Estimadores de kernel realizado: medir volatilidad con ruido de microestructura
Aprende cómo un kernel realizado pondera las autocovarianzas de los rendimientos para estimar la variación de precios de alta frecuencia, con un ejemplo de Parzen, la elección del ancho de banda y sus límites.
En esta guíaPor qué sirve un kernel cuando muestrear con más frecuencia añade ruido
Resumen breve
Un kernel realizado estima la variación de precios a partir de rendimientos de alta frecuencia y tiene en cuenta la dependencia serial que generan las observaciones de precios ruidosas. Calcula autocovarianzas de los rendimientos en varios rezagos y las combina con ponderaciones suaves. El ancho de banda determina cuántos rezagos entran en la suma. Es una medición basada en un modelo para un intervalo observado, no una previsión de volatilidad ni una garantía de que se hayan eliminado todos los errores de los datos de mercado.
Por qué sirve un kernel cuando muestrear con más frecuencia añade ruido
Si no hubiera ruido, sumar los rendimientos intradía al cuadrado sería una forma natural de estimar la variación del intervalo observado. Sin embargo, los precios de transacción o las cotizaciones pueden incluir rebotes entre oferta y demanda, discreción de precios, latencia o errores de registro. Al restar dos precios ruidosos, sus errores pasan al rendimiento; además, dos rendimientos adyacentes comparten uno de esos errores con signos opuestos. Por eso, las autocovarianzas seriales contienen información sobre el ruido de observación.
La varianza realizada ordinaria solo usa el producto de rezago cero: suma los rendimientos al cuadrado. Con un muestreo muy frecuente, el ruido puede acumularse más rápido que el movimiento nuevo del precio latente. Un kernel realizado añade al término de rezago cero autocovarianzas ponderadas en rezagos positivos y negativos. Bajo supuestos adecuados y con un ancho de banda creciente, los términos de rezago distinto de cero ayudan a compensar el efecto principal del ruido y a conservar la variación del precio eficiente.
Barndorff-Nielsen, Hansen, Lunde y Shephard desarrollaron los kernels realizados para medir la variación ex post cuando hay fricciones de mercado en su artículo original de Econometrica. Su método es un cálculo de varianza de largo plazo cuidadosamente ponderado, no una invitación a usar cada tick sin revisar los datos. Para el indicador básico de alta frecuencia, consulta la guía para calcular la volatilidad realizada. Este artículo se centra en la corrección con kernel y sus decisiones.
Separa el precio eficiente del precio registrado
Sea \(X_t\) el logaritmo del precio eficiente latente y \(Y_{t_i}\) el logaritmo del precio registrado en el instante \(t_i\):
\[ Y_{t_i}=X_{t_i}+\epsilon_{t_i}, \]
donde \(\epsilon_{t_i}\) representa el ruido de microestructura. Un modelo de referencia habitual trata el precio latente como un proceso continuo con tasa local de varianza \(\sigma_t^2\). El objetivo para el intervalo fijo \([0,T]\) es la varianza integrada:
\[ IV_T=\int_0^T \sigma_t^2\,dt. \]
La derivación más sencilla supone que el ruido tiene media cero, es independiente en el tiempo y del proceso del precio eficiente, y tiene varianza estable. Así se ve con claridad el origen de la corrección. Las operaciones y cotizaciones reales pueden incumplir estos supuestos: el ruido puede tener dependencia serial, variar con el tiempo, relacionarse con el precio eficiente o depender de cómo se eligen los instantes de observación.
Si el proceso latente tiene saltos, la variación cuadrática también incluye sus cuadrados. Que ese sea el objetivo depende del modelo y la pregunta de investigación. Una derivación con precio continuo busca la varianza integrada; no debe decirse que un kernel realizado separa la varianza continua de los saltos a menos que se añada una construcción robusta a saltos. La guía sobre variación cuadrática explica la diferencia entre la varianza integrada y la variación total de la trayectoria.
Este planteamiento estima un intervalo ya concluido. No recupera exactamente el precio latente, no pronostica el siguiente intervalo ni indica el precio al que se habría podido ejecutar una operación. También debe documentarse el tipo de precio de alta frecuencia: las transacciones, los puntos medios de cotización u otro indicador pueden generar series de rendimientos y características del ruido diferentes.
Las autocovarianzas de los rendimientos revelan el patrón del ruido
Para una secuencia de \(n\) rendimientos observados \(r_i=Y_{t_i}-Y_{t_{i-1}}\), define la suma no normalizada de autocovarianzas en el rezago \(h\):
\[ \Gamma_h=\sum_{i=h+1}^{n} r_i r_{i-h}, \qquad \Gamma_{-h}=\Gamma_h. \]
En el rezago cero, \(\Gamma_0=\sum_{i=1}^n r_i^2\), la varianza realizada habitual. En el rezago uno, los productos emparejan rendimientos adyacentes. Con ruido de precio aditivo e independiente, el componente de ruido de rendimientos consecutivos tiene signos opuestos: un error de observación positivo eleva un rendimiento y reduce el siguiente. Esto puede producir una autocovarianza negativa en el primer rezago. Los patrones en otros rezagos también pueden mostrar cómo afecta el ruido a la secuencia de rendimientos.
Las sumas por rezago no se dividen entre el número de productos. Este detalle permite combinar los términos en la misma escala que la suma de varianza realizada. El estimador está relacionado con una estimación de varianza de largo plazo consistente ante heterocedasticidad y autocorrelación, pero no es una suma arbitraria de autocorrelaciones muestrales normalizadas. Los extremos y la convención exacta de suma también forman parte del estimador.
Las autocovarianzas no señalan qué tick individual era «ruido» y cuál «señal»: agregan productos cruzados a lo largo del intervalo. Una \(\Gamma_1\) negativa puede ser compatible con el rebote entre oferta y demanda, pero no demuestra por sí sola un mecanismo concreto. Si los rendimientos reales tienen dependencia serial o el ruido posee otra estructura, una misma autocovarianza puede reflejar varios efectos. La interpretación depende del modelo declarado y de las ponderaciones del kernel, no de diagnosticar el mercado con cada rezago.
Las ponderaciones suaves del kernel combinan rezagos cercanos y lejanos
Para un rezago máximo \(H\), una convención habitual en muestras finitas es
\[ \widehat{IV}_{RK}(H)=\Gamma_0+2\sum_{h=1}^{H} k\!\left(\frac{h}{H}\right)\Gamma_h. \]
El factor dos incorpora los términos simétricos de rezagos negativos. \(k(x)\) es una ponderación de kernel en \(0\le x\le1\): comienza con \(k(0)=1\) y se reduce hacia cero al acercarse al límite del ancho de banda. Los artículos y programas pueden usar convenciones de indexación y extremos algo distintas, por ejemplo \(H+1\) en el denominador. Para reproducir un resultado, indica la convención y aplícala de manera uniforme.
El kernel de Parzen es una opción no negativa habitual:
\[ k(x)= \begin{cases} 1-6x^2+6x^3, & 0\le x\le \tfrac12,\\ 2(1-x)^3, & \tfrac12 < x\le1,\\ 0, & x>1. \end{cases} \]
Da más peso a los rezagos cortos y reduce suavemente el peso de los más largos. Esta atenuación es útil porque el ruido de alta frecuencia puede crear dependencia entre rendimientos y las estimaciones de rezagos lejanos son cada vez más variables. La construcción no negativa de Parzen está diseñada para que el estimador univariante de kernel realizado no sea negativo bajo la implementación especificada. Otros kernels no tienen necesariamente esa propiedad. Un kernel flat-top puede ofrecer propiedades de sesgo favorables, pero producir una estimación negativa en una muestra finita.
La imagen siguiente es una analogía de esa atenuación: destaca las contribuciones de rezagos cercanos y hace que las lejanas se desvanezcan. No representa rendimientos medidos, ponderaciones empíricas de una muestra concreta ni una estimación de volatilidad.
<!-- learn:illustration --> <!-- Text-free concept: ecos simétricos de rendimientos se desvanecen suavemente al alejarse de un centro luminoso, como ponderaciones de rezagos que disminuyen dentro de un ancho de banda finito. Es conceptual; no son datos de mercado ni resultados del estimador. -->

El ancho de banda determina el equilibrio entre sesgo y varianza
El ancho de banda \(H\) es el mayor rezago incluido en la suma. Si es demasiado pequeño, puede quedar sin tratar una dependencia serial importante del ruido de observación. Si es demasiado grande, se añaden productos de rezagos más variables y puede aumentar la varianza muestral. Por eso, el ancho de banda es una decisión estadística de ajuste, no el número de observaciones que hay que descartar ni un intervalo temporal válido para todos los activos.
En la teoría asintótica del kernel realizado de Parzen, el ancho de banda óptimo crece en el orden de \(n^{3/5}\). Una expresión práctica utilizada en la literatura es
\[ H^*=c^*\,\xi^{4/5}n^{3/5}, \qquad c^*_{\text{Parzen}}=3.5134, \]
donde \(n\) es el número de rendimientos de la cuadrícula fina y \(\xi\) resume el nivel relativo de ruido y la cuarticidad integrada del precio latente. Una expresión de escala es
\[ \xi^2=\frac{\omega^2}{\sqrt{T\int_0^T\sigma_u^4\,du}}, \]
donde \(\omega^2\) es la varianza del ruido de observación. En la práctica, estas cantidades son desconocidas y hay que estimarlas, a menudo con estimaciones piloto de la varianza del ruido y la cuarticidad integrada. La fórmula muestra que el número óptimo de rezagos depende tanto del tamaño muestral como del entorno de ruido y señal; no es un ajuste universal fijo.
El diseño asintótico requiere que el ancho de banda crezca y, a la vez, siga siendo pequeño frente al tamaño de la muestra; suele expresarse como \(H\to\infty\) y \(H/n\to0\). La regla \(n^{3/5}\) equilibra el sesgo principal y la varianza bajo el modelo y las condiciones del kernel del artículo. En una sesión finita, un valor plug-in puede ser inestable si la estimación piloto del ruido o la cuarticidad integrada es deficiente. Informa el \(H\) elegido, la convención utilizada, los valores piloto y la sensibilidad ante alternativas razonables.
Cálculo hipotético con cuatro rendimientos
Considera una secuencia hipotética deliberadamente pequeña, medida en puntos básicos:
\[ (r_1,r_2,r_3,r_4)=(1,-1,1,-1)\ \mathrm{bp}. \]
La secuencia solo sirve para comprobar la aritmética; no son datos de mercado. Cuatro rendimientos son demasiado pocos para justificar una elección asintótica del ancho de banda. La suma en el rezago cero es
\[ \Gamma_0=1^2+(-1)^2+1^2+(-1)^2=4\ \mathrm{bp}^2. \]
Los productos del primer rezago son \((-1),(-1),(-1)\), por lo que \(\Gamma_1=-3\ \mathrm{bp}^2\). En el segundo, \(r_3r_1=1\) y \(r_4r_2=1\), de modo que \(\Gamma_2=2\ \mathrm{bp}^2\).
Fijemos \(H=2\) solo para ilustrar la fórmula. Con el kernel de Parzen, \(k(1/2)=1-6(1/4)+6(1/8)=1/4\), mientras que \(k(1)=0\). Por tanto:
\[ \widehat{IV}_{RK}=4+2\left(\tfrac14\right)(-3)+2(0)(2) =2.5\ \mathrm{bp}^2. \]
La varianza realizada simple es \(4\ \mathrm{bp}^2\); en este ejemplo, el término negativo ponderado del primer rezago reduce la estimación del kernel. La suma del segundo rezago no contribuye porque el peso de Parzen es cero en el límite. El resultado no es negativo, pero la aritmética no demuestra por sí sola que equivalga a la variación oculta del precio eficiente. No se observó la trayectoria latente ni se calculó un intervalo de incertidumbre, así que no se obtiene una previsión ni una conclusión de trading. La raíz cuadrada, cerca de 1,58 bp, es solo la escala de desviación estándar de este intervalo hipotético.
El ejemplo también muestra por qué deben comunicarse el ancho de banda y la regla de indexación. Cambiar \(H\), la convención de extremos o los rendimientos modifica los pesos o los productos incluidos. El resultado se puede reproducir porque se muestran todos los rendimientos, sumas por rezago, pesos y unidades.
El tratamiento de extremos y la limpieza de datos forman parte del método
Las sumas no normalizadas por rezago pueden dar una influencia desproporcionada a las observaciones de los extremos, sobre todo si el primer o último precio registrado contiene un gran error. Los estudios prácticos sobre kernels realizados analizan promedios locales, a menudo llamados jittering, para reducir los efectos de borde. Una implementación habitual sustituye un precio extremo por la media local de observaciones cercanas antes de calcular los rendimientos. Deben documentarse el tamaño de la ventana y si se promedian uno o ambos extremos.
La limpieza puede importar tanto como la fórmula. Una operación mal registrada, una cotización obsoleta, un mercado cruzado, una marca temporal duplicada o una escala de precios errónea genera rendimientos y productos que aparecen en varias sumas. Documenta el campo de precio, la alineación temporal, los límites de la sesión, el tratamiento de duplicados y filtros, y cómo se tratan las subastas o los cierres. Las reglas de limpieza deben fijarse con independencia de que hagan más verosímil la estimación final.
El estudio práctico de kernels realizados de 2009 trata datos de operaciones y cotizaciones, efectos de borde, tendencias locales y el kernel no negativo de Parzen. La lección práctica es que «robusto al ruido» no significa «independiente de los datos». Una tendencia gradual durante una ventana corta, cambios en las fricciones o la construcción de cotizaciones pueden cuestionar la interpretación de referencia. El jittering puede reducir un problema de extremos, pero no corrige una serie mal alineada ni una observación errónea en mitad de la muestra.
Supuestos del modelo y límites importantes
La teoría clásica establece supuestos sobre el proceso del precio latente, el muestreo, el ruido, la regularidad del kernel y el ancho de banda. Algunas construcciones de kernels realizados son robustas a formas más amplias de ruido serialmente dependiente y a horarios de observación endógenos que el ejemplo sencillo con ruido independiente. Esa robustez depende del teorema: hay que usar un kernel y un ancho de banda que satisfagan las condiciones pertinentes. El estudio de Aït-Sahalia, Mykland y Zhang sobre ruido de microestructura dependiente ayuda a entender por qué debe tratarse explícitamente la dependencia del ruido, en vez de suponer que la fórmula básica cubre automáticamente toda extensión.
La elección del kernel importa. Parzen se usa a menudo para obtener una estimación univariante no negativa. Los pesos flat-top pueden buscar otras propiedades de sesgo y producir valores negativos en muestras finitas. No sustituyas el kernel por cualquier versión HAC solo porque resulte familiar: la literatura de kernels realizados explica que algunas opciones conocidas, incluido Bartlett en la construcción analizada, no ofrecen el mismo resultado de consistencia. Si la estimación es negativa, identifica el kernel y la regla de muestra finita; no la trunques sin decirlo ni la llames varianza física negativa.
La estimación también hereda los límites del precio proxy y del objetivo. Los saltos pueden formar parte de la variación cuadrática; los valores atípicos pueden dominar los productos; las observaciones irregulares o asíncronas pueden cambiar lo que se estima; y la volatilidad o el ruido pueden cambiar durante el intervalo. Un kernel realizado univariante no resuelve por sí mismo el muestreo multivariante no sincrónico, no elimina saltos ni distingue el rebote entre oferta y demanda de todas las demás fuentes de dependencia. Un estimador robusto lo es dentro de un modelo definido, no frente a cualquier defecto posible de los datos.
Informa una medición de un intervalo, no una previsión ni una cotización ejecutable
Un informe reproducible debe identificar la serie de precios y el diseño de muestreo, la ventana observada, las unidades de rendimiento, la función kernel, el rezago máximo \(H\), la convención de extremos, la regla de promediado local y cualquier limpieza. Si se usa un ancho de banda plug-in, comunica las estimaciones de ruido y cuarticidad integrada o suficientes detalles para reproducirlas. Aclara si el resultado estima varianza integrada, variación cuadrática con saltos o una medida de volatilidad transformada.
La estimación describe la variación del intervalo observado. No es una estimación de volatilidad futura a menos que un modelo de previsión distinto proyecte las mediciones históricas a un horizonte futuro y se evalúe fuera de muestra. Tampoco estima un diferencial cotizado ni el coste de ejecución: la guía del diferencial de Roll usa autocovarianzas de rendimientos para medir otra cantidad. La guía de volatilidad realizada Two-Scale presenta otro método robusto al ruido, con una estructura de corrección diferente.
La cuestión central no es solo si conviene usar un kernel realizado, sino si los precios, el esquema de muestreo, el objetivo, el kernel y el ancho de banda se ajustan suficientemente a la pregunta de investigación. Una tabla de sensibilidad y límites explícitos del modelo facilitan la revisión. Incluso una estimación cuidadosa sigue siendo una medición histórica con incertidumbre muestral: no demuestra una regla de trading rentable ni garantiza que hayan desaparecido los efectos de microestructura.
Preguntas frecuentes
Q1¿El kernel realizado elimina todo el ruido de microestructura?
No. Puede reducir el efecto del ruido bajo supuestos concretos y con un kernel y un ancho de banda adecuados. Los errores de datos, el ruido cambiante o dependiente, los problemas de muestreo y una especificación incorrecta siguen afectando a la estimación.
Q2¿El kernel de Parzen es lo mismo que el ancho de banda?
No. El kernel es la función que asigna pesos relativos a los rezagos. El ancho de banda es el mayor rezago incluido y define el rango sobre el que se atenúan los pesos.
Q3¿Por qué dos implementaciones pueden dar kernels realizados distintos?
Pueden usar anchos de banda, índices de extremos, ventanas de jittering, campos de precio, reglas de limpieza o convenciones del kernel diferentes. Estas decisiones cambian las sumas de autocovarianza y deben comunicarse.
Q4¿Una estimación con kernel realizado es una previsión de volatilidad?
Por sí sola, no. Mide la variación del intervalo observado. Para pronosticar un horizonte futuro hace falta un modelo separado y una evaluación fuera de muestra.
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
¿Qué añade un kernel realizado a la suma ordinaria de varianza realizada?
Elige una respuesta para ver la explicación
Glosario de opciones
Volatilidad calculada a partir de cambios ya ocurridos con una regla declarada de rendimiento, ventana y anualización; distintas convenciones dan valores distintos
Leer la guía detalladaVariación cuadráticaLímite de sumas de incrementos al cuadrado sobre particiones cada vez más finas, que mide variación de segundo orden y genera correcciones de Itô
Leer la guía detallada