La prueba Ljung–Box de autocorrelación en series temporales
Aprende cómo el estadístico Q de Ljung–Box combina autocorrelaciones residuales, cómo elegir retardos y grados de libertad, y qué no puede demostrar sobre los retornos financieros.
En esta guíaQué evalúa la prueba Ljung–Box
Resumen breve
La prueba Ljung–Box pregunta si las autocorrelaciones hasta un retardo elegido son conjuntamente compatibles con cero. Aplicada a residuos de un modelo, comprueba si queda dependencia lineal en ese rango; no demuestra independencia, normalidad, corrección del modelo ni un pronóstico de retornos negociable.
Qué evalúa la prueba Ljung–Box
Un gráfico de autocorrelación muestral puede mostrar dependencia en varios retardos, pero revisar muchas barras por separado crea un problema de comparaciones múltiples. La prueba Ljung–Box combina las primeras \(h\) autocorrelaciones muestrales en un único estadístico portmanteau. Su hipótesis nula afirma que todas las autocorrelaciones poblacionales de los retardos 1 a \(h\) son cero. La alternativa es que al menos una difiere de cero.
Box y Pierce desarrollaron una prueba global de falta de ajuste para modelos de series temporales estimados. Ljung y Box modificaron el estadístico para mejorar la aproximación en muestras finitas. Portmanteau significa que un estadístico resume correlaciones de varios retardos; no que se haya comprobado toda forma de dependencia temporal.
Para una serie de retornos, la pregunta puede ser si los retornos pasados con signo dejan dependencia serial lineal. Para un modelo ARMA ajustado, suele preguntarse si queda autocorrelación en los residuos después de incorporar la estructura de retardos especificada. Son usos relacionados, pero distintos; identifica la serie sometida a prueba antes de interpretar el resultado.
Calcula los estadísticos Box–Pierce y Ljung–Box
Sea \(\hat\rho_k\) la autocorrelación muestral en el retardo \(k\), \(n\) el número de observaciones utilizado para calcularla y \(h\) el mayor retardo de la prueba. El estadístico Box–Pierce es
\[ Q_{BP}=n\sum_{k=1}^{h}\hat\rho_k^2. \]
El ajuste Ljung–Box pondera cada retardo según el tamaño muestral disponible:
\[ Q_{LB}=n(n+2)\sum_{k=1}^{h}\frac{\hat\rho_k^2}{n-k}. \]
Como las correlaciones se elevan al cuadrado, tanto la autocorrelación positiva como la negativa aumentan el estadístico. El ajuste da más peso a una correlación estimada en un retardo con menos pares de observaciones disponibles. En muestras grandes, ambos estadísticos suelen aproximarse; en muestras finitas, Ljung–Box se usa a menudo porque el estudio original encontró una mejor aproximación para muestras pequeñas.
Bajo la hipótesis nula de ruido blanco y las condiciones de regularidad de la prueba, \(Q_{LB}\) se compara con una distribución chi-cuadrado. Para una serie bruta sin parámetros dinámicos estimados, los grados de libertad de referencia suelen ser \(h\). Para residuos de un ARMA(\(p,q\)) estimado, el ajuste habitual es \(h-p-q\), siempre que sea positivo. La corrección refleja parámetros utilizados para ajustar la dinámica residual; no es una instrucción universal de restar todos los coeficientes de cualquier regresión. Los modelos integrados, estacionales, restringidos u otros modelos especializados pueden requerir convenciones distintas. Ajusta los grados de libertad al contraste concreto y a la definición del software. Por ejemplo, al contrastar residuos ARMA(2,2) solo hasta \(h=4\), el ajuste habitual deja cero grados de libertad. No se puede hacer la comparación chi-cuadrado ordinaria: elige un rango de retardos más largo y preespecificado o un diagnóstico adecuado para ese modelo, en vez de forzar una distribución con cero grados de libertad. Explica también por qué elegiste ese horizonte.
Sigue un cálculo hipotético de residuos
Supón que un modelo ajustado deja \(n=250\) residuos y que un contraste preespecificado de cinco retardos produce autocorrelaciones \(0.10, 0.05, -0.08, 0.02, -0.04\). Box–Pierce primero las eleva al cuadrado y las suma:
\[ 0.10^2+0.05^2+(-0.08)^2+0.02^2+(-0.04)^2=0.0209. \]
Por tanto, \(Q_{BP}=250(0.0209)=5.225\). Con las ponderaciones Ljung–Box se obtiene
\[ Q_{LB}=250(252)\left(\frac{0.0100}{249}+\frac{0.0025}{248}+\frac{0.0064}{247}+\frac{0.0004}{246}+\frac{0.0016}{245}\right)\approx 5.31. \]
El cálculo todavía no es un valor p. Si los residuos provienen de un ARMA(1,1), la referencia habitual usa \(h-p-q=5-1-1=3\) grados de libertad; una serie bruta puede usar cinco bajo su propia hipótesis nula. La elección de grados de libertad cambia la probabilidad de cola superior. Todos los valores son inventados para mostrar la aritmética, no son datos de mercado ni resultados de un modelo.
Un estadístico pequeño significa que las autocorrelaciones cuadradas observadas no son inusualmente grandes bajo la distribución de referencia elegida. No demuestra que sean exactamente cero. Un estadístico grande indica que el conjunto es difícil de conciliar con la hipótesis nula al nivel elegido. Examina qué retardos y características del modelo influyen, en vez de tratar el número por sí solo como diagnóstico.
Elige el horizonte de retardos antes de buscar el resultado más favorable
El límite \(h\) define la pregunta. Contrastar solo unos pocos retardos cortos puede pasar por alto una dependencia más lenta o un patrón semanal en datos diarios. Ampliar la prueba a muchos retardos puede añadir estimaciones débiles y ruidosas, reducir la potencia frente a un patrón corto concreto y hacer que el resultado dependa de unas pocas correlaciones de largo plazo. Un \(h\) grande también deja menos grados de libertad tras el ajuste ARMA.
Elige los retardos según la frecuencia de muestreo, la estructura conocida del calendario, el objetivo del modelo y la dependencia que no debería quedar en los residuos. En datos diarios de mercado, un retardo de sesión no siempre equivale a uno de día natural. Los datos intradía pueden tener efectos de hora del día y de la noche. Un modelo estacional puede requerir retardos estacionales o un diagnóstico estacional; un único límite genérico puede ocultar esa estructura.
Si pruebas muchos valores de \(h\), transformaciones, activos u órdenes del modelo y solo informas del menor valor p, la significación presentada ignora esa búsqueda. Declara el rango de retardos y la regla de decisión antes de interpretar el diagnóstico, o incorpora la búsqueda más amplia al plan de inferencia.
Lee el gráfico de autocorrelación junto con el estadístico conjunto
Un gráfico de autocorrelación suele incluir bandas aproximadas para un retardo, como \(\pm1.96/\sqrt{n}\). Bajo un modelo simple de ruido blanco pueden ayudar a señalar una correlación muestral individual, pero no son una banda simultánea del 95% para todos los retardos. Mirar muchas barras por separado aumenta la posibilidad de que alguna cruce por azar. Ljung–Box plantea una única pregunta conjunta para el conjunto preespecificado y usa una distribución de referencia para el estadístico combinado.
Un único valor de autocorrelación relativamente alto o varios moderados pueden elevar el estadístico conjunto. Tras la prueba, inspecciona los términos por retardo \(n(n+2)\hat\rho_k^2/(n-k)\) y el gráfico ACF. Una sola barra fuera de una banda heurística no equivale automáticamente a un resultado portmanteau significativo, y que todos estén dentro de sus bandas individuales no garantiza que el estadístico conjunto sea insignificante.

Distingue retornos brutos, residuos del modelo y residuos cuadrados
Aplicada a retornos con signo, la prueba pregunta si su autocorrelación lineal hasta el retardo \(h\) es conjuntamente cero. Aplicada a residuos ajustados, pregunta si el modelo elegido dejó una dependencia lineal similar. El rechazo puede motivar revisar la especificación de la media, los tiempos, el calendario de mercado y los gráficos residuales, pero no identifica por sí solo el término que falta.
Comprueba si las ventanas de retornos solapadas generan dependencia
La definición de las observaciones puede crear autocorrelación aunque los retornos subyacentes de un periodo no estén correlacionados. Por ejemplo, un retorno móvil de cinco sesiones y el siguiente retorno móvil de cinco sesiones comparten cuatro retornos diarios. El solapamiento conecta mecánicamente observaciones contiguas. Ljung–Box puede rechazar correctamente la autocorrelación nula en esa serie construida sin demostrar que un retorno diario no solapado fuera predecible.
Indica si las observaciones son retornos diarios, retornos móviles de varios días o residuos de un modelo con resultados solapados. Alinea el calendario de sesiones, las horas de cierre y el intervalo nocturno con la pregunta económica. Si necesitas horizontes solapados, usa inferencia y una distribución de referencia adecuadas a esa construcción, en vez de interpretarla como evidencia de una ventaja de trading independiente.
Puede haber agrupamiento de volatilidad aunque los retornos con signo tengan poca autocorrelación. Elevar residuos al cuadrado cambia la pregunta: la autocorrelación de residuos cuadrados o estandarizados absolutos puede indicar dependencia en la escala de los retornos. McLeod y Li estudian las autocorrelaciones de residuos cuadrados como diagnóstico de dependencia no lineal tras un ajuste ARMA. Sigue siendo un diagnóstico, no la prueba de un único modelo de volatilidad. La guía ARCH-LM aborda de forma más específica la dependencia ARCH, y la guía GARCH explica la varianza condicional.
La autocorrelación cero es una condición más débil que la independencia. Una serie puede tener correlaciones cero en los retardos analizados y aun depender de transformaciones no lineales, varianza condicional, colas o regímenes. El estadístico Ljung–Box tampoco informa por sí solo sobre normalidad, estacionariedad, estructura causal ni rentabilidad después de los costes de ejecución.
Comprueba la distribución de referencia cuando se estimaron parámetros
La aproximación chi-cuadrado sencilla depende del modelo, la construcción de residuos, el tamaño muestral y el método de estimación de parámetros. Si primero se ajusta un ARMA, las autocorrelaciones residuales son estimaciones, no correlaciones de innovaciones observadas directamente. El ajuste habitual de grados de libertad es una convención asintótica práctica, no una garantía exacta en muestras finitas para toda especificación.
Muestras pequeñas, horizontes largos, raíces AR y MA que casi se cancelan, valores atípicos, heterocedasticidad condicional o dependencia serial fuera de la familia ajustada pueden reducir la fiabilidad de la aproximación. Un rechazo puede deberse a una media mal especificada, problemas de calidad de datos o una distribución de referencia inadecuada. No rechazar puede reflejar poca potencia o una elección de retardos que omitió la dependencia de interés.
Para modelos complejos o no estándar, usa un procedimiento de diagnóstico cuya distribución de referencia corresponda al ajuste o evalúa la calibración con un bootstrap justificado que repita la estimación. Remuestrear residuos iid no es automáticamente válido si la preocupación es la dependencia o la varianza cambiante. Explica el diseño del remuestreo y separa la selección del modelo de la evaluación final.
Interpreta el rechazo como inicio del diagnóstico, no como señal de trading
Después de un rechazo, inspecciona la función de autocorrelación, la autocorrelación parcial cuando corresponda, el momento de los residuos y las contribuciones por retardo a \(Q_{LB}\). Considera si el patrón es breve, estacional, se debe a un término de la media omitido o se concentra en residuos cuadrados. Cualquier cambio del modelo debe responder a una pregunta de especificación defendible y evaluarse en datos que no se usaron para elegirlo.
Para una regla de trading, un patrón predecible dentro de la muestra no es una ventaja ejecutable. Cada pronóstico del siguiente periodo debe estar disponible antes de la orden, mantenerse en una validación cronológica fuera de muestra e incluir diferencial comprador-vendedor, impacto, comisiones, financiación, préstamo de valores y rotación. La prueba Ljung–Box no evalúa la rentabilidad neta de una estrategia ni demuestra que el rechazo persista fuera de muestra.
Informa de la definición y el número de observaciones, la serie analizada, las transformaciones, el límite de retardos, las autocorrelaciones individuales o el gráfico, la variante de la prueba, los grados de libertad de referencia, el estadístico, el valor p y el nivel de significación. Si son retornos financieros, explica cómo se trataron las sesiones, los valores ausentes, los horizontes solapados y la varianza condicional ajustada. Así el lector puede distinguir qué hizo la prueba y qué cuestiones dejó abiertas.
El artículo de Box y Pierce de 1970 desarrolla el estadístico global de autocorrelación residual. El artículo de Ljung y Box de 1978 propone el ajuste para muestras finitas. El artículo de McLeod y Li de 1983 estudia autocorrelaciones de residuos cuadrados. La referencia Box–Ljung de NIST resume el estadístico y el ajuste de grados de libertad para residuos. Para otros diagnósticos, consulta las guías de pruebas de razón de varianza, ARCH-LM y agrupamiento de volatilidad GARCH.
Preguntas frecuentes
Q1¿Una prueba Ljung–Box no significativa demuestra que los residuos son ruido blanco?
No. Significa que las autocorrelaciones seleccionadas no fueron suficientemente grandes para rechazar la hipótesis nula conjunta al nivel elegido. Puede quedar dependencia en otros retardos, dependencia no lineal, agrupamiento de volatilidad o falta de potencia.
Q2¿Qué grados de libertad debo usar para residuos ARMA ajustados?
La convención habitual es \(h-p-q\) para residuos de un ARMA(\(p,q\)), siempre que sea positiva; los modelos estacionales o especializados pueden seguir otras reglas. Ajusta la distribución de referencia al modelo y la implementación exactos.
Q3¿Puede Ljung–Box identificar un patrón de retornos rentable?
No. Es un diagnóstico de autocorrelación conjunta hasta retardos seleccionados. Una afirmación de predicción o trading requiere una regla en tiempo real preespecificada, evidencia cronológica fuera de muestra y costes de ejecución realistas.
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
¿Cuál es la hipótesis nula de Ljung–Box hasta el retardo h?
Elige una respuesta para ver la explicación