Prueba de Giacomini–White: precisión condicional de pronósticos
Aprende cómo la prueba de Giacomini–White evalúa si la precisión de un pronóstico cambia con condiciones conocidas, cómo elegir instrumentos y qué permite concluir
En esta guíaLa precisión promedio y la condicional responden preguntas distintas
Resumen breve
El marco de Giacomini–White (GW) pregunta si la pérdida relativa de dos pronósticos se relaciona con información disponible al momento de emitirlos. Puede revelar diferencias ocultas por una puntuación promedio, pero el resultado depende de los pronósticos, la ventana de evaluación, la función de pérdida y las variables condicionantes elegidas de antemano.
La precisión promedio y la condicional responden preguntas distintas
Supón que el pronóstico A tiene una pérdida promedio menor que B en una muestra de prueba. Ese promedio podría ocultar un patrón útil: A puede funcionar mejor en mercados tranquilos y B cuando la volatilidad es alta. Si quieres saber cuál rindió mejor en promedio, corresponde una comparación incondicional. Si preguntas si la información conocida al emitir el pronóstico ayuda a anticipar cuál rendirá mejor, el objeto de interés es la capacidad predictiva condicional.
Giacomini y White plantean el problema como una comparación de métodos de pronóstico con una función de pérdida y un conjunto de información especificados. El marco admite pronósticos puntuales, por intervalos, probabilísticos o de densidad, siempre que la pérdida corresponda a la tarea. También forma parte del método el procedimiento de estimación que genera cada pronóstico. Una ventana móvil, una muestra de entrenamiento fija o una regla de ponderación son componentes del método evaluado, no detalles inocuos que deban cambiarse tras ver los resultados (Giacomini y White, 2006).
La cuestión está relacionada con las pruebas de ruptura estructural, pero no es la misma. Una prueba condicional pregunta si la pérdida relativa del pronóstico se asocia sistemáticamente con la información elegida. Una prueba de ruptura pregunta si los parámetros o una relación cambiaron en un momento desconocido o especificado. La guía de Diebold–Mariano trata la comparación incondicional de pérdidas promedio; una pregunta condicional exige definir explícitamente la información condicionante.
Alinea primero los pronósticos, resultados e información
Sea (Y_{t+1}) el objetivo observado después del origen de pronóstico (t). Los pronósticos ŷA,t+1 y ŷB,t deben referirse al mismo objetivo, horizonte, unidades y corte de información. Para una pérdida (L) en la que un valor menor es mejor, define la diferencia de pérdidas como:
dₜ₊₁ = L(Yₜ₊₁, ŷA,ₜ₊₁) − L(Yₜ₊₁, ŷB,ₜ₊₁)
Con esta convención, un valor positivo significa que A sufrió una pérdida mayor y favorece a B en ese origen; uno negativo favorece a A. Usa una fila por origen y evalúa ambos pronósticos frente a la misma realización. Conserva los pronósticos disponibles en su momento, la versión de los datos y la versión del modelo. No reconstruyas pronósticos históricos con datos revisados ni con información que llegó después.
Las variables condicionantes también deben conocerse en el origen del pronóstico. Algunos ejemplos son una estimación rezagada de volatilidad, un indicador de evento anunciado previamente, una diferencia de pérdidas rezagada o un estado del mercado calculado solo con observaciones pasadas. Una variable medida después de (t) no puede explicar qué pronóstico habría sido mejor en (t+1) sin sesgo de anticipación.
La métrica debe corresponder al objetivo. El error cuadrático es una opción para un pronóstico de la media condicional, pero no sirve automáticamente para pronósticos de volatilidad, cuantiles o densidad. Si un modelo pronostica varianza y otro desviación estándar, primero expresa ambos como pronósticos de la misma magnitud. La prueba no puede reparar una pregunta mal definida.
Para pronósticos de volatilidad, evalúa ambos con la misma definición de varianza realizada y el mismo intervalo de muestreo. Si uno cubre precios intradía y el otro también incluye rendimientos nocturnos, la diferencia de pérdidas puede deberse a objetivos distintos y no a la habilidad de pronóstico. Decide cómo tratar los movimientos durante el cierre, la frecuencia de muestreo, las observaciones ausentes y la medida realizada; aplica esas decisiones por igual. Si el indicador realizado tiene ruido de medición, ese error afecta ambas pérdidas y debe formar parte de la interpretación.
Formula la hipótesis nula condicional y elige las funciones de prueba
Sea (mathcal{G}_t) el conjunto de información usado para condicionar la comparación. La hipótesis nula idealizada es:
H₀: E[dₜ₊₁ | 𝒢ₜ] = 0
Esto afirma que la diferencia esperada de pérdidas es cero dadas las condiciones especificadas. La prueba GW de un paso transforma esa proposición en momentos mediante un vector de funciones de prueba (h_t) seleccionado previamente. Cada función debe poder calcularse con información disponible en (t):
H₀,ₕ: E[hₜ dₜ₊₁] = 0
Una constante en (h_t) incluye la diferencia promedio de pérdidas. Otros elementos pueden representar un estado del mercado, una pérdida relativa rezagada o una transformación no lineal elegida antes de examinar los resultados. Por ejemplo, (h_t=(1,S_t)'), donde (S_t) es un indicador binario de alta volatilidad conocido en (t), prueba un momento constante y si la diferencia de pérdidas se asocia con ese estado.
Un conjunto finito de funciones solo prueba los momentos que define. Rechazar indica que al menos uno de los momentos seleccionados no concuerda con cero bajo los supuestos de la prueba; no identifica un modelo universalmente mejor ni demuestra que importe toda variable de estado posible. No rechazar tampoco prueba que el rendimiento condicional sea igual. Si solo se incluye una constante, se compara un momento incondicional, no se exploran todas las condiciones posibles.
Elige la pérdida, los instrumentos, las transformaciones, la muestra y el horizonte antes de ver qué modelo gana. Añadir muchos indicadores de estado, umbrales y rezagos después de ver los resultados crea otra búsqueda. La prueba condicional no corrige esa selección por sí sola.
Fija también el momento en que se construye cada variable de estado. Si «volatilidad alta» significa el 20 % superior de la volatilidad de toda la muestra, las observaciones futuras contribuyen al umbral aplicado a orígenes pasados. Estima cada umbral solo con información disponible en ese origen o usa una regla publicada antes de esa fecha. Para una variable de estado continua, especifica de antemano sus unidades y cualquier centrado o escalado. Varios indicadores casi idénticos pueden duplicar las condiciones de momento y dificultar la inversión de la matriz de covarianza; utiliza el conjunto mínimo que tenga una interpretación clara.
Construye el estadístico de Wald e interpreta su distribución de referencia
Con (q) funciones de prueba, forma el vector de momentos (g_{t+1}=h_t d_{t+1}). Su media muestral es:
ḡ = (1/n) Σₜ gₜ₊₁
El estadístico GW de un paso tiene la forma de Wald:
GW = n ḡ′ Ω̂⁻¹ ḡ
Aquí, (hatOmega) estima la matriz de covarianza del vector de momentos. Bajo la nula y las condiciones de regularidad del artículo, el estadístico tiene asintóticamente una distribución de referencia chi-cuadrado con (q) grados de libertad. Por ello, el número de funciones afecta a la distribución de referencia y puede afectar a la potencia. Muchos instrumentos débiles o redundantes pueden volver inestable la estimación de covarianza sin aportar información útil.
En el marco de un paso, la nula implica una estructura de diferencia de martingala para el vector de momentos, lo que permite usar en la prueba original una estimación basada en segundos momentos muestrales. Para otros horizontes, resultados superpuestos o desviaciones de ese marco, el estimador de varianza debe ajustarse a los supuestos y la dependencia de la prueba elegida. Sigue la formulación de la implementación utilizada en vez de copiar automáticamente el ancho de banda HAC de otra prueba. Los métodos generales HAC, incluido el estimador de Newey y West (1987), son herramientas para los casos que los requieren, no una prescripción universal de ancho de banda para GW. La credibilidad depende también de la covarianza estimada y del diseño de pronóstico.
Comprueba si (Ω̂) se puede estimar con los momentos seleccionados. Funciones casi duplicadas, un indicador con muy pocas observaciones en un estado o demasiadas interacciones pueden hacer que la matriz sea singular o inestable. Su inversa podría cambiar mucho tras una pequeña revisión de datos y distorsionar el estadístico. Cada función debe responder a una condición o diferencia de rendimiento; informa su número y la covarianza de los momentos. Eliminar una función aparentemente poco útil tras ver el resultado es otro paso de selección y debe declararse.
El valor p es evidencia contra las restricciones de momentos especificadas bajo la distribución de referencia. No es la probabilidad de que A o B sea el modelo verdadero ni la probabilidad de que una regla de negociación vaya a ser rentable. Informa el estadístico, los grados de libertad, el valor p y los momentos exactos para que pueda entenderse qué significa el rechazo.
<!-- learn:illustration -->

Un ejemplo con dos estados muestra lo que oculta el promedio
Considera ocho orígenes hipotéticos de un paso. Sea (S_t=0) el estado tranquilo y (S_t=1) el de alta volatilidad. Supón que las diferencias de pérdidas (d_{t+1}=L_A-L_B) son −2, −2, −2 y −2 en los cuatro orígenes tranquilos, y +2, +2, +2 y +2 en los cuatro de alta volatilidad. Las diferencias negativas favorecen a A; las positivas, a B.
El promedio de los ocho orígenes es cero, así que este pequeño ejemplo no muestra una diferencia de pérdidas incondicional. La media del estado tranquilo es −2 y la del estado volátil es +2. La clasificación relativa se invierte con el estado. Una prueba con (h_t=(1,S_t)') incluye un momento constante y otro de alta volatilidad capaz de reflejar este patrón.
Estos ocho valores ilustran el cálculo, pero no bastan para una inferencia fiable. Con datos reales hay que considerar cómo se estimaron los pronósticos, si el estado se fijó de antemano, cuántos orígenes hay y cómo varían en el tiempo los momentos de diferencia de pérdidas. Una división visual por estados no demuestra que el patrón vaya a persistir.
Trata la ventana de estimación como parte del método
La asintótica original de GW conserva la incertidumbre de estimación de los pronósticos: el tamaño máximo de la ventana de estimación permanece finito mientras crece el número de pronósticos fuera de muestra. Las ventanas móviles y una muestra de estimación fija encajan en ese planteamiento central. El tamaño de ventana y cualquier regla de selección basada en los datos forman parte de cada método y deben fijarse e informarse como tales.
Esto importa cuando los modelos se vuelven a estimar. Ignorar la estimación de parámetros puede omitir la incertidumbre generada por la forma en que cada método aprende de los datos pasados. GW admite pronósticos de modelos anidados o no anidados bajo sus condiciones, pero no garantiza el mismo resultado con cualquier implementación de ventana expansiva ni cualquier estimador. En el marco original de un paso, una ventana expansiva convencional queda fuera del supuesto de ventana finita. Si el diseño difiere, usa resultados derivados para esa construcción concreta.
La prueba tampoco elige una ventana adecuada. Una ventana corta puede adaptarse a las condiciones recientes, aunque utiliza menos observaciones; una larga o expansiva puede estabilizar las estimaciones y conservar relaciones obsoletas. Compara esas opciones con una evaluación planificada de antemano e incluye la selección de ventana en el procedimiento registrado. Giacomini y Rossi (2010) desarrollan pruebas distintas para estudiar cómo evoluciona la precisión relativa en entornos inestables. Esa pregunta sobre la trayectoria temporal se relaciona con GW, pero no es el mismo estadístico condicional básico.
Un rechazo condicional tampoco produce por sí solo una regla de negociación que seleccione en tiempo real el pronóstico correcto. Un instrumento puede asociarse a la diferencia de pérdidas en los datos de evaluación sin generar una regla de cambio estable o aplicable. Define la regla de selección usando información pasada y evalúala después en una secuencia posterior no utilizada de orígenes, incluida la incertidumbre de estimación y decisión.
Distingue GW de DM, las pruebas de modelos anidados y las de inestabilidad
La prueba Diebold–Mariano pregunta si dos pronósticos tienen la misma pérdida promedio en la muestra de evaluación. GW pregunta si la información seleccionada se asocia con su pérdida relativa; permite un contraste incondicional como una restricción de momentos particular. Como muestra el ejemplo de dos estados, dos modelos pueden tener la misma puntuación promedio y un rendimiento relativo que depende de las condiciones.
Si los pronósticos proceden de modelos anidados y la pregunta específica es la igualdad del error cuadrático medio de pronóstico, un método para modelos anidados como el ajuste de Clark–West aborda otra nula y el problema de ruido de estimación. Si se probaron muchas reglas o pronósticos y se pregunta si algún candidato tiene capacidad predictiva superior, se necesita un procedimiento a nivel de familia, como Reality Check de White o la prueba SPA de Hansen. Una prueba condicional de un par elegido no deshace una búsqueda más amplia.
Por último, que la precisión relativa cambie con el tiempo no identifica una fecha concreta de ruptura. Si la pregunta se refiere a la trayectoria del rendimiento y no a su asociación con instrumentos seleccionados, puede ser más apropiada una prueba de inestabilidad local o reversión. Giacomini y Rossi (2010) estudian esas comparaciones. Elige el método según la pregunta; no interpretes todo rechazo como evidencia a favor de una estrategia que cambia con el régimen.
Ten en cuenta la baja potencia y las pruebas repetidas
Las pruebas condicionales pueden requerir muchos datos. Dividir la muestra en estados tranquilos y volátiles reduce las observaciones de cada comparación. Más funciones elevan el número de momentos y los grados de libertad. Si varias condiciones guardan una relación débil con la pérdida relativa, la prueba puede tener poca potencia aunque existan diferencias condicionales.
El documento de trabajo de la Reserva Federal de San Luis de McCracken analiza la existencia, el tamaño y la potencia de GW en un ejemplo sencillo de pérdida cuadrática. Sus simulaciones encuentran que la prueba puede mantener correctamente el tamaño y, a la vez, tener poca potencia en las configuraciones examinadas (McCracken, 2020). Es una advertencia de interpretación, no una estimación universal de potencia para todas las aplicaciones. No rechazar puede reflejar poca información o baja potencia y no debe presentarse como prueba de que los pronósticos son intercambiables.
Probar repetidamente definiciones de estados, umbrales, horizontes, pérdidas y fechas de evaluación alternativas aumenta la probabilidad de hallar algo por azar. Registra todas las pruebas candidatas y separa el análisis exploratorio de una muestra de confirmación preespecificada. Para afirmar que una estrategia de una familia es predictiva, aplica a toda la familia un método adecuado para pruebas múltiples o sesgo de selección de modelos. Añadir instrumentos condicionales no vuelve la evidencia más convincente de forma automática.
Al comparar varios modelos, un procedimiento para toda la familia responde una pregunta distinta de la prueba condicional por pares. La guía del conjunto de confianza de modelos explica cómo una comparación iterativa puede conservar los modelos que no se distinguen con el nivel elegido. No sustituye la preespecificación de las condiciones de una prueba GW.
Informa el diseño para que otra persona pueda reproducirlo
Nombra los dos métodos de pronóstico, cómo se estima cada uno, si los modelos son anidados, el objetivo, el horizonte y las fechas de evaluación. Especifica la función de pérdida y la convención de signo de (d_{t+1}). Describe cada componente de (h_t), cómo se calcula, cuándo pasa a estar disponible y si se eligió antes de examinar los resultados.
Informa el calendario de los orígenes, la regla de ventana de estimación, la versión de los datos, el criterio de muestra común, el número de orígenes fuera de muestra y de funciones de prueba, el estimador de covarianza, la distribución de referencia, el estadístico, los grados de libertad y el valor p. Indica si los horizontes se solapan y cómo se trata la dependencia. Incluye pérdidas promedio y resúmenes de las diferencias, no solo el resultado de la prueba.
Enumera los instrumentos, umbrales, ventanas, pérdidas y pares de pronósticos alternativos que probaste. Si usaste las mismas observaciones para seleccionar el modelo o las variables condicionantes y para probarlos, indícalo. Un resultado puede ser informativo sin confirmar una hipótesis; un informe transparente permite juzgar su alcance y diseñar una validación independiente.
Preguntas frecuentes
Q1¿La prueba de Giacomini–White es igual a la de Diebold–Mariano?
No. Diebold–Mariano se centra en la igualdad de pérdidas promedio. El marco GW de un paso prueba momentos condicionales seleccionados e incluye un momento incondicional como restricción posible.
Q2¿Rechazar indica qué pronóstico usar en todos los regímenes de mercado?
No. Indica que al menos un momento elegido no concuerda con cero bajo los supuestos de la prueba. El resultado depende de los instrumentos, la muestra y la pérdida; no garantiza el rendimiento en cada estado.
Q3¿Puedo seguir añadiendo umbrales de volatilidad hasta que la prueba rechace?
Eso supone buscar entre variables condicionantes. Preespecifica las variables cuando sea posible, informa todas las variantes probadas y usa una muestra de confirmación aparte o una corrección adecuada para toda la familia si haces una afirmación predictiva amplia.
Q4¿Tener capacidad predictiva condicional significa que una estrategia es rentable?
No. La prueba compara pérdidas de pronóstico. Para afirmar que hay rentabilidad necesitas una regla de decisión definida y evaluar por separado la ejecución, las comisiones, la financiación, el impacto de mercado y el riesgo. Investigación primaria - Giacomini y White, “Tests of Conditional Predictive Ability” (2006) - Giacomini y Rossi, “Forecast Comparisons in Unstable Environments” (2010) - McCracken, “Tests of Conditional Predictive Ability: Existence, Size, and Power” (documento de trabajo de la Reserva Federal de San Luis, 2020) - Diebold y Mariano, “Comparing Predictive Accuracy” (1995) - Newey y West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
Si dₜ₊₁ = L(A) − L(B), ¿qué significa una diferencia de pérdidas positiva?
Elige una respuesta para ver la explicación