Prueba de Clark–West para pronósticos anidados: fórmula, ejemplo y límites
Descubre por qué los modelos de pronóstico anidados requieren una comparación de MSPE ajustada, cómo funciona el estadístico Clark–West y qué puede y qué no puede demostrar un resultado unilateral.
En esta guíaPor qué los pronósticos anidados requieren una comparación aparte
Resumen breve
La prueba Clark–West ajusta una comparación de errores al cuadrado cuando un modelo de pronóstico incluye un benchmark más pequeño. Los parámetros adicionales estimados pueden añadir ruido a los pronósticos del modelo mayor aunque no aporten información predictiva real. El ajuste modifica la diferencia de pérdidas que se usa para la inferencia; no modifica los pronósticos ni garantiza que el modelo mayor sea útil.
Por qué los pronósticos anidados requieren una comparación aparte
Supongamos que un modelo restringido pronostica el rendimiento del mes siguiente con una constante, mientras que un modelo mayor añade una razón de valoración. El modelo restringido está anidado en el mayor: fijar en cero el coeficiente añadido devuelve el benchmark. Aunque ese coeficiente sea realmente cero, estimarlo puede introducir ruido muestral en las predicciones del modelo mayor. Por eso, el error cuadrático medio de predicción (MSPE) observado de este modelo puede ser mayor incluso cuando ambos tienen la misma capacidad predictiva poblacional.
El ajuste Clark–West aborda ese problema de ruido de estimación al comparar fuera de muestra errores al cuadrado de pronósticos anidados. En ese contexto, pregunta si el modelo mayor aporta valor predictivo más allá del benchmark restringido. Es una pregunta más acotada que la comparación general de la guía de Diebold–Mariano, que compara pérdidas emparejadas y cuyo uso no es automáticamente válido con la distribución de referencia habitual para modelos anidados. Clark y McCracken estudian el distinto comportamiento asintótico y en muestras finitas de las pruebas de precisión y encompassing para pronósticos anidados; Clark y West desarrollan el procedimiento MSPE ajustado y su inferencia aproximada. Clark and McCracken (2001)00071-9); Clark and West (2007).
Comprueba el anidamiento y conserva un diseño fuera de muestra
El benchmark restringido debe pronosticar el mismo objetivo (y_{t+h}) que la alternativa mayor. El modelo mayor tiene que contener la especificación del benchmark como caso especial, normalmente al fijar en cero uno o varios coeficientes añadidos. Que sea más complejo, use más variables o ajuste mejor dentro de la muestra no demuestra esa relación de anidamiento.
Genera ambos pronósticos para cada origen usando solo la información disponible en ese momento. Estima los modelos con una ventana de entrenamiento cronológica, emite pronósticos para una ventana de evaluación posterior y usa el mismo objetivo, horizonte, unidades, orígenes y observaciones realizadas para ambos. La reestimación recursiva o móvil puede ser apropiada, pero indica cuál usas y conserva los pronósticos que realmente se hicieron en cada origen. Si consultas repetidamente la ventana de evaluación para elegir predictores, transformaciones u horizontes, esta pasa a formar parte de la selección del modelo en vez de ser evidencia intacta. La guía CAViaR muestra por qué un pronóstico de cuantiles de cola también debe evaluarse con una pérdida adecuada para su objetivo, en vez de incorporarse a una comparación de pronósticos de la media.
El ajuste Clark–West se ocupa del ruido de estimación de parámetros bajo la hipótesis nula de modelos anidados; no corrige el uso de información futura, las muestras no coincidentes, los datos revisados tratados como si se hubieran conocido antes ni la búsqueda de modelos no declarada. Informa la ventana de estimación inicial, el número de orígenes, el horizonte, la versión de los datos y las actualizaciones móviles o recursivas para que se pueda determinar qué comparación fue realmente fuera de muestra.
Calcula la diferencia de pérdidas ajustada
Sea f₀,t+h el pronóstico restringido, f₁,t+h el del modelo mayor y eⱼ,t+h = yₜ₊ₕ − fⱼ,t+h el error de pronóstico j. Con una pérdida de error al cuadrado, la diferencia ajustada Clark–West para cada periodo es
dCW,t+h = (e₀,t+h)² − [(e₁,t+h)² − (f₀,t+h − f₁,t+h)²]
Equivale al error cuadrático del modelo restringido menos el del modelo mayor, más la distancia al cuadrado entre sus pronósticos. El último término estima el ruido adicional de pronóstico asociado a los parámetros ajustados extra bajo la hipótesis nula. Clark y West describen el ajuste como una reducción del MSPE muestral del modelo mayor por ese término de brecha antes de compararlo con el modelo restringido. Clark and West (2007).
Calcula el promedio de las diferencias ajustadas en los orígenes de evaluación comunes: mean(dCW) = (1/P) Σ dCW,t+h. Si los resultados y pronósticos se miden en puntos básicos, cada error al cuadrado y diferencia ajustada se expresa en puntos básicos al cuadrado. Según la convención anterior, un promedio ajustado positivo favorece al modelo mayor. Es una puntuación de comparación ajustada, no el MSPE realizado del modelo mayor ni un pronóstico para operar.
Define la hipótesis unilateral antes de interpretar el resultado
La pregunta habitual de Clark–West es si el modelo mayor y anidado tiene un MSPE esperado menor que el benchmark restringido. La hipótesis nula representa que el componente añadido no mejora la capacidad predictiva; la alternativa unilateral favorece al modelo mayor. Con la fórmula anterior, un promedio ajustado suficientemente positivo en relación con su error estándar respalda esa alternativa.
En la notación de pérdida ajustada, las hipótesis de trabajo son H₀: E[dCW] = 0 frente a H₁: E[dCW] > 0. La dirección positiva se debe a que la pérdida del modelo restringido aparece primero. Si se invierte la resta, cambia el signo; por eso, indica la convención junto al resultado.
El estadístico suele escribirse como la media muestral de dCW dividida por su error estándar estimado. Para los contextos que estudian, Clark y West recomiendan una prueba unilateral aproximadamente normal, con un error estándar convencional o consistente con la autocorrelación según corresponda. West (1996) desarrolla inferencia para momentos de funciones suaves de pronósticos y errores fuera de muestra, incluidos contextos en los que los pronósticos dependen de parámetros estimados. La dirección debe elegirse antes de ver los resultados: un estadístico Clark–West positivo no permite cambiar después a una hipótesis bilateral o de signo distinto.
El valor p está condicionado a la relación de anidamiento, la construcción de los pronósticos, el objetivo, la pérdida, el método de inferencia y los supuestos de muestreo. No indica la probabilidad de que el modelo mayor sea verdadero ni demuestra que un predictor añadido cause cambios en el objetivo.
Sigue un ejemplo de cuatro periodos
Considera cuatro observaciones hipotéticas en puntos básicos. Los valores reales son [0, 1, −1, 0], los pronósticos del modelo restringido son [−1, 0, 0, 0] y los del modelo mayor anidado son [−1.5, 0.5, −0.5, 0.5]. Los errores al cuadrado del modelo restringido son [1, 1, 1, 0], con un MSPE medio de 0.75 bp². Los errores al cuadrado del modelo mayor son [2.25, 0.25, 0.25, 0.25], también con un MSPE medio de 0.75 bp².
Las brechas de pronóstico al cuadrado (f₀ − f₁)² son [0.25, 0.25, 0.25, 0.25]. Al aplicar la diferencia ajustada e₀² − e₁² + (f₀ − f₁)² se obtiene [−1, 1, 1, 0] bp². Su media muestral es 0.25 bp². Los MSPE sin ajustar coinciden, mientras que el promedio ajustado es positivo porque la corrección tiene en cuenta el ruido de estimación del pronóstico del modelo mayor.
Estos cuatro periodos solo ilustran el cálculo. Son demasiado pocos para estimar la incertidumbre de forma creíble o determinar significación estadística. Por sí solo, el promedio ajustado positivo no demuestra una ventaja predictiva real, y los valores son hipotéticos, no observaciones de mercado. <!-- learn:illustration -->

Ten en cuenta la dependencia de los errores y los horizontes
Incluso los pronósticos a un paso pueden producir diferencias de pérdidas ajustadas con dependencia serial si el objetivo, los predictores o la ventana de estimación evolucionan con el tiempo. En pronósticos de varios pasos solapados, los orígenes adyacentes comparten periodos objetivo realizados, por lo que sus diferencias ajustadas pueden estar correlacionadas por construcción. Un error estándar ordinario que trate cada origen como independiente puede subestimar la incertidumbre.
Estima el error estándar a partir de la serie de diferencias ajustadas con un método que refleje el diseño muestral, como una estimación de varianza de largo plazo consistente con heterocedasticidad y autocorrelación cuando se cumplan sus condiciones. Clark y West señalan explícitamente el uso de errores consistentes con la autocorrelación si los errores de pronóstico están autocorrelacionados. Indica el horizonte, el estimador de covarianza, el kernel y el ancho de banda si los usas, así como cualquier método de remuestreo o de valores críticos. La guía de block bootstrap explica por qué el remuestreo de observaciones dependientes de series temporales debe conservar el orden; un bootstrap genérico no implementa automáticamente la hipótesis nula Clark–West.
El tratamiento de la dependencia necesario depende del diseño. Los horizontes más largos, objetivos persistentes, reestimación repetida de parámetros y cambios de volatilidad pueden crear dependencia más allá del solapamiento simple. Compara configuraciones de inferencia razonables y explícalas en vez de elegir la que arroja el valor p más bajo.
Considera los valores críticos normales una aproximación, no una garantía
Las pruebas de pronóstico de modelos anidados pueden tener distribuciones nulas no estándar, en especial cuando las muestras de estimación y evaluación crecen a la vez. El análisis de Clark y McCracken muestra que las pruebas de igual precisión y encompassing para pronósticos anidados tienen un comportamiento asintótico y en muestras finitas distinto del de la comparación habitual entre modelos no anidados. Clark y West motivan un estadístico ajustado con inferencia aproximadamente normal útil en los diseños estudiados, pero eso no es una garantía universal para muestras finitas. Clark and McCracken (2001)00071-9); Clark and West (2007).
Una muestra de evaluación pequeña, muchos parámetros añadidos, un benchmark mal especificado, la selección de predictores basada en datos y la elección entre estimación móvil o recursiva pueden afectar el tamaño y la potencia de la prueba. Si la muestra o el diseño difieren sustancialmente de los contextos del artículo, considera valores críticos adecuados al diseño o un procedimiento de simulación/bootstrap especificado con cuidado. Informa el tamaño de las muestras de estimación y evaluación y deja claro qué distribución de referencia produjo el valor p.
Distingue las pruebas relacionadas y limita las conclusiones
La prueba Diebold–Mariano pregunta si dos series de pérdidas de pronóstico tienen la misma pérdida esperada en un marco general de pérdidas emparejadas. El ajuste Clark–West está diseñado para comparaciones de errores al cuadrado en las que un modelo anida al otro y los parámetros extra estimados distorsionan la diferencia MSPE sin ajustar bajo la hipótesis nula. Aplicar el ajuste a modelos no anidados sin justificación cambia la pregunta. El artículo original de DM permite una variedad amplia de medidas de pérdida y contempla errores de pronóstico que no tienen que ser gaussianos ni independientes; es una referencia relacionada, no un sinónimo del procedimiento para modelos anidados. Diebold and Mariano (1995).
Ningún método resuelve los grados de libertad del investigador derivados de probar muchos objetivos, horizontes, benchmarks y conjuntos de predictores. Si la comparación final procede de una búsqueda amplia, registra el conjunto de candidatos y usa un método diseñado para la pregunta a nivel de búsqueda. La guía White Reality Check y Hansen SPA cubre la inferencia de toda una familia de reglas de trading probadas; la prueba Clark–West por sí sola no convierte una comparación seleccionada en confirmatoria.
Un resultado unilateral significativo es evidencia, bajo los supuestos declarados, de que el modelo mayor mejora la precisión esperada de los pronósticos al cuadrado para el objetivo y el diseño de evaluación probados. No demuestra que el predictor adicional sea causal, que la señal vaya a mantenerse estable ni que una estrategia basada en el pronóstico obtenga rendimientos positivos. La mejora puede ser demasiado pequeña para las decisiones y las mayores ganancias del modelo pueden concentrarse en periodos en que operar resulta caro.
La rentabilidad del trading requiere una regla aparte, datos de evaluación intactos y spreads, comisiones, deslizamiento, impacto de mercado, financiación, préstamo de activos y límites de riesgo realistas. Las afirmaciones causales necesitan una estrategia de identificación adecuada a la pregunta; una comparación de pronósticos posterior a la muestra no es un diseño causal. Explica qué demuestra realmente el resultado Clark–West y reserva las demás afirmaciones para evidencia que las ponga a prueba.
Informa el diseño para que la comparación se pueda reproducir
Nombra el modelo restringido y el mayor, identifica las restricciones exactas que los hacen anidados y define el objetivo, horizonte, unidades del error al cuadrado, ventana de estimación, calendario de orígenes, fechas de evaluación y regla de muestra común. Explica si los coeficientes se reestiman de forma recursiva o con una ventana móvil y cómo se conservan el conjunto de información y las versiones de los datos.
Informa los MSPE sin ajustar de ambos modelos, la media de la diferencia Clark–West ajustada, la convención de signo, el error estándar, la alternativa unilateral, la distribución de referencia o los valores críticos, el valor p y el estimador de dependencia. También declara el número de parámetros añadidos, tamaños de muestra, búsquedas de predictores y horizontes, selección de benchmark y si la ventana de evaluación influyó en el diseño del modelo. Así, los lectores podrán distinguir una prueba ajustada de modelos anidados de una comparación general de pronósticos y valorar la incertidumbre restante.
Preguntas frecuentes
Q1¿La prueba Clark–West sustituye a la prueba Diebold–Mariano?
No. Clark–West trata la comparación de MSPE al cuadrado para modelos anidados. Diebold–Mariano es un marco general para pérdidas emparejadas y no se debe suponer que su distribución de referencia habitual se aplica automáticamente a pronósticos anidados.
Q2¿Una media ajustada positiva demuestra que el modelo mayor es mejor?
No. Apunta a favor del modelo mayor según la convención de signo indicada, pero la inferencia también requiere un error estándar adecuado, un diseño fuera de muestra creíble y suficientes observaciones.
Q3¿Puedo usar Clark–West para modelos no anidados?
No por defecto. El ajuste se motiva por el ruido de estimación bajo una hipótesis nula de modelos anidados. Para modelos no anidados, elige una prueba adecuada al diseño y a la pérdida del pronóstico.
Q4¿Un resultado Clark–West significativo implica una estrategia de trading rentable?
No. Evalúa la precisión del pronóstico para un objetivo y un diseño de evaluación. Los resultados de trading también dependen de la regla de decisión, ejecución, comisiones, financiación, riesgo y más evidencia fuera de muestra. Investigación primaria - Clark and West, “Approximately Normal Tests for Equal Predictive Accuracy in Nested Models” (2007) - Clark and McCracken, “Tests of Equal Forecast Accuracy and Encompassing for Nested Models” (2001)00071-9) - West, “Asymptotic Inference about Predictive Ability” (1996) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
¿Por qué el ajuste Clark–West añade la brecha al cuadrado entre los dos pronósticos?
Elige una respuesta para ver la explicación