Prueba Diebold–Mariano: cómo comparar la precisión de pronósticos
Aprende qué compara la prueba Diebold–Mariano, cómo entran las diferencias de pérdida y la correlación serial en el estadístico, y por qué la precisión del pronóstico no equivale a ganancias al operar.
En esta guíaLa prueba compara la pérdida esperada de los pronósticos
Resumen breve
La prueba Diebold–Mariano (DM) pregunta si dos procedimientos de pronóstico tienen la misma pérdida esperada al evaluar resultados emparejados. Trabaja con una serie de diferencias de pérdida, por lo que la función de pérdida, el horizonte y la dependencia entre fechas influyen en el resultado. Rechazar la hipótesis nula respalda que existe una diferencia bajo el diseño de evaluación indicado; no demuestra que un modelo seguirá siendo superior ni que una estrategia será rentable después de costes.
La prueba compara la pérdida esperada de los pronósticos
La prueba Diebold–Mariano compara dos pronósticos del mismo objetivo en las mismas fechas de evaluación. En cada origen, ambos procedimientos deben enfrentarse al mismo resultado realizado, horizonte e instante de corte de la información. Después la prueba pregunta si la pérdida media de un procedimiento difiere sistemáticamente de la del otro, permitiendo que las diferencias de pérdida varíen con el tiempo.
Diebold y Mariano plantean la cuestión para una función de pérdida general, no solo para el error cuadrático medio. Su artículo original desarrolla pruebas de la hipótesis nula de que pronósticos competidores tienen la misma precisión predictiva (Diebold y Mariano, 1995). Aquí, «precisión» significa menor pérdida esperada según la función elegida para la comparación. No significa que el pronóstico sea verdadero, explique causalmente el resultado, esté bien calibrado en todas las partes de su distribución o sea útil para cualquier decisión.
Supón que los modelos A y B pronostican la misma rentabilidad futura en el mismo momento. La prueba DM no comprueba si un coeficiente de alguno de los modelos es cero ni si ambos producen los mismos valores ajustados en la muestra de estimación. Compara cómo se traducen sus errores de pronóstico en la pérdida escogida dentro de la muestra de evaluación.
Hay que especificar el diseño antes de interpretar el estadístico. El objetivo, los orígenes del pronóstico, el horizonte, la función de pérdida, el tratamiento de resultados ausentes, el calendario de reestimación del modelo y la alternativa unilateral o bilateral determinan qué pregunta se contrasta. Si estas decisiones difieren entre modelos, la diferencia de pérdidas deja de representar una comparación en condiciones equivalentes.
Define pronósticos emparejados y una diferencia de pérdida
Sea $y_t$ el objetivo realizado en el origen de pronóstico $t$, y sean $\hat y_{A,t}$ y $\hat y_{B,t}$ los pronósticos de A y B. Sus errores son $e_{A,t}=y_t-\hat y_{A,t}$ y $e_{B,t}=y_t-\hat y_{B,t}$. Para una función de pérdida $L$, define la diferencia de pérdidas en cada fecha así:
$$ d_t=L(e_{A,t})-L(e_{B,t}) $$
Con esta convención de signos, una media negativa de $d_t$ significa que A tuvo menor pérdida observada; una media positiva significa que B tuvo menor pérdida. La hipótesis nula poblacional es $E[d_t]=0$. La alternativa bilateral pregunta si las pérdidas esperadas difieren en alguna dirección; la unilateral pregunta por una dirección elegida de antemano. No elijas la dirección después de ver qué modelo ganó.
Con pérdida cuadrática, $L(e)=e^2$, los errores grandes pesan mucho más. Con pérdida absoluta, $L(e)=|e|$, un único error grande domina menos la clasificación. La pérdida cuantílica puede corresponder a un objetivo asimétrico, y otras pérdidas pueden medir otros aspectos del desempeño predictivo. Cambiar la pérdida puede invertir el orden de los modelos, así que «mejor pronóstico» no tiene un significado único hasta que se especifique la pérdida. La revisión de Tashman sobre pruebas de pronóstico fuera de muestra también destaca que la evaluación debe corresponder al problema de pronóstico (Tashman, 200000065-0)).
Usa los mismos orígenes y resultados para ambos modelos. Si a uno le falta una fecha difícil, descartarla en silencio solo para ese modelo cambia la muestra comparativa. Si en producción se reestimará el modelo cada mes con datos nuevos, genera los pronósticos de evaluación con esa misma regla; un experimento de parámetros fijos responde a otra pregunta. Una evaluación secuencial como la validación walk-forward define cómo producir pronósticos posteriores sin usar información futura.
Un ejemplo con cuatro orígenes aclara la diferencia media
Supón cuatro orígenes de pronóstico hipotéticos y expresa tanto el objetivo como los errores en puntos porcentuales. Los errores de A son $[1,2,0,1]$ y los de B son $[2,1,1,1]$. Cada par corresponde a la misma rentabilidad realizada y al mismo intervalo de pronóstico. Los valores son inventados únicamente para mostrar el cálculo.
Con pérdida cuadrática, las pérdidas de A son $[1,4,0,1]$ y su error cuadrático medio es $(1+4+0+1)/4=1.50$ puntos porcentuales al cuadrado. Las pérdidas de B son $[4,1,1,1]$ y su error cuadrático medio es $(4+1+1+1)/4=1.75$. En estos cuatro resultados, el MSE de A es 0.25 puntos porcentuales al cuadrado menor.
Las diferencias por fecha, $d_t=L(e_{A,t})-L(e_{B,t})$, son $[-3,3,-1,0]$. Su media es $(-3+3-1+0)/4=-0.25$, igual a la diferencia entre el MSE medio de A y el de B. El signo negativo favorece a A con esta convención. Todavía no indica que la diferencia supere el ruido muestral: cuatro pares de pronósticos no bastan para tratar el signo como evidencia estadística convincente.
La definición de pérdida también cambia lo que significa «mejor». En otro ejemplo hipotético, C tiene errores absolutos $[0,0,0,3]$ y D tiene $[1,1,1,1]$. Con pérdida absoluta, las medias son 0.75 para C y 1 para D, de modo que se prefiere C. Con pérdida cuadrática, las medias son 2.25 para C y 1 para D, por lo que ahora se prefiere D. La prueba no puede resolver esta discrepancia sin decidir qué errores importan más.
<!-- Illustration placement: after this section; text-free conceptual scene showing two forecast paths against one realized path, with visibly different miss distances and no labels or numerical claims. -->
El estadístico DM escala la brecha media de pérdida por su incertidumbre
La diferencia de pérdida media muestral es $\bar d=T^{-1}\sum_{t=1}^{T}d_t$, donde $T$ es el número de resultados de pronóstico emparejados. Su error estándar depende de la varianza de largo plazo de $d_t$, no solo de su varianza en una fecha. Una forma general del estadístico es:
$$ DM=\frac{\bar d}{\sqrt{\widehat{\Omega}/T}} $$
$\widehat{\Omega}$ estima la varianza de largo plazo de la serie de diferencias de pérdida. Si las fechas fueran independientes, con el estimador elegido se reduciría a la varianza de $d_t$. Pero las pérdidas de pronóstico suelen agruparse: durante un período de alta volatilidad pueden aumentar los errores de ambos modelos, y un objetivo a $h$ pasos puede hacer que ventanas de error contiguas compartan rentabilidades realizadas. Ignorar dependencia positiva puede reducir demasiado el error estándar estimado y hacer que la evidencia parezca más sólida de lo que es.
Una construcción HAC habitual estima las autocovarianzas $\hat\gamma_k$ de las diferencias de pérdida centradas y las combina como $\widehat{\Omega}=\hat\gamma_0+2\sum_{k=1}^{q}w_k\hat\gamma_k$. Con pesos de Bartlett, hasta el ancho de banda $q$, $w_k=1-k/(q+1)$. Newey y West propusieron un estimador de covarianza semidefinido positivo, consistente ante heterocedasticidad y autocorrelación (Newey y West). El kernel y el ancho de banda son decisiones de implementación: decláralos y elígelos de acuerdo con el diseño del pronóstico, no para obtener un p-valor preferido. La guía de errores estándar HAC aborda el problema general de estimación de covarianzas.
Bajo las condiciones regulares de la prueba, el estadístico DM estándar se compara asintóticamente con una distribución normal estándar. Un valor absoluto grande indica que la diferencia media observada es grande respecto de su incertidumbre estimada. El signo identifica qué modelo tuvo menor pérdida según el orden definido; el p-valor no mide el tamaño ni el valor económico de la diferencia. Tampoco representa la probabilidad de que la hipótesis nula sea cierta o de que un pronóstico funcione en el futuro.
Los pronósticos a varios pasos se solapan y requieren considerar la muestra finita
Al pronosticar cada período un objetivo de varios períodos adelante, las ventanas de evaluación se solapan. Por ejemplo, un pronóstico mensual de la rentabilidad acumulada de los próximos tres meses comparte dos de esos tres rendimientos mensuales con el pronóstico emitido un mes después. Aunque los rendimientos mensuales fueran independientes, el solapamiento puede inducir correlación serial en los errores de pronóstico y en sus diferencias de pérdida.
En una configuración básica de $h$ pasos, la varianza debería reflejar como mínimo la dependencia hasta el rezago $h-1$. No es una regla universal de ancho de banda: la reestimación móvil, los objetivos persistentes, la agrupación de volatilidad y la función de pérdida pueden introducir más dependencia. Registra el horizonte, el espacio entre orígenes y el motivo para elegir el truncamiento HAC u otro estimador de varianza. El número de filas de pronóstico no equivale automáticamente al número de observaciones independientes.
La prueba asintótica original puede tener un nivel efectivo inadecuado en muestras moderadas. Harvey, Leybourne y Newbold propusieron una modificación de muestra finita para comparar errores cuadráticos medios de pronóstico (HLN, 199700719-4)). Una forma habitual, para horizonte $h$ y $T$ pronósticos, multiplica el estadístico DM por:
$$ DM_{HLN}=DM\sqrt{\frac{T+1-2h+h(h-1)/T}{T}} $$
El estadístico modificado suele compararse con una distribución $t$ con $T-1$ grados de libertad. Para $T=60$ y $h=5$, el multiplicador es aproximadamente $0.925$. El ejemplo solo ilustra la aritmética de la corrección: no afirma que 60 observaciones basten para un modelo concreto ni que se cumplan sus supuestos. La corrección atiende un problema específico de muestra finita, pero no repara filtración de información, un objetivo inválido, dependencia no modelada, selección repetida de modelos ni una pérdida mal especificada.
Los modelos anidados requieren otro argumento para comparar pronósticos
El modelo A puede ser una versión restringida del modelo B; por ejemplo, B puede añadir predictores a A. Bajo una hipótesis nula en la que los predictores adicionales no aportan valor predictivo poblacional, sus coeficientes estimados aún pueden añadir ruido a los pronósticos de B. Por eso el modelo más amplio podría mostrar un MSE observado mayor aunque los predictores extra no mejoren el proceso subyacente. La lógica habitual de igualdad de precisión para modelos no anidados no se traslada automáticamente sin cambios.
Clark y West desarrollan pruebas aproximadamente normales de precisión predictiva igual en modelos anidados y ajustan la comparación de errores cuadráticos por el ruido de estimación que introduce el modelo más amplio (Clark y West, 2007). Su ajuste no sustituye universalmente a todas las pruebas DM: se diseñó para una pregunta, una pérdida y una configuración asintótica concretas. Identifica si un modelo está anidado en otro y elige una prueba cuya distribución nula corresponda al diseño. No des por hecho que el p-valor DM estándar de un programa cubre cualquier relación entre modelos.
También importan otras distinciones. Una predicción con menor MSE quizá no mejore la cobertura de intervalos, la calibración probabilística, la precisión direccional ni una decisión posterior. Una comparación puede ser fuera de muestra y aun así usar un conjunto de validación inadecuado que se inspeccionó reiteradamente durante el desarrollo. Informa la relación entre modelos, el esquema de estimación, el horizonte y los datos disponibles al generar cada pronóstico.
La precisión de los pronósticos no equivale a una ventaja al operar
El resultado DM evalúa una pérdida predictiva; una decisión de trading evalúa un proceso de rentabilidad y riesgo. Un MSE menor para los rendimientos del siguiente período no garantiza que una señal acierte el lado de la operación con frecuencia suficiente, dimensione bien las posiciones o soporte rotación, spread, impacto de mercado, comisiones, coste de préstamo, funding y demoras de ejecución. A la inversa, un pronóstico con un error cuadrático medio ligeramente peor todavía puede mejorar una decisión si es más preciso en los momentos en que la estrategia tiene mucha exposición. Para respaldar esa afirmación, quizá la pérdida deba representar la decisión real en lugar de una métrica predictiva genérica y cómoda.
Una diferencia estadísticamente significativa también puede ser económicamente pequeña. Informa el tamaño de la diferencia media de pérdida en unidades interpretables junto con su incertidumbre, no solo un p-valor o una etiqueta de ganador. Si la afirmación trata del resultado de una cartera, vuelve a ejecutar la regla de decisión completa y congelada sobre datos posteriores adecuados, con supuestos realistas de operación, e informa por separado el resultado neto. DM no calcula esos resultados ni incorpora costes, salvo que la pérdida se haya diseñado explícitamente para hacerlo.
La prueba tampoco corrige haber buscado entre muchos modelos, objetivos, horizontes, funciones de pérdida, períodos o reglas y presentar después solo la comparación más favorable. Repetir pruebas por pares crea su propio problema de selección. Conserva el registro de búsqueda y aplica un método de pruebas múltiples adecuado a la familia de afirmaciones. La guía de pruebas múltiples y tasa de falsos descubrimientos explica por qué los umbrales habituales pueden inducir a error tras una búsqueda amplia. DM es una herramienta de evaluación, no una corrección por minería de datos.
Informa el detalle necesario para reproducir la comparación
Un informe claro identifica el objetivo y sus unidades, el corte de información, los orígenes, el horizonte, el calendario de reestimación y la muestra común de evaluación. Especifica la función de pérdida y el signo de $d_t$, muestra la pérdida media de cada modelo y la diferencia media, indica la hipótesis unilateral o bilateral elegida previamente e informa el estimador de varianza, kernel, ancho de banda, estadístico, distribución de referencia, p-valor e intervalo de confianza o medida de incertidumbre cuando corresponda.
Declara también si los modelos están anidados, cómo se trataron los resultados ausentes y los valores extremos, cuántas especificaciones alternativas se examinaron y si el período de evaluación influyó en las decisiones de modelado. Presenta la magnitud de la diferencia y no solo si cruzó un umbral. Una serie temporal de $d_t$ o un gráfico de diferencias acumuladas puede revelar cambios de régimen ocultos por una media general, aunque la visualización no sustituye una inferencia que tenga en cuenta la dependencia.
En trading cuantitativo, agrega el paso de pronóstico a acción: umbral de señal, tamaño de posición, momento de rebalanceo, controles de riesgo, precio de ejecución y supuestos de costes. La prueba DM solo compara la serie de pérdidas predictivas que recibe. No certifica el flujo de datos, no hace comparables muestras distintas, no demuestra causalidad ni promete que se mantengan las clasificaciones históricas. Úsala como una parte transparente de la evaluación de modelos, junto con un diseño de pronóstico ordenado en el tiempo y una evaluación explícita de las decisiones.
Preguntas frecuentes
Q1¿La prueba Diebold–Mariano compara coeficientes de modelos?
No. Compara la pérdida esperada de los errores que generan dos procedimientos de pronóstico sobre resultados emparejados. Una prueba de coeficientes plantea otra pregunta sobre un parámetro del modelo.
Q2¿Puedo usarla con pronósticos a varios períodos?
Sí, pero las ventanas objetivo solapadas pueden hacer que las diferencias de pérdida sucesivas tengan dependencia serial. Usa un estimador de varianza y, cuando proceda, una corrección de muestra finita adecuados al horizonte y al diseño; documenta las decisiones.
Q3¿Un resultado significativo significa que el mejor pronóstico dará beneficios?
No. Respalda una diferencia en la pérdida elegida bajo el diseño de evaluación. La rentabilidad también depende de cómo se conviertan los pronósticos en posiciones, los riesgos asumidos y los costes y la ejecución realizados.
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
¿Cuál es la hipótesis nula de la comparación básica de Diebold–Mariano?
Elige una respuesta para ver la explicación
Glosario de opciones
Cambio de la varianza condicional del error entre valores o estados, que invalida una fórmula de covarianza con varianza constante.
Leer la guía detalladaTasa de error familiarProbabilidad de rechazar falsamente al menos una hipótesis nula verdadera dentro de una familia de pruebas predefinida.
Leer la guía detalladaReversión a la mediaTendencia dependiente del modelo a volver hacia una referencia fija o cambiante; no implica automáticamente estacionariedad ni operabilidad.
Leer la guía detallada