Regresión de Mincer–Zarnowitz: prueba el sesgo y la calibración del pronóstico
Aprende cómo la regresión de Mincer–Zarnowitz contrasta el intercepto y la escala de un pronóstico, por qué un error medio cero no equivale a calibración y qué no demuestra la prueba
En esta guíaUn error medio cero todavía puede ocultar un problema de calibración
Resumen breve
Una regresión de Mincer–Zarnowitz (MZ) comprueba si los valores observados se alinean linealmente con el nivel y la escala de sus pronósticos. La hipótesis nula habitual fija el intercepto en cero y la pendiente del pronóstico en uno. Esta restricción conjunta aporta más información que el error medio por sí solo, pero no demuestra que se haya aprovechado bien toda la información disponible.
Un error medio cero todavía puede ocultar un problema de calibración
Imagina que un modelo estima el rendimiento del próximo periodo o que una economista pronostica el crecimiento del trimestre siguiente. El promedio de los errores de pronóstico puede ser cero en la muestra de evaluación. Eso es evidencia contra una sobreestimación o subestimación persistente en promedio, pero no demuestra que los valores pronosticados se muevan en la misma proporción que los resultados posteriores. Los pronósticos pueden ser demasiado extremos, demasiado comprimidos o estar desplazados linealmente mientras los errores positivos y negativos se cancelan.
La regresión MZ hace visible esta segunda pregunta al regresar el resultado observado sobre el pronóstico. Mincer y Zarnowitz introdujeron este marco al evaluar pronósticos económicos (capítulo de 1969). Es un diagnóstico para pronósticos puntuales de un objetivo numérico, en especial cuando se pretende estimar una media condicional bajo pérdida cuadrática. No compara cuál de dos modelos tiene menor pérdida media; para eso consulta la guía de Diebold–Mariano.
La distinción importa en investigación de trading. Un pronóstico de rendimientos puede tener poco sesgo medio y aun así una escala incorrecta; uno de volatilidad puede excederse en un rango y quedarse corto en otro. La regresión puede señalar un desajuste lineal, pero el resultado depende de la muestra, la definición del objetivo, el momento de disponibilidad de la información y el método de inferencia. No demuestra que el pronóstico pueda convertirse en una regla rentable.
Alinea el origen, el objetivo y la versión de los datos
Para cada origen de pronóstico t, empareja un pronóstico (fₜ) con el objetivo observado después (yₜ) que debía predecir. Cada par tiene un horizonte fijo: (fₜ) se emitió en un origen anterior para el objetivo posterior (yₜ); el subíndice t funciona después como notación compacta para estos pares. Ambos deben corresponder a la misma variable, horizonte, unidad y convención temporal. Si una estimación anticipa el rendimiento a cinco días y la observación es el de un día, la regresión ya no evalúa la calibración para el objetivo previsto.
Usa pronósticos que realmente estaban disponibles en cada origen y conserva su valor, la versión del modelo, la versión histórica de los datos y la hora de corte de información. Las primeras publicaciones macroeconómicas pueden revisarse. Decide si evaluarás frente al dato inicial o al valor final revisado y conserva esa decisión: sustituir las entradas históricas por datos revisados puede conceder a la evaluación información que el pronosticador original no tenía.
En series de trading, alinea de forma coherente los componentes de cierre a cierre, intradía y nocturno. Los objetivos de varios periodos que se solapan también generan dependencia entre errores adyacentes. Conviene usar una muestra común: si falta un modelo justo en fechas volátiles, la distinta composición de fechas puede parecer un problema de calibración. Usa el mismo objetivo y calendario de orígenes para cada serie que evalúes.
Distingue los pronósticos generados de los valores ajustados dentro de muestra. Si estimas el modelo con las mismas observaciones que entran en la regresión MZ, el ajuste dentro de muestra puede aparentar calibración. Para afirmar que funciona en el futuro, construye una secuencia cronológica fuera de muestra, reestima solo con la información disponible en cada origen y reserva un periodo final que no se use para seleccionar modelos ni umbrales.
Estima la regresión de Mincer–Zarnowitz y especifica la nula
La regresión habitual en niveles es
yₜ = α + β fₜ + uₜ
donde (yₜ) es el objetivo observado, (fₜ) el pronóstico y (uₜ) el residuo de regresión. La restricción conjunta de calibración convencional es
H₀: α = 0 y β = 1
Si se cumplen ambas restricciones, la relación lineal ajustada entre resultado y pronóstico coincide con la línea de identidad: no hace falta un desplazamiento constante y un cambio unitario del pronóstico corresponde a un cambio unitario del resultado ajustado. Estima la regresión y contrasta ambas restricciones conjuntamente mediante Wald o una prueba F equivalente, con una matriz de covarianza adecuada al diseño muestral. Probar el intercepto y la pendiente por separado no equivale a probar la restricción conjunta.
El residuo (uₜ) no es automáticamente el error bruto de pronóstico (yₜ − fₜ). Coinciden bajo la nula conjunta; si no, el intercepto y la pendiente estimados absorben un desplazamiento y un reescalado lineales. Informa también del error de pronóstico original para que se vean tanto el error medio como la relación de calibración.
A veces se denomina a la restricción MZ prueba de insesgadez o racionalidad del pronóstico. Define el término con precisión. El error incondicional medio cero exige (E[yₜ − fₜ] = 0); imponer (α = 0, β = 1) exige una relación lineal específica y suele ser más restrictivo. Holden y Peel muestran que la restricción conjunta convencional es suficiente, pero no necesaria, para la insesgadez según su formulación (1990). No uses «insesgado» y «calibrado por MZ» como sinónimos sin decir qué restricción se contrasta.
<!-- learn:illustration -->

Un ejemplo pequeño separa el sesgo medio de la restricción conjunta
Considera tres pronósticos hipotéticos y sus resultados posteriores:
| Pronóstico (fₜ) | Valor observado (yₜ) | Error (yₜ − fₜ) |
|---|---|---|
| 1 | 1.5 | 0.5 |
| 2 | 2.0 | 0.0 |
| 3 | 2.5 | −0.5 |
El promedio del pronóstico y del resultado es 2, y el error medio es cero. Sin embargo, los valores siguen (yₜ = 1 + 0.5 fₜ): la regresión MZ tiene intercepto (α = 1) y pendiente (β = 0.5), no (0, 1). Los errores se cancelan en promedio aunque falla la restricción lineal; en este ejemplo construido, el resultado solo varía la mitad que el pronóstico.
Es una ilustración aritmética construida a mano, no datos de mercado ni una muestra para inferencia. Con tres puntos sin ruido no tiene sentido informar un valor p significativo ni afirmar que un sistema real ha fallado. En una muestra real, la prueba conjunta incorpora la incertidumbre de estimación. Una gran desviación del coeficiente puede ser imprecisa; una pequeña puede estimarse con precisión si hay suficientes datos. El ejemplo solo muestra que el error medio y la restricción MZ responden a preguntas distintas.
Un ajuste de recalibración como (1 + 0.5 fₜ) reproduciría exactamente estos tres resultados porque se construyó con ellos. Eso no demuestra que funcione después. Si recalibrar forma parte del procedimiento, estima el ajuste en un segmento de entrenamiento anterior y evalúalo con datos posteriores que no determinaron esos coeficientes.
Interpreta conjuntamente el intercepto, la pendiente y R cuadrado
El intercepto (α) es el resultado ajustado cuando el pronóstico es cero; su significado práctico depende de si cero está dentro o cerca del rango pronosticado. La pendiente (β) indica cuánto varía el resultado ajustado cuando cambia el pronóstico. Controlando el intercepto, una pendiente inferior a uno significa que el pronóstico cambia más por unidad que el resultado ajustado; una superior a uno implica lo contrario. Ningún coeficiente describe toda la relación si el otro también queda libre.
Un (R²) alto no demuestra calibración. Por ejemplo, la relación sin ruido (yₜ = 2 + 1.1 fₜ) tiene (R² = 1), pero no satisface la nula MZ. (R²) resume cuánta variación explica el ajuste lineal; la prueba conjunta pregunta si la recta es la de identidad. A la inversa, un pronóstico ruidoso puede tener un (R²) bajo aunque no se rechace la restricción. Calibración y precisión están relacionadas, pero son propiedades distintas.
No deduzcas el resultado de los dos estadísticos t individuales: el intercepto y la pendiente pueden estar correlacionados, y el Wald/F conjunto usa su covarianza. Informa α, β y su incertidumbre, el estadístico y valor p conjuntos, el tamaño muestral y el error bruto medio. Un gráfico con la línea de identidad o una comparación por grupos puede ayudar; indica si elegiste los grupos tras inspeccionar los datos. Una prueba lineal puede pasar por alto relaciones curvas, cambios de régimen o errores en las colas.
La calibración es más débil que la eficiencia completa del pronóstico
Bajo pérdida cuadrática, el pronóstico puntual óptimo es la esperanza condicional del objetivo dada la información del pronosticador. Esto implica que la información disponible en el origen no debería predecir los errores posteriores. La regresión MZ solo comprueba una relación lineal que incluye el propio pronóstico y una constante; no comprueba todas las variables de ese conjunto de información.
Un diagnóstico más exigente puede añadir variables informativas preespecificadas (zₜ) a una regresión de errores, por ejemplo:
yₜ − fₜ = δ₀ + δ₁ zₜ + vₜ
Si una variable conocida en el origen predice errores posteriores, quizá se dejó información útil sin utilizar. El momento de disponibilidad y la selección deben ser correctos; probar muchos retardos, estados de mercado y transformaciones crea otro problema de búsqueda múltiple. No encontrar predicción en una lista corta no demuestra eficiencia respecto de toda la información.
Zarnowitz analiza sesgo, correlación serial, tamaño muestral y potencia en pronósticos de encuestas (Documento de trabajo NBER 1070, 1983). Por eso describe MZ como un diagnóstico de calibración lineal o una comprobación débil de eficiencia, no como prueba de uso óptimo de toda la información relevante. La guía Giacomini–White cubre otra comparación condicional basada en momentos de pérdida seleccionados.
Ten en cuenta la estimación, los solapamientos y la incertidumbre
Los errores pueden ser heterocedásticos, autocorrelacionados o solaparse, sobre todo con pronósticos móviles de varios pasos. Las fórmulas OLS habituales no garantizan por sí solas errores estándar válidos para la restricción conjunta. Elige y describe un método de inferencia justificado por el horizonte, la dependencia y el esquema de estimación; no supongas independencia ni que haya una corrección universal.
Si estimas parámetros, construyes una recalibración y la pruebas en la misma muestra corta, la incertidumbre convencional quizá no refleje el procedimiento completo. Los pronósticos anidados también pueden producir distribuciones nulas no estándar al comparar precisión. Usa un método derivado para la construcción concreta o evalúa el paso de calibración, completamente especificado, en una reserva posterior. No pruebes muchas ecuaciones, objetivos y muestras para luego tratar el último valor p como confirmatorio.
No rechazar no demuestra calibración: puede deberse a poca potencia o intervalos amplios. Rechazar también depende del objetivo, la muestra, la forma lineal y la covarianza estimada. Examina decisiones razonables de evaluación y declara esos análisis, diferenciándolos de una prueba preespecificada. Es especialmente importante con pronósticos persistentes o pocos episodios independientes.
Escoge la prueba que responda a la pregunta sobre el pronóstico
MZ contrasta una restricción lineal de calibración entre pronóstico y resultado. La prueba Diebold–Mariano pregunta si dos procedimientos tienen la misma pérdida media bajo una puntuación elegida. Un pronóstico puede estar calibrado y rendir peor con esa puntuación, o ser más preciso en promedio y fallar la calibración MZ.
Si preguntas si la precisión cambia con información conocida en el origen, la prueba Giacomini–White evalúa momentos condicionales de pérdida seleccionados. Si se buscaron muchos pronósticos o reglas, el Model Confidence Set o White Reality Check/Hansen SPA aborda un problema de selección entre candidatos. Ninguno sustituye un objetivo bien definido ni orígenes honestos.
La regresión MZ en niveles estándar corresponde a pronósticos puntuales de un objetivo numérico. Los pronósticos de cuantiles, probabilidades, intervalos o densidades necesitan pruebas y puntuaciones diseñadas para ese objeto. Un buen resultado para la media no se traslada automáticamente al riesgo de cola ni a una distribución de volatilidad.
Informa del diseño de calibración para que pueda reproducirse
Especifica el objetivo, horizonte, unidades, corte informativo, fechas de evaluación, versión de datos y si los pronósticos fueron realmente fuera de muestra. Incluye la ecuación, cómo defines el error y qué restricciones contrastas. Aclara si «insesgado» significa error medio cero o la restricción conjunta (α = 0, β = 1).
Informa los coeficientes, errores estándar o intervalos, estadístico Wald/F conjunto, grados de libertad, valor p, número de orígenes, error medio y (R²) con una interpretación limitada. Describe la covarianza o el remuestreo, sobre todo si hay horizontes solapados o dependencia serial. Declara estimación, recalibración, selección y cualquier objetivo, muestra o transformación alternativa que hayas probado.
Un informe transparente permite distinguir sesgo medio, calibración lineal, eficiencia informativa y precisión comparativa. Son afirmaciones empíricas diferentes. Superar una restricción de regresión no valida todos los usos del pronóstico, y evaluarlo no prueba rentabilidad después de costes.
Preguntas frecuentes
Q1¿La prueba de Mincer–Zarnowitz solo comprueba el error medio del pronóstico?
No. El error medio compara las medias del pronóstico y del resultado. La prueba MZ convencional restringe conjuntamente el intercepto a cero y la pendiente a uno. Holden y Peel muestran que esta condición es suficiente, pero no necesaria, para la insesgadez bajo su formulación.
Q2¿Superar la prueba MZ demuestra que un pronóstico es eficiente?
No. Comprueba una relación lineal con el pronóstico, no si toda la información disponible en el origen deja de predecir los errores. La eficiencia exige una condición más fuerte sobre el conjunto de información.
Q3¿Puedo usar la misma regresión para una previsión VaR o de cuantiles?
No sin adaptar la definición de calibración y la inferencia. La regresión estándar en niveles corresponde a pronósticos puntuales numéricos; cuantiles y colas requieren pruebas y puntuaciones propias.
Q4¿La calibración demuestra que una estrategia de trading es rentable?
No. La calibración describe la relación entre pronósticos y resultados. La rentabilidad requiere una regla de decisión definida de antemano y evaluación separada fuera de muestra que incluya ejecución, comisiones, financiación, impacto de mercado y riesgo. Investigación primaria - Mincer y Zarnowitz, “The Evaluation of Economic Forecasts” (1969) - Holden y Peel, “On Testing for Unbiasedness and Efficiency of Forecasts” (1990) - Zarnowitz, “Rational Expectations and Macroeconomic Forecasts” (NBER Working Paper 1070, 1983) - Diebold y Mariano, “Comparing Predictive Accuracy” (1995) - Giacomini y White, “Tests of Conditional Predictive Ability” (2006)
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
¿Cuál es la nula conjunta convencional de la regresión MZ?
Elige una respuesta para ver la explicación
Glosario de opciones
Definiciones claras de términos esenciales, desde calls, puts y cadenas de opciones hasta IV, griegas, interés abierto y max pain
Ver el glosario de opciones