Prueba de encompassing de pronósticos: ¿una predicción contiene la información de otra?
Descubre cómo se evalúa la información predictiva incremental y por qué el encompassing no equivale a comparar pérdidas, calibración ni rentabilidad.
En esta guía¿Qué pregunta responde el encompassing?
Resumen breve
Una prueba de encompassing pregunta si el pronóstico de un rival aporta información lineal adicional que podría mejorar un pronóstico de referencia. La respuesta depende de la hipótesis, la construcción del contraste y la estimación de parámetros. Un peso de combinación positivo o no significativo no constituye un veredicto general sobre calidad o rentabilidad.
¿Qué pregunta responde el encompassing?
Supongamos que A y B pronostican el mismo objetivo y, y comparten origen y horizonte. La prueba no se limita a preguntar cuál tuvo un error menor en el pasado. Pregunta si, una vez considerado el pronóstico A, B conserva una señal adicional que pueda mejorar A bajo una formulación lineal especificada. Si B no añade información predictiva en ese diseño, se dice que A engloba a B o que B no mejora adicionalmente a A.
La evaluación de encompassing se desarrolló, entre otros contextos, al comparar modelos macroeconómicos lineales. Chong y Hendry (1986) analizan esta idea en Econometric Evaluation of Linear Macro-Economic Models {source:chongHendry1986ForecastEncompassing}. «Englobar» describe una relación condicional entre pronósticos concretos y una hipótesis concreta; no significa que A sea siempre correcto ni que B carezca de utilidad en cualquier otro problema.
Un RMSE menor ordena los errores observados según una métrica y una muestra determinadas. El encompassing trata la información incremental de un pronóstico rival respecto de una referencia. Las dos respuestas pueden no coincidir, así que el orden de RMSE no demuestra por sí solo el resultado de encompassing.
El RMSE es la raíz cuadrada del error cuadrático medio: RMSE = √[(1/n) Σₜ₌₁ⁿ eₜ²]. No es el error cuadrático medio sin transformar.
Alinea los pronósticos antes de compararlos
f_A,t y f_B,t deben pronosticar el mismo objetivo y, con la misma información disponible en cada origen y para un único horizonte. Armoniza la definición del objetivo, las unidades, las marcas de tiempo, la muestra y el tratamiento de observaciones ausentes. Un pronóstico del cierre de mañana no es directamente comparable con el promedio de los próximos cinco días, aunque ambos se llamen pronóstico de rendimiento.
Usa las predicciones que realmente estaban disponibles en cada origen histórico, no versiones reestimadas después con información futura. Conserva las fechas de datos y modelos, y aplica reglas documentadas a datos macroeconómicos revisados o precios ajustados. Si elegiste el período o las especificaciones tras inspeccionar los resultados, descríbelo como parte de la búsqueda, no como validación independiente fuera de muestra.
Define el signo explícitamente: e_A,t = y_t − f_A,t y d_t = f_B,t − f_A,t. Fija la convención antes de calcular coeficientes. Si inviertes el orden de A y B, cambia el signo de d y del peso estimado. La información no cambia, pero sí la interpretación del signo.
La pendiente resume una posible señal lineal adicional de B
Una combinación lineal ilustrativa es f_C,t = f_A,t + w d_t, o f_C,t = (1−w)f_A,t + w f_B,t. Regresar el error e_A,t sobre una constante y d_t ayuda a interpretar w: si la diferencia entre pronósticos está asociada con los errores de A, podría contener información lineal adicional. En esta representación, la pendiente estima el peso incremental de B y la constante recoge el sesgo medio de A.
Sin embargo, esta interpretación no es una definición única de todas las pruebas de encompassing. Algunas especificaciones restringen la constante o el sesgo del pronóstico; otras usan otra referencia o información condicional. El contraste puede ser unilateral o imponer restricciones conjuntas. La estimación de parámetros y la estructura de modelos anidados también pueden cambiar la inferencia apropiada. Por eso hay que nombrar la prueba, la hipótesis y sus condiciones, sin presentar una regresión o un valor crítico como regla universal.
Los pesos estimados pueden quedar fuera de [0,1]. En ese caso, la mejor mezcla lineal muestral extrapola más allá de las dos predicciones en lugar de quedarse entre ellas. Una implementación puede imponer pesos no negativos o que sumen uno, pero las restricciones dependen del método. Indícalas y no recortes un estimador sin restricciones sin volver a estimar.
En la regresión ilustrativa e_A,t = α + β d_t + u_t con constante, la pendiente poblacional es β = Cov(e_A,d)/Var(d), siempre que Var(d)>0. Por tanto, β=0 significa que no hay asociación lineal entre el error de A y la diferencia de pronósticos una vez permitido un sesgo constante. No descarta relaciones no lineales ni otros tipos de información.
Sin constante, la pendiente poblacional es E[e_A d]/E[d²], si E[d²]>0; la restricción de pendiente cero es entonces el momento cruzado E[e_A d]=0. Este momento solo equivale a covarianza cero cuando E[e_A]=0 o E[d]=0. En la regresión con constante, α=0 es una restricción de sesgo distinta; junto con β=0 exige que el error medio de A sea cero. Por ello, probar α=0 añade una restricción de insesgadez y no examina únicamente la información incremental.
La formulación cambia; no hay un umbral universal
Un contraste concreto traduce la pregunta sobre información adicional en restricciones para coeficientes o diferencias de pronóstico. Puede incluir una constante para recoger sesgo, examinar una pendiente incremental o utilizar información condicional conocida en el origen. La alternativa puede ser unilateral si la pregunta, definida de antemano, es si mejora A, o bilateral si interesa cualquier relación adicional. Cada decisión cambia qué evalúa el estadístico y cómo debe estimarse la incertidumbre.
Por ello, la pendiente de una regresión ilustrativa no es automáticamente el estadístico de encompassing utilizado en todos los estudios. Antes de mirar el p-valor, ajusta la prueba a la relación entre los modelos, el momento de estimación de parámetros, el diseño fuera de muestra y los supuestos sobre los errores. Si el resultado cambia con esas decisiones, informa de ello en vez de elegir después la formulación que produce el resultado deseado.
<!-- learn:illustration -->

Un ejemplo hipotético calcula una mezcla, no su significación
Supongamos que d, en puntos básicos, es [−4, −2, −1, 1, 2, 4], que los errores de A son [−1,6, −1,2, 1,5, 0,5, 1,3, 1,5] y que n = 6. La media de d es cero y la media de e_A es 1/3 de punto básico. La suma de cuadrados de d es 42; la suma de d por los errores de A centrados en su media es 16,4.
Por tanto, en una regresión OLS ordinaria con constante, la pendiente es w = 16,4/42 ≈ 0,3905 y la constante es 1/3 de punto básico. La mezcla muestral queda f_C = f_A + 0,3905(f_B−f_A). El cálculo ilustra un peso lineal ajustado en la muestra. No contrasta si la pendiente difiere estadísticamente de cero ni si la combinación mejorará pronósticos futuros.
Seis observaciones no permiten obtener un valor p ni concluir que una predicción engloba o supera a la otra. Hace falta un diseño muestral adecuado y una estimación de incertidumbre coherente con la dependencia de los errores y la forma en que se generaron las predicciones. Además, estimar el peso y evaluarlo en las mismas seis observaciones es una evaluación dentro de muestra.
La hipótesis y la inferencia dependen de cómo se formule la prueba
En el sentido simplificado de este artículo, la nula «A engloba a B» afirma que B no aporta una señal relevante una vez tenido en cuenta A, o que un coeficiente de mejora especificado es cero. No existe una ecuación universal de prueba. Hay que saber si se permite sesgo, qué información condicional se incluye, si la alternativa unilateral apunta a mejorar A y cómo se tratan los parámetros estimados.
Harvey, Leybourne y Newbold (1998) estudian pruebas de encompassing y observan que el contraste de mínimos cuadrados no es robusto ante errores no normales, además de analizar alternativas: Tests for Forecast Encompassing {source:harveyLeybourneNewbold1998ForecastEncompassing}. Por ello, no basta con leer el coeficiente OLS y el valor p predeterminado de un programa sin revisar las hipótesis y la distribución de referencia.
Un p-valor superior a 0,05 no demuestra equivalencia ni que B no sirva. Puede reflejar una muestra corta, un error estándar grande o poca potencia. La conclusión apropiada es que, con este diseño y sus supuestos, los datos no aportaron evidencia suficiente contra la hipótesis especificada al umbral elegido; nada más.
El encompassing no responde a cuatro preguntas cercanas
Diebold–Mariano compara las pérdidas medias de dos pronósticos en los mismos orígenes. Encompassing pregunta si un pronóstico rival contiene información adicional respecto de una referencia. Por eso una predicción puede tener un RMSE menor sin que B añada información lineal útil a A, y también puede ocurrir lo contrario. Consulta la prueba Diebold–Mariano de precisión predictiva.
Clark–West ajusta la comparación de precisión fuera de muestra de modelos lineales anidados, en los que el ruido de estimación de parámetros adicionales complica la distribución del contraste. Clark y McCracken (2001) analizan la distribución de pruebas de igual precisión y encompassing para pronósticos a un paso de modelos lineales anidados en Tests of Equal Forecast Accuracy and Encompassing for Nested Models00071-9) {source:clarkMcCrackenNestedForecasts2001}. No es un sustituto automático para cada contraste de encompassing. El test de Clark–West para ajustar la precisión de modelos anidados explica ese ajuste de precisión.
La combinación de pronósticos estima o elige pesos para un objetivo, a menudo minimizando una pérdida de entrenamiento o fuera de muestra. Es un procedimiento para construir predicciones, no por sí mismo una prueba de la hipótesis de encompassing; consulta pesos iguales o estimados en una combinación de pronósticos. Mincer–Zarnowitz suele examinar la calibración de nivel y pendiente frente a valores realizados, no la misma pregunta sobre información adicional de un pronóstico rival; consulta la prueba de calibración Mincer–Zarnowitz.
La estimación de parámetros cambia la incertidumbre fuera de muestra
Si los pronósticos se generan mediante regresiones estimadas, esa estimación puede afectar la distribución del contraste. West (2001) estudia pruebas de encompassing cuando las predicciones dependen de parámetros de regresión estimados y explica por qué el proceso de generación debe entrar en la inferencia: Tests for Forecast Encompassing When Forecasts Depend on Estimated Regression Parameters {source:west2001EstimatedForecastsEncompassing}. Llamar a un resultado «fuera de muestra» no basta si el contraste ignora que se reestimaron parámetros o cambió la ventana de entrenamiento.
Antes de analizar, determina si los modelos son anidados, si la estimación es fija o móvil, si los horizontes de prueba se solapan y cómo se relacionan los errores. Elige una inferencia apropiada al diseño e informa de la sensibilidad a opciones razonables. Si se probaron muchos modelos, objetivos o ventanas y solo se publica el resultado favorito, un único valor p no refleja la búsqueda previa.
Si los momentos de la regresión presentan heterocedasticidad o dependencia serial, una opción para estimar la covarianza es un estimador HAC de Newey–West, consistente ante heterocedasticidad y autocorrelación. Newey y West (1987) describen este estimador {source:neweyWest1987}. El kernel y el ancho de banda deben ajustarse al diseño de pronóstico; HAC es un posible componente de la estimación de incertidumbre, no una prueba de encompassing por sí sola.
Una señal incremental no es una orden de trading
Aunque B aporte información predictiva fiable, eso no demuestra una rentabilidad neta positiva. Hay que definir cómo convertir la predicción en una posición, el momento de operar, las comisiones, la financiación, el deslizamiento, la liquidez y los límites de riesgo. Una señal pequeña puede desaparecer por los costes de ejecución. También puede servir para cobertura o control de riesgos sin elevar la rentabilidad media.
Al informar resultados, especifica objetivo, horizonte, orígenes, muestra común, signos de e y d, formulación de la prueba, nula y alternativa, tratamiento de constante o sesgo, método de estimación, restricciones de pesos e inferencia. Muestra el peso con error estándar o intervalo de confianza cuando el diseño lo permita, y separa claramente el ajuste dentro de muestra del rendimiento fuera de muestra. Encompassing no garantiza una predicción ni una operación rentable.
Referencias
- Chong y Hendry, “Econometric Evaluation of Linear Macro-Economic Models” (1986), DOI
- Harvey, Leybourne y Newbold, “Tests for Forecast Encompassing” (1998), DOI
- Clark y McCracken, “Tests of Equal Forecast Accuracy and Encompassing for Nested Models” (2001), DOI00071-9)
- West, “Tests for Forecast Encompassing When Forecasts Depend on Estimated Regression Parameters” (2001), DOI
- Newey y West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987) DOI
Preguntas frecuentes
Q1¿Que A englobe a B significa que B es un mal modelo?
No. Significa que el contraste especificado no encontró información incremental relevante en B respecto de A para el objetivo, horizonte, muestra e hipótesis elegidos. B puede ser útil para otro objetivo o uso condicional.
Q2¿Una prueba de encompassing es igual que una prueba de precisión predictiva?
No. La precisión compara pérdidas; el encompassing pregunta si una predicción rival aporta señal adicional frente a una referencia. Los resultados pueden coincidir o diferir.
Q3¿Debo restringir el peso entre cero y uno?
No necesariamente. Un estimador sin restricciones puede quedar fuera de [0,1], mientras que algunos métodos imponen límites. Indica el método y la restricción, y vuelve a estimar con ella en vez de recortar el resultado después.
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
En f_C = f_A + w(f_B−f_A), ¿qué describe directamente w?
Elige una respuesta para ver la explicación