Conjunto de confianza de modelos (MCS): comparar pronósticos sin imponer un ganador
Descubre cómo el Model Confidence Set usa pruebas secuenciales y un bootstrap que respeta la dependencia temporal para conservar modelos de pronóstico que los datos no permiten distinguir.
En esta guía¿A qué pregunta responde el Model Confidence Set?
Resumen breve
El Model Confidence Set (MCS) compara una familia definida de procedimientos de pronóstico y conserva los candidatos cuya inferioridad no puede demostrarse con una función de pérdida elegida. Si la muestra no permite distinguirlos, pueden quedar varios modelos; el resultado depende de la familia, el diseño del pronóstico, la pérdida y el método de inferencia.
¿A qué pregunta responde el Model Confidence Set?
Supón que tienes varios procedimientos para pronosticar la volatilidad del día siguiente. Sus errores difieren, pero la muestra puede ser demasiado corta o ruidosa para saber cuál tiene la menor pérdida esperada. Elegir sin más el procedimiento con menor pérdida promedio obliga a declarar un ganador incluso cuando la diferencia podría deberse a la variación muestral. El MCS ofrece una respuesta en forma de conjunto: ¿qué candidatos no pueden clasificarse como inferiores según los datos y un criterio de desempeño especificado?
El MCS parte de un conjunto de candidatos \(\mathcal M_0\), una pérdida u otro criterio y un nivel de confianza. Prueba de manera secuencial si los candidatos que aún se comparan tienen igual capacidad predictiva. Si se rechaza la hipótesis, una regla de eliminación descarta un candidato relativamente débil y se repite la prueba con el conjunto reducido. Los candidatos que quedan forman el MCS. Hansen, Lunde y Nason proponen el procedimiento como un conjunto de confianza para el mejor modelo o los mejores modelos de la colección especificada, de forma parecida a un intervalo de confianza que conserva varios valores cuando los datos son imprecisos (artículo de 2011).
“Mejor” solo tiene sentido dentro de esta comparación. Depende de los candidatos incluidos, el objetivo, el horizonte, la información disponible en cada origen del pronóstico y el criterio usado. El MCS no supone que alguno de los candidatos sea el verdadero proceso generador de los datos, y puede conservar varios candidatos con la misma pérdida esperada mínima. No asigna una probabilidad bayesiana de que un modelo conservado sea correcto.
Define de antemano la familia de candidatos y la pregunta
Especifica \(\mathcal M_0\) antes de calcular las pérdidas. Un candidato puede ser un modelo estimado junto con sus reglas de estimación y actualización de pronósticos, o un procedimiento que no corresponda a un modelo estadístico. Por ejemplo, “GARCH” no define por completo un candidato si cambian la distribución de los errores, el tamaño de la ventana móvil, la actualización de parámetros o el horizonte. Cada combinación puede ser un procedimiento distinto.
Todos los candidatos deben pronosticar el mismo objetivo en los mismos orígenes y con la información que habría estado disponible entonces. No siempre es justo comparar la pérdida de un pronóstico de varianza condicional a un día con la de una previsión de volatilidad a cinco días, porque el objetivo o las unidades pueden diferir. Usa una muestra común, explica cómo alineas las observaciones faltantes y registra la versión de los datos, la ventana inicial de estimación, el esquema recursivo o móvil y el tratamiento de datos revisados. Si se solapan los horizontes de varios pasos, las pérdidas de orígenes distintos pueden compartir periodos realizados.
Elige el criterio antes de revisar los resultados. El error cuadrático, el error absoluto o una pérdida específica de una decisión pueden producir rankings distintos para pronósticos puntuales. Un pronóstico de varianza puede requerir una pérdida adaptada a una proxy de volatilidad ruidosa; un pronóstico de cuantiles necesita una puntuación cuantílica. Un buen MCS bajo una pérdida no tiene por qué serlo bajo otra. Si reduces la lista después de mirar los mismos resultados de evaluación, el conjunto formal queda condicionado a ese filtro no declarado y deja de reflejar toda la búsqueda.
Convierte los pronósticos comunes en contrastes de pérdidas pareados
Sea \(y_{t+h}\) el resultado observado para un pronóstico emitido en el origen \(t\), y \(\hat y_{i,t+h|t}\) el pronóstico del candidato \(i\). Con una función de pérdida \(L\) elegida de antemano, calcula la pérdida de cada candidato en cada origen común:
\[ L_{i,t}=L(y_{t+h},\hat y_{i,t+h|t}) \]
Supón que una pérdida menor es mejor. El contraste pareado entre los candidatos \(i\) y \(j\) es:
\[ d_{ij,t}=L_{i,t}-L_{j,t}, \qquad \bar d_{ij}=\frac{1}{P}\sum_{t=1}^{P}d_{ij,t} \]
Aquí \(P\) es el número de orígenes comunes. Con esta convención, \(\bar d_{ij}>0\) significa que la pérdida promedio de \(i\) fue mayor que la de \(j\) en la muestra; \(\bar d_{ij}<0\) favorece a \(i\). El emparejamiento importa porque ambos candidatos se enfrentan a los mismos resultados observados. Un shock de mercado común puede elevar las pérdidas de ambos, mientras el contraste aísla su desempeño relativo en las mismas fechas.
La hipótesis nula de igual capacidad predictiva para el conjunto actual \(\mathcal M\) se puede escribir así:
\[ H_{0,\mathcal M}:\quad \mu_{ij}=E[d_{ij,t}]=0 \quad \text{for every } i,j\in\mathcal M \]
Es una hipótesis conjunta sobre el conjunto actual, no una colección de pruebas por pares independientes de la que se eligen los resultados convenientes. El marco MCS combina una prueba de equivalencia para el conjunto con una regla para eliminar candidatos. La hipótesis no afirma que los pronósticos sean idénticos en cada fecha.
Prueba el conjunto actual y define la regla de eliminación
El MCS alterna entre una prueba del conjunto y una eliminación. Empieza con \(\mathcal M=\mathcal M_0\) y prueba la igual capacidad predictiva al nivel elegido \(\alpha\). Si no se rechaza, el procedimiento se detiene y reporta el conjunto actual. Si se rechaza, una regla de eliminación definida de antemano quita un candidato, y la prueba se repite con el conjunto reducido. Bajo los supuestos del procedimiento, los supervivientes forman el MCS de nivel \((1-\alpha)\).
El artículo desarrolla dos estadísticos conocidos. El estadístico de rango busca el mayor contraste pareado de pérdida estandarizado:
\[ T_{R,\mathcal M}=\max_{i,j\in\mathcal M}|t_{ij}|, \qquad t_{ij}=\frac{\bar d_{ij}}{\widehat{\mathrm{se}}(\bar d_{ij})} \]
La regla de eliminación que le corresponde quita al candidato con la mayor desventaja estandarizada frente a otro. El segundo estadístico compara cada candidato con el desempeño promedio del conjunto actual:
\[ T_{\max,\mathcal M}=\max_{i\in\mathcal M}t_{i\cdot}, \qquad d_{i\cdot,t}=\frac{1}{|\mathcal M|}\sum_{j\in\mathcal M}d_{ij,t} \]
Aquí \(t_{i\cdot}\) estandariza el promedio de \(d_{i\cdot,t}\) por su error estándar, y la regla asociada elimina al candidato con la mayor pérdida excedente estandarizada frente al promedio del conjunto. El estadístico y la regla de eliminación forman un par. Elígelos y repórtalos en conjunto; no los mezcles después de ver cuál produce un conjunto menor. El artículo de MCS explica por qué la prueba y la regla que identifica al candidato eliminado deben ser coherentes (Hansen, Lunde y Nason).
Conserva la dependencia temporal en el bootstrap
La distribución del estadístico máximo depende de la variación conjunta de los contrastes de pérdida entre candidatos. Tratar cada modelo o fecha como una observación independiente puede romper dos formas de dependencia: las pérdidas de fechas consecutivas pueden estar relacionadas y las pérdidas de varios candidatos en una misma fecha están emparejadas. Por eso, el bootstrap del MCS debe conservar la estructura conjunta de la serie temporal al aproximar la distribución nula del estadístico del conjunto.
Una opción es volver a muestrear bloques temporales alineados del vector de pérdidas o contrastes de todos los candidatos. En el bootstrap estacionario, los bloques tienen longitudes aleatorias y el siguiente puede comenzar en una fecha escogida al azar. Politis y Romano introdujeron el método para observaciones estacionarias con dependencia débil (artículo de 1994). El apéndice de implementación de MCS describe el bootstrap por bloques y menciona el estacionario como alternativa. Remuestrear por separado la serie de pérdidas de cada modelo destruye el emparejamiento por fecha y puede cambiar la comparación.
La longitud promedio de los bloques, la variante de bootstrap, el centrado bajo la hipótesis nula, el número de réplicas y el horizonte afectan la estimación de incertidumbre. Los pronósticos solapados a varios pasos pueden prolongar la dependencia de las diferencias, pero no existe una longitud de bloque universal. Explica el diseño y comprueba si la conclusión cambia con opciones de dependencia razonables. El bootstrap aproxima la inferencia bajo ciertos supuestos; no corrige el uso de información futura, la inspección repetida de la muestra de prueba, la evolución no estacionaria de las puntuaciones ni una familia de candidatos incompleta.
Sigue un ejemplo hipotético con cuatro modelos
Supón que cuatro procedimientos A, B, C y D pronostican el mismo objetivo de volatilidad en 120 orígenes diarios comunes. Sus pérdidas cuadráticas promedio son 1.20, 1.23, 1.45 y 1.90, en unidades ilustrativas de puntos porcentuales al cuadrado. Estos promedios ordenan a A primero y D último, pero el ranking no indica si las diferencias superan la incertidumbre muestral.
La diferencia media pareada de pérdidas entre A y B es \(1.20-1.23=-0.03\). Si el error estándar que tiene en cuenta la dependencia es \(0.04\), el estadístico de ese par es \(-0.03/0.04=-0.75\). Ese contraste único no demuestra una diferencia estadística clara entre A y B. El MCS no se detiene ahí: su estadístico de conjunto usa los contrastes conjuntos entre los cuatro candidatos.
Para ilustrar la secuencia, supón que una ejecución hipotética del MCS por bloques usa \(T_R\), \(\alpha=0.05\) y una regla coherente que elimina al peor candidato en la serie completa de 120 orígenes. Imaginemos que el valor p del conjunto completo es 0.018 y se elimina D; para \(\{A,B,C\}\), el siguiente valor p es 0.11. Como 0.11 supera 0.05, el procedimiento se detiene y el MCS ilustrativo del 95% es \(\{A,B,C\}\). C permanece aunque su pérdida promedio sea mayor que la de A: la prueba conjunta hipotética no ha demostrado que C sea inferior.
Estos valores p son inventados para explicar los pasos; no se pueden reconstruir a partir de los cuatro promedios ni del contraste A–B. Un resultado real requiere la serie completa de pérdidas por origen, los pronósticos de los candidatos, el diseño del bootstrap y la secuencia de eliminación. Conserva esos datos y reporta qué candidato salió en cada paso. <!-- learn:illustration -->

Interpreta el conjunto superviviente sin exagerar
Bajo las condiciones de regularidad y los supuestos de prueba, el MCS al 95% está construido para incluir al mejor candidato del conjunto especificado con al menos la cobertura asintótica indicada. Esto no significa que cada modelo conservado tenga un 95% de probabilidad de ser el mejor. La afirmación de confianza se refiere a la cobertura en muestras repetidas; no es una distribución bayesiana sobre los nombres de los modelos.
No rechazar la igualdad de capacidad predictiva no demuestra que las pérdidas esperadas sean exactamente iguales. La prueba puede tener poca potencia con un periodo de evaluación breve, contrastes muy volátiles o varios candidatos casi empatados. Un conjunto grande puede indicar que los datos no permiten distinguir las alternativas. También puede contener modelos que sean malos en términos absolutos, porque el MCS los compara entre sí y no exige un umbral externo.
El conjunto también está limitado por los candidatos incluidos inicialmente en \(\mathcal M_0\). Si se omite un procedimiento realmente mejor, el MCS no puede encontrarlo. Si se elimina un modelo después de inspeccionar el mismo periodo de evaluación, la cobertura nominal no toma en cuenta ese filtrado no reportado. Explica cómo se formó y filtró la familia. Si varios candidatos comparten la menor pérdida esperada, conservar más de uno es compatible con el método, no un fallo de selección.
Distingue el MCS de las pruebas por pares y contra un benchmark
La prueba de Diebold–Mariano se centra en la diferencia pareada de pérdidas entre dos procedimientos para los mismos resultados. El MCS prueba secuencialmente un conjunto e informa qué candidatos sobreviven a su procedimiento conjunto de eliminación. Ejecutar varias pruebas DM y conservar los pares no significativos no equivale automáticamente a MCS; importan el bootstrap conjunto y la coherencia de la regla de eliminación.
La prueba de Clark–West trata una comparación más específica de errores cuadráticos cuando un modelo de pronóstico anida a un benchmark restringido y la estimación afecta la diferencia bruta. El MCS no exige anidamiento y puede usar una pérdida elegida por el usuario, pero sigue necesitando un diseño de pronóstico común.
Reality Check de White y el test SPA de Hansen preguntan si al menos un miembro de una familia buscada supera un benchmark designado. El MCS no requiere benchmark y describe un conjunto de candidatos relativamente superiores en vez de contrastar un benchmark único. Todos requieren documentar la búsqueda y tratar la dependencia, pero sus hipótesis nulas son distintas. Consulta la guía de Reality Check y SPA y los artículos originales de White (2000) y Hansen (2005).
Reporta el diseño y separa el ranking del valor para operar
Un informe reproducible del MCS identifica cada procedimiento, el objetivo y horizonte comunes, las reglas de información, el calendario de estimación, las fechas de evaluación, el tratamiento de faltantes, la fórmula de pérdida y el sentido en que una pérdida es mejor. También indica el nivel de significación, el estadístico y la regla de eliminación, el tipo de bootstrap, la longitud del bloque, el centrado, el número de réplicas, los valores p de cada paso y los miembros finales. Presenta pérdidas promedio y diferencias como contexto, pero no sustituyas la inferencia conjunta por una tabla de rankings.
Para evaluar volatilidad, especifica cómo se construyó la proxy observada y si tiene ruido o revisiones. Para pronósticos de varios pasos, informa si se solapan los periodos objetivo y cómo trataste la dependencia. Muestra la sensibilidad a cambios razonables de pérdida, periodo de muestra y bootstrap cuando esas decisiones afecten la composición del conjunto. Un valor p muy pequeño sin los candidatos eliminados y la secuencia no basta para reproducir el resultado.
Un MCS compara procedimientos según un criterio. No establece causalidad, no identifica el modelo generador de los datos ni prueba que el pronóstico superviviente produzca una operación rentable. Convertir el pronóstico en una posición requiere umbrales, tamaño, rotación, momento de ejecución, spread, comisiones, deslizamiento, financiación, préstamo de activos y límites de riesgo. Evalúa ese proceso de decisión congelado por separado con datos posteriores adecuados e informa los resultados netos de trading aparte. Para puntuar volatilidad con proxies ruidosas, consulta la guía de QLIKE frente al error cuadrático.
Preguntas frecuentes
Q1¿El MCS elige un único mejor modelo?
No necesariamente. Puede quedar un solo candidato si los datos lo distinguen, o varios si no se demuestra que alguno sea inferior. Elegir uno de los supervivientes para implementarlo requiere una regla de decisión aparte.
Q2¿Un modelo incluido en el MCS tiene un 95% de probabilidad de ser correcto?
No. El nivel de confianza describe la cobertura en muestras repetidas del mejor candidato de la familia especificada bajo los supuestos del método. No es una probabilidad posterior de que el modelo sea verdadero.
Q3¿Puedo usar el MCS con pronósticos distintos a la volatilidad?
Sí. Puede comparar pronósticos, modelos econométricos u otros procedimientos si se definen un criterio común adecuado y un diseño de muestreo compatible. El resultado siempre depende de la familia y la pérdida elegidas.
Q4¿El MCS tiene en cuenta automáticamente todos los modelos que probé?
Solo si la búsqueda real está representada en la familia de candidatos y en la evaluación. Un filtrado no declarado o el uso repetido de los datos de evaluación no se corrigen por ejecutar el MCS después.
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
¿Qué informa el Model Confidence Set?
Elige una respuesta para ver la explicación
Glosario de opciones
Definiciones claras de términos esenciales, desde calls, puts y cadenas de opciones hasta IV, griegas, interés abierto y max pain
Ver el glosario de opciones