Backtesting de VaR: pruebas de Kupiec y Christoffersen explicadas
Aprende cómo las pruebas POF de Kupiec y de cobertura condicional de Christoffersen evalúan las excepciones de VaR, cómo leer un ejemplo de 250 días y por qué no rechazar no demuestra precisión.
En esta guía¿Qué comprueba un backtest de VaR?
Resumen breve
Un backtest de VaR compara cada umbral de pérdida pronosticado con la pérdida que se produjo después. La prueba de Kupiec pregunta si el número de excepciones es coherente con la tasa objetivo. Las pruebas de Christoffersen también preguntan si las excepciones llegan de forma independiente o se agrupan. Evalúan aspectos distintos del pronóstico; ninguna demuestra que el modelo de riesgo sea correcto.
¿Qué comprueba un backtest de VaR?
El valor en riesgo (VaR) es un umbral de pérdida ligado a un nivel de confianza y un horizonte determinados. Si el VaR diario al 99% es de 10.000 $, el modelo asigna una probabilidad del 1% a que la pérdida diaria supere esa cantidad, según la información y los supuestos declarados. El VaR no limita la pérdida a 10.000 $ ni indica cuánto podría perderse una vez superado el umbral.
El backtesting convierte una secuencia de pronósticos y resultados en una secuencia de excepciones. Si un modelo de VaR diario al 99% está bien calibrado, las excepciones deberían aparecer alrededor del 1% de las veces a largo plazo en observaciones comparables. Hay dos aspectos: la frecuencia total debería acercarse al objetivo y las excepciones no deberían seguir un patrón incompatible con los pronósticos condicionales de riesgo del modelo. La prueba de proporción de fallos (POF) de Kupiec se centra en el primero. Las pruebas de independencia y de cobertura condicional de Christoffersen incorporan el orden de las excepciones.
La distinción importa en la práctica. Un modelo puede registrar cuatro excepciones en un año y concentrarlas todas en una semana turbulenta. Otro puede tener las mismas cuatro repartidas durante el año. Una prueba que solo cuenta ve cuatro en ambos casos; una prueba temporal ve dos secuencias diferentes. Estas pruebas ayudan a describir esas características, pero no sustituyen la revisión de las posiciones, los datos de mercado, los supuestos ni la magnitud de las pérdidas.
La guía sobre GARCH y agrupación de la volatilidad explica cómo modelar la persistencia de la varianza; un modelo de varianza y un backtest responden preguntas distintas.
Define la excepción antes de contarla
Usa una sola convención de signos en todo el análisis. Sea Lₜ la pérdida realizada en el día t y VaRₜ|ₜ₋₁ el umbral de pérdida diario pronosticado con la información disponible antes del día t. Define el indicador de excepción Iₜ como 1 si Lₜ > VaRₜ|ₜ₋₁ y como 0 en caso contrario. Para un modelo de VaR al 99%, la probabilidad objetivo de excepción es α = 1 − 0,99 = 0,01. Algunas fuentes definen el indicador con rendimientos o describen un intervalo cubierto; son convenciones equivalentes tras traducir el signo y la probabilidad. Indica cuál utilizas.
El pronóstico y el resultado deben corresponder al mismo portafolio, horizonte, momento de valoración y definición de pérdida. Si el pronóstico se hace después del cierre para el siguiente día de negociación, compáralo con la pérdida de ese día usando una regla de valoración coherente. Decide de antemano cómo tratar la igualdad con el umbral de VaR, los festivos, las observaciones faltantes, los cierres del mercado, las correcciones intradía y los cambios en el portafolio. Estas decisiones pueden alterar la secuencia de excepciones, sobre todo cuando los excesos son raros.
Mantén separado el ajuste del modelo de su evaluación final. Si eliges parámetros o límites de riesgo después de revisar el mismo periodo que vas a probar, el valor p deja de describir una comprobación limpia fuera de muestra. En pronósticos móviles, registra cuándo se produjo cada pronóstico y qué información estaba disponible entonces. Los pronósticos superpuestos de varios días pueden generar dependencia entre excepciones, aunque las de un día fueran independientes. Las pruebas estándar siguientes no corrigen por sí solas horizontes incompatibles, información futura, datos revisados ni el proceso de selección del modelo.
¿Qué pregunta plantea la prueba POF de Kupiec?
Supón que hay T pares comparables de pronóstico y resultado, y x excepciones. La tasa observada es p̂ = x/T. La prueba de proporción de fallos de Kupiec compara dos verosimilitudes binomiales: una fija la probabilidad de excepción en la tasa objetivo α y la otra la estima libremente como p̂. El estadístico de razón de verosimilitudes es:
LRᵤ꜀ = −2 ln [ (1−α)^(T−x) α^x / ((1−p̂)^(T−x) p̂^x) ]
Bajo la hipótesis nula, las excepciones son sucesos Bernoulli independientes con probabilidad α. En una muestra suficientemente grande, el estadístico se aproxima a una distribución chi-cuadrado con un grado de libertad. Un valor grande rechaza la frecuencia de excepción especificada. Como la alternativa estima libremente la tasa observada, se puede rechazar si hay demasiadas o demasiado pocas excepciones. Que un modelo casi nunca supere su VaR no significa que esté bien calibrado: puede ser tan conservador que sus pronósticos no resulten útiles para el objetivo previsto.
La prueba POF usa el recuento x, no las fechas en que ocurrieron las excepciones. Reordenar los mismos indicadores de hit no cambia su estadístico. Por eso, un resultado POF no revela si cuatro excepciones estuvieron dispersas o fueron consecutivas. La verosimilitud binomial también supone independencia de los indicadores para construir su distribución de referencia. Si la pregunta es si las excepciones se agrupan, añade una prueba de dependencia en vez de inferirlo a partir del resultado POF.
La formulación original aparece en el artículo de Kupiec de 1995, disponible también en el archivo de la Reserva Federal.
El ejemplo de 250 días necesita contexto
Considera una secuencia hipotética de 250 pronósticos diarios de VaR al 99%. La tasa objetivo es α = 0,01, por lo que bajo la hipótesis nula se esperan Tα = 250 × 0,01 = 2,5 excepciones. Supón que aparecen cuatro. La tasa observada es p̂ = 4/250 = 0,016, o 1,6%. Está por encima del objetivo del 1%, pero la diferencia por sí sola no determina si la prueba de razón de verosimilitudes rechaza.
Al sustituir T = 250, x = 4 y α = 0,01 se obtiene LRᵤ꜀ ≈ 0,769. Con la referencia asintótica chi-cuadrado(1), p ≈ 0,38; el valor crítico al 5% es aproximadamente 3,84. Según esta aproximación, el ejemplo no rechaza la cobertura incondicional al nivel del 5%. Los cálculos son hipotéticos y sirven para explicar el método; no son un resultado empírico ni un umbral general de aceptación.
Las dos log-verosimilitudes muestran de dónde sale el estadístico. Con la tasa objetivo fija, ℓ₀ = 246 ln(0,99) + 4 ln(0,01) ≈ −20,893. Con la tasa observada sin restringir, ℓ₁ = 246 ln(0,984) + 4 ln(0,016) ≈ −20,508. El ajuste sin restricción mejora alrededor de 0,385 unidades de log-verosimilitud; por tanto, LRᵤ꜀ = −2(ℓ₀ − ℓ₁) ≈ 0,769. La prueba mide la pérdida de ajuste frente al modelo de tasa objetivo, no una distancia en dólares.
No rechazar no demuestra que el modelo esté bien calibrado. Solo se esperaban 2,5 excepciones en 250 días, así que una o dos observaciones adicionales cambian notablemente la tasa observada. La referencia chi-cuadrado es asintótica y las pruebas de sucesos raros pueden tener poca potencia con una muestra de este tamaño. Lee el estadístico junto con el número esperado, el horizonte, el diseño de la prueba y el tamaño de la muestra. Un valor p no es la probabilidad de que el modelo VaR sea verdadero.
El mismo número de excepciones puede ocultar tiempos distintos
Compara ahora dos secuencias hipotéticas de 250 días, cada una con cuatro excepciones. En la secuencia A aparecen en los días 20, 80, 140 y 220. En la B, en los días 60 y 61, y 180 y 181. Ambas tienen x = 4 y p̂ = 1,6%, así que su estadístico de Kupiec es idéntico. Sin embargo, B contiene dos pares de excepciones en días consecutivos y A ninguno.
El esquema ilustra por qué conviene conservar la secuencia de hits, no solo su total. Es conceptual: no son datos de mercado de 250 días ni un resultado de prueba. Las excepciones consecutivas pueden motivar una revisión de si el modelo reacciona con retraso a los cambios de volatilidad, pero unos pocos puntos no bastan para diagnosticar la causa. El patrón también puede deberse a una especificación incorrecta, un choque de mercado, cambios en el portafolio, horizontes superpuestos o convenciones de datos y tiempos.
Para contar transiciones, define nᵢⱼ como el número de veces que el indicador anterior vale i y el actual j; 0 significa sin excepción y 1 significa excepción. Lejos de los límites de la muestra, A tiene n₀₁ = 4 y n₁₁ = 0; B tiene n₀₁ = 2 y n₁₁ = 2. Ambas tienen cuatro excepciones, pero en B algunas ocurren después de otra. Esa es la información que utiliza una prueba de independencia de primer orden.
Los recuentos completos de transiciones son n₀₀=241, n₀₁=4, n₁₀=4 y n₁₁=0 para A; para B son 243, 2, 2 y 2. La probabilidad estimada de un hit después de un día sin excepción es n₀₁/(n₀₀+n₀₁); después de un hit, n₁₁/(n₁₀+n₁₁). Para A son 4/245 ≈ 1,63% y 0/4. Para B son 2/245 ≈ 0,82% y 2/4 = 50%. Ese 50% se basa en solo cuatro transiciones desde un hit: describe esta diminuta secuencia hipotética, no una estimación creíble del riesgo real de un modelo para el día siguiente.

¿Qué añade la prueba de independencia de Christoffersen?
La prueba de independencia de Christoffersen compara la probabilidad de una excepción tras un día tranquilo con la de una excepción después de un hit. Define π₀ = Pr(Iₜ = 1 | Iₜ₋₁ = 0) y π₁ = Pr(Iₜ = 1 | Iₜ₋₁ = 1). Bajo la hipótesis nula de independencia, π₀ = π₁: el estado de hit del día anterior no cambia la probabilidad actual. Bajo la alternativa, se estiman por separado ambas probabilidades con n₀₀, n₀₁, n₁₀ y n₁₁.
El estadístico de razón de verosimilitudes compara esos dos modelos y suele evaluarse también con una distribución chi-cuadrado de un grado de libertad. A diferencia de la prueba POF, depende del orden de los indicadores. Si a menudo una excepción va seguida de otra, π₁ puede superar π₀. La prueba se refiere a la dependencia de primer orden en esta secuencia binaria; no examina todas las formas en que la información pasada, la volatilidad o el estado del portafolio podrían anticipar pérdidas futuras.
Con pocas excepciones, las estimaciones de transición pueden ser especialmente inestables. Una secuencia sin hits consecutivos puede producir una estimación límite de cero para π₁, pero no demuestra que un segundo hit sea imposible; solo indica que no apareció en esta muestra. Revisa los recuentos de transición y el tamaño de la muestra junto al estadístico. No interpretes una tabla dispersa como una estimación precisa del riesgo de cola del día siguiente.
El marco de evaluación de pronósticos de intervalos condicionales se desarrolla en el artículo de Christoffersen de 1998.
La cobertura condicional combina frecuencia e independencia
La prueba de cobertura condicional suma el estadístico de frecuencia de Kupiec y el de independencia de Christoffersen: LR꜀꜀ = LRᵤ꜀ + LRᵢₙd. La hipótesis nula conjunta es que la probabilidad de excepción es α y que las excepciones son independientes en el tiempo. En el planteamiento estándar de muestra grande, la suma se compara con una distribución chi-cuadrado de dos grados de libertad.
Conviene informar también los componentes, no solo el resultado conjunto. Rechazar la cobertura condicional significa que los dos requisitos conjuntos no son compatibles con la secuencia observada bajo los supuestos de la prueba, pero no identifica la causa. Si POF rechaza y la independencia no, el recuento puede ser la señal más clara. Si rechaza la independencia, revisa la agrupación temporal aunque el total parezca cercano al objetivo. Si no se rechaza ninguna, la muestra aún puede ser demasiado corta para revelar una especificación incorrecta.
La interpretación de la prueba es limitada. Reduce cada día a un resultado binario y no distingue entre superar VaR por 1 $ o por 1 millón $. Tampoco valida el resto de la distribución de pérdidas ni demuestra que Expected Shortfall sea correcto. Para ver qué preguntas distintas responden VaR y Expected Shortfall, consulta la guía sobre VaR frente a Expected Shortfall.
Las excepciones raras dificultan inferir con muestras cortas
Con VaR al 99%, una muestra de 250 días solo tiene 2,5 excepciones esperadas. Si los hits independientes tienen probabilidad del 1%, el número esperado de transiciones entre dos hits en 249 pares de días adyacentes es aproximadamente 249 × 0,01² = 0,025. La mayoría de estas muestras no tendrá excepciones consecutivas aunque el modelo esté bien calibrado. Esta escasez dificulta estimar con precisión las probabilidades de transición y puede dejar poca potencia para una prueba de dependencia.
Christoffersen y Pelletier muestran que los backtests VaR existentes pueden tener potencia relativamente baja en muestras pequeñas realistas y estudian pruebas basadas en la duración entre excepciones. Sus resultados motivan un diagnóstico adicional; no implican que las pruebas de duración sean siempre superiores ni eliminan la necesidad de ajustarlas al pronóstico de riesgo y al diseño de la muestra. Si hay pocas observaciones, dilo en vez de presentar un no rechazo como certificado de salud.
La tasa de cola objetivo también importa. Con VaR al 95%, la tasa nominal es 5% y se esperan 12,5 excepciones en 250 días; con VaR al 99,9%, solo 0,25. Que ambas utilicen la misma prueba no hace comparables las evidencias. Indica el nivel de confianza, horizonte, número de observaciones, recuentos objetivo y observado, transiciones y si usas una referencia asintótica o un método de muestra finita.
Christoffersen y Pelletier estudian pruebas basadas en la duración entre excepciones en su artículo de 2004.
¿Cuándo conviene usar otro diagnóstico?
Elige el siguiente diagnóstico preguntando qué información descartaron las dos pruebas. Si quieres comprobar si los hits se pueden predecir con hits rezagados, pronósticos de VaR u otras variables conocidas al hacer el pronóstico, la prueba de cuantiles dinámicos (DQ) de Engle y Manganelli evalúa restricciones sobre indicadores de excepción centrados y un conjunto elegido de instrumentos. El resultado depende de esos instrumentos y de cuándo están disponibles; no es una prueba de todo fallo condicional imaginable. Una prueba de duración examina el tiempo de espera entre excepciones y amplía el análisis en otro sentido.
Si preocupa el tamaño de la pérdida tras cruzar el umbral VaR, no bastan las pruebas de frecuencia e independencia. Revisa la magnitud de las excepciones y elige un método de evaluación de Expected Shortfall compatible con el pronóstico y los supuestos. Si preocupa seleccionar el mejor resultado después de probar muchos modelos, el backtesting de VaR no resuelve ese problema de selección; consulta PBO y CSCV para un diagnóstico distinto basado en rangos.
Un informe útil indica el portafolio y la convención de pérdida, el horizonte, nivel de confianza y fechas de evaluación, cómo se generaron los pronósticos, la definición de excepción, los recuentos esperado y observado, el estadístico POF, las transiciones y los resultados de independencia y cobertura condicional. Explica también las limitaciones por tamaño de muestra u horizontes superpuestos. Grafica en el tiempo los umbrales pronosticados y las pérdidas realizadas, y mantén cerrados los datos posteriores al evaluar el modelo. Así la evidencia se puede interpretar; superar una prueba histórica no garantiza el control futuro del riesgo.
Engle y Manganelli presentan la prueba de cuantiles dinámicos en su artículo CAViaR.
Preguntas frecuentes
Q1¿Que una prueba de Kupiec no rechace significa que mi modelo VaR es preciso?
No. Significa que, bajo los supuestos de la prueba, no se encontró evidencia suficiente contra la tasa de excepción especificada. Una muestra corta, especialmente con un nivel de confianza del 99% o superior, puede tener muy pocas excepciones para revelar un problema.
Q2¿Dos modelos pueden obtener el mismo resultado de Kupiec y tener patrones de excepciones distintos?
Sí. El estadístico de Kupiec depende del recuento, no del orden. La prueba de independencia de Christoffersen añade información sobre si las excepciones se agrupan en observaciones adyacentes.
Q3¿Estas pruebas indican qué tan grande puede ser una pérdida tras superar VaR?
No. Usan un indicador de excepción y no miden su magnitud. Si importan las pérdidas por encima del umbral VaR, revisa las pérdidas de cola y evalúa Expected Shortfall por separado.
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
¿Qué característica utiliza la prueba POF de Kupiec?
Elige una respuesta para ver la explicación
Glosario de opciones
Pérdida media desde el cuantil VaR elegido hasta la peor cola bajo una convención precisa; mide la gravedad más allá del umbral y no solo su ubicación
Leer la guía detalladaGARCHModelo temporal que actualiza la varianza condicional con choques pasados al cuadrado y la varianza previa; modela persistencia de volatilidad, no dirección
Leer la guía detalladaAsignaciónProceso por el que el vendedor debe cumplir la obligación del contrato tras recibir un aviso de ejercicio; puede crear o eliminar una posición en el subyacente
Leer la guía detallada