Puntuación conjunta de VaR y ES: el enfoque de Fissler–Ziegel
Descubre por qué el Valor en Riesgo y el Déficit Esperado requieren una regla de puntuación conjunta, cómo comparar pronósticos con Fissler–Ziegel y en qué difiere de los tests de excepciones VaR.
En esta guíaEmpieza por el par de pronósticos y la convención de cola
Resumen breve
El VaR es un cuantil y puede puntuarse por separado con una pérdida cuantílica. El Déficit Esperado (ES) es distinto: en amplias clases de distribuciones no es elicitable como pronóstico puntual independiente. Fissler y Ziegel muestran que VaR y ES pueden evaluarse juntos mediante una puntuación estrictamente consistente bajo ciertas condiciones. Esto permite comparar pares de pronósticos, pero una puntuación baja no demuestra que un modelo sea correcto.
Empieza por el par de pronósticos y la convención de cola
Sea L_t una pérdida, de modo que los valores más altos sean peores, y c un nivel de confianza, por ejemplo 97,5 %. El cuantil de pérdida condicional v(c,t) es el menor x para el que F(L_t ≤ x | información hasta t−1) alcanza c. Para la cola superior de pérdidas, el ES es e(c,t) = 1/(1−c) multiplicado por la integral de v(u,t) desde c hasta 1, siempre que la media de cola sea finita. En una distribución continua coincide con la pérdida media por encima del umbral VaR. Si hay masa puntual en el umbral, la definición mediante la integral de cuantiles incorpora solo la fracción necesaria de esa masa.
La puntuación debe respetar la convención usada en los pronósticos. Algunos artículos definen VaR y ES para rendimientos en la cola inferior, a menudo con valores negativos, y llaman α = 1−c a la probabilidad de cola. Con pérdidas positivas se usa la cola superior y el ES es al menos tan grande como el VaR. Mezclar ambas convenciones puede invertir desigualdades e indicadores de excepción. Deja claro el signo, el nivel de confianza, el horizonte y la información disponible antes del resultado.
Por qué VaR y ES no tienen la misma puntuación independiente
Un cuantil puede evaluarse con una puntuación pinball estrictamente consistente. Para una pérdida L y el cuantil c v, una versión es S_VaR(v,L) = (I{L ≤ v}−c)(v−L). Bajo las condiciones habituales para cuantiles, la puntuación esperada alcanza su mínimo en el cuantil objetivo. Por eso puede evaluarse VaR por separado con las observaciones posteriores.
Para ES no existe una puntuación estrictamente consistente equivalente que lo elicite por sí solo en las amplias clases de distribuciones de pérdidas usadas en gestión del riesgo. El alcance de la afirmación es concreto: se refiere a un pronóstico puntual independiente cuyo score esperado selecciona ES de forma única. No significa que ES carezca de sentido ni que sus pronósticos no se puedan comparar o someter a pruebas.
Fissler y Ziegel establecen la distinción clave: ES no es elicitable por sí solo en ese sentido, pero el par (VaR, ES) sí lo es conjuntamente bajo condiciones moderadas de regularidad y momentos. Su trabajo analiza las condiciones para puntuaciones estrictamente consistentes (Fissler y Ziegel, 2016). La elicitabilidad conjunta implica que una misma función usa ambas previsiones y el resultado observado. No basta con sumar dos pérdidas cualesquiera y llamarlas puntuación de ES.
Qué evalúa una puntuación de Fissler–Ziegel
Denota por S_c(v,e;L) una puntuación conjunta admisible al nivel c. La consistencia estricta significa que la puntuación esperada bajo la distribución objetivo se minimiza en el par correcto: (VaR_c, ES_c) = arg min sobre (v,e) de E[S_c(v,e;L)]. Con las condiciones pertinentes, el mínimo es único. La puntuación combina información sobre si se cruzó el umbral VaR con la pérdida realizada en la cola y el pronóstico ES. Para pérdidas positivas, el ES no debe quedar por debajo del VaR.
Fissler y Ziegel describen una clase de puntuaciones, no una fórmula única obligatoria. Patton, Ziegel y Chen aplican ese resultado a modelos dinámicos conjuntos de VaR y ES y a la comparación de pronósticos (Patton, Ziegel y Chen, 2019). Un miembro habitual, FZ0, se expresa para rendimientos de cola inferior: Y = −L, α = 1−c y pronósticos negativos e ≤ v < 0: S_FZ0(Y,v,e;α) = −I{Y ≤ v}(v−Y)/(αe) + v/e + ln(−e) − 1. La fórmula depende de esa convención de rendimientos y de esos signos. No se debe trasladar sin cambios a pérdidas positivas ni es necesariamente la mejor puntuación para todos los datos. Indica la regla elegida y comprueba sus supuestos.
Cómo leer medias y diferencias de puntuación
Para el modelo m calcula S_c(v_hat(m,t),e_hat(m,t);L_t) para cada par pronóstico–resultado y promedia las T observaciones. Con la misma puntuación admisible, fechas, objetivo y convenciones, una media menor indica mejor desempeño relativo a esa regla. Su valor no es una probabilidad, un VaR en dinero ni una previsión de pérdidas; la escala depende de la puntuación.
Para comparar A y B, forma d_t = S_A,t − S_B,t. Una media negativa favorece a A según la regla escogida. Al evaluar ambos pronósticos frente a la misma realización, la diferencia pareada resulta más informativa que dos medias redondeadas por separado. Aun así, puede ser ruidosa cuando hay pocas observaciones en la cola.
<!-- learn:illustration -->
Compara los mismos orígenes de pronóstico, cartera o variable objetivo, horizonte, nivel de confianza y versión de los datos. Los pronósticos deben registrarse antes de observar los resultados. Si los horizontes se solapan o las diferencias de puntuación tienen dependencia serial, la incertidumbre debe reflejarla. Informa de un error estándar o intervalo apropiado; una diferencia pequeña sin incertidumbre no constituye una victoria fiable.

Por qué no basta con sumar dos pérdidas independientes
Puede parecer natural añadir al pinball del VaR un error absoluto de la previsión ES frente a algún valor de referencia. Pero ese valor de referencia quizá no sea adecuado y el segundo término no tiene por qué minimizarse en el ES verdadero. Una suma con ponderaciones arbitrarias tampoco garantiza consistencia conjunta. La forma del score FZ se construye para evaluar juntos VaR y ES.
La clase Fissler–Ziegel contiene varias puntuaciones con escalas y énfasis distintos. Las medias de dos reglas diferentes no se comparan directamente. Patton, Ziegel y Chen analizan FZ0 con propiedades de escala bajo supuestos adicionales sobre los signos; eso no convierte FZ0 en una opción universalmente superior. Elige y documenta la regla antes de ordenar los modelos.
El par de pronósticos también debe ser coherente. Una cifra ES aparentemente razonable puede puntuar mal si contradice el VaR que la acompaña. A la inversa, una buena puntuación conjunta no prueba que toda la distribución condicional sea correcta. Se evalúa la función VaR–ES definida, con el score y diseño escogidos.
Las mismas excepciones VaR pueden ocultar pérdidas de cola distintas
El indicador de excepción VaR es binario: I_t = 1 si L_t supera el VaR pronosticado y 0 en caso contrario. Dos modelos pueden registrar las mismas fechas y el mismo número de excepciones, aunque el tamaño de las pérdidas que superan el umbral difiera mucho. Cuatro brechas no dicen si todas fueron pequeñas o una llegó muy lejos en la cola. Un simple recuento descarta precisamente la magnitud que el ES pretende describir.
La puntuación conjunta utiliza VaR y ES junto con la pérdida observada, por lo que el tamaño de las pérdidas de cola puede afectar al score más allá del número de excepciones. La función elegida determina cuánto contribuye cada observación. No declares un ganador por un único evento extremo: calcula la puntuación en toda la muestra común y examina la sensibilidad.
La comparación de pronósticos mediante scores no responde a la misma pregunta que la calibración VaR. La primera ordena pares según una regla fijada; un test de excepciones estudia frecuencia o patrones temporales de los cruces. Una clasificación por score no certifica la calibración completa del modelo.
Los tests de excepciones y los backtests de ES responden preguntas distintas
Los tests de Kupiec comparan el número de excepciones VaR con la tasa objetivo; extensiones de Christoffersen también estudian su dependencia o agrupamiento. Reducen cada resultado a acierto o no acierto, así que no miden cuánto superó la pérdida el umbral ni validan directamente el pronóstico ES. La guía sobre VaR y Déficit Esperado explica la información distinta que aportan ambas medidas.
Acerbi y Szekely proponen backtests no paramétricos de ES y señalan que la elicitabilidad es pertinente para seleccionar modelos, pero no es un requisito para contrastar una medida de riesgo (Acerbi y Szekely, 2014). Bayer y Dimitriadis desarrollan backtests de ES basados en regresiones y estructuras conjuntas de VaR–ES; sus variantes tienen supuestos y exigencias de covarianza propios (Bayer y Dimitriadis, 2022). Una clasificación de scores no sustituye un backtest específico; tampoco una no-rechazo demuestra que el par de pronósticos sea correcto.
Planifica la inferencia pareada y evita la selección posterior
La secuencia d_t de diferencias de puntuación es una serie temporal. Para pronósticos de un paso no solapados y con supuestos de dependencia adecuados puede considerarse un contraste pareado de la diferencia media. Con dependencia serial o horizontes solapados, la incertidumbre debe ajustarse, por ejemplo, con una varianza de largo plazo o remuestreo por bloques adecuados. Informa del procedimiento y de sus parámetros, no solo del valor p.
Fija la puntuación, nivel de cola, horizonte, período de evaluación y conjunto de modelos antes de mirar los resultados. Si se prueban muchas reglas, ventanas, carteras y variantes y solo se presenta la menor puntuación, aparece un problema de selección. Reserva si es posible un período posterior que no se haya usado para elegir el modelo y describe la búsqueda. Los errores estándar habituales no corrigen esa selección automáticamente.
Presenta las medias y su diferencia pareada con incertidumbre, la definición del score, los signos y convenciones, las fechas comunes fuera de muestra y el número de observaciones de cola. Si el ranking cambia con reglas o períodos razonables, muestra esa sensibilidad.
Límites y lista práctica de comprobación
Con niveles de confianza altos hay pocas observaciones de cola, por lo que el ranking puede ser inestable incluso en series largas. La heterocedasticidad condicional, los cambios de régimen, los rendimientos solapados, el error de estimación, los datos erróneos y los cambios de cartera también afectan las diferencias. La elicitabilidad conjunta no resuelve estos problemas; proporciona una clase de puntuaciones fundamentada bajo condiciones matemáticas.
Comprueba que la pérdida realizada corresponda a la misma cartera, horizonte, método de valoración y signo que la previsión; VaR y ES deben usar la misma cola. Verifica que los pronósticos fueran ex ante y que la puntuación cumpla las condiciones de distribución, momentos y signos que requiere. Informa de tamaño muestral, observaciones de cola, fórmula, procedimiento de incertidumbre y búsqueda de modelos o scores. La conclusión queda limitada a ese diseño.
Una puntuación conjunta menor es evidencia de mejor desempeño predictivo relativo según una regla concreta. No demuestra que el modelo capture todos los extremos, que sus estimaciones sean seguras ni que el futuro se parezca a la muestra. Este artículo explica métodos estadísticos y no es asesoramiento de inversión.
Preguntas frecuentes
Q1¿Puedo comparar pronósticos ES con error absoluto?
No como sustituto general de una puntuación estrictamente consistente. Para comparar pronósticos puntuales, ES suele evaluarse junto con VaR; para calibración puede usarse un backtest específico de ES.
Q2¿Una puntuación conjunta indica si el modelo está calibrado?
Compara el desempeño relativo bajo un score elegido. La calibración y la especificación del modelo son preguntas distintas y requieren diagnósticos y contrastes adecuados.
Q3¿Pueden dos modelos tener las mismas excepciones VaR y puntuaciones conjuntas distintas?
Sí. Pueden coincidir los indicadores y diferir el tamaño de las pérdidas que superan VaR o las previsiones ES. El efecto exacto depende del score.
Q4¿Una puntuación baja significa que el modelo es seguro?
No. El resultado depende de la muestra, la puntuación y los supuestos elegidos. Las pocas observaciones de cola, cambios de régimen, selección de modelos o errores de datos pueden cambiarlo. No es asesoramiento de inversión.
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
¿Por qué suele puntuarse Expected Shortfall junto con VaR?
Elige una respuesta para ver la explicación
Glosario de opciones
Pérdida media desde el cuantil VaR elegido hasta la peor cola bajo una convención precisa; mide la gravedad más allá del umbral y no solo su ubicación
Leer la guía detalladaAsignaciónProceso por el que el vendedor debe cumplir la obligación del contrato tras recibir un aviso de ejercicio; puede crear o eliminar una posición en el subyacente
Leer la guía detalladaDiferencial bid-askDistancia entre el mejor bid y ask visibles, que actúa como coste práctico y señala la incertidumbre del precio de una ejecución inmediata
Leer la guía detallada