Noter VaR et ES conjointement : l’approche de Fissler–Ziegel
Découvrez pourquoi la VaR et l’Expected Shortfall nécessitent une règle de score conjointe, comment comparer des prévisions avec Fissler–Ziegel et en quoi cette approche diffère des tests d’exceptions VaR.
Dans ce guideCommencer par le couple de prévisions et la convention de queue
Bref résumé
La VaR est un quantile et peut être évaluée seule avec une perte quantile. L’Expected Shortfall (ES) est différent : dans de larges classes de distributions, il n’est pas élicitable comme prévision ponctuelle autonome. Fissler et Ziegel montrent que VaR et ES peuvent être évalués ensemble avec un score strictement cohérent sous certaines conditions. Cela permet de comparer des couples de prévisions, sans prouver qu’un modèle à score faible est correct.
Commencer par le couple de prévisions et la convention de queue
Soit L_t une perte : une valeur élevée est défavorable. Soit c un niveau de confiance, par exemple 97,5 %. Le quantile conditionnel de perte v(c,t) est le plus petit x pour lequel F(L_t ≤ x | information disponible jusqu’à t−1) atteint c. Pour la queue supérieure des pertes, l’ES est e(c,t) = 1/(1−c) fois l’intégrale de v(u,t) de c à 1, si la moyenne de queue est finie. Pour une distribution continue, cela correspond à la perte moyenne au-delà du seuil VaR. En présence d’une masse au seuil, l’intégrale des quantiles ne retient que la fraction nécessaire de cette masse.
Le score doit respecter la convention employée par les prévisions. Certains articles définissent VaR et ES sur la queue inférieure des rendements, souvent avec des valeurs négatives, et notent la probabilité de queue α = 1−c. Pour des pertes positives, la même région de risque se trouve dans la queue supérieure et l’ES est au moins égal à la VaR. Mélanger les conventions peut inverser les inégalités et les indicateurs d’exception. Indiquez le signe, le niveau de confiance, l’horizon et l’information disponible avant la réalisation.
Pourquoi VaR et ES n’ont pas le même score autonome
Un quantile possède un score de type pinball strictement cohérent. Pour une perte L et son quantile c v, un score VaR est S_VaR(v,L) = (I{L ≤ v}−c)(v−L). Sous les conditions habituelles des quantiles, son espérance est minimale au quantile cible. La VaR peut donc être évaluée seule à partir des prévisions et des réalisations.
Pour l’ES, il n’existe pas de score strictement cohérent équivalent qui l’élicite seul sur les larges classes de distributions de pertes utilisées en gestion du risque. La portée de cette affirmation est précise : elle concerne une prévision ponctuelle autonome dont le score espéré sélectionne l’ES de façon unique. Elle ne signifie pas que l’ES est inutile, impossible à comparer ou impossible à tester.
Fissler et Ziegel établissent la distinction essentielle : l’ES n’est pas élicitable seul en ce sens, mais le couple (VaR, ES) l’est conjointement sous des conditions modérées de régularité et de moments. Leur article analyse les conditions de scores strictement cohérents (Fissler et Ziegel, 2016). L’élicitabilité conjointe signifie qu’une même fonction prend les deux prévisions et le résultat observé en entrée. Ajouter deux pertes quelconques ne crée donc pas un score ES valide.
Ce qu’évalue un score de Fissler–Ziegel
Notons S_c(v,e;L) un score conjoint admissible au niveau c. La stricte cohérence signifie que le score espéré sous la distribution cible est minimisé par le couple correct : (VaR_c, ES_c) = arg min sur (v,e) de E[S_c(v,e;L)]. Sous les conditions pertinentes, le minimum est unique. Le score combine l’information indiquant si le seuil VaR a été franchi avec la perte réalisée dans la queue et la prévision ES. Pour des pertes positives, l’ES ne doit pas être inférieur à la VaR.
Fissler et Ziegel décrivent une classe de scores, et non une formule unique obligatoire. Patton, Ziegel et Chen s’appuient sur ce résultat pour modéliser conjointement VaR et ES au cours du temps et comparer les prévisions (Patton, Ziegel et Chen, 2019). Un membre courant, FZ0, s’écrit pour les rendements de queue inférieure : Y = −L, α = 1−c et des prévisions négatives e ≤ v < 0 : S_FZ0(Y,v,e;α) = −I{Y ≤ v}(v−Y)/(αe) + v/e + ln(−e) − 1. Cette formule dépend de la convention des rendements et des signes indiqués. Elle ne s’applique pas sans adaptation aux pertes positives et n’est pas automatiquement le meilleur score pour tout jeu de données. Précisez la règle retenue et vérifiez ses hypothèses.
Bien lire les moyennes et les différences de score
Pour le modèle m, calculez S_c(v_hat(m,t),e_hat(m,t);L_t) sur chaque paire prévision-réalisation, puis faites la moyenne sur T dates. Avec le même score admissible, les mêmes dates, la même cible et les mêmes conventions, une moyenne plus faible indique une meilleure performance relative à cette règle. Ce nombre n’est ni une probabilité, ni un montant de VaR, ni une prévision de perte en euros ; son échelle dépend du score.
Pour comparer A et B, formez d_t = S_A,t − S_B,t. Une moyenne négative favorise A selon le score choisi. Comme les deux prévisions sont confrontées à la même réalisation, cette différence appariée est plus informative que deux moyennes arrondies séparément. Elle peut toutefois rester très incertaine lorsque les observations de queue sont rares.
<!-- learn:illustration -->
Comparez les mêmes origines de prévision, le même portefeuille ou la même cible, le même horizon, le même niveau de confiance et la même version des données. Les prévisions doivent avoir été enregistrées avant les résultats. En cas d’horizons qui se chevauchent ou de dépendance sérielle des différences, l’incertitude doit en tenir compte. Présentez une erreur-type ou un intervalle adapté : un petit écart brut ne constitue pas à lui seul une victoire solide.

Pourquoi deux pertes autonomes ne suffisent pas
Il peut sembler naturel d’ajouter à la perte pinball de VaR un écart absolu entre l’ES prévu et une valeur de référence. Mais cette référence peut elle-même être inadéquate, et l’espérance de ce second terme n’est pas nécessairement minimisée par le vrai ES. Une somme pondérée arbitrairement ne possède pas automatiquement la cohérence conjointe. La forme du score FZ est conçue pour évaluer ensemble le couple VaR–ES.
La classe Fissler–Ziegel contient plusieurs scores, avec des échelles et des sensibilités différentes. Les moyennes calculées avec deux fonctions différentes ne sont pas directement comparables. Patton, Ziegel et Chen étudient FZ0 et certaines propriétés d’échelle sous des hypothèses de signe supplémentaires ; cela ne rend pas FZ0 universellement supérieur. Choisissez et documentez la règle avant d’examiner le classement.
Le couple de prévisions doit aussi être cohérent. Une prévision ES apparemment plausible peut mal se comporter si elle contredit la VaR qui l’accompagne. À l’inverse, un bon score conjoint ne prouve pas que toute la distribution conditionnelle est correcte. L’évaluation porte sur la fonction VaR–ES définie, le score choisi et le protocole retenu.
Les mêmes exceptions VaR peuvent masquer des pertes de queue différentes
L’indicateur d’exception VaR est binaire : I_t = 1 si L_t dépasse la VaR prévue, sinon 0. Deux modèles peuvent avoir les mêmes dates et le même nombre d’exceptions alors que les pertes au-delà du seuil diffèrent fortement. Quatre dépassements ne disent pas s’ils étaient faibles ou si l’un d’eux était très loin dans la queue. Un simple décompte élimine précisément l’information de taille que l’ES apporte.
Un score conjoint utilise les prévisions VaR et ES avec la perte réalisée ; la taille des pertes de queue peut donc compter au-delà du nombre d’exceptions. La fonction retenue détermine la contribution exacte de chaque observation. Ne désignez pas un vainqueur à partir d’un seul événement extrême : calculez le score sur tout l’échantillon commun et examinez sa sensibilité.
La comparaison par score et le test de calibration VaR répondent à des questions différentes. La première classe des couples de prévisions selon une règle définie. Un test d’exceptions porte sur la fréquence ou le regroupement temporel des franchissements du seuil. Un classement ne constitue pas un certificat complet de calibration.
Les tests d’exceptions et les backtests d’ES répondent à d’autres questions
Les tests de Kupiec comparent le nombre d’exceptions VaR au taux visé ; les prolongements de Christoffersen examinent aussi leur dépendance ou leur regroupement. Comme ils réduisent chaque résultat à une exception ou non, ils ne mesurent pas l’ampleur des pertes au-delà du seuil et ne valident pas directement la prévision ES. Le guide VaR et Expected Shortfall explique les informations différentes apportées par ces deux mesures.
Acerbi et Szekely proposent des backtests non paramétriques de l’ES et soulignent que l’élicitabilité concerne la sélection de modèles sans être une condition préalable au test d’une mesure de risque (Acerbi et Szekely, 2014). Bayer et Dimitriadis développent des backtests d’ES fondés sur une structure de régression VaR–ES conjointe ; leurs variantes ont chacune leurs hypothèses et leurs exigences de covariance (Bayer et Dimitriadis, 2022). Un classement de scores ne remplace pas un backtest dédié. Une absence de rejet ne prouve pas non plus que le couple de prévisions soit correct.
Prévoir l’inférence appariée et éviter la sélection a posteriori
La suite des différences d_t constitue une série temporelle. Pour des prévisions à un pas sans chevauchement et sous des hypothèses de dépendance adéquates, un test apparié de la différence moyenne peut être envisagé. En présence de dépendance sérielle ou d’horizons qui se chevauchent, utilisez une méthode d’incertitude adaptée, par exemple une variance de long terme ou un rééchantillonnage par blocs approprié. Indiquez la méthode et ses paramètres au lieu de ne donner qu’une valeur p.
Fixez le score, le niveau de queue, l’horizon, la période d’évaluation et les modèles avant de consulter les résultats. Essayer de nombreux scores, fenêtres, portefeuilles et variantes puis ne montrer que le meilleur crée un problème de sélection. Gardez si possible une période ultérieure non utilisée pour choisir le modèle et décrivez la recherche. Les erreurs-types ordinaires ne corrigent pas automatiquement cette sélection.
Présentez les moyennes et leur différence appariée avec l’incertitude, la définition du score, les conventions et signes, les dates communes hors échantillon et le nombre d’observations de queue. Si le classement change selon des choix raisonnables de score ou de période, montrez cette sensibilité.
Limites et liste de vérification pratique
À des niveaux de confiance élevés, les observations de queue sont rares : le classement peut donc être instable même pour une série longue. L’hétéroscédasticité conditionnelle, les changements de régime, les rendements qui se chevauchent, l’incertitude d’estimation, les erreurs de données et les modifications de portefeuille peuvent aussi affecter les différences. L’élicitabilité conjointe n’efface pas ces problèmes ; elle fournit une classe de scores fondée sous certaines conditions mathématiques.
Vérifiez que la perte réalisée correspond au même portefeuille, horizon, mode de valorisation et signe que la prévision. VaR et ES doivent désigner la même probabilité de queue. Assurez-vous que les prévisions étaient ex ante et que le score respecte ses hypothèses de distribution, de moments et de signes. Indiquez la longueur de l’échantillon, les observations de queue, la formule du score, la méthode d’incertitude et toute recherche de modèles ou de scores. La conclusion reste liée à ce protocole.
Un score conjoint plus faible constitue un indice de meilleure performance prédictive relative sous une règle donnée. Il ne démontre ni que le modèle couvre tous les événements extrêmes, ni que ses estimations sont sûres, ni que l’avenir ressemblera à l’échantillon. Cet article présente des méthodes statistiques et ne constitue pas un conseil en investissement.
Questions fréquentes
Q1Puis-je comparer des prévisions d’ES avec l’erreur absolue ?
Pas comme remplacement général d’un score strictement cohérent. Pour une comparaison de prévisions ponctuelles, l’ES est généralement évalué avec VaR ; pour une question de calibration, utilisez un backtest dédié.
Q2Un score conjoint indique-t-il si le modèle est calibré ?
Il compare les performances relatives sous un score choisi. Calibration et mauvaise spécification sont deux questions distinctes qui nécessitent des tests et diagnostics adaptés.
Q3Deux modèles peuvent-ils avoir les mêmes exceptions VaR mais des scores différents ?
Oui. Les indicateurs peuvent coïncider tandis que la taille des pertes dépassant VaR ou les prévisions ES diffèrent. L’effet exact dépend du score retenu.
Q4Un score faible signifie-t-il que le modèle est sûr ?
Non. Le résultat dépend de l’échantillon, du score et des hypothèses. La rareté des données de queue, les changements de régime, la sélection de modèles ou des erreurs de données peuvent le modifier. Ce n’est pas un conseil en investissement.
Sources et lectures complémentaires
Signaler un problème
Nous préparons un e-mail avec le lien de cet article. Mark ne reçoit le signalement qu’après son envoi
Vérification rapide
Guide terminé ? Vérifiez vos acquis avec 3 questions
Question 01
Pourquoi l’Expected Shortfall est-il souvent évalué avec la VaR ?
Choisissez une réponse pour voir l'explication
Glossaire des options
The average loss from a chosen VaR quantile through the worst tail under a precise convention; it measures severity beyond the threshold rather than only its location.
Lire le guide approfondiassignation d’optionProcessus qui attribue au vendeur l’obligation d’exécuter le contrat après un avis d’exercice et peut créer une livraison ou un achat d’actions.
Lire le guide approfondiécart acheteur-vendeurÉcart entre la meilleure offre d’achat et la meilleure offre de vente d’un contrat. Il représente un coût implicite pour entrer puis sortir d’une position et peut s’élargir lorsque la liquidité diminue.
Lire le guide approfondi