Skip to content
Tous les guides sur les options et contrats à terme
Évaluer la fréquence et le calendrier des exceptions12 min de lecture

Backtesting de la VaR : les tests de Kupiec et Christoffersen

Comprenez comment les tests POF de Kupiec et de couverture conditionnelle de Christoffersen évaluent les exceptions de VaR, avec un exemple sur 250 jours et les limites d’un non-rejet.

Dans ce guideQue vérifie un backtest de VaR ?

Bref résumé

Un backtest de VaR compare chaque seuil de perte prévu à la perte ensuite observée. Le test de Kupiec demande si le nombre d’exceptions est cohérent avec le taux cible. Les tests de Christoffersen examinent aussi leur ordre : les exceptions arrivent-elles indépendamment ou se regroupent-elles ? Ces tests portent sur des aspects différents de la prévision et aucun ne prouve qu’un modèle de risque est exact.

Que vérifie un backtest de VaR ?

La valeur à risque (VaR) est un seuil de perte associé à un niveau de confiance et à un horizon précis. Si la VaR quotidienne à 99 % est de 10 000 $, le modèle attribue, selon les informations et hypothèses indiquées, une probabilité de 1 % à une perte quotidienne supérieure à ce montant. Cela ne plafonne pas la perte et ne dit pas quelle pourrait être son ampleur une fois le seuil dépassé.

Le backtesting transforme une suite de prévisions et de résultats en une suite d’exceptions. Pour un modèle de VaR quotidienne à 99 % correctement calibré, les exceptions devraient représenter environ 1 % des observations comparables à long terme. Cette idée comprend deux questions : la fréquence globale est-elle proche de la cible et le calendrier des exceptions contredit-il les prévisions conditionnelles de risque du modèle ? Le test de proportion d’échecs (POF) de Kupiec porte surtout sur la première. Les tests d’indépendance et de couverture conditionnelle de Christoffersen prennent aussi en compte l’ordre des exceptions.

La distinction est utile en pratique. Un modèle peut produire quatre exceptions en un an, toutes pendant une semaine agitée ; un autre peut avoir les mêmes quatre exceptions réparties sur l’année. Un test fondé uniquement sur le compte voit quatre cas dans les deux séries, alors qu’un test temporel voit deux séquences différentes. Ces outils décrivent certaines propriétés des prévisions, mais ne remplacent pas l’examen des positions, des données de marché, des hypothèses ou de l’ampleur des pertes. Le guide sur les modèles GARCH et les grappes de volatilité explique comment représenter la persistance de la variance ; un modèle de variance et un backtest répondent à des questions distinctes.

Définir l’exception avant de la compter

Gardez une convention de signe unique. Notons Lₜ la perte réalisée au jour t et VaRₜ|ₜ₋₁ le seuil de perte prévu pour ce jour à partir des informations disponibles avant t. L’indicateur d’exception Iₜ vaut 1 si Lₜ > VaRₜ|ₜ₋₁ et 0 sinon. Pour une VaR à 99 %, la probabilité d’exception cible est α = 1 − 0,99 = 0,01. Certaines sources partent des rendements ou définissent l’intervalle couvert ; ces conventions sont équivalentes après traduction du signe et de la probabilité. Précisez celle que vous utilisez.

La prévision et le résultat doivent concerner le même portefeuille, le même horizon, le même instant de valorisation et la même définition de perte. Une VaR calculée après la clôture pour le jour de marché suivant doit être comparée à la perte de ce jour selon une règle cohérente. Décidez à l’avance du traitement d’une perte exactement égale à la VaR, des jours fériés, des données manquantes, des fermetures de marché, des corrections intrajournalières et des changements de portefeuille. Quand les exceptions sont rares, ces choix peuvent modifier la suite observée.

Séparez l’ajustement du modèle de son évaluation finale. Si les paramètres ou les seuils de risque ont été choisis après examen de la période de test, la valeur p ne correspond plus à une vérification propre hors échantillon. Pour des prévisions glissantes, consignez leur date de production et les informations alors disponibles. Des prévisions pluri-journalières qui se chevauchent peuvent rendre les indicateurs dépendants. Les tests ci-dessous ne corrigent automatiquement ni un horizon incohérent, ni une fuite d’information future, ni des données révisées, ni la sélection du modèle.

Quelle question pose le test POF de Kupiec ?

Supposons T paires prévision-résultat comparables et x exceptions. La fréquence observée est p̂ = x/T. Le test de proportion d’échecs de Kupiec compare deux vraisemblances binomiales : l’une fixe la probabilité d’exception à la cible α, l’autre l’estime librement à p̂. La statistique du rapport de vraisemblance est :

LRᵤ꜀ = −2 ln [ (1−α)^(T−x) α^x / ((1−p̂)^(T−x) p̂^x) ]

La formulation originale figure dans l’article de Kupiec de 1995, également répertorié dans les archives de la Réserve fédérale. Sous l’hypothèse nulle, les exceptions sont des événements de Bernoulli indépendants de probabilité α. Pour un échantillon assez grand, la statistique suit approximativement une loi du chi carré à un degré de liberté. Une valeur élevée contredit la fréquence spécifiée. Comme l’alternative estime librement la fréquence observée, le test peut rejeter en cas d’excès ou d’insuffisance d’exceptions. Un modèle qui franchit rarement son seuil de VaR n’est pas forcément bien calibré ; il peut être si conservateur que ses prévisions deviennent peu utiles.

Le POF n’utilise que le nombre x, pas les dates des exceptions. Réordonner les mêmes indicateurs ne change pas sa statistique. Le résultat ne permet donc pas de savoir si quatre exceptions étaient espacées ou consécutives. La vraisemblance binomiale suppose également l’indépendance des indicateurs pour établir sa distribution de référence. Pour savoir si les exceptions se regroupent, ajoutez un test de dépendance au lieu d’interpréter le POF comme un test temporel.

Un exemple sur 250 jours montre pourquoi la valeur p doit être contextualisée

Considérons une série hypothétique de 250 prévisions quotidiennes de VaR à 99 %. La cible est α = 0,01 ; sous l’hypothèse nulle, le nombre attendu est Tα = 250 × 0,01 = 2,5 exceptions. Si quatre sont observées, p̂ = 4/250 = 0,016, soit 1,6 %. Cette fréquence dépasse la cible de 1 %, mais l’écart seul ne suffit pas à décider si le test rejette.

En remplaçant T = 250, x = 4 et α = 0,01 dans la formule, on obtient LRᵤ꜀ ≈ 0,769. Avec la référence asymptotique du chi carré(1), p ≈ 0,38 et le seuil critique à 5 % est d’environ 3,84. Selon cette approximation, l’exemple ne rejette pas la couverture inconditionnelle au seuil de 5 %. Ce calcul est hypothétique : il illustre la méthode, sans présenter un résultat empirique ni un seuil universel d’acceptation.

Les deux log-vraisemblances montrent l’origine de la statistique. Avec le taux cible imposé, ℓ₀ = 246 ln(0,99) + 4 ln(0,01) ≈ −20,893. Avec le taux observé libre, ℓ₁ = 246 ln(0,984) + 4 ln(0,016) ≈ −20,508. La vraisemblance libre est supérieure d’environ 0,385 unité de log-vraisemblance ; ainsi LRᵤ꜀ = −2(ℓ₀ − ℓ₁) ≈ 0,769. Le test mesure la perte d’ajustement par rapport au modèle au taux cible, pas une distance en dollars.

Un non-rejet ne démontre pas que le modèle est bien calibré. Seules 2,5 exceptions étaient attendues sur 250 jours ; une ou deux observations supplémentaires modifient sensiblement le taux observé. La référence du chi carré est asymptotique et la puissance des tests d’événements rares peut être limitée avec un échantillon de cette taille. Lisez la statistique avec le compte attendu, l’horizon, le plan du test et la taille de l’échantillon. Une valeur p n’est pas la probabilité que le modèle de VaR soit vrai.

Le même nombre d’exceptions peut cacher des calendriers différents

Comparons deux suites hypothétiques de 250 jours, contenant chacune quatre exceptions. Dans la séquence A, elles surviennent aux jours 20, 80, 140 et 220. Dans la séquence B, elles surviennent aux jours 60 et 61, puis 180 et 181. Les deux séries ont x = 4 et p̂ = 1,6 %, donc la statistique de Kupiec est identique. Pourtant, B contient deux paires d’exceptions consécutives et A n’en contient aucune.

Le schéma conceptuel associé rappelle pourquoi il faut conserver l’ordre des indicateurs au lieu de ne rapporter que leur total. Il ne s’agit ni d’une série réelle de 250 jours ni d’un résultat de test. Des exceptions consécutives peuvent inciter à vérifier si le modèle tarde à réagir aux changements de volatilité, mais quelques points ne permettent pas d’en identifier la cause. Le motif peut aussi venir d’une mauvaise spécification, d’un choc de marché, d’un changement de portefeuille, d’horizons chevauchants ou de conventions de données et d’horodatage.

Notons nᵢⱼ le nombre de transitions où l’indicateur précédent vaut i et l’actuel j, avec 0 pour aucune exception et 1 pour une exception. En dehors des frontières de l’échantillon, A a n₀₁ = 4 et n₁₁ = 0 ; B a n₀₁ = 2 et n₁₁ = 2. Les deux séries comptent quatre exceptions, mais certaines de B suivent une exception précédente. C’est l’information exploitée par un test d’indépendance de premier ordre.

Les tableaux de transition complets sont n₀₀=241, n₀₁=4, n₁₀=4, n₁₁=0 pour A et n₀₀=243, n₀₁=2, n₁₀=2, n₁₁=2 pour B. La probabilité estimée après un jour sans exception est n₀₁/(n₀₀+n₀₁) ; après une exception, n₁₁/(n₁₀+n₁₁). Pour A, elles valent 4/245 ≈ 1,63 % et 0/4 = 0 %. Pour B, elles valent 2/245 ≈ 0,82 % et 2/4 = 50 %. Le 50 % repose sur seulement quatre transitions après une exception : il décrit cette séquence hypothétique minuscule et ne constitue pas une estimation fiable du risque du lendemain.

Schéma conceptuel sans texte comparant deux séquences d’exceptions de VaR de même longueur et avec le même nombre de dépassements, l’une dispersée et l’autre regroupée par paires consécutives.
Un même nombre d’exceptions peut survenir à des moments différents. Ce schéma illustre uniquement un regroupement ; ce ne sont ni des données de marché ni un résultat de test.

Qu’ajoute le test d’indépendance de Christoffersen ?

Le test d’indépendance compare la probabilité d’une exception après une journée calme avec celle qui suit une exception. Posons π₀ = Pr(Iₜ = 1 | Iₜ₋₁ = 0) et π₁ = Pr(Iₜ = 1 | Iₜ₋₁ = 1). Sous l’hypothèse nulle d’indépendance, π₀ = π₁ : l’état d’exception de la veille ne change pas la probabilité d’une exception aujourd’hui. Sous l’alternative, les probabilités de transition sont estimées séparément à partir de n₀₀, n₀₁, n₁₀ et n₁₁.

Le cadre d’évaluation des prévisions d’intervalles conditionnels est présenté dans l’article de Christoffersen de 1998. La statistique du rapport de vraisemblance compare les deux modèles et est généralement évaluée à l’aide d’une loi du chi carré à un degré de liberté. Contrairement au POF, elle dépend de l’ordre des indicateurs. Si une exception en suit souvent une autre, π₁ peut dépasser π₀. Le test porte sur la dépendance de premier ordre de cette suite binaire ; il ne couvre pas toutes les façons dont l’information passée, la volatilité ou l’état du portefeuille peuvent aider à prévoir les pertes.

Avec peu d’exceptions, les probabilités de transition sont particulièrement instables. Une séquence sans exception consécutive peut donner une estimation de π₁ égale à zéro, mais cela ne prouve pas qu’une deuxième exception soit impossible : aucune n’a simplement été observée ici. Examinez les comptes de transitions et la taille de l’échantillon avec la statistique. Un tableau clairsemé ne fournit pas une estimation précise du risque de queue pour le lendemain.

La couverture conditionnelle combine fréquence et indépendance

Le test de couverture conditionnelle additionne la statistique de fréquence de Kupiec et celle d’indépendance de Christoffersen : LR꜀꜀ = LRᵤ꜀ + LRᵢₙd. Son hypothèse nulle conjointe affirme que la probabilité d’exception vaut α et que les exceptions sont indépendantes dans le temps. Dans le cadre standard de grand échantillon, la somme est comparée à une loi du chi carré à deux degrés de liberté.

Rapportez aussi les deux composantes. Le rejet de la couverture conditionnelle indique que les conditions conjointes ne sont pas compatibles avec la séquence observée sous les hypothèses du test, sans en identifier la cause. Si le POF rejette mais pas le test d’indépendance, le compte global peut être le signal le plus net. Si l’indépendance est rejetée, examinez le calendrier même lorsque le nombre total semble proche de la cible. Si aucun test ne rejette, l’échantillon peut encore être trop court pour révéler une mauvaise spécification.

La portée reste limitée : chaque journée est réduite à un indicateur binaire. Le test ne distingue pas un dépassement de VaR de 1 $ d’un dépassement de 1 million de dollars. Il ne valide pas non plus toute la distribution des pertes ni l’Expected Shortfall. Pour comparer les questions auxquelles répondent la VaR et l’Expected Shortfall, consultez le guide sur la VaR et l’Expected Shortfall.

Les exceptions rares compliquent l’inférence sur un échantillon court

À 99 % de VaR, un échantillon de 250 jours ne prévoit que 2,5 exceptions. Si les exceptions indépendantes ont une probabilité de 1 %, le nombre attendu de transitions exception-exception parmi 249 paires de jours voisins est d’environ 249 × 0,01² = 0,025. La plupart des échantillons de cette taille ne contiendront aucune paire consécutive même si le modèle est bien calibré. Cette rareté rend les probabilités de transition difficiles à estimer et peut limiter la puissance d’un test de dépendance.

Christoffersen et Pelletier discutent de la faible puissance possible des backtests de VaR dans des petits échantillons réalistes et étudient les tests fondés sur la durée entre exceptions dans leur article de 2004. Cela motive un diagnostic complémentaire ; cela ne rend pas les tests de durée toujours supérieurs et ne dispense pas d’adapter le test aux prévisions de risque et au plan d’échantillonnage. Quand les observations sont peu nombreuses, signalez-le au lieu de présenter un non-rejet comme un certificat de fiabilité.

Le taux de queue cible compte aussi. À 95 % de VaR, le taux nominal est de 5 %, soit 12,5 exceptions attendues en 250 jours ; à 99,9 %, il n’y en a que 0,25. Employer le même nom de test ne rend pas les éléments de preuve comparables entre ces plans. Indiquez le niveau de confiance, l’horizon, le nombre d’observations, les comptes cible et observé, les transitions, ainsi que le recours à une approximation asymptotique ou à une méthode en échantillon fini.

Quand faut-il utiliser un autre diagnostic ?

Choisissez le prochain diagnostic en vous demandant quelles informations les deux tests ont écartées. Pour savoir si les exceptions sont prévisibles à partir des indicateurs retardés, des prévisions de VaR ou d’autres variables disponibles au moment de la prévision, le test des quantiles dynamiques (DQ) d’Engle et Manganelli teste des restrictions portant sur des indicateurs d’exception centrés et un ensemble d’instruments choisi. Le résultat dépend de ces instruments et de leur disponibilité au bon moment ; il ne détecte pas toutes les formes possibles de défaut conditionnel. Un test de durée étudie plutôt le temps d’attente entre les exceptions.

Engle et Manganelli présentent le test DQ dans leur article CAViaR. Si la question porte sur l’ampleur des pertes au-delà du seuil VaR, les tests de fréquence et d’indépendance ne suffisent pas : examinez les dépassements et choisissez une méthode d’évaluation de l’Expected Shortfall adaptée. Si vous vous inquiétez du choix du meilleur résultat après de nombreux essais de modèles, le backtesting de la VaR ne résout pas ce problème de sélection ; PBO et CSCV constituent un diagnostic distinct fondé sur les rangs.

Un rapport utile précise le portefeuille, la convention de perte, l’horizon, le niveau de confiance, les dates d’évaluation, la façon dont les prévisions ont été produites, la définition d’exception, les comptes attendus et observés, la statistique POF, les transitions et les résultats des tests d’indépendance et de couverture conditionnelle. Mentionnez les limites liées à la taille de l’échantillon ou aux horizons qui se chevauchent. Représentez les seuils prévus et les pertes réalisées dans le temps et gardez les données d’évaluation ultérieures hors de la sélection du modèle. Ces pratiques rendent les éléments observés interprétables ; un test historique réussi ne garantit pas le contrôle du risque à venir.

Questions fréquentes

Q1Un test de Kupiec qui ne rejette pas prouve-t-il que mon modèle de VaR est exact ?

Non. Le non-rejet signifie que le test n’a pas trouvé assez d’éléments contre le taux d’exception spécifié sous ses hypothèses. Un échantillon court, surtout pour une VaR à 99 % ou davantage, peut contenir trop peu d’exceptions pour révéler un problème.

Q2Deux modèles peuvent-ils réussir le même test de Kupiec tout en ayant des séquences différentes ?

Oui. La statistique de Kupiec dépend du compte, pas de l’ordre. Le test d’indépendance de Christoffersen ajoute des informations sur le regroupement éventuel des exceptions dans des observations voisines.

Q3Ces tests indiquent-ils la taille d’une perte après un dépassement de VaR ?

Non. Ils utilisent un indicateur d’exception et ne mesurent pas l’ampleur du dépassement. Si la gravité des pertes au-delà du seuil importe, examinez-les et évaluez séparément l’Expected Shortfall.

Sources et lectures complémentaires

Signaler un problème

Nous préparons un e-mail avec le lien de cet article. Mark ne reçoit le signalement qu’après son envoi

Vérification rapide

Guide terminé ? Vérifiez vos acquis avec 3 questions

Question 1 / 3

Question 01

Quelle information utilise le test POF de Kupiec ?

Choisissez une réponse pour voir l'explication

Glossaire des options