Skip to content
Alle optiegidsen
Toets de frequentie en timing van VaR-overschrijdingen12 minuten gelezen

VaR-backtesting: de toetsen van Kupiec en Christoffersen uitgelegd

Lees hoe de Kupiec-POF-toets en Christoffersen-toetsen voor conditionele dekking VaR-overschrijdingen beoordelen, hoe je een voorbeeld van 250 dagen leest en waarom niet verwerpen geen bewijs van nauwkeurigheid is.

In deze gidsWat controleert een VaR-backtest?

Korte samenvatting

Een VaR-backtest vergelijkt de voorspelde verliesgrens met het verlies dat daarna optrad. De Kupiec-toets vraagt of het aantal overschrijdingen overeenkomt met het doelpercentage. De toetsen van Christoffersen kijken ook of overschrijdingen onafhankelijk optreden of zich ophopen. Ze toetsen verschillende kenmerken van de voorspelling; geen van beide bewijst dat een risicomodel correct is.

Wat controleert een VaR-backtest?

Value at Risk (VaR) is een verliesgrens die hoort bij een bepaald betrouwbaarheidsniveau en een bepaalde horizon. Als de eendaagse VaR op 99% $10.000 is, kent het model op basis van de genoemde informatie en aannames een kans van 1% toe aan een eendaags verlies boven $10.000. VaR is geen maximumverlies en vertelt niet hoe groot een verlies kan zijn nadat die grens is overschreden.

Backtesting zet een reeks voorspellingen en uitkomsten om in een reeks overschrijdingsindicatoren. Bij een dagelijkse VaR van 99% zou een goed gekalibreerd model over herhaalde, vergelijkbare waarnemingen ongeveer 1% overschrijdingen moeten opleveren. Dat bestaat uit twee onderdelen: de langetermijnfrequentie hoort bij het doelpercentage te liggen, en de overschrijdingen mogen niet voorkomen in een patroon dat strijdig is met de conditionele risicovoorspellingen van het model. De proportion-of-failures-toets (POF) van Kupiec richt zich op het eerste onderdeel. De onafhankelijkheids- en conditionele-dekkingstoetsen van Christoffersen nemen ook de volgorde mee.

Dat onderscheid is praktisch. Een model kan in een jaar vier overschrijdingen hebben en ze alle vier in één turbulente week plaatsen. Bij een ander model kunnen dezelfde vier over het jaar verspreid zijn. Een toets die alleen telt, ziet in beide gevallen vier; een toets die de timing bekijkt, ziet verschillende reeksen. De onderstaande toetsen helpen die kenmerken te beschrijven, maar vervangen geen controle van posities, marktgegevens, aannames of verliesomvang. De aparte gids over GARCH en volatiliteitsclustering legt uit hoe GARCH-modellen clustering weergeven; een variantie- en backtest beantwoorden verschillende vragen.

Leg de overschrijding vast voordat je telt

Gebruik steeds dezelfde tekenconventie. Noem Lₜ het gerealiseerde verlies op dag t en VaRₜ|ₜ₋₁ de eendaagse verliesgrens die is voorspeld met informatie van vóór dag t. Definieer de overschrijdingsindicator als Iₜ = 1 wanneer Lₜ > VaRₜ|ₜ₋₁ en als Iₜ = 0 anders. Bij een VaR-model van 99% is de beoogde overschrijdingskans α = 1 − 0.99 = 0.01. Sommige bronnen gebruiken rendementen of de indicator dat een uitkomst binnen een voorspellingsinterval valt; die conventies zijn gelijkwaardig als teken en kans goed worden vertaald. Vermeld welke definitie je gebruikt.

Voorspelling en uitkomst moeten betrekking hebben op hetzelfde portfolio, dezelfde horizon, hetzelfde waarderingstijdstip en dezelfde verliesdefinitie. Als je na de slotkoers een voorspelling voor de volgende handelsdag maakt, vergelijk die dan volgens een vaste waarderingsregel met het verlies op die volgende dag. Bepaal vooraf hoe je omgaat met een uitkomst precies op de VaR-grens, feestdagen, ontbrekende waarnemingen, marktstops, intradaycorrecties en portfoliowijzigingen. Zulke keuzes kunnen de reeks hits veranderen, vooral als overschrijdingen zeldzaam zijn.

Houd modelpassing gescheiden van de uiteindelijke evaluatie. Als parameters of risicogrenzen zijn gekozen nadat dezelfde toetsperiode is bekeken, beschrijft de p-waarde geen zuivere out-of-samplecontrole meer. Noteer bij rollende voorspellingen wanneer elke voorspelling is gemaakt en welke informatie toen beschikbaar was. Overlappende meerdaagse voorspellingen kunnen afhankelijkheid in de overschrijdingsindicatoren veroorzaken. De standaardtoetsen hieronder herstellen geen verkeerde horizon, toekomstinformatie, herziene invoer of modelselectieproces.

Welke vraag stelt de Kupiec-POF-toets?

Stel dat er T vergelijkbare paren van voorspelling en uitkomst zijn en x overschrijdingen. De waargenomen frequentie is p̂ = x/T. De proportion-of-failures-toets van Kupiec, ook wel de toets op onvoorwaardelijke dekking, vergelijkt twee binomiale likelihoods: één houdt de overschrijdingskans vast op het doel α; de andere schat de kans vrij als p̂. De toets komt uit Kupiecs artikel uit 1995; er is ook een archiefvermelding van de Federal Reserve. De likelihood-ratiostatistiek is

LRᵤ꜀ = −2 ln [ (1−α)^(T−x) α^x / ((1−p̂)^(T−x) p̂^x) ].

Onder de nulhypothese zijn overschrijdingen onafhankelijke Bernoulli-gebeurtenissen met kans α. Bij een voldoende grote steekproef benadert de statistiek een chi-kwadraatverdeling met één vrijheidsgraad. Een grote waarde verwerpt de opgegeven overschrijdingsfrequentie. Omdat de alternatieve kans vrij wordt geschat, kan de toets zowel verwerpen als er te veel als te weinig overschrijdingen zijn. Een model dat VaR bijna nooit overschrijdt, is niet automatisch goed gekalibreerd: het kan zo conservatief zijn dat de voorspelling niet bruikbaar is voor het beoogde doel.

De POF-toets gebruikt het aantal x, niet de datums waarop de overschrijdingen plaatsvonden. Dezelfde indicatoren in een andere volgorde geven dezelfde statistiek. De toets kan dus niet onderscheiden of vier overschrijdingen verspreid waren of achter elkaar voorkwamen. De Bernoulli-likelihood veronderstelt voor haar referentieverdeling bovendien dat de indicatoren onafhankelijk zijn. Als clustering de vraag is, voeg dan een toets op afhankelijkheid toe in plaats van clustering uit de POF-uitkomst af te leiden.

Het voorbeeld van 250 dagen laat zien waarom een p-waarde context nodig heeft

Neem een hypothetische reeks van 250 eendaagse voorspellingen voor een VaR van 99%. Het doelpercentage is α = 0.01, dus onder de nulhypothese is het verwachte aantal overschrijdingen Tα = 250 × 0.01 = 2.5. Stel dat de reeks vier overschrijdingen bevat. De waargenomen frequentie is p̂ = 4/250 = 0.016, oftewel 1.6%. Dat is hoger dan het doel van 1%, maar het verschil alleen bepaalt niet of de likelihood-ratiotoets verwerpt.

Met T = 250, x = 4 en α = 0.01 is LRᵤ꜀ ≈ 0.769. Met de asymptotische chi-kwadraat(1)-referentie is p ≈ 0.38; de kritieke waarde bij 5% is ongeveer 3.84. Volgens die benadering verwerpt dit voorbeeld de nulhypothese van onvoorwaardelijke dekking niet op het 5%-niveau. Dit is een hypothetische berekening, geen empirische uitkomst of aanbevolen acceptatiedrempel.

De twee log-likelihoods laten zien hoe de statistiek ontstaat. Met de doelkans vastgezet is ℓ₀ = 246 ln(0.99) + 4 ln(0.01) ≈ −20.893. Met de waargenomen kans vrij geschat is ℓ₁ = 246 ln(0.984) + 4 ln(0.016) ≈ −20.508. De vrije passing is ongeveer 0.385 log-likelihoodeenheid hoger, zodat LRᵤ꜀ = −2(ℓ₀ − ℓ₁) ≈ 0.769. De toets meet het verlies aan passing ten opzichte van het doelmodel, niet een verschil in euro's.

Niet verwerpen bewijst niet dat het model goed gekalibreerd is. Er waren slechts 2.5 overschrijdingen verwacht, dus één of twee extra gebeurtenissen veranderen de waargenomen frequentie merkbaar. De chi-kwadraatreferentie is asymptotisch en toetsen voor zeldzame gebeurtenissen kunnen bij deze steekproefomvang weinig onderscheidingsvermogen hebben. Lees de statistiek samen met het verwachte aantal, de voorspellingshorizon, het toetsontwerp en de steekproefomvang. Een p-waarde is niet de kans dat het VaR-model waar is.

Hetzelfde aantal overschrijdingen kan een andere timing verbergen

Vergelijk twee hypothetische reeksen van 250 dagen met elk vier overschrijdingen. In reeks A vinden ze plaats op dag 20, 80, 140 en 220. In reeks B zijn het dag 60, 61, 180 en 181. Beide hebben x = 4 en p̂ = 1.6%, dus hun Kupiec-statistiek is hetzelfde. B bevat echter twee paren overschrijdingen op opeenvolgende dagen en A geen.

De schematische illustratie hieronder laat zien waarom je de volgorde van de hitreeks bewaart in plaats van alleen het totaal. Ze is conceptueel, geen gegevensreeks van 250 dagen of toetsresultaat. Opeenvolgende overschrijdingen kunnen passen bij een model dat niet snel genoeg reageert op veranderende volatiliteit, maar een paar punten stellen de oorzaak niet vast. Het patroon kan ook samenhangen met modelspecificatie, een marktschok, portfoliowijzigingen, overlappende perioden of regels voor gegevens en timing.

Laat nᵢⱼ het aantal overgangen zijn waarbij de vorige indicator i is en de huidige j; 0 betekent geen overschrijding en 1 wel. Afgezien van de steekproefgrenzen heeft reeks A n₀₁ = 4 en n₁₁ = 0, terwijl B n₀₁ = 2 en n₁₁ = 2 heeft. Beide hebben vier overschrijdingen, maar in B volgt een deel van de hits op een eerdere hit. Dat is de informatie die een eerste-orde onafhankelijkheidstoets gebruikt.

De volledige overgangstabel is A: n₀₀ = 241, n₀₁ = 4, n₁₀ = 4, n₁₁ = 0; B: respectievelijk 243, 2, 2 en 2. De geschatte kans op een hit na een dag zonder overschrijding is n₀₁/(n₀₀+n₀₁); na een hit is dat n₁₁/(n₁₀+n₁₁). Voor A zijn dat 4/245 ≈ 1.63% en 0/4 = 0%. Voor B zijn het 2/245 ≈ 0.82% en 2/4 = 50%. Die 50% berust op slechts vier hypothetische overgangen na een hit, geen geloofwaardige schatting van het risico van een echt model op de volgende dag.

Tekstloos conceptschema vergelijkt twee VaR-overschrijdingsreeksen van gelijke lengte met hetzelfde aantal overschrijdingen: één verspreide reeks en één met paren op opeenvolgende dagen.
Hetzelfde aantal overschrijdingen kan op verschillende momenten plaatsvinden. Dit schema toont alleen clustering; het zijn geen marktgegevens of een toetsresultaat.

Wat voegt Christoffersens onafhankelijkheidstoets toe?

De onafhankelijkheidstoets van Christoffersen beoordeelt of de kans op een overschrijding vandaag verandert als er gisteren wel of geen overschrijding was. Schrijf π₀ = Pr(Iₜ = 1 | Iₜ₋₁ = 0) en π₁ = Pr(Iₜ = 1 | Iₜ₋₁ = 1). Onder de nulhypothese van onafhankelijkheid geldt π₀ = π₁. Onder de alternatieve hypothese worden beide overgangskansen afzonderlijk geschat met n₀₀, n₀₁, n₁₀ en n₁₁.

De likelihood-ratiostatistiek vergelijkt beide modellen en wordt doorgaans beoordeeld met een asymptotische chi-kwadraatverdeling met één vrijheidsgraad. Anders dan de POF-toets gebruikt zij de volgorde van de indicatoren. Als overschrijdingen vaak op eerdere overschrijdingen volgen, kan π₁ groter zijn dan π₀. De toets gaat specifiek over afhankelijkheid van de eerste orde in deze binaire reeks; zij toetst niet elke manier waarop eerdere informatie, volatiliteit of de portfoliostatus toekomstige verliezen kan voorspellen. Christoffersens artikel uit 1998 ontwikkelt de evaluatie van conditionele intervaldekking.

Bij weinig overschrijdingen zijn overgangsschattingen extra instabiel. Een reeks zonder opeenvolgende hits kan een grensschatting π₁ = 0 opleveren, maar dat bewijst niet dat een tweede hit onmogelijk is. Het betekent alleen dat die zich in deze steekproef niet voordeed. Bekijk de overgangsaantallen en steekproefomvang naast de statistiek. Lees een dunne tabel niet als een nauwkeurige schatting van het toekomstige staart­risico.

Conditionele dekking combineert frequentie en onafhankelijkheid

De toets op conditionele dekking combineert de Kupiec-frequentiestatistiek met de onafhankelijkheidsstatistiek van Christoffersen: LR꜀꜀ = LRᵤ꜀ + LRᵢₙd. De gezamenlijke nulhypothese stelt dat de overschrijdingskans α is en overschrijdingen in de tijd onafhankelijk zijn. In de standaardbenadering voor grote steekproeven wordt de som vergeleken met een chi-kwadraatverdeling met twee vrijheidsgraden.

Rapporteer ook de deeltoetsen en niet alleen de gezamenlijke toets. Verwerpen van conditionele dekking betekent dat de twee voorwaarden samen niet passen bij de waargenomen reeks onder de aannames van de toets; het wijst de oorzaak niet aan. Als POF wel verwerpt maar onafhankelijkheid niet, is het totaal mogelijk het duidelijkste signaal. Als onafhankelijkheid verwerpt, verdient de timing aandacht, ook wanneer het totaal dicht bij het doel ligt. Als geen van beide verwerpt, kan de steekproef nog steeds te kort zijn om een misspecificatie te ontdekken.

De interpretatie is beperkt. De toets vat elke dag samen als een binaire uitkomst en maakt dus geen onderscheid tussen een verlies dat VaR met $1 overschrijdt en een verlies dat met $1 miljoen eroverheen gaat. Zij valideert ook niet de rest van de verliesverdeling en toont niet aan dat Expected Shortfall correct is. Lees meer over de verschillende vragen rond staart­risico in de gids over VaR en Expected Shortfall.

Zeldzame overschrijdingen maken korte steekproeven lastig

Bij een VaR van 99% zijn er in 250 dagen slechts 2.5 overschrijdingen te verwachten. Als onafhankelijke hits een kans van 1% hebben, is het verwachte aantal hit-op-hit-overgangen over 249 aangrenzende paren ongeveer 249 × 0.01² = 0.025. De meeste steekproeven zullen geen opeenvolgend paar bevatten, zelfs als het model goed gekalibreerd is. Door die schaarste zijn overgangskansen moeilijk precies te schatten en kan een afhankelijkheidstoets weinig onderscheidingsvermogen hebben.

Christoffersen en Pelletier melden dat bestaande VaR-backtests in realistische kleine steekproeven relatief weinig onderscheidingsvermogen kunnen hebben. In hun artikel uit 2004 onderzoeken ze duurtoetsen die de tijd tussen overschrijdingen modelleren. Dat motiveert een aanvullende diagnose, maar bewijst niet dat een duurtoets altijd beter is of dat je de toets niet op de voorspelling en steekproef hoeft af te stemmen. Zijn er weinig waarnemingen, vermeld dat dan in plaats van niet verwerpen als een goedkeuring te behandelen.

Ook het beoogde staartpercentage telt. Bij een VaR van 95% zijn in 250 dagen 12.5 overschrijdingen te verwachten; bij 99.9% zijn dat er slechts 0.25. Hetzelfde toetslabel maakt bewijs uit verschillende ontwerpen niet vergelijkbaar. Vermeld betrouwbaarheidsniveau, horizon, aantal waarnemingen, beoogde en waargenomen aantallen, overgangsaantallen en of de berekening asymptotisch is of een methode voor eindige steekproeven gebruikt.

Wanneer gebruik je een andere diagnose?

Kies een volgende diagnose door te vragen welke informatie de twee toetsen weglieten. Wil je testen of overschrijdingen voorspelbaar zijn uit vertraagde hits, VaR-voorspellingen of andere variabelen die op het voorspeltijdstip bekend waren, dan toetst de dynamic-quantiletoets (DQ) van Engle en Manganelli restricties op gecentreerde overschrijdingsindicatoren en een gekozen set instrumenten. De conclusie hangt af van die instrumenten en hun timing; de toets omvat niet elke denkbare conditionele fout. Een duurtoets onderzoekt juist de wachttijden tussen overschrijdingen. Beide voegen een ander soort informatie toe. Het CAViaR-artikel beschrijft het DQ-raamwerk.

Gaat de vraag over de omvang van het verlies nadat VaR is overschreden, dan zijn frequentie en onafhankelijkheid alleen niet genoeg. Bekijk de omvang van de overschrijdingen en kies een methode om Expected Shortfall te beoordelen die past bij de voorspelling en aannames. Gaat het om de keuze van het beste resultaat na veel modellen te hebben geprobeerd, dan lost VaR-backtesting het selectierisico niet op. Zie PBO en CSCV voor een andere rangdiagnose.

Een bruikbaar rapport vermeldt het portfolio en de verliesconventie, horizon, betrouwbaarheidsniveau, evaluatiedatums, hoe voorspellingen zijn gemaakt, de overschrijdingsregel, verwachte en waargenomen aantallen, POF-statistiek, overgangsaantallen, resultaten van onafhankelijkheid en conditionele dekking, plus beperkingen door steekproefomvang of overlappende horizons. Voeg grafieken van de voorspelde grens en gerealiseerde verliezen toe en houd latere evaluatiegegevens buiten de modelkeuze. Zo blijven de historische gegevens interpreteerbaar; een geslaagde backtest garandeert geen toekomstige risicobeheersing.

Veelgestelde vragen

Q1Is mijn VaR-model nauwkeurig als de Kupiec-toets niet verwerpt?

Nee. Het betekent dat de toets onder haar aannames niet genoeg bewijs vond tegen het opgegeven overschrijdingspercentage. Een korte steekproef, vooral bij een betrouwbaarheidsniveau van 99% of hoger, bevat mogelijk te weinig overschrijdingen om een probleem te laten zien.

Q2Kunnen twee modellen die dezelfde Kupiec-toets doorstaan toch verschillende overschrijdingspatronen hebben?

Ja. De Kupiec-statistiek hangt af van het aantal en niet van de volgorde. De onafhankelijkheidstoets van Christoffersen voegt informatie toe over clustering in aangrenzende waarnemingen.

Q3Vertellen deze toetsen hoe groot een verlies kan zijn nadat VaR is overschreden?

Nee. Ze gebruiken een binaire overschrijdingsindicator en meten de omvang van de overschrijding niet. Als verliezen voorbij de VaR-grens relevant zijn, bekijk dan de staartverliezen en beoordeel Expected Shortfall afzonderlijk.

Bronnen en verder lezen

Probleem melden

We bereiden een e-mail met de link naar dit artikel voor. Mark ontvangt je melding pas nadat je die verstuurt

Snelle check

De gids gelezen? Test jezelf met 3 vragen

Vraag 1 / 3

Vraag 01

Welke eigenschap gebruikt de Kupiec-POF-toets?

Kies een antwoord om de uitleg te zien

Optiewoordenlijst