VaR-Backtesting: Kupiec- und Christoffersen-Tests erklärt
Erfahre, wie der Kupiec-POF- und der Christoffersen-Test VaR-Ausnahmen beurteilen, wie ein Beispiel mit 250 Tagen zu lesen ist und warum eine Nichtverwerfung keinen Genauigkeitsnachweis darstellt.
In diesem LeitfadenWas prüft ein VaR-Backtest?
Kurze Zusammenfassung
Ein VaR-Backtest vergleicht jede vorhergesagte Verlustschwelle mit dem anschließend eingetretenen Verlust. Der Kupiec-Test fragt, ob die Zahl der Ausnahmen zur Zielrate passt. Die Tests von Christoffersen prüfen zusätzlich, ob Ausnahmen unabhängig auftreten oder sich häufen. Sie prüfen unterschiedliche Eigenschaften der Prognose; keiner beweist, dass ein Risikomodell korrekt ist.
Was prüft ein VaR-Backtest?
Der Value at Risk (VaR) ist eine Verlustschwelle für ein festgelegtes Konfidenzniveau und einen festgelegten Zeithorizont. Beträgt ein eintägiger VaR auf dem 99%-Niveau 10.000 $, setzt das Modell unter seinen angegebenen Informationen und Annahmen die Wahrscheinlichkeit eines Tagesverlusts von mehr als 10.000 $ auf 1 %. Der Betrag ist keine Verlustobergrenze und sagt auch nicht, wie groß ein Verlust nach Überschreiten der Schwelle werden kann.
Beim Backtesting wird eine Folge von Prognosen und Ergebnissen in eine Folge von Ausnahmen übersetzt. Ein gut kalibriertes Modell für eintägigen VaR auf dem 99%-Niveau sollte bei vergleichbaren Beobachtungen langfristig ungefähr in 1 % der Fälle eine Ausnahme melden. Das hat zwei Seiten: Die Gesamtquote sollte nahe am Ziel liegen, und die Ausnahmen sollten nicht in einem Muster auftreten, das den bedingten Risikoprognosen des Modells widerspricht. Der Proportion-of-Failures-Test (POF) von Kupiec konzentriert sich auf den ersten Punkt. Christoffersens Unabhängigkeits- und Bedingte-Deckungs-Tests beziehen die Reihenfolge der Ausnahmen ein.
Diese Unterscheidung ist praktisch relevant. Ein Modell kann in einem Jahr vier Ausnahmen aufweisen, die alle in einer turbulenten Woche aufeinanderfolgen. Ein anderes kann dieselben vier Ausnahmen über das Jahr verteilt zeigen. Ein reiner Zähltest sieht in beiden Fällen vier; ein Test des Zeitmusters sieht unterschiedliche Hit-Sequenzen. Die folgenden Tests helfen, solche Merkmale zu beschreiben. Sie ersetzen weder die Prüfung der Positionen und Marktdaten noch die der Annahmen oder der Verlusthöhe.
Wie GARCH-Modelle Volatilitätscluster beschreiben, erklärt der Leitfaden zu GARCH und Volatilitätsclustering; ein Varianzmodell und ein Backtest beantworten unterschiedliche Fragen.
Die Ausnahme vor dem Zählen definieren
Verwende durchgehend dieselbe Vorzeichenkonvention. Sei Lₜ der realisierte Verlust am Tag t und VaRₜ|ₜ₋₁ die mit den Informationen vor Tag t erstellte eintägige Verlustschwelle. Definiere den Ausnahmeindikator Iₜ als 1, wenn Lₜ > VaRₜ|ₜ₋₁ gilt, andernfalls als 0. Bei einem 99%-VaR-Modell beträgt die Zielwahrscheinlichkeit einer Ausnahme α = 1 − 0,99 = 0,01. Manche Quellen definieren den Indikator anhand von Renditen oder verwenden ein abgedecktes Intervall. Nach Übersetzung von Vorzeichen und Wahrscheinlichkeit sind das gleichwertige Konventionen. Gib an, welche du verwendest.
Prognose und Ergebnis müssen sich auf dasselbe Portfolio, denselben Horizont, Bewertungszeitpunkt und dieselbe Verlustdefinition beziehen. Wird nach Börsenschluss ein VaR für den folgenden Handelstag erstellt, vergleiche ihn anhand einer konsistent festgelegten Bewertungsregel mit dem Verlust dieses Tages. Lege vorab fest, wie du Gleichheit an der VaR-Schwelle, Feiertage, fehlende Beobachtungen, Marktschließungen, nachträgliche Intraday-Korrekturen und Portfolioänderungen behandelst. Solche Entscheidungen können die Hit-Sequenz verändern, besonders bei seltenen Überschreitungen.
Trenne die Modellanpassung von der abschließenden Bewertung. Wurden Parameter oder Risikoschwellen nach Sichtung desselben Zeitraums gewählt, der getestet wird, beschreibt der p-Wert keine saubere Out-of-Sample-Prüfung mehr. Bei rollierenden Prognosen solltest du festhalten, wann jede Prognose erstellt wurde und welche Informationen damals verfügbar waren. Überlappende Mehrtagesprognosen können Abhängigkeit zwischen Ausnahmen erzeugen, selbst wenn Eintages-Ausnahmen unabhängig wären. Die folgenden Standardtests beheben weder unpassende Horizonte und Look-ahead noch revidierte Eingaben oder einen Modellauswahlprozess.
Welche Frage stellt der Kupiec-POF-Test?
Angenommen, es gibt T vergleichbare Prognose-Ergebnis-Paare und x Ausnahmen. Die beobachtete Ausnahmequote beträgt p̂ = x/T. Kupiecs Proportion-of-Failures-Test vergleicht zwei Binomial-Likelihoods: In der einen ist die Ausnahme-Wahrscheinlichkeit auf die Zielgröße α festgelegt, in der anderen wird sie frei als p̂ geschätzt. Die Likelihood-Ratio-Statistik lautet:
LRᵤ꜀ = −2 ln [ (1−α)^(T−x) α^x / ((1−p̂)^(T−x) p̂^x) ]
Unter der Nullhypothese sind Ausnahmen unabhängige Bernoulli-Ereignisse mit Wahrscheinlichkeit α. Bei ausreichend großer Stichprobe ist die Statistik näherungsweise chi-quadrat-verteilt mit einem Freiheitsgrad. Eine große Statistik verwirft die vorgegebene Ausnahmehäufigkeit. Da die Alternative die beobachtete Rate frei schätzt, kann der Test bei zu vielen oder zu wenigen Ausnahmen verwerfen. Ein Modell, dessen VaR kaum überschritten wird, ist nicht automatisch gut kalibriert; seine Risikoprognosen können für den beabsichtigten Zweck übermäßig konservativ sein.
Der POF-Test verwendet die Anzahl x, nicht die Tage, an denen Ausnahmen auftraten. Eine Permutation derselben Hit-Indikatoren ändert daher seine Statistik nicht. Aus einem POF-Ergebnis lässt sich nicht ablesen, ob vier Ausnahmen verteilt oder aufeinanderfolgend waren. Außerdem beruht die binomiale Referenzverteilung auf der Unabhängigkeitsannahme für Ausnahmeindikatoren. Wenn es um Häufungen geht, sollte ein Abhängigkeitstest hinzukommen, statt das Muster aus dem POF-Ergebnis abzuleiten.
Die ursprüngliche Darstellung findet sich in Kupiecs Arbeit von 1995; ein Archivnachweis der Federal Reserve ist ebenfalls verfügbar.
Das Beispiel mit 250 Tagen braucht Einordnung
Betrachte eine hypothetische Folge von 250 eintägigen VaR-Prognosen auf dem 99%-Niveau. Die Zielrate beträgt α = 0,01; unter der Nullhypothese sind also Tα = 250 × 0,01 = 2,5 Ausnahmen zu erwarten. Angenommen, es treten vier Ausnahmen auf. Dann beträgt die beobachtete Rate p̂ = 4/250 = 0,016 oder 1,6 %. Sie liegt über dem Ziel von 1 %, doch die Differenz allein entscheidet nicht darüber, ob der Likelihood-Ratio-Test verwirft.
Mit T = 250, x = 4 und α = 0,01 ergibt sich LRᵤ꜀ ≈ 0,769. Gegen die asymptotische chi-quadrat(1)-Referenz beträgt p ≈ 0,38; der kritische Wert bei 5 % liegt bei etwa 3,84. Nach dieser Näherung verwirft das Beispiel die Nullhypothese der unbedingten Deckung auf dem 5%-Niveau nicht. Die Werte sind hypothetisch und dienen der Erklärung; sie sind weder ein empirisches Ergebnis noch eine allgemeine Akzeptanzschwelle.
Die beiden Log-Likelihoods zeigen, woher die Statistik kommt. Bei festgehaltener Zielrate gilt ℓ₀ = 246 ln(0,99) + 4 ln(0,01) ≈ −20,893. Bei der uneingeschränkten beobachteten Rate gilt ℓ₁ = 246 ln(0,984) + 4 ln(0,016) ≈ −20,508. Die freie Anpassung ist um etwa 0,385 Log-Likelihood-Einheiten besser; daher LRᵤ꜀ = −2(ℓ₀ − ℓ₁) ≈ 0,769. Der Test misst den Anpassungsverlust gegenüber dem Modell mit der Zielrate, keinen Abstand in Dollar.
Eine Nichtverwerfung belegt keine gute Kalibrierung. Bei 250 Tagen waren nur 2,5 Ausnahmen zu erwarten; ein oder zwei zusätzliche Ereignisse verändern die beobachtete Quote deutlich. Die Chi-Quadrat-Referenz ist asymptotisch, und Tests für seltene Ereignisse können bei dieser Stichprobengröße geringe Teststärke haben. Lies die Statistik zusammen mit erwarteter Anzahl, Prognosehorizont, Testdesign und Stichprobengröße. Ein p-Wert ist nicht die Wahrscheinlichkeit, dass das VaR-Modell wahr ist.
Dieselbe Zahl an Ausnahmen kann unterschiedlich verteilt sein
Vergleiche zwei hypothetische Sequenzen mit je 250 Tagen und vier Ausnahmen. In Sequenz A liegen sie an den Tagen 20, 80, 140 und 220. In Sequenz B an den Tagen 60 und 61 sowie 180 und 181. Beide haben x = 4 und p̂ = 1,6 %, also dieselbe Kupiec-Statistik. B enthält jedoch zwei benachbarte Ausnahmepaare, A keines.
Die Skizze macht deutlich, warum die Hit-Sequenz erhalten bleiben sollte und nicht nur ihre Summe. Sie ist konzeptionell, keine 250-tägige Marktdatenfolge und kein Testergebnis. Aufeinanderfolgende Ausnahmen können Anlass sein zu prüfen, ob ein Modell auf veränderte Volatilität zu langsam reagiert. Wenige Punkte allein zeigen aber nicht die Ursache. Das Muster kann auf eine Fehlspezifikation, einen Marktschock, Portfolioänderungen, überlappende Horizonte oder Daten- und Zeitkonventionen zurückgehen.
Für Übergangszahlen sei nᵢⱼ die Anzahl der Fälle, in denen der vorherige Indikator i und der aktuelle j ist; 0 bedeutet keine Ausnahme, 1 eine Ausnahme. Abseits der Stichprobengrenzen gilt für A: n₀₁ = 4 und n₁₁ = 0; für B: n₀₁ = 2 und n₁₁ = 2. Beide Sequenzen enthalten vier Ausnahmen, aber in B folgt ein Teil davon auf eine vorherige Ausnahme. Genau diese Reihenfolge nutzt ein Unabhängigkeitstest erster Ordnung.
Die vollständigen Übergangszahlen lauten für A n₀₀ = 241, n₀₁ = 4, n₁₀ = 4 und n₁₁ = 0; für B entsprechend 243, 2, 2 und 2. Die geschätzte Hit-Wahrscheinlichkeit nach einem Tag ohne Ausnahme ist n₀₁/(n₀₀+n₀₁), nach einem Hit n₁₁/(n₁₀+n₁₁). Bei A sind das 4/245 ≈ 1,63 % und 0/4. Bei B sind es 2/245 ≈ 0,82 % und 2/4 = 50 %. Die 50 % beruhen auf nur vier Übergängen nach einem Hit; sie beschreiben diese winzige hypothetische Sequenz und sind keine glaubwürdige Schätzung des Risikos eines realen Modells am Folgetag.

Was ergänzt Christoffersens Unabhängigkeitstest?
Christoffersens Unabhängigkeitstest vergleicht die Wahrscheinlichkeit einer Ausnahme nach einem ruhigen Tag mit der nach einem Ausnahmetag. Sei π₀ = Pr(Iₜ = 1 | Iₜ₋₁ = 0) und π₁ = Pr(Iₜ = 1 | Iₜ₋₁ = 1). Unter der Nullhypothese der Unabhängigkeit gilt π₀ = π₁: Der Hit-Status des Vortags ändert die Wahrscheinlichkeit eines heutigen Hits nicht. Unter der Alternative werden die beiden Übergangswahrscheinlichkeiten anhand von n₀₀, n₀₁, n₁₀ und n₁₁ separat geschätzt.
Die Likelihood-Ratio-Statistik für Unabhängigkeit vergleicht diese Modelle und wird üblicherweise ebenfalls anhand einer Chi-Quadrat-Verteilung mit einem Freiheitsgrad bewertet. Anders als der POF-Test hängt sie von der Reihenfolge der Indikatoren ab. Folgen auf eine Ausnahme häufiger weitere Ausnahmen, kann π₁ größer als π₀ sein. Der Test betrifft jedoch die Abhängigkeit erster Ordnung in dieser binären Folge; er testet nicht alle Möglichkeiten, wie frühere Informationen, Volatilität oder der Portfoliostatus künftige Verluste vorhersagen könnten.
Bei wenigen Ausnahmen sind Übergangsschätzungen besonders instabil. Eine Folge ohne aufeinanderfolgende Hits kann für π₁ eine Rand-Schätzung von null ergeben. Das beweist nicht, dass ein weiterer Hit unmöglich ist, sondern nur, dass in dieser Stichprobe keiner beobachtet wurde. Betrachte Übergangszahlen und Stichprobengröße zusammen mit der Statistik. Eine dünn besetzte Tabelle ist keine präzise Schätzung des Tail-Risikos am nächsten Tag.
Der Rahmen zur Auswertung bedingter Intervallprognosen geht auf Christoffersens Arbeit von 1998 zurück.
Bedingte Deckung verbindet Häufigkeit und Unabhängigkeit
Der Test auf bedingte Deckung kombiniert die Kupiec-Häufigkeitsstatistik mit der Christoffersen-Unabhängigkeitsstatistik: LR꜀꜀ = LRᵤ꜀ + LRᵢₙd. Die gemeinsame Nullhypothese lautet, dass die Ausnahme-Wahrscheinlichkeit α beträgt und die Ausnahmen über die Zeit unabhängig sind. Im standardmäßigen Großstichproben-Setup wird die Summe mit einer Chi-Quadrat-Verteilung mit zwei Freiheitsgraden verglichen.
Berichte neben dem gemeinsamen Ergebnis auch die einzelnen Komponenten. Eine Verwerfung der bedingten Deckung bedeutet, dass die gemeinsame Bedingung unter den Testannahmen nicht mit der beobachteten Folge vereinbar ist; die Ursache benennt sie nicht. Verwirft der POF-Test, nicht aber der Unabhängigkeitstest, ist möglicherweise die Gesamtzahl das klarere Signal. Verwirft der Unabhängigkeitstest, sollte die zeitliche Häufung auch bei einer zielnahen Gesamtzahl untersucht werden. Verwirft keiner, kann die Stichprobe trotzdem zu kurz sein, um eine Fehlspezifikation aufzudecken.
Der Test hat eine enge Aussagekraft. Er verdichtet jeden Tag zu einem binären Ergebnis und unterscheidet nicht zwischen einer Überschreitung um 1 $ oder um 1 Million $. Er validiert auch nicht die restliche Verlustverteilung oder die Expected Shortfall. Wie sich die Fragen von VaR und Expected Shortfall unterscheiden, erklärt der Leitfaden zu VaR versus Expected Shortfall.
Seltene Ausnahmen erschweren die Inferenz in kleinen Stichproben
Bei 99%-VaR sind in 250 Tagen nur 2,5 Ausnahmen zu erwarten. Bei unabhängigen Hits mit 1 % Wahrscheinlichkeit beträgt die erwartete Zahl von Hit-zu-Hit-Übergängen in 249 benachbarten Tagespaaren ungefähr 249 × 0,01² = 0,025. Die meisten Stichproben enthalten also gar kein benachbartes Ausnahmepaar, selbst wenn das Modell richtig kalibriert ist. Dadurch lassen sich Übergangswahrscheinlichkeiten nur schwer präzise schätzen; ein Abhängigkeitstest kann wenig Teststärke haben.
Christoffersen und Pelletier berichten, dass vorhandene VaR-Backtests in realistischen kleinen Stichproben relativ geringe Teststärke haben können, und untersuchen Tests, die die Dauer zwischen Ausnahmen modellieren. Das motiviert eine zusätzliche Diagnose; es bedeutet nicht, dass ein Dauertest immer überlegen ist oder dass er zu jedem Risikoprognose- und Stichprobendesign passt. Bei wenigen Beobachtungen sollte man das offen sagen, statt eine Nichtverwerfung als Unbedenklichkeitsbescheinigung zu lesen.
Auch die Ziel-Tailrate ist wichtig. Bei 95%-VaR beträgt die nominale Rate 5 %, also sind in 250 Tagen 12,5 Ausnahmen zu erwarten; bei 99,9%-VaR nur 0,25. Derselbe Testname macht die Evidenz aus diesen Designs nicht vergleichbar. Nenne Konfidenzniveau, Horizont, Beobachtungszahl, Ziel- und Ist-Zahl, Übergangszahlen sowie, ob eine asymptotische Referenz oder ein Finite-Sample-Verfahren verwendet wurde.
Christoffersen und Pelletier untersuchen Dauertests zwischen Ausnahmen in ihrer Arbeit von 2004.
Wann ist eine weitere Diagnose sinnvoll?
Wähle den nächsten Test danach aus, welche Informationen die bisherigen Tests verwerfen. Soll geprüft werden, ob Ausnahmen anhand früherer Hits, VaR-Prognosen oder anderer zum Prognosezeitpunkt bekannter Variablen vorhersagbar sind, testet der Dynamic-Quantile-Test (DQ) von Engle und Manganelli Restriktionen auf zentrierte Ausnahmeindikatoren und eine gewählte Instrumentenmenge. Das Ergebnis hängt von diesen Instrumenten und ihrem zeitlichen Informationsstand ab; es testet nicht jedes denkbare bedingte Versagen. Ein Dauertest untersucht stattdessen die Wartezeit zwischen Ausnahmen und erweitert die Analyse um eine andere Eigenschaft.
Geht es um die Höhe des Verlusts nach Überschreiten der VaR-Schwelle, reichen Häufigkeits- und Unabhängigkeitstests nicht. Prüfe die Überschreitungsbeträge und wähle ein zur Prognose und den Annahmen passendes Verfahren zur Expected-Shortfall-Bewertung. Geht es um die Auswahl des besten Ergebnisses nach vielen Modellversuchen, löst VaR-Backtesting das Strategieauswahlproblem nicht. PBO und CSCV behandeln als getrennte rangbasierte Diagnose die Auswahl aus einer Kandidatenfamilie.
Ein brauchbarer Bericht nennt Portfolio und Verlustkonvention, Prognosehorizont, Konfidenzniveau, Bewertungszeitraum, Prognoseverfahren, Ausnahmedefinition, erwartete und beobachtete Anzahl, POF-Statistik, Übergangszahlen sowie Ergebnisse der Unabhängigkeits- und Bedingte-Deckungs-Tests. Beschreibe auch Einschränkungen durch Stichprobengröße oder überlappende Horizonte. Stelle Prognoseschwellen und realisierte Verluste zeitlich dar und halte spätere Evaluationsdaten bei der Modellauswahl zurück. So wird die Evidenz interpretierbar; ein bestandener historischer Test garantiert keine künftige Risikokontrolle.
Engle und Manganelli stellen den Dynamic-Quantile-Test in ihrer CAViaR-Arbeit vor.
Häufige Fragen
Q1Bedeutet ein nicht verworfener Kupiec-Test, dass mein VaR-Modell korrekt ist?
Nein. Die Nichtverwerfung bedeutet, dass der Test unter seinen Annahmen keine ausreichende Evidenz gegen die vorgegebene Ausnahmequote gefunden hat. Eine kurze Stichprobe, insbesondere bei einem Konfidenzniveau von 99 % oder höher, kann zu wenige Ausnahmen enthalten, um ein Problem zu erkennen.
Q2Können zwei Modelle denselben Kupiec-Test bestehen und trotzdem unterschiedliche Ausnahmemuster haben?
Ja. Die Kupiec-Statistik hängt von der Anzahl ab, nicht von ihrer Reihenfolge. Christoffersens Unabhängigkeitstest ergänzt Informationen dazu, ob sich Ausnahmen in benachbarten Beobachtungen häufen.
Q3Zeigen diese Tests, wie groß ein Verlust nach Überschreiten des VaR werden kann?
Nein. Sie verwenden einen binären Ausnahmeindikator und messen nicht die Höhe der Überschreitung. Wenn Verluste jenseits der VaR-Schwelle wichtig sind, prüfe die Tail-Verluste und bewerte den Expected Shortfall gesondert.
Quellen und weiterführende Lektüre
Problem melden
Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden
Schnelltest
Fertig gelesen? Prüfe dich mit 3 Fragen
Frage 01
Welches Merkmal verwendet der Kupiec-POF-Test?
Wähle eine Antwort, um die Erklärung zu sehen
Optionsglossar
The average loss from a chosen VaR quantile through the worst tail under a precise convention; it measures severity beyond the threshold rather than only its location.
Detaillierten Leitfaden lesenGARCHA time-series model that updates conditional variance from past squared shocks and prior variance; it models volatility persistence, not return direction.
Detaillierten Leitfaden lesenOptionszuweisungVerfahren, bei dem die Pflicht zur Vertragserfüllung nach einer Ausübungsmitteilung dem Verkäufer zugeteilt wird und eine Lieferung oder ein Kauf von Aktien entstehen kann.
Detaillierten Leitfaden lesen