Skip to content
Alle Leitfäden zu Optionen und Futures
Gemeinsame Bewertung von Tail-Risk-Prognosen14 Min.

VaR und Expected Shortfall gemeinsam bewerten: Fissler–Ziegel erklärt

Erfahren Sie, warum Value at Risk und Expected Shortfall eine gemeinsame Bewertungsregel benötigen, wie Fissler–Ziegel-Scores Prognosen vergleichen und worin sie sich von VaR-Ausnahmetests unterscheiden.

In diesem LeitfadenBeginnen Sie mit dem Prognosepaar und der Tail-Konvention

Kurze Zusammenfassung

VaR ist ein Quantil und lässt sich allein mit einem Quantilverlust bewerten. Expected Shortfall (ES) ist anders: Über breite Verteilungsklassen hinweg ist ES als eigenständige Punktprognose nicht elicitable. Fissler und Ziegel zeigen, dass sich VaR und ES unter geeigneten Bedingungen gemeinsam mit einem strikt konsistenten Score bewerten lassen. Das ermöglicht den Vergleich von Prognosepaaren, beweist aber nicht, dass ein Modell mit niedrigem Score korrekt ist.

Beginnen Sie mit dem Prognosepaar und der Tail-Konvention

Sei L_t ein Verlust, bei dem größere Werte schlechter sind, und c ein Konfidenzniveau, etwa 97,5 %. Das bedingte Verlustquantil v(c,t) ist das kleinste x, für das F(L_t ≤ x | Information bis t−1) mindestens c erreicht. Für den oberen Verlust-Tail ist ES e(c,t) = 1/(1−c) mal das Integral der Quantile v(u,t) von c bis 1, sofern der Tail-Mittelwert endlich ist. Bei stetiger Verteilung entspricht dies dem durchschnittlichen Verlust jenseits der VaR-Schwelle. Bei einer Punktmasse an der Schwelle berücksichtigt die Quantil-Integraldefinition nur den erforderlichen Anteil dieser Masse.

Die Vorzeichenkonvention muss zu den Prognosen passen. Manche Arbeiten verwenden Renditen im unteren Tail, oft mit negativen VaR- und ES-Werten, und bezeichnen die Tail-Wahrscheinlichkeit mit α = 1−c. Bei positiven Verlusten liegt derselbe Risikobereich im oberen Tail; ES ist dann mindestens so groß wie VaR. Werden Rendite- und Verlustkonvention vermischt, können sich Ungleichungen und Ausnahmekennzahlen umkehren. Dokumentieren Sie Vorzeichen, Konfidenzniveau, Horizont und den Informationsstand vor Eintritt des Ergebnisses.

Warum VaR und ES nicht denselben eigenständigen Score haben

Ein Quantil lässt sich mit einem Pinball-Score strikt konsistent bewerten. Für einen Verlust L und das c-Quantil v lautet eine Variante S_VaR(v,L) = (I{L ≤ v}−c)(v−L). Bei den üblichen Quantilbedingungen wird der erwartete Score am Zielquantil minimiert. Damit kann VaR allein anhand der Prognose und der späteren Beobachtung bewertet werden.

Für ES gibt es über die breiten Verteilungsklassen des Risikomanagements keinen entsprechenden strikt konsistenten Score, der ES allein als Punktprognose elicitable macht. Diese Aussage ist begrenzt: Gemeint ist ein Score, dessen Erwartungswert eindeutig durch eine einzelne ES-Prognose minimiert wird. Sie bedeutet weder, dass ES unbrauchbar ist, noch dass ES-Prognosen nicht verglichen oder getestet werden können.

Fissler und Ziegel zeigen den entscheidenden Unterschied: ES ist in diesem Sinn allein nicht elicitable, das Paar (VaR, ES) dagegen unter milden Regularitäts- und Momentbedingungen gemeinsam. Ihre Arbeit untersucht allgemeine Bedingungen für strikt konsistente Scores (Fissler und Ziegel, 2016). Gemeinsame Elicitierbarkeit bedeutet, dass ein Score beide Prognosen und das realisierte Ergebnis verwendet. Zwei beliebige Einzelverluste zu addieren ergibt deshalb noch keinen gültigen ES-Score.

Was ein Fissler–Ziegel-Score bewertet

Bezeichnen Sie einen zulässigen gemeinsamen Score zum Niveau c mit S_c(v,e;L). Strikte Konsistenz bedeutet, dass der erwartete Score unter der Zielverteilung beim richtigen Paar minimiert wird: (VaR_c, ES_c) = arg min über (v,e) von E[S_c(v,e;L)]. Unter den einschlägigen Bedingungen ist dieses Minimum eindeutig. Der Score verknüpft Informationen darüber, ob die VaR-Schwelle überschritten wurde, mit der Höhe des realisierten Tail-Verlusts und der ES-Prognose. Bei positiven Verlusten darf ES nicht unter VaR liegen.

Fissler und Ziegel beschreiben eine Scoreklasse, keine einzelne vorgeschriebene Formel. Patton, Ziegel und Chen verwenden das Ergebnis für dynamische gemeinsame VaR- und ES-Modelle sowie Prognosevergleiche (Patton, Ziegel und Chen, 2019). Ein verbreiteter FZ0-Score verwendet untere Rendite-Tails: Y = −L, α = 1−c und negative Prognosen e ≤ v < 0: S_FZ0(Y,v,e;α) = −I{Y ≤ v}(v−Y)/(αe) + v/e + ln(−e) − 1. Diese Formel setzt die Renditekonvention und die genannten Vorzeichen voraus. Sie ist keine unveränderte Formel für positive Verluste und nicht automatisch der beste Score für jeden Datensatz. Geben Sie die gewählte Regel an und prüfen Sie ihre Annahmen.

Mittelwerte und Score-Differenzen richtig lesen

Für Modell m berechnen Sie je Prognose-Ergebnis-Paar S_c(v_hat(m,t), e_hat(m,t); L_t) und mitteln über T Beobachtungen. Bei gleichem zulässigem Score, Ziel, Zeitraum und gleichen Konventionen ist ein niedrigerer Mittelwert relativ zu dieser Regel besser. Der Zahlenwert ist weder eine Wahrscheinlichkeit noch ein VaR-Betrag oder ein prognostizierter Geldverlust; seine Skala hängt vom Score ab.

Für den gepaarten Vergleich bilden Sie d_t = S_A,t − S_B,t. Ein negativer Mittelwert spricht für A nach dem gewählten Score. Beide Prognosen erhalten dieselbe Realisierung, daher ist die gepaarte Differenz aussagekräftiger als zwei getrennt gerundete Mittelwerte. Bei wenigen Tail-Beobachtungen kann auch sie stark schwanken.

<!-- learn:illustration -->

Vergleichen Sie dieselben Prognoseursprünge, dasselbe Portfolio oder Ziel, denselben Horizont, dasselbe Konfidenzniveau und denselben Datenstand. Prognosen müssen vor den Ergebnissen aufgezeichnet sein. Überlappende Horizonte oder serielle Abhängigkeit in den Score-Differenzen müssen sich in Standardfehlern oder Intervallen widerspiegeln. Ein kleiner roher Abstand ist allein kein belastbarer Sieg.

Zwei abstrakte Verteilungskurven, eine vertikale Schwelle und ein hervorgehobener Randbereich stehen über zwei verbundenen Schalen zum Vergleich gemeinsamer VaR- und ES-Prognosen. Die Grafik enthält keine Daten oder Beschriftungen.
Konzeptionelle Darstellung von Schwelle, Verteilungsschwanz und gemeinsamer Bewertung von VaR und ES; keine beobachtete Verteilung oder Prognose.

Warum zwei Einzelverluste nicht genügen

Es mag naheliegen, den VaR-Pinball-Verlust um einen absoluten Fehler der ES-Prognose zu ergänzen. Der ES-Referenzwert muss dann aber selbst geeignet sein; außerdem muss der erwartete zweite Term nicht am wahren ES minimiert werden. Eine beliebig gewichtete Summe besitzt nicht automatisch die gemeinsame Konsistenz. Beim FZ-Score ist die Form so konstruiert, dass das Paar VaR und ES gemeinsam bewertet wird.

Die Fissler–Ziegel-Klasse enthält mehrere Scores mit unterschiedlichen Skalen und Gewichtungen. Mittelwerte aus verschiedenen Scorefunktionen sind nicht direkt vergleichbar. Patton, Ziegel und Chen diskutieren FZ0 mit zusätzlichen Vorzeichenannahmen und bestimmten Skaleneigenschaften; daraus folgt keine universelle Überlegenheit. Wählen und dokumentieren Sie die Regel, bevor Sie die Prognoserangfolge betrachten.

Auch das Prognosepaar muss zusammenpassen. Eine scheinbar plausible ES-Zahl kann zusammen mit einem widersprüchlichen VaR schlecht abschneiden. Umgekehrt beweist ein guter gemeinsamer Score nicht, dass die gesamte bedingte Verteilung korrekt ist. Bewertet wird die angegebene VaR–ES-Funktion unter dem gewählten Score und Design.

Gleiche VaR-Ausnahmen können unterschiedliche Tail-Verluste verbergen

Ein VaR-Ausnahmeindikator ist binär: I_t = 1, wenn L_t die prognostizierte VaR-Schwelle überschreitet, sonst 0. Zwei Modelle können dieselben Ausnahmedaten haben, obwohl Verluste jenseits der Schwelle sehr unterschiedlich groß sind. Vier Überschreitungen sagen nicht, ob jede nur knapp war oder eine davon viel tiefer in den Tail reichte. Ein reiner Trefferzähler verwirft genau die Größeninformation, die ES ergänzen soll.

Ein gemeinsamer Score verwendet beide Prognosen zusammen mit dem realisierten Verlust; je nach gewählter Regel können daher Tail-Beträge über die Trefferzahl hinaus wirken. Wie stark ein einzelner Verlust zählt, ergibt sich aus der Scorefunktion. Bestimmen Sie den Gewinner nicht anhand eines Extremereignisses, sondern berechnen Sie den Score über die gemeinsame Stichprobe und prüfen Sie die Sensitivität.

Scorebasierter Prognosevergleich und VaR-Kalibrierung beantworten verschiedene Fragen. Der erste ordnet Prognosepaare nach einer festgelegten Regel. Ein VaR-Ausnahmetest prüft dagegen Häufigkeit oder Zeitmuster der Schwellenüberschreitungen. Eine Rangfolge ist kein vollständiges Kalibrierungszertifikat.

Ausnahmetests und ES-Backtests beantworten andere Fragen

Kupiec-Tests vergleichen die Zahl der VaR-Ausnahmen mit der Zielquote; Christoffersen-Erweiterungen untersuchen auch Abhängigkeit oder Cluster. Da diese Verfahren jedes Ergebnis zu Treffer oder Nichttreffer verdichten, messen sie weder die Höhe der Überschreitungen noch prüfen sie direkt die ES-Prognose. Der VaR- und Expected-Shortfall-Leitfaden erläutert, welche unterschiedlichen Informationen die beiden Risikomaße enthalten.

Acerbi und Szekely schlagen nichtparametrische ES-Backtests vor und betonen, dass Elicitierbarkeit für Modellauswahl relevant ist, aber keine Voraussetzung für einen Risikotest (Acerbi und Szekely, 2014). Bayer und Dimitriadis entwickeln regressionsbasierte ES-Backtests mit gemeinsamer VaR–ES-Struktur; ihre Varianten haben jeweils eigene Annahmen und Anforderungen an die Kovarianzschätzung (Bayer und Dimitriadis, 2022). Ein Score-Ranking ersetzt keinen gezielten Backtest. Eine Nichtzurückweisung beweist umgekehrt nicht, dass das Prognosepaar korrekt ist.

Gepaarte Inferenz planen und nachträgliche Auswahl vermeiden

Die Folge d_t der Score-Differenzen ist selbst eine Zeitreihe. Bei nicht überlappenden Ein-Schritt-Prognosen und passenden Abhängigkeitsannahmen kann ein gepaarter Test des mittleren Unterschieds sinnvoll sein. Bei serieller Abhängigkeit oder überlappenden Horizonten braucht die Unsicherheit eine dazu passende Methode, etwa eine geeignete Langfristvarianz oder Block-Stichprobenziehung. Berichten Sie Verfahren und Bandbreite beziehungsweise Blockregel statt nur eines p-Werts.

Legen Sie Score, Tail-Niveau, Horizont, Auswertungszeitraum und Modellmenge fest, bevor Sie Ergebnisse vergleichen. Wer viele Scores, Zeitfenster, Portfolios und Prognosevarianten ausprobiert und nur den besten Wert zeigt, unterliegt einem Auswahlproblem. Bewahren Sie möglichst einen späteren, unberührten Testzeitraum auf und beschreiben Sie die Suche. Die üblichen Standardfehler berücksichtigen diese Auswahl nicht automatisch.

Berichten Sie Mittelwerte und gepaarte Differenz samt Unsicherheit, Scoredefinition, Vorzeichen und Konventionen, gemeinsame Out-of-Sample-Daten sowie die Zahl der Tail-Beobachtungen. Ändert sich die Rangfolge unter vernünftigen Score- oder Zeitraumvarianten, sollte die Sensitivität sichtbar bleiben.

Grenzen und Checkliste für die Berichterstattung

Bei hohen Konfidenzniveaus gibt es nur wenige Tail-Beobachtungen. Eine lange Zeitreihe kann deshalb trotzdem eine instabile Modellrangfolge liefern. Bedingte Heteroskedastizität, Regimewechsel, überlappende Renditen, Parameterschätzung, Datenfehler und Änderungen im Portfolio beeinflussen Score-Differenzen. Gemeinsame Elicitierbarkeit beseitigt diese Probleme nicht; sie liefert eine begründete Scoreklasse unter mathematischen Voraussetzungen.

Prüfen Sie, ob realisierter Verlust und Prognose dasselbe Portfolio, denselben Horizont, dieselbe Bewertung und dasselbe Vorzeichen haben. VaR und ES müssen dasselbe Tail-Niveau meinen. Die Prognosen müssen ex ante erstellt worden sein und die Scorefunktion muss zu ihren Verteilungs-, Moment- und Vorzeichenannahmen passen. Berichten Sie Stichprobenlänge, Tail-Treffer, Score, Unsicherheitsverfahren sowie Modell- und Score-Auswahl. Die Schlussfolgerung gilt nur für dieses Design.

Ein niedrigerer gemeinsamer Score ist Evidenz für bessere relative Prognoseleistung unter einer bestimmten Regel. Er belegt weder, dass alle Tail-Ereignisse erfasst sind, noch dass ein Risikomodell sicher ist oder künftige Ergebnisse der Stichprobe entsprechen. Dieser Beitrag erläutert statistische Methoden und ist keine Anlageberatung.

Häufige Fragen

Q1Kann ich ES-Prognosen mit absolutem Fehler vergleichen?

Nicht als allgemeingültigen Ersatz für einen strikt konsistenten Score. Für einen Punktprognosevergleich wird ES typischerweise zusammen mit VaR bewertet; für Kalibrierung eignen sich gezielte ES-Backtests.

Q2Zeigt ein gemeinsamer Score, ob ein Risikomodell kalibriert ist?

Er vergleicht relative Leistung unter einem gewählten Score. Kalibrierung und Modellspezifikation sind getrennte Fragen und benötigen passende Tests und Diagnosen.

Q3Können zwei Modelle dieselben VaR-Ausnahmen haben und trotzdem andere Scores erhalten?

Ja. Trefferindikatoren können übereinstimmen, während Überschreitungsverluste oder ES-Prognosen abweichen. Die genaue Wirkung hängt von der Scorefunktion ab.

Q4Bedeutet ein niedriger Score, dass ein Modell sicher ist?

Nein. Das Ergebnis gilt für Stichprobe, Score und Annahmen. Wenige Tail-Daten, Regimewechsel, Modellauswahl oder Datenprobleme können das Resultat beeinflussen. Dies ist keine Anlageberatung.

Quellen und weiterführende Lektüre

Problem melden

Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden

Schnelltest

Fertig gelesen? Prüfe dich mit 3 Fragen

Frage 1 / 3

Frage 01

Warum wird Expected Shortfall häufig zusammen mit VaR bewertet?

Wähle eine Antwort, um die Erklärung zu sehen

Optionsglossar