Probability Integral Transform: Kalibrierung von Dichteprognosen
Erfahren Sie, wie der Probability Integral Transform kontinuierliche und diskrete Dichteprognosen bewertet und was PIT-Histogramme zeigen können
In diesem LeitfadenWarum ein Punktfehler für Dichteprognosen nicht ausreicht
Kurze Zusammenfassung
Eine Dichteprognose beschreibt mögliche Ergebnisse und die Wahrscheinlichkeit, die jedem Bereich zugeordnet wird. Der Probability Integral Transform (PIT) wandelt ein beobachtetes Ergebnis in seine prognostizierte kumulative Wahrscheinlichkeit um. Gleichverteilte PIT-Werte sind unter bestimmten Voraussetzungen ein nützlicher Kalibrierungsdiagnostik. Ein gleichmäßiges Histogramm allein beweist jedoch weder bedingte Prognosegüte noch zeitliche Unabhängigkeit.
Warum ein Punktfehler für Dichteprognosen nicht ausreicht
Eine Punktprognose könnte für die Rendite am nächsten Tag 0,2 % angeben. Eine Dichteprognose weist dagegen dem gesamten möglichen Renditebereich Wahrscheinlichkeiten zu, einschließlich gewöhnlicher Bewegungen und seltener Extremereignisse. Bei der Bewertung geht es daher darum, ob die vor Beobachtung des Ergebnisses veröffentlichte Verteilung mit dem späteren Ergebnis vereinbar ist. Der Mincer–Zarnowitz-Leitfaden behandelt eine lineare Kalibrierungsregression für numerische Punktprognosen; die Prüfung einer vollständigen Prognoseverteilung ist eine andere Frage.
Der PIT ermittelt, wie viel Wahrscheinlichkeit die Prognose für Werte kleiner oder gleich dem beobachteten Ergebnis angesetzt hat. Er ist ein Wahrscheinlichkeitsrang, keine Rendite, kein Handelssignal und kein Gewinnmaß. Im Finanzbereich kann eine Renditedichte in Risikoschätzungen oder Entscheidungen einfließen, doch der PIT bewertet die prognostizierten Verteilungen. Der Diebold–Mariano-Leitfaden vergleicht durchschnittliche Prognoseverluste anhand einer gewählten Bewertungsregel; das ist eine andere Frage als die Kalibrierung einer Dichteprognose.
Eine kontinuierliche Prognose über ihre Verteilungsfunktion transformieren
Sei \(Y_{t+1}\) das Ergebnis nach dem Prognosezeitpunkt \(t\), und sei \(F_{t+1}(y\mid\mathcal I_t)\) die kumulative Verteilungsfunktion (CDF) der Prognose, die nur auf den zu diesem Zeitpunkt verfügbaren Informationen beruht. Bei einer kontinuierlichen Prognose berechnet man
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ)
Die CDF gibt die Wahrscheinlichkeit für Werte kleiner oder gleich \(y\) an. Wenn sie der wahren bedingten Verteilung des Ergebnisses entspricht, folgt aus dem Probability-Integral-Transform-Satz
Pr(Uₜ₊₁ ≤ u | 𝓘ₜ) = u, for 0 ≤ u ≤ 1
Damit ist der PIT einer idealen kontinuierlichen Ein-Schritt-Prognose bedingt gleichverteilt. Bei einer sequenziellen Auswertung, deren Informationsmenge die Vergangenheit umfasst, sind ideale PIT-Werte unter den geltenden Voraussetzungen zudem zeitlich unabhängig. Die Transformation geht auf Rosenblatt zurück; Diebold, Gunther und Tay machten PIT-Sequenzen für die Bewertung von Dichteprognosen nutzbar (Rosenblatt, 1952; Diebold, Gunther, and Tay, 1998).
Zur Kontrolle von Hand sei eine Prognose \(N(0,1)\) und der beobachtete Wert \(y=1\). Dann ist der PIT \(\Phi(1)\approx0.8413\): Die Prognose wies Werten bis einschließlich 1 etwa 84,13 % Wahrscheinlichkeit zu. Dieser einzelne Wert zeigt nur die Berechnung. Für eine Aussage zur Kalibrierung braucht man eine Folge von Prognosen und Ergebnissen.
Für diskrete Ergebnisse den randomisierten PIT verwenden
Bei einer diskreten Prognose springt die CDF an den möglichen Ergebnissen. Daher kann \(F(Y)\) bei einer korrekten Prognose nur einige wenige Werte annehmen und ist im Allgemeinen nicht gleichverteilt. Ein randomisierter PIT füllt jedes Sprungintervall:
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ) + Vₜ₊₁ [Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ) − Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ)]
Dabei bezeichnet \(F(y^-)\) den linksseitigen Grenzwert, also die Wahrscheinlichkeit eines Werts unter \(y\). \(V\) ist eine unabhängige \(U(0,1)\)-Ziehung, die nur der Auswertung dient. Bei einer kontinuierlichen Verteilung ist der Sprung null und der Ausdruck vereinfacht sich zu \(F(Y)\). Brockwell beweist die randomisierte Transformation für beliebige Verteilungen einschließlich diskreter und gemischter Fälle (2007). Für geordnete Zähldaten erörtern Czado, Gneiting und Held außerdem einen nicht randomisierten PIT und marginale Kalibrierungsdiagramme; solche diskreten Verfahren sollte man nicht am stetigen Gleichverteilungsmaßstab messen (2009).
Angenommen, eine hypothetische Bernoulli-Prognose weist \(P(Y=1)=0{,}20\) und damit \(P(Y=0)=0{,}80\) zu. Der gewöhnliche PIT beträgt 0,80, wenn \(Y=0\) eintritt, und 1,00, wenn \(Y=1\) eintritt. Diese beiden Werte sind nicht gleichverteilt. Bei der Randomisierung wird \(Y=0\) auf \(0{,}80V\) und damit auf \([0,0{,}80]\) abgebildet; \(Y=1\) wird zu \(0{,}80+0{,}20V\) und füllt \([0{,}80,1]\). Die Abschnitte treten mit Wahrscheinlichkeit 0,80 beziehungsweise 0,20 auf, sodass die Gesamtdichte auf \([0,1]\) gleich eins ist. Die Hilfsziehung dient der Bewertung und gehört nicht zur ursprünglichen Prognose.
Marginale Gleichverteilung von Unabhängigkeit und bedingter Kalibrierung trennen
Eine gleichverteilte marginale PIT-Verteilung ist für ideale kontinuierliche Dichteprognosen notwendig, aber nicht hinreichend. Beim Zusammenlegen können sich Fehler aufheben: In einem Marktregime sind Prognosen womöglich zu hoch, in einem anderen zu niedrig, während das Gesamthistogramm flach wirkt. Gneiting, Balabdaoui und Raftery beschreiben Beispiele, in denen ein weitgehend gleichmäßiges PIT-Histogramm mit verzerrten Einzelprognosen einhergeht (2007).
Auch die Reihenfolge ist wichtig. Ein gleichmäßiges Histogramm kann zeitliche Abhängigkeit verbergen, etwa aufeinanderfolgende große Werte oder lange Folgen ähnlicher PIT-Werte. Korrekte bedingte Ein-Schritt-Prognosen erfordern bei einer Informationsmenge, die die Vergangenheit einschließt, mehr als marginale Gleichverteilung. Bei überlappenden Mehrschrittprognosen kann selbst eine korrekte Auswertung abhängige PIT-Werte erzeugen. Die Referenzverteilung muss dieses Design berücksichtigen; Unabhängigkeit darf nicht automatisch angenommen werden.
Prüfen Sie neben der PIT-Verteilung auch ihre Beziehung zu Zeit, verzögerten PIT-Werten, Prognoseursprungsvariablen und vorab festgelegten Regimen. Bedingte Grafiken oder Tests können verborgene Muster sichtbar machen, bringen aber Entscheidungen und Grenzen bei kleinen Stichproben mit sich. Eine begrenzte Auswahl von Tests beweist keine Kalibrierung für jede denkbare Bedingungsvariable.
Ein PIT-Histogramm ist ein Hinweis, kein abschließendes Urteil
Das Histogramm fasst die marginale Verteilung der PIT-Werte in Klassen zusammen. Eine U-Form passt häufig zu zu konzentrierten oder unterdispersen Prognosen; ein Buckel in der Mitte häufig zu zu breiten oder überdispersen Prognosen. Ein Ungleichgewicht zwischen links und rechts kann auf einen Lagefehler hindeuten. Das sind jedoch heuristische Hinweise und keine eindeutigen Diagnosen: Abhängigkeit, gemischte Regime, diskrete Ergebnisse, Klassengrenzen und kleine Stichproben können irreführende Formen erzeugen.
Das Histogramm verwirft die zeitliche Reihenfolge. Es zeigt weder, wann ein Kalibrierungsproblem begann, noch ob große PIT-Werte gehäuft auftreten oder eine Teilgruppe fehlkalibriert ist. Breite Klassen und wenig Daten können flach wirken; schmale Klassen zeigen womöglich nur Stichprobenrauschen. Berichten Sie Zahl der Prognosen, Klassengrenzen und nach Möglichkeit Unsicherheit; untersuchen Sie zusätzlich zeitliche Abhängigkeit und vorab gewählte bedingte Teilgruppen. Zu formalen Verteilungstests zählen der Rahmen von Diebold–Gunther–Tay und Berkowitz’ Likelihood-Ratio-Test mit transformiertem PIT: Berkowitz transformiert innere PIT-Werte zu \(Z_t=\Phi^{-1}(U_t)\) und prüft die gemeinsame Nullhypothese unabhängiger Standardnormalwerte gegen eine spezifizierte dynamische Alternative wie AR(1). Die Schlussfolgerung hängt von den Testannahmen ab; weder Grafik noch Einzeltest sind ein allgemeines Gütesiegel (Berkowitz, 2001).
<!-- learn:illustration -->

Parameterschätzung berücksichtigen und außerhalb der Stichprobe bewerten
Das Gleichverteilungsergebnis setzt voraus, dass die Prognose-CDF das wahre bedingte Gesetz ist. In der Praxis werden Parameter geschätzt, Verteilungsfamilien ausgewählt und Merkmale oder Schwellenwerte angepasst. \(F_{t+1}(\cdot;\hat\theta_t)\) ist daher Teil eines Prognoseverfahrens und keine bekannte wahre CDF. Werden Ergebnisse aus der Auswertungsperiode zur Parameterschätzung verwendet und die daraus berechneten PIT-Werte anschließend als unberührter Out-of-Sample-Nachweis bezeichnet, fließen Prüfdaten in die Anpassung ein.
Bei einer rollierenden Auswertung muss jede Prognose nur die an ihrem Ursprung verfügbaren Informationen verwenden. Dokumentieren Sie Schätzfenster, Neuschätzungsfrequenz, Datenstand, Modellversion und Modellwahl. Diese Entscheidungen verändern das bewertete Verfahren. Benachbarte rollierende Fenster teilen Beobachtungen und können deshalb Abhängigkeit erzeugen; überlappende Horizonte kommen hinzu. Simulation oder Bootstrap sollten die tatsächliche Schätzungs- und Prognosepipeline wiederholen.
Die Auswirkungen auf Testgröße und Teststärke hängen von Schätzer, Stichprobe und Test ab. Ein PIT-Histogramm berücksichtigt keine Parameterunsicherheit; iid-Referenzwerte passen nicht automatisch zu jedem geschätzten oder überlappenden Design. Wenn Inferenz wichtig ist, wählen Sie einen Test mit passenden Voraussetzungen oder simulieren/bootstrapen Sie die vollständige Pipeline. Halten Sie eine abschließende Auswertungsstichprobe von der Modellauswahl getrennt, wenn echte Out-of-Sample-Evidenz gefragt ist.
Kalibrierung und Schärfe der Prognose auseinanderhalten
Kalibrierung betrifft das gemeinsame Verhalten von Prognosen und Ergebnissen: Treten Ereignisse mit zugewiesener Wahrscheinlichkeit entsprechend häufig ein, und passen die Verteilungen zu den Beobachtungen? Die Schärfe (sharpness) beschreibt die Konzentration der Prognoseverteilungen selbst, ohne die Ergebnisse heranzuziehen. Gneiting, Balabdaoui und Raftery empfehlen, die Schärfe bei gegebener Kalibrierung zu erhöhen, nicht sie als Ersatz für Kalibrierung zu behandeln.
Eine breite Prognose kann kalibriert, aber wenig informativ sein. Eine enge Prognose wirkt präzise, ist jedoch schlecht kalibriert, wenn die Ergebnisse häufig außerhalb ihrer Masse liegen. Der PIT prüft die Verteilungskonsistenz; Schärfemaße beschreiben Streuung, Intervallbreite oder Konzentration. Das eine kann besser werden, während das andere schlechter wird.
Ein zusammengefasstes PIT kann gleichmäßig erscheinen, obwohl Fehler vom Volatilitätsregime oder Prognosehorizont abhängen. Wenn solche Bedingungen für die Nutzung wichtig sind, legen Sie sie vorher fest. Das ist verwandt, aber nicht dasselbe wie der Giacomini–White-Test auf bedingte Prognosefähigkeit, der Prognoseverluste anhand ausgewählter Informationen vergleicht.
Vollständige Prognosen mit proper scores auf gemeinsamen Ergebnissen vergleichen
Der PIT ist hauptsächlich diagnostisch und liefert keine einzelne Rangfolge konkurrierender Dichteprognosen. Proper Scoring Rules wie logarithmischer Score und Continuous Ranked Probability Score (CRPS) weisen jeder Prognose und jedem Ergebnis einen skalaren Verlust zu. Nach ihrer Definition wird der erwartete Verlust minimiert, wenn die wahre Prognoseverteilung angegeben wird. Modelle lassen sich auf gemeinsamen Out-of-Sample-Ergebnissen vergleichen; ein einzelner Stichprobenmittelwert beweist aber nicht, dass ein Modell korrekt ist. Der Model-Confidence-Set-Leitfaden vergleicht Prognoseverfahren als Menge. Für Dichteprognosen braucht man einen proper score, der für die vollständige Verteilung definiert ist.
Nennen Sie Ziel, Horizont, gemeinsame Termine, Verlustkonvention und Benchmark. Der logarithmische Score reagiert besonders stark, wenn eine Prognose einer Beobachtung nur sehr geringe Dichte zuweist; CRPS vergleicht kumulative Verteilungen und reagiert anders. Berichten Sie Unsicherheit der Score-Differenz unter Berücksichtigung von Abhängigkeit, Schätzung und Modellsuche. PIT-Diagramme zeigen mögliche Verteilungsfehler; Scores fassen Vergleichsleistung unter einer festgelegten Strafe zusammen.
Weder Kalibrierung noch ein besserer Score beweist Handelsprofitabilität. Dazu braucht es separat eine Entscheidungsregel, Informationszeitpunkt, Positionsgröße, Ausführungs- und Finanzierungskosten und eine Out-of-Sample-Renditeauswertung. Eine Prognosekennzahl ist keine Backtest-Rendite.
Einen reproduzierbaren PIT-Ablauf festhalten
Legen Sie Prognoseziel, Horizont, Ursprungszeitpunkt, Datenstand des Ergebnisses und kontinuierlichen, diskreten oder gemischten Verteilungstyp fest. Speichern Sie jede prognostizierte CDF oder genügend Informationen für ihre Reproduktion zusammen mit Ergebnis und Informationsmenge. Berechnen Sie \(F_t(Y_t)\) für kontinuierliche Prognosen; bei Sprüngen dokumentieren Sie den randomisierten PIT oder ein diskretes Diagnoseverfahren.
Untersuchen Sie danach Verteilung und zeitliche Reihenfolge. Berichten Sie Histogrammklassen, Stichprobengröße, Umgang mit Bindungen und bei diskreten Prognosen Seed oder Wiederholungen. Ergänzen Sie vorab festgelegte Unabhängigkeits- oder Bedingungstests und verwenden Sie Inferenz, die rollierende, überlappende oder geschätzte Prognosen berücksichtigt. Vergleichen Sie Modelle abschließend mit proper scores auf denselben zurückgehaltenen Ergebnissen. Das ist Evidenz zu bestimmten Prognosen und Bedingungen, kein Beweis dauerhafter Kalibrierung oder profitablen Handels.
Häufige Fragen
Q1Beweist ein gleichverteilter PIT, dass eine Dichteprognose korrekt ist?
Nein. Er ist eine notwendige Diagnosebedingung bei einer korrekten kontinuierlichen Prognose, aber marginale Gleichverteilung beweist weder Unabhängigkeit noch bedingte Kalibrierung. Prüfen Sie zeitliche Abhängigkeit und relevante Bedingungen.
Q2Sollte ich bei einer diskreten Prognose den randomisierten PIT verwenden?
Wenn Sie unter einer korrekten diskreten Verteilung eine kontinuierliche Gleichverteilungsreferenz möchten, können Sie ihn verwenden. Die Hilfsziehung verteilt das Ergebnis über den CDF-Sprung. Dokumentieren Sie Methode und Seed oder verwenden Sie eine diskrete Diagnose, wenn Sie Randomisierung vermeiden wollen.
Q3Was bedeutet ein U-förmiges PIT-Histogramm?
Es passt häufig zu zu konzentrierten Prognoseverteilungen; ein Buckel in der Mitte passt oft zu zu breiten Prognosen. Behandeln Sie das als Hinweis und prüfen Sie Abhängigkeit, Regime, Stichprobe und Klassengrenzen.
Q4Ist ein besseres PIT-Histogramm gleichbedeutend mit einem besseren Prognosescore?
Nein. Diagramme diagnostizieren Verteilungen; proper scores vergleichen Prognosen unter einem festgelegten Verlust und Ziel. Berichten Sie bei Bedarf beides auf gemeinsamen Out-of-Sample-Ergebnissen, ohne eines als Handelsgewinn zu deuten. Primärforschung - Rosenblatt, “Remarks on a Multivariate Transformation” (1952) - Diebold, Gunther, and Tay, “Evaluating Density Forecasts with Applications to Financial Risk Management” (1998) - Berkowitz, “Testing Density Forecasts, with Applications to Risk Management” (2001) - Gneiting, Balabdaoui, and Raftery, “Probabilistic Forecasts, Calibration and Sharpness” (2007) - Brockwell, “Universal Residuals: A Multivariate Transformation” (2007) - Czado, Gneiting, and Held, “Predictive Model Assessment for Count Data” (2009)
Quellen und weiterführende Lektüre
Problem melden
Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden
Schnelltest
Fertig gelesen? Prüfe dich mit 3 Fragen
Frage 01
Was folgt aus dem PIT-Satz für eine korrekte kontinuierliche bedingte Ein-Schritt-Prognose?
Wähle eine Antwort, um die Erklärung zu sehen