Skip to content
Alle Leitfäden zu Optionen und Futures
Prognoseprüfung13 Min. Lesezeit

Giacomini–White-Test: Bedingte Prognosegüte

Wie der Giacomini–White-Test prüft, ob bekannte Bedingungen mit der relativen Prognosegüte zusammenhängen, wie Instrumente gewählt werden und was das Ergebnis aussagt

In diesem LeitfadenDurchschnittliche und bedingte Prognosegüte beantworten verschiedene Fragen

Kurze Zusammenfassung

Der Giacomini–White-Rahmen (GW) fragt, ob der relative Verlust zweier Prognosen mit Informationen zusammenhängt, die zum Prognosezeitpunkt verfügbar waren. So können Unterschiede sichtbar werden, die ein Durchschnittswert verdeckt. Das Ergebnis hängt jedoch von den Prognosen, dem Auswertungsfenster, der Verlustfunktion und den vorab gewählten Bedingungsvariablen ab.

Durchschnittliche und bedingte Prognosegüte beantworten verschiedene Fragen

Angenommen, Prognose A hat in einer Teststichprobe einen niedrigeren durchschnittlichen Verlust als Prognose B. Der Mittelwert kann ein Muster verbergen: A ist vielleicht in ruhigen Märkten besser, B dagegen bei hoher Volatilität. Wer wissen will, welche Prognose im Durchschnitt besser war, vergleicht die unbedingten Verluste. Wer fragt, ob am Prognosezeitpunkt bekannte Informationen anzeigen, welche Prognose besser abschneidet, untersucht bedingte Prognosefähigkeit.

Giacomini und White formulieren dies als Vergleich von Prognosemethoden unter einer festgelegten Verlustfunktion und Informationsmenge. Der Rahmen eignet sich für Punkt-, Intervall-, Wahrscheinlichkeits- und Dichteprognosen, sofern die Verlustfunktion zur jeweiligen Aufgabe passt. Auch das Schätzverfahren, mit dem eine Prognose erzeugt wird, gehört zur Methode. Ein rollierendes Fenster, eine feste Trainingsstichprobe oder eine Gewichtungsregel sind daher Teil des geprüften Verfahrens und keine nebensächlichen Einstellungen, die man nach Sichtung der Ergebnisse ändern sollte (Giacomini und White, 2006).

Die Frage hängt mit Strukturbruchtests zusammen, ist aber nicht identisch mit ihnen. Ein bedingter Test fragt, ob der relative Prognoseverlust systematisch mit ausgewählten Informationen verbunden ist. Ein Strukturbruchtest fragt, ob sich Parameter oder ein Zusammenhang zu einem unbekannten oder festgelegten Zeitpunkt geändert haben. Der Diebold–Mariano-Leitfaden behandelt den unbedingten Vergleich durchschnittlicher Verluste; für eine bedingte Frage müssen die Konditionierungsinformationen ausdrücklich festgelegt werden.

Prognosen, Ergebnisse und Informationen zuerst aufeinander abstimmen

Sei (Y_{t+1}) das Ergebnis, das nach dem Prognoseursprung (t) beobachtet wird. Die Prognosen ŷA,t+1 und ŷB,t müssen dasselbe Ziel, denselben Horizont, dieselben Einheiten und denselben Informationsstichtag abdecken. Bei einer Verlustfunktion (L), bei der weniger besser ist, lautet die Verlustdifferenz:

dₜ₊₁ = L(Yₜ₊₁, ŷA,ₜ₊₁) − L(Yₜ₊₁, ŷB,ₜ₊₁)

Bei dieser Vorzeichenkonvention bedeutet ein positiver Wert, dass A mehr Verlust verursacht hat und B an diesem Ursprung besser war. Ein negativer Wert spricht für A. Verwenden Sie eine Zeile je Prognoseursprung und bewerten Sie beide Prognosen anhand derselben Realisierung. Bewahren Sie die zum damaligen Zeitpunkt verfügbaren Prognosen sowie Datenstand und Modellversion auf. Erzeugen Sie historische Prognosen nicht mit revidierten Eingaben oder später verfügbaren Informationen neu.

Auch die Konditionierungsvariablen müssen am Prognoseursprung bekannt sein. Beispiele sind eine verzögerte Volatilitätsschätzung, ein vorab angekündigtes Ereignis, eine verzögerte Verlustdifferenz oder ein Marktstatus, der ausschließlich aus vergangenen Beobachtungen berechnet wird. Eine nach (t) gemessene Variable kann ohne Look-ahead-Bias nicht erklären, welche Prognose zum Zeitpunkt (t+1) besser gewesen wäre.

Die Bewertungsmetrik muss zum Ziel passen. Der quadrierte Fehler ist eine mögliche Verlustfunktion für Prognosen des bedingten Mittelwerts, eignet sich aber nicht automatisch für Volatilitäts-, Quantil- oder Dichteprognosen. Sagt ein Modell die Varianz und ein anderes die Standardabweichung voraus, müssen beide zunächst dieselbe Größe prognostizieren. Ein Test kann eine unpassende Fragestellung nicht korrigieren.

Bewerten Sie Volatilitätsprognosen anhand derselben Definition der realisierten Varianz und desselben Stichprobenintervalls. Deckt eine Prognose nur Intraday-Preise ab, eine andere aber auch Renditen über Nacht, kann die Verlustdifferenz auf unterschiedliche Ziele statt auf Prognosefähigkeit zurückgehen. Legen Sie fest, wie Kursbewegungen während Marktschließungen, Stichprobenfrequenz, fehlende Beobachtungen und das realisierte Maß behandelt werden, und wenden Sie diese Regeln einheitlich an. Ist der realisierte Proxy verrauscht, beeinflusst der Messfehler beide Verlustwerte und muss bei der Interpretation berücksichtigt werden.

Bedingte Nullhypothese formulieren und Testfunktionen wählen

Sei (mathcal{G}_t) die Informationsmenge, auf die der Vergleich bedingt wird. Die idealisierte Nullhypothese lautet:

H₀: E[dₜ₊₁ | 𝒢ₜ] = 0

Sie besagt, dass die erwartete Verlustdifferenz gegeben die festgelegten Informationen null ist. Der Ein-Schritt-GW-Test übersetzt diese bedingte Aussage in Momentbedingungen anhand eines vorab gewählten Vektors von Testfunktionen (h_t). Jede Funktion darf nur Informationen verwenden, die zum Zeitpunkt (t) verfügbar sind:

H₀,ₕ: E[hₜ dₜ₊₁] = 0

Eine Konstante in (h_t) erfasst die durchschnittliche Verlustdifferenz. Weitere Elemente können einen Marktstatus, einen verzögerten relativen Verlust oder eine nichtlineare Transformation darstellen, die vor der Auswertung festgelegt wurde. Beispielsweise prüft (h_t=(1,S_t)'), wobei (S_t) zum Zeitpunkt (t) eine bekannte binäre Anzeige für hohe Volatilität ist, sowohl ein konstantes Moment als auch den Zusammenhang der Verlustdifferenz mit diesem Zustand.

Eine endliche Menge an Testfunktionen prüft nur die dadurch definierten Momente. Bei einer Verwerfung ist mindestens eines der ausgewählten Momente unter den Testannahmen nicht mit null vereinbar. Das identifiziert weder ein universell bestes Modell noch beweist es, dass jede denkbare Zustandsvariable relevant ist. Eine Nichtverwerfung beweist keine gleiche bedingte Prognosegüte. Enthält der Test nur eine Konstante, vergleicht er ein unbedingtes Moment und durchsucht nicht alle möglichen Bedingungen.

Legen Sie Verlustfunktion, Instrumente, Transformationen, Stichprobe und Prognosehorizont fest, bevor Sie sehen, welches Modell gewinnt. Viele Zustandsindikatoren, Schwellenwerte und Verzögerungen nach Sichtung der Ergebnisse hinzuzufügen, schafft ein weiteres Suchproblem. Der bedingte Test korrigiert diese Auswahl nicht von selbst.

Fixieren Sie auch den Zeitpunkt, zu dem jede Zustandsvariable berechnet wird. Bedeutet „hohe Volatilität“ beispielsweise das oberste Fünftel der Volatilität in der Gesamtstichprobe, fließen künftige Beobachtungen in den Schwellenwert für frühere Ursprünge ein. Schätzen Sie den Schwellenwert nur mit den an jedem Ursprung verfügbaren Daten oder verwenden Sie eine vorher veröffentlichte Regel. Bei stetigen Zustandsvariablen sind Einheiten sowie Zentrierung oder Skalierung vorab festzulegen. Mehrere fast gleiche Indikatoren können redundante Momentbedingungen erzeugen und das Invertieren der Kovarianzmatrix erschweren. Verwenden Sie daher die kleinste klar interpretierbare Menge.

Wald-Statistik bilden und Referenzverteilung interpretieren

Bei (q) Testfunktionen wird der Momentvektor (g_{t+1}=h_t d_{t+1}) gebildet. Sein Stichprobenmittel ist:

ḡ = (1/n) Σₜ gₜ₊₁

Die Ein-Schritt-GW-Statistik hat die Form einer Wald-Statistik:

GW = n ḡ′ Ω̂⁻¹ ḡ

Dabei schätzt (hatOmega) die Kovarianzmatrix des Momentvektors. Unter der Nullhypothese und den Regularitätsbedingungen der Arbeit gilt asymptotisch eine Chi-Quadrat-Referenzverteilung mit (q) Freiheitsgraden. Die Zahl der Testfunktionen beeinflusst somit die Referenzverteilung und kann die Teststärke beeinflussen. Viele schwache oder redundante Instrumente können die Kovarianzschätzung instabil machen, ohne nützliche Information hinzuzufügen.

Im Ein-Schritt-Fall impliziert die Nullhypothese eine Martingaldifferenzstruktur des Momentvektors. Deshalb kann der Originaltest eine Schätzung anhand des Stichproben-Zweitmoments verwenden. Bei anderen Horizonten, überlappenden Ergebnissen oder Abweichungen von diesem Rahmen muss der Varianzschätzer zu den Annahmen und Abhängigkeiten des gewählten Tests passen. Folgen Sie der konkreten Formulierung Ihrer Implementierung, statt eine HAC-Bandbreite aus einem anderen Test zu übernehmen. Allgemeine HAC-Verfahren, darunter der Schätzer von Newey und West (1987), sind Werkzeuge für geeignete Fälle und keine universelle Bandbreitenvorschrift für GW. Die Glaubwürdigkeit des Ergebnisses hängt auch von der Kovarianzschätzung und dem Prognosedesign ab.

Prüfen Sie außerdem, ob (Ω̂) für die gewählten Momente überhaupt schätzbar ist. Fast identische Testfunktionen, ein Indikator mit kaum Beobachtungen in einem Zustand oder zu viele Interaktionen können die Matrix singulär oder instabil machen. Dann kann sich ihre Inverse nach einer kleinen Datenänderung stark verändern und die Teststatistik verzerren. Jede Funktion sollte einen Bezug zu einer Bedingung oder einem Leistungsunterschied haben; berichten Sie ihre Anzahl und die Momentkovarianz. Eine nach Sichtung des Ergebnisses entfernte, scheinbar nutzlose Funktion ist ebenfalls ein Auswahlschritt und sollte offengelegt werden.

Der p-Wert ist Evidenz gegen die angegebenen Momentrestriktionen unter der Referenzverteilung. Er ist weder die Wahrscheinlichkeit, dass A oder B das wahre Modell ist, noch die Chance, dass eine Handelsregel profitabel wird. Berichten Sie Statistik, Freiheitsgrade, p-Wert und die exakt geprüften Momente, damit die Bedeutung einer Verwerfung erkennbar ist.

<!-- learn:illustration -->

Drei klare Glasflächen zeigen blaue und bernsteinfarbene Bahnen, die sich abwechselnd annähern und entfernen; ihre relative Leistung kann je nach Bedingung wechseln
Konzeptbild für wechselnde relative Prognoseleistung unter verschiedenen Bedingungen; keine gemessenen Marktdaten, Testergebnisse oder Handelssignale

Zwei Zustände zeigen, was der Durchschnitt verdecken kann

Betrachten wir acht hypothetische Ein-Schritt-Prognoseursprünge. (S_t=0) bezeichnet einen ruhigen Zustand, (S_t=1) einen Zustand hoher Volatilität. Die Verlustdifferenzen (d_{t+1}=L_A-L_B) seien an den vier ruhigen Ursprüngen −2, −2, −2 und −2 sowie an den vier Ursprüngen mit hoher Volatilität +2, +2, +2 und +2. Negative Differenzen sprechen für A, positive für B.

Der Durchschnitt über alle acht Ursprünge beträgt null; in diesem kleinen Beispiel gibt es also keine unbedingte Verlustdifferenz. Im ruhigen Zustand liegt der Durchschnitt bei −2, bei hoher Volatilität bei +2. Die Rangfolge wechselt mit dem Zustand. Ein Test mit (h_t=(1,S_t)') umfasst ein konstantes Moment und ein Moment für hohe Volatilität, das dieses Muster abbilden kann.

Diese acht Werte veranschaulichen nur das Rechenprinzip und reichen nicht für zuverlässige statistische Schlüsse. Bei echten Daten sind das Schätzverfahren der Prognosen, die vorab festgelegte Zustandsvariable, die Anzahl der Ursprünge und der zeitliche Verlauf der Verlustdifferenzen zu berücksichtigen. Eine grafische Aufteilung nach Zuständen belegt allein nicht, dass das Muster anhält.

Das Schätzfenster als Teil der Methode behandeln

Die ursprüngliche GW-Asymptotik erhält die Unsicherheit der Prognoseschätzung, indem die maximale Größe des Schätzfensters endlich bleibt, während die Zahl der Prognosen außerhalb der Stichprobe wächst. Rollierende Fenster und eine feste Schätzstichprobe passen zu diesem Kerndesign. Fenstergröße und datenabhängige Regeln für die Fensterauswahl gehören zur Prognosemethode und sind entsprechend festzulegen und offenzulegen.

Das ist wichtig, wenn Prognosemodelle wiederholt neu geschätzt werden. Ein Vergleich, der die Parameterschätzung ignoriert, kann die Unsicherheit übersehen, die beim Lernen aus vergangenen Daten entsteht. Unter den angegebenen Bedingungen lässt GW Prognosen aus verschachtelten und nicht verschachtelten Modellen zu. Das garantiert aber nicht dieselben Eigenschaften für jede Implementierung mit wachsendem Fenster oder jeden Schätzer. Im ursprünglichen Ein-Schritt-Rahmen fällt ein übliches expandierendes Fenster nicht unter die Annahme eines endlichen Fensters. Weicht das Design ab, verwenden Sie Resultate, die für die tatsächliche Prognosekonstruktion hergeleitet wurden.

Der Test wählt auch kein passendes Fenster für Sie. Ein kurzes Fenster reagiert möglicherweise schneller auf jüngere Bedingungen, enthält aber weniger Beobachtungen. Ein langes oder wachsendes Fenster kann die Schätzungen stabilisieren, zugleich jedoch veraltete Zusammenhänge beibehalten. Vergleichen Sie diese Möglichkeiten anhand eines vorab geplanten Auswertungsdesigns und dokumentieren Sie die Fensterauswahl. Giacomini und Rossi (2010) entwickeln separate Tests dafür, wie sich die relative Prognosegüte in instabilen Umgebungen über die Zeit verändert. Diese Frage ist verwandt, aber die Statistik unterscheidet sich vom grundlegenden bedingten GW-Test.

Auch liefert eine bedingte Verwerfung für sich genommen keine Handelsregel, die in Echtzeit stets die bessere Prognose auswählt. Ein Instrument kann in den Auswertungsdaten mit der Verlustdifferenz zusammenhängen, ohne eine stabile oder umsetzbare Wechselregel zu ergeben. Definieren Sie eine solche Auswahlregel ausschließlich mit vergangenen Informationen und prüfen Sie sie anschließend an einer späteren, unangetasteten Folge von Prognoseursprüngen. Berücksichtigen Sie auch die Unsicherheit der Regel und ihrer Schätzung.

GW von DM, Tests verschachtelter Modelle und Instabilitätstests unterscheiden

Der Diebold–Mariano-Test fragt, ob zwei Prognosen in der Auswertungsstichprobe denselben durchschnittlichen Verlust haben. GW fragt, ob ausgewählte Informationen mit ihrem relativen Verlust zusammenhängen; ein unbedingter Vergleich ist dabei eine mögliche Momentrestriktion. Wie das Zwei-Zustände-Beispiel zeigt, kann der Durchschnitt gleich sein, obwohl sich die relative Leistung je nach Bedingung unterscheidet.

Stammen Prognosen aus verschachtelten Modellen und geht es ausdrücklich um gleiche mittlere quadratische Prognosefehler, behandelt eine Methode für verschachtelte Modelle wie die Clark–West-Korrektur eine andere Nullhypothese und ein anderes Problem der Schätzunsicherheit. Wurden viele Handelsregeln oder Prognosen durchsucht und lautet die Frage, ob irgendein Kandidat überlegene Prognosefähigkeit besitzt, ist ein Verfahren für die gesamte Kandidatenfamilie angebracht, etwa Whites Reality Check oder Hansens SPA-Test. Ein bedingter Test für ein ausgewähltes Paar macht eine breitere Suche nicht ungeschehen.

Ein Nachweis, dass sich die relative Prognosegüte über die Zeit verändert, belegt schließlich keinen bestimmten Bruchzeitpunkt. Geht es um den zeitlichen Verlauf statt um den Zusammenhang mit ausgewählten Instrumenten, kann ein Test auf lokale Instabilität oder Umkehrungen besser passen. Giacomini und Rossi (2010) untersuchen solche Prognosevergleiche. Richten Sie die Methode an der Frage aus und behandeln Sie eine Verwerfung nicht automatisch als Beleg für eine regimeabhängige Handelsstrategie.

Geringe Teststärke und wiederholte Tests berücksichtigen

Bedingte Tests benötigen mitunter viele Daten. Eine Aufteilung der Stichprobe in ruhige und volatile Zustände verringert die Beobachtungszahl für jeden Vergleich. Mehr Testfunktionen erhöhen die Zahl der Momente und Freiheitsgrade. Sind mehrere Bedingungen nur schwach mit dem relativen Verlust verbunden, kann die Teststärke selbst dann gering sein, wenn bedingte Unterschiede bestehen.

Ein Arbeitspapier der Federal Reserve Bank of St. Louis von McCracken untersucht Existenz, Größe und Teststärke des GW-Tests anhand eines einfachen Beispiels mit quadratischem Verlust. Die Simulationen zeigen, dass der Test in den untersuchten Fällen korrektes Niveau haben kann, während seine Teststärke dort meist niedrig ist (McCracken, 2020). Das ist eine Warnung für die Interpretation und keine universelle Vorhersage der Teststärke jeder Anwendung. Eine Nichtverwerfung kann an wenig Information oder geringer Teststärke liegen und beweist nicht, dass Prognosen austauschbar sind.

Wer wiederholt andere Zustandsdefinitionen, Schwellenwerte, Horizonte, Verlustfunktionen und Auswertungsdaten ausprobiert, erhöht die Chance eines Zufallstreffers. Dokumentieren Sie alle getesteten Varianten und trennen Sie explorative Analysen von einer vorab festgelegten Bestätigungsstichprobe. Soll die Aussage lauten, eine Strategie aus einer Familie sei prognostisch, wenden Sie ein geeignetes Mehrfachtest- oder Data-Snooping-Verfahren auf diese Familie an. Mehr bedingende Instrumente schaffen nicht automatisch überzeugendere Evidenz.

Beim Vergleich mehrerer Prognosemodelle beantwortet ein Verfahren für eine ganze Familie eine andere Frage als ein paarweiser bedingter Test. Der Leitfaden zum Model Confidence Set beschreibt, wie ein iterativer Vergleich eine Menge von Modellen behalten kann, die auf dem gewählten Niveau statistisch nicht unterscheidbar sind. Er ersetzt nicht die Vorabfestlegung der Bedingungen in einer GW-Analyse.

Das Design so berichten, dass es reproduzierbar ist

Nennen Sie beide Prognosemethoden, ihr jeweiliges Schätzverfahren, eine mögliche Verschachtelung, Ziel und Horizont sowie die Auswertungsdaten. Geben Sie die genaue Verlustfunktion und das Vorzeichen von (d_{t+1}) an. Beschreiben Sie jedes Element von (h_t), seine Berechnung, den Zeitpunkt seiner Verfügbarkeit und ob es vor Sichtung der Ergebnisse ausgewählt wurde.

Berichten Sie Zeitplan der Prognoseursprünge, Regel für das Schätzfenster, Datenstand, Regel für die gemeinsame Stichprobe, Zahl der Prognoseursprünge außerhalb der Stichprobe, Zahl der Testfunktionen, Kovarianzschätzer, Referenzverteilung, Teststatistik, Freiheitsgrade und p-Wert. Geben Sie an, ob sich Horizonte überlappen und wie Abhängigkeiten behandelt werden. Fügen Sie durchschnittliche Verluste und Zusammenfassungen der Verlustdifferenz hinzu, nicht nur das Testergebnis.

Listen Sie andere ausprobierte Instrumente, Schwellenwerte, Fenster, Verluste und Prognosepaare auf. Haben dieselben Beobachtungen das Modell oder die Konditionierungsvariablen ausgewählt und anschließend getestet, legen Sie dies offen. Ein Ergebnis kann informativ sein, ohne bestätigend zu wirken. Transparente Berichte erlauben es Lesern, Reichweite und Design einzuschätzen und eine unabhängige Validierung zu planen.

Häufige Fragen

Q1Ist der Giacomini–White-Test dasselbe wie ein Diebold–Mariano-Test?

Nein. Diebold–Mariano konzentriert sich auf gleiche durchschnittliche Verluste. Der Ein-Schritt-GW-Rahmen prüft ausgewählte bedingte Momente und schließt ein unbedingtes Moment als mögliche Restriktion ein.

Q2Zeigt eine Verwerfung, welche Prognose in jedem Marktregime zu verwenden ist?

Nein. Sie zeigt, dass mindestens ein gewähltes Moment unter den Testannahmen nicht mit null vereinbar ist. Das Ergebnis hängt von Instrumenten, Stichprobe und Verlustfunktion ab und garantiert keine Leistung in jedem Zustand.

Q3Kann ich so lange Volatilitätsschwellen hinzufügen, bis der Test verwirft?

Das wäre eine Suche über Konditionierungsvariablen. Legen Sie die Variablen möglichst vorab fest, berichten Sie alle getesteten Varianten und verwenden Sie bei einer breiten Prognoseaussage eine getrennte Bestätigungsstichprobe oder eine angemessene Korrektur für die gesamte Kandidatenfamilie.

Q4Bedeutet bedingte Prognosefähigkeit, dass eine Handelsstrategie profitabel ist?

Nein. Der Test vergleicht Prognoseverluste. Eine Handelsaussage braucht eine definierte Entscheidungsregel und eine eigene Bewertung von Ausführung, Gebühren, Finanzierung, Markteinfluss und Risiko. Primärliteratur - Giacomini und White, “Tests of Conditional Predictive Ability” (2006) - Giacomini und Rossi, “Forecast Comparisons in Unstable Environments” (2010) - McCracken, “Tests of Conditional Predictive Ability: Existence, Size, and Power” (Arbeitspapier der Federal Reserve Bank of St. Louis, 2020) - Diebold und Mariano, “Comparing Predictive Accuracy” (1995) - Newey und West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)

Quellen und weiterführende Lektüre

Problem melden

Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden

Schnelltest

Fertig gelesen? Prüfe dich mit 3 Fragen

Frage 1 / 3

Frage 01

Was bedeutet eine positive Verlustdifferenz bei dₜ₊₁ = L(A) − L(B)?

Wähle eine Antwort, um die Erklärung zu sehen

Optionsglossar