Der Clark–West-Test für verschachtelte Prognosen: Formel, Beispiel und Grenzen
Erfahre, warum verschachtelte Prognosemodelle einen angepassten MSPE-Vergleich benötigen, wie die Clark–West-Statistik funktioniert und was ein einseitiges Ergebnis aussagen kann und was nicht.
In diesem LeitfadenWarum verschachtelte Prognosen einen eigenen Vergleich brauchen
Kurze Zusammenfassung
Der Clark–West-Test korrigiert den Vergleich quadrierter Fehler, wenn ein Prognosemodell ein kleineres Benchmarkmodell enthält. Zusätzliche geschätzte Parameter können die Prognosen des größeren Modells verrauschen, selbst wenn sie keine echte Prognoseinformation hinzufügen. Die Korrektur ändert die für den Test verwendete Verlustdifferenz; sie ändert weder die Prognosen noch garantiert sie, dass das größere Modell nützlich ist.
Warum verschachtelte Prognosen einen eigenen Vergleich brauchen
Angenommen, ein eingeschränktes Modell prognostiziert die Rendite des nächsten Monats mit einer Konstanten, während ein größeres Modell zusätzlich eine Bewertungskennzahl verwendet. Das eingeschränkte Modell ist im größeren verschachtelt: Wird der zusätzliche Koeffizient auf null gesetzt, erhält man das Benchmarkmodell. Selbst wenn dieser Koeffizient tatsächlich null ist, kann seine Schätzung Stichprobenrauschen in die Prognosen des größeren Modells einbringen. Dann kann sein beobachteter mittlerer quadratischer Prognosefehler (MSPE) höher sein, obwohl beide Modelle dieselbe Prognosekraft in der Grundgesamtheit haben.
Die Clark–West-Korrektur richtet sich gegen dieses Schätzrauschen beim Out-of-Sample-Vergleich quadrierter Fehler verschachtelter Prognosen. Unter diesem Aufbau fragt sie, ob das größere Modell über das eingeschränkte Benchmark hinaus zusätzlichen Prognosewert bietet. Das ist eine engere Frage als der allgemeine Vergleich im Diebold–Mariano-Leitfaden, der paarweise Prognoseverluste vergleicht und bei verschachtelten Modellen nicht automatisch mit seiner üblichen Referenzverteilung gültig ist. Clark und McCracken untersuchen das abweichende asymptotische Verhalten und Verhalten in endlichen Stichproben bei Tests der Prognosegenauigkeit und der Umfassungsbeziehung verschachtelter Modelle. Clark und West entwickeln das angepasste MSPE-Verfahren und seine approximative Inferenz. Clark and McCracken (2001)00071-9); Clark and West (2007).
Prüfe die Verschachtelung und halte das Out-of-Sample-Design ein
Das eingeschränkte Benchmark soll dasselbe Ziel (y_{t+h}) prognostizieren wie die größere Alternative. Das größere Modell muss die Spezifikation des Benchmarks als Sonderfall enthalten, typischerweise indem ein oder mehrere zusätzliche Koeffizienten auf null gesetzt werden. Dass ein Modell komplexer ist, mehr Variablen enthält oder in der Stichprobe besser passt, belegt diese Verschachtelung nicht.
Erzeuge beide Prognosen für jeden Prognosezeitpunkt ausschließlich mit den zu diesem Zeitpunkt verfügbaren Informationen. Schätze die Modelle in einem chronologisch geordneten Trainingsfenster, erstelle Prognosen für ein späteres Bewertungsfenster und verwende für beide dasselbe Ziel, denselben Horizont, dieselben Einheiten und Prognosezeitpunkte sowie dieselben realisierten Beobachtungen. Eine rekursive oder rollierende Neuschätzung kann geeignet sein; gib an, welches Verfahren du verwendest, und bewahre die an jedem Zeitpunkt tatsächlich erstellten Prognosen auf. Wenn du das Bewertungsfenster wiederholt prüfst, um Prädiktoren, Transformationen oder Horizonte auszuwählen, wird es Teil der Modellauswahl statt unangetasteter Evidenz. Der CAViaR-Leitfaden zeigt, warum eine Prognose eines Randquantils ebenfalls anhand eines zu ihrem Ziel passenden Verlusts bewertet werden sollte und nicht in einen Vergleich von Mittelwertprognosen gehört.
Die Clark–West-Korrektur behandelt Parameterschätzrauschen unter der Nullhypothese verschachtelter Modelle. Sie behebt weder Look-ahead, nicht übereinstimmende Stichproben, revidierte Daten, die fälschlich als damals bekannt behandelt werden, noch nicht offengelegte Modellsuche. Berichte das anfängliche Schätzfenster, die Anzahl der Prognosezeitpunkte, den Horizont, den Datenstand und alle rollierenden oder rekursiven Aktualisierungen, damit erkennbar ist, was wirklich außerhalb der Stichprobe lag.
Berechne die angepasste Verlustdifferenz
Sei f₀,t+h die Prognose des eingeschränkten Modells, f₁,t+h die des größeren Modells und eⱼ,t+h = yₜ₊ₕ − fⱼ,t+h der Prognosefehler j. Bei quadriertem Fehler als Verlust lautet die Clark–West-Differenz je Periode:
dCW,t+h = (e₀,t+h)² − [(e₁,t+h)² − (f₀,t+h − f₁,t+h)²]
Gleichwertig ist dies der quadrierte Fehler des eingeschränkten Modells minus der des größeren Modells, zuzüglich des quadrierten Abstands zwischen den Prognosen. Der letzte Term schätzt unter der Nullhypothese das zusätzliche Prognoserauschen, das mit den zusätzlich geschätzten Parametern verbunden ist. Clark und West beschreiben die Korrektur so, dass vor dem Vergleich mit dem eingeschränkten Modell dieser Prognoseabstand vom Stichproben-MSPE des größeren Modells abgezogen wird. Clark and West (2007).
Bilde den Mittelwert der angepassten Differenzen über die gemeinsamen Bewertungszeitpunkte: mean(dCW) = (1/P) Σ dCW,t+h. Werden Ergebnisse und Prognosen in Basispunkten gemessen, sind quadrierter Fehler und angepasste Differenz in quadrierten Basispunkten angegeben. Ein positiver angepasster Mittelwert spricht nach der obigen Konvention für das größere Modell. Er ist ein angepasster Vergleichswert, weder das realisierte MSPE des größeren Modells noch eine Prognose für den Handel.
Lege die einseitige Hypothese fest, bevor du das Ergebnis ansiehst
Die übliche Frage beim Clark–West-Test lautet, ob das größere, verschachtelte Modell ein niedrigeres erwartetes MSPE als das eingeschränkte Benchmark hat. Die Nullhypothese steht für keine zusätzliche Prognoseverbesserung durch die hinzugefügte Modellkomponente; die einseitige Alternative spricht für das größere Modell. Nach der Formel oben zeigt ein ausreichend positiver angepasster Mittelwert relativ zu seinem Standardfehler Evidenz für diese Alternative.
In der Notation des angepassten Verlusts lauten die Arbeitshypothesen H₀: E[dCW] = 0 gegenüber H₁: E[dCW] > 0. Die positive Richtung folgt daraus, dass zuerst der Verlust des eingeschränkten Modells steht. Wird die Subtraktion umgekehrt, dreht sich das Vorzeichen um; gib daher die Konvention zusammen mit dem Ergebnis an.
Die Teststatistik wird häufig als Stichprobenmittel von dCW geteilt durch seinen geschätzten Standardfehler geschrieben. Clark und West empfehlen für die von ihnen untersuchten Fälle einen einseitigen approximativ normalverteilten Test mit einem üblichen oder, falls passend, autokorrelationskonsistenten Standardfehler. West (1996) entwickelt Inferenz für Momente glatter Funktionen von Out-of-Sample-Prognosen und -Fehlern, auch wenn Prognosen von geschätzten Parametern abhängen. Die Richtung muss vor dem Blick auf die Ergebnisse feststehen: Eine positive Clark–West-Statistik ist kein Grund, nach Sichtung der Stichprobe auf eine zweiseitige oder anders gerichtete Hypothese zu wechseln.
Der p-Wert gilt unter der Bedingung der Verschachtelung, der Prognoseerstellung, des Ziels, der Verlustfunktion, der Inferenzmethode und der Stichprobenannahmen. Er ist weder die Wahrscheinlichkeit, dass das größere Modell wahr ist, noch ein Beleg dafür, dass ein zusätzlicher Prädiktor das Ziel kausal verändert.
Rechne ein Beispiel mit vier Perioden durch
Betrachte vier hypothetische Beobachtungen in Basispunkten. Die tatsächlichen Werte sind [0, 1, −1, 0], die Prognosen des eingeschränkten Modells [−1, 0, 0, 0] und die Prognosen des verschachtelten größeren Modells [−1.5, 0.5, −0.5, 0.5]. Die quadrierten Fehler des eingeschränkten Modells sind [1, 1, 1, 0], mit einem mittleren MSPE von 0.75 bp². Die quadrierten Fehler des größeren Modells sind [2.25, 0.25, 0.25, 0.25]; auch sein mittleres MSPE beträgt 0.75 bp².
Die quadrierten Prognoseabstände (f₀ − f₁)² sind [0.25, 0.25, 0.25, 0.25]. Mit der angepassten Differenz e₀² − e₁² + (f₀ − f₁)² ergibt sich [−1, 1, 1, 0] bp². Ihr Stichprobenmittel ist 0.25 bp². Die rohen MSPEs sind gleich, während der angepasste Mittelwert positiv ist, weil die Korrektur das Prognoseschätzrauschen des größeren Modells berücksichtigt.
Diese vier Perioden veranschaulichen nur die Rechnung. Sie reichen bei Weitem nicht aus, um die Unsicherheit verlässlich zu schätzen oder statistische Signifikanz festzustellen. Der positive angepasste Mittelwert allein belegt keinen echten Prognosevorteil; die Werte sind hypothetisch und keine Marktbeobachtungen. <!-- learn:illustration -->

Berücksichtige abhängige Prognosefehler und Horizonte
Auch bei Ein-Schritt-Prognosen können angepasste Verlustdifferenzen seriell abhängig sein, wenn sich Ziel, Prädiktoren oder Schätzfenster im Zeitverlauf entwickeln. Bei überlappenden Mehr-Schritt-Prognosen teilen benachbarte Ursprünge realisierte Zielperioden, sodass ihre angepassten Differenzen konstruktionsbedingt korreliert sein können. Ein gewöhnlicher Standardfehler, der jeden Ursprung als unabhängig behandelt, kann die Unsicherheit unterschätzen.
Schätze den Standardfehler anhand der Reihe angepasster Differenzen mit einem Verfahren, das dem Stichprobendesign entspricht, zum Beispiel mit einer heteroskedastizitäts- und autokorrelationskonsistenten Langfristvarianz, sofern deren Voraussetzungen passen. Clark und West weisen bei autokorrelierten Prognosefehlern ausdrücklich auf autokorrelationskonsistente Standardfehler hin. Nenne Prognosehorizont, Kovarianzschätzer, Kernel und Bandbreite, falls verwendet, sowie eine mögliche Resampling- oder Kritischer-Wert-Methode. Der Block-Bootstrap-Leitfaden erklärt, warum beim Resampling abhängiger Zeitreihen die Reihenfolge erhalten bleiben muss; ein allgemeiner Bootstrap setzt nicht automatisch die Clark–West-Nullhypothese um.
Die erforderliche Behandlung der Abhängigkeit hängt vom Design ab. Längere Horizonte, persistente Ziele, wiederholte Parameterschätzungen und Volatilitätsänderungen können über das einfache Überlappungsmuster hinaus Abhängigkeiten erzeugen. Vergleiche sinnvolle Inferenzvarianten und erläutere sie, statt nur die Variante mit dem kleinsten p-Wert auszuwählen.
Behandle normale kritische Werte als Näherung, nicht als Garantie
Tests für Prognosen verschachtelter Modelle können nichtstandardisierte Nullverteilungen haben, besonders wenn Schätz- und Bewertungsstichprobe gemeinsam wachsen. Clark und McCracken zeigen, dass Gleichgenauigkeits- und Umfassungstests für verschachtelte Prognosen ein anderes asymptotisches Verhalten und Verhalten in endlichen Stichproben aufweisen als der bekannte Vergleich nicht verschachtelter Modelle. Clark und West begründen eine angepasste Statistik mit nützlicher approximativ normaler Inferenz für die untersuchten Designs; das ist jedoch keine allgemeine Garantie für jede endliche Stichprobe. Clark and McCracken (2001)00071-9); Clark and West (2007).
Kleine Bewertungsstichproben, viele zusätzliche Parameter, falsch spezifizierte Benchmarks, datengetriebene Prädiktorauswahl und die Wahl zwischen rollierender und rekursiver Schätzung können Testgröße und Teststärke beeinflussen. Weicht Stichprobe oder Design deutlich von den Bedingungen der Arbeit ab, erwäge designgerechte kritische Werte oder ein sorgfältig spezifiziertes Simulations- oder Bootstrap-Verfahren. Berichte die Größen von Schätz- und Bewertungsstichprobe und nenne die Referenzverteilung, aus der der p-Wert stammt.
Unterscheide verwandte Tests und begrenze Prognoseaussagen
Der Diebold–Mariano-Test fragt in einem allgemeinen Rahmen für gepaarte Verluste, ob zwei Prognoseverlustreihen denselben erwarteten Verlust haben. Die Clark–West-Korrektur ist auf Vergleiche quadrierter Fehler zugeschnitten, bei denen ein Modell das andere enthält und zusätzliche geschätzte Parameter unter der Nullhypothese die rohe MSPE-Differenz verzerren. Die Korrektur ohne Begründung auf nicht verschachtelte Modelle anzuwenden, ändert die Fragestellung. Die ursprüngliche DM-Arbeit erlaubt eine breite Auswahl an Verlustmaßen und behandelt Prognosefehler, die weder gaußverteilt noch unabhängig sein müssen; sie ist thematisch verwandt, aber kein Synonym für das Verfahren für verschachtelte Modelle. Diebold and Mariano (1995).
Keine der beiden Methoden löst das Problem des Forscherspielraums, der durch viele getestete Ziele, Horizonte, Benchmarks und Prädiktorsätze entsteht. Stammt der endgültige Vergleich aus einer breiten Suche, dokumentiere die Kandidatenfamilie und verwende eine Methode, die für die Suchfrage als Ganzes entwickelt wurde. Der Leitfaden zu White’s Reality Check und Hansen’s SPA behandelt familienweite Inferenz für untersuchte Handelsregeln; der Clark–West-Test allein macht einen ausgewählten Prognosevergleich nicht zu einer konfirmatorischen Prüfung.
Ein signifikantes einseitiges Ergebnis ist unter den genannten Annahmen ein Beleg dafür, dass das größere Modell die erwartete Genauigkeit quadrierter Prognosefehler für das getestete Ziel und Bewertungsdesign verbessert. Es zeigt nicht, dass der zusätzliche Prädiktor kausal ist, das Signal stabil bleibt oder eine darauf beruhende Strategie positive Renditen erzielt. Prognoseverbesserungen können für Entscheidungen zu klein sein, und die größten Gewinne eines Modells können in Perioden auftreten, in denen der Handel teuer ist.
Für Handelsprofitabilität braucht es eine separate Regel, unangetastete Bewertungsdaten und realistische Spreads, Gebühren, Slippage, Markteinfluss, Finanzierung, Leihkosten und Risikolimits. Kausale Aussagen benötigen eine zur Frage passende Identifikationsstrategie; ein Prognosevergleich nach der Stichprobe ist kein kausales Design. Sage genau, was das Clark–West-Ergebnis belegt, und überlasse andere Behauptungen Evidenz, die sie tatsächlich prüft.
Dokumentiere das Design, damit der Vergleich reproduzierbar ist
Nenne das eingeschränkte und das größere Modell, die konkreten Restriktionen, die sie verschachteln, sowie Ziel, Horizont, Einheiten der quadrierten Fehler, Schätzfenster, Zeitplan der Prognoseursprünge, Bewertungsdaten und Regel für die gemeinsame Stichprobe. Erläutere, ob Koeffizienten rekursiv oder in einem rollierenden Fenster neu geschätzt werden und wie Informationsstand und Datenversionen bewahrt bleiben.
Berichte die rohen MSPEs beider Modelle, die mittlere Clark–West-Differenz, Vorzeichenkonvention, Standardfehler, einseitige Alternative, Referenzverteilung oder kritische Werte, p-Wert und Schätzer der Abhängigkeit. Lege außerdem die Zahl zusätzlicher Parameter, Stichprobengrößen, Suchen über Prädiktoren und Horizonte, Benchmarkauswahl und die Nutzung des Bewertungsfensters bei der Modellentwicklung offen. So können Leser einen angepassten Test verschachtelter Modelle von einem allgemeinen Prognosevergleich unterscheiden und die verbleibende Unsicherheit beurteilen.
Häufige Fragen
Q1Ersetzt der Clark–West-Test den Diebold–Mariano-Test?
Nein. Clark–West betrifft den MSPE-Vergleich quadrierter Fehler verschachtelter Modelle. Diebold–Mariano ist ein allgemeiner Rahmen für gepaarte Verluste; seine übliche Referenzverteilung gilt nicht automatisch für verschachtelte Prognosen.
Q2Beweist ein positiver angepasster Mittelwert, dass das größere Modell besser ist?
Nein. Nach der festgelegten Vorzeichenkonvention spricht er für das größere Modell. Für die Inferenz braucht es aber auch einen geeigneten Standardfehler, ein glaubwürdiges Out-of-Sample-Design und genügend Beobachtungen.
Q3Kann ich Clark–West bei nicht verschachtelten Modellen verwenden?
Nicht ohne Weiteres. Die Korrektur ist durch Schätzrauschen unter der Nullhypothese verschachtelter Modelle motiviert. Für einen nicht verschachtelten Vergleich sollte der Test zur Prognosegestaltung und Verlustfunktion passen.
Q4Bedeutet ein signifikantes Clark–West-Ergebnis eine profitable Handelsstrategie?
Nein. Der Test betrifft die Prognosegenauigkeit für ein Ziel und ein Bewertungsdesign. Handelsergebnisse hängen auch von Entscheidungsregel, Ausführung, Gebühren, Finanzierung, Risiko und weiterer Out-of-Sample-Evidenz ab. Primärforschung - Clark and West, “Approximately Normal Tests for Equal Predictive Accuracy in Nested Models” (2007) - Clark and McCracken, “Tests of Equal Forecast Accuracy and Encompassing for Nested Models” (2001)00071-9) - West, “Asymptotic Inference about Predictive Ability” (1996) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)
Quellen und weiterführende Lektüre
Problem melden
Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden
Schnelltest
Fertig gelesen? Prüfe dich mit 3 Fragen
Frage 01
Warum addiert die Clark–West-Korrektur den quadrierten Abstand zwischen den beiden Prognosen?
Wähle eine Antwort, um die Erklärung zu sehen