Forecast-Encompassing-Test: Enthält eine Prognose die Information der anderen?
Erfahren Sie, wie ein Encompassing-Test zusätzliche Prognoseinformation prüft und warum er weder Verlustvergleich noch Kalibrierung oder einen Profitabilitätstest ersetzt.
In diesem LeitfadenWelche Frage beantwortet ein Encompassing-Test?
Kurze Zusammenfassung
Ein Forecast-Encompassing-Test fragt, ob die Prognose eines Konkurrenten zusätzliche lineare Information enthält, mit der sich eine Referenzprognose verbessern lässt. Die Antwort hängt von der Hypothese, der Testkonstruktion und der Parameterschätzung ab. Ein positiver oder insignifikanter Mischungskoeffizient ist kein allgemeines Urteil über Modellgüte oder Profitabilität.
Welche Frage beantwortet ein Encompassing-Test?
Angenommen, A und B prognostizieren denselben Zielwert y zum selben Prognosezeitpunkt und für denselben Horizont. Ein Encompassing-Test fragt nicht nur, welches Modell in der Vergangenheit einen kleineren Fehler hatte. Er fragt: Enthält die Prognose von B, nachdem A berücksichtigt wurde, noch ein zusätzliches Signal, das A in einer festgelegten linearen Form verbessern kann? Liefert B in diesem Design keine zusätzliche Prognoseinformation, sagt man, A umfasse B oder B verbessere A nicht weiter.
Die Idee der Forecast-Encompassing-Bewertung wurde unter anderem bei der Evaluation linearer ökonomischer Modelle ausgearbeitet. Chong und Hendry (1986) behandeln sie in Econometric Evaluation of Linear Macro-Economic Models {source:chongHendry1986ForecastEncompassing}. „Umfassen“ beschreibt eine bedingte Beziehung zwischen konkreten Prognosen und einer konkreten Hypothese. Es bedeutet weder, dass A jederzeit korrekt ist, noch dass B in einem anderen Kontext nutzlos wäre.
Ein niedrigerer RMSE ordnet die Fehler in einer Stichprobe nach einer bestimmten Kennzahl. Encompassing betrifft dagegen den zusätzlichen Informationsgehalt einer konkurrierenden Prognose gegenüber einer Referenz. Die Antworten auf beide Fragen können auseinanderfallen. Aus einem RMSE-Rang allein folgt daher kein Encompassing-Ergebnis.
Der RMSE ist die Quadratwurzel des mittleren quadratischen Prognosefehlers: RMSE = √[(1/n) Σₜ₌₁ⁿ eₜ²]. Er ist also nicht der mittlere quadratische Fehler selbst.
Zuerst müssen beide Prognosen vergleichbar sein
f_A,t und f_B,t sollten denselben Zielwert y, denselben Informationsstand am Prognoseursprung und denselben Horizont verwenden. Stimmen Sie Zieldefinition, Einheit, Zeitstempel, Stichprobe und den Umgang mit fehlenden Beobachtungen ab. Eine Prognose des morgigen Schlusskurses lässt sich nicht unmittelbar mit einer Prognose des Durchschnitts der kommenden fünf Tage vergleichen, selbst wenn beide als Renditeprognose bezeichnet werden.
Verwenden Sie die Prognosen, die am jeweiligen historischen Ursprung tatsächlich verfügbar waren, keine nachträglich mit Zukunftsinformationen neu geschätzten Versionen. Bewahren Sie Daten- und Modellstand auf und behandeln Sie überarbeitete Wirtschaftsdaten sowie angepasste Aktienkurse nach dokumentierten Regeln. Wurden Zeitraum oder Spezifikationen nach Sichtung der Ergebnisse ausgewählt, gehört das zur Suchprozedur und nicht zu unabhängiger Out-of-Sample-Evidenz.
Definieren Sie die Vorzeichenkonvention ausdrücklich: e_A,t = y_t − f_A,t und d_t = f_B,t − f_A,t. Schreiben Sie diese Festlegung auf, bevor Sie einen Koeffizienten berechnen. Wird die Reihenfolge von A und B vertauscht, ändert sich das Vorzeichen von d und des Mischungskoeffizienten. Die Information selbst ändert sich dadurch nicht, wohl aber die Interpretation des Vorzeichens.
Die Steigung beschreibt ein mögliches lineares Zusatzsignal von B
Eine illustrative lineare Kombination lautet f_C,t = f_A,t + w d_t, also f_C,t = (1−w)f_A,t + w f_B,t. Eine Regression des Fehlers e_A,t auf eine Konstante und d_t hilft, w zu interpretieren: Hängt die Differenz der beiden Prognosen mit den Fehlern von A zusammen, könnte sie lineare Zusatzinformation tragen. In dieser Darstellung ist die Steigung eine Schätzung des zusätzlichen Gewichts für B; die Konstante nimmt den durchschnittlichen Bias von A auf.
Diese Interpretation ist jedoch keine einheitliche Definition aller Encompassing-Tests. Manche Spezifikationen beschränken die Konstante oder den Forecast-Bias, andere verwenden eine andere Referenzprognose oder bedingte Informationen. Getestet werden kann eine einseitige Alternative oder eine gemeinsame Restriktion. Auch geschätzte Modellparameter und verschachtelte Modelle können eine andere Inferenz erfordern. Nennen Sie deshalb Test, Hypothese und Annahmen, statt eine Regression oder einen kritischen Wert als universelle Regel darzustellen.
Geschätzte Gewichte können außerhalb von [0,1] liegen. Dann extrapoliert die beste lineare Stichprobenkombination über beide Prognosen hinaus, statt zwischen ihnen zu liegen. Eine konkrete Implementierung kann nichtnegative Gewichte oder eine Summe von eins erzwingen; die Beschränkungen hängen von der Methode ab. Berichten Sie diese und schneiden Sie einen unbeschränkten Schätzer nicht ohne erneute Schätzung auf das Intervall zurecht.
In der erklärenden Regression e_A,t = α + β d_t + u_t ist die Populationssteigung mit Konstante β = Cov(e_A,d)/Var(d), sofern Var(d)>0. β=0 bedeutet daher, dass nach Zulassung eines konstanten Bias kein linearer Zusammenhang zwischen dem Fehler von A und der Prognosedifferenz besteht. Nichtlineare oder andere Information ist damit nicht ausgeschlossen.
Ohne Konstante lautet die Populationssteigung E[e_A d]/E[d²], sofern E[d²]>0; die Nullrestriktion für die Steigung ist dann das Kreuzmoment E[e_A d]=0. Dieses Moment ist nur dann gleich einer Kovarianz von null, wenn E[e_A]=0 oder E[d]=0 gilt. In einer Regression mit Konstante ist α=0 eine zusätzliche Biasrestriktion; zusammen mit β=0 erzwingt sie einen mittleren Prognosefehler von A gleich null. Ein Test auf α=0 prüft somit mehr als nur inkrementelle Information.
Testspezifikationen unterscheiden sich, eine Schwelle gilt nicht für alle
Ein konkreter Test übersetzt die Frage nach Zusatzinformation in Restriktionen für Koeffizienten oder Prognosedifferenzen. Eine Konstante kann Bias erfassen, eine zusätzliche Steigung geprüft oder Information verwendet werden, die am Prognoseursprung verfügbar war. Auch die Alternative kann einseitig sein, wenn vorab eine Verbesserung von A gefragt wird, oder zweiseitig, wenn jede zusätzliche Beziehung relevant ist. Jede Wahl verändert, was die Teststatistik prüft und wie die Unsicherheit geschätzt werden muss.
Die Steigung einer illustrativen Regression ist deshalb nicht automatisch die Encompassing-Statistik, die jede Studie verwendet. Stimmen Sie den Test vor dem Blick auf den p-Wert auf die Beziehung der Modelle, den Zeitpunkt der Parameterschätzung, das Out-of-Sample-Design und die Fehlerannahmen ab. Reagiert das Ergebnis empfindlich auf diese Entscheidungen, berichten Sie das, statt nachträglich die Spezifikation mit dem gewünschten Resultat auszuwählen.
<!-- learn:illustration -->

Ein hypothetisches Beispiel zeigt das Mischen, nicht die Signifikanz
Nehmen wir d in Basispunkten als [−4, −2, −1, 1, 2, 4] und die Fehler von A als [−1,6, −1,2, 1,5, 0,5, 1,3, 1,5], bei n = 6. Der Mittelwert von d ist null, der Mittelwert von e_A beträgt 1/3 Basispunkt. Die Quadratsumme von d ist 42; die Summe der Produkte aus d und der um ihren Mittelwert bereinigten Fehlerreihe beträgt 16,4.
Damit ergibt sich in einer gewöhnlichen OLS-Regression mit Konstante die Steigung w = 16,4/42 ≈ 0,3905 und eine Konstante von 1/3 Basispunkt. Die Stichprobenkombination lautet f_C = f_A + 0,3905(f_B−f_A). Das Beispiel berechnet einen linearen Mischungskoeffizienten. Es testet weder, ob die Steigung statistisch von null abweicht, noch ob die Kombination künftige Prognosen verbessert.
Aus sechs Beobachtungen sollte man keinen p-Wert oder Schluss auf Encompassing beziehungsweise Überlegenheit ableiten. Dafür braucht es ein geeignetes Stichprobendesign und eine Unsicherheitsschätzung, die zur Fehlerstruktur und zur Erzeugung der Prognosen passt. Wird das Gewicht geschätzt und auf denselben sechs Beobachtungen bewertet, ist die Bewertung zudem naturgemäß in-sample.
Hypothese und Inferenz hängen von der Testformulierung ab
Im vereinfachten Sinn dieses Artikels lautet die Null „A umfasst B“, dass B nach Berücksichtigung von A kein relevantes Zusatzsignal liefert oder dass ein definierter Verbesserungskoeffizient null ist. Das ist keine universelle Testgleichung. Klären Sie, ob ein Bias zugelassen wird, welche bedingten Informationen eingehen, ob die Alternative einseitig auf eine Verbesserung von A gerichtet ist und wie geschätzte Parameter behandelt werden.
Harvey, Leybourne und Newbold (1998) untersuchen Forecast-Encompassing-Tests. Sie weisen darauf hin, dass der Least-Squares-Test gegenüber nicht normalverteilten Fehlern nicht robust ist, und behandeln Alternativen: Tests for Forecast Encompassing {source:harveyLeybourneNewbold1998ForecastEncompassing}. Der OLS-Koeffizient samt Standard-p-Wert einer Software genügt daher nicht, ohne die Hypothesen und die Referenzverteilung zu prüfen.
Ein p-Wert über 0,05 belegt weder Äquivalenz noch, dass B wertlos ist. Dahinter können eine kurze Stichprobe, ein großer Standardfehler oder geringe Teststärke stehen. Die angemessene Aussage lautet: Unter diesem Design und seinen Annahmen lieferten die Daten bei der gewählten Schwelle keine ausreichende Evidenz gegen die festgelegte Nullhypothese. Mehr folgt daraus nicht.
Encompassing beantwortet vier verwandte, aber andere Fragen
Der Diebold–Mariano-Test vergleicht die durchschnittlichen Verluste zweier Prognosen an denselben Ursprüngen. Encompassing fragt nach zusätzlicher Information in einer Konkurrenzprognose relativ zu einer Referenz. Deshalb kann eine Prognose einen niedrigeren RMSE haben, ohne dass B A eine nützliche lineare Information hinzufügt, und umgekehrt. Siehe den Diebold–Mariano-Test zur Prognosegenauigkeit.
Clark–West korrigiert den Vergleich der Out-of-Sample-Prognosegenauigkeit verschachtelter linearer Modelle, bei denen die Schätzunsicherheit zusätzlicher Koeffizienten die Testverteilung erschwert. Clark und McCracken (2001) diskutieren Verteilungsfragen bei Tests gleicher Prognosegenauigkeit und des Encompassings für Ein-Schritt-Prognosen aus verschachtelten linearen Modellen: Tests of Equal Forecast Accuracy and Encompassing for Nested Models00071-9) {source:clarkMcCrackenNestedForecasts2001}. Dieser Rahmen ist kein automatischer Ersatz für jeden Encompassing-Test. Die gesonderte Clark–West-Anpassung für die Prognosegenauigkeit verschachtelter Modelle behandelt den entsprechenden Genauigkeitsvergleich.
Eine Prognosekombination schätzt oder wählt Gewichte für ein Ziel, häufig zur Minimierung eines Trainings- oder Out-of-Sample-Verlusts. Das ist ein Verfahren zur Prognosekonstruktion und für sich genommen kein Test einer Encompassing-Hypothese. Siehe gleiche oder geschätzte Gewichte bei Prognosekombinationen. Der Mincer–Zarnowitz-Test untersucht typischerweise Niveau- und Steigungskalibrierung relativ zu realisierten Werten, nicht dieselbe Frage nach zusätzlicher Information einer Konkurrenzprognose. Dazu mehr im Mincer–Zarnowitz-Test zur Prognosekalibrierung.
Parameterschätzung verändert die Out-of-Sample-Unsicherheit
Werden Prognosen aus geschätzten Regressionen erzeugt, kann die Parameterschätzung die Verteilung des Tests beeinflussen. West (2001) behandelt Forecast-Encompassing-Tests, wenn Prognosen von geschätzten Regressionsparametern abhängen, und erklärt, warum die Prognosekonstruktion in der Inferenz berücksichtigt werden sollte: Tests for Forecast Encompassing When Forecasts Depend on Estimated Regression Parameters {source:west2001EstimatedForecastsEncompassing}. „Out of sample“ zu sagen genügt nicht, wenn der Test ignoriert, dass Parameter neu geschätzt oder Trainingsfenster verändert wurden.
Klären Sie vorab, ob die Modelle verschachtelt sind, ob die Schätzung fest oder rollierend erfolgt, ob sich Testhorizonte zeitlich überlappen und wie die Prognosefehler abhängen. Wählen Sie ein Inferenzverfahren, das zum Design passt, und berichten Sie die Sensitivität gegenüber vertretbaren Annahmen. Wurden viele Modelle, Zielgrößen oder Stichprobenfenster ausprobiert und nur das beste Resultat veröffentlicht, bildet ein einzelner p-Wert die vorausgehende Suche nicht ab.
Zeigen die Regressionsmomente Heteroskedastizität oder serielle Abhängigkeit, kann ein Newey–West-Schätzer für heteroskedastizitäts- und autokorrelationskonsistente (HAC) Kovarianzen eine geeignete Option sein. Newey und West (1987) beschreiben diesen Schätzer {source:neweyWest1987}. Kernel und Bandbreite müssen zum Prognosedesign passen; HAC ist ein möglicher Baustein der Unsicherheitsschätzung, kein Encompassing-Test an sich.
Ein Zusatzsignal ist noch kein Handelssignal
Selbst wenn B verlässliche Prognoseinformation hinzufügt, ist damit keine positive Nettorendite belegt. Dafür müssen Sie eine Regel festlegen, die Prognosen in Positionen übersetzt, ebenso Zeitpunkt, Gebühren, Finanzierung, Slippage, Liquidität und Risikolimits. Ein kleines Prognosesignal kann durch Ausführungskosten aufgezehrt werden. Es kann aber auch für Absicherung oder Risikosteuerung nützlich sein, ohne die mittlere Rendite zu erhöhen.
Berichten Sie Zielgröße, Horizont, Prognoseursprünge, gemeinsame Stichprobe, Vorzeichenkonvention für e und d, Testformulierung, Null- und Alternativhypothese, Umgang mit Konstante oder Bias, Schätzverfahren, Gewichtsrestriktionen und Inferenzmethode. Zeigen Sie, soweit zum Design passend, Mischungskoeffizient mit Standardfehler oder Konfidenzintervall und trennen Sie In-Sample-Anpassung ausdrücklich von Out-of-Sample-Leistung. Encompassing ist weder eine Prognose- noch eine Handelsgarantie.
Literatur
- Chong und Hendry, “Econometric Evaluation of Linear Macro-Economic Models” (1986), DOI
- Harvey, Leybourne und Newbold, “Tests for Forecast Encompassing” (1998), DOI
- Clark und McCracken, “Tests of Equal Forecast Accuracy and Encompassing for Nested Models” (2001), DOI00071-9)
- West, “Tests for Forecast Encompassing When Forecasts Depend on Estimated Regression Parameters” (2001), DOI
- Newey und West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987) DOI
Häufige Fragen
Q1Bedeutet „A umfasst B“, dass B ein schlechtes Modell ist?
Nein. Es bedeutet, dass der festgelegte Test für Ziel, Horizont, Stichprobe und Hypothese keine relevante Zusatzinformation in B gegenüber A gefunden hat. Für ein anderes Ziel oder eine andere bedingte Anwendung kann B dennoch nützlich sein.
Q2Ist ein Encompassing-Test dasselbe wie ein Test der Prognosegenauigkeit?
Nein. Ein Genauigkeitstest vergleicht Verluste. Encompassing fragt nach dem zusätzlichen Signal einer Konkurrenzprognose relativ zu einer Referenz. Beide Ergebnisse können übereinstimmen oder auseinanderfallen.
Q3Sollte ich das Gewicht auf null bis eins beschränken?
Nicht zwingend. Ein unbeschränkter Schätzer kann außerhalb von [0,1] liegen, während bestimmte Kombinationsverfahren Restriktionen auferlegen. Geben Sie Methode und Restriktion an und schätzen Sie mit der Restriktion neu, statt das Ergebnis nachträglich abzuschneiden.
Quellen und weiterführende Lektüre
Problem melden
Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden
Schnelltest
Fertig gelesen? Prüfe dich mit 3 Fragen
Frage 01
Was beschreibt w in f_C = f_A + w(f_B−f_A) unmittelbar?
Wähle eine Antwort, um die Erklärung zu sehen