Mincer–Zarnowitz-Regression: Prognosebias und Kalibrierung prüfen
Erfahre, wie die Mincer–Zarnowitz-Regression Achsenabschnitt und Skalierung einer Prognose prüft, warum ein Fehlerdurchschnitt von null keine Kalibrierung bedeutet und was der Test nicht beweist
In diesem LeitfadenEin Fehlerdurchschnitt von null kann ein Kalibrierungsproblem verdecken
Kurze Zusammenfassung
Eine Mincer–Zarnowitz-Regression (MZ) prüft in einer linearen Kalibrierungsdiagnose, ob realisierte Werte dem Niveau und der Skalierung ihrer Prognosen entsprechen. Die übliche Nullhypothese setzt den Achsenabschnitt auf null und die Steigung der Prognose auf eins. Diese gemeinsame Restriktion sagt mehr aus als der durchschnittliche Fehler allein, beweist aber nicht, dass alle verfügbaren Informationen sinnvoll genutzt wurden.
Ein Fehlerdurchschnitt von null kann ein Kalibrierungsproblem verdecken
Angenommen, ein Modell prognostiziert eine Rendite für die nächste Periode oder eine Ökonomin das Wachstum im nächsten Quartal. Der durchschnittliche Prognosefehler kann in der Bewertungsstichprobe null sein. Das spricht gegen dauerhaftes Über- oder Unterschätzen im Durchschnitt, zeigt aber nicht, dass Prognosewerte sich eins zu eins mit den späteren Ergebnissen bewegen. Prognosen können zu extrem, zu stark geglättet oder linear verschoben sein, während sich positive und negative Fehler ausgleichen.
Die MZ-Regression macht diese zweite Frage sichtbar, indem sie den realisierten Wert auf die Prognose regressiert. Mincer und Zarnowitz führten den Ansatz bei der Bewertung ökonomischer Prognosen ein (Kapitel von 1969). Er ist eine Diagnose für Punktprognosen eines numerischen Ziels, besonders wenn eine bedingte Erwartung unter quadratischem Fehlerverlust geschätzt werden soll. Er vergleicht nicht, welches von zwei Modellen den kleineren durchschnittlichen Verlust hat; dafür gibt es den Diebold–Mariano-Leitfaden.
Auch in der Handelsforschung ist die Unterscheidung wichtig. Eine Renditeprognose kann wenig durchschnittlichen Bias, aber eine falsche Skalierung haben; eine Volatilitätsprognose kann sie in einem Bereich über- und in einem anderen unterschätzen. Der Test kann lineare Abweichungen markieren, sein Ergebnis hängt jedoch von Stichprobe, Zieldefinition, Informationszeitpunkt und Inferenz ab. Er beweist nicht, dass sich aus der Prognose eine profitable Handelsregel ergibt.
Prognoseursprung, Ziel und Datenstand aufeinander abstimmen
Ordne jedem Prognoseursprung t eine Prognose (fₜ) und den später realisierten Zielwert (yₜ) zu. Jedes Paar hat einen festen Horizont: (fₜ) wurde an einem früheren Ursprung für das spätere Ziel (yₜ) erstellt; der Index t dient in den folgenden Gleichungen als Kurznotation für solche Paare. Beide müssen dieselbe Variable, denselben Horizont, dieselbe Einheit und dieselbe Zeitkonvention betreffen. Eine Fünf-Tage-Renditeprognose mit einer Eintagesrendite zu paaren prüft nicht die Kalibrierung für das vorgesehene Ziel.
Verwende nur Prognosen, die am jeweiligen Ursprung tatsächlich verfügbar waren, und bewahre Prognosewert, Modellversion, Datenstand und Informationsschluss auf. Erste Veröffentlichungen von Makrodaten werden mitunter revidiert. Lege fest, ob die Kalibrierung gegen den Erstwert oder einen später endgültigen Wert geprüft wird. Ersetzte historische Eingaben durch revidierte Daten können der Bewertung Informationen geben, die der ursprünglichen Prognose fehlten.
Bei Handelsdaten müssen Schlusskurs-, Intraday- und Overnight-Komponenten konsistent ausgerichtet sein. Überlappende Mehrperiodenziele erzeugen zudem Abhängigkeit zwischen benachbarten Fehlern. Eine gemeinsame Bewertungsstichprobe ist wichtig: Fehlt ein Modell gerade an volatilen Tagen, kann eine andere Zusammensetzung wie ein Kalibrierungsunterschied aussehen. Nutze dieselben Ziele und Prognoseursprünge für alle betrachteten Reihen.
Unterscheide echte erzeugte Prognosen von angepassten Werten. Wurde das Prognosemodell mit denselben Beobachtungen geschätzt, die in die MZ-Regression eingehen, kann die In-Stichproben-Anpassung wie Kalibrierung wirken. Für Aussagen über künftige Prognosen erstelle eine chronologische Out-of-Sample-Reihe, schätze an jedem Ursprung nur mit damals verfügbaren Informationen neu und halte eine unberührte Bestätigungsperiode zurück.
Die Mincer–Zarnowitz-Regression schätzen und die Nullhypothese angeben
Die Standardregression in Niveaus lautet
yₜ = α + β fₜ + uₜ
Dabei ist (yₜ) das realisierte Ziel, (fₜ) die Prognose und (uₜ) das Regressionsresiduum. Die übliche gemeinsame Kalibrierungsrestriktion lautet
H₀: α = 0 und β = 1
Gelten beide Bedingungen, liegt die angepasste lineare Beziehung auf der Identitätsgeraden: Ein konstanter Versatz ist unnötig und eine Einheit mehr Prognose entspricht einer Einheit mehr angepasstem Ergebnis. Schätze die Regression und teste beide Bedingungen gemeinsam mit einem Wald- oder äquivalenten F-Test sowie einer zur Stichprobenstruktur passenden Kovarianzschätzung. Separate Tests für Achsenabschnitt und Steigung ersetzen den gemeinsamen Test nicht.
Das Residuum (uₜ) ist nicht automatisch der rohe Prognosefehler (yₜ − fₜ). Unter der gemeinsamen Null stimmen sie überein; andernfalls nehmen geschätzter Achsenabschnitt und Steigung eine lineare Verschiebung und Skalierung auf. Berichte deshalb neben den Koeffizienten auch den tatsächlichen Prognosefehler.
Die MZ-Restriktion wird mitunter als Test auf Unverzerrtheit oder Rationalität bezeichnet. Definiere den Begriff genau: Ein Fehler mit bedingungslosem Erwartungswert null verlangt (E[yₜ − fₜ] = 0); (α = 0, β = 1) verlangt eine bestimmte lineare Beziehung und ist im Allgemeinen strenger. Holden und Peel zeigen, dass die herkömmliche gemeinsame Restriktion in ihrer Formulierung für Unverzerrtheit hinreichend, aber nicht notwendig ist (1990). Verwende „unverzerrt“ und „MZ-kalibriert“ nicht ohne Angabe der getesteten Bedingung als Synonyme.
<!-- learn:illustration -->

Ein kleines Beispiel trennt Durchschnittsbias und gemeinsame Restriktion
Betrachte drei hypothetische Prognosen und spätere Ergebnisse:
| Prognose (fₜ) | Realisierter Wert (yₜ) | Fehler (yₜ − fₜ) |
|---|---|---|
| 1 | 1.5 | 0.5 |
| 2 | 2.0 | 0.0 |
| 3 | 2.5 | −0.5 |
Der Durchschnitt beider Spalten ist 2 und der mittlere Prognosefehler null. Dennoch gilt (yₜ = 1 + 0.5 fₜ); die MZ-Regression hat also Achsenabschnitt (α = 1) und Steigung (β = 0.5), nicht (0, 1). Fehler heben sich im Durchschnitt auf, obwohl die lineare Restriktion scheitert: In diesem konstruierten Beispiel bewegt sich das Ergebnis nur halb so stark wie die Prognose.
Das ist eine von Hand konstruierte Rechenillustration, keine Marktdaten und keine Inferenzstichprobe. Aus drei rauschfreien Punkten lässt sich weder ein aussagekräftiger p-Wert ableiten noch das Scheitern eines echten Prognosesystems behaupten. In einer realen Stichprobe berücksichtigt der gemeinsame Test die Schätzunsicherheit. Eine große Abweichung kann unpräzise sein; eine kleine kann mit genügend Daten präzise geschätzt werden. Das Beispiel zeigt nur, dass Mittelwertfehler und MZ-Restriktion verschiedene Fragen beantworten.
Eine Anpassung wie (1 + 0.5 fₜ) reproduziert die drei Werte exakt, weil sie aus ihnen konstruiert wurde. Das sagt nichts über künftige Ergebnisse aus. Wenn Rekalibrierung Teil der Methode ist, schätze sie auf einem früheren Trainingsabschnitt und bewerte die Anpassung anschließend auf späteren, dafür nicht verwendeten Daten.
Achsenabschnitt, Steigung und R-Quadrat gemeinsam lesen
Der Achsenabschnitt (α) ist das angepasste Ergebnis bei Prognose null; seine praktische Bedeutung hängt davon ab, ob null im Prognosebereich liegt. Die Steigung (β) beschreibt, wie stark das angepasste Ergebnis mit der Prognose variiert. Bei konstantem Achsenabschnitt bedeutet eine Steigung unter eins, dass sich die Prognose stärker verändert als das angepasste Ergebnis; über eins bedeutet das Gegenteil. Keiner der Koeffizienten beschreibt allein die Beziehung vollständig.
Ein hohes (R²) beweist keine Kalibrierung. Die rauschfreie Beziehung (yₜ = 2 + 1.1 fₜ) hat beispielsweise (R² = 1), verletzt aber die MZ-Null. (R²) fasst erklärte Variation zusammen; der gemeinsame Test prüft, ob die Gerade die Identitätsgerade ist. Umgekehrt kann ein verrauschtes, aber nicht zurückgewiesenes Modell ein niedriges (R²) haben. Kalibrierung und Präzision hängen zusammen, sind jedoch verschieden.
Leite das Ergebnis nicht allein aus zwei einzelnen t-Statistiken ab: Achsenabschnitt und Steigung können korreliert sein. Berichte α, β samt Unsicherheit, gemeinsame Wald-/F-Statistik und p-Wert, Stichprobengröße und mittleren Rohfehler. Eine Grafik mit Identitätsgerade oder ein Vergleich gebinnter Werte kann ergänzen; lege offen, wenn Bins nach Dateninspektion gewählt wurden. Ein linearer Test kann Krümmung, Regimewechsel oder Fehler in den Verteilungsschwänzen übersehen.
Kalibrierung ist schwächer als vollständige Prognoseeffizienz
Unter quadratischem Fehlerverlust ist die optimale Punktprognose der bedingte Erwartungswert des Ziels angesichts der Informationsmenge des Prognostikers. Dann sollten Informationen, die am Prognoseursprung bekannt waren, spätere Fehler nicht vorhersagen können. Eine MZ-Regression prüft aber nur eine lineare Beziehung mit der Prognose selbst und einer Konstante, nicht alle Variablen dieser Informationsmenge.
Eine weitergehende Diagnose kann vorab festgelegte Informationsvariablen (zₜ) in eine Fehlerregression aufnehmen:
yₜ − fₜ = δ₀ + δ₁ zₜ + vₜ
Sagt eine am Ursprung bekannte Variable spätere Fehler voraus, könnte nutzbare Information unberücksichtigt geblieben sein. Zeitliche Verfügbarkeit und Auswahl müssen stimmen; viele Lags, Marktphasen und Transformationen auszuprobieren schafft ein neues Mehrfachtestsproblem. In einer kurzen Liste keine Vorhersagbarkeit zu finden, beweist keine Effizienz gegenüber der ganzen Informationsmenge.
Zarnowitz diskutiert bei Umfrageprognosen Bias, serielle Korrelation, Stichprobengröße und Teststärke (NBER-Arbeitspapier 1070, 1983). Bezeichne MZ deshalb als lineare Kalibrierungsdiagnose oder schwachen Effizienzcheck, nicht als Beweis optimaler Informationsnutzung. Der Giacomini–White-Leitfaden behandelt einen anderen, auf ausgewählten Verlustmomenten beruhenden bedingten Vergleich.
Schätzung, Überlappung und endliche Stichproben berücksichtigen
Prognosefehler können heteroskedastisch, seriell korreliert oder überlappend sein, besonders bei rollierenden Mehrschrittprognosen. Die üblichen OLS-Formeln garantieren daher keine gültigen Standardfehler für die gemeinsame Restriktion. Wähle eine für Horizont, Abhängigkeit und Schätzverfahren begründete Inferenz und berichte sie; unterstelle keine Unabhängigkeit. Bandbreite oder Korrektur sind nicht universell.
Werden Modellparameter in derselben kurzen Stichprobe geschätzt, eine Rekalibrierung gebaut und getestet, kann gewöhnliche Regressionsunsicherheit den gesamten Ablauf verfehlen. Verschachtelte Prognosen können für Genauigkeitsvergleiche zudem nichtstandardmäßige Nullverteilungen erzeugen. Nutze eine Methode für den konkreten Prognoseprozess oder prüfe einen vollständig festgelegten Kalibrierungsschritt auf einem späteren Holdout. Wähle Gleichung, Ziel und Stichprobe nicht nach vielen Versuchen und behandle den letzten p-Wert dann als Bestätigung.
Eine Nichtzurückweisung beweist keine Kalibrierung; geringe Teststärke oder breite Intervalle können der Grund sein. Auch eine Zurückweisung gilt nur für Ziel, Stichprobe, lineare Form und Kovarianzschätzung. Prüfe vernünftige Alternativen und trenne solche Sensitivitätsanalysen von einem vorab festgelegten Test. Das ist besonders wichtig bei persistenten Prognosen oder wenigen unabhängigen Episoden.
Einen Test passend zur Prognosefrage auswählen
MZ prüft eine lineare Kalibrierungsrestriktion für Prognose und realisiertes Ziel. Der Diebold–Mariano-Test fragt dagegen, ob zwei Verfahren unter einem gewählten Score denselben durchschnittlichen Verlust haben. Eine Prognose kann kalibriert und nach diesem Score dennoch schlechter sein oder im Mittel genauer sein und die MZ-Kalibrierung verfehlen.
Wenn die Genauigkeit von Informationen am Prognoseursprung abhängen könnte, prüft der Giacomini–White-Test ausgewählte bedingte Verlustmomente. Wurden viele Prognosen oder Handelsregeln durchsucht, adressiert ein familienweiter Ansatz wie der Model Confidence Set oder White Reality Check/Hansen SPA ein anderes Selektionsproblem. Keiner ersetzt klar definierte Ziele und ehrliche Prognoseursprünge.
Die MZ-Regressionsform in Niveaus ist für numerische Punktprognosen gedacht. Quantil-, Wahrscheinlichkeits-, Intervall- und Dichteprognosen brauchen Kalibrierungstests und Scores für den jeweiligen Prognosegegenstand. Ein gutes Ergebnis für den Mittelwert lässt sich nicht ohne eigene Begründung auf Extremrisiko oder Volatilitätsverteilungen übertragen.
Das Kalibrierungsdesign reproduzierbar berichten
Nenne Ziel, Horizont, Einheit, Informationsschluss, Bewertungsdaten, Datenstand und ob die Prognosen tatsächlich Out-of-Sample entstanden. Gib Gleichung, Fehlerdefinition und getestete Restriktionen an. Erkläre, ob „unverzerrt“ den Fehlerdurchschnitt null oder die gemeinsame MZ-Bedingung (α = 0, β = 1) meint.
Berichte Koeffizienten, Standardfehler oder Intervalle, gemeinsame Wald-/F-Statistik, Freiheitsgrade, p-Wert, Zahl der Prognoseursprünge, mittleren Fehler und (R²) mit begrenzter Interpretation. Beschreibe Kovarianz- oder Resamplingmethode, besonders bei überlappenden Horizonten oder serieller Abhängigkeit. Lege Modellschätzung, Rekalibrierung, Auswahl sowie getestete Alternativziele, Stichproben oder Transformationen offen.
So können Leser durchschnittlichen Bias, lineare Kalibrierung, Informationseffizienz und vergleichende Genauigkeit auseinanderhalten. Das sind getrennte empirische Aussagen. Eine bestandene Restriktion validiert nicht jede Nutzung der Prognose; eine Prognosebewertung allein ist kein Nachweis von Handelsgewinnen nach Kosten.
Häufige Fragen
Q1Ist der Mincer–Zarnowitz-Test nur ein Test des durchschnittlichen Prognosefehlers?
Nein. Der Fehlerdurchschnitt vergleicht die Mittelwerte von Prognose und Ergebnis. Der übliche MZ-Test setzt Achsenabschnitt null und Steigung eins gemeinsam. Holden und Peel zeigen, dass dies unter ihrer Formulierung hinreichend, aber nicht notwendig für Unverzerrtheit ist.
Q2Beweist ein bestandener MZ-Test Effizienz?
Nein. Er prüft eine lineare Beziehung mit der Prognose, nicht ob alle am Ursprung verfügbaren Informationen Fehler ausschließen. Effizienz verlangt eine stärkere Bedingung an die Informationsmenge.
Q3Kann ich dieselbe Regression für eine VaR- oder Quantilprognose verwenden?
Nicht ohne angepasste Kalibrierungsdefinition und Inferenz. Die Standardregression in Niveaus gilt für numerische Punktprognosen; Quantil- und Extremrisikoprognosen brauchen passende Tests und Scores.
Q4Beweist Kalibrierung die Profitabilität einer Handelsstrategie?
Nein. Kalibrierung beschreibt die Beziehung zwischen Prognose und Ergebnis. Profitabilität erfordert eine vorab definierte Handelsregel und eine separate Out-of-Sample-Prüfung einschließlich Ausführung, Gebühren, Finanzierung, Markteinfluss und Risiko. Primärforschung - Mincer und Zarnowitz, „The Evaluation of Economic Forecasts“ (1969) - Holden und Peel, „On Testing for Unbiasedness and Efficiency of Forecasts“ (1990) - Zarnowitz, „Rational Expectations and Macroeconomic Forecasts“ (NBER Working Paper 1070, 1983) - Diebold und Mariano, „Comparing Predictive Accuracy“ (1995) - Giacomini und White, „Tests of Conditional Predictive Ability“ (2006)
Quellen und weiterführende Lektüre
Problem melden
Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden
Schnelltest
Fertig gelesen? Prüfe dich mit 3 Fragen
Frage 01
Was ist die übliche gemeinsame Nullhypothese der MZ-Regression?
Wähle eine Antwort, um die Erklärung zu sehen
Optionsglossar
Klare Definitionen wichtiger Begriffe — von Calls, Puts und Optionsketten bis zu impliziter Volatilität, Griechen und Geld-Brief-Spanne
Optionsglossar öffnen