Skip to content
Alle Leitfäden zu Optionen und Futures
Vergleichen Sie zwei Prognosen anhand ihrer Verluste bei denselben Ergebnissen13 Minuten Lesezeit

Diebold–Mariano-Test erklärt: Prognosegenauigkeit vergleichen

Erfahren Sie, was der Diebold–Mariano-Test vergleicht, wie Verlustdifferenzen und serielle Korrelation in die Statistik eingehen und warum Prognosegenauigkeit kein Handelsgewinn ist.

In diesem LeitfadenDer Test vergleicht den erwarteten Prognoseverlust

Kurze Zusammenfassung

Der Diebold–Mariano-Test (DM-Test) fragt, ob zwei Prognoseverfahren für dieselben beobachteten Ergebnisse denselben erwarteten Verlust aufweisen. Er verwendet eine Zeitreihe von Verlustdifferenzen; deshalb beeinflussen die Verlustfunktion, der Prognosehorizont und die Abhängigkeit zwischen Zeitpunkten das Ergebnis. Eine Zurückweisung stützt einen Unterschied unter dem angegebenen Evaluationsdesign. Sie belegt weder eine dauerhaft überlegene Prognose noch einen nach Kosten profitablen Handelsansatz.

Der Test vergleicht den erwarteten Prognoseverlust

Der Diebold–Mariano-Test vergleicht zwei Prognosen für dasselbe Ziel über dieselben Evaluationszeitpunkte. An jedem Prognoseursprung müssen beide Verfahren demselben realisierten Ergebnis, demselben Prognosehorizont und demselben Informationsstichtag gegenüberstehen. Anschließend prüft der Test, ob der durchschnittliche Verlust eines Verfahrens systematisch vom anderen abweicht, wobei sich die Verlustdifferenzen im Zeitverlauf ändern dürfen.

Diebold und Mariano formulieren die Frage für allgemeine Verlustfunktionen und nicht nur für den mittleren quadratischen Fehler. In ihrer Originalarbeit entwickeln sie Tests der Nullhypothese, dass konkurrierende Prognosen dieselbe Vorhersagegenauigkeit besitzen (Diebold und Mariano, 1995). „Genauigkeit“ bedeutet hier einen niedrigeren erwarteten Verlust gemäß der für den Vergleich gewählten Funktion. Sie bedeutet nicht, dass eine Prognose wahr oder kausal erklärend ist, in allen Teilen ihrer Verteilung gut kalibriert ist oder für jede Entscheidung nützlich ist.

Angenommen, Modell A und Modell B prognostizieren zum selben Zeitpunkt dieselbe zukünftige Rendite. Der DM-Test prüft weder, ob ein Koeffizient eines der Modelle null ist, noch ob beide Modelle in der Schätzstichprobe dieselben angepassten Werte liefern. Verglichen wird, wie sich ihre Prognosefehler in der Evaluationsstichprobe unter der gewählten Verlustfunktion niederschlagen.

Vor der Interpretation der Statistik muss das Design feststehen. Zielgröße, Prognoseursprünge, Horizont, Verlustfunktion, Umgang mit fehlenden Ergebnissen, Zeitplan für Neuschätzungen sowie einseitige oder zweiseitige Alternative bestimmen die Fragestellung. Ändern sich diese Festlegungen zwischen den Modellen, ist die Verlustdifferenz kein Vergleich unter gleichen Bedingungen mehr.

Gepaarte Prognosen und eine Verlustdifferenz definieren

Sei $y_t$ der realisierte Zielwert am Prognoseursprung $t$, und seien $\hat y_{A,t}$ und $\hat y_{B,t}$ die Prognosen der Modelle A und B. Die Prognosefehler lauten $e_{A,t}=y_t-\hat y_{A,t}$ und $e_{B,t}=y_t-\hat y_{B,t}$. Für eine Verlustfunktion $L$ ist die Verlustdifferenz am jeweiligen Datum:

$$ d_t=L(e_{A,t})-L(e_{B,t}) $$

Bei dieser Vorzeichenkonvention bedeutet ein negatives durchschnittliches $d_t$, dass Modell A den niedrigeren beobachteten Verlust hat; ein positives Mittel spricht für den niedrigeren Verlust von B. Die Nullhypothese in der Grundgesamtheit lautet $E[d_t]=0$. Eine zweiseitige Alternative fragt nach einem Unterschied in beliebiger Richtung, eine einseitige nach einer vorab festgelegten Richtung. Die Richtung darf nicht erst gewählt werden, nachdem der Gewinner bekannt ist.

Bei quadratischem Fehlerverlust $L(e)=e^2$ zählen große Abweichungen überproportional. Beim absoluten Fehlerverlust $L(e)=|e|$ wird die Rangfolge weniger von einem einzelnen großen Fehler bestimmt. Quantilverlust kann zu einem asymmetrischen Prognoseziel passen; andere Verlustfunktionen zielen auf weitere Aspekte der Vorhersageleistung. Eine andere Funktion kann die Modellrangfolge umkehren. „Beste Prognose“ hat daher keine eindeutige Bedeutung, bevor der Verlust benannt ist. Auch Tashmans Überblick über Tests mit Prognosen außerhalb der Schätzstichprobe betont, dass das Evaluationsverfahren zur Prognoseaufgabe passen muss (Tashman, 200000065-0)).

Verwenden Sie für beide Modelle dieselben Prognoseursprünge und Ergebnisse. Fehlt bei einem Modell gerade ein schwieriger Zeitpunkt, verändert ein stilles Auslassen dieses Datums nur für dieses Modell die Vergleichsstichprobe. Soll ein Modell im späteren Einsatz monatlich mit neuen Daten neu geschätzt werden, müssen die Evaluationsprognosen dieselbe Regel verwenden. Eine Prognose mit festen Parametern beantwortet eine andere Frage. Eine sequenzielle Auswertung wie die Walk-forward-Validierung zeigt, wie spätere Prognosen ohne Verwendung zukünftiger Daten erstellt werden können.

Ein Beispiel mit vier Prognoseursprüngen erklärt die mittlere Differenz

Betrachten wir vier hypothetische Prognoseursprünge; Zielwert und Prognosefehler werden in Prozentpunkten gemessen. Die Fehler von Modell A lauten $[1,2,0,1]$, die von Modell B $[2,1,1,1]$. Jedes Paar bezieht sich auf dieselbe realisierte Rendite und dasselbe Prognoseintervall. Die Werte dienen ausschließlich der Veranschaulichung der Rechnung.

Bei quadratischem Fehlerverlust hat A die Verluste $[1,4,0,1]$ und damit einen mittleren quadratischen Fehler von $(1+4+0+1)/4=1.50$ quadrierten Prozentpunkten. B hat die Verluste $[4,1,1,1]$ und einen mittleren quadratischen Fehler von $(4+1+1+1)/4=1.75$. Für diese vier Ergebnisse liegt der MSE von A um 0.25 quadrierte Prozentpunkte niedriger.

Die datumsweisen Differenzen $d_t=L(e_{A,t})-L(e_{B,t})$ sind $[-3,3,-1,0]$. Ihr Mittel beträgt $(-3+3-1+0)/4=-0.25$ und entspricht der Differenz zwischen dem MSE von A und dem von B. Das negative Vorzeichen spricht nach dieser Konvention für A. Es sagt noch nicht aus, ob der Unterschied größer als das Stichprobenrauschen ist. Vier Prognosepaare sind kein überzeugender statistischer Nachweis.

Auch die Verlustdefinition verändert, was „besser“ bedeutet. In einem separaten hypothetischen Vergleich hat Modell C absolute Fehler $[0,0,0,3]$ und Modell D absolute Fehler $[1,1,1,1]$. Beim absoluten Verlust beträgt der Mittelwert für C 0.75 und für D 1, also ist C vorzuziehen. Bei quadriertem Verlust betragen die Mittelwerte für C 2.25 und für D 1; nun ist D vorzuziehen. Ohne eine Entscheidung darüber, welche Prognosefehler schwerer wiegen, kann der Test diesen Konflikt nicht lösen.

<!-- Illustration placement: after this section; text-free conceptual scene showing two forecast paths against one realized path, with visibly different miss distances and no labels or numerical claims. -->

Die DM-Statistik skaliert die mittlere Verlustlücke mit ihrer Unsicherheit

Der Stichprobenmittelwert der Verlustdifferenz ist $\bar d=T^{-1}\sum_{t=1}^{T}d_t$, wobei $T$ die Zahl gepaarter Prognoseergebnisse bezeichnet. Sein Standardfehler hängt von der langfristigen Varianz von $d_t$ ab, nicht nur von der Varianz an einem einzelnen Datum. Eine allgemeine Form der Teststatistik ist:

$$ DM=\frac{\bar d}{\sqrt{\widehat{\Omega}/T}} $$

Dabei schätzt $\hat{\Omega}$ die langfristige Varianz der Verlustdifferenzreihe. Bei unabhängigen Datenpunkten entspräche sie unter dem gewählten Schätzer der Varianz von $d_t$. Prognoseverluste häufen sich jedoch häufig: In einer Phase hoher Volatilität können die Fehler beider Modelle groß sein, und bei einem Zielwert über $h$ Schritte können benachbarte Fehlerfenster dieselben realisierten Renditen enthalten. Wird positive Abhängigkeit ignoriert, kann der Standardfehler zu klein ausfallen und die Evidenz stärker erscheinen, als sie ist.

Ein verbreiteter HAC-Ansatz schätzt Autokovarianzen $\hat\gamma_k$ der um ihren Mittelwert bereinigten Verlustdifferenz und kombiniert sie als $\hat{\Omega}=\hat\gamma_0+2\sum_{k=1}^{q}w_k\hat\gamma_k$. Mit Bartlett-Gewichten gilt bis zur Bandbreite $q$: $w_k=1-k/(q+1)$. Newey und West entwickelten einen positiv semidefiniten, heteroskedastizitäts- und autokorrelationskonsistenten Kovarianzschätzer (Newey und West). Kernel und Bandbreite sind Implementierungsentscheidungen: Legen Sie sie offen und wählen Sie sie passend zum Prognosedesign, nicht passend zu einem gewünschten p-Wert. Der Leitfaden zu HAC-Standardfehlern behandelt das allgemeinere Kovarianzproblem.

Unter den regulären Bedingungen des Tests wird die Standard-DM-Statistik mit einer asymptotischen Standardnormalverteilung verglichen. Ein großer Absolutwert bedeutet, dass die beobachtete mittlere Verlustlücke im Verhältnis zu ihrer geschätzten Unsicherheit groß ist. Das Vorzeichen zeigt gemäß der festgelegten Reihenfolge, welches Modell den niedrigeren Verlust hatte; der p-Wert misst weder die Größe noch den ökonomischen Wert der Differenz. Ein p-Wert ist auch nicht die Wahrscheinlichkeit, dass die Nullhypothese stimmt oder eine Prognose künftig funktioniert.

Mehrschrittprognosen überlappen; deshalb ist die Stichprobenkorrektur wichtig

Wer in jeder Periode mehrere Schritte voraus prognostiziert, erhält überlappende Evaluationsfenster. Eine monatliche Prognose der kumulierten Rendite der nächsten drei Monate teilt beispielsweise zwei der drei Monatsrenditen mit der Prognose, die einen Monat später erstellt wird. Selbst bei unabhängigen Monatsrenditen kann diese Überlappung eine serielle Korrelation der Prognosefehler und ihrer Verlustdifferenzen erzeugen.

In einem einfachen $h$-Schritt-Design sollte die Varianzberechnung mindestens die Abhängigkeit bis zum Lag $h-1$ berücksichtigen. Das ist keine universelle Bandbreitenregel: Rollierende Parameterschätzungen, persistente Zielgrößen, Volatilitätscluster und die gewählte Verlustfunktion können zusätzliche Abhängigkeit verursachen. Dokumentieren Sie Prognosehorizont, Abstand der Prognoseursprünge und die Begründung für die HAC-Abschneidung oder einen anderen Varianzschätzer. Die Zahl der Prognosezeilen ist nicht automatisch die Zahl unabhängiger Informationsstücke.

Der ursprüngliche asymptotische Test kann in mittelgroßen Stichproben eine unpassende tatsächliche Testgröße aufweisen. Harvey, Leybourne und Newbold schlagen eine Korrektur für endliche Stichproben zum Vergleich mittlerer quadratischer Prognosefehler vor (HLN, 199700719-4)). Eine verbreitete Form für den Horizont $h$ und $T$ Prognosen skaliert die DM-Statistik mit:

$$ DM_{HLN}=DM\sqrt{\frac{T+1-2h+h(h-1)/T}{T}} $$

Die korrigierte Statistik wird üblicherweise mit einer t-Verteilung mit $T-1$ Freiheitsgraden verglichen. Bei $T=60$ und $h=5$ beträgt der Multiplikator etwa $0.925$. Das Beispiel zeigt nur die Rechnung der Korrektur; es besagt nicht, dass 60 Beobachtungen für ein bestimmtes Modell ausreichen oder die Annahmen erfüllt sind. Die Korrektur behandelt ein bestimmtes Problem kleiner Stichproben, behebt aber weder Datenleckage, ein ungültiges Ziel, unbeachtete Abhängigkeit, wiederholte Modellauswahl noch eine falsch spezifizierte Verlustfunktion.

Verschachtelte Modelle erfordern eine andere Argumentation zum Prognosevergleich

Modell A kann eine eingeschränkte Version von Modell B sein, etwa wenn B zusätzliche Prädiktoren enthält. Selbst wenn die zusätzlichen Prädiktoren unter der Nullhypothese keinen Prognosewert in der Grundgesamtheit haben, können ihre geschätzten Koeffizienten Rauschen in die Prognosen von B bringen. Das größere Modell kann deshalb einen höheren beobachteten MSE aufweisen, obwohl die zusätzlichen Variablen den zugrunde liegenden Prognoseprozess nicht verbessern. Die übliche Gleichgenauigkeitslogik für nicht verschachtelte Wettbewerber gilt nicht unverändert.

Clark und West entwickeln annähernd normalverteilte Tests auf gleiche Vorhersagegenauigkeit in verschachtelten Modellen und passen den Vergleich quadratischer Fehler um das durch das größere Modell erzeugte Schätzrauschen an (Clark und West, 2007). Ihre Anpassung ersetzt nicht jeden DM-Test: Sie ist für eine bestimmte Frage zu verschachtelten Modellen, Verlustfunktion und asymptotischen Konstellation ausgelegt. Prüfen Sie, ob ein Modell das andere verschachtelt, und wählen Sie einen Test, dessen Nullverteilung zum Design passt. Nehmen Sie nicht an, ein Standard-DM-p-Wert aus einer Software decke jede Modellbeziehung ab.

Auch andere Unterscheidungen sind wichtig. Ein Modell mit geringerem MSE muss weder die Intervallabdeckung noch die Wahrscheinlichkeitskalibrierung, Richtungsgenauigkeit oder eine nachgelagerte Entscheidung verbessern. Ein Prognosevergleich kann zwar außerhalb der Schätzstichprobe liegen, aber dennoch einen ungeeigneten Holdout verwenden, der während der Modellentwicklung wiederholt geprüft wurde. Geben Sie die Beziehung zwischen den Modellen, das Schätzverfahren, den Prognosehorizont und den Datenstand für jede Prognose an.

Prognosegenauigkeit ist nicht dasselbe wie ein Handelsvorteil

Ein DM-Ergebnis bewertet einen Prognoseverlust. Eine Handelsentscheidung bewertet einen Ertrags- und Risikoprozess. Ein niedrigerer MSE für die Rendite der nächsten Periode garantiert nicht, dass ein Signal oft genug die richtige Handelsrichtung trifft, Positionen passend dimensioniert oder Umschlag, Spread, Markteinfluss, Gebühren, Leihkosten, Funding und Ausführungsverzögerungen übersteht. Umgekehrt kann eine Prognose mit leicht höherem mittlerem quadratischen Fehler eine Entscheidung verbessern, wenn sie gerade dort genauer ist, wo die Strategie stark exponiert ist. Für eine solche Aussage sollte die Verlustfunktion gegebenenfalls die tatsächliche Entscheidung abbilden statt eine bequeme allgemeine Prognosekennzahl zu verwenden.

Selbst ein statistisch signifikanter Unterschied kann ökonomisch sehr klein sein. Berichten Sie neben der Unsicherheit die Größe der mittleren Verlustdifferenz in verständlichen Einheiten, nicht nur einen p-Wert oder das Etikett „Gewinner“. Geht es um Portfolioergebnisse, muss die vollständige, eingefrorene Entscheidungsregel auf geeigneten späteren Daten mit realistischen Handelsannahmen wiederholt und die Nettorendite separat ausgewiesen werden. Der DM-Test berechnet solche Ergebnisse nicht und berücksichtigt keine Kosten, sofern die Verlustfunktion nicht ausdrücklich so gestaltet wurde.

Der Test korrigiert auch nicht dafür, dass viele Modelle, Zielgrößen, Horizonte, Verlustfunktionen, Zeiträume oder Handelsregeln durchsucht und anschließend nur der günstigste Vergleich berichtet wird. Wiederholte Paarvergleiche schaffen ein eigenes Auswahlproblem. Bewahren Sie das Suchprotokoll auf und verwenden Sie ein Mehrfachtestverfahren, das zur Familie der Behauptungen passt. Der Leitfaden zu Mehrfachtests und Falschentdeckungsrate erläutert, warum gewöhnliche Schwellen nach einer breiten Suche irreführen können. Ein DM-Test ist ein Evaluationswerkzeug und keine Korrektur für Data Snooping.

Berichten Sie genug Details, damit der Vergleich reproduzierbar ist

Ein klarer Bericht nennt Zielgröße und Einheiten, Informationsstichtag, Prognoseursprünge, Horizont, Neuschätzungsplan und gemeinsame Evaluationsstichprobe. Er nennt die Verlustfunktion und das Vorzeichen von $d_t$, zeigt den durchschnittlichen Verlust jedes Modells und die mittlere Differenz, gibt die vorab gewählte ein- oder zweiseitige Hypothese an und dokumentiert Varianzschätzer, Kernel, Bandbreite, Teststatistik, Referenzverteilung, p-Wert sowie gegebenenfalls Konfidenzintervall oder Unsicherheitsschätzung.

Legen Sie außerdem offen, ob die Modelle verschachtelt sind, wie mit fehlenden Ergebnissen und Extremwerten umgegangen wurde, wie viele alternative Spezifikationen geprüft wurden und ob die Evaluationsperiode die Modellauswahl beeinflusst hat. Zeigen Sie die Größe der Differenz statt nur, ob ein Schwellenwert überschritten wurde. Eine Zeitreihe von $d_t$ oder die kumulierte Verlustdifferenz kann Regimewechsel sichtbar machen, die ein Gesamtmittel verdeckt; eine Grafik ersetzt jedoch keine Inferenz, die Abhängigkeit berücksichtigt.

Im quantitativen Handel gehört auch der Weg von der Prognose zur Handlung dazu: Signalschwelle, Positionsgröße, Rebalancing-Zeitpunkt, Risikokontrollen, Ausführungspreis und Kostenannahmen. Der DM-Test vergleicht nur die Prognoseverlustreihe, die ihm vorgegeben wird. Er zertifiziert weder die Datenpipeline, macht unterschiedliche Evaluationsstichproben vergleichbar, beweist Kausalität noch garantiert er den Fortbestand historischer Rangfolgen. Verwenden Sie ihn als transparenten Teil der Modellbewertung zusammen mit einem zeitlich sauberen Prognosedesign und einer expliziten Beurteilung der Entscheidungsebene.

Häufige Fragen

Q1Vergleicht der Diebold–Mariano-Test Modellkoeffizienten?

Nein. Er vergleicht den erwarteten Verlust der Prognosefehler, die zwei Prognoseverfahren für dieselben Ergebnisse erzeugen. Ein Koeffiziententest beantwortet eine andere Frage zu einem Modellparameter.

Q2Kann ich den Test für Prognosen über mehrere Perioden verwenden?

Ja, aber überlappende Zielzeiträume können aufeinanderfolgende Verlustdifferenzen seriell abhängig machen. Verwenden Sie einen zum Horizont und Modelldesign passenden Varianzschätzer und gegebenenfalls eine Korrektur für endliche Stichproben; dokumentieren Sie Ihre Entscheidungen.

Q3Bedeutet ein signifikantes Ergebnis, dass die bessere Prognose Geld verdient?

Nein. Es stützt einen Unterschied beim gewählten Prognoseverlust unter dem Evaluationsdesign. Die Rentabilität hängt auch davon ab, wie Prognosen in Positionen umgesetzt werden, welches Risiko eingegangen wird sowie von tatsächlicher Ausführung und Handelskosten.

Quellen und weiterführende Lektüre

Problem melden

Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden

Schnelltest

Fertig gelesen? Prüfe dich mit 3 Fragen

Frage 1 / 3

Frage 01

Wie lautet die Nullhypothese des grundlegenden Diebold–Mariano-Vergleichs?

Wähle eine Antwort, um die Erklärung zu sehen

Optionsglossar

Legen Sie fest, aus welcher Historie ein Finanzmodell lerntExpanding- und Rolling-Fenster für die Walk-Forward-ValidierungVergleichen Sie wachsende und feste rollierende Trainingsfenster für Finanzmodelle, trennen Sie Validierung und Abschlusstest und wählen Sie Fensterregeln ohne spätere Ergebnisse.Derselbe Koeffizient kann unterschiedliche Unsicherheit habenHeteroskedastizität, Autokorrelation und robuste StandardfehlerErfahre, warum klassische Standardfehler scheitern, was White-, Cluster- und Newey-West-HAC-Schätzer erlauben, wie sie ausgewählt werden und wo robuste Inferenz bei Finanzdaten endetWarum ein einzelner Schwellenwert scheitert, wenn Forschende viele Ideen testenMehrfachtests und False Discovery Rate im FinanzwesenVerstehen Sie multiple Vergleiche, familienweite Fehlerrate, False Discovery Rate, Bonferroni, Holm, Benjamini–Hochberg, Abhängigkeit, q-Werte, Faktormining, Backtest-Auswahl und Forschungs-GovernancePrognosegenauigkeit vergleichenDiebold–Mariano-Test: So vergleichen Sie PrognosenErfahren Sie, wie der Diebold–Mariano-Test gepaarte Prognoseverluste vergleicht, überlappende Horizonte berücksichtigt und warum ein kleiner p-Wert keine Handelsfähigkeit belegt.Validierung von ZeitreihenmodellenPurged Cross-Validation und Embargo: Label-Leakage in Trading-Modellen vermeidenErfahren Sie, wie Purging und Embargo überlappende Forward-Labels in Finanzzeitreihen behandeln und wie sie sich von Walk-Forward-Validierung und CPCV unterscheiden.