Skip to content
Alle Leitfäden zu Optionen und Futures
Vergleich von Prognosemodellen14 Minuten Lesezeit

Model Confidence Set (MCS): Prognosemodelle vergleichen, ohne einen Sieger zu erzwingen

Erfahre, wie das Model Confidence Set mit sequenziellen Tests und einem Bootstrap für abhängige Daten Prognosemodelle beibehält, die sich statistisch nicht unterscheiden lassen.

In diesem LeitfadenWelche Frage beantwortet das Model Confidence Set?

Kurze Zusammenfassung

Das Model Confidence Set (MCS) vergleicht eine festgelegte Familie von Prognoseverfahren und behält diejenigen Kandidaten bei, deren Unterlegenheit sich unter einer gewählten Verlustfunktion nicht nachweisen lässt. Wenn die Stichprobe die Kandidaten nicht trennt, können mehrere Modelle übrig bleiben. Das Ergebnis hängt von der Kandidatenfamilie, dem Prognosedesign, der Verlustfunktion und dem Inferenzverfahren ab.

Welche Frage beantwortet das Model Confidence Set?

Angenommen, mehrere Verfahren prognostizieren die Volatilität des nächsten Tages. Ihre Fehler sind unterschiedlich, aber die Stichprobe ist vielleicht zu kurz oder zu verrauscht, um festzustellen, welches Verfahren den kleinsten erwarteten Verlust hat. Wer einfach das Verfahren mit dem niedrigsten Durchschnittsverlust auswählt, erzwingt einen Sieger, auch wenn der Abstand durch Stichprobenschwankungen entstanden sein könnte. Das MCS gibt eine mengenförmige Antwort: Welche Kandidaten lassen sich anhand des gewählten Leistungskriteriums mit den vorliegenden Daten nicht als unterlegen einstufen?

Das MCS beginnt mit einer Kandidatenmenge \(\mathcal M_0\), einer Verlustfunktion oder einem anderen Kriterium und einem Konfidenzniveau. Es prüft wiederholt, ob die noch betrachteten Kandidaten die gleiche Prognosefähigkeit haben. Wird die Hypothese verworfen, entfernt eine Eliminierungsregel einen relativ schwachen Kandidaten; anschließend wird die kleinere Menge erneut getestet. Die verbleibenden Kandidaten bilden das MCS. Hansen, Lunde und Nason führen das Verfahren als Konfidenzmenge für das beste Modell oder die besten Modelle der festgelegten Sammlung ein – ähnlich einer Parameter-Konfidenzregion, die bei ungenauen Daten mehrere Werte umfasst (Arbeit von 2011).

„Am besten“ gilt nur innerhalb dieses Vergleichs. Welches Modell am besten ist, hängt von den aufgenommenen Kandidaten, dem Ziel, dem Prognosehorizont, den am jeweiligen Prognoseursprung verfügbaren Informationen und dem Bewertungskriterium ab. Das MCS setzt nicht voraus, dass ein Kandidat der wahre datengenerierende Prozess ist. Mehrere Kandidaten können denselben niedrigsten erwarteten Verlust haben. Das MCS liefert keine Bayes’sche Wahrscheinlichkeit dafür, dass ein behaltenes Modell richtig ist.

Kandidatenfamilie und Prognosefrage vorab festlegen

Definiere die Menge \(\mathcal M_0\), bevor du Verluste berechnest. Ein Kandidat kann ein geschätztes Modell samt Schätz- und Aktualisierungsregel sein oder ein Prognoseverfahren ohne statistisches Modell. Die Bezeichnung „GARCH“ reicht beispielsweise nicht aus, wenn sich Fehlerverteilung, Länge des rollierenden Fensters, Parameterschätzung oder Prognosehorizont unterscheiden. Jede solche Kombination ist ein anderes Prognoseverfahren.

Jeder Kandidat muss dasselbe Ziel zu denselben Prognoseursprüngen und mit den Informationen prognostizieren, die zu diesem Zeitpunkt verfügbar waren. Der Verlust einer eintägigen Prognose der bedingten Varianz lässt sich nicht ohne Weiteres mit dem einer fünftägigen Volatilitätsprognose vergleichen, wenn sich Ziel oder Einheit unterscheiden. Verwende eine gemeinsame Auswertungsstichprobe, beschreibe den Umgang mit fehlenden Beobachtungen und dokumentiere Datenstand, anfängliches Schätzfenster, rekursive oder rollierende Aktualisierung und überarbeitete Eingabedaten. Bei überlappenden Mehrschrittprognosen können Verluste unterschiedlicher Ursprünge dieselben realisierten Zielperioden teilen.

Wähle das Kriterium, bevor du die Ergebnisse ansiehst. Bei Punktprognosen können quadratischer Fehler, absoluter Fehler oder entscheidungsspezifischer Verlust zu unterschiedlichen Rangfolgen führen. Für Varianzprognosen kann ein Verlust nötig sein, der verrauschte Volatilitätsproxys berücksichtigt; Quantilprognosen brauchen eine passende Quantilbewertung. Ein gutes MCS unter einer Verlustfunktion muss unter einer anderen nicht gut sein. Wird die Kandidatenliste nach Sichtung derselben Auswertungsergebnisse verkleinert, ist die formale Menge an diese nicht offengelegte Vorauswahl gebunden und bildet die gesamte Suche nicht mehr ab.

Gemeinsame Prognosen in gepaarte Verlustdifferenzen umwandeln

Sei \(y_{t+h}\) der realisierte Zielwert für eine Prognose vom Ursprung \(t\), und \(\hat y_{i,t+h|t}\) die Prognose von Kandidat \(i\). Berechne mit einer vorab gewählten Verlustfunktion \(L\) den Verlust jedes Kandidaten an jedem gemeinsamen Ursprung:

\[ L_{i,t}=L(y_{t+h},\hat y_{i,t+h|t}) \]

Niedrigerer Verlust gelte als besser. Die gepaarte Differenz zwischen den Kandidaten \(i\) und \(j\) lautet:

\[ d_{ij,t}=L_{i,t}-L_{j,t}, \qquad \bar d_{ij}=\frac{1}{P}\sum_{t=1}^{P}d_{ij,t} \]

Dabei bezeichnet \(P\) die Zahl gemeinsamer Prognoseursprünge. Nach dieser Vorzeichenkonvention bedeutet \(\bar d_{ij}>0\), dass Kandidat \(i\) in der Stichprobe einen höheren durchschnittlichen Verlust als \(j\) hatte; \(\bar d_{ij}<0\) spricht für \(i\). Die Paarung ist wichtig, weil beide Kandidaten denselben realisierten Ergebnissen ausgesetzt waren. Ein gemeinsamer Marktschock kann die Verluste beider erhöhen, während die Differenz ihre relative Leistung an denselben Tagen isoliert.

Die Nullhypothese gleicher Prognosefähigkeit für eine aktuelle Menge \(\mathcal M\) lässt sich so schreiben:

\[ H_{0,\mathcal M}:\quad \mu_{ij}=E[d_{ij,t}]=0 \quad \text{for every } i,j\in\mathcal M \]

Das ist eine gemeinsame Aussage über die aktuelle Menge, keine Sammlung unabhängiger Paarvergleiche, aus denen man nachträglich passende Ergebnisse auswählt. Das MCS verbindet einen Äquivalenztest für die Menge mit einer Eliminierungsregel für den Vergleich mehrerer Kandidaten. Die Nullhypothese besagt nicht, dass die Prognosen an jedem Datum identisch sind.

Aktuelle Menge testen und Eliminierungsregel festlegen

Das MCS wechselt zwischen einem Test für die Kandidatenmenge und einem Eliminierungsschritt. Beginne mit \(\mathcal M=\mathcal M_0\) und teste die gleiche Prognosefähigkeit auf dem gewählten Niveau \(\alpha\). Wird die Hypothese nicht verworfen, endet das Verfahren und die aktuelle Menge wird berichtet. Wird sie verworfen, entfernt eine vorab festgelegte Regel einen Kandidaten; der Test wird für die verkleinerte Menge wiederholt. Unter den Annahmen des Verfahrens bilden die Überlebenden das \((1-\alpha)\)-MCS.

Die Arbeit behandelt zwei bekannte Statistiken. Die Range-Statistik sucht die größte standardisierte paarweise Verlustdifferenz:

\[ T_{R,\mathcal M}=\max_{i,j\in\mathcal M}|t_{ij}|, \qquad t_{ij}=\frac{\bar d_{ij}}{\widehat{\mathrm{se}}(\bar d_{ij})} \]

Die dazu passende Eliminierungsregel entfernt den Kandidaten mit dem größten standardisierten Nachteil gegenüber einem anderen Kandidaten. Eine zweite Statistik vergleicht jeden Kandidaten mit der durchschnittlichen Leistung der aktuellen Menge:

\[ T_{\max,\mathcal M}=\max_{i\in\mathcal M}t_{i\cdot}, \qquad d_{i\cdot,t}=\frac{1}{|\mathcal M|}\sum_{j\in\mathcal M}d_{ij,t} \]

Hier standardisiert \(t_{i\cdot}\) den Mittelwert von \(d_{i\cdot,t}\) mit seinem Standardfehler. Die passende Regel entfernt den Kandidaten mit dem größten standardisierten Mehrverlust gegenüber dem Durchschnitt der Menge. Statistik und Eliminierungsregel bilden ein Paar. Lege sie gemeinsam fest und berichte sie; mische sie nicht nachträglich, weil eines der Paare eine kleinere Menge ergibt. Die MCS-Arbeit zeigt, weshalb der Test und die Regel zur Bestimmung des entfernten Kandidaten kohärent sein müssen (Hansen, Lunde und Nason).

Zeitliche Abhängigkeit im Bootstrap erhalten

Die Verteilung der Maximumstatistik hängt von der gemeinsamen Variabilität der Verlustdifferenzen ab. Werden jedes Modell und jedes Datum als unabhängige Beobachtung behandelt, können zwei Arten von Abhängigkeit verloren gehen: aufeinanderfolgende Verluste können zeitlich zusammenhängen, und die Verluste mehrerer Kandidaten am selben Datum sind gepaart. Der MCS-Bootstrap sollte deshalb die gemeinsame Zeitreihenstruktur bewahren, während er die Nullverteilung der Statistik für die Kandidatenmenge approximiert.

Eine Möglichkeit ist, zeitlich ausgerichtete Blöcke des Vektors aus Kandidatenverlusten oder -differenzen gemeinsam neu zu ziehen. Beim Stationary Bootstrap haben die Blöcke zufällige Längen; der nächste Block kann an einem zufällig gewählten Datum beginnen. Politis und Romano führten das Verfahren für schwach abhängige stationäre Beobachtungen ein (Arbeit von 1994). Der Implementierungsanhang der MCS-Arbeit beschreibt Block-Bootstraps und nennt den Stationary Bootstrap als Alternative. Werden die Verlustreihen der Modelle unabhängig voneinander neu gezogen, geht die Paarung am selben Datum verloren und der Vergleich kann sich ändern.

Durchschnittliche Blocklänge, Bootstrap-Variante, Zentrierung unter der Null gleicher Prognosefähigkeit, Anzahl der Wiederholungen und Prognosehorizont beeinflussen die Unsicherheitsschätzung. Überlappende Mehrschrittprognosen können die Abhängigkeit in den Verlustdifferenzen verlängern, aber eine universelle Blocklänge gibt es nicht. Beschreibe das Design und prüfe, ob die Schlussfolgerung bei plausiblen Abhängigkeitsannahmen stabil bleibt. Bootstrap-Ergebnisse sind eine Approximation unter Annahmen; sie korrigieren weder Look-ahead noch wiederholt geprüfte Testdaten, nichtstationäre Verlustverläufe oder eine unvollständige Kandidatenfamilie.

Hypothetischen Vergleich mit vier Modellen nachvollziehen

Angenommen, vier Verfahren A, B, C und D prognostizieren dasselbe Volatilitätsziel an 120 gemeinsamen täglichen Ursprüngen. Ihre durchschnittlichen quadratischen Verluste betragen 1,20, 1,23, 1,45 und 1,90 in illustrativen quadrierten Prozentpunkte-Einheiten. Diese Mittelwerte ordnen A an erster und D an letzter Stelle ein, sagen aber nicht, ob der Abstand größer als die Stichprobenunsicherheit ist.

Die mittlere gepaarte Verlustdifferenz von A gegenüber B beträgt \(1.20-1.23=-0.03\). Bei einem um zeitliche Abhängigkeit bereinigten Standardfehler von \(0.04\) ergibt sich die paarweise Statistik \(-0.03/0.04=-0.75\). Dieser einzelne Vergleich belegt keinen klaren statistischen Unterschied zwischen A und B. Das MCS hört hier nicht auf, sondern verwendet in der Statistik für die Gesamtmenge die gemeinsamen Kontraste aller vier Kandidaten.

Nehmen wir zur Veranschaulichung an, ein Block-Bootstrap-MCS für die vollständige Verlustreihe mit 120 Ursprüngen verwendet \(T_R\), \(\alpha=0.05\) und eine kohärente Eliminierungsregel für den schwächsten Kandidaten. Angenommen, der p-Wert der vollen Menge beträgt 0.018, sodass D entfernt wird; für \(\{A,B,C\}\) ergibt sich danach 0.11. Da 0.11 über 0.05 liegt, wird die Null nicht mehr verworfen und das illustrative 95%-MCS endet bei \(\{A,B,C\}\). C bleibt trotz eines höheren durchschnittlichen Verlusts als A enthalten, denn der gemeinsame Test hat C in diesem hypothetischen Lauf nicht als unterlegen nachgewiesen.

Diese p-Werte sind erfunden und dienen nur zur Erklärung der Schritte. Aus den vier Durchschnittsverlusten oder dem Kontrast zwischen A und B lassen sie sich nicht rekonstruieren. Ein tatsächliches Ergebnis erfordert die vollständige Verlustreihe je Prognoseursprung, die Prognosen der Kandidaten, das Bootstrap-Design und die Eliminierungsfolge. Bewahre diese Eingaben auf und berichte für jeden Schritt, welcher Kandidat entfernt wurde. <!-- learn:illustration -->

Mehrere Prognosepfade liegen innerhalb eines weichen Bandes nah beieinander, während fernere Pfade verblassen – es bleibt eine Menge statt eines einzelnen Siegers
Konzeptdarstellung eines Prognosevergleichs, der mehrere statistisch nicht unterscheidbare Kandidaten behält; keine beobachteten Prognosen, empirischen Ergebnisse oder Handelssignale.

Verbleibende Modelle ohne Übertreibung interpretieren

Ein 95%-MCS ist unter den Regularitätsbedingungen und Testannahmen des Verfahrens so konstruiert, dass es den besten Kandidaten der festgelegten Menge mit mindestens der ausgewiesenen asymptotischen Abdeckung enthält. Das bedeutet nicht, dass jedes behaltene Modell mit 95-prozentiger Wahrscheinlichkeit das beste ist. Die Konfidenzaussage betrifft die Abdeckung bei wiederholten Stichproben, nicht eine Bayes’sche Verteilung über Modellnamen.

Wenn die Null gleicher Prognosefähigkeit nicht verworfen wird, ist damit nicht bewiesen, dass die erwarteten Verluste exakt gleich sind. Die Teststärke kann gering sein, etwa bei kurzer Auswertungsperiode, stark schwankenden Verlustdifferenzen oder mehreren nahezu gleichwertigen Kandidaten. Eine große verbleibende Menge kann bedeuten, dass die Daten die Alternativen nicht trennen. Sie kann außerdem Modelle enthalten, die absolut schlecht sind, denn das MCS vergleicht Kandidaten miteinander und verlangt keinen externen Mindeststandard.

Die Menge ist außerdem durch die anfängliche Kandidatenmenge \(\mathcal M_0\) begrenzt. Fehlt dort ein tatsächlich besseres Prognoseverfahren, kann das MCS es nicht entdecken. Wird ein Modell vor der Analyse nach Sichtung derselben Auswertungsdaten entfernt, berücksichtigt die nominelle Abdeckung diese nicht dokumentierte Auswahl nicht. Berichte, wie die Kandidatenfamilie gebildet und gefiltert wurde. Haben mehrere Kandidaten denselben niedrigsten erwarteten Verlust, ist es methodisch vorgesehen, mehr als einen zu behalten.

MCS von paarweisen und benchmarkbezogenen Tests unterscheiden

Der Diebold–Mariano-Test konzentriert sich auf eine gepaarte Verlustdifferenz zweier Prognoseverfahren für dieselben Ergebnisse. Das MCS testet eine Menge schrittweise und berichtet die Kandidaten, die das gemeinsame Eliminierungsverfahren überstehen. Mehrere DM-Tests auszuführen und anschließend nicht signifikante Paare zu behalten, ist nicht automatisch mit MCS gleichzusetzen; der gemeinsame Bootstrap und die kohärente Eliminierungsregel sind entscheidend.

Der Clark–West-Test behandelt einen engeren Vergleich quadratischer Fehler, wenn ein Prognosemodell ein eingeschränktes Benchmarkmodell enthält und Schätzunsicherheit die rohe Differenz beeinflusst. MCS verlangt keine Verschachtelung und kann eine nutzerdefinierte Verlustfunktion verwenden, braucht aber weiterhin ein gemeinsames Prognosedesign.

White’s Reality Check und Hansens Superior Predictive Ability Test fragen, ob mindestens ein Kandidat einer durchsuchten Familie einen festgelegten Benchmark übertrifft. Das MCS ist benchmarkfrei und beschreibt eine relativ überlegene Kandidatenmenge, statt nur einen Benchmark zu testen. Alle Verfahren müssen Suchumfang und Abhängigkeit berücksichtigen, beantworten aber unterschiedliche Nullhypothesen. Siehe den Leitfaden zu Reality Check und SPA sowie die Originalarbeiten von White (2000) und Hansen (2005).

Design reproduzierbar berichten und Prognoserang von Handelswert trennen

Ein reproduzierbarer MCS-Bericht nennt alle Kandidatenverfahren, gemeinsames Ziel und Horizont, Informationsregeln, Schätzplan, Auswertungsdaten, Behandlung fehlender Werte, Verlustformel und die Richtung, die als besser gilt. Berichte außerdem Signifikanzniveau, Teststatistik und Eliminierungsregel, Bootstrap-Typ, Blocklänge, Zentrierung, Anzahl der Wiederholungen, p-Werte je Schritt und die endgültige Zugehörigkeit. Durchschnittliche Verluste und Differenzen liefern Kontext, ersetzen die gemeinsame Inferenz aber nicht durch eine Rangliste.

Bei Volatilitätsprognosen ist anzugeben, wie der beobachtete Proxy konstruiert wurde und ob er verrauscht oder revidiert ist. Für Mehrschrittprognosen sind überlappende Zielperioden und die Abhängigkeitsbehandlung offenzulegen. Ändert sich die Zugehörigkeit bei plausiblen Varianten von Verlust, Zeitraum und Bootstrap wesentlich, sollte diese Sensitivität gezeigt werden. Ein kleiner p-Wert ohne die ausgeschiedenen Kandidaten und den Ablauf reicht nicht aus, um die Menge nachzuvollziehen.

Ein MCS vergleicht Prognoseverfahren nach einem Kriterium. Es zeigt weder Kausalität noch das wahre datengenerierende Modell noch, dass eine verbleibende Prognose einen profitablen Handel erzeugt. Für die Umsetzung in Positionen kommen Schwellen, Positionsgrößen, Umschlag, Ausführungszeitpunkt, Spread, Gebühren, Slippage, Finanzierung, Leihe und Risikolimits hinzu. Bewerte den eingefrorenen Entscheidungsprozess getrennt auf geeigneten späteren Daten und berichte Nettoergebnisse separat. Zur Bewertung von Volatilität mit verrauschten Proxys siehe QLIKE versus quadratischer Fehler.

Häufige Fragen

Q1Wählt das MCS genau ein bestes Modell?

Nicht unbedingt. Wenn die Daten einen Kandidaten klar abgrenzen, kann ein Modell übrig bleiben. Andernfalls können mehrere Kandidaten bleiben, deren Unterlegenheit nicht belegt ist. Für die Auswahl eines einzelnen Modells aus dieser Menge braucht es eine eigene Entscheidungsregel.

Q2Hat ein Modell im MCS eine 95-prozentige Wahrscheinlichkeit, richtig zu sein?

Nein. Das Konfidenzniveau beschreibt unter den Annahmen des Verfahrens die Abdeckung des besten Kandidaten der festgelegten Familie bei wiederholten Stichproben. Es ist keine Bayes’sche Wahrscheinlichkeit, dass ein Modell wahr ist.

Q3Kann ich das MCS auch für andere Prognosen als Volatilität nutzen?

Ja. Das Verfahren kann Prognosen, ökonometrische Modelle oder andere Kandidaten vergleichen, wenn ein sinnvolles gemeinsames Kriterium und ein passendes Stichprobendesign festgelegt sind. Das Ergebnis hängt immer von Kandidatenmenge und Verlust ab.

Q4Berücksichtigt das MCS automatisch jedes Modell, das ich ausprobiert habe?

Nur wenn die tatsächliche Suche in Kandidatenfamilie und Auswertungsverfahren abgebildet ist. Nicht dokumentierte Vorauswahl und wiederholte Nutzung der Auswertungsdaten werden durch ein nachträglich berechnetes MCS nicht korrigiert.

Quellen und weiterführende Lektüre

Problem melden

Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden

Schnelltest

Fertig gelesen? Prüfe dich mit 3 Fragen

Frage 1 / 3

Frage 01

Was berichtet das Model Confidence Set?

Wähle eine Antwort, um die Erklärung zu sehen

Optionsglossar

Klare Definitionen wichtiger Begriffe — von Calls, Puts und Optionsketten bis zu impliziter Volatilität, Griechen und Geld-Brief-Spanne

Optionsglossar öffnen
Vergleichen Sie zwei Prognosen anhand ihrer Verluste bei denselben ErgebnissenDiebold–Mariano-Test erklärt: Prognosegenauigkeit vergleichenErfahren Sie, was der Diebold–Mariano-Test vergleicht, wie Verlustdifferenzen und serielle Korrelation in die Statistik eingehen und warum Prognosegenauigkeit kein Handelsgewinn ist.Vergleich verschachtelter PrognosenDer Clark–West-Test für verschachtelte Prognosen: Formel, Beispiel und GrenzenErfahre, warum verschachtelte Prognosemodelle einen angepassten MSPE-Vergleich benötigen, wie die Clark–West-Statistik funktioniert und was ein einseitiges Ergebnis aussagen kann und was nicht.Zwei Bootstrap-Tests für viele gleichzeitig geprüfte HandelsregelnWhite Reality Check und Hansen SPA für Handelsregeln erklärtErfahren Sie, wie White Reality Check und Hansen SPA eine ganze Familie technischer Handelsregeln vergleichen, wie sich ihre Null-Bootstraps unterscheiden und was ein globaler p-Wert aussagt.Bewertung von VolatilitätsprognosenQLIKE oder quadrierter Fehler für Volatilitätsprognosen: verrauschte ProxysVergleiche QLIKE und quadrierte Fehlerverluste für Volatilitätsprognosen, rechne eine Umkehr der Rangfolge nach und erfahre, wann verrauschte Proxys der realisierten Varianz die erwartete Prognoserangfolge erhaltenBewertung von RichtungsprognosenPesaran–Timmermann-Test: Liefert eine Richtungsprognose zusätzliche Information?Erfahre, wie der Pesaran–Timmermann-Test Treffer bei Richtungsprognosen mit einer Basisrate aus tatsächlichen und prognostizierten Aufwärtsanteilen vergleicht und warum serielle Abhängigkeit die Inferenz verändert.