Prognosen kombinieren: gleiche oder geschätzte Gewichte
Erfahre, wie Prognosekombinationen Modellvorhersagen verbinden, warum gleiche Gewichte geschätzte Gewichte übertreffen können und wie du Ergebnisse ohne Look-ahead-Bias prüfst
In diesem LeitfadenWas eine Prognosekombination bedeutet
Kurze Zusammenfassung
Eine Prognosekombination verbindet Vorhersagen für dasselbe Ziel und denselben Horizont. Gleiche Gewichte sind eine transparente Basis. Aus früheren Prognosefehlern geschätzte Gewichte können Modellunterschiede berücksichtigen, doch Schätzrauschen kann sie außerhalb der Stichprobe instabil machen
Was eine Prognosekombination bedeutet
Eine Prognosekombination fasst zwei oder mehr Vorhersagen derselben Größe zu einer Prognose zusammen. Sagen die Modelle A, B und C etwa die realisierte Varianz von morgen voraus, lassen sich ihre Ergebnisse mitteln oder unterschiedlich gewichten. Der kombinierte Wert ist eine neue Prognose und keine Abstimmung darüber, welches Modell recht hat.
Die Eingaben müssen sich auf dasselbe Ziel, denselben Prognosezeitpunkt, Horizont, dieselben Einheiten und denselben Informationsstichtag beziehen. Eine Ein-Tages-Varianzprognose lässt sich nicht direkt mit einer Monatsprognose der Volatilität mitteln, nur weil beide als Volatilität bezeichnet werden. Lege erst eine gemeinsame Größe und Periode fest und richte dann die Vorhersagen aufeinander aus.
Kombinationen sind hilfreich, wenn mehrere plausible Modelle unterschiedliche Eigenschaften einer Reihe erfassen oder unklar ist, welches Modell dauerhaft am besten bleibt. Die Modelle müssen keine völlig verschiedenen Algorithmen nutzen. Entscheidend ist, wie sich ihre Fehler gemeinsam verhalten, nicht wie unterschiedlich ihre Namen klingen.
Bates und Granger fanden in ihrer ursprünglichen Anwendung am Beispiel von Flugpassagieren, dass eine zusammengesetzte Prognose einen niedrigeren mittleren quadratischen Fehler als beide Einzelprognosen haben konnte. Das begründet, Kombinationen zu testen; es garantiert keine Verbesserung für einen anderen Markt, ein anderes Ziel, einen anderen Zeitraum oder eine andere Verlustfunktion (Bates and Granger, 1969).
Beginne mit einer Gleichgewichtung als Basis
Für K Prognosen lautet die Kombination mit gleichen Gewichten:
\[ \widehat{y}_{t+h\mid t}^{\,EW} = \frac{1}{K}\sum_{k=1}^{K}\widehat{y}_{k,t+h\mid t} \]
Jede Komponente trägt gleich viel bei. Für diese Regel ist keine Trainingsstichprobe zur Gewichtsschätzung nötig, und sie lässt sich leicht reproduzieren. Sie ist eine nützliche Basis, auch wenn die endgültige Methode Gewichte schätzt oder beschränkt.
Gleiche Gewichte bedeuten nicht, dass alle Prognosen gleich genau, unabhängig oder wirtschaftlich gleich wichtig sind. Sie bedeuten nur, dass das Kombinationsverfahren keine getrennten Gewichte anhand früherer Ergebnisse schätzt. Wenn alle Eingaben dieselbe Eigenschaft verfehlen, kann auch die Gleichgewichtung einen gemeinsamen Bias übernehmen.
Die Zahl der Modellnamen misst nicht die Vielfalt der Informationen. Drei Volatilitätsmodelle können dieselbe Renditereihe, Sitzungsgrenze und Abtastrate verwenden und alle dieselbe Übernachtbewegung verpassen. Durch Mitteln wird dieses Versäumnis nicht automatisch behoben. Prüfe, ob sich archivierte Out-of-Sample-Fehler sinnvoll unterscheiden, statt aus verschiedenen Bezeichnungen unabhängige Hinweise abzuleiten.
Angenommen, drei Modelle prognostizieren die Volatilität der nächsten Sitzung mit 12, 15 und 20 Basispunkten. Der gleich gewichtete Wert ist \((12+15+20)/3=15{,}67\) Basispunkte. Das zeigt nur die Berechnung; ein einzelner Prognosezeitpunkt belegt weder Genauigkeit noch Rentabilität.
Bei Volatilitätsprognosen ist zu prüfen, ob die Eingabe Varianz oder Standardabweichung ist. Der Durchschnitt dreier Varianzprognosen mit anschließender Quadratwurzel ist im Allgemeinen nicht dasselbe wie der Durchschnitt der Standardabweichungsprognosen. Verwende beim späteren Scoring dieselbe Zieldefinition und dieselben Einheiten.
Schätze Gewichte aus früheren Prognosefehlern
Eine geschätzte lineare Kombination lässt sich schreiben als
\[ \widehat{y}_{t+h\mid t}^{\,C} = \sum_{k=1}^{K} w_k \widehat{y}_{k,t+h\mid t} \]
Ein verbreitetes theoretisches Ergebnis setzt voraus, dass jeder Prognosefehler im Mittel null ist, alle dasselbe Ziel betreffen und die Gewichte sich zu eins summieren. Sei \(\Sigma_e\) die Kovarianzmatrix der Prognosefehler der Komponenten. Wäre sie bekannt und invertierbar, wären die Varianz-minimierenden Gewichte unter diesen Bedingungen:
\[ w^{*} = \frac{\Sigma_e^{-1}\mathbf{1}}{\mathbf{1}'\Sigma_e^{-1}\mathbf{1}} \]
Die Formel ist ein Bezugspunkt und keine Aufforderung, eine verrauschte Stichproben-Kovarianzmatrix einfach zu invertieren. In der Praxis wird \(\Sigma_e\) aus einem begrenzten Archiv früherer Prognosefehler geschätzt. Stark korrelierte Eingaben können die Matrix fast singulär machen, sodass kleine Datenänderungen große Gewichtsänderungen auslösen.
Haben zwei Prognosefehler dieselbe Varianz \(\sigma^2\), beträgt die Varianz ihres gleich gewichteten Durchschnitts \(\sigma^2(1+\rho)/2\), wobei \(\rho\) ihre Fehlerkorrelation ist. Beträgt jede Fehlervarianz 4 und die Korrelation null, ist die Varianz des Durchschnitts 2. Bei einer Korrelation von 0,90 beträgt sie 3,8. Wie viel Varianz durch Mitteln entfällt, hängt von der Fehlerabhängigkeit ab, nicht von den Modellnamen. Die Rechnung betrifft die Fehlervarianz; bei verzerrten Komponenten kommt das Quadrat des Bias zum mittleren quadratischen Fehler hinzu.
Ein anderer Ansatz regressiert das realisierte Ziel auf archivierte Komponentenprognosen, oft mit Achsenabschnitt. Granger und Ramanathan beschreiben lineare Regressionsmethoden, bei denen sich die Gewichte nicht zwingend zu eins addieren. Achsenabschnitt und unbeschränkte Gewichte können den mittleren Bias einer Trainingsstichprobe korrigieren, ändern aber die Interpretation: Die Koeffizienten sind angepasste Prognosekorrekturen und nicht unbedingt Anteile wie in einem Portfolio (Granger and Ramanathan, 1984).
Lege Einschränkungen vor der Bewertung fest. Nichtnegative Gewichte mit Summe eins ergeben ein konvexes Mittel zwischen der kleinsten und größten Komponentenprognose. Negative Gewichte oder ein Achsenabschnitt können Werte außerhalb dieser Spanne ergeben. Für kalibrierte Prognosen kann das angemessen sein, aber nicht für ein Ziel, das wie Varianz nicht negativ sein darf.
Rechne eine Kombination durch
Drei Modelle geben für dasselbe Ziel der nächsten Sitzung Prognosen von 12, 15 und 20 Basispunkten ab. Eine anhand früherer Prognosezeitpunkte geschätzte Regel vergibt die Gewichte 0,50, 0,30 und 0,20. Dann lautet die kombinierte Prognose:
\[ 0{,}50(12) + 0{,}30(15) + 0{,}20(20) = 14{,}5\ \text{Basispunkte} \]
Die Gewichte sind nicht negativ und summieren sich zu eins, also handelt es sich um eine konvexe Kombination zwischen den Komponentenprognosen. Die Abweichung von der gleich gewichteten Prognose von 15,67 Basispunkten folgt aus den Gewichten; sie zeigt nicht, dass die gewichtete Prognose besser ist.
Die Gewichte dürfen nur mit Prognosefehlern geschätzt worden sein, deren Ergebnisse zum Schätzzeitpunkt bereits bekannt waren. In einem historischen Backtest darf die Prognose von 14,5 Basispunkten am Ursprung t Informationen bis t verwenden, nicht aber das realisierte Ziel bei t+1 oder später.
Sobald das Ziel beobachtbar ist, speichere die Komponentenprognosen, die kombinierte Prognose, den tatsächlichen Proxy und den Bewertungsverlust. Wiederholst du dies über spätere Ursprünge, kannst du Regeln an gemeinsamen Daten vergleichen. Auch dann wird ein einzelnes Rechenbeispiel nicht zum Beleg eines dauerhaften Vorteils.
Warum angepasste Gewichte enttäuschen können
Die optimalen Gewichte bei bekannter Kovarianz der Populationsfehler sind nicht dieselben wie aus einer kurzen Stichprobe geschätzte Gewichte. Letztere bringen eine zusätzliche Unsicherheit mit. Ähnliche Komponentenprognosen können stark korrelierte Fehler haben; die Optimierung nutzt dann womöglich kleine historische Unterschiede aus, die nicht bestehen bleiben.
Kangs Simulationen und die Anwendung auf makroökonomische Prognosen zeigen, dass Kombinationsgewichte instabil sein können und ein einfacher Durchschnitt in diesen Fällen praktisch besser abschneiden kann (Kang, 1986). Timmermanns Überblick beschreibt, wie Schätzfehler, Modellinstabilität und Fehlerabhängigkeit Prognosekombinationen beeinflussen (Timmermann, 200601004-9)).
Eine spätere Analyse des Forecast-Combination-Puzzles betont denselben Punkt für endliche Stichproben: Ergebnisse für feste „optimale“ Gewichte müssen nicht unverändert gelten, wenn diese Gewichte selbst geschätzt werden (Claeskens et al., 2016). Das beweist nicht, dass gleiche Gewichte immer gewinnen. Es erklärt, weshalb eine komplexere Gewichtungsregel ihren Nutzen im Out-of-Sample-Vergleich zeigen muss.
<!-- learn:illustration -->
Mögliche Reaktionen sind, mit gleichen Gewichten zu starten, die Zahl der Eingaben zu begrenzen, geschätzte Gewichte in Richtung gleicher Anteile zu schrumpfen oder eine einfache Beschränkung aufzuerlegen. Jede Wahl tauscht Flexibilität gegen Schätzrauschen. Triff sie anhand der Trainingsdaten und dokumentiere die Regel; wähle die attraktivste Variante nicht erst nach Sichtung der endgültigen Testperiode.

Erstelle ein Archiv für Prognosen in Echtzeit
Jede archivierte Komponentenprognose muss zum angegebenen Ursprung tatsächlich erzeugbar gewesen sein. Erstelle jedes Modell ausschließlich mit den damals verfügbaren Daten nach, und speichere Prognosezeitpunkt, Modellversion und Zieldefinition. In-Sample-Anpassungswerte ersetzen keine echten historischen Prognosen, weil das Modell Beobachtungen verwendet haben könnte, die damals noch nicht bekannt waren.
Richte das Archiv nach Ziel und Ursprung aus. In jeder Zeile müssen die Komponenten dasselbe künftige Intervall vorhersagen und ihre Trainingsinformationen zum selben Entscheidungszeitpunkt enden. Fehlende Prognosen sind vor der Schätzung zu entfernen oder ausdrücklich zu behandeln. Ein stiller Wechsel der Eingaben kann die Bedeutung der Gewichte von Datum zu Datum ändern.
Trenne Gewichtsschätzung und abschließende Bewertung. Ein Rolling-Origin-Verfahren kann Gewichte anhand von Prognosen schätzen, deren Ergebnisse vor t beobachtet wurden, die Kombination bei t ausgeben und nach Beobachtung des Ziels bewerten. Ein wachsendes Fenster nutzt alle geeigneten vergangenen Ursprünge; ein rollendes Fenster vergisst ältere Ursprünge nach einer vorher festgelegten Länge. Bei Leistungsänderungen passen sich beide unterschiedlich an.
Wenn Modelle, Transformationen, Horizonte, Gewichtsbeschränkungen oder Verlustfunktionen erst nach Sichtung eines Holdout-Zeitraums gewählt wurden, gehört dieser Zeitraum bereits zur Modellentwicklung. Halte einen neuen Testzeitraum zurück oder nutze eine verschachtelte Auswertung, die jeden Auswahlschritt innerhalb der Trainingsdaten hält.
Vergleiche Kombinationen mit einem gemeinsamen Verlustmaß
Vergleiche die Gleichgewichtung, jede geschätzte oder geschrumpfte Regel und die Einzelprognosen an denselben Ursprüngen und gegen dasselbe realisierte Ziel. Berichte Verlustmaß und gemeinsame Stichprobe. Sonst kann eine Methode nur deshalb stärker erscheinen, weil sie an einfacheren Daten oder mit einer anderen Zieldefinition bewertet wurde.
Das Verlustmaß muss zum Ziel und zur Fragestellung passen. Der quadratische Fehler bestraft große Abweichungen quadratisch; der absolute Fehler gewichtet große Fehler anders. Bei Volatilitätsprognosen gegen verrauschte realisierte Messgrößen sind die Bedingungen des Proxys und das Verlustmaß entscheidend. Der Leitfaden zu QLIKE und quadratischem Fehler erläutert diese Unterschiede. Wähle das Verlustmaß nicht erst, nachdem du gesehen hast, welche Methode es bevorzugt.
Ein Prognosevergleichstest kann quantifizieren, ob beobachtete Verlustunterschiede mit Stichprobenvariation vereinbar sind. Der Diebold–Mariano-Leitfaden behandelt gepaarte Vergleiche von Prognoseverlusten und relevante Annahmen bei überlappenden oder abhängigen Fehlern. Ein Testergebnis behebt weder Look-ahead-Bias noch beweist es wirtschaftlichen Wert.
Wenn du viele Komponentensätze, Gewichtsbeschränkungen oder Verlustregeln ausprobiert und die am besten wirkende Variante für denselben Bewertungszeitraum behalten hast, spiegelt der Vergleich auch diese Suche wider. Der White-Reality-Check-Leitfaden und der Leitfaden zur Wahrscheinlichkeit der Backtest-Überanpassung behandeln die Auswahl unter vielen Handelsregeln. Keiner ersetzt ein sauberes Prognosearchiv oder eine vorab geplante Bewertung.
Wähle ein Validierungsdesign passend zum vorgesehenen Horizont. Sagen tägliche Ursprünge überlappende mehrtägige Ergebnisse voraus, können aufeinanderfolgende Verluste abhängig sein. Berücksichtige diese Abhängigkeit bei der Unsicherheitsschätzung. Viele überlappende Zeilen sind nicht ebenso viele unabhängige Experimente.
Stimme die Kombination auf die Entscheidung ab
Prüfe vor dem Kombinieren, was jedes Modell vorhersagt. Bedingter Mittelwert, Varianz, Quantil und vollständige Wahrscheinlichkeitsverteilung sind unterschiedliche Prognoseobjekte. Ein lineares Mittel von Punktprognosen erzeugt nicht automatisch eine kalibrierte Dichteprognose oder eine zuverlässige Schätzung des Extremrisikos.
Bei strikt nichtnegativen Größen wie Varianz solltest du kombinierte Werte vor der Verwendung prüfen. Ein konvexes Mittel nichtnegativer Prognosen bleibt nichtnegativ; eine Regression mit negativen Gewichten oder Achsenabschnitt muss es nicht. Negative Werte bei null abzuschneiden ändert die Prognoseregel und ist vor der Bewertung festzulegen.
Auch die Anzahl der Prognosen zählt. Schwache oder nahezu identische Eingaben erhöhen möglicherweise die Zahl der geschätzten Gewichte, ohne viele neue Informationen hinzuzufügen. Ist das historische Archiv im Verhältnis zu K kurz, ist eine transparente Regel mit niedriger Dimension vorzuziehen. Zeige außerdem, dass das Ergebnis nicht an einer einzelnen Komponente hängt.
Modellprognosen zu kombinieren ist etwas anderes, als Handelspositionen zu kombinieren. Ein niedrigerer statistischer Verlust beweist nicht, dass eine Strategie nach Gebühren, Spread, Slippage, Markteinfluss und Risikogrenzen mehr verdient. Für die Prognosekonstruktion und die darauf aufbauende Handelsregel ist jeweils ein eigener Out-of-Sample-Beleg erforderlich.
Dokumentiere genug, um das Ergebnis nachzuvollziehen
Ein nützlicher Bericht nennt Prognoseziel, Horizont, Einheiten, Komponentenmodelle, Ursprungszeitpunkte, Archivzeitraum und Regel für fehlende Daten. Er gibt an, ob Gewichte gleich, geschätzt, beschränkt, geschrumpft oder zeitvariabel sind und wie jede Abstimmung erfolgte.
Zeige Gleichgewichtungs-Benchmark, ausgewählte Kombination und stärkste Einzelprognose an denselben Bewertungsdaten. Nenne Verlustfunktion, Unsicherheitsmethode und Umgang mit überlappenden Ergebnissen. Ändern sich Gewichte stark zwischen Fenstern, zeige diese Instabilität und nicht nur die letzten Werte.
Trenne schließlich die empirische Aussage von der Entscheidungsaussage. „Diese Kombination hatte in dieser Stichprobe unter diesem Verlustmaß einen niedrigeren Durchschnittsverlust“ ist enger und leichter reproduzierbar als „Prognosekombinationen verbessern den Handel“. Die erste Aussage lässt sich anhand eines gespeicherten Archivs prüfen; die zweite erfordert eine Strategie, Ausführungsannahmen und eigene Belege.
Häufige Fragen
Q1Ist eine Gleichgewichtung immer besser als ein einzelnes Modell?
Nein. Sie ist eine nützliche Basis ohne Gewichtsschätzung, doch die Genauigkeit hängt von den Komponentenprognosen und dem Ziel ab. Vergleiche sie an denselben Out-of-Sample-Daten mit jeder Einzelprognose.
Q2Müssen sich Prognosegewichte immer zu eins summieren?
Nein. Eine solche Beschränkung ergibt oft einen interpretierbaren konvexen Durchschnitt. Eine Regression mit Achsenabschnitt schätzt eine andere Art der Prognosekorrektur; lege die Spezifikation und ihre Folgen offen.
Q3Kann ich Kombinationsgewichte aus In-Sample-Anpassungswerten schätzen?
Das kann ein unrealistisches Archiv ergeben, weil die Ausgangsmodelle Informationen genutzt haben könnten, die am jeweiligen historischen Ursprung noch nicht verfügbar waren. Verwende lieber echte Rolling-Origin-Prognosen, die nur damalige Daten nutzen.
Q4Beweist eine genauere kombinierte Prognose einen Handelsvorteil?
Nein. Prognosegenauigkeit ist ein statistisches Ergebnis für ein bestimmtes Ziel, einen Proxy, eine Stichprobe und ein Verlustmaß. Eine Handelsaussage erfordert eine definierte Strategie, Ausführungskosten, Risikobeschränkungen und eine getrennte Out-of-Sample-Bewertung. Primärforschung - Bates and Granger (1969), “The Combination of Forecasts,” *Journal of the Operational Research Society*, 20(4), 451–468. - Granger and Ramanathan (1984), “Improved Methods of Combining Forecasts,” *Journal of Forecasting*, 3(2), 197–204. - Kang (1986), “Unstable Weights in the Combination of Forecasts,” *Management Science*, 32(6), 683–695. - Timmermann (2006), “Forecast Combinations,” *Handbook of Economic Forecasting*, 1, 135–196.01004-9) - Claeskens, Magnus, Vasnev, and Wang (2016), “The Forecast Combination Puzzle: A Simple Theoretical Explanation,” *International Journal of Forecasting*, 32(3), 754–762.
Quellen und weiterführende Lektüre
Problem melden
Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden
Schnelltest
Fertig gelesen? Prüfe dich mit 3 Fragen
Frage 01
Was muss vor der Kombination zweier Modellprognosen übereinstimmen?
Wähle eine Antwort, um die Erklärung zu sehen