Skip to content
Alle Leitfäden zu Optionen und Futures
Legen Sie fest, aus welcher Historie ein Finanzmodell lernt12 Min. Lesezeit

Expanding- und Rolling-Fenster für die Walk-Forward-Validierung

Vergleichen Sie wachsende und feste rollierende Trainingsfenster für Finanzmodelle, trennen Sie Validierung und Abschlusstest und wählen Sie Fensterregeln ohne spätere Ergebnisse.

In diesem LeitfadenEin Walk-Forward-Fold hat getrennte Trainings- und Auswertungsfenster

Kurze Zusammenfassung

Ein wachsendes Trainingsfenster behält die früheste zulässige Historie und ergänzt neu verfügbare Daten. Ein rollierendes Fenster umfasst eine feste Zahl der jüngsten zulässigen Beobachtungen und entfernt ältere Zeilen. Beide eignen sich für eine chronologische Walk-Forward-Auswertung; keines ersetzt die Trennung von Modellauswahl und abschließendem Test.

Ein Walk-Forward-Fold hat getrennte Trainings- und Auswertungsfenster

Zum Prognosezeitpunkt kennt die Forschung einige historische Merkmale und Zielwerte, trainiert oder aktualisiert ein Modell und bewertet es auf einem späteren Block. Verschiebt sich der Ursprung, entstehen aufeinanderfolgende Out-of-Sample-Zeiträume. Die Trainingsfensterregel legt fest, welche zulässigen früheren Zeilen bei jedem Fit eingehen. Validierungs- und Testregeln legen fest, welche späteren Ergebnisse Optionen vergleichen und die Leistung messen. Die Entscheidungen hängen zusammen, sind aber nicht dasselbe Fenster.

Ein Expanding-Fenster beginnt an einer festen historischen Grenze und wächst, sobald neue Ergebnisse vorliegen. Beim Rolling-Fenster wandern beide Grenzen weiter, während die Zahl der Trainingsbeobachtungen nach der Anlaufphase gleich bleibt. Kein Fit darf ein Ziel verwenden, das am Prognoseursprung noch nicht vollständig bekannt war. Bei Labels über mehrere Sitzungen reicht das Zeilendatum womöglich nicht: Speichern Sie den Endzeitpunkt des Labels und beachten Sie ihn.

Trennen Sie auch den Rückblick der Merkmale vom Trainingsfenster. Ein Signal kann die Volatilität jeder Zeile aus einem kurzen zurückliegenden Zeitraum berechnen, während das Modell Zeilen aus mehreren Jahren nutzt. Eine Änderung des Feature-Rückblicks verändert die Eingaben; eine Änderung des Trainingsfensters verändert die Beobachtungen für die Schätzung.

Ein Expanding-Fenster behält die anfängliche Historie

Sei \(s\) der Index der ersten zulässigen Beobachtung und \(t\) die jüngste Beobachtung mit vollständig bekanntem Label beim Fit. Das Trainingsset lautet \(\{s,s+1,\ldots,t\}\). Beim nächsten Ursprung bleibt es erhalten und wird um neu zulässige Zeilen ergänzt. Ohne separate Filter wächst die Stichprobe daher mit der Zeit.

Mehr Beobachtungen können die Stichprobenunsicherheit von Parameterschätzungen senken, wenn ältere Daten den betrachteten Prozess weiterhin beschreiben. Sie können seltene Marktphasen bewahren und vermeiden einen willkürlich gewählten historischen Schnittpunkt. Der Nachteil: Alte Zeilen verlieren nicht allein durch ihr Alter Einfluss. Ändert sich der Zusammenhang zwischen Merkmalen und Renditen, können frühe Daten die Schätzung zu überholten Bedingungen ziehen; große Fits können langsamer werden. Mehr Historie bedeutet nicht automatisch mehr Repräsentativität.

Ein Rolling-Fenster entfernt Beobachtungen außerhalb des gewählten Bereichs

Bei fester Länge \(W\) lautet das Trainingsset am Ursprung \(t\) nach Berücksichtigung von Labelverzögerung und Grenzabstand \(\{t-W+1,\ldots,t\}\). Am nächsten Ursprung rückt das Ende vor und die älteste zulässige Zeile fällt heraus. Die Länge kann in Beobachtungen oder Kalenderzeit angegeben werden; bei unregelmäßigen Daten sind diese Einheiten nicht austauschbar.

Das Rolling-Fenster legt eine Aktualitätsregel fest. Es kann sinnvoll sein, wenn die Frage eine Anpassung an wechselnde Bedingungen betrifft oder eine feste Trainingsgröße betrieblich wichtig ist. Es passt sich aber nicht automatisch an. Bei seltenen Fits oder schleichenden Änderungen kann die Reaktion verzögert sein. Eine kurze Spanne senkt die Informationsmenge, kann Schätzungen instabil machen, seltene Stressphasen auslassen oder für komplexe Modelle zu wenig Beispiele liefern. Eine längere Spanne bewahrt mehr Historie, kann neue Muster jedoch verwässern.

Auch die Maßeinheit zählt: Dieselbe Zeilenzahl kann wegen fehlender Handelstage oder anderer Frequenz unterschiedliche Kalenderzeiten abdecken. Bei Paneldaten muss klar sein, ob Zeilen oder Datumsgruppen von Assets entfernt werden. Wird \(W\) nach Einsicht in den Abschlusstest gewählt, ist dieser Teil der Auswahl und kein unabhängiger Test mehr.

Die beiden Regeln liefern jedem Fit eine andere Historie

WahlTrainingszeilen beim FitMöglicher VorteilZu prüfender Nachteil
ExpandingAlle zulässigen Zeilen ab festem StartMehr Beobachtungen und ältere Episoden bleiben enthaltenAlte Regime beeinflussen weiter; Fits können langsamer werden
RollingDie jüngste feste Spanne zulässiger ZeilenKlare Aktualitätsgrenze und begrenzte StichprobeWeniger Information; Ergebnis hängt stärker von der Länge ab

Damit der Vergleich allein die Fensterregel prüft, halten Sie Informationsstichtag, Merkmale, Modellklasse, Trainingsziel, Fit-Termine, Prognosehorizont, Testblöcke und Ausführungsannahmen konstant. Werden beim Rolling-Modell weitere Entscheidungen geändert, lässt sich ein Scoreunterschied nicht dem Fenster allein zuschreiben.

Die Verfahren bestimmen nicht den Prognoseursprung. Beide Trainingsfenster können mit rollierenden Ursprüngen bewertet werden: zulässige Vergangenheit trainieren, nächsten Block vorhersagen, weitergehen und wiederholen. Leonard Tashmans Überblick zu Out-of-Sample-Prognosetests00065-0) behandelt rollierende Ursprünge und rollierende Schätzfenster. Das eine legt fest, wann bewertet wird, das andere, welche Trainingszeilen bleiben.

Ein hypothetischer Zeitplan zeigt die Daten für jeden Fit

Alle Zahlen und Zeitpunkte sind hypothetisch. Angenommen, ein Modell wird monatlich mit der Rendite des Folgemonats als Ziel neu trainiert. Der erste Fit nutzt 60 zulässige Beobachtungen bis Monat 120. Ein Label darf erst nach Abschluss seines Ergebnisses verwendet werden. Bei der ersten Prognose nutzen beide Regeln dieselben 60 Zeilen, wenn die Rolling-Spanne 60 beträgt.

Sobald ein weiteres Monatsergebnis bekannt ist, enthält Expanding 61 zulässige Zeilen. Rolling nimmt die neue auf und entfernt die älteste, sodass es bei 60 bleibt. Nach 12 solchen Aktualisierungen enthält Expanding 72 Zeilen ab dem ursprünglichen Start; Rolling behält die jüngsten 60. Die Modelle können nun andere Parameter schätzen, obwohl jede verwendete Zeile zum jeweiligen Fit-Zeitpunkt verfügbar war.

Reservieren Sie im Beispiel die letzten 24 Monate als äußeren Test. Fensterregel, Spanne, Merkmale und sonstige Einstellungen müssen auf früheren chronologischen Validierungszeiträumen gewählt werden. Im Test wird die Auswahl gemäß dem vorab festgelegten Fitplan eingefroren bewertet. Wer die Spanne nach Einsicht in Testergebnisse ändert, nutzt den Test zur Auswahl und überschätzt seine Aussagekraft.

Wählen Sie die Fensterregel in chronologischer Validierung

Formulieren Sie zuerst die Frage: Soll das Modell bei jedem Fit die gesamte verfügbare Historie nutzen, oder gibt es einen Grund, alte Beispiele auszuschließen? Ist der Zielzusammenhang stabil zu erwarten oder können sich relevante Eingaben ändern? Das grenzt Kandidaten ein, beweist aber nicht, welche Regel in einem Markt besser abschneidet.

Vergleichen Sie auf früheren Entwicklungsdaten wenige vorab festgelegte Varianten, etwa Expanding und einige plausible Rolling-Längen, auf denselben chronologischen Validierungsblöcken und mit gleicher Fitfrequenz. Legen Sie das Ziel vor der Auswertung fest: Prognoseverlust, Kalibrierung, umsatz- und turnoverbereinigter Portfolionutzen sowie Drawdown beantworten verschiedene Fragen. Halten Sie Kosten und Beschränkungen gleich und erfassen Sie fehlgeschlagene Fits sowie fehlende Prognosen. Überlappende Ziele können benachbarte Scores abhängig machen; zählen Sie sie nicht als unabhängige Experimente.

Halten Sie einen späteren Zeitraum als Abschlusstest zurück. In einem verschachtelten Aufbau wählt die innere Validierung Fenster und Einstellungen nur mit Daten vor jedem äußeren Testblock; die äußeren Ergebnisse bewerten den gesamten Auswahlprozess. Der Leitfaden zu Purged Cross-Validation behandelt überlappende Labelgrenzen. Overfitting bei Finanzmodellen und Multiple Testing erklären weitere Auswahlrisiken.

Richten Sie Labels, Vorverarbeitung und Fit-Zeitpunkt an den damaligen Informationen aus

Nutzen Sie am jeweiligen Ursprung nur damals bekannte Merkmale und Labels. Bei Renditen über mehrere Sitzungen kann ein Ergebnis an der Validierungsgrenze noch offen sein, obwohl der Entscheidungszeitpunkt früher lag. Setzen Sie bei Bedarf eine Lücke oder entfernen Sie Zeilen anhand der tatsächlichen Labelintervalle. Eine feste Zeilenzahl genügt nur, wenn Frequenz und Zielhorizont das rechtfertigen. Kein Fenster behebt Merkmale mit Zukunftsinformation.

Lernen Sie Imputation, Skalierung, Merkmalsauswahl und andere Vorverarbeitung nur auf dem Trainingsabschnitt des jeweiligen Folds. Werden Schwelle oder Hyperparameter gewählt, nutzen Sie eine innere chronologische Validierung und frieren Sie die Entscheidung für den späteren Block ein. Die offizielle scikit-learn-Dokumentation zu TimeSeriesSplit beschreibt ein standardmäßig wachsendes Trainingsset und max_train_size als Größenbegrenzung. gap zählt Samples; gleiche Fold-Dauern setzen gleichmäßig verteilte Beobachtungen voraus. Prüfen Sie Zeitstempel, Finanzlabels und die tatsächlich verwendete Bibliotheksversion zusätzlich.

Berichten Sie Leistung je Ursprung und beschreiben Sie die Grenzen

Nennen Sie Fensterregel und genaue Länge, ältestes behaltenes Datum, zulässige Zeilen je Fit, Labelverfügbarkeit, Validierungs- und Testdaten, Horizont und Fitplan. Zeigen Sie Ergebnisse je Testblock und aggregiert. Ein Mittelwert kann eine einzelne Marktphase verbergen; benachbarte Prognosen können dieselben Zielrenditen teilen und sind dann keine unabhängigen Belege.

Prognosegenauigkeit ist keine Nettorendite. Positionierung, Hebel, Umsatz, Liquidität, Gebühren, Spread, Markteinfluss, Leihe, Funding und Ausführungszeitpunkt verändern das Ergebnis. Halten Sie diese Annahmen beim Vergleich konstant und nennen Sie Auslassungen. Die Studie von Cerqueira, Torgo und Mozetič zur Leistungsschätzung bei Zeitreihen zeigt Unterschiede zwischen stationären und nichtstationären Situationen. Sie vergleicht nicht direkt Finanzfensterregeln und belegt keinen universellen Sieger.

Verstehen Sie jeden Backtest als Evidenz für eine bestimmte Historie und ein bestimmtes Verfahren. Expanding kann veraltete Regime behalten; Rolling kann nützliche Information verwerfen und verrauschen. Eine Regel kann in anderen Marktphasen, Universen oder Kostenumgebungen scheitern. Validierung verringert Unsicherheit über das getestete Verfahren, garantiert aber keine künftige Rendite und beweist kein optimales Fenster.

Häufige Fragen

Q1Ist ein Expanding-Fenster immer besser, weil es mehr Daten nutzt?

Nein. Mehr Zeilen können Schätzungen stabilisieren, wenn ältere Beobachtungen relevant bleiben; überholte Regime können das Modell aber weiter beeinflussen. Das hängt von Daten, Ziel, Merkmalen, Schätzer und Zeitraum ab.

Q2Passt sich ein Rolling-Fenster automatisch an einen Regimewechsel an?

Nein. Es entfernt Zeilen außerhalb der gewählten Spanne, erkennt aber keinen Wechsel und garantiert nicht, dass die neue Stichprobe das nächste Regime repräsentiert. Fitfrequenz, Länge und Modell bleiben wichtig.

Q3Darf ich dieselbe Periode zur Fensterabstimmung und zur Leistungsangabe nutzen?

Dann gehört sie zur Modellauswahl. Wählen Sie die Regel chronologisch und bewerten Sie das eingefrorene Verfahren in einem späteren, unberührten Test. Auch dieser beschreibt nur die getestete Historie und Annahmen.

Quellen und weiterführende Lektüre

Problem melden

Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden

Schnelltest

Fertig gelesen? Prüfe dich mit 3 Fragen

Frage 1 / 3

Frage 01

Was ändert sich beim nächsten Fit in einem festen Rolling-Trainingsfenster?

Wähle eine Antwort, um die Erklärung zu sehen

Optionsglossar