Skip to content
Alle Leitfäden zu Optionen und Futures
Warum der Testsieger einer Strategiesuche gemeinsam geprüft werden muss13 Min. Lesezeit

White’s Reality Check gegen Data Snooping in Strategie-Backtests

Erfahre, wie White’s Reality Check nach einer Kandidatensuche die stärkste Strategie mit einer Benchmark vergleicht und dabei das Maximum eines abhängigkeitssensitiven Bootstrap berücksichtigt

In diesem LeitfadenDer Test fragt, ob der Sieger der Suche eine gewählte Benchmark übertrifft

Kurze Zusammenfassung

White’s Reality Check fragt, ob der beste Kandidat einer festgelegten Suche eine bestimmte Benchmark übertrifft, nachdem berücksichtigt wurde, dass er als Maximum ausgewählt wurde. Das Verfahren bootstrappt die gemeinsamen, zeitabhängigen Performance-Differenzen und vergleicht das beobachtete Maximum mit einer Nullverteilung von Bootstrap-Maxima. Ein kleiner adjustierter p-Wert spricht gegen die gemeinsame Nullhypothese, dass es in dieser Kandidatenfamilie und gegenüber dieser Benchmark keine Überlegenheit gibt; er prognostiziert keine Live-Profitabilität.

Der Test fragt, ob der Sieger der Suche eine gewählte Benchmark übertrifft

Ein Researcher kann Dutzende Perioden für gleitende Durchschnitte, Ausbruchsregeln, Haltedauern, Märkte und Filter ausprobieren und anschließend die Strategie mit dem höchsten Backtest-Score melden. Dieser Sieger ist kein gewöhnlicher Einzelkandidat: Die Suche gab ihm viele Chancen, außergewöhnlich gut auszusehen. Ihn allein so zu testen, als wäre er vor der Datensichtung festgelegt worden, ignoriert diesen Auswahlprozess.

White’s Reality Check macht die Auswahl selbst zum Teil des Tests. Er prüft, ob irgendein Kandidat aus der untersuchten Familie eine höhere erwartete Performance als eine definierte Benchmark erzielt. White formuliert die Null als Schnittmenge einseitiger Vergleiche: Die erwartete Benchmark-relative Performance jedes Kandidaten ist höchstens null. Die Alternative lautet, dass mindestens ein Kandidat einen positiven erwarteten Vorteil hat. Als Benchmark kommen etwa Buy-and-Hold, eine einfache Prognoseregel oder ein anderes Vergleichsverfahren infrage. Ihre Definition muss zur Forschungsfrage passen und vor Betrachtung des Testergebnisses feststehen. Die formale Herleitung findet sich in Whites Originalarbeit.

Das ist eine Frage auf Ebene der gesamten Familie und keine Garantie für die Strategie, die zufällig gewinnt. Eine Verwerfung der Null besagt, dass die dokumentierte Familie unter der gewählten Statistik und den Annahmen Hinweise auf Überlegenheit enthält. Sie zeigt weder, dass alle Kandidaten nützlich sind, noch dass der Sieger dauerhaft der beste bleibt oder sein Vorteil eine neue Marktphase übersteht.

Für jeden Kandidaten eine vergleichbare Performance-Differenz bilden

Sei d[k,t] die Performance von Kandidat k abzüglich der Performance der Benchmark im selben Zeitraum t; ein höherer Wert muss immer eine bessere Performance bedeuten. Für einen Renditevergleich kann das die Nettorendite des Kandidaten minus die Nettorendite der Benchmark sein. Geht es stattdessen um Prognoseverluste, lässt sich die Differenz als Benchmark-Verlust minus Kandidatenverlust definieren. Die Vorzeichenkonvention muss einen positiven Wert stets als Vorteil des Kandidaten ausweisen.

Jede Zeile sollte für alle Kandidaten dasselbe Zeitintervall abbilden. Verwende dieselbe Währung, Renditekonvention, Finanzierungsmethode und Kostenregel. Geht es um tatsächlich umsetzbare Strategierenditen, ziehe die einschlägigen Provisionen, Spreads, Slippage, Funding- und Leihkosten ab, bevor d[k,t] gebildet wird. Bruttorenditen zu testen und Kosten nur in einer Fußnote zu erwähnen, beantwortet eine andere Frage.

Der Stichprobenmittelwert für Kandidat k ist d̄[k] = (1/T) Σ_t d[k,t]. Die gemeinsame Null lautet H0: max_k E[d[k,t]] ≤ 0, die Alternative H1: max_k E[d[k,t]] > 0. Die Benchmark gilt für die gesamte Kandidatenfamilie, und alle Kandidaten werden mit demselben Kriterium bewertet. Haben sie unterschiedliche fehlende Daten oder Beobachtungsfrequenzen, lege vor der Differenzberechnung eine vertretbare gemeinsame Stichprobe fest, statt einem Kandidaten stillschweigend ein günstigeres Zeitfenster zu geben.

Die vollständige Kandidatenfamilie gehört zur Forschungsbehauptung

Die Familie umfasst alle Kandidatenregeln, deren Ergebnisse die gemeldete Auswahl beeinflussen konnten. Dazu können getestete Rückblickfenster, Einstiegsschwellen, Signalkombinationen, Anlageuniversen, Haltedauern, Portfoliobeschränkungen und Ausführungsannahmen gehören. Auch manuell ausprobierte Varianten, die nach Sichtung ihrer Ergebnisse verworfen wurden, zählen dazu. Whites Aufsatz aus dem Jahr 2000 verwendet „Specification Search“ im weiten Sinn: Das Auswahlverfahren und nicht nur die endgültige Tabelle erzeugt das Selektionsproblem.

Es gibt zwei entgegengesetzte Fehler. Wer Experimente auslässt, die zur Wahl der gemeldeten Strategie beigetragen haben, macht den adjustierten Test zu optimistisch, weil der Bootstrap eine kleinere Suche sieht als tatsächlich durchgeführt wurde. Wer nachträglich viele beliebige, unabhängige Regeln hinzufügt, kann den Test unnötig konservativ machen und seine Fähigkeit schwächen, einen nützlichen Kandidaten zu erkennen. Definiere die Familie anhand des tatsächlichen Auswahlprozesses und führe ein Research-Protokoll, mit dem sich ihre Abgrenzung prüfen lässt.

Der Test kann nicht auf Experimente schließen, die nie dokumentiert wurden. Ein Notizbuch, das nur die gewinnende Parametereinstellung enthält, reicht nicht aus, um die Suche zu rekonstruieren. Bewahre Kandidatenregister, Datenversion, Auswertungszeiträume, Zielfunktion, Kostenannahmen und Auswahlentscheidungen zusammen auf. Wurde die Familie nach Sichtung der Ergebnisse geändert, lege dar, was sich aus welchem Grund geändert hat. Stelle eine nachträglich zusammengestellte Familie nicht so dar, als wäre sie vorab festgelegt gewesen.

Die Maximum-Statistik trägt die Auswahl in die Nullverteilung

Berechne für jeden Kandidaten die durchschnittliche relative Performance und wähle dann den größten Wert. Eine gängige nicht studentisierte Statistik ist Vobs = √T × max_k d̄[k]. Das Maximum ist entscheidend: Es bildet denselben Schritt „den besten auswählen“ ab, durch den der scheinbare Sieger entstand. Würde nur die Gewinner-Spalte getestet, fehlte dieser Schritt in der Vergleichsverteilung.

Der Bootstrap schätzt, wie groß ein Maximum allein durch Stichprobenvariation ausfallen könnte, wenn die gemeinsame Null der Nichtüberlegenheit gilt. Für Bootstrap-Ziehung b wird der zeitindizierte Vektor der Differenzen aller Kandidaten neu gezogen und eine zentrierte Statistik wie V*b = √T × max_k(d̄*[k,b] − d̄[k]) berechnet. Durch die Zentrierung liegen die Kandidatenmittelwerte an der am wenigsten günstigen Grenze der Nullhypothese, an der die erwarteten Vorteile null sind. Das Maximum erhält zugleich die Auswahl über alle Kandidaten. Whites Arbeit entwickelt die Bootstrap-Verteilung des Maximums und vergleicht die beobachtete Statistik damit.

Wiederhole das Verfahren viele Male. Der adjustierte p-Wert ist der Anteil der Bootstrap-Maxima, die mindestens so groß sind wie Vobs. Bei einer endlichen Zahl B von Ziehungen lautet ein gebräuchlicher Monte-Carlo-Schätzer (1 + count{V*b ≥ Vobs})/(B + 1). Implementierungen können sich bei Studentisierung oder bei Details geschätzter Modelle unterscheiden. Dokumentiere deshalb die Statistik und die Zentrierung unter der Nullhypothese. Entscheidend ist, dass jede Bootstrap-Wiederholung das Maximum der Kandidatenfamilie neu berechnet und nicht nur den beobachteten Sieger bewertet.

Beim Resampling die Abhängigkeit der Kandidatenhistorien erhalten

Finanzdaten sind zeitlich geordnet. Ein unabhängiges Mischen kann serielle Abhängigkeit, Volatilitätscluster und Phasen korrelierter Gewinne oder Verluste auslöschen. Ebenso kann es den Zusammenhang zwischen Strategien verzerren, die oft auf dieselben Markttage reagieren. Solche Merkmale beeinflussen den Randbereich der Maximum-Statistik. Werden Kandidaten unabhängig voneinander oder einzelne Tage mit Zurücklegen gezogen, kann daher eine falsche Referenzverteilung entstehen.

White beschreibt Verfahren für abhängige Daten wie den Moving-Block-Bootstrap und untersucht den Stationary Bootstrap von Politis und Romano. Bei diesem Verfahren läuft ein gezogener Block meist mit der nächsten Zeitbeobachtung weiter; bei einem zufälligen Neustart beginnt er an einem anderen gezogenen Datum. Dadurch sind die Blocklängen geometrisch verteilt und besitzen eine festgelegte mittlere Länge. Unter den Annahmen und Abstimmungsentscheidungen der Methode bleiben kurzfristige zeitliche Folgen so besser erhalten als bei einer i.i.d.-Stichprobe. Siehe Politis und Romanos Arbeit zum Stationary Bootstrap.

Für eine Strategiefamilie ziehe eine gemeinsame Folge von Zeitindizes und wende sie auf den ganzen Zeilenvektor (d[1,t], …, d[K,t]) an. So bleiben sowohl die Reihenfolge innerhalb der gezogenen Blöcke als auch die gleichzeitigen Beziehungen zwischen Kandidaten erhalten. Wähle die Blocklänge mit Blick auf Strategiehorizont und Abhängigkeitsdiagnostik und berichte, wie empfindlich die Ergebnisse auf vernünftige Alternativen reagieren. Werden Parameter im Research-Verfahren neu geschätzt, muss geklärt werden, ob auch dieser Schritt zum Inferenzziel gehört. Falls ja, sollte er bei Bedarf in jeder Wiederholung erneut ausgeführt werden. Nur bereits angepasste, feste Renditen zu resamplen, kann einen Teil des zu prüfenden Verfahrens ausblenden.

Ein hypothetisches Bootstrap-Beispiel verändert die Interpretation

Angenommen, ein Researcher vergleicht über T = 252 Handelstage drei Strategien mit einer Benchmark. Ihre täglichen durchschnittlichen Differenzen nach Kosten betragen +2.0, +1.0 und −0.5 Basispunkte. Der Mittelwert des Siegers liegt also bei 2.0 Basispunkten und die beobachtete Statistik bei √252 × 2.0 bp ≈ 31.75 bp·√Handelstag. Die Skalierung ist Bestandteil der Teststatistik. Es ist kein t-Wert, weil nicht durch einen geschätzten Standardfehler dividiert wird.

Nehmen wir nun 9.999 Stationary-Bootstrap-Wiederholungen an, bei denen dieselben gezogenen Daten für alle drei Kandidaten verwendet werden. In diesem hypothetischen Ergebnis erreichen oder überschreiten 1.199 Wiederholungsmaxima den Wert 31.75. Der Monte-Carlo-Schätzer mit Plus-eins-Korrektur ist (1 + 1,199)/(9,999 + 1) = 0.12. Ein separater Test nur des Siegers könnte hypothetisch einen p-Wert von 0.03 liefern, ließe aber die Suche unter drei Kandidaten außer Acht. Der Reality-Check-p-Wert berücksichtigt den Vergleich der gesamten Familie; bei einer Schwelle von 5 % wird die gemeinsame Null in diesem Beispiel nicht verworfen.

Diese Zahlen sind zur Veranschaulichung erfunden. Sie sind weder gemessene Marktrenditen noch ein Ergebnis aus Whites Arbeit. Ein p-Wert von 0.12 bedeutet nicht, dass die Strategie mit einer Wahrscheinlichkeit von 12 % Verlust macht. Unter dem festgelegten Bootstrap und der Nullkonstruktion ist ein mindestens so großes Kandidatenmaximum nicht selten genug, um auf dem gewählten Niveau zu verwerfen. Die Stichprobenmittelwerte allein zeigen außerdem nicht, ob die Rendite nach Risiko-, Kapazitäts- und Ausführungseffekten wirtschaftlich relevant ist.

Den adjustierten p-Wert als Evidenz für eine festgelegte Familie lesen

Ein kleiner Reality-Check-p-Wert spricht gegen die Behauptung, dass kein Mitglied der einbezogenen Familie die gewählte Benchmark in der erwarteten Performance übertrifft – jeweils unter den Annahmen des Tests. Da es eine gemeinsame Nullhypothese ist, identifiziert der Test nicht automatisch den Kandidaten mit einem dauerhaften Vorteil. Der Sieger kann sich zwischen Stichproben ändern, und selbst bei Verwerfung auf Familienebene kann die Evidenz für eine bestimmte Strategie schwach sein.

Ein großer p-Wert bedeutet, dass die Null nicht verworfen wird; er beweist nicht, dass alle Strategien der Benchmark gleichwertig sind. Eine kurze Stichprobe, stark verrauschte Performance, eine sehr breite Familie, ungenaue Messungen oder geringe Teststärke können das Ergebnis erklären. Ebenso wenig ist der p-Wert die Wahrscheinlichkeit, dass die Null wahr ist. Er ist eine Randwahrscheinlichkeit unter einer Referenzverteilung, die von Kandidatensatz, Performance-Maß, Benchmark, Bootstrap-Design und beobachteten Daten abhängt.

Whites Frage ist ein relativer Vergleich. Eine Regel kann eine schwache Benchmark schlagen und trotzdem Geld verlieren; eine starke Benchmark kann eine Regel übertreffen, obwohl diese positive Renditen erzielt. Berichte absolute und benchmark-relative Ergebnisse gemeinsam mit Unsicherheit, Umschlag, Drawdown, Kapazität und realistischen Kosten. Statistische Evidenz für relative Prognoseüberlegenheit und die wirtschaftliche Eignung einer Anlage sind getrennte Entscheidungen.

Annahmen und Grenzen prüfen, bevor das Ergebnis verwendet wird

Die ursprüngliche Theorie setzt Regularitätsbedingungen für den Prozess der Performance-Differenzen und seine Grenzverteilung voraus. Whites Rahmen umfasst stationäre, stark mischende Zeitreihen; auch der abhängige Bootstrap verlangt eine geeignete Folge von Blocklängen. In endlichen Stichproben können Regimewechsel, Strukturbrüche, Langzeitabhängigkeit, seltene Sprünge und instabile Volatilität die Approximation durch stationäres Resampling fragwürdig machen. Ein Block-Bootstrap erhält einen Teil der lokalen Abhängigkeit, bildet aber kein unbekanntes künftiges Regime nach.

Der Test übernimmt auch Fehler aus Daten und Strategieauswertung. Look-ahead-Leakage, Survivorship Bias, revidierte Daten, unrealistische Ausführungen, ausgelassene Kosten, falsche Behandlung von Kapitalmaßnahmen und eine erst nach Sichtung der Ergebnisse gewählte Benchmark können die Performance-Differenzen unbrauchbar machen. Überlappen sich Haltedauern, können Renditen schon durch die Konstruktion abhängig sein. Resampling-Einheit und Blocklänge müssen diese Abhängigkeit abbilden können. Ist die endgültige Kennzahl nichtlinear – zum Beispiel die Sharpe Ratio –, berechne sie in jeder Wiederholung neu, statt anzunehmen, ein Bootstrap der Durchschnittsrendite teste sie automatisch.

Reality-Check-Implementierungen können konservativ sein, besonders wenn ein großer Kandidatensatz viele klar unterlegene Alternativen enthält. Eine breite Verteilung des Maximums kann eine Verwerfung erschweren, obwohl ein guter Kandidat existiert. Hansens Superior Predictive Ability Test ist ein verwandtes Bootstrap-Verfahren, das schwache Alternativen anders behandelt. Es ist kein allgemeiner Ersatz und seine Annahmen müssen ebenfalls geprüft werden. Vergleiche die Methoden anhand der Forschungsfrage und berichte Sensitivitäten, statt die Methode auszuwählen, die das gewünschte Ergebnis liefert.

Gemeinsam mit Zeitreihenvalidierung und anderen Auswahlverfahren einsetzen

White’s Reality Check behandelt die Frage, ob eine dokumentierte Suchfamilie nach Berücksichtigung der Auswahl einen Kandidaten mit benchmark-relativer Überlegenheit enthält. Er ersetzt keinen chronologischen Holdout oder Walk-Forward-Test einer eingefrorenen Strategie. Label-Überlappungen oder Leakage löst er nicht von selbst. Auch unterscheidet er sich von PBO: Dieses fasst zusammen, wie oft ein In-Sample-Sieger in kombinatorischen Aufteilungen unter dem Median der Kandidaten rangiert. Die Definition dieser Risikodiagnose steht im PBO-Originalaufsatz. Verfahren zur False-Discovery-Rate zielen auf den erwarteten Anteil falscher Befunde unter mehreren Verwerfungen. Die Deflated Sharpe Ratio passt dagegen eine auf der Sharpe Ratio beruhende Signifikanzbewertung an Selektion und nicht normalverteilte Renditen an. Weiterführend sind unsere Leitfäden zu Mehrfachtests und False-Discovery-Rate im Finanzwesen, PBO und CSCV, Walk-Forward-Validierung sowie Purged Cross-Validation und Embargo.

In einer praktischen Prüfung werden Benchmark und Performancedefinition fixiert, die tatsächlich verwendete Kandidatenfamilie rekonstruiert und gepaarte Differenzen je Zeitraum berechnet. Danach wählt und begründet man ein abhängigkeitssensitives Resampling-Design und berichtet Maximum-Statistik und Bootstrap-Randwahrscheinlichkeit. Anschließend wird der eingefrorene Auswahlprozess an späteren chronologischen Daten geprüft; Kosten und Umsetzbarkeit werden separat bewertet. Die Anwendung von Sullivan, Timmermann und White auf technische Handelsregeln zeigt, warum das gesamte Regeluniversum zählt: Die Schlussfolgerung kann sich ändern, wenn die komplette Suche statt nur des gemeldeten Siegers in die Inferenz eingeht. Der Reality Check korrigiert ein bestimmtes Selektionsproblem; er bescheinigt nicht, dass ein Backtest im Live-Handel bestehen wird.

Häufige Fragen

Q1Was prüft White’s Reality Check?

Er prüft, ob der beste Kandidat einer festgelegten Suchfamilie nach Berücksichtigung der Auswahl eine höhere erwartete Performance als eine gewählte Benchmark erzielt.

Q2Beweist ein kleiner Reality-Check-p-Wert, dass eine Strategie profitabel sein wird?

Nein. Er ist Evidenz gegen eine familienweite Null der Nichtüberlegenheit unter der gewählten Benchmark, Kennzahl, Datenbasis und den Bootstrap-Annahmen. Künftige Renditen oder Nettoprofitabilität werden dadurch nicht garantiert.

Q3Warum einen Block-Bootstrap verwenden statt Tage unabhängig neu zu ziehen?

Blöcke können einen Teil der lokalen seriellen Abhängigkeit erhalten. Gemeinsame gezogene Zeitpunkte für alle Kandidaten bewahren zudem ihre gleichzeitigen Beziehungen. Das Blockdesign muss weiterhin zu Daten und Forschungsfrage passen.

Quellen und weiterführende Lektüre

Problem melden

Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden

Schnelltest

Fertig gelesen? Prüfe dich mit 3 Fragen

Frage 1 / 3

Frage 01

Was besagt Whites gemeinsame Nullhypothese?

Wähle eine Antwort, um die Erklärung zu sehen

Optionsglossar

Klare Definitionen wichtiger Begriffe — von Calls, Puts und Optionsketten bis zu impliziter Volatilität, Griechen und Geld-Brief-Spanne

Optionsglossar öffnen