Skip to content
Alle Leitfäden zu Optionen und Futures
Zwei Bootstrap-Tests für viele gleichzeitig geprüfte Handelsregeln15 Minuten Lesezeit

White Reality Check und Hansen SPA für Handelsregeln erklärt

Erfahren Sie, wie White Reality Check und Hansen SPA eine ganze Familie technischer Handelsregeln vergleichen, wie sich ihre Null-Bootstraps unterscheiden und was ein globaler p-Wert aussagt.

In diesem LeitfadenWarum die beste Regel einen Familientest braucht

Kurze Zusammenfassung

Wenn aus vielen getesteten Regeln im Backtest die beste ausgewählt wird, beantwortet ein gewöhnlicher Test für diese eine Regel die falsche Frage. White Reality Check und Hansen SPA prüfen die gesamte festgelegte Regelfamilie gegen einen Benchmark. SPA studentisiert die Regelunterschiede und setzt eine datenabhängige Zentrierung ein, die sehr schlechte Alternativen weniger stark in die Nullverteilung einfließen lässt. Keiner der Tests identifiziert allein einen verlässlichen Gewinner für die Zukunft.

Warum die beste Regel einen Familientest braucht

Wer zwanzig Einstellungen ausprobiert und anschließend die höchste Rendite berichtet, hat nicht nur eine Regel getestet. Die ausgewählte Kennzahl enthält auch den Effekt der Suche: Selbst wenn alle Varianten keinen echten Vorteil haben, wird eine von ihnen im historischen Sample meist gut aussehen. Ein gewöhnlicher t-Test, der so tut, als sei die Gewinnerregel vor der Auswertung festgelegt worden, berücksichtigt diese Auswahl nicht.

White entwickelte den Reality Check, um genau diese Data-Snooping-Frage für eine ganze Suchfamilie zu stellen. Sullivan, Timmermann und White wendeten die Methode auf eine umfangreiche Familie technischer Handelsregeln an und zeigten, warum die getestete Grundgesamtheit offengelegt werden muss. Hansen schlug später mit dem Test auf Superior Predictive Ability, kurz SPA, eine studentisierte Alternative vor, deren Nullverteilung weniger empfindlich auf schlechte und irrelevante Regeln reagiert. Die Originalarbeiten sind White (2000), Sullivan, Timmermann und White (1999) und Hansen (2005).

Benchmark und Leistungsdifferenz vorab festlegen

Für jede Regel $k$ und jeden gemeinsamen Zeitpunkt $t$ sei $d_{k,t}$ ihr Vorteil gegenüber dem Benchmark. Bei Renditen kann man $d_{k,t}=R_{k,t}-R_{0,t}$ setzen. Bei Prognoseverlusten ist die Richtung umzukehren, etwa $d_{k,t}=L_{0,t}-L_{k,t}$, damit ein positiver Wert in beiden Fällen der Regel zugutekommt. Die mittlere Differenz $\mu_k=E[d_{k,t}]$ ist dann das Ziel der Prüfung.

Diese Definition ist nicht bloß Notation. Sie legt fest, ob der Test Bruttorendite, Nettorendite nach Kosten, Verlustreduktion oder eine andere vorab bestimmte Messgröße bewertet. Der Benchmark, die Renditefrequenz, der gemeinsame Auswertungszeitraum und die Vorzeichenkonvention müssen für alle Regeln gleich sein. Für eine nichtlineare Kennzahl wie Sharpe Ratio lässt sich die nachfolgende Mittelwertformel nicht unverändert übernehmen; dafür braucht man ein dazu passendes Testdesign.

Die Hypothese umfasst jede geprüfte Variante

Die globale Nullhypothese lautet $H_0:\max_{k=1,\ldots,K}\mu_k\leq 0$. Gleichbedeutend darf keine Regel aus der Familie im Erwartungswert besser sein als der Benchmark. Die Alternative ist, dass mindestens eine Regel einen positiven mittleren Vorteil hat. Es ist also ein einseitiger Familientest und kein Test, ob alle Regeln gleich sind.

Die Zahl der Kandidaten ergibt sich aus allen tatsächlich verglichenen Einstellungen, nicht nur aus den Varianten, die am Ende in einer Tabelle stehen. Eine hypothetische Suche mit 12 Rückblickfenstern, 4 Filtern und 5 Ausstiegsregeln umfasst rechnerisch $12\times4\times5=240$ Varianten. Das ist nur ein Beispiel für die Größe einer Familie; daraus folgt weder ein bestimmtes Ergebnis noch ein p-Wert. Wurden zusätzlich Assets, Schwellenwerte oder Kostenmodelle ausprobiert, gehören diese Versuche ebenfalls zur dokumentierten Suche.

White Reality Check verwendet das All-Null-Randmodell

Für $n$ gemeinsame Beobachtungen und den Stichprobenmittelwert $\bar d_k$ ist die hier verwendete Reality-Check-Statistik

$$T_{\mathrm{RC}}=\max_{k=1,\ldots,K}\sqrt{n}\,\bar d_k.$$

Der Maximalwert fragt, wie gut die beste Regel im Sample relativ zum Benchmark abschneidet. In dieser Definition wird die Statistik nicht künstlich mit null gekappt. Für die Nullverteilung zentriert man die beobachtete Differenz jeder Regel um ihren Mittelwert und resampelt die so erhaltenen Zeitreihen unter der Randannahme $\mu_k=0$ für alle Kandidaten. Diese gemeinsame All-Null-Grenze ist für die Nullhypothese am ungünstigsten, kann aber die Teststärke verringern.

Warum ist das relevant? Eine sehr schlechte Regel bleibt in jeder Wiederholung als Teil des Maximalwerts enthalten und kann so die kritischen Quantile erhöhen. White formuliert damit eine konservative Frage: Ist der größte beobachtete Vorteil groß genug, um die ungünstigste Konfiguration zu übertreffen, in der alle erwarteten Vorteile null sind? Ein kleiner p-Wert liefert Evidenz gegen die globale Null für die untersuchte Familie, nicht für eine beliebige Regel außerhalb dieser Familie.

Hansen SPA studentisiert und zentriert datenabhängig

SPA standardisiert jeden Mittelwert mit einer Schätzung seiner langfristigen Streuung $\hat\omega_k$. Seine Statistik lautet

$$T_{\mathrm{SPA}}=\max\left(0,\max_k\frac{\sqrt n\,\bar d_k}{\hat\omega_k}\right).$$

Die Skalierung macht Differenzen unterschiedlicher Volatilität vergleichbarer. Der äußere Maximalwert bei null gehört zu dieser SPA-Statistik; er ist kein Zusatz zur oben definierten Reality-Check-Formel. Die Varianzschätzung muss die zeitliche Abhängigkeit der Leistungsdifferenz berücksichtigen und ist selbst eine Modellierungsentscheidung.

Der zweite Unterschied liegt in der Nullzentrierung. SPA schätzt für jede Regel einen Korrekturwert $\hat\mu_{c,k}$. Ist ihr standardisierter Mittelwert deutlich negativ, etwa unter der Hansen-Schwelle $-\sqrt{2\log\log n}$, bleibt dieser negative Mittelwert bei der Bootstrap-Nullverteilung erhalten. Für Regeln, die mit den Daten auch am Nullrand vereinbar sind, wird dagegen auf null zentriert. So bestimmen eindeutig schlechte Regeln die Nullverteilung weniger stark, während plausible Grenzfälle weiter berücksichtigt werden. Die konkrete Zentrierungsregel und die verwendete p-Wert-Variante sollten berichtet werden.

Viele Pfade laufen an einem Gipfel zusammen; daneben stehen eine Waage, zwei abstrakte Verteilungen und Zeitblöcke – ohne Text.
Die Konzeptgrafik veranschaulicht Strategiensuche und den Vergleich von Unsicherheitsverteilungen; sie zeigt keine Testergebnisse oder Marktrenditen.

Der Block-Bootstrap muss die gemeinsame Zeitstruktur erhalten

Die Daten eines Zeitpunkts bilden einen Vektor $(d_{1,t},\ldots,d_{K,t})$ über alle Varianten. Bei jeder Bootstrap-Wiederholung sind ganze Vektorzeilen in zeitlich zusammenhängenden Blöcken zu ziehen. Werden Regeln oder Zeitpunkte unabhängig voneinander resampelt, gehen die Korrelation zwischen Regeln und die zeitliche Abhängigkeit der Leistungsdifferenzen verloren; die daraus berechnete Maximalstatistik beantwortet dann nicht dieselbe Frage.

Der stationäre Bootstrap von Politis und Romano (1994) zieht Blöcke mit geometrisch verteilten Längen und einer gewählten mittleren Blocklänge. Andere geeignete Block-Bootstrap-Verfahren verwenden etwa feste, sich überlappende Blöcke. Die Wiederholungen müssen die ursprüngliche Stichprobenlänge ergeben. Beide Tests setzen voraus, dass das gemeinsame Renditedifferenz-System hinreichend stabil und schwach abhängig ist. Längenwahl, Abhängigkeit und mögliche Strukturbrüche beeinflussen die Aussage; ein Bootstrap beseitigt keine Regimewechsel.

Ein globaler p-Wert benennt keinen Sieger

Ein signifikanter Reality-Check- oder SPA-Test besagt, dass die Daten unter den Annahmen Evidenz für mindestens einen positiven mittleren Vorteil in der erfassten Familie liefern. Der globale p-Wert ist weder die Wahrscheinlichkeit, dass die Nullhypothese wahr ist, noch die Wahrscheinlichkeit, dass eine konkrete Regel künftig funktioniert. Er bestimmt auch nicht, welche getestete Regel individuell überlegen ist. Dafür braucht es gesonderte, selektionsbewusste Analyse und neue Daten.

Bei 240 hypothetischen Varianten könnte der Gewinner also eine von 240 getesteten Regeln sein; diese Zahl sagt nichts darüber aus, ob ein Test verworfen wird. Das Ergebnis hängt von den tatsächlichen Renditedifferenzen, dem Beobachtungsumfang, der gemeinsamen Abhängigkeit und dem Bootstrap-Verfahren ab. Ein hoher oder niedriger p-Wert kann weder eine nicht dokumentierte Suchphase korrigieren noch die künftige Stabilität der Performance garantieren.

FDR und Konfidenzintervalle beantworten andere Fragen

Die False Discovery Rate und Mehrfachtests behandeln typischerweise eine Menge einzelner Hypothesen und kontrollieren unter bestimmten Bedingungen den erwarteten Anteil falscher Entdeckungen unter den Zurückweisungen. Reality Check und SPA prüfen dagegen eine globale Aussage über das Maximum einer festgelegten Familie: Gibt es Evidenz, dass mindestens ein Kandidat den Benchmark übertrifft? Sie liefern nicht automatisch eine bereinigte Liste einzelner Sieger.

Auch ein gewöhnliches Block-Bootstrap-Konfidenzintervall für eine vorab festgelegte Strategie beantwortet eine andere Frage. Der Leitfaden zu Block-Bootstrap-Intervallen für Strategierenditen quantifiziert Unsicherheit eines bestimmten Mittelwerts oder einer anderen festgelegten Kennzahl. Wenn die Strategie erst nach dem Durchsuchen vieler Varianten ausgewählt wurde, korrigiert ein solches Intervall diese Auswahl nicht automatisch. Der Test und die Inferenz müssen zur Forschungsfrage passen.

Purged Cross-Validation behandelt dagegen ein anderes Problem: Sie soll zeitliche Informationsleckage zwischen Trainings- und Testbeobachtungen in geordneten Daten begrenzen. Sie prüft nicht, ob das Maximum einer Regelfamilie den Benchmark übertrifft – das ist die globale Frage von RC und SPA. Der Leitfaden zu Purged Cross-Validation und Embargo erläutert diese zeitliche Trennung.

Kosten, Suchprotokoll und Marktregime bleiben entscheidend

Die Leistungsdifferenzen sollten die Kosten enthalten, die für die getestete Handelsregel relevant sind: Gebühren, Geld-Brief-Spanne, Slippage, Markteinfluss, Finanzierung, Leihkosten und gegebenenfalls Kapitalbindung. Werden Kosten erst nach dem Test abgezogen, kann ein statistisch positiver Bruttovorteil wirtschaftlich verschwinden. Auch verzögerte Ausführung, Liquidität und Positionsgrößen können die realisierbare Rendite verändern.

Ein sauberer Bericht dokumentiert die gesamte Variantenfamilie, alle Auswahl- und Filterstufen, Zeitraum, Datenquelle, Benchmark, Differenzdefinition, Kosten, Blockmethode, Blocklängenregel, Anzahl der Bootstrap-Wiederholungen und die konkret verwendete SPA-p-Wert-Variante. Wiederholtes Nachjustieren nach Betrachtung der Ergebnisse ist neue Suche und muss in der Interpretation auftauchen. Wenn sich die Renditeverteilung durch Strukturbrüche stark verändert oder die Serie nicht plausibel stationär und schwach abhängig ist, können beide Bootstrap-Tests irreführend sein. Sie sind statistische Prüfungen eines historischen Forschungsdesigns, keine Prognose, Garantie oder persönliche Anlageberatung.

Häufige Fragen

Q1Bedeutet ein signifikanter SPA-Test, dass die beste Regel einzeln signifikant ist?

Nein. Der Test bewertet das Maximum der gesamten untersuchten Familie. Ein globaler p-Wert weist keine einzelne Regel als statistisch bestätigten Sieger aus.

Q2Ist SPA immer leistungsstärker als der Reality Check?

Nein. SPA kann bei vielen schlechten oder irrelevanten Alternativen weniger empfindlich sein und dadurch in bestimmten Situationen mehr Teststärke haben. Eine uniforme Dominanz in allen Datenlagen folgt daraus nicht.

Q3Kann ich mit diesen Tests eine künftige Rendite prognostizieren?

Nein. Sie prüfen eine historische, klar definierte Familie unter Annahmen über die gemeinsame Zeitreihe. Strukturbrüche, andere Marktbedingungen, Kosten und neue Auswahlentscheidungen können die künftige Leistung verändern.

Quellen und weiterführende Lektüre

Problem melden

Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden

Schnelltest

Fertig gelesen? Prüfe dich mit 3 Fragen

Frage 1 / 3

Frage 01

Welche Aussage prüft die globale Nullhypothese von Reality Check und SPA?

Wähle eine Antwort, um die Erklärung zu sehen

Optionsglossar

Warum ein einzelner Schwellenwert scheitert, wenn Forschende viele Ideen testenMehrfachtests und False Discovery Rate im FinanzwesenVerstehen Sie multiple Vergleiche, familienweite Fehlerrate, False Discovery Rate, Bonferroni, Holm, Benjamini–Hochberg, Abhängigkeit, q-Werte, Faktormining, Backtest-Auswahl und Forschungs-GovernanceWie belastbar ist die gemessene Strategie-Rendite?Block-Bootstrap: Konfidenzintervalle für Trading-StrategienErfahre, wie Moving-Block- und stationärer Bootstrap zeitliche Abhängigkeit in Renditen berücksichtigen und was ein Konfidenzintervall für Mittelwert oder Sharpe Ratio aussagt.Validierung von ZeitreihenmodellenPurged Cross-Validation und Embargo: Label-Leakage in Trading-Modellen vermeidenErfahren Sie, wie Purging und Embargo überlappende Forward-Labels in Finanzzeitreihen behandeln und wie sie sich von Walk-Forward-Validierung und CPCV unterscheiden.Warum der Testsieger einer Strategiesuche gemeinsam geprüft werden mussWhite’s Reality Check gegen Data Snooping in Strategie-BacktestsErfahre, wie White’s Reality Check nach einer Kandidatensuche die stärkste Strategie mit einer Benchmark vergleicht und dabei das Maximum eines abhängigkeitssensitiven Bootstrap berücksichtigtTechnische HandelsmethodenAnchored VWAP: einen Startpunkt ohne Rückschau wählenErfahren Sie, wie sich Anchored VWAP mit dem Startpunkt ändert, wie sich ein Ereignisanker in Echtzeit festlegen lässt und wie Sie die Regel testen, ohne eine Chartlinie für ein Signal zu halten.