Skip to content
Alle Leitfäden zu Optionen und Futures
Wie oft fällt der Backtest-Sieger hinter das Feld zurück?14 Min. Lesezeit

Probability of Backtest Overfitting (PBO) und CSCV erklärt

Erfahren Sie, wie Combinatorially Symmetric Cross-Validation die PBO schätzt, wie OOS-Ränge zu Logits werden und warum PBO keine Prognose künftiger Verluste ist

In diesem LeitfadenPBO misst den Auswahlprozess, nicht eine Strategie für sich

Kurze Zusammenfassung

Die Probability of Backtest Overfitting (PBO) fragt, wie oft die im In-Sample (IS) ausgewählte beste Strategie im Out-of-Sample (OOS) unter dem Median der Kandidaten liegt. Combinatorially Symmetric Cross-Validation (CSCV) schätzt diesen Anteil, indem sie jeweils die Hälfte gleich langer Zeitblöcke zur Auswahl und die andere Hälfte zur Auswertung verwendet. PBO ist eine Diagnose für eine festgelegte Suche, Kennzahl und historische Ergebnismatrix. Sie ist keine Wahrscheinlichkeit, dass eine live gehandelte Strategie Geld verliert.

PBO misst den Auswahlprozess, nicht eine Strategie für sich

Ein Forschungsteam kann viele Rückblickzeiträume, Einstiegsschwellen, Haltedauern, Märkte, Kostenannahmen und Portfolioregeln testen und anschließend die Variante mit dem höchsten Backtestwert behalten. Das ausgewählte Ergebnis hatte dadurch viele Gelegenheiten, sich an die Besonderheiten der Stichprobe anzupassen. PBO fasst eine Folge dieser Suche zusammen: Wie oft liegt der IS-Sieger über festgelegte IS/OOS-Aufteilungen hinweg im OOS unter dem Median derselben Kandidaten?

Bailey, Borwein, López de Prado und Zhu entwickelten PBO als Rahmen zur Bewertung des Risikos bei der Strategieauswahl und schlugen CSCV als Schätzverfahren vor. Es geht um den Auswahlprozess aus getesteten Konfigurationen, nicht nur um zu viele Parameter in einer einzelnen Prognosegleichung. IS bezeichnet dabei die Daten, mit denen innerhalb einer Aufteilung Kandidaten ausgewählt werden; es muss nicht dem Zeitraum entsprechen, in dem jedes zugrunde liegende Modell geschätzt wurde. Die formale Definition steht im PBO-Originalbeitrag.

Eine hohe Sharpe Ratio über die gesamte Stichprobe schließt nicht aus, dass eine Strategie lediglich der glücklichste Kandidat einer schwachen Forschungsfamilie war. Umgekehrt kann die Auswahl meist einen Kandidaten über den OOS-Median heben, obwohl alle Kandidaten Verluste machen. PBO vergleicht relative Ränge innerhalb der eingereichten Kandidatenmenge. Sie testet für sich genommen keine positive erwartete Rendite.

PBO beantwortet eine andere Frage als andere Validierungsverfahren

Ein chronologischer Holdout oder Walk-forward-Test untersucht, wie ein festgelegter Forschungsprozess auf späteren Beobachtungen abgeschnitten hätte, die frühere Entscheidungen nicht beeinflussten. Purged Cross-Validation behandelt Überschneidungen zwischen Trainingslabels und Testergebnissen; ein Embargo kann einen zusätzlich begründeten Puffer schaffen. Beides misst allein nicht, wie oft der Sieger einer breiten Strategiensuche unter den OOS-Median fällt. Einzelheiten zu Purging und Embargo erklärt der Leitfaden zu Purged Cross-Validation und Embargo.

PBO ist auch keine Korrektur für multiples Testen. Whites Reality Check nutzt einen Bootstrap, um zu prüfen, ob die beste Regel einer Familie nach Berücksichtigung von Data Snooping eine Benchmark übertrifft. Die Deflated Sharpe Ratio passt eine Sharpe-basierte Signifikanzberechnung an Selektionsverzerrungen und nicht normalverteilte Renditen an. PBO fasst dagegen den OOS-Rang des IS-Siegers über Aufteilungen zusammen. Die Verfahren verwenden unterschiedliche Kennzahlen und Annahmen und ersetzen einander daher nicht automatisch. Siehe Whites Reality-Check-Originalarbeit und Baileys und López de Prados Beitrag zur Deflated Sharpe Ratio.

Beginnen Sie mit einer vollständigen, synchronisierten Ergebnismatrix

Sei M eine T-mal-N-Matrix. Jede der N Spalten steht für eine Strategie oder Konfiguration, jede der T Zeilen für dasselbe Beobachtungsintervall bei allen Kandidaten. Eine Zeile kann tägliche Renditen nach den relevanten Handelskosten darstellen. Handeln Kandidaten unterschiedlich häufig, muss zuerst ein gemeinsamer Zeitindex festgelegt und ihre Leistung einheitlich aggregiert werden. Tagesrenditen einer Strategie lassen sich nicht sinnvoll zeilenweise mit monatlichen Gesamtwerten einer anderen vergleichen.

Die Kandidatenmenge sollte die tatsächlichen Auswahlmöglichkeiten abbilden: verworfene Varianten aus Gittersuchen, manuelle Änderungen nach Sichtung der Ergebnisse, andere Universen und Regeln, die zur finalen Wahl beitrugen. PBO kann nur die übergebenen Kandidaten und Historien bewerten. Wurden nach einer viel größeren Suche nur die Finalisten gespeichert, unterschätzt die Schätzung den tatsächlichen Suchumfang.

Verwenden Sie für alle Kandidaten dieselbe Renditedefinition, Währung, Hebelbehandlung und Leistungskennzahl. Wird anhand der Netto-Sharpe-Ratio ausgewählt, fließen passende Gebühren, Spreads, Finanzierung, Funding, Leihkosten und Ausführungsannahmen vor der Berechnung in jede Spalte ein. Die Kennzahl muss zudem auf den unten beschriebenen Teilstichproben berechenbar sein. Die Originalarbeit verlangt synchronisierte Zeilen und eine auf jeder Teilstichprobe schätzbare Kennzahl; bei unterschiedlicher Handelsfrequenz empfiehlt sie einen gemeinsamen Index.

CSCV paart jede Stichprobenhälfte mit ihrem Komplement

Wählen Sie eine gerade Zahl S disjunkter Zeitblöcke gleicher Größe. Die Reihenfolge innerhalb eines Blocks bleibt erhalten. Für jede mögliche Auswahl von S/2 Blöcken bilden diese die In-Sample-Menge (IS); die übrigen S/2 Blöcke bilden die Out-of-Sample-Menge (OOS). Bei pfadabhängigen Kennzahlen werden ausgewählte Blöcke in ihrer ursprünglichen Reihenfolge angeordnet. Dokumentieren Sie, was die Verkettung für die Kennzahl bedeutet.

Es gibt C(S,S/2) IS-Zuordnungen. Bei vier Blöcken A, B, C und D lauten die sechs Zuordnungen AB, AC, AD, BC, BD und CD; jedes Komplement wird ebenfalls als eigene Zuordnung gezählt. Für S = 16 gilt C(16,8) = 12.870. Das sind deterministische Kombinationen derselben Historie, keine 12.870 unabhängigen Marktexperimente.

„Symmetrisch“ bedeutet, dass das Komplement in einer anderen Kombination als Auswahlmenge dient: Einmal ist AB IS und CD OOS, ein anderes Mal umgekehrt. „Kombinatorisch“ bedeutet, dass alle Halbblock-Auswahlen aufgezählt werden statt nur eine zufällige Aufteilung zu ziehen. CSCV ist keine chronologische Wiedergabe. Eine Auswahl kann frühe und späte Blöcke enthalten, während das Komplement mittlere Blöcke enthält. OOS bedeutet hier daher nicht „die Zukunft nach dem Trainingszeitraum“.

Zeitblöcke werden wiederholt symmetrisch in Trainings- und Testhälften geteilt; einige im In-Sample ausgewählte Gewinner landen mit ihrem Out-of-Sample-Rang unter dem Mittelpunkt
Konzeptionelle Darstellung symmetrischer CSCV-Aufteilungen und Rangfolgen; keine echten Daten und keine chronologische Handelssimulation

Wandeln Sie den OOS-Rang des ausgewählten Kandidaten in einen Logit um

Wenden Sie für Aufteilung c die Auswahlregel auf IS an und bestimmen Sie den besten Kandidaten n*(c). Bewerten Sie anschließend alle N Kandidaten mit derselben Kennzahl auf dem komplementären OOS-Teil. Der Rang r(c) des ausgewählten Kandidaten reicht von 1 für den schlechtesten bis N für den besten Wert. Legen Sie vorab fest, wie Gleichstände behandelt werden, und wenden Sie die Regel durchgehend an.

Der relative Rang ist ω(c) = r(c)/(N+1). Der Nenner N+1 hält auch den niedrigsten und höchsten Rang strikt zwischen null und eins. Der Logit lautet λ(c) = ln(ω(c)/(1−ω(c))). Er ist negativ, wenn der Kandidat unter dem OOS-Median liegt, null am Median und positiv darüber. Die geschätzte PBO ist der Anteil aller CSCV-Zuordnungen mit λ(c) ≤ 0.

Der einzelne PBO-Wert gibt an, wie oft der IS-Sieger höchstens den OOS-Median erreicht. Die gesamte Logit-Verteilung zeigt zusätzlich, ob ausgewählte Kandidaten meist nahe der Mitte bleiben, häufig stark zurückfallen oder oft darüber liegen. Ein Logit ist ein transformierter relativer Rang, keine Wahrscheinlichkeit für einen einzelnen Live-Trade und keine kalibrierte Renditeprognose.

Ein hypothetisches Beispiel mit vier Blöcken ergibt 66,7 % PBO

Angenommen, ein Forschungsteam hat vier gleich große historische Blöcke und vier Regeln R1 bis R4. Die Tabelle zeigt alle sechs IS-Zuordnungen. Der OOS-Rang gibt den Rang der im jeweiligen IS ausgewählten Regel unter den vier Regeln auf den Komplementblöcken an. Alle Zahlen sind hypothetisch und veranschaulichen nur die Rechnung.

IS-BlöckeIS-SiegerOOS-Rang rRelativer Rang ω = r/5Logit ln(ω/(1−ω))Höchstens Median?
ABR110,20−1,386Ja
ACR340,80+1,386Nein
ADR220,40−0,405Ja
BCR110,20−1,386Ja
BDR430,60+0,405Nein
CDR320,40−0,405Ja

Vier der sechs ausgewählten Regeln liegen im OOS höchstens beim Median. Damit beträgt die empirische PBO 4/6 ≈ 0,667, also rund 66,7 %. Bei Rang 2 gilt beispielsweise ω = 2/(4+1) = 0,4 und λ = ln(0,4/0,6) ≈ −0,405. Rang 3 ergibt ω = 0,6 und den entgegengesetzten Logit von etwa +0,405.

Das bedeutet nicht, dass die Strategie mit 66,7-prozentiger Wahrscheinlichkeit nächsten Monat Geld verliert. In dieser hypothetischen Matrix und unter dieser Rangkonvention lag der IS-Sieger bei vier von sechs Aufteilungen höchstens beim Kandidatenmedian. Selbst die zwei übrigen Sieger könnten absolut negative OOS-Renditen erzielt und dennoch besser als ihre Kandidaten abgeschnitten haben.

Behandeln Sie PBO als bedingte Diagnose mit Grenzen

PBO hängt von Kandidatenfamilie, Ergebnismatrix, Auswahlkennzahl, Zeitblöcken und Gleichstandsregel ab. Nicht dokumentierte Versuche bleiben unberücksichtigt. „Modellfrei“ bedeutet, dass die Berechnung mit den Leistungshistorien der Kandidaten ohne Kenntnis ihrer Prognosegleichungen möglich ist. Frei von Designentscheidungen, Datenproblemen oder Annahmen ist sie dadurch nicht.

CSCV kombiniert Blöcke zu symmetrischen, gleich großen IS- und OOS-Teilstichproben. Die OOS-Menge ist meist kein einzelner späterer chronologischer Zeitraum. Das Zusammenfügen kann langfristige Abhängigkeiten, Saisonmuster oder die Abfolge wirtschaftlicher Regime stören. S bestimmt sowohl die Kombinationszahl als auch die Dauer eines Blocks. Wählen und dokumentieren Sie S daher anhand der relevanten Horizonte und Strukturen. Viele Kombinationen sind keine ebenso vielen unabhängigen Beobachtungen, weil dieselben Blöcke wiederverwendet werden.

Verzerrungen in den Ursprungsdaten bleiben erhalten: Survivorship Bias, nachträglich überarbeitete Daten, damals nicht verfügbare Merkmale, unrealistische Ausführungen, fehlende Kosten oder ein nachträglich gewähltes Anlageuniversum können alle Kandidatenhistorien entwerten. CSCV entfernt nicht automatisch überlappende Labelintervalle, schätzt nicht zwingend jede Modellpipeline in jedem Split neu und verhindert keinen Informationsfluss aus der Vorverarbeitung. Solche Schritte müssen zur Forschungsfrage passen und ausdrücklich umgesetzt werden. Chronologische Schutzmaßnahmen beschreiben die offizielle Dokumentation zu TimeSeriesSplit und der Leitfaden zur Purged-Validierung.

Pfadabhängige Kennzahlen wie der maximale Drawdown erfordern besondere Sorgfalt: Das Verketten nicht benachbarter Blöcke verändert den Pfad und möglicherweise die Kennzahl. Die PBO-Arbeit weist darauf hin, dass bei manchen Kennzahlen anders als bei der Sharpe Ratio die Reihenfolge zählt. Erklären Sie vor der Interpretation, wie Reihenfolge, Lücken, fehlende Beobachtungen und Aufzinsung behandelt werden.

Berichten Sie PBO neben chronologischer Evidenz und dem vollständigen Suchprotokoll

Bewahren Sie vor der Berechnung das Kandidatenregister, alle Änderungen nach Sichtung der Ergebnisse, die Ergebnismatrix, Auswahlkennzahl und Gleichstandsregel auf. Berichten Sie T, N, S, Blockbildung, C(S,S/2), OOS-Rangkonvention, PBO und Logit-Verteilung. Ergänzen Sie absolute OOS-Leistung, Kosten, Umsatz, Drawdowns und die Zahl verlierender Kandidaten: Ein Rang allein zeigt nicht, ob alle Kandidaten schwach sind.

Nutzen Sie Walk-forward-Tests oder einen echten chronologischen Holdout, um die eingefrorene Forschungsregel auf späteren Daten zu beurteilen. Halten Sie den letzten Zeitraum bei der Wahl von Modell und Schwellenwerten geschlossen; wiederholte Einsicht macht ihn zu einer weiteren Auswahlmenge. Zeitgeordnete Werkzeuge wie TimeSeriesSplit bilden unter ihren dokumentierten Annahmen chronologische Folds, während PBO eine andere Rangseigenschaft der getesteten Kandidatenfamilie misst.

PBO ergänzt Kontrollen gegen Labelüberlappung, Multiple-Testing-Analysen, realistische Ausführungsmodelle, prospektive Auswertung und Live-Überwachung, ersetzt sie aber nicht. Lesen Sie ergänzend Multiple Testing und False-Discovery-Rate im Finanzwesen sowie Sharpe-Ratio bei serieller Korrelation. Keine einzelne Kennzahl beweist aus einer historischen Rangfolge einen dauerhaften Handelsvorteil.

Häufige Fragen

Q1Bedeutet PBO, dass die Strategie mit dieser Wahrscheinlichkeit Geld verliert?

Nein. PBO schätzt, wie oft ein IS-Kandidat in den festgelegten Aufteilungen höchstens den OOS-Median erreicht. Sie ist weder eine Wahrscheinlichkeit künftiger Verluste noch eine kalibrierte Prognose der Live-Rendite.

Q2Ist CSCV dasselbe wie ein Walk-forward-Test?

Nein. CSCV paart jede Auswahl aus der Hälfte der Blöcke mit ihrem Komplement; die OOS-Blöcke können dadurch frühere und spätere Zeitpunkte enthalten. Walk-forward hält das Training vor jedem späteren Testzeitraum, um einen chronologischen, einsatzähnlichen Ablauf zu untersuchen.

Q3Beweist eine niedrige PBO, dass die gewählte Strategie einen Vorteil hat?

Nein. Ein Sieger kann eine schwache Kandidatengruppe übertreffen und absolut dennoch Verluste machen. Bewerten Sie Nettorendite, Unsicherheit, Kosten, Informationsleckage und Ergebnisse auf wirklich späteren Daten getrennt voneinander.

Quellen und weiterführende Lektüre

Problem melden

Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden

Schnelltest

Fertig gelesen? Prüfe dich mit 3 Fragen

Frage 1 / 3

Frage 01

Welches Ereignis fließt in eine PBO-Schätzung ein?

Wähle eine Antwort, um die Erklärung zu sehen

Optionsglossar

Validierung von ZeitreihenmodellenPurged Cross-Validation und Embargo: Label-Leakage in Trading-Modellen vermeidenErfahren Sie, wie Purging und Embargo überlappende Forward-Labels in Finanzzeitreihen behandeln und wie sie sich von Walk-Forward-Validierung und CPCV unterscheiden.Warum ein einzelner Schwellenwert scheitert, wenn Forschende viele Ideen testenMehrfachtests und False Discovery Rate im FinanzwesenVerstehen Sie multiple Vergleiche, familienweite Fehlerrate, False Discovery Rate, Bonferroni, Holm, Benjamini–Hochberg, Abhängigkeit, q-Werte, Faktormining, Backtest-Auswahl und Forschungs-GovernanceRendite im richtigen ZeitmaßstabSharpe Ratio annualisieren: Warum √12 bei Autokorrelation irreführen kannErfahren Sie, wann die Annualisierung einer monatlichen Sharpe Ratio mit √12 gilt, wie serielle Korrelation sie verändert und was eine belastbare Auswertung berichten sollteBewertung von RichtungsprognosenPesaran–Timmermann-Test: Liefert eine Richtungsprognose zusätzliche Information?Erfahre, wie der Pesaran–Timmermann-Test Treffer bei Richtungsprognosen mit einer Basisrate aus tatsächlichen und prognostizierten Aufwärtsanteilen vergleicht und warum serielle Abhängigkeit die Inferenz verändert.Quantitative ForschungDeflated Sharpe Ratio erklärt: Mehrfachtests und Backtest-AuswahlErfahren Sie, wie der Deflated Sharpe Ratio den Sharpe-Nachweis nach der Strategiewahl an Mehrfachtests und nicht normalverteilte Renditen anpasst – mit einem hypothetischen Rechenbeispiel und klaren Grenzen.