Deflated Sharpe Ratio erklärt: Mehrfachtests und Backtest-Auswahl
Erfahren Sie, wie der Deflated Sharpe Ratio den Sharpe-Nachweis nach der Strategiewahl an Mehrfachtests und nicht normalverteilte Renditen anpasst – mit einem hypothetischen Rechenbeispiel und klaren Grenzen.
In diesem LeitfadenNach einer Suche setzt DSR die Sharpe-Schwelle höher
Kurze Zusammenfassung
Der Deflated Sharpe Ratio (DSR) fragt, ob der geschätzte Sharpe-Wert einer ausgewählten Strategie eine Schwelle übersteigt, die sowohl die Suche unter Alternativen als auch die Form der Renditeverteilung berücksichtigt. Dazu wird eine probabilistische Sharpe-Berechnung mit einer um die Auswahl bereinigten Vergleichsschwelle verwendet. DSR ist eine bedingte statistische Diagnose: Er macht aus einem Backtest keinen Beweis für künftige Gewinne und behebt weder ausgelassene Versuche noch unrealistische Kosten oder Zeitreihen-Leakage.
Nach einer Suche setzt DSR die Sharpe-Schwelle höher
Forschende können viele Signaldefinitionen, Rückblickzeiträume, Einstiegsschwellen, Anlageuniversen, Haltedauern und Kostenannahmen testen und anschließend die Variante mit der höchsten Sharpe Ratio berichten. Selbst wenn keine Variante echte Prognosefähigkeit hat, schwanken die Schätzungen in einer endlichen Stichprobe. Je breiter die Suche, desto höher fällt tendenziell der größte Schätzwert aus. Ein so ausgewähltes Ergebnis unterscheidet sich von der Bewertung einer einzelnen Strategie, die vor der Datensichtung festgelegt wurde.
Der von Bailey und López de Prado vorgeschlagene Deflated Sharpe Ratio berücksichtigt zwei Ursachen für die Aufblähung eines ausgewählten Sharpe-Werts: Mehrfachtests und nicht normalverteilte Renditen. Mehrfachtests heben die Schwelle an, die das Ergebnis übertreffen muss; Nichtnormalität verändert die geschätzte Unsicherheit des Sharpe-Werts. Im Originalbeitrag wird DSR als Probabilistic Sharpe Ratio beschrieben, die an einer um die Auswahl bereinigten Schwelle ausgewertet wird. Der Originalbeitrag erläutert die Herleitung und die Schätzung der Versuchszahl.
Diese Einordnung verhindert einen verbreiteten Deutungsfehler. DSR zieht nicht mechanisch einen festen Abschlag vom berichteten Sharpe ab, um eine neue Performanceratio zu erzeugen. Er schätzt, wie deutlich der beobachtete Sharpe eine Schwelle übersteigt, die Suche, Stichprobenumfang und Renditemomente berücksichtigt. Der Punktschätzer des Sharpe kann unverändert bleiben, während der DSR wegen schwächerer Evidenz sinkt. Zur Bedeutung des Sharpe selbst siehe auch Sharpes ursprüngliche Erläuterung.
Das beste Ergebnis aus vielen verrauschten Schätzungen liegt oft ungewöhnlich hoch
Angenommen, alle getesteten Regeln haben denselben wahren Sharpe, doch jede Schätzung variiert wegen der begrenzten Stichprobe. Wer den größten Schätzwert auswählt, wählt damit auch einen günstigen Messfehler aus. Dieser Winner’s Curse bedeutet: Bei neuen Daten dürfte der ausgewählte Wert zum typischen Wert der Gruppe zurückkehren.
Es zählt nicht nur die Zahl der Versuche, sondern auch, wie unterschiedlich ihre Ergebnisse sind. Erzeugen Kandidaten nahezu identische Renditen, hängen ihre geschätzten Sharpe-Werte eng zusammen. Sie bieten dann weniger unabhängige Chancen auf ein zufällig hohes Maximum als dieselbe Zahl unverbundener Kandidaten. Die Zeilenzahl eines Parametergitters ist deshalb nicht automatisch die Zahl unabhängiger Versuche.
Das Suchprotokoll kann auch Entscheidungen außerhalb eines formalen Gitters umfassen: etwa eine manuell geänderte Schwelle, einen ausgeschlossenen Markt oder eine angepasste Kostenannahme, die beeinflusst hat, welches Ergebnis übrig blieb. Ein DSR, der nur mit den endgültigen Kandidaten berechnet wird, kann nicht für Experimente aufkommen, die weder dokumentiert noch als Eingabe übergeben wurden.
Die Probabilistic Sharpe Ratio berechnet die Stichprobenunsicherheit
Die Probabilistic Sharpe Ratio (PSR) schätzt in Wahrscheinlichkeitsform, ob ein Stichproben-Sharpe eine gewählte Vergleichsschwelle übersteigt. Sie berücksichtigt die Zahl der Renditebeobachtungen sowie geschätzte Schiefe und Kurtosis. DSR verwendet dieselbe Grundberechnung, wählt aber eine Vergleichsschwelle, die den erwarteten maximalen Sharpe aus der Suche widerspiegelt.
Für eine verbreitete PSR-Näherung lautet die um die Auswahl bereinigte Berechnung:
$$ \mathrm{DSR}=\Phi\!\left( \frac{(\widehat{SR}-SR_0)\sqrt{T-1}} {\sqrt{1-\widehat{\gamma}_3\widehat{SR} +\frac{\widehat{\gamma}_4-1}{4}\widehat{SR}^{\,2}}} \right) $$
Dabei ist $\Phi$ die kumulative Verteilungsfunktion der Standardnormalverteilung, $\widehat{SR}$ der beobachtete Sharpe je Renditebeobachtung, $SR_0$ die um die Auswahl bereinigte Schwelle in derselben Einheit und $T$ die Zahl der Beobachtungen. $\widehat{\gamma}_3$ ist die Stichprobenschiefe. $\widehat{\gamma}_4$ ist die Pearson-Kurtosis; bei einer Normalverteilung beträgt sie 3. Der Nenner bildet ab, wie Schiefe und Kurtosis die Unsicherheit der Sharpe-Schätzung verändern.
Die Formel hängt von der verwendeten Konvention ab. Verwenden Sie Überschussrenditen mit einer einheitlichen Frequenz und berechnen Sie Sharpe und Schwelle in dieser Frequenz; auch die Kurtosis-Definition muss übereinstimmen. Annualisieren Sie nur eine der Größen, ändert sich der Vergleich. Die geläufige Formel setzt zudem Annahmen über die Abhängigkeit der Renditebeobachtungen voraus. Serielle Abhängigkeit muss gesondert behandelt werden, statt sie stillschweigend in $T$ einzubauen.
Die Schwelle für das erwartete Maximum hängt von der Kandidatenfamilie ab
Für $N$ unabhängige Sharpe-Schätzungen mit ungefähr normaler Verteilung verwenden Bailey und López de Prado eine Extremwertnäherung für das erwartete Maximum:
$$ SR_0 \approx \mu_{SR}+\sigma_{SR} \left[(1-\gamma_E)\Phi^{-1}\!\left(1-\frac{1}{N}\right) +\gamma_E\Phi^{-1}\!\left(1-\frac{1}{Ne}\right)\right] $$
$\mu_{SR}$ und $\sigma_{SR}$ bezeichnen Mittelwert und Standardabweichung der Sharpe-Schätzungen der Kandidaten; $\Phi^{-1}$ ist die Quantilfunktion der Standardnormalverteilung, $e$ die Eulersche Zahl und $\gamma_E \approx 0{,}5772$ die Euler-Mascheroni-Konstante. Der Ausdruck schätzt, wie hoch der beste Wert allein durch Auswahl im angenommenen Versuchsmodell ausfallen kann. Er ist keine allgemeingültige Schwelle für jede Strategiesuche.
Sind die Ergebnisse der Kandidaten korreliert, kann die Behandlung jeder Variante als unabhängig die effektive Zahl der Versuche überschätzen. Der Beitrag erörtert, wie sich aus der Abhängigkeit der Kandidaten eine Zahl unabhängiger Versuche schätzen lässt; auch das ist jedoch eine Modellierungsentscheidung. Korrelation ist nur eine Form von Abhängigkeit, und bei vielen Kandidaten und einer kurzen Renditehistorie kann die Schätzung instabil sein. Berichten Sie die rohe Kandidatenzahl, das Verfahren für eine etwaige effektive Zahl und die Empfindlichkeit gegenüber plausiblen Alternativen.
Ein hypothetisches Beispiel trennt Schwelle und beobachteten Sharpe
Nehmen wir eine bewusst vereinfachte Suche mit 20 unabhängigen Kandidatenstrategien an. Unter der Nullhypothese sei der Mittelwert ihrer Sharpe-Schätzungen 0 und ihre Standardabweichung 0,20 in Monatseinheiten. Die Näherung für das erwartete Maximum ergibt eine Auswahl-Schwelle von etwa $SR_0=0{,}380$ pro Monat. Diese Eingaben dienen nur als Rechenannahmen; sie sind weder Marktbeobachtungen noch eine empfohlene Schwelle.
Nun habe die ausgewählte Strategie 60 monatliche Überschussrenditen, einen geschätzten monatlichen Sharpe von 0,50, eine Stichprobenschiefe von 0 und eine Pearson-Kurtosis von 3. Der PSR-Teil vergleicht 0,50 nicht mit null, sondern mit 0,380:
$$ z=\frac{(0.50-0.380)\sqrt{59}}{\sqrt{1+((3-1)/4)(0.50)^2}} \approx 0.868,\qquad \mathrm{DSR}=\Phi(z)\approx 0.807 $$
Unter diesen vereinfachenden Annahmen beträgt der DSR rund 80,7 %. Das ist weder eine 80,7-prozentige Wahrscheinlichkeit, dass die Strategie nächsten Monat Gewinn erzielt, noch eine Prognose der nächsten Monatsrendite. Es ist die geschätzte Evidenz dafür, dass der zugrunde liegende Sharpe die gewählte Auswahl-Schwelle übersteigt – bedingt auf Modell und Eingaben. Eine andere Versuchszahl, Abhängigkeitsschätzung, Stichprobe oder Renditeverteilung kann das Ergebnis verändern.
Die Empfindlichkeit gegenüber der Streuung der Versuchsschätzungen ist erheblich. Ändert sich nur die angenommene Standardabweichung der Sharpe-Schätzungen der Kandidaten von 0,20 auf 0,10, ergibt dieselbe Suche mit 20 Versuchen eine Schwelle von etwa 0,190 und einen DSR von etwa 98,8 %. Bei einer Standardabweichung von 0,30 liegt die Schwelle bei etwa 0,570 und der DSR bei etwa 30,6 %. Der beobachtete Sharpe von 0,50, die 60 Beobachtungen, Schiefe und Kurtosis bleiben gleich. Diese hypothetische Sensitivität zeigt, warum die Methode zur Schätzung der Versuchsstreuung und der Abhängigkeit zwischen Kandidaten wichtig ist; die Werte bleiben in denselben Monatseinheiten und im selben vereinfachten Modell.
Schiefe und Kurtosis verändern die Unsicherheit, nicht nur die Beschreibung
Zwei Strategien können denselben Stichproben-Sharpe und denselben Stichprobenumfang aufweisen, aber unterschiedliche Renditeverteilungen haben. Ein ausgeprägter linker Rand, Asymmetrie oder ungewöhnlich häufige Extremwerte können die im PSR-Nenner erfasste Stichprobenunsicherheit verändern. Die Anpassung wird aus den gemessenen Momenten berechnet. Sie erklärt nicht jede nicht normale Verteilung gleichermaßen für schädlich und garantiert nicht, dass wenige Stichprobenmomente das Randverhalten vollständig erfassen.
Die Rechnung hängt auch davon ab, was als eine Beobachtung gilt. Tages-, Wochen- und Monatsdaten ergeben jeweils andere Werte für $T$, Sharpe, Schiefe und Kurtosis. Überlappende Haltedauerrenditen können benachbarte Zeilen abhängig machen. Geglättete oder veraltete Bewertungen können eine geringere Schwankung anzeigen als das zugrunde liegende ökonomische Risiko. Geben Sie Frequenz und Konstruktion der Stichprobe an, statt einen annualisierten Sharpe als ausreichende Eingabe zu behandeln.
DSR und andere Validierungsverfahren beantworten verschiedene Fragen
PBO nutzt Combinatorially Symmetric Cross-Validation und fragt, wie oft der In-Sample-Sieger auf ergänzenden Blöcken höchstens den Median der Kandidaten erreicht. DSR schätzt, ob ein ausgewählter Sharpe eine um Suche und Nichtnormalität bereinigte Schwelle übersteigt. Die Ergebnisse und Resampling-Annahmen unterscheiden sich; das eine Verfahren kann das andere nicht ersetzen. Lesen Sie dazu auch die Leitfäden zu PBO und CSCV und zu Mehrfachtests im Finanzwesen. Bailey und Mitautoren formalisieren diese Selektionsdiagnose in ihrer ursprünglichen PBO-Arbeit.
Whites Reality Check verwendet einen Bootstrap, um zu prüfen, ob die beste Regel einer Kandidatenfamilie nach Berücksichtigung von Data Snooping eine festgelegte Benchmark übertrifft. Dabei steht der Vergleich mit der Benchmark im Mittelpunkt; DSR verwendet eine Sharpe-Schwelle. Ein chronologischer Walk-forward-Test oder ein abschließender Holdout fragt, wie sich ein eingefrorener Prozess in späteren Zeiträumen verhält. Die Verfahren ergänzen sich, weil sie unterschiedliche Teile der Forschungsbehauptung prüfen. Das Verfahren wird in Whites ursprünglicher Arbeit zum Reality Check beschrieben.
Berichten Sie Suchprotokoll und Annahmen zusammen mit dem DSR
Ein nachvollziehbarer Bericht nennt das Kandidatenuniversum, alle dokumentierten Entscheidungen, die die Auswahl beeinflussten, die rohe Versuchszahl, ein etwaiges Verfahren zur effektiven Versuchszahl, Renditeserie, Stichprobenumfang und Frequenz, Sharpe-Definition, Schiefe, Kurtosis-Konvention sowie Auswahl-Schwelle. Geben Sie an, ob Renditen vor oder nach Spread, Provisionen, Markteinfluss, Funding, Leihkosten und sonstigen Kosten berechnet wurden. Zeigen Sie beobachteten Sharpe und DSR gemeinsam, damit sichtbar wird, was sich durch die Auswahlkorrektur verändert.
Die übliche Formel setzt ein Stichprobenmodell voraus, das bei seriell korrelierten Beobachtungen ungeeignet sein kann. Los Arbeit zu Sharpe-Ratio-Statistiken erläutert, warum Zeitaggregation und Abhängigkeit die Sharpe-Inferenz beeinflussen. Überlappen Renditen oder zeigen sie serielle Korrelation, verwenden Sie ein Inferenzverfahren, das diese Struktur berücksichtigt, und legen Sie dessen Annahmen offen. Einen Monats-Sharpe mit $\sqrt{12}$ zu multiplizieren korrigiert keine Autokorrelation. Für eine zeitbewusste Bewertung siehe auch den Leitfaden zu expanding und rolling Walk-forward-Fenstern.
DSR kann keine undokumentierte Suche aufdecken, Look-ahead-Leakage entfernen, Survivorship-Bias-Daten repräsentativ machen, Ausführungen validieren, Kapazität schätzen oder Stabilität in einem neuen Marktregime garantieren. Er ersetzt weder ökonomische Begründung noch spätere chronologische Evidenz. Behandeln Sie DSR als eine dokumentierte Diagnose innerhalb eines Forschungsprozesses und halten Sie Kandidatenverlauf und Datenpipeline reproduzierbar.
Häufige Fragen
Q1Ist der Deflated Sharpe Ratio eine Sharpe Ratio, von der eine Strafe abgezogen wurde?
Nein. DSR ist eine probabilistische Kennzahl, die den ausgewählten Sharpe, eine um die Auswahl bereinigte Schwelle, Stichprobenumfang, Schiefe und Kurtosis berücksichtigt. Der berichtete Sharpe-Punktschätzer wird nicht mechanisch abgezinst und durch eine neue Ratio ersetzt.
Q2Sollte ich jede Parameterkombination als unabhängigen Versuch zählen?
Nein. Ähnliche Kandidaten können korrelierte Renditen aufweisen. Daher muss die rohe Größe des Gitters nicht der effektiven Zahl unabhängiger Chancen auf einen hohen Schätzwert entsprechen. Bewahren Sie das vollständige Suchprotokoll auf und legen Sie Verfahren und Unsicherheit der Abhängigkeitsschätzung offen.
Q3Beweist ein hoher DSR, dass eine Handelsstrategie funktionieren wird?
Nein. DSR hängt von Kandidatenfamilie, Daten, Renditekonstruktion, Versuchsannahmen und Stichprobenmodell ab. Er korrigiert weder ausgelassene Experimente noch Ausführungsfehler, Leakage, Regimewechsel oder Unsicherheit über die Zukunft.
Quellen und weiterführende Lektüre
Problem melden
Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden
Schnelltest
Fertig gelesen? Prüfe dich mit 3 Fragen
Frage 01
Was ändert sich, wenn eine Probabilistic-Sharpe-Berechnung als Grundlage für DSR dient?
Wähle eine Antwort, um die Erklärung zu sehen