Skip to content
Alle optiegidsen
Kwantitatief onderzoek12 min leestijd

Deflated Sharpe Ratio uitgelegd: meerdere tests en backtestselectie

Lees hoe de Deflated Sharpe Ratio de statistische onderbouwing van een Sharpe na strategiekeuze aanpast voor meerdere tests en niet-normale rendementen, met een hypothetisch rekenvoorbeeld en duidelijke beperkingen.

In deze gidsDSR verhoogt de Sharpe-drempel na een zoekproces

Korte samenvatting

De Deflated Sharpe Ratio (DSR) vraagt of de geschatte Sharpe van een gekozen strategie een drempel overschrijdt die zowel de zoektocht tussen alternatieven als de vorm van de rendementsverdeling weerspiegelt. De methode past een probabilistische Sharpe-berekening toe op een voor selectie aangepaste vergelijkingswaarde. DSR is een voorwaardelijke statistische diagnose: een backtest wordt er geen bewijs voor toekomstige winst door, en ontbrekende tests, onrealistische kosten of tijdreekslekkage worden er niet mee hersteld.

DSR verhoogt de Sharpe-drempel na een zoekproces

Een onderzoeker kan veel signaaldefinities, terugkijkperioden, instapdrempels, universums, houdperioden en kostenveronderstellingen testen en vervolgens de variant met de hoogste Sharpe-ratio rapporteren. Zelfs als geen enkele kandidaat echte voorspellende vaardigheid heeft, variëren de schattingen door steekproefruis. Hoe breder de zoektocht, hoe hoger de maximale schatting doorgaans uitvalt. Een geselecteerd resultaat is daarom iets anders dan de beoordeling van één strategie die vóór inzage in de data is vastgelegd.

De Deflated Sharpe Ratio, voorgesteld door Bailey en López de Prado, pakt twee bronnen van vertekening in een geselecteerde Sharpe aan: meervoudig toetsen en niet-normale rendementen. Meervoudig toetsen verhoogt de drempel die een resultaat moet halen; niet-normaliteit verandert de geschatte onzekerheid van de Sharpe. Het oorspronkelijke artikel beschrijft DSR als een Probabilistic Sharpe Ratio, berekend ten opzichte van een voor selectie aangepaste drempel. Het oorspronkelijke artikel licht de afleiding en de schatting van het aantal pogingen toe.

Deze formulering voorkomt een veelvoorkomende misvatting. DSR trekt niet mechanisch een vaste straf af van de gerapporteerde Sharpe om zo een nieuwe rendementsratio te maken. De methode schat hoe sterk de waargenomen Sharpe een drempel overschrijdt die samenhangt met de zoekruimte, de steekproefomvang en de momenten van de rendementen. De puntschatting van de Sharpe kan onveranderd blijven terwijl DSR daalt omdat het bewijs zwakker is. Zie voor de betekenis van de Sharpe zelf ook Sharpes oorspronkelijke uitleg.

De beste van veel ruisgevoelige schattingen is vaak uitzonderlijk hoog

Stel dat alle geteste regels dezelfde werkelijke Sharpe hebben, maar dat elke schatting varieert doordat die op een beperkte steekproef berust. Wie de hoogste schatting kiest, kiest daarmee ook een gunstige meetfout. Dat is de winner’s curse: bij nieuwe gegevens zal de gekozen schatting naar verwachting terugvallen in de richting van de gebruikelijke groepswaarde.

Niet alleen het aantal pogingen telt, maar ook hoe verschillend de schattingen zijn. Als kandidaten vrijwel dezelfde rendementen opleveren, bewegen hun geschatte Sharpes sterk samen. Ze bieden dan minder onafhankelijke kansen op een toevallig hoog maximum dan een even grote groep niet-verwante kandidaten. Het aantal regels in een parameterraster is dus niet automatisch het aantal onafhankelijke pogingen.

Het zoeklogboek kan ook keuzes buiten een formeel raster omvatten: een handmatig gewijzigde drempel, een weggelaten markt of een herziene kostenaanname die bepaalde welke uitkomst overbleef. Een DSR die alleen op de definitieve kandidaten is gebaseerd, kan geen rekening houden met experimenten die niet zijn vastgelegd of als invoer zijn opgegeven.

De Probabilistic Sharpe Ratio berekent steekproefonzekerheid

De Probabilistic Sharpe Ratio (PSR) schat of een Sharpe op basis van de steekproef een gekozen vergelijkingswaarde overschrijdt, rekening houdend met het aantal rendementswaarnemingen en de geschatte scheefheid en kurtosis. DSR gebruikt dezelfde basisberekening, maar kiest een vergelijkingswaarde die het verwachte maximale Sharpe-resultaat uit het zoekproces weerspiegelt.

Voor een gangbare PSR-benadering is de voor selectie aangepaste berekening:

$$ \mathrm{DSR}=\Phi\!\left( \frac{(\widehat{SR}-SR_0)\sqrt{T-1}} {\sqrt{1-\widehat{\gamma}_3\widehat{SR} +\frac{\widehat{\gamma}_4-1}{4}\widehat{SR}^{\,2}}} \right) $$

Hier is $\Phi$ de cumulatieve verdelingsfunctie van de standaardnormale verdeling, $\widehat{SR}$ de waargenomen Sharpe per rendementswaarneming, $SR_0$ de voor selectie aangepaste drempel in dezelfde eenheden en $T$ het aantal waarnemingen. $\widehat{\gamma}_3$ is de steekproefscheefheid en $\widehat{\gamma}_4$ de Pearson-kurtosis, die bij een normale verdeling 3 is. De noemer weerspiegelt hoe scheefheid en kurtosis de onzekerheid van de Sharpe-schatting veranderen.

De uitdrukking hangt af van de gekozen conventies. Gebruik excessrendementen met één frequentie en bereken de Sharpe en de drempel op diezelfde frequentie; definieer kurtosis ook consistent. Als slechts één grootheid wordt geannualiseerd, verandert de vergelijking. De gangbare formule veronderstelt bovendien iets over de afhankelijkheid tussen rendementswaarnemingen. Seriële afhankelijkheid moet apart worden behandeld, niet stilzwijgend in $T$ worden verwerkt.

De drempel voor het verwachte maximum hangt af van de kandidatengroep

Voor $N$ onafhankelijke Sharpe-schattingen met een ongeveer normale verdeling gebruiken Bailey en López de Prado een benadering uit de extreme-waardetheorie voor het verwachte maximum:

$$ SR_0 \approx \mu_{SR}+\sigma_{SR} \left[(1-\gamma_E)\Phi^{-1}\!\left(1-\frac{1}{N}\right) +\gamma_E\Phi^{-1}\!\left(1-\frac{1}{Ne}\right)\right] $$

$\mu_{SR}$ en $\sigma_{SR}$ zijn het gemiddelde en de standaardafwijking van de Sharpe-schattingen van de kandidaten; $\Phi^{-1}$ is de kwantielfunctie van de standaardnormale verdeling, $e$ het getal van Euler en $\gamma_E \approx 0,5772$ de constante van Euler-Mascheroni. De uitdrukking schat hoe hoog de beste schatting uitsluitend door selectie kan uitkomen onder het gekozen pogingenmodel. Het is geen universele drempel voor elke strategieselectie.

Als kandidaatresultaten gecorreleerd zijn, kan de effectieve hoeveelheid pogingen worden overschat wanneer elke variant als onafhankelijk wordt behandeld. Het artikel bespreekt hoe je op basis van de afhankelijkheid tussen kandidaten het aantal onafhankelijke pogingen kunt schatten, maar ook die schatting is een modelkeuze. Correlatie is maar één vorm van afhankelijkheid, en een schatting met veel kandidaten en een korte rendementsreeks kan instabiel zijn. Rapporteer het ruwe aantal kandidaten, de methode voor een eventueel effectief aantal en de gevoeligheid voor plausibele alternatieven.

Een hypothetische berekening scheidt drempel en waargenomen Sharpe

Neem een bewust vereenvoudigde zoektocht met 20 onafhankelijke kandidaatstrategieën. Onder de nulhypothese nemen we een gemiddelde Sharpe-schatting van 0 en een standaardafwijking van 0,20 in maandelijkse eenheden aan. De benadering van het verwachte maximum geeft een selectiedrempel van ongeveer $SR_0=0,380$ per maand. Dit zijn aannames om de berekening te laten zien, geen marktwaarnemingen of aanbevolen benchmark.

Stel vervolgens dat één geselecteerde strategie 60 maandelijkse waarnemingen van excessrendement heeft, een geschatte maandelijkse Sharpe van 0,50, een steekproefscheefheid van 0 en een Pearson-kurtosis van 3. De PSR-component vergelijkt 0,50 met 0,380, niet met nul:

$$ z=\frac{(0.50-0.380)\sqrt{59}}{\sqrt{1+((3-1)/4)(0.50)^2}} \approx 0.868,\qquad \mathrm{DSR}=\Phi(z)\approx 0.807 $$

Onder deze vereenvoudigde aannames komt de DSR uit op ongeveer 80,7%. Dat betekent niet dat er 80,7% kans is dat de strategie volgende maand winst maakt en het is geen voorspelling van het rendement voor volgende maand. Het is de geschatte statistische onderbouwing dat de onderliggende Sharpe de gekozen selectiedrempel overschrijdt, gegeven het model en de invoer. Een ander aantal pogingen, een andere afhankelijkheidsschatting, steekproef of rendementsverdeling kan de uitkomst veranderen.

De gevoeligheid voor de spreiding van de schattingen tussen pogingen is groot. Als alleen de veronderstelde standaardafwijking van de Sharpe-schattingen van kandidaten verandert van 0,20 in 0,10, geeft dezelfde zoekactie van 20 pogingen een drempel van circa 0,190 en een DSR van circa 98,8%. Bij een standaardafwijking van 0,30 zijn de drempel ongeveer 0,570 en de DSR circa 30,6%. De waargenomen Sharpe van 0,50, de 60 waarnemingen, scheefheid en kurtosis blijven gelijk. Deze hypothetische gevoeligheid laat zien waarom de methode om de spreiding en afhankelijkheid tussen kandidaten te schatten van belang is; alle waarden blijven in dezelfde maandelijkse eenheden en hetzelfde vereenvoudigde model.

Scheefheid en kurtosis veranderen de onzekerheid, niet alleen het verhaal

Twee strategieën kunnen dezelfde steekproef-Sharpe en dezelfde steekproefomvang hebben, maar toch verschillende rendementsverdelingen. Een uitgesproken linkerstaart, asymmetrie of ongewoon frequente extreme waarnemingen kan de steekproefonzekerheid in de PSR-noemer veranderen. De aanpassing komt uit de gemeten momenten; ze bestempelt niet elke niet-normale verdeling als even schadelijk en garandeert niet dat enkele steekproefmomenten het staartgedrag volledig beschrijven.

De berekening hangt ook af van wat als één waarneming geldt. Dagelijkse, wekelijkse en maandelijkse data geven verschillende waarden voor $T$, Sharpe, scheefheid en kurtosis. Rendementen over overlappende houdperioden kunnen naburige rijen afhankelijk maken. Afgevlakte of verouderde waarderingen kunnen minder variabel lijken dan het onderliggende economische risico. Beschrijf de frequentie en opbouw van de steekproef in plaats van de geannualiseerde Sharpe als voldoende invoer te behandelen.

DSR en andere validatiemethoden beantwoorden verschillende vragen

PBO gebruikt Combinatorially Symmetric Cross-Validation om te vragen hoe vaak de in-samplewinnaar op complementaire blokken op of onder de mediaan van de kandidaten eindigt. DSR schat of een geselecteerde Sharpe een drempel overschrijdt die is aangepast voor de zoekactie en niet-normaliteit. De uitkomsten en aannames voor hersteekproeven verschillen; de ene methode kan de andere niet vervangen. Bekijk ook de gidsen over PBO en CSCV en meervoudig toetsen in financiën. Bailey en coauteurs formaliseren deze selectiediagnose in hun oorspronkelijke PBO-artikel.

White’s Reality Check gebruikt een bootstrap om te toetsen of de beste regel in een kandidatengroep een opgegeven benchmark verslaat, rekening houdend met data snooping. Die vraag draait om vergelijking met een benchmark; DSR gebruikt een Sharpe-drempel. Een chronologische walk-forward- of finale holdout-evaluatie vraagt hoe een bevroren proces in latere perioden werkt. De methoden kunnen elkaar aanvullen omdat ze verschillende delen van de onderzoeksvraag beoordelen. White beschrijft de methode in zijn oorspronkelijke artikel over de Reality Check.

Rapporteer de zoekactie en aannames bij de DSR

Een reproduceerbaar verslag vermeldt het kandidaatuniversum, alle vastgelegde keuzes die de selectie beïnvloedden, het ruwe aantal pogingen, de methode voor een eventueel effectief aantal, de rendementsreeks, steekproefomvang en frequentie, de Sharpe-definitie, scheefheid, de kurtosisconventie en de voor selectie aangepaste drempel. Geef aan of rendementen bruto zijn of netto van spread, commissies, marktimpact, funding, leenlasten en overige kosten. Toon de waargenomen Sharpe en DSR samen, zodat lezers kunnen zien wat er veranderde.

De gebruikelijke formule veronderstelt een steekproefmodel dat mogelijk niet past bij serieel gecorreleerde waarnemingen. Lo’s onderzoek naar Sharpe-ratiostatistiek legt uit waarom tijdaggregatie en afhankelijkheid van invloed zijn op Sharpe-inferentie. Als rendementen overlappen of seriële correlatie vertonen, gebruik dan een inferentieprocedure die met die structuur rekening houdt en licht de aannames toe. Een maandelijkse Sharpe vermenigvuldigen met $\sqrt{12}$ corrigeert geen autocorrelatie. Zie voor een tijdsgebonden evaluatie ook de gids over expanding en rolling walk-forward-vensters.

DSR kan geen ongedocumenteerde zoekactie ontdekken, look-ahead-lekkage verwijderen, data met survivorship bias representatief maken, uitvoeringen valideren, capaciteit schatten of stabiliteit in een nieuw regime garanderen. Het vervangt ook geen economische onderbouwing of later chronologisch bewijs. Behandel DSR als één gedocumenteerde diagnose binnen een onderzoeksproces en houd het kandidatenlogboek en de datapijplijn reproduceerbaar.

Veelgestelde vragen

Q1Is de Deflated Sharpe Ratio een Sharpe-ratio waar een straf vanaf is getrokken?

Nee. DSR is een probabilistische statistiek op basis van de geselecteerde Sharpe, een voor selectie aangepaste drempel, de steekproefomvang, scheefheid en kurtosis. De gerapporteerde puntschatting van de Sharpe wordt niet vervangen door een mechanisch verlaagde ratio.

Q2Moet ik elke parametercombinatie als een onafhankelijke poging tellen?

Nee. Vergelijkbare kandidaten kunnen gecorreleerde rendementen hebben, zodat de ruwe rasteromvang niet gelijk hoeft te zijn aan het effectieve aantal onafhankelijke kansen om een hoge schatting te kiezen. Bewaar het volledige zoeklogboek en vermeld de methode voor afhankelijkheid en de onzekerheid daarvan.

Q3Bewijst een hoge DSR dat een handelsstrategie zal werken?

Nee. DSR is voorwaardelijk op de kandidatengroep, data, rendementsconstructie, aannames over pogingen en het steekproefmodel. De methode corrigeert geen ontbrekende experimenten, uitvoeringsfouten, lekkage, regimeverandering of onzekerheid over de toekomst.

Bronnen en verder lezen

Probleem melden

We bereiden een e-mail met de link naar dit artikel voor. Mark ontvangt je melding pas nadat je die verstuurt

Snelle check

De gids gelezen? Test jezelf met 3 vragen

Vraag 1 / 3

Vraag 01

Wat verandert er als een Probabilistic-Sharpe-berekening de basis vormt voor DSR?

Kies een antwoord om de uitleg te zien

Optiewoordenlijst