White’s Reality Check voor data snooping in strategiebacktests
Lees hoe White’s Reality Check na het zoeken naar kandidaten de beste strategie vergelijkt met een benchmark via het maximum van een bootstrap die afhankelijkheid behoudt
In deze gidsDe toets vraagt of de zoekwinnaar een gekozen benchmark verslaat
Korte samenvatting
White’s Reality Check onderzoekt of de best presterende kandidaat uit een vastgelegde zoekfamilie een opgegeven benchmark verslaat, rekening houdend met het feit dat deze kandidaat als maximum is geselecteerd. De toets bootstrapt de gezamenlijke, tijdsafhankelijke prestatieverschillen en vergelijkt het waargenomen maximum met een nulverdeling van bootstrapmaxima. Een kleine aangepaste p-waarde is bewijs tegen de gezamenlijke nulhypothese van geen superioriteit binnen die familie en tegenover die benchmark; het is geen voorspelling van winstgevendheid in livehandel.
De toets vraagt of de zoekwinnaar een gekozen benchmark verslaat
Een onderzoeker kan tientallen vensters voor voortschrijdende gemiddelden, uitbraakregels, aanhoudperioden, markten en filters proberen en daarna de strategie met de hoogste backtestscore rapporteren. Die winnaar is geen gewone kandidaat op zichzelf: de zoektocht gaf de strategie veel kansen om uitzonderlijk goed te lijken. De winnaar testen alsof die vooraf was gekozen, negeert die selectie.
White’s Reality Check neemt de selectie mee in de toets. De vraag is of een kandidaat uit de onderzochte familie een hogere verwachte prestatie heeft dan een gedefinieerde benchmark. White formuleert de nulhypothese als de doorsnede van eenzijdige vergelijkingen: de verwachte prestatie van iedere kandidaat ten opzichte van de benchmark is hoogstens nul. De alternatieve hypothese is dat ten minste één kandidaat een positief verwacht voordeel heeft. De benchmark kan buy-and-hold zijn, een eenvoudige voorspelregel of een andere vergelijkingsregel. De definitie moet aansluiten op de onderzoeksvraag en vaststaan voordat de uitkomst wordt bekeken. Zie de formele opzet in Whites oorspronkelijke artikel.
Dit is een vraag over de hele familie, geen garantie over de strategie die toevallig wint. Verwerping van de nulhypothese betekent dat de geregistreerde familie, onder de gekozen toetsingsgrootheid en aannames, aanwijzingen voor superioriteit bevat. Het bewijst niet dat elke kandidaat nuttig is, dat de winnaar de beste blijft of dat het voordeel een nieuw marktregime overleeft.
Druk iedere kandidaat uit als een vergelijkbaar prestatieverschil
Laat d[k,t] de prestatie van kandidaat k minus die van de benchmark in dezelfde periode t zijn; een hogere waarde moet steeds gunstiger zijn voor de kandidaat. Bij een rendementsvergelijking kan dit het netto rendement van de kandidaat minus het netto rendement van de benchmark zijn. Gaat het om voorspellingsverlies, gebruik dan benchmarkverlies minus kandidaatverlies. De tekenconventie moet een positieve waarde altijd als voordeel voor de kandidaat aanduiden.
Elke rij moet voor alle kandidaten naar hetzelfde tijdsinterval verwijzen. Gebruik één valuta, rendementsdefinitie, financieringsbehandeling en kostenbeleid. Als de claim betrekking heeft op uitvoerbare strategierendementen, trek dan relevante provisies, spreads, slippage, funding en leenkosten af voordat je d[k,t] berekent. Bruto rendementen toetsen en kosten alleen in een voetnoot noemen, beantwoordt een andere vraag.
Het steekproefgemiddelde voor kandidaat k is d̄[k] = (1/T) Σ_t d[k,t]. De gezamenlijke nulhypothese luidt H0: max_k E[d[k,t]] ≤ 0; het alternatief is H1: max_k E[d[k,t]] > 0. De benchmark is gemeenschappelijk voor de kandidatenfamilie en iedereen wordt met hetzelfde criterium beoordeeld. Verschillen ontbrekende datums of waarnemingsfrequenties, bepaal dan vóór de berekening een verdedigbare gemeenschappelijke steekproef. Geef een kandidaat niet ongemerkt een gunstiger tijdvenster.
Neem de volledige kandidatenfamilie op in de onderzoeksclaim
De familie bestaat uit kandidaatregels die de gerapporteerde winnaar konden beïnvloeden. Denk aan geteste terugkijkperioden, instapdrempels, combinaties van signalen, beleggingsuniversums, aanhoudperioden, portfoliobeperkingen en uitvoeringsaannames. Ook handmatige varianten die na inzage in de uitkomsten zijn verworpen, horen erbij. White gebruikt „specification search” in zijn artikel uit 2000 in brede zin: het keuzeproces, en niet alleen de uiteindelijke tabel, veroorzaakt het selectieprobleem.
Er zijn twee tegengestelde fouten. Proeven weglaten die hielpen de gerapporteerde strategie te kiezen, maakt de aangepaste toets te optimistisch: de bootstrap ziet een kleinere zoekruimte dan er werkelijk was. Achteraf veel willekeurige, niet-gerelateerde regels toevoegen kan de toets onnodig conservatief maken en het vermogen verminderen om een bruikbare kandidaat te vinden. Bepaal de familie op basis van het werkelijke selectieproces en bewaar een onderzoekslogboek waarmee de afbakening te controleren is.
De toets kan niet raden welke experimenten nooit zijn vastgelegd. Een notitieboek met alleen de winnende parameters is onvoldoende om de zoektocht te reconstrueren. Bewaar het kandidatenregister, de dataversie, evaluatiedatums, doelmaat, kostenaannames en selectiebeslissingen bij elkaar. Is de familie na inzage in resultaten gewijzigd, vermeld dan wat en waarom; presenteer een achteraf samengestelde familie niet alsof die vooraf vaststond.
De maximumstatistiek neemt de selectie mee in de nulverdeling
Bereken voor iedere kandidaat het gemiddelde relatieve rendement en neem daarvan het maximum. Een gebruikelijke niet-gestudentiseerde statistiek is Vobs = √T × max_k d̄[k]. Het maximum is belangrijk: het stelt dezelfde handeling voor als het proces „kies de beste” waarmee de schijnbare winnaar is gevonden. Alleen de winnende kolom toetsen zou die selectie uit de referentieverdeling weglaten.
De bootstrap benadert hoe groot een maximum door steekproefvariatie kan worden als de gezamenlijke nul van geen superioriteit waar is. Trek bij bootstrapreplicatie b de tijdreeks van verschillen voor alle kandidaten opnieuw en bereken bijvoorbeeld de gecentreerde statistiek V*b = √T × max_k(d̄*[k,b] − d̄[k]). Door te centreren liggen de kandidaatgemiddelden op de minst gunstige grens van de nulhypothese, waar verwachte voordelen nul zijn. Het maximum houdt de selectie uit de kandidatenfamilie in stand. Whites artikel ontwikkelt de bootstrapverdeling van dit maximum en vergelijkt die met de waargenomen statistiek.
Herhaal dit vaak. De aangepaste p-waarde is het aandeel bootstrapmaxima dat minstens zo groot is als Vobs. Bij B trekkingen is (1 + count{V*b ≥ Vobs})/(B + 1) een gangbare Monte-Carloschatting. Implementaties kunnen verschillen in studentisering of de behandeling van geschatte modellen. Leg daarom de statistiek en de centrering onder de nulhypothese vast. Iedere bootstrapreplicatie moet het maximum van de volledige familie opnieuw berekenen, niet alleen de waargenomen winnaar beoordelen.
Behoud afhankelijkheid bij het resamplen van de kandidaatgeschiedenis
Financiële waarnemingen staan in tijdsvolgorde. Onafhankelijk schudden kan seriële afhankelijkheid, volatiliteitsclusters en reeksen van gecorreleerde winsten of verliezen wissen. Ook kan het de relatie vertekenen tussen strategieën die op dezelfde marktdagen reageren. Deze kenmerken beïnvloeden de staart van de maximumstatistiek. Kandidaten afzonderlijk resamplen of losse dagen met teruglegging trekken, kan daardoor een verkeerde referentieverdeling opleveren.
White beschrijft methoden voor afhankelijke data, zoals de moving-block-bootstrap, en bespreekt de stationaire bootstrap van Politis en Romano. Bij die laatste loopt een getrokken blok meestal door naar de volgende tijdwaarneming; bij een willekeurige herstart begint het op een andere getrokken datum. De bloklengten volgen daardoor een geometrische verdeling met een gekozen gemiddelde. Onder de aannames en instellingen van de methode blijven korte opeenvolgingen beter behouden dan bij een i.i.d.-steekproef. Zie Politis en Romano over de stationaire bootstrap.
Trek voor een strategiefamilie één gedeelde reeks tijdsindexen en pas die toe op de volledige rijvector (d[1,t], …, d[K,t]). Zo blijven zowel de tijdsvolgorde binnen de blokken als de gelijktijdige afhankelijkheid tussen kandidaten behouden. Kies de bloklengte aan de hand van de strategiehorizon en afhankelijkheidsdiagnostiek, en rapporteer hoe gevoelig de uitkomst is voor redelijke alternatieven. Als het onderzoeksproces parameters opnieuw schat, bepaal dan of die stap deel uitmaakt van de inferentievraag en herhaal die in elke resampling wanneer nodig. Alleen vaste, vooraf geschatte rendementen resamplen kan een deel van het te toetsen proces buiten beschouwing laten.
Een hypothetisch bootstrapvoorbeeld verandert de interpretatie
Stel dat een onderzoeker drie strategieën met een benchmark vergelijkt over T = 252 handelsdagen. Hun gemiddelde dagelijkse prestatieverschillen na kosten zijn +2.0, +1.0 en −0.5 basispunten. De gemiddelde differentie van de winnaar is dus 2.0 basispunten en de waargenomen statistiek is √252 × 2.0 bp ≈ 31.75 bp·√handelsdag. Deze schaling hoort bij de toetsingsgrootheid; dit is geen t-statistiek, want er wordt niet gedeeld door een geschatte standaardfout.
Stel vervolgens dat 9.999 stationaire-bootstrapreplicaties voor alle drie kandidaten dezelfde getrokken datums gebruiken. In deze hypothetische uitkomst zijn 1.199 replicatiemaxima minstens 31,75. De Monte-Carloschatting met plus-ééncorrectie is (1 + 1,199)/(9,999 + 1) = 0.12. Een aparte toets van alleen de winnaar zou hypothetisch 0.03 kunnen opleveren, maar laat de zoektocht tussen drie kandidaten buiten beschouwing. De Reality Check-p-waarde vergelijkt de volledige familie en verwerpt in dit voorbeeld de gezamenlijke nul niet bij een grens van 5%.
Deze getallen zijn verzonnen om de berekening te tonen; het zijn geen gemeten marktprestaties en geen resultaten uit Whites artikel. Een p-waarde van 0.12 betekent niet dat de strategie 12% kans heeft om verlies te maken. Onder de opgegeven bootstrap en nulconstructie is een minstens zo groot maximum niet zeldzaam genoeg om op het gekozen niveau te verwerpen. De steekproefgemiddelden laten ook niet zien of het rendement na risico, capaciteit en uitvoering economisch betekenisvol is.
Lees de aangepaste p-waarde als bewijs voor een afgebakende familie
Een kleine Reality Check-p-waarde is bewijs tegen de bewering dat geen enkel lid van de opgenomen familie de gekozen benchmark in verwachte prestatie verslaat, onder de aannames van de toets. Omdat de nul gezamenlijk is, wijst de toets niet automatisch aan welke kandidaat een duurzaam voordeel heeft. De identiteit van de winnaar kan per steekproef veranderen en het bewijs voor één strategie kan zwak zijn, zelfs wanneer een familietoets de nul verwerpt.
Een grote p-waarde is het niet-verwerpen van de nul, geen bewijs dat alle strategieën gelijkwaardig zijn aan de benchmark. Een korte steekproef, ruisende prestaties, een brede kandidatenfamilie, onnauwkeurige metingen of weinig toetsingsvermogen kunnen de uitkomst verklaren. De p-waarde is evenmin de kans dat de nulhypothese waar is. Het is een staartkans onder een referentieverdeling die afhangt van de kandidaten, prestatiemaatstaf, benchmark, bootstrapopzet en waargenomen data.
White stelt een relatieve vraag. Een regel kan een zwakke benchmark verslaan en toch geld verliezen; een regel kan achterblijven bij een sterke benchmark en toch positief rendement opleveren. Rapporteer absolute en benchmarkrelatieve resultaten samen met onzekerheid, turnover, drawdown, capaciteit en realistische kosten. Statistische aanwijzingen voor relatieve voorspellende superioriteit en een economisch investeringsargument zijn afzonderlijke beslissingen.
Controleer aannames en beperkingen voordat je de uitkomst gebruikt
De oorspronkelijke theorie veronderstelt regelmatigheidsvoorwaarden voor het proces van prestatieverschillen en de limietverdeling. Whites opzet omvat stationaire, sterk mengende tijdreeksen; ook de afhankelijke bootstrap vereist een geschikte reeks bloklengten. In een eindige steekproef kunnen regimewisselingen, structurele breuken, langetermijnafhankelijkheid, zeldzame sprongen en instabiele volatiliteit de stationaire benadering twijfelachtig maken. Een block-bootstrap behoudt een deel van de lokale afhankelijkheid, maar bootst geen onbekend toekomstig regime na.
De toets erft fouten in de data en evaluatie van de strategie. Look-ahead-lekkage, survivorship bias, herziene data, onrealistische fills, ontbrekende kosten, onjuiste verwerking van corporate actions en een benchmark die na inzage in de uitkomsten is gekozen, kunnen de prestatieverschillen ongeldig maken. Bij overlappende aanhoudperioden kunnen rendementen van nature afhankelijk zijn; de resamplingeenheid en bloklengte moeten die afhankelijkheid kunnen weergeven. Is de uiteindelijke maatstaf niet-lineair, zoals de Sharpe-ratio, bereken die dan in elke replicatie opnieuw in plaats van aan te nemen dat een bootstrap van gemiddelde rendementen die maatstaf automatisch toetst.
Reality Check-implementaties kunnen conservatief zijn, vooral wanneer een grote kandidatenfamilie veel duidelijk zwakke alternatieven bevat. Een brede maximumverdeling kan verwerping moeilijk maken, ook wanneer er een goede kandidaat is. Hansens Superior Predictive Ability-toets is een verwante bootstrapmethode die zwakke alternatieven anders behandelt. Het is geen universele vervanging; ook de aannames ervan moeten worden nagegaan. Vergelijk methoden op basis van de onderzoeksvraag en rapporteer gevoeligheid, in plaats van de methode te kiezen die de gewenste uitkomst oplevert.
Gebruik de toets naast chronologische validatie en andere selectiemethoden
White’s Reality Check onderzoekt of een geregistreerde zoekfamilie, na correctie voor selectie, een kandidaat bevat die de benchmark relatief overtreft. Het vervangt geen chronologische holdout of walk-forward-evaluatie van een vastgezette strategie. Het lost overlappende labels of datalekken niet vanzelf op. Ook verschilt het van PBO, dat samenvat hoe vaak een in-samplewinnaar bij combinatorische splitsingen lager dan de mediaan van de kandidaten rangschikt; de oorspronkelijke PBO-publicatie formaliseert die diagnose van selectierisico. Procedures voor false discovery richten zich op het verwachte foutieve aandeel onder meerdere verwerpingen. De Deflated Sharpe Ratio past juist een Sharpe-gebaseerde significantiebeoordeling aan voor selectie en niet-normale rendementen. Lees verder over multiple testing en false discovery in finance, PBO en CSCV, walk-forward-validatie en purged cross-validation en embargo.
Een praktische controle zet eerst benchmark en prestatiebegrip vast, reconstrueert de werkelijke kandidatenfamilie, berekent gepaarde verschillen per periode, kiest en motiveert een resamplingontwerp dat afhankelijkheid behoudt, en rapporteert het maximum en de bootstrapstaartkans. Test daarna het vastgezette selectieproces op latere chronologische data en beoordeel kosten en uitvoerbaarheid afzonderlijk. De toepassing op technische handelsregels door Sullivan, Timmermann en White laat zien waarom het regeluniversum ertoe doet: de conclusie kan veranderen wanneer de volledige zoektocht en niet alleen de gerapporteerde winnaar in de inferentie wordt meegenomen. Reality Check corrigeert een specifiek selectieprobleem; het is geen certificaat dat een backtest livehandel zal doorstaan.
Veelgestelde vragen
Q1Wat toetst White’s Reality Check?
De toets onderzoekt of de beste kandidaat uit een gedefinieerde zoekfamilie een hogere verwachte prestatie heeft dan een gekozen benchmark, met correctie voor de selectie uit meerdere kandidaten.
Q2Bewijst een kleine Reality Check-p-waarde dat een strategie winstgevend wordt?
Nee. Zij is bewijs tegen de nulhypothese van geen superioriteit op familieniveau, onder de gekozen benchmark, maatstaf, data en bootstrapaannames. Ze garandeert geen toekomstige rendementen of nettowinstgevendheid.
Q3Waarom een block-bootstrap gebruiken in plaats van dagen onafhankelijk te resamplen?
Blokken kunnen een deel van de lokale seriële afhankelijkheid behouden. Dezelfde getrokken datums voor alle kandidaten behouden ook hun gelijktijdige relaties. Het blokontwerp moet nog steeds passen bij de data en onderzoeksvraag.
Bronnen en verder lezen
Probleem melden
We bereiden een e-mail met de link naar dit artikel voor. Mark ontvangt je melding pas nadat je die verstuurt
Snelle check
De gids gelezen? Test jezelf met 3 vragen
Vraag 01
Wat zegt Whites gezamenlijke nulhypothese?
Kies een antwoord om de uitleg te zien
Optiewoordenlijst
Heldere definities van belangrijke optiebegrippen, van calls, puts en optieketens tot IV, Greeks, open interest en max pain
Bekijk de optiewoordenlijst