Skip to content
Alle optiegidsen
Twee bootstraptoetsen voor een hele familie handelsregels15 min. leestijd

White Reality Check en Hansen SPA voor handelsregels

Lees hoe Reality Check en Hansen SPA een volledige verzameling technische handelsregels met een benchmark vergelijken, hoe hun nulverdelingen verschillen en wat een globale p-waarde wel en niet zegt.

In deze gidsWaarom de winnaar een toets voor de hele familie nodig heeft

Korte samenvatting

Wie na veel backtests de best presterende regel kiest, heeft daarmee de statistische vraag veranderd. Een gewone toets op alleen de winnaar houdt geen rekening met de zoek- en selectieprocedure. White Reality Check en Hansen SPA toetsen een hele vooraf omschreven familie tegen een benchmark. SPA standaardiseert de verschillen en gebruikt een data-afhankelijke centrering, zodat uitgesproken slechte alternatieven minder invloed hebben. Geen van beide toetsen wijst op zichzelf een regel aan die ook in de toekomst zal winnen.

Waarom de winnaar een toets voor de hele familie nodig heeft

Stel dat je twintig instellingen probeert en vervolgens alleen de hoogste historische opbrengst laat zien. Dan heb je niet één regel beoordeeld. De uitkomst weerspiegelt ook de zoektocht: zelfs als geen enkele variant een werkelijk voordeel heeft, kan er in de historische steekproef toevallig één gunstig lijken. Een gewone t-toets die doet alsof je de winnaar al vóór het bekijken van de data had vastgelegd, laat dit selectie-effect buiten beschouwing.

White ontwikkelde de Reality Check om dit probleem van data snooping voor een hele groep kandidaten te onderzoeken. Sullivan, Timmermann en White pasten de methode toe op een omvangrijke verzameling technische handelsregels en maakten duidelijk waarom je de volledige onderzochte familie moet beschrijven. Hansen stelde later de Superior Predictive Ability-toets, kortweg SPA, voor. Deze standaardiseert verschillen en reageert minder sterk op slechte en weinig relevante regels. De primaire artikelen zijn White (2000), Sullivan, Timmermann en White (1999) en Hansen (2005).

Leg de benchmark en het rendementsverschil vooraf vast

Voor regel $k$ en gezamenlijk tijdstip $t$ noemen we $d_{k,t}$ het voordeel ten opzichte van de benchmark. Voor rendement kan dat $d_{k,t}=R_{k,t}-R_{0,t}$ zijn. Bij voorspellingsverliezen draai je de volgorde om, bijvoorbeeld $d_{k,t}=L_{0,t}-L_{k,t}$, zodat een positieve uitkomst in beide gevallen gunstig is voor de kandidaat. De grootheid die je toetst is het gemiddelde $\mu_k=E[d_{k,t}]$.

Deze keuze bepaalt wat «beter» betekent: bruto rendement, rendement na kosten, een daling van een verliesmaat of een ander vooraf gekozen criterium. Alle kandidaten moeten dezelfde benchmark, frequentie, evaluatieperiode en tekenconventie gebruiken. De formules hieronder gaan over gemiddelde verschillen. Voor een niet-lineaire maat zoals de Sharpe-ratio is een passende methode nodig; je kunt die maat niet zonder meer in deze gemiddeldeformules invullen.

De nulhypothese omvat alle onderzochte varianten

De globale nulhypothese luidt $H_0:\max_{k=1,\ldots,K}\mu_k\leq0$. Dat betekent dat geen enkele regel uit de familie gemiddeld beter presteert dan de benchmark. De alternatieve hypothese zegt dat ten minste één regel een positief gemiddeld voordeel heeft. Het is een eenzijdige toets voor de familie als geheel, geen toets of alle regels gelijk zijn.

De grootte van de familie hangt af van wat je daadwerkelijk hebt onderzocht, niet alleen van de varianten in de eindtabel. Neem als rekenvoorbeeld 12 terugkijkvensters, 4 filters en 5 uitstapinstellingen. Dat levert $12\times4\times5=240$ combinaties op. Dit is uitsluitend een hypothetische rekensom, geen prestatie-uitkomst of p-waarde. Als je ook andere instrumenten, drempels of aannames over kosten hebt geprobeerd, horen die keuzes bij de beschreven zoektocht.

Reality Check gebruikt de nulgrens waarop alle gemiddelden nul zijn

Met $n$ gezamenlijke waarnemingen en steekproefgemiddelde $\bar d_k$ is de hier gebruikte Reality Check-statistiek

$$T_{\mathrm{RC}}=\max_{k=1,\ldots,K}\sqrt{n}\,\bar d_k.$$

Het maximum laat het grootste gemeten voordeel ten opzichte van de benchmark zien. In deze definitie wordt de statistiek niet kunstmatig op nul afgekapt. Om de nulverdeling te benaderen, centreer je elk verschil met het eigen steekproefgemiddelde en trek je bootstrapsteekproeven onder de grens $\mu_k=0$ voor alle kandidaten. Dit is binnen de globale nul de voor de alternatieve hypothese minst gunstige situatie, maar kan het onderscheidingsvermogen van de toets verkleinen.

Een regel met een sterk negatief gemiddelde blijft in iedere herhaling onderdeel van het maximum en kan daardoor kritieke kwantielen verhogen. White stelt een voorzichtige vraag: is het beste gemeten voordeel groter dan wat ook zichtbaar zou kunnen zijn wanneer alle verwachte voordelen nul zijn? Een kleine p-waarde levert bewijs tegen de globale nulhypothese voor de vastgelegde familie. Kandidaten die buiten de opgegeven zoekprocedure vielen, worden er niet mee beoordeeld.

SPA standaardiseert en centreert de nulverdeling op basis van de data

SPA deelt elk gemiddeld verschil door een schatting van de langetermijnspreiding, $\hat\omega_k$. De toetsingsgrootheid is

$$T_{\mathrm{SPA}}=\max\left(0,\max_k\frac{\sqrt n\,\bar d_k}{\hat\omega_k}\right).$$

Door de standaardisering zijn verschillen met uiteenlopende volatiliteit beter vergelijkbaar. Het buitenste maximum met nul hoort bij de SPA-statistiek; het wordt niet aan de eerder gegeven Reality Check-formule toegevoegd. De schatting van de langetermijnspreiding moet rekening houden met tijdsafhankelijkheid in de verschillenreeks, dus ook die keuze verdient toelichting.

Het tweede verschil is de nulcentrering. SPA berekent per regel een correctiewaarde $\hat\mu_{c,k}$. Is het gestandaardiseerde gemiddelde voldoende negatief, bijvoorbeeld lager dan Hansens grens $-\sqrt{2\log\log n}$, dan blijft dat geschatte negatieve gemiddelde behouden in de bootstrapverdeling onder de nul. Kandidaten die verenigbaar zijn met de nulgrens worden juist op nul gecentreerd. Duidelijk slechte regels trekken de kritieke kwantielen zo minder omhoog, terwijl plausibele grensgevallen meetellen. Vermeld zowel de gebruikte centreerregel als de variant van de SPA-p-waarde.

Veel paden komen samen op een top, naast een balans, twee abstracte verdelingen en rijen tijdsblokken, zonder tekst.
Conceptuele illustratie van het zoeken naar strategieën en het vergelijken van onzekerheidsverdelingen; er worden geen testuitkomsten of waargenomen marktrendementen getoond.

De blokbootstrap moet de gezamenlijke afhankelijkheid behouden

Op elk tijdstip is er een vector $(d_{1,t},\ldots,d_{K,t})$ met de verschillen voor alle handelsregels. Trek bij elke bootstrapherhaling volledige vectorrijen in aaneengesloten tijdsblokken. Als je de regels los van elkaar resamplet of losse tijdstippen willekeurig trekt, verdwijnt zowel de samenhang tussen kandidaten als de tijdsafhankelijkheid van de verschillen. Het resulterende maximum gaat dan over een ander statistisch probleem.

De stationaire bootstrap van Politis en Romano (1994) gebruikt blokken met geometrisch verdeelde lengtes en een gekozen gemiddelde bloklengte. Andere passende methoden gebruiken vaste, overlappende blokken met opeenvolgende waarnemingen. De blokken worden samengevoegd tot de oorspronkelijke steekproeflengte is bereikt. Beide toetsen veronderstellen een voldoende stabiel en zwak afhankelijk gezamenlijk proces van rendementsverschillen. De bloklengte en structurele veranderingen kunnen de uitkomst beïnvloeden; resampling herstelt geen regimebreuk.

Een globale p-waarde wijst geen individuele winnaar aan

Een significante Reality Check of SPA betekent dat de data, onder de gekozen aannames, bewijs geven dat minstens één regel uit de beschreven familie een positief gemiddeld voordeel ten opzichte van de benchmark heeft. De globale p-waarde is niet de kans dat de nulhypothese waar is en evenmin de kans dat een bepaalde regel later zal werken. Ze zegt ook niet welke kandidaat individueel superieur is. Voor zo’n conclusie is aanvullend onderzoek nodig dat rekening houdt met selectie, liefst aangevuld met nieuwe gegevens.

In het hypothetische voorbeeld met 240 varianten kan de beste waargenomen regel er één van de 240 zijn; dat aantal alleen bepaalt niet of de nulhypothese wordt verworpen. De feitelijke verschillen, het aantal waarnemingen, de gezamenlijke afhankelijkheid en de gekozen bootstrap zijn bepalend. Een p-waarde, hoog of laag, corrigeert geen verzwegen zoekstappen en garandeert niet dat de historische relatie blijft bestaan.

FDR en betrouwbaarheidsintervallen beantwoorden andere vragen

De gids over meervoudig toetsen en de false discovery rate behandelt doorgaans een verzameling afzonderlijke hypothesen. Onder expliciete voorwaarden beheerst die aanpak het verwachte aandeel valse ontdekkingen onder de verworpen hypotheses. Reality Check en SPA toetsen een globale uitspraak over het maximum van één vastgelegde familie: is er bewijs dat minstens één kandidaat de benchmark verslaat? Ze leveren niet vanzelf een gecorrigeerde lijst met individuele winnaars.

Een betrouwbaarheidsinterval op basis van een blokbootstrap voor één vooraf gekozen strategie is ook iets anders. De gids over blokbootstrapintervallen voor strategierendement schat de onzekerheid van één vastgelegde gemiddelde opbrengst of andere statistiek. Is de strategie gekozen na het doorzoeken van veel varianten, dan corrigeert dat interval de selectiebias niet automatisch. Kies een methode die aansluit op de vraag die je stelt.

Purged cross-validatie richt zich op een ander probleem: het beperken van tijdsgebonden informatielekkage tussen trainings- en testwaarnemingen bij tijdreeksgegevens. Ze toetst niet of het maximum van een regelverzameling de benchmark verslaat; dat is de globale vraag van RC en SPA. De gids over purged cross-validatie en embargo legt die tijdsscheiding uit.

Kosten, zoekgeschiedenis en marktregimes blijven van belang

Neem de relevante kosten op in de verschillen die je toetst: commissies, bied-laatspread, slippage, marktimpact, financiering, effectenleningen en waar relevant de kosten van kapitaal. Kosten pas na de toets aftrekken kan een statistisch positief bruto voordeel omzetten in een economisch waardeloze uitkomst. Ook vertraging in uitvoering, beschikbare liquiditeit en positiegrootte bepalen wat werkelijk haalbaar is.

Een reproduceerbaar verslag beschrijft de volledige familie, iedere filter- en selectiestap, datumbereik en databron, benchmark, definitie van $d_{k,t}$, kosten, blokmethode, keuze van bloklengte, aantal herhalingen en de gebruikte SPA-p-waardevariant. Aanpassingen die je doet nadat je de resultaten hebt bekeken, breiden de zoektocht uit en horen in de interpretatie thuis. Als structurele breuken de verdeling veranderen of de gezamenlijke reeks niet bij benadering stationair en zwak afhankelijk is, kunnen beide bootstraptoetsen misleiden. Het zijn statistische toetsen van een historisch onderzoeksontwerp, geen voorspellingen, garanties of persoonlijk beleggingsadvies.

Veelgestelde vragen

Q1Betekent een significante SPA dat de beste regel afzonderlijk significant is?

Nee. SPA toetst het maximum over de hele onderzochte familie. De globale p-waarde bevestigt geen enkele regel als individuele winnaar.

Q2Heeft SPA altijd meer onderscheidingsvermogen dan Reality Check?

Nee. SPA kan minder gevoelig zijn voor veel slechte of irrelevante alternatieven en daardoor in bepaalde gevallen meer onderscheidingsvermogen hebben. Dat betekent geen uniforme dominantie voor ieder ontwerp.

Q3Kunnen deze toetsen toekomstig rendement voorspellen?

Nee. Ze beoordelen een historische, afgebakende familie onder aannames over het gezamenlijke proces. Regimewisselingen, kosten, nieuwe selectiekeuzes en toekomstige omstandigheden kunnen de uitkomst veranderen.

Bronnen en verder lezen

Probleem melden

We bereiden een e-mail met de link naar dit artikel voor. Mark ontvangt je melding pas nadat je die verstuurt

Snelle check

De gids gelezen? Test jezelf met 3 vragen

Vraag 1 / 3

Vraag 01

Wat stelt de globale nulhypothese van Reality Check en SPA?

Kies een antwoord om de uitleg te zien

Optiewoordenlijst