Skip to content
Alle optiegidsen
Hoe vaak zakt de backtestwinnaar onder de mediaan van de groep?14 min leestijd

Probability of Backtest Overfitting (PBO) en CSCV uitgelegd

Lees hoe combinatorische symmetrische kruisvalidatie PBO schat, hoe OOS-rangen logits worden en waarom PBO geen voorspelling van toekomstige verliezen is

In deze gidsPBO meet het selectieproces, niet één strategie op zichzelf

Korte samenvatting

De probability of backtest overfitting (PBO) vraagt hoe vaak de strategie die binnen de steekproef (IS) als beste is gekozen, buiten de steekproef (OOS) onder de mediaan van de kandidaten eindigt. Combinatorische symmetrische kruisvalidatie (CSCV) schat dit aandeel door steeds de helft van even grote tijdsblokken voor selectie te gebruiken en de andere helft voor evaluatie. PBO is een diagnose die afhangt van een vastgelegde zoekactie, score en historische prestatiematrix. Het is niet de kans dat een live strategie geld verliest.

PBO meet het selectieproces, niet één strategie op zichzelf

Een onderzoeksteam kan verschillende terugkijkvensters, instapdrempels, houdperiodes, universums, kosten en portefeuillebeperkingen proberen en daarna de variant met de hoogste backtestscore behouden. De gekozen uitkomst heeft zo veel kansen gekregen om zich aan de bijzonderheden van de steekproef aan te passen. PBO vat een gevolg van die zoekactie samen: bij de vastgelegde IS/OOS-verdelingen, hoe vaak eindigt de IS-winnaar OOS onder de mediaan van dezelfde kandidaten?

Bailey, Borwein, López de Prado en Zhu introduceerden PBO als raamwerk voor het risico van strategieselectie en stelden CSCV voor als één manier om dit te schatten. De definitie gaat over de procedure die kiest uit geteste configuraties, niet alleen over te veel parameters in één voorspellingsvergelijking. IS is per verdeling de subset waarmee kandidaten worden gekozen; dit hoeft niet de periode te zijn waarin alle onderliggende modellen zijn geschat. De formele opzet staat in het oorspronkelijke PBO-artikel.

Een strategie kan over de volledige steekproef een hoge Sharpe-ratio hebben en toch de gelukkigste kandidaat uit een zwakke onderzoeksgroep zijn. Omgekeerd kan een selectieproces meestal een kandidaat boven de OOS-mediaan kiezen terwijl alle kandidaten verlies opleveren. PBO vergelijkt relatieve rangen binnen de aangeleverde kandidaatgroep; het toetst op zichzelf niet of het verwachte rendement positief is.

PBO beantwoordt een andere vraag dan andere validatiemethoden

Een chronologische holdout- of walk-forwardtest vraagt hoe een vastgelegd onderzoeksproces presteerde op latere waarnemingen die niet voor eerdere beslissingen zijn gebruikt. Purged cross-validation behandelt overlap tussen trainingslabels en testuitkomsten; een embargo kan een afzonderlijk onderbouwde buffer toevoegen. Geen van die maatregelen meet op zichzelf hoe vaak de winnaar van een brede strategiesearch OOS onder de mediaan van de kandidaten zakt. Zie de gids voor purged cross-validation en embargo.

PBO is ook iets anders dan een correctie voor multiple testing. White’s Reality Check gebruikt bootstrap om te toetsen of de beste regel uit een groep een benchmark overtreft na correctie voor data snooping. De Deflated Sharpe Ratio past een Sharpe-gebaseerde significantieberekening aan voor selectie-effecten en niet-normale rendementen. PBO vat juist de OOS-rang van de IS-geselecteerde kandidaat over meerdere verdelingen samen. De methoden gebruiken verschillende statistieken en aannames en vervangen elkaar dus niet vanzelfsprekend. Zie het oorspronkelijke Reality Check-artikel van White en Bailey en López de Prado’s artikel over de Deflated Sharpe Ratio.

Begin met een volledige, gesynchroniseerde prestatiematrix

Neem een matrix M met T rijen en N kolommen. Elke kolom is één kandidaatstrategie of -configuratie; elke rij is voor alle kandidaten hetzelfde waarnemingsinterval. Een rij kan dagelijkse rendementen na relevante handelskosten bevatten. Als kandidaten met verschillende frequenties handelen, bepaal dan eerst een gemeenschappelijke tijdindex en aggregeer de prestaties consequent. Dagelijkse rendementen van de ene strategie vergelijken met maandtotalen van een andere levert geen betekenisvolle rijgewijze matrix op.

De kandidaatgroep moet de werkelijke selectiemogelijkheden weerspiegelen: afgewezen varianten uit een grid search, handmatige aanpassingen na het bekijken van resultaten, andere universums en alternatieve regels die de uiteindelijke keuze beïnvloedden. PBO kan alleen de aangeleverde kandidaten en prestatiegeschiedenissen beoordelen. Als na een veel grotere zoekactie alleen finalisten zijn vastgelegd, onderschat de uitkomst de zoekruimte.

Gebruik voor iedere kandidaat dezelfde rendementsdefinitie, valuta, behandeling van leverage en prestatiemaatstaf. Als de selectie op netto-Sharpe gebeurt, verwerk dan eerst de relevante vergoedingen, spreads, financiering, funding, leenlasten en uitvoeringsaannames in iedere kolom. De maatstaf moet ook op de volgende deelsteekproeven berekenbaar zijn. Het oorspronkelijke artikel vereist gesynchroniseerde rijen en een maatstaf die op iedere deelsteekproef kan worden geschat; bij verschillende handelsfrequenties beveelt het een gemeenschappelijke index aan.

CSCV koppelt iedere steekproefhelft aan het complement

Kies een even aantal S disjuncte tijdsblokken van gelijke grootte en behoud binnen elk blok de tijdsvolgorde. Voor iedere mogelijke keuze van S/2 blokken vormen die de in-sample-set (IS); de resterende S/2 blokken vormen de out-of-sample-set (OOS). Behoud bij een padgevoelige maatstaf de oorspronkelijke volgorde van gekozen blokken en leg vast wat het samenvoegen betekent.

Het aantal IS-toewijzingen is C(S,S/2). Met vier blokken A, B, C en D zijn er zes toewijzingen: AB, AC, AD, BC, BD en CD; ook ieder complement telt als eigen toewijzing. Bij S = 16 is C(16,8) = 12.870. Dit zijn deterministische combinaties van dezelfde geschiedenis, geen 12.870 onafhankelijke marktproeven.

‘Symmetrisch’ betekent dat het complement in een andere combinatie opnieuw als selectieset wordt gebruikt: in de ene splitsing is AB IS en CD OOS, in een andere is dat omgekeerd. ‘Combinatorisch’ betekent dat alle keuzes van de helft van de blokken worden opgesomd in plaats van één willekeurige splitsing te trekken. Het is geen chronologische replay. Een selectie kan vroege en late blokken bevatten terwijl het complement middenblokken bevat; OOS betekent dus niet ‘de toekomst na de trainingsperiode’.

Tijdblokken worden herhaaldelijk in symmetrische trainings- en testhelften verdeeld; sommige winnaars in de steekproef eindigen buiten de steekproef onder het midden
Conceptuele weergave van symmetrische CSCV-indelingen en rangen; geen echte gegevens of chronologische handelssimulatie

Zet de OOS-rang van de gekozen kandidaat om in een logit

Pas voor splitsing c de onderzoeksselectieregel toe op IS en kies de beste kandidaat n*(c). Bereken daarna dezelfde prestatiemaatstaf voor alle N kandidaten op de complementaire OOS-set. De rang r(c) van de gekozen kandidaat loopt van 1 voor de slechtste tot N voor de beste. Leg vooraf vast hoe gelijke standen worden afgehandeld en houd die regel constant.

Zet de rang om in de relatieve rang ω(c) = r(c)/(N+1). De noemer N+1 houdt zelfs de laagste en hoogste rang strikt tussen nul en één. De logit is λ(c) = ln(ω(c)/(1−ω(c))). Deze is negatief onder de OOS-mediaan, nul op de mediaan en positief erboven. De geschatte PBO is het aandeel CSCV-toewijzingen waarvoor λ(c) ≤ 0.

De enkele PBO-waarde geeft aan hoe vaak de IS-winnaar hoogstens de OOS-mediaan haalt. De volledige logitverdeling laat zien of geselecteerde kandidaten meestal rond het midden blijven, vaak ver terugvallen of juist boven de mediaan eindigen. Een logit is een getransformeerde relatieve rang, geen kans voor een individuele live-transactie en geen gekalibreerde voorspelling van toekomstige rendementen.

Een hypothetisch voorbeeld met vier blokken geeft 66,7% PBO

Stel dat er vier historische blokken van gelijke grootte zijn en vier kandidaatregels, R1 tot en met R4. De tabel toont de zes IS-toewijzingen. De OOS-rang is de positie van de IS-geselecteerde regel tussen alle vier regels op de complementaire blokken. Alle waarden zijn hypothetisch en dienen alleen ter illustratie.

IS-blokkenIS-winnaarOOS-rang rRelatieve rang ω = r/5Logit ln(ω/(1−ω))Mediaan of lager?
ABR110,20−1,386Ja
ACR340,80+1,386Nee
ADR220,40−0,405Ja
BCR110,20−1,386Ja
BDR430,60+0,405Nee
CDR320,40−0,405Ja

Vier van de zes gekozen regels halen OOS een relatieve rang van hoogstens een half. De empirische PBO is dus 4/6 ≈ 0,667, oftewel ongeveer 66,7%. Bij rang 2 geldt bijvoorbeeld ω = 2/(4+1) = 0,4 en λ = ln(0,4/0,6) ≈ −0,405. Rang 3 geeft ω = 0,6 en de tegengestelde logit van ongeveer +0,405.

Dit betekent niet dat er 66,7% kans is dat de strategie volgende maand geld verliest. In deze hypothetische matrix en met deze rangconventie lag de IS-winnaar in vier van de zes verdelingen op of onder de mediaan van de kandidaten. Ook de twee overige winnaars kunnen absoluut negatieve OOS-rendementen hebben gehad terwijl ze beter presteerden dan hun concurrenten.

Behandel PBO als een voorwaardelijke diagnose met beperkingen

PBO hangt af van de kandidaatgroep, de waargenomen prestatiematrix, de selectiemaatstaf, de tijdsblokken en de gelijkstandsregel. Niet vastgelegde experimenten vallen buiten de beoordeling. ‘Modelvrij’ betekent dat de berekening kan worden uitgevoerd op basis van de prestatiegeschiedenissen zonder de voorspellingsvergelijkingen te kennen; het betekent niet dat ontwerpkeuzes, gegevenskwaliteit en aannames geen rol spelen.

CSCV combineert blokken tot symmetrische subsets van gelijke grootte, maar de OOS-set is meestal geen aaneengesloten latere periode. Het opnieuw combineren kan langetermijnafhankelijkheid, seizoenspatronen of de volgorde van economische regimes verstoren. S bepaalt zowel het aantal combinaties als de duur van ieder blok. Kies en documenteer S daarom op basis van relevante horizons en marktstructuur. Een groot aantal combinaties levert niet evenveel onafhankelijke waarnemingen op, omdat dezelfde blokken steeds terugkomen.

De statistiek erft vertekeningen in de bronrendementen: survivorship bias, herziene data, kenmerken die destijds niet beschikbaar waren, onrealistische fills, ontbrekende kosten of een achteraf gekozen universum kunnen alle kandidaatgeschiedenissen misleidend maken. CSCV verwijdert niet automatisch overlappende labelintervallen, schat niet vanzelf iedere modelpipeline opnieuw binnen iedere splitsing en voorkomt geen datalek via preprocessing. Stem zulke stappen expliciet af op de onderzoeksvraag. Voor chronologische bescherming, zie de officiële TimeSeriesSplit-documentatie en de gids voor purged validatie.

Padgevoelige maatstaven zoals maximale drawdown vragen extra zorg: niet-aaneengesloten blokken samenvoegen verandert het pad en mogelijk de maatstaf. Het PBO-artikel merkt op dat de volgorde bij sommige maatstaven wel uitmaakt, anders dan bij Sharpe. Leg uit hoe volgorde, gaten, ontbrekende waarnemingen en samengestelde rendementen worden behandeld voordat je een rang interpreteert.

Rapporteer PBO naast chronologisch bewijs en het volledige zoeklogboek

Bewaar vóór de berekening het kandidatenregister, iedere wijziging na het bekijken van resultaten, de prestatiematrix, de selectiemaatstaf en de gelijkstandsregel. Rapporteer T, N, S, blokconstructie, C(S,S/2), de OOS-rangconventie, de geschatte PBO en de logitverdeling. Voeg absolute OOS-prestaties, kosten, omzet, drawdowns en het aantal verliezende kandidaten toe: alleen een rang laat niet zien of alle kandidaten zwak zijn.

Gebruik walk-forward of een echte chronologische holdout om het bevroren onderzoeksproces op latere data te beoordelen. Houd de laatste periode gesloten tijdens de keuze van model en drempels; herhaald bekijken maakt die periode een nieuwe selectieset. Tijdgeordende tools zoals TimeSeriesSplit maken chronologische folds onder hun gedocumenteerde aannames; PBO meet een andere ranggebaseerde eigenschap van de onderzochte kandidaatgroep.

PBO kan daarom controles op overlappende labels, multiple-testinganalyse, realistische uitvoeringsmodellen, prospectieve evaluatie en live monitoring aanvullen, maar niet vervangen. Lees ook multiple testing en false-discovery rate in de financiële sector en Sharpe-correcties bij seriële correlatie. Geen enkele maatstaf maakt van een historische rangorde bewijs voor een blijvend handelsvoordeel.

Veelgestelde vragen

Q1Betekent PBO dat de strategie die kans heeft om geld te verliezen?

Nee. PBO schat hoe vaak een IS-geselecteerde kandidaat in de vastgelegde verdelingen OOS op of onder de mediaan eindigt. Het is geen kans op toekomstig verlies en geen gekalibreerde voorspelling van live rendement.

Q2Is CSCV hetzelfde als walk-forward testen?

Nee. CSCV koppelt iedere geselecteerde blokhelft aan het complement, waardoor OOS zowel eerdere als latere blokken kan bevatten. Walk-forward houdt de training vóór iedere latere testperiode om een chronologisch, op inzet lijkend pad te onderzoeken.

Q3Bewijst een lage PBO dat de gekozen strategie een voordeel heeft?

Nee. De winnaar kan beter zijn dan een zwakke groep en toch absoluut verlies opleveren. Beoordeel netto rendement, onzekerheid, kosten, datalekken en prestaties op echt latere data afzonderlijk.

Bronnen en verder lezen

Probleem melden

We bereiden een e-mail met de link naar dit artikel voor. Mark ontvangt je melding pas nadat je die verstuurt

Snelle check

De gids gelezen? Test jezelf met 3 vragen

Vraag 1 / 3

Vraag 01

Welke gebeurtenis draagt bij aan een geschatte PBO?

Kies een antwoord om de uitleg te zien

Optiewoordenlijst