Skip to content
Tutte le guide sulle opzioni
Quanto spesso il vincitore del backtest scende sotto la mediana del gruppo14 min di lettura

Probabilità di overfitting del backtest (PBO) e CSCV

Scopri come la validazione incrociata simmetrica combinatoria stima la PBO, trasforma i ranghi fuori campione in logit e perché non prevede perdite future

In questa guidaLa PBO misura il processo di selezione, non una strategia isolata

Breve sintesi

La probabilità di overfitting del backtest (PBO) chiede quanto spesso la strategia scelta come migliore nel campione interno (IS) si colloca sotto la mediana dei candidati nel campione esterno (OOS). La validazione incrociata simmetrica combinatoria (CSCV) stima questa frequenza assegnando ripetutamente metà di blocchi temporali uguali alla selezione e l’altra metà alla valutazione. La PBO è una diagnosi condizionata a una specifica ricerca, metrica e matrice storica delle prestazioni; non è la probabilità che una strategia operativa perda denaro.

La PBO misura il processo di selezione, non una strategia isolata

Un gruppo di ricerca può provare diversi lookback, soglie d’ingresso, periodi di detenzione, universi, ipotesi sui costi e vincoli di portafoglio, poi mantenere la variante con il punteggio di backtest più alto. Il risultato selezionato ha avuto molte occasioni per adattarsi alle peculiarità del campione. La PBO riassume una conseguenza di questa ricerca: nelle partizioni IS/OOS definite, quanto spesso il vincitore IS finisce sotto la mediana OOS degli stessi candidati?

Bailey, Borwein, López de Prado e Zhu hanno introdotto la PBO per analizzare il rischio di selezione delle strategie e proposto la CSCV come metodo di stima. La definizione riguarda il processo che seleziona tra configurazioni testate, non soltanto il numero di parametri in una singola equazione previsionale. Per ciascuna partizione, IS è il sottoinsieme usato per scegliere tra i candidati e non deve coincidere con il periodo in cui sono stati stimati tutti i modelli sottostanti. La formulazione è nell’articolo originale sulla PBO.

Una strategia può avere uno Sharpe elevato sull’intero campione ed essere comunque il candidato più fortunato di una famiglia debole. Viceversa, la selezione può spesso scegliere un candidato sopra la mediana OOS anche se tutti i candidati hanno rendimenti negativi. La PBO confronta ranghi relativi nell’insieme fornito; da sola non verifica un rendimento atteso positivo.

La PBO risponde a una domanda diversa dagli altri strumenti di validazione

Un holdout cronologico o un test walk-forward chiede come abbia funzionato un processo di ricerca definito su osservazioni successive non usate per le decisioni precedenti. La cross-validation con purging affronta la sovrapposizione tra gli intervalli delle etichette di training e gli esiti di test; un embargo può aggiungere un margine giustificato separatamente. Nessuno di questi interventi misura da solo quanto spesso il vincitore di una ricerca ampia scende sotto la mediana OOS. Consulta la guida alla purged cross-validation e all’embargo.

La PBO è diversa anche da una correzione per test multipli. Il Reality Check di White usa un bootstrap per verificare se la regola migliore di una famiglia supera un benchmark dopo aver considerato il data snooping. Lo Sharpe deflazionato adegua un test di significatività basato sullo Sharpe agli effetti di selezione e ai rendimenti non normali. La PBO riassume invece il rango OOS del candidato scelto in IS nelle varie partizioni. Metodi, statistiche e ipotesi sono diversi, quindi non si sostituiscono automaticamente. Vedi l’articolo originale di White sul Reality Check e il lavoro di Bailey e López de Prado sullo Sharpe deflazionato.

Parti da una matrice delle prestazioni completa e sincronizzata

Sia M una matrice T per N: le N colonne sono strategie o configurazioni candidate e le T righe rappresentano lo stesso intervallo di osservazione per tutti. Una riga può contenere i rendimenti giornalieri al netto dei costi rilevanti. Se la frequenza di negoziazione varia, definisci prima un indice temporale comune e aggrega le prestazioni in modo coerente. Confrontare riga per riga i rendimenti giornalieri di una strategia con i totali mensili di un’altra non produce una matrice significativa.

L’insieme dei candidati deve rappresentare le effettive opportunità di selezione: varianti scartate da ricerche a griglia, modifiche manuali fatte dopo aver visto i risultati, universi alternativi e regole che hanno contribuito alla scelta finale. La PBO valuta solo i candidati e le serie storiche fornite. Se dopo una ricerca molto più ampia si registrano solo i finalisti, la stima sottorappresenta la ricerca realmente effettuata.

Usa la stessa convenzione dei rendimenti, valuta, trattamento della leva e metrica per ogni candidato. Se la scelta usa lo Sharpe netto, includi in ogni colonna commissioni, spread, finanziamento, funding, costi di prestito e ipotesi di esecuzione pertinenti prima di calcolarlo. La metrica deve poter essere stimata anche nei sottoinsiemi successivi. L’articolo originale richiede righe sincronizzate e una metrica stimabile su ciascun sottocampione; con frequenze diverse suggerisce di allineare le serie a un indice comune.

La CSCV abbina ogni metà del campione al suo complemento

Scegli un numero pari S di blocchi temporali disgiunti e della stessa dimensione, mantenendo l’ordine interno. Per ogni possibile scelta di S/2 blocchi, combina quei blocchi come insieme in-sample (IS) e usa i restanti come out-of-sample (OOS). Per metriche che dipendono dal percorso, conserva l’ordine originario dei blocchi scelti e documenta cosa implica la concatenazione.

Le assegnazioni IS sono C(S,S/2). Con quattro blocchi A, B, C e D, le sei assegnazioni sono AB, AC, AD, BC, BD e CD; anche ogni complemento compare come assegnazione distinta. Con S = 16, C(16,8) = 12.870. Sono combinazioni deterministiche della stessa storia, non 12.870 esperimenti di mercato indipendenti.

“Simmetrica” indica che il complemento è riutilizzato come insieme di selezione in un’altra combinazione: in uno split AB è IS e CD OOS, in un altro CD è IS e AB OOS. “Combinatoria” significa enumerare tutte le scelte di metà blocchi anziché estrarre uno split casuale. Non è una simulazione cronologica: l’insieme selezionato può includere blocchi iniziali e finali mentre il complemento contiene blocchi centrali. Qui OOS non significa necessariamente “il futuro dopo il training”.

I blocchi temporali vengono divisi più volte in metà di addestramento e verifica; alcuni vincitori in-sample scendono sotto il punto mediano quando sono classificati out-of-sample
Schema concettuale delle suddivisioni simmetriche e dei ranghi CSCV; non mostra dati reali né una simulazione di trading cronologica

Trasforma il rango OOS del candidato selezionato in un logit

Per lo split c, applica ai dati IS la regola di selezione della ricerca e scegli il candidato migliore n*(c). Calcola quindi la stessa metrica per tutti gli N candidati sul complemento OOS. Definisci r(c) come il rango OOS del candidato selezionato, con 1 per il peggiore e N per il migliore. Specifica in anticipo come gestire i pareggi e applica la stessa regola a tutti gli split.

Il rango relativo è ω(c) = r(c)/(N+1). Il denominatore N+1 mantiene il valore rigorosamente tra zero e uno anche agli estremi. Il logit è λ(c) = ln(ω(c)/(1−ω(c))). È negativo quando il candidato scelto si colloca sotto la mediana OOS, zero alla mediana e positivo sopra. La PBO stimata è la quota di assegnazioni CSCV con λ(c) ≤ 0.

Il valore sintetico di PBO indica quanto spesso il vincitore IS raggiunge al massimo la mediana OOS. La distribuzione completa dei logit mostra anche se i candidati selezionati rimangono vicino al centro, scendono spesso molto sotto o tendono a superarlo. Il logit trasforma un rango relativo: non è una probabilità per una singola operazione reale né una previsione calibrata del rendimento futuro.

Un esempio ipotetico con quattro blocchi dà una PBO del 66,7%

Supponi che ci siano quattro blocchi storici uguali e quattro regole candidate R1–R4. La tabella mostra le sei assegnazioni IS. Il rango OOS è quello della regola scelta in IS tra tutte e quattro sui blocchi complementari. I valori sono ipotetici e servono soltanto a illustrare il calcolo.

Blocchi ISVincitore ISRango OOS rRango relativo ω = r/5Logit ln(ω/(1−ω))Alla mediana o sotto?
ABR110,20−1,386Sì
ACR340,80+1,386No
ADR220,40−0,405Sì
BCR110,20−1,386Sì
BDR430,60+0,405No
CDR320,40−0,405Sì

Quattro regole selezionate su sei hanno un rango relativo OOS non superiore a un mezzo. La PBO empirica è quindi 4/6 ≈ 0,667, cioè circa 66,7%. Per il rango 2: ω = 2/(4+1) = 0,4 e λ = ln(0,4/0,6) ≈ −0,405. Il rango 3 dà ω = 0,6 e il logit opposto, circa +0,405.

Questo non significa che ci sia il 66,7% di probabilità di perdere denaro il mese prossimo. In questa matrice ipotetica e con questa convenzione di rango, il vincitore IS si è collocato alla mediana dei candidati OOS o sotto in quattro dei sei split. Anche gli altri due vincitori potrebbero aver avuto rendimenti OOS assoluti negativi pur superando i concorrenti.

Considera la PBO una diagnosi condizionata con dei limiti

La PBO dipende dalla famiglia di candidati, dalla matrice osservata, dalla metrica di selezione, dai blocchi temporali e dalla regola sui pareggi. Le prove non registrate restano fuori dal suo perimetro. “Indipendente dal modello” significa che si può calcolare dalle serie dei candidati senza conoscere le equazioni previsionali; non vuol dire che sia priva di scelte di progetto, problemi di qualità dei dati o ipotesi.

La CSCV combina i blocchi in sottoinsiemi simmetrici di uguale dimensione, ma l’OOS non è in genere un unico periodo cronologico successivo. La ricombinazione può interrompere dipendenza di lungo periodo, stagionalità o sequenze dei regimi economici. S determina sia il numero di combinazioni sia la durata rappresentata da ogni blocco: scegli e documenta il valore considerando gli orizzonti e la struttura rilevanti. Molte combinazioni non creano altrettante osservazioni indipendenti, perché riutilizzano gli stessi blocchi.

La statistica eredita i bias dei rendimenti di partenza. Survivorship bias, dati revisionati, variabili non disponibili all’epoca, esecuzioni irrealistiche, costi omessi e universi scelti a posteriori possono rendere fuorvianti tutte le serie. La CSCV non elimina automaticamente intervalli di etichette sovrapposti, non ristima per forza l’intera pipeline a ogni split e non impedisce perdite informative nel preprocessing. Tali passaggi vanno progettati per la domanda di ricerca. Per le protezioni cronologiche, confronta la documentazione ufficiale di TimeSeriesSplit e la guida alla validazione con purging.

Le metriche dipendenti dal percorso, come il drawdown massimo, richiedono attenzione: concatenare blocchi non contigui cambia il percorso e può cambiare il valore. Il paper sulla PBO osserva che, a differenza dello Sharpe, per alcune metriche conta l’ordine delle osservazioni. Spiega come gestisci ordine, lacune, dati mancanti e capitalizzazione prima di interpretare il rango.

Riporta la PBO insieme alle prove cronologiche e al registro completo della ricerca

Prima del calcolo conserva il registro dei candidati, ogni modifica successiva alla visione dei risultati, la matrice delle prestazioni, la metrica di selezione e la regola sui pareggi. Riporta T, N, S, costruzione dei blocchi, C(S,S/2), convenzione del rango OOS, PBO stimata e distribuzione dei logit. Aggiungi rendimento OOS assoluto, costi, turnover, drawdown e numero di candidati in perdita: il rango da solo non mostra se sono tutti deboli.

Usa un walk-forward o un autentico holdout cronologico per valutare il processo di ricerca bloccato su dati successivi. Tieni chiuso il periodo finale mentre scegli modello e soglie; consultarlo ripetutamente lo trasforma in un altro insieme di selezione. Strumenti ordinati per tempo come TimeSeriesSplit creano fold cronologici secondo le ipotesi documentate, mentre la PBO misura una diversa proprietà di rango della famiglia esplorata.

La PBO può quindi integrare, ma non sostituire, controlli sulla sovrapposizione delle etichette, analisi di test multipli, modelli realistici di esecuzione, valutazione prospettica e monitoraggio live. Continua con test multipli e false discovery rate nella finanza e correzioni dello Sharpe per autocorrelazione seriale. Nessuna singola statistica trasforma un rango storico nella prova di un vantaggio persistente.

Domande frequenti

Q1La PBO significa che la strategia ha quella probabilità di perdere denaro?

No. Stima quanto spesso il candidato scelto in IS si colloca alla mediana OOS o sotto nelle partizioni definite. Non è una probabilità di perdita futura né una previsione calibrata del rendimento live.

Q2La CSCV equivale a un test walk-forward?

No. La CSCV abbina ogni metà di blocchi al suo complemento, perciò il sottoinsieme OOS può includere blocchi iniziali e successivi. Il walk-forward mantiene il training prima di ogni periodo di test successivo e analizza un percorso cronologico simile all’implementazione.

Q3Una PBO bassa dimostra che la strategia selezionata ha un vantaggio?

No. Il vincitore può superare un gruppo debole e perdere comunque in termini assoluti. Valuta separatamente rendimenti netti, incertezza, costi, fughe informative e risultati su dati davvero successivi.

Fonti e approfondimenti

Segnala un problema

Prepareremo un’e-mail con il link a questo articolo. Mark riceverà la segnalazione solo dopo l’invio

Controllo rapido

Hai finito la guida? Verifica ciò che hai capito con 3 domande

Domanda 1 / 3

Domanda 01

Quale evento contribuisce a una stima della PBO?

Scegli una risposta per vedere la spiegazione

Glossario delle opzioni