Skip to content
Tutte le guide sulle opzioni
Ricerca quantitativa12 min di lettura

Deflated Sharpe Ratio: test multipli e selezione dei backtest

Scopri come il Deflated Sharpe Ratio corregge l’evidenza dello Sharpe dopo la selezione di una strategia per test multipli e rendimenti non normali, con un esempio ipotetico e limiti espliciti.

In questa guidaDopo una ricerca, il DSR alza la soglia dello Sharpe

Breve sintesi

Il Deflated Sharpe Ratio (DSR) chiede se lo Sharpe stimato di una strategia selezionata superi una soglia che riflette sia la ricerca tra le alternative sia la forma della distribuzione dei rendimenti. Applica un calcolo probabilistico dello Sharpe a un riferimento corretto per la selezione. Il DSR è una diagnosi statistica condizionata: non trasforma un backtest in una prova di profitti futuri e non corregge test omessi, costi irrealistici o leakage temporale.

Dopo una ricerca, il DSR alza la soglia dello Sharpe

Chi fa ricerca può provare molte definizioni di segnale, finestre retrospettive, soglie di ingresso, universi, durate di detenzione e ipotesi sui costi, poi riportare la versione con lo Sharpe ratio più alto. Anche se nessun candidato possiede capacità predittiva reale, le stime variano per effetto del campionamento. Più ampia è la ricerca, più tende a crescere la stima massima. Il risultato selezionato è quindi diverso dalla valutazione di un’unica strategia definita prima di osservare i dati.

Il Deflated Sharpe Ratio, proposto da Bailey e López de Prado, affronta due fonti di inflazione dello Sharpe selezionato: test multipli e rendimenti non normali. I test multipli innalzano il riferimento che il risultato deve superare; la non normalità cambia l’incertezza stimata dello Sharpe. L’articolo originale descrive il DSR come un Probabilistic Sharpe Ratio calcolato rispetto a una soglia corretta per la selezione. L’articolo originale illustra la derivazione e la stima del numero di tentativi.

Questa interpretazione evita un errore comune. Il DSR non sottrae meccanicamente una penalità fissa allo Sharpe riportato per ottenere un nuovo rapporto di performance. Stima quanto lo Sharpe osservato superi una soglia legata alla ricerca, alla dimensione del campione e ai momenti dei rendimenti. La stima puntuale dello Sharpe può restare invariata mentre il DSR diminuisce perché l’evidenza è più debole. Per il significato dello Sharpe stesso, consulta anche la spiegazione originale di Sharpe.

Il migliore tra molte stime rumorose è spesso insolitamente alto

Supponi che tutte le regole testate abbiano lo stesso Sharpe reale, ma che ogni stima vari perché basata su un campione finito. Scegliere la stima più alta significa scegliere anche un errore di misurazione favorevole. È la maledizione del vincitore: su nuovi dati, ci si aspetta che la stima selezionata torni verso il valore tipico del gruppo.

Conta il numero di tentativi, ma anche quanto differiscono le rispettive stime. Se i candidati producono rendimenti quasi identici, i loro Sharpe stimati sono strettamente correlati e offrono meno occasioni indipendenti di ottenere un massimo fortunato rispetto a un insieme altrettanto grande di candidati non correlati. Il numero di righe in una griglia di parametri non equivale automaticamente al numero di tentativi indipendenti.

Il registro della ricerca può includere decisioni al di fuori di una griglia formale: una soglia modificata manualmente, un mercato escluso o un’ipotesi di costo rivista che ha influenzato il risultato rimasto. Un DSR calcolato solo sui candidati finali non può considerare esperimenti che non sono stati registrati o forniti al calcolo.

Il Probabilistic Sharpe Ratio calcola l’incertezza campionaria

Il Probabilistic Sharpe Ratio (PSR) stima se uno Sharpe campionario superi un riferimento scelto, tenendo conto del numero di osservazioni dei rendimenti e dell’asimmetria e curtosi stimate. Il DSR usa lo stesso calcolo di base, ma sceglie un riferimento che rispecchia lo Sharpe massimo atteso dalla ricerca.

Per una comune approssimazione PSR, il calcolo corretto per la selezione è:

$$ \mathrm{DSR}=\Phi\!\left( \frac{(\widehat{SR}-SR_0)\sqrt{T-1}} {\sqrt{1-\widehat{\gamma}_3\widehat{SR} +\frac{\widehat{\gamma}_4-1}{4}\widehat{SR}^{\,2}}} \right) $$

Qui $\Phi$ è la funzione di distribuzione cumulativa normale standard, $\widehat{SR}$ lo Sharpe osservato per osservazione di rendimento, $SR_0$ la soglia corretta per la selezione nelle stesse unità e $T$ il numero di osservazioni. $\widehat{\gamma}_3$ è l’asimmetria campionaria e $\widehat{\gamma}_4$ la curtosi di Pearson, pari a 3 per una distribuzione normale. Il denominatore riflette come asimmetria e curtosi cambino l’incertezza della stima dello Sharpe.

L’espressione dipende dalle convenzioni. Usa rendimenti in eccesso a una sola frequenza e calcola Sharpe e soglia alla stessa frequenza; definisci la curtosi in modo coerente. Annualizzare una sola di queste quantità cambia il confronto. La formula consueta si basa anche su ipotesi riguardo alla dipendenza delle osservazioni; la dipendenza seriale richiede un trattamento separato, non una sostituzione silenziosa di $T$.

La soglia del massimo atteso dipende dalla famiglia di candidati

Per $N$ stime dello Sharpe indipendenti e approssimativamente normali, Bailey e López de Prado usano un’approssimazione dei valori estremi per il massimo atteso:

$$ SR_0 \approx \mu_{SR}+\sigma_{SR} \left[(1-\gamma_E)\Phi^{-1}\!\left(1-\frac{1}{N}\right) +\gamma_E\Phi^{-1}\!\left(1-\frac{1}{Ne}\right)\right] $$

$\mu_{SR}$ e $\sigma_{SR}$ indicano media e deviazione standard delle stime dello Sharpe dei candidati; $\Phi^{-1}$ è la funzione quantile normale standard, $e$ il numero di Eulero e $\gamma_E \approx 0,5772$ la costante di Eulero-Mascheroni. L’espressione stima quanto possa salire la migliore stima per il solo effetto della selezione nel modello di tentativi scelto. Non è una soglia universale per ogni ricerca di strategie.

Se i risultati dei candidati sono correlati, trattare ogni variante come indipendente può sovrastimare il numero effettivo di tentativi. L’articolo discute come stimare il numero di tentativi indipendenti a partire dalla dipendenza tra i candidati, ma anche questa stima è una scelta di modello. La correlazione è solo una forma di dipendenza e la sua stima può essere instabile con molti candidati e una cronologia breve. Riporta il numero grezzo dei candidati, il metodo per ogni stima effettiva e la sensibilità ad alternative plausibili.

Un calcolo ipotetico separa la soglia dallo Sharpe osservato

Supponi una ricerca volutamente semplificata con 20 strategie candidate indipendenti. Sotto l’ipotesi nulla, poni a 0 la media delle stime di Sharpe e a 0,20 la loro deviazione standard in unità mensili. L’approssimazione del massimo atteso dà una soglia di selezione di circa $SR_0=0,380$ al mese. Sono ipotesi per illustrare l’aritmetica, non osservazioni di mercato né un riferimento consigliato.

Supponi ora che la strategia selezionata abbia 60 osservazioni mensili di rendimenti in eccesso, Sharpe mensile stimato 0,50, asimmetria campionaria 0 e curtosi di Pearson 3. La componente PSR confronta 0,50 con 0,380, non con zero:

$$ z=\frac{(0.50-0.380)\sqrt{59}}{\sqrt{1+((3-1)/4)(0.50)^2}} \approx 0.868,\qquad \mathrm{DSR}=\Phi(z)\approx 0.807 $$

Con queste ipotesi semplificative il DSR risultante è circa 80,7%. Non è una probabilità dell’80,7% che la strategia guadagni il prossimo mese e non è una previsione del rendimento del mese successivo. È l’evidenza stimata che lo Sharpe sottostante superi la soglia di selezione scelta, condizionatamente al modello e agli input. Un diverso numero di tentativi, una diversa stima della dipendenza, un altro campione o una distribuzione diversa possono cambiare il risultato.

La sensibilità alla dispersione delle stime dei tentativi è sostanziale. Se cambia solo la deviazione standard ipotizzata delle stime di Sharpe dei candidati, da 0,20 a 0,10, la stessa ricerca con 20 tentativi dà una soglia di circa 0,190 e un DSR di circa 98,8%. Se la deviazione standard è 0,30, la soglia è circa 0,570 e il DSR circa 30,6%. Lo Sharpe osservato di 0,50, le 60 osservazioni, l’asimmetria e la curtosi restano uguali. Questa sensibilità ipotetica mostra perché contano il metodo di stima della dispersione e la dipendenza tra candidati; i valori restano nelle stesse unità mensili e nello stesso modello semplificato.

Asimmetria e curtosi cambiano l’incertezza, non solo il racconto

Due strategie possono avere lo stesso Sharpe campionario e la stessa dimensione del campione, ma distribuzioni dei rendimenti diverse. Una coda sinistra pronunciata, l’asimmetria o osservazioni estreme insolitamente frequenti possono cambiare l’incertezza campionaria rappresentata nel denominatore del PSR. La correzione è calcolata dai momenti osservati: non giudica tutte le distribuzioni non normali ugualmente dannose e non garantisce che pochi momenti campionari descrivano completamente le code.

Il calcolo dipende anche da cosa si considera un’osservazione. Dati giornalieri, settimanali e mensili producono valori diversi di $T$, Sharpe, asimmetria e curtosi. I rendimenti su periodi di detenzione sovrapposti possono rendere dipendenti le righe adiacenti. Valutazioni smussate o obsolete possono apparire meno variabili del rischio economico sottostante. Descrivi frequenza e costruzione del campione invece di considerare sufficiente il solo Sharpe annualizzato.

DSR e altri metodi di validazione rispondono a domande diverse

Il PBO usa la cross-validation combinatoria simmetrica per chiedere quanto spesso il vincitore in-sample si classifichi alla mediana dei candidati o sotto di essa su blocchi complementari. Il DSR stima se uno Sharpe selezionato superi una soglia corretta per la ricerca e la non normalità. Risultati e ipotesi di ricampionamento sono diversi; un metodo non sostituisce l’altro. Consulta le guide a PBO e CSCV e ai test multipli in finanza. Bailey e i coautori formalizzano questa diagnosi della selezione nell’articolo originale sul PBO.

Il Reality Check di White usa un bootstrap per testare se la regola migliore di una famiglia di candidati superi un riferimento specificato, tenendo conto del data snooping. La domanda è relativa al benchmark, mentre il DSR usa una soglia basata sullo Sharpe. Un walk-forward cronologico o un holdout finale chiede come si comporti un processo congelato in periodi successivi. Questi metodi sono complementari perché valutano parti diverse della tesi di ricerca. White descrive il metodo nel suo articolo originale sul Reality Check.

Riporta la ricerca e le ipotesi insieme al DSR

Un rapporto riproducibile identifica l’universo dei candidati, tutte le decisioni documentate che hanno influenzato la selezione, il numero grezzo di tentativi, il metodo per l’eventuale numero effettivo, la serie dei rendimenti, dimensione e frequenza del campione, definizione dello Sharpe, asimmetria, convenzione della curtosi e soglia corretta per la selezione. Specifica se i rendimenti sono lordi o al netto di spread, commissioni, impatto di mercato, funding, prestito e altri costi. Mostra insieme Sharpe osservato e DSR, così che sia visibile cosa cambia.

La formula convenzionale presume un modello campionario che potrebbe non adattarsi a osservazioni con correlazione seriale. Il lavoro di Lo sulle statistiche dello Sharpe spiega perché aggregazione temporale e dipendenza influenzano l’inferenza. Se i rendimenti si sovrappongono o mostrano correlazione seriale, usa una procedura inferenziale che affronti quella struttura e spiega le ipotesi. Moltiplicare uno Sharpe mensile per $\sqrt{12}$ non corregge l’autocorrelazione. Per una valutazione attenta all’ordine temporale, consulta anche la guida alle finestre walk-forward expanding e rolling.

Il DSR non può scoprire una ricerca non documentata, eliminare leakage look-ahead, rendere rappresentativi dati affetti da survivorship bias, convalidare le esecuzioni, stimare la capacità o garantire stabilità in un nuovo regime. Non sostituisce il ragionamento economico né l’evidenza cronologica successiva. Trattalo come una diagnosi documentata all’interno del processo di ricerca e conserva registri dei candidati e pipeline dei dati riproducibili.

Domande frequenti

Q1Il Deflated Sharpe Ratio è uno Sharpe da cui viene sottratta una penalità?

No. Il DSR è una statistica di tipo probabilistico costruita usando Sharpe selezionato, soglia corretta per la selezione, dimensione del campione, asimmetria e curtosi. La stima puntuale dello Sharpe riportato non viene sostituita da un rapporto scontato meccanicamente.

Q2Devo contare ogni combinazione di parametri come un tentativo indipendente?

No. Candidati simili possono avere rendimenti correlati, quindi la dimensione grezza della griglia può non coincidere con il numero effettivo di occasioni indipendenti per selezionare una stima elevata. Conserva il registro completo della ricerca e dichiara metodo e incertezza della dipendenza.

Q3Un DSR elevato dimostra che una strategia di trading funzionerà?

No. Il DSR è condizionato alla famiglia di candidati, ai dati, alla costruzione dei rendimenti, alle ipotesi sui tentativi e al modello campionario. Non corregge esperimenti omessi, errori di esecuzione, leakage, cambiamenti di regime o incertezza futura.

Fonti e approfondimenti

Segnala un problema

Prepareremo un’e-mail con il link a questo articolo. Mark riceverà la segnalazione solo dopo l’invio

Controllo rapido

Hai finito la guida? Verifica ciò che hai capito con 3 domande

Domanda 1 / 3

Domanda 01

Che cosa cambia quando il calcolo del Probabilistic Sharpe è alla base del DSR?

Scegli una risposta per vedere la spiegazione

Glossario delle opzioni