White Reality Check e Hansen SPA per le regole di trading
Scopri come Reality Check e Hansen SPA valutano un’intera famiglia di regole tecniche rispetto a un benchmark, come costruiscono il bootstrap sotto l’ipotesi nulla e cosa significa il p-value globale.
In questa guidaLa regola migliore richiede un test sull’intera famiglia
Breve sintesi
Scegliere in un backtest la regola che ha reso di più dopo averne provate molte cambia la domanda statistica. Un test ordinario applicato alla sola vincitrice ignora la selezione. White Reality Check e Hansen SPA valutano invece l’intera famiglia rispetto a un benchmark. SPA standardizza le differenze e applica un centraggio della distribuzione nulla che dipende dai dati, così le alternative chiaramente scadenti incidono meno. Nessuno dei due test individua da solo una regola destinata a vincere in futuro.
La regola migliore richiede un test sull’intera famiglia
Se provi venti impostazioni e poi mostri soltanto quella con il rendimento storico più alto, non hai valutato una regola sola. Il risultato scelto riflette anche la ricerca: persino se nessuna variante possiede un vantaggio reale, una può sembrare ottima per puro caso nel campione storico. Un normale test t che tratti la vincitrice come se fosse stata scelta prima di osservare i dati non considera questo processo di selezione.
White ha sviluppato Reality Check per porre questa domanda di data snooping su tutta la famiglia esaminata. Sullivan, Timmermann e White hanno applicato il metodo a un ampio insieme di regole tecniche, mostrando perché occorre dichiarare da quale universo deriva il risultato. In seguito Hansen ha proposto il test di superior predictive ability, o SPA, che standardizza le differenze ed è meno sensibile alle regole scadenti e irrilevanti. Le fonti primarie sono White (2000), Sullivan, Timmermann e White (1999) e Hansen (2005).
Definisci prima il benchmark e la differenza di performance
Per ogni regola $k$ e data comune $t$, definiamo $d_{k,t}$ come il suo vantaggio rispetto al benchmark. Per i rendimenti si può usare $d_{k,t}=R_{k,t}-R_{0,t}$. Per gli errori di previsione si inverte l’ordine, ad esempio $d_{k,t}=L_{0,t}-L_{k,t}$, affinché un valore positivo favorisca la regola in entrambi i casi. La media di popolazione da valutare è $\mu_k=E[d_{k,t}]$.
Questa scelta stabilisce che cosa significhi «migliore»: rendimento lordo, rendimento netto dei costi, riduzione di una perdita o un’altra misura definita in anticipo. Tutte le regole devono avere lo stesso benchmark, la stessa frequenza, le stesse date di valutazione e la stessa convenzione dei segni. Le formule che seguono riguardano la media delle differenze. Se interessa una metrica non lineare, come lo Sharpe ratio, non basta sostituirla meccanicamente nelle equazioni: serve un’inferenza adatta a quella metrica.
L’ipotesi nulla include tutte le varianti provate
L’ipotesi nulla globale è $H_0:\max_{k=1,\ldots,K}\mu_k\leq0$: in media nessuna regola della famiglia supera il benchmark. L’alternativa afferma che almeno una regola ha un vantaggio medio positivo. È un test unilaterale sull’intera famiglia, non un test di uguaglianza fra tutte le regole.
La dimensione della famiglia dipende dalla ricerca effettiva, non solo dalle varianti rimaste nella tabella finale. Come esempio puramente aritmetico, 12 finestre di lookback, 4 filtri e 5 impostazioni di uscita generano $12\times4\times5=240$ varianti. È un esempio ipotetico, non un risultato né una stima di redditività. Se hai provato anche altri strumenti, soglie o ipotesi sui costi, quei tentativi fanno parte del processo da documentare.
Reality Check usa il confine nullo con tutte le medie a zero
Con $n$ osservazioni comuni e media campionaria $\bar d_k$, la statistica Reality Check usata qui è
$$T_{\mathrm{RC}}=\max_{k=1,\ldots,K}\sqrt{n}\,\bar d_k.$$
Il massimo descrive il vantaggio osservato più alto rispetto al benchmark. In questa definizione la statistica non viene troncata artificialmente a zero. Per approssimare la distribuzione sotto l’ipotesi nulla, si centra ciascuna serie di differenze sottraendo la propria media campionaria e si ricampionano i dati sul confine $\mu_k=0$ per tutti i candidati. Fra i casi ammessi dalla nulla, questa configurazione è la meno favorevole all’alternativa, ma può ridurre la potenza del test.
Il motivo è che una regola molto negativa resta nel massimo a ogni replica e può aumentare i quantili critici. La domanda prudente di White è se il miglior vantaggio del backtest sia abbastanza grande da superare quello che potrebbe emergere nel caso limite in cui tutti i vantaggi attesi siano nulli. Un p-value basso è evidenza contro l’ipotesi nulla globale della famiglia dichiarata; non valuta candidati che non sono stati inclusi nella ricerca.
SPA standardizza e centra la distribuzione nulla in base ai dati
SPA divide ciascuna media delle differenze per una stima della sua variabilità di lungo periodo, $\hat\omega_k$. La statistica è
$$T_{\mathrm{SPA}}=\max\left(0,\max_k\frac{\sqrt n\,\bar d_k}{\hat\omega_k}\right).$$
La standardizzazione rende confrontabili differenze con volatilità diversa. Il massimo esterno con zero fa parte della statistica SPA; non va aggiunto alla formula di Reality Check mostrata sopra. La stima di lungo periodo deve tenere conto della dipendenza temporale della serie differenziale e va quindi descritta nel resoconto.
Anche il centraggio è diverso. SPA calcola per ciascuna regola una correzione $\hat\mu_{c,k}$. Se la media standardizzata è sufficientemente negativa — per esempio al di sotto della soglia di Hansen $-\sqrt{2\log\log n}$ — la media negativa stimata viene mantenuta nella distribuzione bootstrap sotto la nulla. I candidati compatibili con il confine nullo vengono invece centrati a zero. Le regole chiaramente scadenti pesano così meno sui quantili critici, mentre si mantengono le alternative plausibili vicino al confine. Indica quale regola di centraggio e quale variante del p-value SPA hai usato.

Il bootstrap a blocchi deve conservare la dipendenza congiunta
A ogni data si osserva un vettore $(d_{1,t},\ldots,d_{K,t})$ che contiene le differenze di tutte le regole. Ogni replica bootstrap deve ricampionare righe vettoriali complete in blocchi temporalmente consecutivi. Ricampionare ogni regola in modo indipendente o estrarre singole date distrugge sia la correlazione fra le candidate sia la dipendenza temporale; il massimo risultante non rappresenta più lo stesso problema.
Il bootstrap stazionario di Politis e Romano (1994) estrae blocchi con lunghezze geometriche e lunghezza media scelta. Altri schemi appropriati usano blocchi consecutivi di dimensione fissa e sovrapposti. Le repliche vengono concatenate fino a raggiungere la lunghezza del campione originale. Entrambi i test presuppongono che il processo congiunto delle differenze sia sufficientemente stabile e debolmente dipendente. La scelta della lunghezza e le eventuali rotture strutturali possono cambiare il risultato: il ricampionamento non ripara un cambio di regime.
Un p-value globale non indica una regola vincente
Un risultato significativo con Reality Check o SPA indica che, date le ipotesi adottate, i dati forniscono evidenza che almeno una regola della famiglia documentata ha un vantaggio medio positivo rispetto al benchmark. Il p-value globale non è la probabilità che l’ipotesi nulla sia vera e nemmeno la probabilità che una regola specifica funzioni in futuro. Non stabilisce quale regola sia individualmente superiore. Per attribuire un vantaggio a un singolo candidato serve un’analisi ulteriore che tenga conto della selezione e, idealmente, nuovi dati.
Nell’esempio ipotetico con 240 varianti, il risultato migliore osservato potrebbe essere una fra le 240; il numero, da solo, non dice se la nulla venga respinta. Contano le differenze di rendimento effettive, il numero di osservazioni, la dipendenza congiunta e il bootstrap scelto. Un p-value, alto o basso, non corregge fasi di ricerca non dichiarate e non garantisce che la performance si mantenga.
FDR e intervalli di confidenza rispondono a domande diverse
La guida ai test multipli e al false discovery rate riguarda in genere una serie di ipotesi individuali e, sotto condizioni dichiarate, controlla la quota attesa di scoperte false fra quelle rifiutate. Reality Check e SPA affrontano invece una domanda globale sul massimo di una famiglia definita: ci sono evidenze che almeno un candidato superi il benchmark? Non producono automaticamente un elenco corretto di regole vincenti.
Anche un intervallo di confidenza con bootstrap a blocchi per una strategia fissata in anticipo risponde a un’altra domanda. La guida agli intervalli bootstrap dei rendimenti di strategia quantifica l’incertezza di una media o di un’altra statistica specificata. Se la strategia è stata scelta dopo aver cercato fra molte alternative, quell’intervallo non corregge automaticamente il bias di selezione. La procedura deve rispecchiare la domanda statistica.
La cross-validation purged affronta un problema diverso: ridurre la fuga temporale di informazioni tra le osservazioni di addestramento e quelle di test nei dati ordinati nel tempo. Non verifica se il massimo di una famiglia di regole supera il benchmark: questa è la domanda globale di RC e SPA. La guida alla Purged Cross-Validation e all’embargo spiega questa distinzione.
Costi, cronologia della ricerca e regimi restano essenziali
Le differenze sottoposte al test dovrebbero includere i costi pertinenti alle regole esaminate: commissioni, spread denaro-lettera, slippage, impatto di mercato, finanziamento, prestito di titoli e costo del capitale quando applicabile. Sottrarli solo dopo il test può trasformare un vantaggio lordo statisticamente positivo in un risultato senza valore economico. Anche ritardi di esecuzione, liquidità disponibile e dimensione delle posizioni modificano la performance realizzabile.
Un resoconto riproducibile descrive l’intera famiglia, i passaggi di selezione e filtraggio, le date e le fonti dei dati, il benchmark, la definizione di $d_{k,t}$, i costi, il metodo a blocchi, la regola per la lunghezza dei blocchi, il numero di repliche e la variante di p-value SPA. Ritoccare la regola dopo aver visto i risultati amplia la ricerca e va dichiarato. Se rotture strutturali modificano la distribuzione o la serie non è approssimativamente stazionaria e debolmente dipendente, questi bootstrap possono fuorviare. Sono test statistici di un disegno storico, non previsioni, garanzie o consigli finanziari personalizzati.
Domande frequenti
Q1Un test SPA significativo significa che la regola migliore è significativa da sola?
No. Il test valuta il massimo dell’intera famiglia esaminata. Il p-value globale non certifica una singola regola come vincitrice.
Q2SPA è sempre più potente di Reality Check?
No. Può essere meno sensibile a molte alternative scadenti o irrilevanti e avere più potenza in alcune situazioni, ma non domina in modo uniforme in ogni disegno.
Q3Questi test possono prevedere la performance futura?
No. Valutano una famiglia storica definita, sotto ipotesi sul processo congiunto. Cambi di regime, costi, nuove scelte di selezione e condizioni future possono cambiare i risultati.
Fonti e approfondimenti
Segnala un problema
Prepareremo un’e-mail con il link a questo articolo. Mark riceverà la segnalazione solo dopo l’invio
Controllo rapido
Hai finito la guida? Verifica ciò che hai capito con 3 domande
Domanda 01
Che cosa afferma l’ipotesi nulla globale di Reality Check e SPA?
Scegli una risposta per vedere la spiegazione