Test multipli e false discovery rate nella finanza
Comprendi confronti multipli, family-wise error, false discovery rate, Bonferroni, Holm, Benjamini–Hochberg, dipendenza, q-value, factor mining, selezione dei backtest e governance della ricerca
Risposta diretta
I test multipli emergono quando si cercano insieme molte ipotesi, strategie, fattori, asset, orizzonti o specifiche. Anche i p-value validi di singoli test generano allora vincitori dovuti al caso. Il family-wise error rate controlla la probabilità di almeno un rifiuto falso, mentre il false discovery rate controlla la quota falsa attesa tra i rifiuti sotto ipotesi dichiarate. È la famiglia di ricerca, non solo la tabella finale, a determinare il problema
Più test creano più vincitori casuali
Se m veri null indipendenti sono testati al livello α, la probabilità di almeno un rifiuto falso è 1−(1−α)^m
Con α=0.05 e m=20, questa probabilità è circa 64%, anche se ogni singolo test ha un tasso nominale di rifiuto falso del 5%
La dipendenza modifica il calcolo esatto, ma non giustifica il fingere che sia stato testato solo il vincitore riportato
La famiglia definisce la domanda sull'errore
Una famiglia di test può includere tutti i fattori, le trasformazioni, gli universi, i lag, gli orizzonti, i filtri, le scelte di modello e le riesecuzioni considerati per una singola tesi di ricerca
Definire la famiglia dopo aver visto i risultati sottostima la molteplicità e permette ai ricercatori di separare prove correlate finché la correzione diventa innocua
La famiglia difendibile segue il processo decisionale e l'opportunità di selezione, non semplicemente le righe che sopravvivono in un paper o in una dashboard
FWER e FDR controllano perdite diverse
Il family-wise error rate è la probabilità di effettuare almeno un rifiuto falso all'interno della famiglia
Il false discovery rate è E[V/max(R,1)], dove V è il numero di rifiuti falsi e R è il numero totale di rifiuti
Il FWER è più rigoroso quando qualsiasi affermazione falsa è costosa; l'FDR è spesso più potente quando lo screening di molti candidati può tollerare una quota falsa controllata
Le procedure richiedono le loro ipotesi
Bonferroni testa ogni ipotesi a α/m e controlla il FWER senza richiedere indipendenza, anche se può essere conservativo
Anche il metodo step-down di Holm controlla il FWER e non è mai meno potente della regola di rifiuto Bonferroni di base
Benjamini–Hochberg ordina i p-value e controlla l'FDR sotto indipendenza e alcune forme di dipendenza positiva; altre strutture di dipendenza richiedono metodi giustificati
I valori aggiustati non sono probabilità posteriori di verità
Un p-value aggiustato è il più piccolo livello di errore familiare al quale un'ipotesi verrebbe rifiutata con una procedura scelta
Un q-value viene comunemente interpretato come una soglia FDR minima stimata per dichiarare un risultato una scoperta, in funzione del metodo e delle ipotesi
Nessuna delle due quantità è automaticamente la probabilità che una strategia selezionata sia falsa; per questo serve un modello diverso e una diversa formulazione del condizionamento
La finanza nasconde una grande famiglia adattiva
Il factor mining, le regole tecniche, i segnali sulle opzioni, i dati alternativi, i vincoli di portafoglio e le ipotesi sui costi creano migliaia di prove correlate
I fattori pubblicati sono selezionati da ricerche passate, quindi valutare un nuovo fattore con un t-statistic isolato vicino a due ignora la pressione cumulativa delle scoperte
Asset e periodi condivisi rendono i test dipendenti, mentre il cambiamento di regime significa che una correzione per la selezione non può garantire la performance economica futura
La governance deve conservare il registro della ricerca
Registra ogni ipotesi, versione del codice, universo, risultato, trasformazione, ritardo, costo e scelta di arresto con un identificativo stabile della ricerca
Separa scoperta, conferma e monitoraggio live; congela le regole di conferma e usa dati realmente non toccati o una valutazione prospettica
Riporta evidenze grezze e aggiustate, definizione della famiglia, ipotesi sulla dipendenza, dimensioni degli effetti, costi, stabilità, idee rifiutate e deterioramento live
Domande frequenti
Qual è il problema dei test multipli?
È l'aumento delle false scoperte causato dal testare e selezionare tra molte ipotesi, giudicando poi i vincitori come se ogni test fosse isolato
Qual è la differenza tra FWER e FDR?
Il FWER controlla la probabilità di almeno un rifiuto falso; l'FDR controlla la proporzione falsa attesa tra tutti i rifiuti
Come funziona Benjamini–Hochberg?
Ordina i p-value, li confronta con soglie dipendenti dal rango e rifiuta fino al rango massimo che soddisfa il criterio sotto le ipotesi dichiarate
Il controllo dell'FDR rende affidabile una strategia di trading?
No. Affronta l'errore di selezione all'interno di una famiglia di test definita, non il cambiamento di regime, i costi, il leakage, il rischio di modello o la redditività futura