Tutte le guide sulle opzioni
Perché una soglia fallisce quando i ricercatori testano molte idee16 min di lettura

Test multipli e false discovery rate nella finanza

Comprendi confronti multipli, family-wise error, false discovery rate, Bonferroni, Holm, Benjamini–Hochberg, dipendenza, q-value, factor mining, selezione dei backtest e governance della ricerca

A cura di Mark · Fonti primarie qui sotto

Risposta diretta

I test multipli emergono quando si cercano insieme molte ipotesi, strategie, fattori, asset, orizzonti o specifiche. Anche i p-value validi di singoli test generano allora vincitori dovuti al caso. Il family-wise error rate controlla la probabilità di almeno un rifiuto falso, mentre il false discovery rate controlla la quota falsa attesa tra i rifiuti sotto ipotesi dichiarate. È la famiglia di ricerca, non solo la tabella finale, a determinare il problema

Più test creano più vincitori casuali

Se m veri null indipendenti sono testati al livello α, la probabilità di almeno un rifiuto falso è 1−(1−α)^m

Con α=0.05 e m=20, questa probabilità è circa 64%, anche se ogni singolo test ha un tasso nominale di rifiuto falso del 5%

La dipendenza modifica il calcolo esatto, ma non giustifica il fingere che sia stato testato solo il vincitore riportato

La famiglia definisce la domanda sull'errore

Una famiglia di test può includere tutti i fattori, le trasformazioni, gli universi, i lag, gli orizzonti, i filtri, le scelte di modello e le riesecuzioni considerati per una singola tesi di ricerca

Definire la famiglia dopo aver visto i risultati sottostima la molteplicità e permette ai ricercatori di separare prove correlate finché la correzione diventa innocua

La famiglia difendibile segue il processo decisionale e l'opportunità di selezione, non semplicemente le righe che sopravvivono in un paper o in una dashboard

FWER e FDR controllano perdite diverse

Il family-wise error rate è la probabilità di effettuare almeno un rifiuto falso all'interno della famiglia

Il false discovery rate è E[V/max(R,1)], dove V è il numero di rifiuti falsi e R è il numero totale di rifiuti

Il FWER è più rigoroso quando qualsiasi affermazione falsa è costosa; l'FDR è spesso più potente quando lo screening di molti candidati può tollerare una quota falsa controllata

Le procedure richiedono le loro ipotesi

Bonferroni testa ogni ipotesi a α/m e controlla il FWER senza richiedere indipendenza, anche se può essere conservativo

Anche il metodo step-down di Holm controlla il FWER e non è mai meno potente della regola di rifiuto Bonferroni di base

Benjamini–Hochberg ordina i p-value e controlla l'FDR sotto indipendenza e alcune forme di dipendenza positiva; altre strutture di dipendenza richiedono metodi giustificati

I valori aggiustati non sono probabilità posteriori di verità

Un p-value aggiustato è il più piccolo livello di errore familiare al quale un'ipotesi verrebbe rifiutata con una procedura scelta

Un q-value viene comunemente interpretato come una soglia FDR minima stimata per dichiarare un risultato una scoperta, in funzione del metodo e delle ipotesi

Nessuna delle due quantità è automaticamente la probabilità che una strategia selezionata sia falsa; per questo serve un modello diverso e una diversa formulazione del condizionamento

La finanza nasconde una grande famiglia adattiva

Il factor mining, le regole tecniche, i segnali sulle opzioni, i dati alternativi, i vincoli di portafoglio e le ipotesi sui costi creano migliaia di prove correlate

I fattori pubblicati sono selezionati da ricerche passate, quindi valutare un nuovo fattore con un t-statistic isolato vicino a due ignora la pressione cumulativa delle scoperte

Asset e periodi condivisi rendono i test dipendenti, mentre il cambiamento di regime significa che una correzione per la selezione non può garantire la performance economica futura

La governance deve conservare il registro della ricerca

Registra ogni ipotesi, versione del codice, universo, risultato, trasformazione, ritardo, costo e scelta di arresto con un identificativo stabile della ricerca

Separa scoperta, conferma e monitoraggio live; congela le regole di conferma e usa dati realmente non toccati o una valutazione prospettica

Riporta evidenze grezze e aggiustate, definizione della famiglia, ipotesi sulla dipendenza, dimensioni degli effetti, costi, stabilità, idee rifiutate e deterioramento live

Domande frequenti

Qual è il problema dei test multipli?

È l'aumento delle false scoperte causato dal testare e selezionare tra molte ipotesi, giudicando poi i vincitori come se ogni test fosse isolato

Qual è la differenza tra FWER e FDR?

Il FWER controlla la probabilità di almeno un rifiuto falso; l'FDR controlla la proporzione falsa attesa tra tutti i rifiuti

Come funziona Benjamini–Hochberg?

Ordina i p-value, li confronta con soglie dipendenti dal rango e rifiuta fino al rango massimo che soddisfa il criterio sotto le ipotesi dichiarate

Il controllo dell'FDR rende affidabile una strategia di trading?

No. Affronta l'errore di selezione all'interno di una famiglia di test definita, non il cambiamento di regime, i costi, il leakage, il rischio di modello o la redditività futura

Fonti e approfondimenti

Guide correlate