P-value e significatività statistica in finanza
Comprendi p-value, ipotesi nulla, statistiche del test, livelli di significatività, errori di Tipo I e Tipo II, potenza, dimensione dell'effetto, optional stopping, data snooping e interpretazione finanziaria
Risposta diretta
Un p-value è la probabilità, secondo un modello nullo e un piano di analisi specificati, di ottenere una statistica del test almeno altrettanto incompatibile con quel modello quanto quella osservata. Non è la probabilità che l'ipotesi nulla sia vera, la probabilità che un risultato si sia verificato per caso o la dimensione e l'importanza economica di un effetto. La significatività statistica è una regola decisionale, non una prova
Un test inizia prima del p-value
Specifica le ipotesi nulla e alternativa, la statistica del test, il modello di campionamento, la regola di arresto, la direzione della coda e il livello di significatività prima di esaminare il risultato
L'ipotesi nulla rappresenta spesso l'assenza di effetto o un valore di riferimento, ma può anche essere composita e contenere parametri di disturbo che richiedono una stima
Cambiare universo, orizzonte, controlli, regola per gli outlier o test dopo aver visto i dati cambia l'esperimento di cui si interpreta il p-value
Il p-value è condizionato da un modello
Sotto l'ipotesi nulla, la statistica del test ha una distribuzione di riferimento; il p-value misura quanto la statistica osservata penetra nella coda pertinente
Un valore piccolo indica incompatibilità tra i dati e l'intera impostazione del modello nullo, non quale ipotesi abbia fallito o se l'alternativa sia vera
Dipendenza mal specificata, code pesanti, eteroschedasticità, errori nei dati o selezione possono rendere non valide la distribuzione di riferimento e il p-value
Le soglie di significatività definiscono regole d'errore
Un livello α prestabilito limita la probabilità di rifiutare un'ipotesi nulla vera secondo le assunzioni del test, non la quota di affermazioni pubblicate che sono false
L'errore di Tipo I è un falso rifiuto; l'errore di Tipo II è la mancata reiezione di un'ipotesi nulla falsa e la potenza è la probabilità di rifiuto secondo un'alternativa specificata
Non rifiutare non dimostra l'assenza di effetto, soprattutto quando il campione ha bassa potenza per alternative economicamente significative
Dimensione dell'effetto e incertezza rispondono a domande diverse
Campioni grandi possono rendere statisticamente significativi effetti minuscoli, mentre piccoli campioni rumorosi possono non rilevare effetti abbastanza grandi da contare
Riporta stima dell'effetto, intervallo, unità, costi di transazione, capacità e soglia pratica insieme al p-value
Risultati appena sopra e appena sotto 0.05 di solito forniscono prove simili; trasformare quel confine in un interruttore netto di verità scarta informazioni
La flessibilità della ricerca distorce la significatività
Optional stopping, tentativi con molte specifiche, rimozione di osservazioni, cambio degli esiti e pubblicazione dei soli test riusciti alterano il comportamento dei falsi positivi
Il p-value nominale è valido solo per il percorso di analisi che lo ha generato, comprese regole sequenziali legittime o correzioni dichiarate in anticipo
Preregistrazione, registri completi della ricerca, analisi multiverso, holdout intatti e replicazione mostrano la sensibilità, ma non correggono un modello errato
La dipendenza finanziaria indebolisce i test da manuale
I rendimenti possono essere autocorrelati, dipendenti trasversalmente, eteroschedastici, sovrapposti e condizionati a un universo selezionato che è sopravvissuto
Errori standard iid ingenui possono gonfiare le t-statistiche, mentre la ricerca ripetuta di fattori e il backtesting creano una famiglia implicita di test molto più ampia
Usa errori standard e ricampionamenti giustificati dalla struttura delle serie temporali, poi verifica la stabilità tra regimi, attività, costi, ritardi e dati live
Le prove dovrebbero sostenere una decisione
Tratta il p-value come una diagnostica continua tra dimensione dell'effetto, incertezza, prove precedenti, meccanismo, performance predittiva e costi decisionali
Definisci in anticipo quale errore conta: un segnale di trading falso, un'esposizione al rischio mancata, una copertura instabile o un modello promosso senza valore economico
Riporta l'intera famiglia di analisi e le repliche fallite, così un singolo risultato significativo selezionato non viene scambiato per la solidità del programma di ricerca
Domande frequenti
Che cosa significa un p-value di 0.05?
Secondo il modello nullo specificato, i risultati almeno altrettanto incompatibili della statistica del test osservata si verificano con probabilità 0.05
Un p inferiore a 0.05 dimostra l'ipotesi alternativa?
No. Non assegna probabilità alle ipotesi e non esclude una specificazione errata, selezione, errori nei dati o un effetto economicamente trascurabile
Un p superiore a 0.05 dimostra che non esiste alcun effetto?
No. Significa che il test non ha rifiutato a quella soglia e può riflettere bassa potenza, rumore, un modello inadatto o un effetto realmente piccolo
Perché i p-value finanziari sono spesso sovrastimati?
Dipendenza, ricerca ripetuta di strategie, specifiche flessibili, campioni selezionati e costi irrealistici possono far apparire l'evidenza nominale più forte di quanto sia