Test di Diebold–Mariano: confronto della precisione delle previsioni
Scopri cosa confronta il test di Diebold–Mariano, come differenze di perdita e correlazione seriale entrano nella statistica e perché la precisione previsiva non equivale a profitti di trading.
In questa guidaIl test confronta la perdita attesa delle previsioni
Breve sintesi
Il test di Diebold–Mariano (DM) chiede se due procedure di previsione abbiano la stessa perdita attesa sugli stessi risultati osservati. Usa una serie di differenze di perdita, quindi funzione di perdita, orizzonte e dipendenza tra date influiscono sull'esito. Il rifiuto dell'ipotesi nulla sostiene l'esistenza di una differenza secondo il disegno di valutazione specificato; non dimostra che un modello resterà superiore né che una strategia sarà redditizia al netto dei costi.
Il test confronta la perdita attesa delle previsioni
Il test di Diebold–Mariano confronta due previsioni dello stesso obiettivo nelle stesse date di valutazione. A ogni origine entrambe le procedure devono riferirsi allo stesso risultato realizzato, allo stesso orizzonte e allo stesso istante limite delle informazioni. Il test valuta poi se la perdita media di una procedura differisce sistematicamente da quella dell'altra, ammettendo che le differenze di perdita varino nel tempo.
Diebold e Mariano formulano il quesito per una funzione di perdita generale, non soltanto per l'errore quadratico medio. Il loro articolo originale sviluppa test dell'ipotesi nulla secondo cui previsioni concorrenti hanno uguale accuratezza predittiva (Diebold e Mariano, 1995). Qui «accuratezza» significa minore perdita attesa in base alla funzione scelta per il confronto. Non significa che una previsione sia vera, spieghi causalmente il risultato, sia ben calibrata in ogni parte della distribuzione o sia utile per ogni decisione.
Supponiamo che i modelli A e B prevedano lo stesso rendimento futuro nello stesso momento. Il test DM non verifica se un coefficiente di uno dei due modelli sia pari a zero, né se i valori stimati coincidano nel campione di stima. Confronta come gli errori previsivi si traducono nella perdita scelta nel campione di valutazione.
Il disegno va definito prima di interpretare la statistica. Obiettivo, origini delle previsioni, orizzonte, funzione di perdita, gestione dei risultati mancanti, calendario di ristima e alternativa unilaterale o bilaterale determinano la domanda sottoposta a verifica. Se queste scelte differiscono tra i modelli, la differenza di perdita non rappresenta più un confronto a parità di condizioni.
Definisci previsioni appaiate e una differenza di perdita
Sia $y_t$ il valore realizzato dell'obiettivo all'origine di previsione $t$ e siano $\hat y_{A,t}$ e $\hat y_{B,t}$ le previsioni dei modelli A e B. Gli errori sono $e_{A,t}=y_t-\hat y_{A,t}$ e $e_{B,t}=y_t-\hat y_{B,t}$. Data una funzione di perdita $L$, la differenza di perdita alla data è:
$$ d_t=L(e_{A,t})-L(e_{B,t}) $$
Con questa convenzione dei segni, una media di $d_t$ negativa indica che A ha avuto una perdita osservata minore; una media positiva indica che la perdita di B è stata minore. L'ipotesi nulla nella popolazione è $E[d_t]=0$. L'alternativa bilaterale cerca una differenza in entrambe le direzioni, mentre quella unilaterale indica una direzione scelta in anticipo. Non scegliere la direzione dopo aver visto quale modello ha vinto.
Con la perdita quadratica $L(e)=e^2$, gli errori grandi pesano in misura sproporzionata. Con la perdita assoluta $L(e)=|e|$, la graduatoria è meno dominata da un singolo errore ampio. La perdita quantile può adattarsi a un obiettivo asimmetrico; altre perdite mirano ad aspetti diversi della capacità predittiva. Cambiando funzione, l'ordine dei modelli può invertirsi: «previsione migliore» non ha un significato univoco finché non si specifica la perdita. Anche la rassegna di Tashman sui test previsivi fuori campione sottolinea che la valutazione deve corrispondere al problema affrontato (Tashman, 200000065-0)).
Usa le stesse origini di previsione e gli stessi risultati per entrambi i modelli. Se manca per un modello proprio una data difficile, eliminarla in silenzio solo per quel modello cambia il campione di confronto. Se in produzione il modello verrebbe ristimato ogni mese con dati nuovi, genera le previsioni di valutazione secondo la stessa regola; un esercizio con parametri fissi risponde a un'altra domanda. Una valutazione sequenziale come la validazione walk-forward definisce come produrre previsioni successive senza usare dati futuri.
Un esempio con quattro origini chiarisce la differenza media
Considera quattro origini di previsione ipotetiche e misura l'obiettivo e gli errori in punti percentuali. Gli errori di A sono $[1,2,0,1]$, quelli di B sono $[2,1,1,1]$. Ogni coppia riguarda lo stesso rendimento realizzato e lo stesso intervallo previsivo. I numeri sono inventati solo per mostrare il calcolo.
Con la perdita quadratica, le perdite di A sono $[1,4,0,1]$ e il suo errore quadratico medio è $(1+4+0+1)/4=1.50$ punti percentuali al quadrato. Le perdite di B sono $[4,1,1,1]$ e il suo errore quadratico medio è $(4+1+1+1)/4=1.75$. Su questi quattro risultati, l'MSE di A è inferiore di 0.25 punti percentuali al quadrato.
Le differenze per data $d_t=L(e_{A,t})-L(e_{B,t})$ sono $[-3,3,-1,0]$. La loro media è $(-3+3-1+0)/4=-0.25$, ossia la differenza tra MSE medio di A e quello di B. Il segno negativo favorisce A con questa convenzione. Non dice ancora se la differenza supera il rumore campionario: quattro coppie di previsioni non bastano come prova statistica convincente.
Anche la definizione della perdita cambia cosa significa «migliore». In un altro esempio ipotetico, C ha errori assoluti $[0,0,0,3]$ e D ha $[1,1,1,1]$. Con la perdita assoluta le medie sono 0.75 per C e 1 per D, quindi si preferisce C. Con la perdita quadratica le medie sono 2.25 per C e 1 per D, quindi si preferisce D. Il test non può risolvere il disaccordo senza decidere quali errori contano di più.
<!-- Illustration placement: after this section; text-free conceptual scene showing two forecast paths against one realized path, with visibly different miss distances and no labels or numerical claims. -->
La statistica DM rapporta lo scarto medio di perdita alla sua incertezza
La differenza media campionaria di perdita è $\bar d=T^{-1}\sum_{t=1}^{T}d_t$, dove $T$ è il numero di risultati previsivi appaiati. Il suo errore standard dipende dalla varianza di lungo periodo di $d_t$, non soltanto dalla varianza a una singola data. Una forma generale della statistica è:
$$ DM=\frac{\bar d}{\sqrt{\widehat{\Omega}/T}} $$
$\widehat{\Omega}$ stima la varianza di lungo periodo della serie delle differenze di perdita. Se le date fossero indipendenti, con lo stimatore scelto si ridurrebbe alla varianza di $d_t$. Le perdite previsive però spesso si raggruppano: in una fase di alta volatilità possono aumentare gli errori di entrambi i modelli, e un obiettivo a $h$ passi può far condividere rendimenti realizzati a finestre di errore adiacenti. Ignorare una dipendenza positiva può sottostimare l'errore standard e far sembrare le evidenze più forti.
Una costruzione HAC comune stima le autocovarianze $\hat\gamma_k$ della differenza di perdita centrata e le combina come $\widehat{\Omega}=\hat\gamma_0+2\sum_{k=1}^{q}w_k\hat\gamma_k$. Con i pesi di Bartlett fino alla banda $q$, $w_k=1-k/(q+1)$. Newey e West hanno sviluppato uno stimatore di covarianza semidefinito positivo e consistente per eteroschedasticità e autocorrelazione (Newey e West). Kernel e banda sono scelte d'implementazione: dichiarale e sceglile in base al disegno previsivo, non per ottenere un p-value preferito. La guida agli errori standard HAC tratta il problema generale della stima della covarianza.
In condizioni regolari, la statistica DM standard viene confrontata asintoticamente con una normale standard. Un valore assoluto grande indica che lo scarto medio osservato è ampio rispetto all'incertezza stimata. Il segno identifica quale modello ha avuto perdita minore nell'ordine definito; il p-value non misura l'entità né il valore economico della differenza. Non è neppure la probabilità che l'ipotesi nulla sia vera o che la previsione funzioni in futuro.
Le previsioni a più passi si sovrappongono e la dimensione finita del campione conta
Quando si prevede a ogni periodo un obiettivo a più periodi di distanza, le finestre di valutazione si sovrappongono. Una previsione mensile del rendimento cumulato dei tre mesi successivi condivide, per esempio, due rendimenti mensili su tre con la previsione emessa un mese dopo. Anche se i rendimenti mensili fossero indipendenti, la sovrapposizione può indurre correlazione seriale negli errori previsivi e nelle relative differenze di perdita.
In un'impostazione base a $h$ passi, la varianza dovrebbe includere almeno la dipendenza fino al ritardo $h-1$. Non è una regola universale per la banda: ristime mobili, obiettivi persistenti, raggruppamenti della volatilità e funzione di perdita possono produrre ulteriore dipendenza. Registra orizzonte, distanza tra origini e motivazione per la troncatura HAC o per un altro stimatore di varianza. Il numero di righe di previsione non equivale automaticamente a osservazioni indipendenti.
Il test asintotico originale può avere una dimensione effettiva inadeguata in campioni moderati. Harvey, Leybourne e Newbold propongono una correzione a campione finito per confrontare gli errori quadratici medi di previsione (HLN, 199700719-4)). Una forma comune per orizzonte $h$ e $T$ previsioni moltiplica la statistica DM per:
$$ DM_{HLN}=DM\sqrt{\frac{T+1-2h+h(h-1)/T}{T}} $$
La statistica modificata viene in genere confrontata con una distribuzione $t$ con $T-1$ gradi di libertà. Con $T=60$ e $h=5$, il moltiplicatore è circa $0.925$. L'esempio mostra solo il calcolo della correzione: non dice che 60 osservazioni bastino per uno specifico modello né che le ipotesi siano soddisfatte. La correzione affronta un problema definito di piccolo campione; non corregge leakage, obiettivi non validi, dipendenza non modellata, selezione ripetuta dei modelli o una funzione di perdita mal specificata.
I modelli annidati richiedono un ragionamento diverso per il confronto previsivo
Il modello A può essere una versione vincolata del modello B; per esempio, B può aggiungere predittori ad A. Anche sotto l'ipotesi nulla in cui i predittori extra non abbiano valore previsivo nella popolazione, i loro coefficienti stimati possono aggiungere rumore alle previsioni di B. Il modello più ampio potrebbe quindi avere un MSE osservato maggiore anche se le variabili aggiuntive non migliorano il processo previsivo sottostante. La logica usuale di uguale accuratezza per modelli concorrenti non annidati non si applica automaticamente senza modifiche.
Clark e West sviluppano test approssimativamente normali di uguale accuratezza predittiva nei modelli annidati e correggono il confronto degli errori quadratici per il rumore di stima introdotto dal modello più ampio (Clark e West, 2007). La loro correzione non sostituisce universalmente tutti i test DM: è progettata per uno specifico quesito sui modelli annidati, una determinata perdita e una certa impostazione asintotica. Verifica se un modello ne annida un altro e scegli un test con distribuzione nulla coerente col disegno. Non assumere che il p-value DM standard fornito dal software gestisca ogni relazione tra modelli.
Contano anche altre distinzioni. Una previsione con MSE inferiore potrebbe non migliorare la copertura degli intervalli, la calibrazione probabilistica, l'accuratezza direzionale o una decisione successiva. Un confronto può essere fuori campione ma usare comunque un holdout non valido, esaminato ripetutamente durante lo sviluppo del modello. Dichiara la relazione tra i modelli, il metodo di stima, l'orizzonte e quali dati erano disponibili quando è stata generata ogni previsione.
La precisione previsiva non equivale a un vantaggio nel trading
Un risultato DM valuta una perdita previsiva. Una decisione di trading valuta un processo di rendimenti e rischio. Un MSE più basso per i rendimenti del periodo successivo non garantisce che un segnale indichi abbastanza spesso il verso giusto, dimensioni correttamente le posizioni o resista a turnover, spread, impatto di mercato, commissioni, prestito titoli, funding e ritardi d'esecuzione. Al contrario, una previsione con errore quadratico medio leggermente peggiore può migliorare una decisione se è più accurata nei momenti di maggiore esposizione della strategia. Per sostenere questa affermazione, la perdita potrebbe dover riflettere la decisione concreta invece di una metrica previsiva generica e comoda.
Anche una differenza statisticamente significativa può essere economicamente minima. Riporta l'entità della differenza media in unità interpretabili insieme all'incertezza, non soltanto un p-value o l'etichetta di vincitore. Se si affermano risultati di portafoglio, applica di nuovo l'intera regola decisionale bloccata a dati successivi adatti, con ipotesi di trading realistiche, e comunica separatamente gli esiti netti. Il test DM non calcola tali esiti né contabilizza i costi, a meno che la perdita non sia stata esplicitamente costruita per includerli.
Il test non corregge nemmeno la ricerca tra molti modelli, obiettivi, orizzonti, funzioni di perdita, intervalli temporali o regole di trading seguita dalla pubblicazione del confronto più favorevole. Ripetere confronti a coppie crea un problema di selezione proprio. Conserva il registro della ricerca e applica un metodo per test multipli adatto alla famiglia di affermazioni. La guida a test multipli e false discovery rate illustra perché le soglie abituali possono trarre in inganno dopo una ricerca ampia. DM è uno strumento di valutazione, non una correzione per data snooping.
Riporta dettagli sufficienti per riprodurre il confronto
Un resoconto chiaro indica obiettivo e unità, limite informativo, origini previsive, orizzonte, calendario di ristima e campione comune di valutazione. Specifica la funzione di perdita e il segno di $d_t$, riporta la perdita media di ogni modello e la differenza media, identifica l'ipotesi unilaterale o bilaterale scelta in anticipo e documenta stimatore di varianza, kernel, banda, statistica, distribuzione di riferimento, p-value e, se pertinente, intervallo di confidenza o misura dell'incertezza.
Dichiara anche se i modelli sono annidati, come hai gestito risultati mancanti e valori estremi, quante specifiche alternative hai esaminato e se il periodo di valutazione ha influenzato le scelte del modello. Mostra l'entità della differenza, non solo se ha superato una soglia. Una serie temporale di $d_t$ o un grafico delle differenze di perdita cumulative può rivelare cambiamenti di regime nascosti dalla media complessiva, ma il grafico non sostituisce un'inferenza che tenga conto della dipendenza.
Nel trading quantitativo, descrivi anche il passaggio dalla previsione all'azione: soglia del segnale, dimensionamento della posizione, tempi di ribilanciamento, controlli del rischio, prezzo d'esecuzione e ipotesi sui costi. Il test DM confronta soltanto la serie di perdite previsive che riceve. Non certifica la pipeline dei dati, non rende comparabili campioni di valutazione diversi, non dimostra causalità e non garantisce la persistenza delle classifiche storiche. Usalo come parte trasparente della valutazione del modello, insieme a un disegno previsivo rispettoso dell'ordine temporale e a una valutazione esplicita a livello decisionale.
Domande frequenti
Q1Il test di Diebold–Mariano confronta i coefficienti dei modelli?
No. Confronta la perdita attesa degli errori prodotti da due procedure di previsione sugli stessi risultati appaiati. Un test sui coefficienti risponde a una domanda diversa relativa a un parametro del modello.
Q2Posso usare il test per previsioni a più periodi?
Sì, ma le finestre obiettivo sovrapposte possono rendere dipendenti nel tempo differenze di perdita successive. Usa una stima della varianza e, se opportuno, una correzione a campione finito adeguate a orizzonte e disegno del modello; documenta le scelte.
Q3Un risultato significativo significa che la previsione migliore farà guadagnare?
No. Sostiene una differenza nella perdita previsiva scelta secondo il disegno di valutazione. La redditività dipende anche da come le previsioni diventano posizioni, dal rischio assunto e dai costi e dall'esecuzione effettivi.
Fonti e approfondimenti
Segnala un problema
Prepareremo un’e-mail con il link a questo articolo. Mark riceverà la segnalazione solo dopo l’invio
Controllo rapido
Hai finito la guida? Verifica ciò che hai capito con 3 domande
Domanda 01
Qual è l'ipotesi nulla nel confronto base di Diebold–Mariano?
Scegli una risposta per vedere la spiegazione
Glossario delle opzioni
Variation in the conditional error variance across regressor values or states, invalidating an equal-variance covariance formula.
Leggi la guida completaFamily-wise error rateThe probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
Leggi la guida completa