Skip to content
Tutte le guide sulle opzioni
Valutazione dell’accuratezza delle previsioni14 min di lettura

Test di Diebold–Mariano: come confrontare l’accuratezza delle previsioni

Scopri come il test di Diebold–Mariano confronta le perdite previsive appaiate, gestisce orizzonti sovrapposti e perché un p-value basso non dimostra abilità di trading.

In questa guidaUn errore di backtest inferiore non dimostra ancora una previsione migliore

Breve sintesi

Il test di Diebold–Mariano confronta due previsioni osservando la differenza tra le rispettive perdite sugli stessi valori realizzati. Il risultato dipende dalla funzione di perdita, dal campione di valutazione, dall’orizzonte previsivo e dalla stima dell’incertezza. Un errore campionario inferiore non è automaticamente prova di una migliore accuratezza attesa, e una maggiore accuratezza previsiva non equivale a una strategia di trading redditizia.

Un errore di backtest inferiore non dimostra ancora una previsione migliore

Supponiamo che due modelli prevedano gli stessi rendimenti, la stessa volatilità o la stessa variabile economica nelle medesime date. Nel campione di valutazione, l’errore medio del modello A è inferiore a quello del modello B. Questo descrive il campione, ma non dice se A sia sistematicamente più accurato o se il divario osservato possa dipendere dalla normale variabilità delle date finite nel test.

Il test di Diebold–Mariano (DM) trasforma il confronto in una serie temporale appaiata. A ogni origine previsiva, confronta entrambe le previsioni con lo stesso valore realizzato, assegna un punteggio usando una funzione di perdita scelta in anticipo e analizza la sequenza delle differenze di perdita. L’appaiamento conta: una giornata di mercato volatile può aumentare le perdite di entrambi i modelli, mentre il confronto verifica quale dei due tenda a perdere meno proprio in quelle stesse giornate.

Il quadro originale non si limita all’errore quadratico né richiede errori previsivi distribuiti normalmente. Può confrontare diverse funzioni di perdita, anche asimmetriche, se i punteggi sono coerenti con la domanda previsiva. Occorrono comunque un disegno di valutazione difendibile e una stima dell’incertezza della differenza media di perdita. Diebold e Mariano (1995) presentano il test di uguaglianza dell’accuratezza predittiva; Harvey, Leybourne e Newbold (1997)00719-4) studiano una modifica per campioni piccoli.

Confronta elementi omogenei prima di calcolare una statistica

Ogni riga dovrebbe rappresentare un’origine previsiva confrontabile. Entrambi i modelli devono prevedere lo stesso obiettivo e lo stesso orizzonte, usando le informazioni disponibili a quell’origine. Prima di confrontare le perdite, allinea valori realizzati, date e orari, valuta o unità, versione dei dati e regole per le osservazioni mancanti. Se un modello prevede la chiusura di domani e l’altro una media su cinque giorni, gli errori rispondono a domande diverse.

Usa previsioni generate senza informazioni future. Un holdout cronologico o una valutazione pseudo-out-of-sample mobile possono aiutare, ma la sola separazione non basta se lo stesso holdout è stato riutilizzato per ottimizzare caratteristiche, soglie o varianti del modello. Conserva la previsione effettivamente formulata a ogni origine storica, insieme alla versione dei dati e del modello che l’ha prodotta. Dati macroeconomici rivisti, filtri di survivorship bias o rettifiche societarie basate su eventi futuri possono altrimenti modificare la valutazione a posteriori.

Valuta i due modelli sullo stesso insieme di origini. Eliminare le date difficili per un modello ma non per l’altro compromette il confronto appaiato. Se mancano previsioni, definisci un campione comune oppure motiva il trattamento dei valori mancanti; non lasciare in silenzio che i modelli affrontino regimi di mercato diversi. Scegli date iniziale e finale prima di verificare quale intervallo produca il risultato preferito.

La funzione di perdita definisce cosa significa “più accurato”

Indichiamo con yₜ il valore realizzato all’origine t e con ŷA,ₜ e ŷB,ₜ le previsioni dei modelli. Gli errori sono eA,ₜ = yₜ − ŷA,ₜ ed eB,ₜ = yₜ − ŷB,ₜ. Una funzione di perdita L trasforma ogni errore in un punteggio, per cui un valore inferiore è migliore. La perdita quadratica, L(e) = e², penalizza maggiormente gli errori grandi. La perdita assoluta, L(e) = |e|, cresce in modo lineare con l’errore. Una previsione quantilica può usare invece una perdita pinball asimmetrica, perché sottostimare e sovrastimare comportano costi diversi.

La scelta del punteggio può cambiare quale modello sembri migliore. Consideriamo due coppie ipotetiche di errori espressi nelle stesse unità: gli errori di A sono 0 e 2; quelli di B sono 1 e 1. Con la perdita quadratica, le perdite medie sono rispettivamente 2 e 1, quindi B ottiene un punteggio migliore. Con la perdita assoluta, la media è 1 per entrambi. Nessun calcolo è universalmente corretto: ciascuno risponde a una domanda diversa sugli errori che contano.

Per le previsioni dei rendimenti, l’errore quadratico può essere utile per una previsione della media condizionata; una previsione di volatilità richiede un punteggio adatto al suo obiettivo, mentre una previsione di Value-at-Risk richiede un punteggio quantilico o un backtest specifico per il rischio. Scegliere la funzione di perdita dopo aver visto quale modello vince trasforma il test in un’ulteriore ricerca. Definisci il punteggio e la direzione di “migliore” prima di esaminare il confronto.

Una previsione VaR riguarda un quantile di coda, non una normale previsione puntuale. La guida al backtesting VaR spiega come i test di frequenza e di tempistica delle eccezioni valutino separatamente questa previsione di rischio.

Costruisci le differenze di perdita appaiate e dichiara l’ipotesi nulla

Per una funzione di perdita in cui un valore inferiore è migliore, definiamo la differenza nel periodo t come

dₜ = L(eA,ₜ) − L(eB,ₜ)

Con questa convenzione del segno, un dₜ positivo significa che A ha subito una perdita maggiore e quindi B ha avuto una perdita inferiore in quell’origine; un valore negativo favorisce A. La media campionaria è d̄ = (1/n) Σ dₜ. L’ipotesi nulla di uguaglianza incondizionata dell’accuratezza è E[dₜ] = 0. L’alternativa bilaterale chiede se le perdite attese differiscano in una delle due direzioni. Un’alternativa unilaterale definita in anticipo può chiedere se un modello specifico abbia una perdita attesa inferiore.

La statistica di base è

DM = d̄ / √(Ŝd / n)

Qui Ŝd stima la varianza di lungo periodo della serie delle differenze di perdita, non soltanto la varianza degli errori previsivi di uno dei due modelli. Sotto l’ipotesi nulla e condizioni di regolarità adeguate, la statistica è asintoticamente normale standard. Valori positivi elevati favoriscono B secondo la convenzione indicata; valori negativi elevati favoriscono A. Il p-value misura la compatibilità con l’ipotesi nulla e le assunzioni di campionamento specificate, non la probabilità che uno dei modelli sia vero.

L’appaiamento elimina le differenze irrilevanti nelle scale complessive degli errori dei due modelli solo nella misura in cui sono catturate dalle differenze per origine. Non rende indipendente la serie delle perdite, non elimina automaticamente l’incertezza dovuta alla stima dei parametri e non corregge una ricerca tra molti obiettivi e specifiche. Queste scelte fanno parte del disegno e del calcolo dell’incertezza.

Un esempio a un passo distingue il divario campionario dalle evidenze

Supponiamo di avere 100 previsioni ipotetiche appaiate a un passo. La perdita quadratica media del modello A è 0.26 e quella del modello B è 0.23, in punti percentuali al quadrato. La differenza media è quindi d̄ = 0.26 − 0.23 = 0.03, a favore di B. Per semplicità, assumiamo che la varianza stimata di lungo periodo di dₜ sia 0.04 e che non vi sia covarianza seriale tra le origini.

L’errore standard stimato della differenza media è √(0.04 / 100) = 0.02. La statistica non corretta è 0.03 / 0.02 = 1.50. Per h = 1 e T = 100, il fattore di correzione per campioni piccoli di Harvey–Leybourne–Newbold è √[(T + 1 − 2h + h(h − 1)/T) / T] = √0.99 ≈ 0.995. Il prodotto dà una statistica corretta di circa 1.49; usando come riferimento approssimato una distribuzione t₉₉, il p-value bilaterale è circa 0.14.

B ha un errore quadratico medio osservato più basso, ma questo esempio non offre evidenze forti contro l’uguaglianza dell’accuratezza attesa alle soglie convenzionali di significatività. La mancata reiezione non dimostra che i modelli siano ugualmente accurati; anche una reiezione resta condizionata al punteggio, alle origini e alle assunzioni scelte. Il valore della varianza e tutte le perdite sono input ipotetici a fini didattici, non risultati empirici.

Le radici quadrate delle due perdite quadratiche medie corrispondono a root mean squared error (RMSE) di circa 0.510 e 0.480 punti percentuali, con uno scarto descrittivo di 0.030. La statistica DM, tuttavia, verifica le differenze appaiate delle perdite quadratiche; non è un test t sulla differenza fra le due radici.

Schema concettuale in tre pannelli: due linee previsive confrontate con lo stesso percorso realizzato, indicatori di perdita appaiati per origine e barre con segno delle differenze di perdita intorno alla media e a una banda di incertezza.
Illustrazione concettuale del confronto tra due previsioni sullo stesso percorso realizzato e della sintesi delle differenze di perdita appaiate. Non rappresenta dati di mercato né risultati empirici del test.

Gli orizzonti sovrapposti rendono dipendenti le differenze di perdita

Se le previsioni a cinque giorni vengono emesse ogni giorno, due previsioni adiacenti condividono quattro dei cinque giorni obiettivo. Gli errori, le perdite e le differenze di perdita possono quindi muoversi insieme. Trattare 100 origini previsive giornaliere come 100 confronti indipendenti può sottostimare l’incertezza e far apparire la statistica troppo elevata.

La varianza di lungo periodo tiene conto della covarianza seriale in dₜ. Un comune stimatore consistente rispetto a eteroschedasticità e autocorrelazione (HAC) ha la forma

Ŝd = γ̂₀ + 2 Σₖ₌₁ᵐ wₖ γ̂ₖ

dove γ̂ₖ è l’autocovarianza campionaria di d al ritardo k, wₖ è un peso del kernel e m è la banda scelta. Newey e West (1987) presentano uno stimatore HAC della covarianza semidefinito positivo. Per errori previsivi ideali a h passi e sotto le ipotesi pertinenti, la sovrapposizione spesso genera dipendenza per almeno h − 1 ritardi; l’impostazione DM originale discute uno stimatore troncato per quel caso. Nei dati reali la dipendenza può durare più a lungo per obiettivi persistenti, stime mobili o costruzione della strategia: h − 1 non è quindi una regola universale per la banda.

Dichiara orizzonte, kernel, banda e ogni correzione per campioni piccoli. Mostra se le conclusioni cambiano con impostazioni di dipendenza ragionevoli, anziché scegliere una banda perché produce il p-value preferito. Se le origini di valutazione sono distanziate per evitare sovrapposizioni, spiega questa scelta e quale informazione o dimensione campionaria sacrifichi. L’incertezza che considera la dipendenza è parte del test, non un’opzione di visualizzazione.

Modelli annidati e abilità previsiva variabile richiedono domande diverse

Il confronto DM usuale si interpreta più facilmente quando, sotto l’ipotesi nulla di pari accuratezza, le previsioni non sono annidate. Se un modello più grande contiene un benchmark più piccolo, i coefficienti aggiuntivi stimati possono introdurre rumore previsivo anche quando i loro valori veri sono nulli. In tal caso, la differenza tra gli errori quadratici medi può avere una distribuzione nulla non standard. Per confronti di MSPE out-of-sample tra modelli annidati, un metodo come la correzione di Clark–West tiene conto di questo effetto del rumore di stima; non è un sostituto generale del DM in ogni disegno. Vedi Clark e West (2007).

L’ipotesi nulla DM ordinaria riguarda la perdita media incondizionata sull’intero campione di valutazione. Può nascondere cambiamenti nel tempo: A può fare meglio nei periodi tranquilli e B in quelli volatili, con medie complessive simili. Se la domanda è se l’accuratezza relativa dipenda dalle informazioni disponibili alla data della previsione, i test di capacità previsiva condizionale combinano le differenze di perdita con strumenti definiti in anticipo. Giacomini e White (2006) sviluppano questo quadro. Le ipotesi e la finestra di valutazione contano; aggiungere indicatori arbitrari dopo aver esaminato i risultati non è una scorciatoia valida.

La scelta del test deve seguire la struttura del confronto: previsioni indipendenti, modelli annidati, capacità condizionale variabile o una famiglia selezionata tra molti candidati sono casi diversi. Per quest’ultimo, la guida al Reality Check di White e allo SPA di Hansen spiega la correzione a livello di famiglia dopo aver cercato fra molte regole di trading.

Una perdita previsiva inferiore non dimostra una strategia redditizia

Una previsione può essere statisticamente più accurata senza migliorare i risultati netti di trading. Una strategia deve trasformare la previsione in una posizione, decidere quando operare e sostenere spread, commissioni, slippage, impatto sul mercato, finanziamento, prestito titoli e limiti di rischio. Un piccolo miglioramento dell’errore quadratico medio dei rendimenti può non essere utile per le decisioni, mentre un modello con errore medio leggermente peggiore potrebbe individuare meglio un evento di coda importante per una specifica regola.

Mantieni separate la valutazione delle previsioni e quella del portafoglio. Prima verifica la previsione rispetto a un obiettivo e a una perdita coerenti con il compito dichiarato. Poi valuta una regola di trading definita completamente su dati che non sono serviti a selezionare la previsione, usando ipotesi realistiche di esecuzione e finanziamento. Il p-value di un test previsivo non è un rendimento di backtest, un indice di Sharpe o una probabilità di profitto futuro.

Provare ripetutamente modelli, obiettivi, orizzonti, funzioni di perdita e finestre campionarie crea bias di selezione, anche se ogni calcolo DM individuale è corretto. Registra la ricerca completa e usa un metodo a livello di famiglia quando la domanda è se almeno un candidato sia sopravvissuto alla selezione. La guida al block bootstrap tratta l’incertezza che preserva la dipendenza per una statistica prespecificata; da solo non corregge la ricerca non documentata tra molti modelli.

Riporta dettagli sufficienti perché un altro ricercatore possa replicare l’analisi

Indica i due modelli, la relazione con il benchmark, l’obiettivo, l’orizzonte, la sequenza delle origini previsive, le date di valutazione, l’insieme informativo, la versione dei dati e la regola per il campione comune. Definisci matematicamente la funzione di perdita e specifica se un dₜ positivo favorisce A o B. Riporta n, la perdita media di ciascun modello, d̄, lo stimatore della varianza di lungo periodo, kernel e banda HAC, correzione per campioni piccoli, distribuzione di riferimento, direzione del test e p-value.

Specifica inoltre se i modelli sono annidati, come sono stati stimati i parametri, se il confronto è stato scelto prima o dopo aver esaminato i risultati e quali altre varianti sono state provate. Se il campione è stato usato per selezionare il modello, descrivi il test come parte di quella selezione anziché come evidenza out-of-sample intatta. Un resoconto chiaro permette ai lettori di vedere esattamente cosa viene confrontato e quali problemi di incertezza o selezione restano fuori dall’analisi.

Domande frequenti

Q1Il test di Diebold–Mariano richiede errori previsivi distribuiti normalmente?

No. Il quadro può essere applicato anche a errori previsivi non normali. Il test richiede comunque una stima adeguata della varianza delle differenze di perdita e condizioni di regolarità per la distribuzione di riferimento.

Q2Posso confrontare due modelli che prevedono orizzonti diversi?

Non come confronto omogeneo dell’accuratezza. Allinea prima obiettivo e orizzonte; altrimenti i modelli rispondono a domande previsive diverse.

Q3Un risultato DM significativo basta per scegliere un modello di trading?

No. È un’evidenza sulle perdite previsive attese in uno specifico confronto. Occorre ancora considerare la ricerca fra modelli, le regole decisionali, i costi di esecuzione, il finanziamento e i risultati della strategia out-of-sample. Ricerche fondamentali - Diebold e Mariano, “Comparing Predictive Accuracy” (1995) - Harvey, Leybourne e Newbold, “Testing the Equality of Prediction Mean Squared Errors” (1997)00719-4) - Giacomini e White, “Tests of Conditional Predictive Ability” (2006) - Clark e West, “Approximately Normal Tests for Equal Predictive Accuracy in Nested Models” (2007) - Newey e West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)

Fonti e approfondimenti

Segnala un problema

Prepareremo un’e-mail con il link a questo articolo. Mark riceverà la segnalazione solo dopo l’invio

Controllo rapido

Hai finito la guida? Verifica ciò che hai capito con 3 domande

Domanda 1 / 3

Domanda 01

Con dₜ = L(eA,ₜ) − L(eB,ₜ), quale modello è favorito da una media campionaria positiva?

Scegli una risposta per vedere la spiegazione

Glossario delle opzioni

Due test bootstrap per una famiglia di regole valutate insiemeWhite Reality Check e Hansen SPA per le regole di tradingScopri come Reality Check e Hansen SPA valutano un’intera famiglia di regole tecniche rispetto a un benchmark, come costruiscono il bootstrap sotto l’ipotesi nulla e cosa significa il p-value globale.Quanta incertezza c’è nel rendimento stimato?Bootstrap a blocchi e intervalli di confidenza per strategie di tradingScopri come il bootstrap a blocchi mobili e quello stazionario conservano la dipendenza temporale quando stimano l’incertezza del rendimento medio o dello Sharpe.Verifica frequenza e tempistica delle violazioni VaRBacktest del VaR: spiegazione dei test di Kupiec e ChristoffersenScopri come il test POF di Kupiec e i test di copertura condizionale di Christoffersen valutano le violazioni del VaR, come leggere un esempio di 250 giorni e perché la mancata reiezione non prova l’accuratezza.Meccanica delle opzioniCos'è l'assegnazione di un'opzione?Comprendi come l'assegnazione trasformi una call o put short in un'obbligazione sul titolo, quando può avvenire e come preparare contante e azioniUn numero di contratti consentito non equivale a un budget di rischioLimiti di posizione e limiti di esercizio delle opzioni a confrontoScopri in che modo i limiti di posizione delle opzioni quotate differiscono dai limiti di esercizio, perché contano l'aggregazione sullo stesso lato e la reportistica e perché margin o buying power non indicano se una quantità è consentita