Test di Giacomini–White: accuratezza condizionata delle previsioni
Scopri come il test di Giacomini–White valuta se l'accuratezza delle previsioni varia con condizioni note, come scegliere gli strumenti e cosa indica il risultato
In questa guidaAccuratezza media e condizionata rispondono a domande diverse
Breve sintesi
Il framework di Giacomini–White (GW) chiede se la perdita relativa di due previsioni sia collegata alle informazioni disponibili quando vengono formulate. Può far emergere differenze nascoste da un punteggio medio, ma il risultato dipende dalle previsioni, dalla finestra di valutazione, dalla funzione di perdita e dalle variabili di condizionamento scelte in anticipo.
Accuratezza media e condizionata rispondono a domande diverse
Supponiamo che, in un campione di prova, la previsione A abbia una perdita media inferiore a quella di B. La media può nascondere uno schema utile: A potrebbe funzionare meglio nei mercati tranquilli e B quando la volatilità è elevata. Per capire quale previsione sia stata migliore in media è adatto un confronto incondizionato. Se invece la domanda è se le informazioni note alla data della previsione aiutino a prevedere quale metodo funzionerà meglio, l'oggetto è la capacità predittiva condizionata.
Giacomini e White inquadrano il problema come confronto tra metodi di previsione con una funzione di perdita e un insieme informativo specificati. Il framework si applica a previsioni puntuali, intervallari, probabilistiche o di densità, purché la perdita sia coerente con il compito. Anche la procedura di stima che genera ciascuna previsione fa parte del metodo: una finestra mobile, un campione di addestramento fisso o una regola di ponderazione sono elementi del metodo valutato, non dettagli innocui da cambiare dopo aver visto i risultati (Giacomini e White, 2006).
La domanda è collegata ai test di rottura strutturale, ma non coincide con essi. Un test condizionato chiede se la perdita relativa della previsione sia associata sistematicamente alle informazioni scelte. Un test di rottura chiede se i parametri o una relazione siano cambiati in un momento ignoto o specificato. La guida al test di Diebold–Mariano riguarda il confronto incondizionato delle perdite medie; una domanda condizionata richiede di definire esplicitamente le informazioni di condizionamento.
Allinea prima previsioni, risultati e informazioni
Sia (Y_{t+1}) l'obiettivo osservato dopo l'origine della previsione (t). Le previsioni ŷA,t+1 e ŷB,t devono riferirsi allo stesso obiettivo, orizzonte, unità di misura e limite informativo. Per una funzione di perdita (L), dove un valore inferiore è preferibile, la differenza di perdita è:
dₜ₊₁ = L(Yₜ₊₁, ŷA,ₜ₊₁) − L(Yₜ₊₁, ŷB,ₜ₊₁)
Con questa convenzione, un valore positivo significa che A ha subito una perdita maggiore e favorisce B in quell'origine; un valore negativo favorisce A. Usa una riga per ogni origine e valuta entrambe le previsioni sulla stessa realizzazione. Conserva le previsioni disponibili all'epoca, la versione dei dati e quella del modello. Non ricostruire le previsioni storiche con input rivisti o informazioni arrivate dopo.
Anche le variabili di condizionamento devono essere note all'origine della previsione. Esempi sono una stima ritardata della volatilità, un indicatore di un evento annunciato in anticipo, una differenza di perdita ritardata o uno stato del mercato calcolato solo con osservazioni passate. Una variabile misurata dopo (t) non può spiegare quale previsione sarebbe stata migliore a (t+1) senza introdurre look-ahead bias.
La misura deve corrispondere all'obiettivo. L'errore quadratico è un'opzione per una previsione della media condizionata, ma non è automaticamente adatto a una previsione di volatilità, quantile o densità. Se un modello prevede la varianza e un altro la deviazione standard, esprimili prima come previsioni della stessa quantità. Il test non può correggere una domanda impostata male.
Per le previsioni di volatilità, valuta entrambe usando la stessa definizione di varianza realizzata e lo stesso intervallo di campionamento. Se una copre i prezzi intraday e l'altra include anche i rendimenti overnight, una differenza di perdita può riflettere obiettivi diversi invece della capacità predittiva. Decidi come trattare i movimenti durante la chiusura dei mercati, la frequenza di campionamento, le osservazioni mancanti e la misura realizzata, poi applica le scelte in modo coerente. Se il proxy realizzato è rumoroso, l'errore di misura influenza entrambe le perdite e va considerato nell'interpretazione.
Formula l'ipotesi nulla condizionata e scegli le funzioni di test
Sia (mathcal{G}_t) l'insieme informativo usato per condizionare il confronto. L'ipotesi nulla idealizzata è:
H₀: E[dₜ₊₁ | 𝒢ₜ] = 0
Significa che, date le informazioni specificate, la differenza attesa delle perdite è zero. Il test GW a un passo traduce questa proposizione in momenti usando un vettore di funzioni di test (h_t) selezionato in anticipo, ciascuna misurabile con le informazioni disponibili al tempo (t):
H₀,ₕ: E[hₜ dₜ₊₁] = 0
Una costante in (h_t) include la differenza media delle perdite. Altri elementi possono rappresentare uno stato del mercato, una perdita relativa ritardata o una trasformazione non lineare scelta prima di esaminare i risultati. Per esempio, (h_t=(1,S_t)'), dove (S_t) è un indicatore binario di alta volatilità noto a (t), verifica sia un momento costante sia l'associazione tra differenza di perdita e quello stato.
Un insieme finito di funzioni di test verifica solo i momenti che definisce. Un rifiuto indica che almeno uno dei momenti selezionati non è compatibile con zero secondo le ipotesi del test; non individua un modello universalmente migliore né dimostra che sia rilevante ogni possibile variabile di stato. Un mancato rifiuto non dimostra uguaglianza delle prestazioni condizionate. Se l'insieme contiene solo una costante, il test confronta un momento incondizionato, non esplora tutte le condizioni possibili.
Scegli la perdita, gli strumenti, le trasformazioni, il campione e l'orizzonte prima di vedere quale modello prevale. Aggiungere molti indicatori di stato, soglie e ritardi dopo aver osservato i risultati crea un ulteriore problema di ricerca. Il test condizionato non corregge automaticamente questa selezione.
Definisci anche quando costruire ciascuna variabile di stato. Se «alta volatilità» significa il 20% più alto della volatilità nell'intero campione, le osservazioni future contribuiscono alla soglia applicata alle origini passate. Stima la soglia soltanto con le informazioni disponibili a ciascuna origine oppure usa una regola annunciata prima di quella data. Per una variabile continua, specifica in anticipo unità, centratura ed eventuale scalatura. Indicatori quasi identici possono rendere ridondanti le condizioni di momento e difficile invertire la matrice di covarianza; usa il gruppo più piccolo che abbia un'interpretazione chiara.
Calcola la statistica di Wald e interpreta la distribuzione di riferimento
Con (q) funzioni di test, costruisci il vettore di momenti (g_{t+1}=h_t d_{t+1}). La sua media campionaria è:
ḡ = (1/n) Σₜ gₜ₊₁
La statistica GW a un passo ha forma di Wald:
GW = n ḡ′ Ω̂⁻¹ ḡ
Qui (hatOmega) stima la matrice di covarianza del vettore dei momenti. Sotto l'ipotesi nulla e le condizioni di regolarità del lavoro originale, la statistica ha asintoticamente una distribuzione chi-quadrato di riferimento con (q) gradi di libertà. Il numero di funzioni influenza quindi la distribuzione di riferimento e può incidere sulla potenza. Molti strumenti deboli o ridondanti possono rendere instabile la stima della covarianza senza aggiungere informazioni utili.
Nel caso a un passo, l'ipotesi nulla implica una struttura di differenza di martingala per il vettore dei momenti, perciò il test originale può usare una stima basata sul secondo momento campionario. Per altri orizzonti, risultati sovrapposti o deviazioni da questo schema, lo stimatore della varianza deve rispettare le ipotesi e la struttura di dipendenza del test scelto. Segui la formulazione dell'implementazione adottata, senza copiare automaticamente la larghezza di banda HAC di un altro test. I metodi HAC generali, compreso lo stimatore di Newey e West (1987), servono nei casi che li richiedono e non prescrivono una larghezza di banda universale per GW. La credibilità dipende anche dalla stima della covarianza e dal disegno delle previsioni.
Verifica anche che (Ω̂) sia stimabile per i momenti selezionati. Funzioni quasi duplicate, un indicatore con pochissime osservazioni in uno stato o troppe interazioni possono rendere la matrice singolare o instabile. La sua inversa può cambiare molto dopo una piccola revisione dei dati e distorcere la statistica. Ogni funzione deve avere una motivazione collegata a una condizione o differenza di rendimento; riporta il loro numero e la covarianza dei momenti. Eliminare una funzione giudicata poco utile dopo aver visto il risultato è un ulteriore passaggio di selezione da dichiarare.
Il valore p è evidenza contro le restrizioni di momento indicate secondo la distribuzione di riferimento. Non è la probabilità che A o B sia il modello vero né la probabilità che una regola di trading sia redditizia. Riporta statistica, gradi di libertà, valore p e momenti esatti testati per rendere chiaro il significato di un rifiuto.
<!-- learn:illustration -->

Un esempio con due stati mostra cosa può nascondere la media
Considera otto ipotetiche origini a un passo. Sia (S_t=0) uno stato tranquillo e (S_t=1) uno stato di alta volatilità. Supponi che le differenze di perdita (d_{t+1}=L_A-L_B) siano −2, −2, −2 e −2 nelle quattro origini tranquille, e +2, +2, +2 e +2 nelle quattro con alta volatilità. Le differenze negative favoriscono A; quelle positive favoriscono B.
La media delle otto origini è zero: in questo piccolo esempio non c'è quindi una differenza incondizionata di perdita. La media nello stato tranquillo è −2 e quella nello stato volatile è +2. La graduatoria relativa cambia con lo stato. Un test con (h_t=(1,S_t)') include un momento costante e uno di alta volatilità che può riflettere questo schema.
Gli otto valori illustrano il calcolo, ma non bastano per un'inferenza affidabile. Nei dati reali il test deve considerare come sono state stimate le previsioni, se lo stato è stato fissato in anticipo, quanti origini sono disponibili e come variano nel tempo i momenti della differenza di perdita. Una suddivisione visiva per stato non dimostra che lo schema persisterà.
Considera la finestra di stima parte del metodo
L'asintotica originale di GW mantiene l'incertezza di stima delle previsioni lasciando finita la dimensione massima della finestra di stima mentre cresce il numero di previsioni fuori campione. Le finestre mobili e un campione di stima fisso rientrano in questo schema fondamentale. La dimensione della finestra e ogni regola di scelta basata sui dati fanno parte del metodo e vanno fissate e riportate.
Questo è importante quando i modelli vengono ristimati. Un confronto che ignora la stima dei parametri può trascurare l'incertezza generata dal modo in cui ciascun metodo apprende dai dati passati. GW può confrontare previsioni da modelli annidati o non annidati alle condizioni dichiarate, ma non garantisce risultati equivalenti per qualsiasi implementazione a finestra espansiva o stimatore. Nel framework originale a un passo, una normale finestra espansiva non rispetta l'ipotesi di finestra finita. Se il disegno è diverso, usa risultati derivati per la costruzione effettiva della previsione.
Il test non sceglie neppure una finestra adatta al tuo caso. Una finestra breve può adattarsi alle condizioni recenti ma usa meno osservazioni; una finestra lunga o espansiva può stabilizzare le stime pur mantenendo relazioni obsolete. Confronta le opzioni con una valutazione pianificata e registra anche la selezione della finestra. Giacomini e Rossi (2010) sviluppano test distinti per l'evoluzione della prestazione relativa in ambienti instabili. La domanda sull'andamento nel tempo è collegata, ma non usa la stessa statistica del test condizionato GW di base.
Un rifiuto condizionato non fornisce da solo una regola di trading che scelga in tempo reale la previsione corretta. Uno strumento può essere associato alla differenza di perdita nei dati di valutazione senza generare una regola di passaggio stabile o utilizzabile. Per selezionare le previsioni con informazioni correnti, definisci la regola usando dati passati e valutala su una sequenza successiva e intatta di origini, includendo l'incertezza di stima e decisione.
Distingui GW da DM, dai test per modelli annidati e dai test di instabilità
Il test di Diebold–Mariano chiede se due previsioni abbiano la stessa perdita media nel campione di valutazione. GW chiede se le informazioni selezionate siano associate alla perdita relativa, ammettendo un confronto incondizionato come particolare restrizione di momento. Come mostra l'esempio a due stati, due modelli possono avere lo stesso punteggio medio e prestazioni relative diverse a seconda delle condizioni.
Se le previsioni provengono da modelli annidati e la domanda riguarda nello specifico l'uguaglianza dell'errore quadratico medio di previsione, un metodo per modelli annidati come la correzione di Clark–West affronta un'altra ipotesi nulla e il problema del rumore di stima. Se sono state cercate molte regole di trading o previsioni e la domanda è se almeno una abbia capacità predittiva superiore, serve una procedura a livello dell'intera famiglia, per esempio il Reality Check di White o il test SPA di Hansen. Un test condizionato su una coppia selezionata non annulla una ricerca più ampia.
Infine, l'evidenza che l'accuratezza relativa cambi nel tempo non individua una specifica data di rottura. Se la domanda riguarda il percorso della prestazione relativa, più che l'associazione con strumenti scelti, può essere più adatto un test di instabilità locale o di inversione. Giacomini e Rossi (2010) studiano questi confronti. Scegli il metodo in base alla domanda, senza trattare ogni rifiuto come prova di una strategia di trading che cambia con il regime.
Considera la bassa potenza e i test ripetuti
I test condizionati possono richiedere molti dati. Dividere il campione in stati tranquilli e volatili riduce le osservazioni che sostengono ciascun confronto. Aggiungere funzioni aumenta il numero di momenti e i gradi di libertà. Se diverse condizioni sono solo debolmente legate alla perdita relativa, il test può avere poca potenza anche in presenza di differenze condizionate.
Il working paper della Federal Reserve Bank di St. Louis di McCracken studia esistenza, dimensione e potenza del test GW in un semplice esempio con perdita quadratica. Le simulazioni indicano che il test può mantenere correttamente la dimensione e avere comunque potenza generalmente bassa nei casi esaminati (McCracken, 2020). È un avvertimento interpretativo, non una stima universale della potenza per ogni applicazione. Un mancato rifiuto può riflettere informazioni limitate o bassa potenza; non va descritto come prova che le previsioni siano intercambiabili.
Provare ripetutamente definizioni di stato, soglie, orizzonti, funzioni di perdita e date di valutazione alternative aumenta la probabilità di un risultato casuale. Registra tutte le varianti testate e separa l'analisi esplorativa da un campione di conferma predefinito. Se vuoi sostenere che una strategia di una famiglia è predittiva, applica all'intera famiglia una correzione appropriata per test multipli o data snooping. Aggiungere strumenti condizionati non rende automaticamente l'evidenza più convincente.
Quando si confrontano più modelli, una procedura familiare risponde a una domanda diversa dal test condizionato a coppie. La guida al Model Confidence Set spiega come un confronto iterativo possa mantenere un insieme di modelli non distinguibili al livello scelto; non sostituisce la definizione anticipata delle condizioni in un'analisi GW.
Riporta il disegno in modo che altri possano riprodurlo
Indica i due metodi di previsione, come viene stimato ciascuno, se i modelli sono annidati, l'obiettivo, l'orizzonte e le date di valutazione. Specifica la funzione di perdita e la convenzione di segno di (d_{t+1}). Descrivi ogni elemento di (h_t), come viene costruito, quando diventa osservabile e se è stato scelto prima di guardare i risultati.
Riporta calendario delle origini, regola della finestra di stima, versione dei dati, criterio per il campione comune, numero di origini fuori campione, numero di funzioni di test, stimatore della covarianza, distribuzione di riferimento, statistica, gradi di libertà e valore p. Indica se gli orizzonti si sovrappongono e come viene gestita la dipendenza. Includi perdite medie e riepiloghi delle differenze, non solo il risultato del test.
Elenca gli altri strumenti, le soglie, le finestre, le perdite e le coppie di previsioni provate. Se le stesse osservazioni sono servite a selezionare il modello o le variabili di condizionamento e poi a testarli, dichiaralo. Un risultato può essere informativo senza essere confermativo; un resoconto trasparente consente di valutarne l'ambito e progettare una validazione indipendente.
Domande frequenti
Q1Il test di Giacomini–White è uguale a quello di Diebold–Mariano?
No. Diebold–Mariano riguarda l'uguaglianza delle perdite medie. Il framework GW a un passo verifica momenti condizionati selezionati e include un momento incondizionato come possibile restrizione.
Q2Un rifiuto indica quale previsione usare in ogni regime di mercato?
No. Mostra che almeno un momento scelto non è compatibile con zero secondo le ipotesi del test. Il risultato dipende da strumenti, campione e perdita e non garantisce prestazioni in ogni stato.
Q3Posso continuare ad aggiungere soglie di volatilità finché il test rifiuta?
Questo crea una ricerca tra variabili di condizionamento. Definisci gli strumenti in anticipo quando possibile, riporta tutte le specifiche provate e usa un campione di conferma separato o una correzione appropriata per l'intera famiglia se formuli un'affermazione predittiva generale.
Q4Capacità predittiva condizionata significa che una strategia è redditizia?
No. Il test confronta le perdite delle previsioni. Un'affermazione di trading richiede una regola decisionale definita e una valutazione separata di esecuzione, commissioni, finanziamento, impatto di mercato e rischio. Ricerca primaria - Giacomini e White, “Tests of Conditional Predictive Ability” (2006) - Giacomini e Rossi, “Forecast Comparisons in Unstable Environments” (2010) - McCracken, “Tests of Conditional Predictive Ability: Existence, Size, and Power” (working paper della Federal Reserve Bank di St. Louis, 2020) - Diebold e Mariano, “Comparing Predictive Accuracy” (1995) - Newey e West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)
Fonti e approfondimenti
Segnala un problema
Prepareremo un’e-mail con il link a questo articolo. Mark riceverà la segnalazione solo dopo l’invio
Controllo rapido
Hai finito la guida? Verifica ciò che hai capito con 3 domande
Domanda 01
Con dₜ₊₁ = L(A) − L(B), cosa indica una differenza di perdita positiva?
Scegli una risposta per vedere la spiegazione