Skip to content
Tutte le guide sulle opzioni
Confronto tra previsioni annidate12 min di lettura

Il test Clark–West per previsioni annidate: formula, esempio e limiti

Scopri perché i modelli di previsione annidati richiedono un confronto MSPE corretto, come funziona la statistica Clark–West e cosa può o non può dimostrare un risultato unilaterale.

In questa guidaPerché le previsioni annidate richiedono un confronto specifico

Breve sintesi

Il test Clark–West corregge il confronto degli errori quadratici quando un modello di previsione annida un benchmark più piccolo. I parametri aggiuntivi stimati possono introdurre rumore nelle previsioni del modello più ampio anche se non apportano vera informazione predittiva. La correzione modifica la differenza di perdita usata nell’inferenza; non cambia nessuna delle due previsioni e non garantisce l’utilità del modello più ampio.

Perché le previsioni annidate richiedono un confronto specifico

Supponiamo che un modello ristretto preveda il rendimento del mese successivo usando una costante, mentre un modello più ampio aggiunga un rapporto di valutazione. Il modello ristretto è annidato in quello più ampio: ponendo a zero il coefficiente aggiuntivo si ottiene il benchmark. Anche se quel coefficiente è davvero nullo, stimarlo può comunque aggiungere rumore campionario alle previsioni del modello più ampio. Il suo errore quadratico medio di previsione osservato (MSPE) può quindi risultare maggiore anche quando il contenuto predittivo dei due modelli nella popolazione è uguale.

La correzione Clark–West affronta questo problema di rumore di stima nel confronto fuori campione degli errori quadratici di previsioni annidate. In questa configurazione, verifica se il modello più ampio aggiunge valore predittivo rispetto al benchmark ristretto. È una domanda più circoscritta rispetto al confronto generale descritto nella guida Diebold–Mariano, che confronta perdite previsionali appaiate e non è automaticamente valida con la distribuzione di riferimento usuale per i modelli annidati. Clark e McCracken analizzano il diverso comportamento asintotico e in campioni finiti dei test di accuratezza e encompassing per previsioni annidate; Clark e West sviluppano la procedura MSPE corretta e la relativa inferenza approssimata. Clark e McCracken (2001)00071-9); Clark e West (2007).

Verifica l’annidamento e mantieni il disegno fuori campione

Indichiamo con f₀,t+h la previsione del benchmark ristretto, che deve riferirsi allo stesso obiettivo (y_{t+h}) dell’alternativa più ampia. Il modello più ampio deve contenere la specificazione del benchmark come caso particolare, di norma ponendo a zero uno o più coefficienti aggiuntivi. La sola maggiore complessità, l’uso di più variabili o un migliore adattamento in campione non dimostrano l’annidamento.

Per ogni origine di previsione, genera entrambe le stime usando solo le informazioni disponibili in quel momento. Stima i modelli su una finestra cronologica di addestramento, produci previsioni su una finestra di valutazione successiva e usa per entrambi lo stesso obiettivo, orizzonte, unità, origini e osservazioni realizzate. Una ristima ricorsiva o mobile può essere appropriata, ma dichiara quale procedura usi e conserva le previsioni effettivamente prodotte a ogni origine. Consultare ripetutamente la finestra di valutazione per scegliere predittori, trasformazioni o orizzonti la rende parte della selezione del modello, anziché una prova intatta. La guida CAViaR mostra perché anche una previsione di quantile di coda va valutata con una funzione di perdita adatta al suo obiettivo, anziché essere inserita in un confronto di previsioni della media.

La correzione Clark–West riguarda il rumore di stima dei parametri sotto l’ipotesi nulla di modelli annidati; non corregge l’uso di informazioni future, campioni non corrispondenti, dati revisionati trattati come se fossero già noti o ricerche di modelli non dichiarate. Riporta la finestra iniziale di stima, il numero di origini di previsione, l’orizzonte, la versione dei dati e ogni aggiornamento mobile o ricorsivo, così che sia possibile valutare se il test sia davvero fuori campione.

Calcola la differenza di perdita corretta

Indichiamo con f₀,t+h la previsione ristretta, con f₁,t+h quella del modello più ampio e con eⱼ,t+h = yₜ₊ₕ − fⱼ,t+h l’errore di previsione j. Per una perdita basata sull’errore quadratico, la differenza Clark–West corretta per periodo è

dCW,t+h = (e₀,t+h)² − [(e₁,t+h)² − (f₀,t+h − f₁,t+h)²]

In forma equivalente, è l’errore quadratico del modello ristretto meno quello del modello più ampio, più la distanza quadratica tra le due previsioni. L’ultimo termine stima il rumore previsionale aggiuntivo associato ai parametri supplementari stimati sotto l’ipotesi nulla. Clark e West descrivono la correzione come la riduzione dell’MSPE campionario del modello più ampio di questo termine di scarto, prima del confronto con il modello ristretto. Clark e West (2007).

Calcola la media delle differenze corrette sulle origini comuni di valutazione: mean(dCW) = (1/P) Σ dCW,t+h. Se risultati e previsioni sono espressi in punti base, ogni errore quadratico e differenza corretta è in punti base al quadrato. Una media corretta positiva favorisce il modello più ampio secondo la convenzione sopra. È un punteggio di confronto corretto, non l’MSPE realizzato del modello più ampio né una previsione da usare per operare.

Definisci l’ipotesi unilaterale prima di leggere il risultato

La domanda abituale del test Clark–West è se il modello annidato più ampio abbia un MSPE atteso inferiore a quello del benchmark ristretto. L’ipotesi nulla rappresenta l’assenza di un miglioramento predittivo incrementale dovuto alla componente aggiunta; l’alternativa unilaterale favorisce il modello più ampio. Con la formula sopra, l’evidenza a favore dell’alternativa consiste in una media corretta sufficientemente positiva rispetto al suo errore standard.

Nella notazione della perdita corretta, le ipotesi operative sono H₀: E[dCW] = 0 contro H₁: E[dCW] > 0. Il segno positivo dipende dall’aver messo per prima la perdita del modello ristretto. Invertendo la sottrazione si inverte anche il segno: dichiara la convenzione insieme al risultato.

La statistica del test è spesso la media campionaria di dCW divisa per il suo errore standard stimato. Clark e West raccomandano un test unilaterale approssimativamente normale per le configurazioni studiate, con errore standard ordinario o robusto all’autocorrelazione quando appropriato. West (1996) sviluppa l’inferenza per momenti di funzioni regolari di previsioni ed errori fuori campione, anche quando le previsioni dipendono da parametri stimati. La direzione va scelta prima di vedere i risultati: una statistica Clark–West positiva non autorizza a passare dopo aver visto il campione a un’ipotesi bilaterale o a una convenzione di segno diversa.

Il valore p riportato è condizionato alla relazione di annidamento, alla costruzione delle previsioni, all’obiettivo, alla perdita, al metodo inferenziale e alle ipotesi di campionamento. Non è la probabilità che il modello più ampio sia vero e non dimostra che un predittore aggiunto causi variazioni dell’obiettivo.

Esamina un esempio di quattro periodi

Considera quattro osservazioni ipotetiche in punti base. I valori realizzati sono [0, 1, −1, 0], le previsioni ristrette [−1, 0, 0, 0] e quelle del modello annidato più ampio [−1.5, 0.5, −0.5, 0.5]. Gli errori quadratici del modello ristretto sono [1, 1, 1, 0], con MSPE medio di 0.75 bp². Gli errori quadratici del modello più ampio sono [2.25, 0.25, 0.25, 0.25], anch’essi con MSPE medio di 0.75 bp².

Gli scarti quadratici tra le previsioni (f₀ − f₁)² sono [0.25, 0.25, 0.25, 0.25]. Applicando la differenza corretta e₀² − e₁² + (f₀ − f₁)², si ottiene [−1, 1, 1, 0] bp². La media campionaria è 0.25 bp². Gli MSPE grezzi coincidono, mentre la media corretta è positiva perché la correzione tiene conto del rumore di stima delle previsioni del modello più ampio.

Questi quattro periodi illustrano solo i calcoli. Sono troppo pochi per stimare l’incertezza in modo credibile o stabilire la significatività statistica. La media corretta positiva non prova da sola un reale vantaggio previsionale; i valori sono ipotetici, non osservazioni di mercato. <!-- learn:illustration -->

Due percorsi traslucidi annidati, blu e ambra, salgono verso un orizzonte comune; sotto, quattro coppie previsione-risultato sono rappresentate da sfere blu e ambra unite da archi trasparenti
Illustrazione concettuale senza testo né assi; le coppie sono schematiche, non dati empirici, una previsione o un segnale operativo

Considera la dipendenza degli errori previsionali e gli orizzonti

Anche nelle previsioni a un passo, le differenze di perdita corrette possono essere serialmente dipendenti perché obiettivo, predittori o finestra di stima evolvono nel tempo. Nelle previsioni sovrapposte a più passi, origini adiacenti condividono periodi realizzati dell’obiettivo e le differenze corrette possono quindi essere correlate per costruzione. Un errore standard ordinario che tratti ogni origine come indipendente può sottostimare l’incertezza.

Stima l’errore standard dalla serie delle differenze corrette con un metodo inferenziale che rifletta il disegno di campionamento, ad esempio una stima della varianza di lungo periodo coerente in presenza di eteroschedasticità e autocorrelazione, se le condizioni sono adeguate. Clark e West menzionano esplicitamente errori standard robusti all’autocorrelazione per errori previsionali autocorrelati. Dichiara l’orizzonte, lo stimatore di covarianza, kernel e bandwidth se usati, e qualsiasi metodo di ricampionamento o valore critico. La guida al block bootstrap spiega perché il ricampionamento di serie temporali dipendenti deve preservare l’ordine; un bootstrap generico non applica automaticamente l’ipotesi nulla Clark–West.

Il trattamento necessario della dipendenza dipende dal disegno. Orizzonti più lunghi, obiettivi persistenti, stime ripetute dei parametri e variazioni della volatilità possono creare dipendenza oltre la semplice sovrapposizione. Confronta impostazioni inferenziali ragionevoli e spiegale, invece di scegliere quella con il valore p più piccolo.

Considera i valori critici normali un’approssimazione, non una garanzia

I test previsionali per modelli annidati possono avere distribuzioni nulle non standard, soprattutto quando crescono insieme sia i campioni di stima sia quelli di valutazione. L’analisi di Clark e McCracken mostra che i test di uguale accuratezza e encompassing per previsioni annidate hanno un comportamento asintotico e in campioni finiti diverso dal consueto confronto tra modelli non annidati. Clark e West motivano una statistica corretta con inferenza approssimativamente normale utile nei disegni studiati, ma ciò non costituisce una garanzia universale nei campioni finiti. Clark e McCracken (2001)00071-9); Clark e West (2007).

Campioni di valutazione piccoli, molti parametri aggiuntivi, benchmark mal specificati, selezione dei predittori guidata dai dati e scelta tra stima mobile e ricorsiva possono influire sulla dimensione e sulla potenza del test. Se il campione o il disegno differisce in modo sostanziale dalle condizioni degli articoli, valuta valori critici adatti al disegno o una procedura di simulazione/bootstrap definita con cura. Riporta le dimensioni dei campioni di stima e valutazione e specifica quale distribuzione di riferimento ha prodotto il valore p.

Distingui i test correlati e limita le affermazioni sulle previsioni

Il test Diebold–Mariano verifica se due serie di perdite previsionali hanno la stessa perdita attesa in un quadro generale di perdite appaiate. La correzione Clark–West è pensata per confronti di errori quadratici in cui un modello annida l’altro e i parametri aggiuntivi stimati distorcono la differenza MSPE grezza sotto l’ipotesi nulla. Applicare la correzione a modelli non annidati e non correlati modifica la domanda senza giustificazione. L’articolo originale DM ammette un’ampia gamma di misure di perdita e discute errori previsionali che non devono essere necessariamente gaussiani o indipendenti; è un riferimento affine, non un sinonimo della procedura per modelli annidati. Diebold e Mariano (1995).

Nessuno dei due metodi risolve i gradi di libertà del ricercatore derivanti dal provare molti obiettivi, orizzonti, benchmark e insiemi di predittori. Se il confronto finale deriva da una ricerca ampia, registra la famiglia di candidati e usa un metodo pensato per la domanda a livello di ricerca. La guida a White’s Reality Check e Hansen’s SPA tratta l’inferenza sull’intera famiglia di regole di trading selezionate; il test Clark–West da solo non rende confermativo un confronto previsionale scelto dopo la ricerca.

Un risultato unilaterale significativo è una prova, sotto le ipotesi dichiarate, che il modello più ampio migliori l’accuratezza attesa degli errori quadratici per l’obiettivo e il disegno di valutazione testati. Non dimostra che il predittore aggiunto sia causale, che il segnale resti stabile o che una strategia basata sulla previsione generi rendimenti positivi. I miglioramenti possono essere troppo piccoli per incidere sulle decisioni e i maggiori vantaggi del modello possono verificarsi in periodi costosi per fare trading.

La redditività richiede una regola separata, dati di valutazione non utilizzati e ipotesi realistiche su spread, commissioni, slippage, impatto di mercato, finanziamento, prestito e limiti di rischio. Le affermazioni causali richiedono una strategia di identificazione adeguata alla domanda; un confronto previsionale dopo il campione non è un disegno causale. Dichiara cosa dimostra effettivamente il risultato Clark–West e lascia le altre affermazioni a prove che le verifichino.

Descrivi il disegno affinché il confronto sia riproducibile

Indica il modello ristretto e quello più ampio, specifica i vincoli esatti che li rendono annidati e definisci obiettivo, orizzonte, unità degli errori quadratici, finestra di stima, calendario delle origini previsionali, date di valutazione e regola per il campione comune. Spiega se i coefficienti vengono ristimati ricorsivamente o con una finestra mobile e come vengono preservati l’insieme informativo e le versioni dei dati.

Riporta entrambi gli MSPE grezzi, la media della differenza Clark–West corretta, la convenzione di segno, l’errore standard, l’alternativa unilaterale, la distribuzione di riferimento o i valori critici, il valore p e lo stimatore della dipendenza. Dichiara inoltre il numero di parametri aggiunti, le dimensioni dei campioni, le ricerche di predittori e orizzonti, la selezione del benchmark e l’eventuale influenza della finestra di valutazione sul disegno del modello. Queste informazioni aiutano a distinguere un test corretto per modelli annidati da un confronto previsionale generale e a valutare l’incertezza residua.

Domande frequenti

Q1Il test Clark–West sostituisce il test Diebold–Mariano?

No. Clark–West riguarda il confronto degli MSPE quadratici per modelli annidati. Diebold–Mariano è un quadro generale di perdite appaiate; non si deve presumere che la sua distribuzione di riferimento usuale gestisca automaticamente le previsioni annidate.

Q2Una media corretta positiva dimostra che il modello più ampio è migliore?

No. Indica una direzione favorevole al modello più ampio secondo la convenzione dichiarata, ma l’inferenza richiede anche un errore standard appropriato, un disegno fuori campione credibile e osservazioni sufficienti.

Q3Posso usare Clark–West per modelli non annidati?

Non per impostazione predefinita. La correzione nasce dal rumore di stima sotto un’ipotesi nulla di modelli annidati. Per confronti non annidati scegli un test adatto al disegno previsionale e alla perdita.

Q4Un risultato Clark–West significativo implica una strategia di trading redditizia?

No. Il test valuta l’accuratezza della previsione per un obiettivo e un disegno di valutazione. I risultati di trading dipendono anche dalla regola decisionale, dall’esecuzione, dai costi, dal finanziamento, dal rischio e da ulteriori prove fuori campione. Ricerca primaria - Clark e West, “Approximately Normal Tests for Equal Predictive Accuracy in Nested Models” (2007) - Clark e McCracken, “Tests of Equal Forecast Accuracy and Encompassing for Nested Models” (2001)00071-9) - West, “Asymptotic Inference about Predictive Ability” (1996) - Diebold e Mariano, “Comparing Predictive Accuracy” (1995)

Fonti e approfondimenti

Segnala un problema

Prepareremo un’e-mail con il link a questo articolo. Mark riceverà la segnalazione solo dopo l’invio

Controllo rapido

Hai finito la guida? Verifica ciò che hai capito con 3 domande

Domanda 1 / 3

Domanda 01

Perché la correzione Clark–West aggiunge la distanza quadratica tra le due previsioni?

Scegli una risposta per vedere la spiegazione

Glossario delle opzioni

Valutazione dell’accuratezza delle previsioniTest di Diebold–Mariano: come confrontare l’accuratezza delle previsioniScopri come il test di Diebold–Mariano confronta le perdite previsive appaiate, gestisce orizzonti sovrapposti e perché un p-value basso non dimostra abilità di trading.Modella direttamente un quantile condizionale delle perdite usando le informazioni disponibili prima di ogni previsioneCAViaR spiegato: Value at Risk condizionale autoregressivoScopri come CAViaR prevede ricorsivamente un quantile VaR condizionale, ne stima la dinamica con la perdita quantilica, tratta in modo asimmetrico gli shock dei rendimenti e si distingue da GARCH ed Expected Shortfall.Quanta incertezza c’è nel rendimento stimato?Bootstrap a blocchi e intervalli di confidenza per strategie di tradingScopri come il bootstrap a blocchi mobili e quello stazionario conservano la dipendenza temporale quando stimano l’incertezza del rendimento medio o dello Sharpe.Due test bootstrap per una famiglia di regole valutate insiemeWhite Reality Check e Hansen SPA per le regole di tradingScopri come Reality Check e Hansen SPA valutano un’intera famiglia di regole tecniche rispetto a un benchmark, come costruiscono il bootstrap sotto l’ipotesi nulla e cosa significa il p-value globale.Fondamenti delle opzioniChe cosa significano in-the-money, at-the-money e out-of-the-money?Scopri come funzionano le etichette in-the-money, at-the-money e out-of-the-money per call e put, con esempi di valore intrinseco e punto di pareggio