Model Confidence Set (MCS): confrontare le previsioni senza imporre un vincitore
Scopri come il Model Confidence Set usa test sequenziali e un bootstrap che preserva la dipendenza per mantenere i modelli previsivi che i dati non riescono a distinguere.
In questa guidaA quale domanda risponde il Model Confidence Set?
Breve sintesi
Il Model Confidence Set (MCS) confronta una famiglia definita di procedure previsive e restituisce i candidati che non risultano inferiori secondo la funzione di perdita scelta. Se il campione non li distingue, possono restare più modelli; l’esito dipende dalla famiglia, dal disegno previsivo, dalla perdita e dalla procedura inferenziale.
A quale domanda risponde il Model Confidence Set?
Supponiamo di avere più procedure che prevedono la volatilità del giorno successivo. I loro errori differiscono, ma il campione può essere troppo breve o rumoroso per stabilire quale abbia la perdita attesa minore. Scegliere la procedura con la perdita media più bassa imporrebbe un vincitore anche quando il divario potrebbe dipendere dalla variabilità campionaria. L’MCS offre una risposta sotto forma di insieme: quali candidati restano statisticamente compatibili con il primato secondo un criterio prestabilito?
L’MCS parte dall’insieme di candidati \(\mathcal M_0\), da una perdita o da un altro criterio e da un livello di confidenza. Verifica ripetutamente se i candidati ancora in esame hanno pari capacità predittiva. Se il test rifiuta l’ipotesi nulla, una regola di eliminazione rimuove un candidato giudicato relativamente debole e il test prosegue sull’insieme ridotto. I candidati superstiti formano l’MCS. Hansen, Lunde e Nason lo propongono come insieme di confidenza per il modello o i modelli migliori della collezione specificata, analogamente a un intervallo di confidenza parametrico che può includere più valori quando i dati sono imprecisi (articolo del 2011).
“Migliore” vale solo rispetto ai candidati inclusi, al target, all’orizzonte, alle informazioni disponibili a ogni origine e al criterio di valutazione. L’MCS non presuppone che un candidato sia il vero processo generatore dei dati e può mantenerne più di uno con la stessa perdita attesa minima. Non è una probabilità a posteriori che un modello superstite sia corretto.
Definire la famiglia di candidati e la domanda previsiva
Prima di calcolare le perdite, fissare \(\mathcal M_0\). Un candidato può essere un modello stimato insieme alle regole di stima e aggiornamento delle previsioni, oppure una procedura previsiva non descritta da un modello statistico. “GARCH”, per esempio, non è specificato del tutto se possono cambiare distribuzione della volatilità, finestra mobile, aggiornamento dei parametri e orizzonte: ogni scelta può definire un candidato diverso.
Ogni candidato deve prevedere lo stesso target alle stesse origini e sullo stesso orizzonte, usando soltanto le informazioni che sarebbero state disponibili allora. Le perdite grezze non sono direttamente confrontabili se un modello prevede la varianza a un giorno e un altro la volatilità a cinque giorni. Usare un campione di valutazione comune, allineare esplicitamente le osservazioni mancanti e registrare vintage dei dati, finestra iniziale, schema ricorsivo o mobile e trattamento degli input rivisti. Previsioni temporalmente sovrapposte possono condividere osservazioni nelle perdite di origini vicine.
Scegliere il criterio prima di osservare i risultati. Errore quadratico, errore assoluto o una perdita legata alla decisione possono ordinare diversamente le previsioni puntuali. Una previsione di varianza può richiedere una perdita per la volatilità adatta a una proxy rumorosa; una previsione quantilica richiede un quantile score, non l’errore quadratico medio. Un buon MCS secondo una perdita non garantisce un buon MCS secondo un’altra. Se la lista è stata ridotta dopo aver esaminato gli stessi risultati di valutazione, l’insieme formale è condizionato a quella selezione non dichiarata e non rappresenta l’intera ricerca.
Trasformare le previsioni comuni in differenze appaiate di perdita
Sia \(y_{t+h}\) il target realizzato per una previsione emessa all’origine \(t\), e sia \(\hat y_{i,t+h|t}\) la previsione del candidato \(i\). Per una funzione di perdita \(L\) scelta in anticipo, calcolare una perdita per ogni candidato e origine comune:
\[ L_{i,t}=L(y_{t+h},\hat y_{i,t+h|t}) \]
Supponiamo che una perdita minore sia preferibile. Per i candidati \(i\) e \(j\), definiamo la differenza appaiata:
\[ d_{ij,t}=L_{i,t}-L_{j,t}, \qquad \bar d_{ij}=\frac{1}{P}\sum_{t=1}^{P}d_{ij,t} \]
Dove \(P\) è il numero di origini previsive comuni. Con questa convenzione dei segni, un \(\bar d_{ij}\) positivo indica che nel campione il candidato \(i\) ha avuto una perdita media maggiore di \(j\); un valore negativo favorisce \(i\). L’appaiamento conta perché entrambi affrontano gli stessi esiti realizzati. Gli shock di mercato comuni possono aumentare entrambe le perdite, mentre la differenza isola la prestazione relativa.
L’ipotesi nulla di pari capacità predittiva per l’insieme corrente \(\mathcal M\) è:
\[ H_{0,\mathcal M}:\quad \mu_{ij}=E[d_{ij,t}]=0 \quad \text{per ogni } i,j\in\mathcal M \]
È un’affermazione congiunta sull’insieme corrente, non una raccolta di test a coppie indipendenti da esaminare uno per uno. Il quadro MCS originale usa un test congiunto di equivalenza e una regola di eliminazione per gestire il confronto fra modelli. Non chiede se le previsioni siano identiche in ogni data.
Testare l’insieme corrente e stabilire la regola di eliminazione
La procedura alterna un test a livello dell’insieme e un’eliminazione. Si parte da \(\mathcal M=\mathcal M_0\) e si testa la pari capacità predittiva al livello \(\alpha\) scelto. Se l’ipotesi non viene rifiutata, ci si ferma e si riporta l’insieme corrente. Se viene rifiutata, una regola prestabilita elimina un candidato e il test si ripete sull’insieme ridotto. Sotto le ipotesi della procedura, i superstiti formano l’MCS \((1-\alpha)\).
L’articolo sviluppa due statistiche note. La statistica range cerca la maggiore differenza appaiata di perdita standardizzata:
\[ T_{R,\mathcal M}=\max_{i,j\in\mathcal M}|t_{ij}|, \qquad t_{ij}=\frac{\bar d_{ij}}{\widehat{\mathrm{se}}(\bar d_{ij})} \]
La regola di eliminazione associata rimuove il candidato con il maggiore svantaggio standardizzato rispetto a un altro. Una seconda statistica confronta ogni candidato con la prestazione media dell’insieme corrente:
\[ T_{\max,\mathcal M}=\max_{i\in\mathcal M}t_{i\cdot}, \qquad d_{i\cdot,t}=\frac{1}{|\mathcal M|}\sum_{j\in\mathcal M}d_{ij,t} \]
Qui \(t_{i\cdot}\) standardizza la media di \(d_{i\cdot,t}\); la regola corrispondente rimuove il candidato con il maggiore eccesso di perdita standardizzato rispetto alla media dell’insieme. Statistica e regola formano una coppia: vanno scelte e dichiarate insieme, senza mescolarle dopo aver visto quale produce un insieme più piccolo. L’articolo MCS spiega perché il test di rifiuto deve essere coerente con la regola che identifica il candidato da eliminare (Hansen, Lunde e Nason).
Preservare la dipendenza temporale nel bootstrap
La distribuzione di una statistica massima dipende dalla variabilità congiunta delle differenze di perdita dei candidati. Trattare ogni modello o data come osservazione indipendente può spezzare entrambe le dipendenze: perdite successive possono essere serialmente correlate e quelle di due candidati nella stessa data sono appaiate. Il bootstrap MCS deve quindi conservare la struttura congiunta della serie temporale mentre approssima la distribuzione nulla della statistica a livello dell’insieme.
Un approccio ricampiona blocchi temporali allineati del vettore di perdite o differenze. Nel stationary bootstrap le lunghezze dei blocchi sono casuali e la serie ricampionata può ripartire da una data scelta a caso; Politis e Romano introdussero il metodo per osservazioni stazionarie debolmente dipendenti (articolo del 1994). Gli autori MCS descrivono implementazioni block bootstrap e indicano il stationary bootstrap come alternativa. Ricampionare separatamente la serie di perdita di ciascun modello distrugge l’appaiamento nella stessa data e può modificare il confronto.
Lunghezza media del blocco, variante bootstrap, centratura sotto l’ipotesi nulla di pari capacità, numero di repliche e orizzonte influenzano la stima dell’incertezza. Orizzonti lunghi con sovrapposizione spesso allungano la dipendenza nelle differenze, ma non esiste una lunghezza universale adatta a ogni target e campione. Descrivere il disegno e verificare la sensibilità a impostazioni ragionevoli. L’output del bootstrap è un’approssimazione basata sulle sue ipotesi, non corregge look-ahead, riuso dell’holdout, score non stazionari o una famiglia di candidati incompleta.
Svolgere un confronto ipotetico fra quattro modelli
Supponiamo che quattro procedure A, B, C e D prevedano lo stesso target di volatilità su 120 origini giornaliere comuni. Le perdite quadratiche medie, in unità illustrative di punti percentuali al quadrato, sono 1.20, 1.23, 1.45 e 1.90. Le medie collocano A al primo posto e D all’ultimo, ma una classifica da sola non descrive l’incertezza campionaria.
Per A contro B, la differenza media appaiata è \(1.20-1.23=-0.03\). Se l’errore standard tiene conto della dipendenza ed è \(0.04\), la statistica a coppie è \(-0.03/0.04=-0.75\). Questo singolo contrasto non mostra una differenza statisticamente netta fra A e B. L’MCS va oltre: la statistica congiunta considera le differenze fra tutti e quattro i candidati.
Per illustrare la procedura, supponiamo che un MCS block bootstrap sull’intera serie di 120 origini usi \(T_R\), \(\alpha=0.05\) e una regola coerente che elimina il candidato peggiore. Supponiamo che il p-value dell’insieme completo sia 0.018, che D venga eliminato e che il p-value successivo per \(\{A,B,C\}\) sia 0.11. Poiché 0.11 supera 0.05, la procedura si ferma con \(\{A,B,C\}\) come MCS ipotetico al 95%. C resta anche se la sua perdita media supera quella di A: questo esempio ipotetico non ha stabilito che C sia inferiore nel test congiunto.
I p-value sono inventati per mostrare i passaggi; non si ricavano dalle quattro perdite medie o dal solo contrasto A–B. Un risultato reale richiede la serie completa delle perdite a ogni origine, le previsioni dei candidati, il disegno bootstrap e l’ordine di eliminazione. Conservare questi input e riportare la sequenza completa. <!-- learn:illustration -->

Interpretare l’insieme superstite senza affermazioni eccessive
Al livello di confidenza del 95%, date le condizioni di regolarità e di test, l’MCS è progettato per contenere il miglior candidato dell’insieme specificato con almeno la copertura asintotica dichiarata. Non significa che ciascun modello superstite abbia il 95% di probabilità di essere il migliore. La confidenza riguarda la copertura su campioni ripetuti, non una distribuzione a posteriori delle etichette dei modelli.
Non rifiutare la pari capacità predittiva non prova che le perdite attese siano identiche. La potenza può essere limitata con un periodo di valutazione breve, differenze di perdita molto variabili o più candidati quasi a pari merito. Un insieme ampio può indicare onestamente che i dati non distinguono le alternative. Può contenere anche modelli tutti scarsi in termini assoluti, perché l’MCS li confronta tra loro, non con uno standard esterno obbligatorio.
L’insieme è limitato ai candidati inclusi in \(\mathcal M_0\). Se manca una procedura previsiva davvero migliore, l’MCS non può scoprirla. Se un modello viene escluso dopo aver consultato gli stessi dati di valutazione, la copertura nominale non tiene conto di quella ricerca non registrata. Dichiarare come sono stati generati e filtrati i candidati. Se più candidati condividono la perdita attesa minima, mantenerli tutti è coerente con il metodo.
Distinguere l’MCS dai test a coppie e dai benchmark
Il test Diebold–Mariano considera la differenza appaiata di perdita fra due procedure. L’MCS testa ripetutamente un insieme e riferisce quali candidati superano la procedura congiunta di eliminazione. Eseguire molti test DM e conservare le coppie non significative non equivale automaticamente all’MCS: contano il bootstrap congiunto e la regola coerente di eliminazione.
Il test Clark–West riguarda un confronto più circoscritto dell’errore quadratico quando un modello contiene un benchmark vincolato e il rumore di stima influenza la differenza grezza. L’MCS non richiede candidati annidati e consente una perdita definita dall’utente, ma richiede previsioni costruite sullo stesso disegno.
Il Reality Check di White e il test Superior Predictive Ability di Hansen chiedono se almeno un membro di una famiglia esplorata batte un benchmark designato. L’MCS non dipende da un benchmark e descrive un insieme di candidati relativamente migliori. Tutti richiedono di documentare la ricerca e la dipendenza, ma testano ipotesi nulle diverse. Vedi la guida a Reality Check e SPA e gli articoli originali di White (2000) e Hansen (2005).
Dichiarare il disegno e separare la classifica previsiva dal valore di trading
Un rapporto riproducibile elenca ogni procedura candidata, target e orizzonte comuni, regole sull’origine e sulle informazioni, programma di stima, date di valutazione, trattamento dei mancanti, formula di perdita e direzione preferita. Riporta livello di significatività, statistica e regola di eliminazione, tipo di bootstrap, lunghezza dei blocchi, centratura, numero di repliche, p-value a ogni passaggio e insieme finale. Le perdite medie aiutano il contesto ma non sostituiscono l’inferenza congiunta.
Per la volatilità, spiega come è stata costruita la proxy osservata e se è rumorosa o rivista. Per previsioni a più passi, dichiara la sovrapposizione delle finestre e il metodo per la dipendenza. Mostra la sensibilità a variazioni plausibili di perdita, periodo e impostazioni bootstrap quando incidono sull’insieme. Un p-value piccolo senza i candidati eliminati e i dettagli della procedura non basta a riprodurre il risultato.
L’MCS confronta procedure previsive secondo un criterio. Non stabilisce causalità, non identifica il processo generatore dei dati e non dimostra che le previsioni superstiti rendano profittevole un trade. Per passare a una posizione servono soglie, dimensionamento, turnover, momento di esecuzione, spread, commissioni, slippage, finanziamento, prestito e limiti di rischio. Valutare separatamente la regola congelata su dati successivi adeguati e riferire i risultati netti. Per proxy imperfette della volatilità, vedi la guida a QLIKE e perdita quadratica.
Domande frequenti
Q1L’MCS sceglie un solo modello migliore?
Non necessariamente. Può restare un candidato se i dati lo distinguono oppure più candidati se il campione non stabilisce quale sia inferiore. Per sceglierne uno da distribuire serve una regola decisionale separata.
Q2Un modello nell’MCS ha il 95% di probabilità di essere corretto?
No. Il livello di confidenza descrive la copertura su campioni ripetuti del miglior candidato della famiglia specificata, sotto le ipotesi del metodo. Non è una probabilità a posteriori che un modello sia vero.
Q3Posso usare l’MCS per previsioni diverse dalla volatilità?
Sì. Può confrontare previsioni, modelli econometrici o altre procedure se si definiscono un criterio comune sensato e un disegno di campionamento adeguato. Il risultato dipende sempre dai candidati e dalla perdita scelti.
Q4L’MCS considera automaticamente ogni modello che ho provato?
Solo se la ricerca effettiva è rappresentata nella famiglia e nella valutazione. Una selezione non documentata o il riuso dei dati di valutazione non vengono corretti semplicemente calcolando un MCS in seguito.
Fonti e approfondimenti
Segnala un problema
Prepareremo un’e-mail con il link a questo articolo. Mark riceverà la segnalazione solo dopo l’invio
Controllo rapido
Hai finito la guida? Verifica ciò che hai capito con 3 domande
Domanda 01
Che cosa riporta il Model Confidence Set?
Scegli una risposta per vedere la spiegazione
Glossario delle opzioni
Definizioni chiare dei termini essenziali, da call, put e catene di opzioni a IV, greche, interesse aperto e max pain
Sfoglia il glossario delle opzioni