Backtest del VaR: spiegazione dei test di Kupiec e Christoffersen
Scopri come il test POF di Kupiec e i test di copertura condizionale di Christoffersen valutano le violazioni del VaR, come leggere un esempio di 250 giorni e perché la mancata reiezione non prova l’accuratezza.
In questa guidaChe cosa verifica un backtest del VaR?
Breve sintesi
Un backtest del VaR confronta la soglia di perdita prevista con la perdita che si verifica in seguito. Il test di Kupiec chiede se il numero di violazioni è coerente con il tasso obiettivo. I test di Christoffersen verificano anche se le violazioni sono indipendenti nel tempo o si raggruppano. Misurano aspetti diversi della previsione e nessuno dei due dimostra che il modello di rischio sia corretto.
Che cosa verifica un backtest del VaR?
Il Value at Risk (VaR) è una soglia di perdita legata a un livello di confidenza e a un orizzonte. Se il VaR giornaliero al 99% è $10.000, secondo le informazioni e le ipotesi dichiarate dal modello la probabilità di una perdita giornaliera superiore a $10.000 è pari all’1%. Il VaR non è un limite massimo alla perdita e non descrive quanto possa essere grande una perdita oltre quella soglia.
Il backtest trasforma la sequenza delle previsioni e dei risultati in una sequenza di indicatori di violazione. Con un VaR giornaliero al 99%, un modello ben calibrato dovrebbe produrre violazioni circa nell’1% delle osservazioni comparabili su un campione ripetuto. L’affermazione ha due componenti: la frequenza di lungo periodo dovrebbe essere vicina al target e le violazioni non dovrebbero seguire un andamento incompatibile con le previsioni condizionali di rischio del modello. Il test proportion-of-failures (POF) di Kupiec riguarda la prima componente. I test di indipendenza e di copertura condizionale di Christoffersen considerano anche l’ordine delle violazioni.
La distinzione è concreta. Un modello può registrare quattro violazioni in un anno e concentrarle tutte in una settimana turbolenta. Un altro può avere quattro violazioni distribuite nell’anno. Un test che guarda solo il conteggio vede quattro in entrambi i casi; un test che considera il tempo osserva sequenze diverse. I test qui sotto aiutano a descrivere queste caratteristiche, ma non sostituiscono l’esame delle posizioni, dei dati di mercato, delle ipotesi o della gravità delle perdite. Una guida separata su GARCH e clustering della volatilità spiega come i modelli GARCH rappresentano il clustering; un modello della varianza e un backtest rispondono a domande diverse.
Definisci la violazione prima di contarla
Usa sempre la stessa convenzione di segno. Sia Lₜ la perdita realizzata nel giorno t e VaRₜ|ₜ₋₁ la soglia giornaliera prevista con le informazioni disponibili prima del giorno t. Definisci l’indicatore di violazione Iₜ = 1 se Lₜ > VaRₜ|ₜ₋₁ e Iₜ = 0 altrimenti. Per un modello VaR al 99%, la probabilità di violazione obiettivo è α = 1 − 0,99 = 0,01. Alcune fonti definiscono l’indicatore in termini di rendimenti o di copertura dell’intervallo; le convenzioni sono equivalenti se si traducono correttamente segno e probabilità. Dichiara quale usi.
Previsione e risultato devono riferirsi allo stesso portafoglio, orizzonte, orario di valutazione e definizione di perdita. Se la previsione viene prodotta dopo la chiusura per il giorno di negoziazione successivo, confrontala con la perdita di quel giorno secondo una regola di valutazione coerente. Decidi in anticipo come trattare l’uguaglianza alla soglia VaR, le festività, le osservazioni mancanti, le chiusure di mercato, le correzioni intraday e i cambiamenti del portafoglio. Queste scelte possono modificare la sequenza, soprattutto quando le violazioni sono rare.
Tieni separata la stima del modello dalla valutazione finale. Se parametri o soglie di rischio sono stati scelti dopo aver esaminato lo stesso periodo usato nel test, il p-value non descrive più un controllo out-of-sample pulito. Per previsioni rolling, registra quando ciascuna è stata formulata e quali informazioni erano disponibili allora. Orizzonti di più giorni sovrapposti possono rendere dipendenti gli indicatori di violazione. I test standard che seguono non correggono automaticamente orizzonti disallineati, dati futuri, input revisionati o processi di selezione del modello.
A quale domanda risponde il test POF di Kupiec?
Supponi di avere T coppie previsione-risultato comparabili e x violazioni. Il tasso osservato è p̂ = x/T. Il test proportion-of-failures (POF) di Kupiec, chiamato anche test di copertura incondizionata, deriva dal suo articolo del 1995; è disponibile anche una scheda d’archivio della Federal Reserve. Confronta due verosimiglianze binomiali: la prima fissa la probabilità di violazione al target α, la seconda la stima liberamente come p̂. La statistica del rapporto di verosimiglianza è
LRᵤ꜀ = −2 ln [ (1−α)^(T−x) α^x / ((1−p̂)^(T−x) p̂^x) ].
Sotto l’ipotesi nulla, le violazioni sono eventi Bernoulli indipendenti con probabilità α. Per campioni sufficientemente grandi, la statistica è approssimativamente distribuita come una chi-quadro con un grado di libertà. Un valore elevato porta a respingere la frequenza di violazione specificata. Poiché l’alternativa stima liberamente il tasso osservato, il test può respingere sia quando le violazioni sono troppe sia quando sono troppo poche. Un modello che quasi mai supera il VaR non è automaticamente calibrato: potrebbe essere così prudente da non essere utile per lo scopo previsto.
Il POF usa il numero x, non le date delle violazioni. Riordinare gli stessi indicatori non cambia la statistica. Perciò il risultato non distingue quattro violazioni sparse da quattro consecutive. La verosimiglianza Bernoulli presuppone inoltre indipendenza degli indicatori per la distribuzione di riferimento. Se vuoi verificare il raggruppamento, aggiungi un test di dipendenza anziché dedurlo dal POF.
Un esempio di 250 giorni mostra perché il p-value va contestualizzato
Considera una serie ipotetica di 250 previsioni giornaliere del VaR al 99%. Il tasso obiettivo è α = 0,01, quindi sotto l’ipotesi nulla il numero atteso di violazioni è Tα = 250 × 0,01 = 2,5. Supponi che la serie contenga quattro violazioni. Il tasso osservato è p̂ = 4/250 = 0,016, cioè l’1,6%. È superiore al target dell’1%, ma lo scarto da solo non stabilisce se il test del rapporto di verosimiglianza respinga.
Sostituendo T = 250, x = 4 e α = 0,01 si ottiene LRᵤ꜀ ≈ 0,769. Usando il riferimento asintotico chi-quadro(1), p ≈ 0,38 e il valore critico al 5% è circa 3,84. Con questa approssimazione, l’esempio non respinge l’ipotesi di copertura incondizionata al 5%. Il calcolo è ipotetico, non un risultato empirico né una soglia di accettazione consigliata.
Le due log-verosimiglianze mostrano da dove viene la statistica. Con il tasso obiettivo fissato, ℓ₀ = 246 ln(0,99) + 4 ln(0,01) ≈ −20,893. Con il tasso osservato non vincolato, ℓ₁ = 246 ln(0,984) + 4 ln(0,016) ≈ −20,508. L’adattamento libero è superiore di circa 0,385 unità di log-verosimiglianza, quindi LRᵤ꜀ = −2(ℓ₀ − ℓ₁) ≈ 0,769. Il test misura la perdita di adattamento rispetto al modello con il tasso obiettivo, non una distanza in euro.
La mancata reiezione non dimostra che il modello sia ben calibrato. Erano attese soltanto 2,5 violazioni, perciò uno o due eventi in più cambiano sensibilmente il tasso osservato. Il riferimento chi-quadro è asintotico e i test per eventi rari possono avere poca potenza con un campione di queste dimensioni. Leggi la statistica insieme al conteggio atteso, all’orizzonte, al disegno del test e alla dimensione del campione. Il p-value non è la probabilità che il modello VaR sia vero.
Lo stesso numero di violazioni può nascondere tempistiche diverse
Confronta due sequenze ipotetiche di 250 giorni, ciascuna con quattro violazioni. Nella sequenza A le violazioni sono ai giorni 20, 80, 140 e 220. Nella sequenza B sono ai giorni 60, 61, 180 e 181. Entrambe hanno x = 4 e p̂ = 1,6%, quindi la statistica di Kupiec è identica. B, però, contiene due coppie di violazioni in giorni consecutivi, mentre A non ne contiene.
Lo schema qui sotto mostra perché conviene conservare l’ordine della sequenza di hit, non solo il totale. È concettuale: non è una serie di dati di 250 giorni né il risultato di un test. Violazioni consecutive possono essere compatibili con un modello che non reagisce alle variazioni della volatilità, ma pochi punti non bastano a diagnosticarne la causa. Il pattern può dipendere anche da specificazione errata, shock di mercato, cambiamenti del portafoglio, orizzonti sovrapposti o convenzioni sui dati e sulla tempistica.
Sia nᵢⱼ il numero di transizioni in cui l’indicatore precedente vale i e quello corrente j; 0 significa nessuna violazione e 1 una violazione. Escludendo i confini del campione, A ha n₀₁ = 4 e n₁₁ = 0, mentre B ha n₀₁ = 2 e n₁₁ = 2. Entrambe hanno quattro violazioni, ma in B alcune sono seguite da un’altra violazione. È questa l’informazione utilizzata dal test di indipendenza di primo ordine.
La tabella completa delle transizioni è: A, n₀₀ = 241, n₀₁ = 4, n₁₀ = 4, n₁₁ = 0; B, rispettivamente 243, 2, 2 e 2. La probabilità stimata di hit dopo un giorno senza violazione è n₀₁/(n₀₀+n₀₁); dopo una violazione è n₁₁/(n₁₀+n₁₁). Per A sono 4/245 ≈ 1,63% e 0/4 = 0%. Per B sono 2/245 ≈ 0,82% e 2/4 = 50%. Quel 50% deriva da quattro sole transizioni ipotetiche successive a un hit: non è una stima credibile del rischio del modello reale il giorno seguente.

Che cosa aggiunge il test di indipendenza di Christoffersen?
Il test di indipendenza di Christoffersen, sviluppato nel suo articolo del 1998, valuta se la probabilità di violazione oggi cambia in base alla presenza o meno di una violazione ieri. Sia π₀ = Pr(Iₜ = 1 | Iₜ₋₁ = 0) e π₁ = Pr(Iₜ = 1 | Iₜ₋₁ = 1). Sotto l’ipotesi nulla di indipendenza, π₀ = π₁. Nell’alternativa, le due probabilità di transizione vengono stimate separatamente dai conteggi n₀₀, n₀₁, n₁₀ e n₁₁.
La statistica del rapporto di verosimiglianza confronta i due modelli e di norma viene valutata con riferimento asintotico chi-quadro a un grado di libertà. A differenza del POF, dipende dall’ordine degli indicatori. Se le violazioni tendono a essere seguite da altre violazioni, π₁ può superare π₀. Il test riguarda specificamente la dipendenza di primo ordine nella sequenza binaria; non verifica ogni possibile modo in cui informazioni passate, volatilità o stato del portafoglio possano prevedere perdite future.
Con poche violazioni, le stime di transizione possono essere molto instabili. Una sequenza senza hit consecutivi può produrre una stima al limite π₁ = 0, ma ciò non dimostra che una seconda violazione sia impossibile. Significa solo che non se ne è verificata una nel campione. Esamina i conteggi delle transizioni e la dimensione del campione insieme alla statistica. Non interpretare una tabella sparsa come una stima precisa del rischio di coda del giorno successivo.
La copertura condizionale combina frequenza e indipendenza
Il test di copertura condizionale combina la statistica di frequenza di Kupiec e quella di indipendenza di Christoffersen: LR꜀꜀ = LRᵤ꜀ + LRᵢₙd. L’ipotesi nulla congiunta afferma che la probabilità di violazione è α e che le violazioni sono indipendenti nel tempo. Nel consueto quadro di grande campione, la somma viene confrontata con una chi-quadro a due gradi di libertà.
Riporta anche i risultati delle componenti, non solo il test congiunto. Il rifiuto della copertura condizionale indica che le due condizioni congiunte non sono coerenti con la sequenza osservata sotto le ipotesi del test, ma non ne identifica la causa. Se il POF respinge ma l’indipendenza no, il conteggio totale può essere il segnale più chiaro. Se respinge il test di indipendenza, occorre esaminare la tempistica delle violazioni anche quando il totale è vicino al target. Se nessuno respinge, il campione potrebbe comunque essere troppo breve per rivelare una specificazione errata.
L’interpretazione è circoscritta. Il test riduce ogni giorno a un esito binario e non distingue una perdita che supera il VaR di $1 da una che lo supera di $1 milione. Non convalida il resto della distribuzione delle perdite né dimostra che l’Expected Shortfall sia corretto. Per capire come VaR e Expected Shortfall rispondano a domande diverse sul rischio di coda, consulta la guida a VaR ed Expected Shortfall.
Le violazioni rare complicano l’inferenza su campioni brevi
Con VaR al 99%, un campione di 250 giorni implica solo 2,5 violazioni attese. Se gli hit indipendenti hanno probabilità dell’1%, il numero atteso di transizioni hit-hit in 249 coppie adiacenti è circa 249 × 0,01² = 0,025. La maggior parte di questi campioni non avrà coppie consecutive anche se il modello è calibrato. Questa scarsità rende difficile stimare con precisione le probabilità di transizione e può limitare la potenza del test di dipendenza.
Nel loro articolo del 2004, Christoffersen e Pelletier segnalano che i backtest VaR esistenti possono avere potenza relativamente bassa in campioni piccoli ma realistici e studiano test basati sulla durata tra le violazioni. I loro risultati motivano un’ulteriore diagnostica; non dimostrano che un test di durata sia sempre superiore né eliminano la necessità di adattare il test alla previsione di rischio e al disegno del campione. Quando le osservazioni sono poche, dichiaralo invece di trattare la mancata reiezione come una certificazione.
Conta anche il livello di coda obiettivo. Con VaR al 95%, 250 giorni implicano 12,5 violazioni attese; con VaR al 99,9%, soltanto 0,25. La stessa etichetta del test non rende confrontabili le evidenze ottenute con disegni diversi. Indica il livello di confidenza, l’orizzonte, il numero di osservazioni, il target e il conteggio osservato, i conteggi di transizione e se il riferimento è asintotico o deriva da un metodo a campione finito.
Quando conviene usare un’altra diagnostica?
Scegli il test successivo chiedendoti quali informazioni i due precedenti hanno scartato. Se vuoi verificare se le violazioni sono prevedibili da hit ritardati, previsioni VaR o altre variabili note al momento della previsione, il test dynamic quantile (DQ) di Engle e Manganelli nel loro articolo CAViaR verifica vincoli sugli indicatori di violazione centrati e su un insieme di strumenti scelto. La conclusione dipende da quegli strumenti e dalla loro tempistica; non è un test di ogni possibile errore condizionale. Un test basato sulle durate esamina invece i tempi di attesa tra le violazioni e amplia l’analisi in modo diverso.
Se la questione riguarda l’entità della perdita oltre la soglia VaR, frequenza e indipendenza non bastano. Esamina la dimensione delle eccedenze e scegli un metodo di valutazione dell’Expected Shortfall coerente con la previsione e le ipotesi. Se il problema è aver scelto il risultato migliore dopo aver provato molti modelli, il backtest VaR non risolve il rischio di selezione della strategia; consulta PBO e CSCV per una diagnostica distinta basata sui ranghi.
Un rapporto utile specifica portafoglio e definizione di perdita, orizzonte, livello di confidenza, date di valutazione, generazione delle previsioni, regola di violazione, conteggi attesi e osservati, statistica POF, conteggi di transizione, risultati dei test di indipendenza e copertura condizionale, oltre ai limiti dovuti al campione o agli orizzonti sovrapposti. Affianca ai test grafici delle soglie previste e delle perdite realizzate e non riutilizzare i dati di valutazione nella selezione del modello. Così le evidenze sono interpretabili, ma un backtest superato non garantisce il controllo del rischio futuro.
Domande frequenti
Q1Se il test di Kupiec non respinge, il mio modello VaR è accurato?
No. Significa che, sotto le ipotesi del test, non è stata trovata evidenza sufficiente contro il tasso di violazione specificato. Un campione breve, soprattutto a un livello di confidenza del 99% o superiore, può contenere troppo poche violazioni per rivelare un problema.
Q2Due modelli che superano lo stesso test di Kupiec possono avere pattern di violazione diversi?
Sì. La statistica di Kupiec dipende dal conteggio, non dall’ordine. Il test di indipendenza di Christoffersen aggiunge informazioni sull’eventuale raggruppamento delle violazioni in osservazioni vicine.
Q3Questi test mi dicono quanto può essere grande la perdita dopo il superamento del VaR?
No. Usano un indicatore di violazione e non misurano l’entità dell’eccedenza. Se conta la gravità delle perdite oltre il VaR, esamina separatamente le perdite di coda e valuta anche l’Expected Shortfall.
Fonti e approfondimenti
Segnala un problema
Prepareremo un’e-mail con il link a questo articolo. Mark riceverà la segnalazione solo dopo l’invio
Controllo rapido
Hai finito la guida? Verifica ciò che hai capito con 3 domande
Domanda 01
Quale caratteristica utilizza il test POF di Kupiec?
Scegli una risposta per vedere la spiegazione
Glossario delle opzioni
The average loss from a chosen VaR quantile through the worst tail under a precise convention; it measures severity beyond the threshold rather than only its location.
Leggi la guida completaGARCHA time-series model that updates conditional variance from past squared shocks and prior variance; it models volatility persistence, not return direction.
Leggi la guida completaAssignmentThe process that requires an option writer to fulfill the contract after an exercise notice is allocated; it can create or remove an underlying position.
Leggi la guida completa