Punteggio congiunto VaR–ES: il metodo di Fissler–Ziegel
Scopri perché Value at Risk ed Expected Shortfall richiedono una regola di punteggio congiunta, come confrontare le previsioni con Fissler–Ziegel e in cosa differiscono dai test delle eccezioni VaR.
In questa guidaParti dalla coppia di previsioni e dalla convenzione della coda
Breve sintesi
Il VaR è un quantile e può essere valutato da solo con una perdita quantilica. L’Expected Shortfall (ES) è diverso: in ampie classi di distribuzioni non è elicitable come previsione puntuale autonoma. Fissler e Ziegel mostrano che VaR ed ES possono essere valutati insieme con un punteggio strettamente coerente, se valgono determinate condizioni. Questo permette di confrontare coppie di previsioni, ma un punteggio basso non dimostra che il modello sia corretto.
Parti dalla coppia di previsioni e dalla convenzione della coda
Sia L_t una perdita, quindi un valore maggiore è peggiore, e sia c un livello di confidenza, per esempio 97,5%. Il quantile condizionale della perdita v(c,t) è il più piccolo x per cui F(L_t ≤ x | informazioni disponibili fino a t−1) raggiunge c. Per la coda superiore delle perdite, l’ES è e(c,t) = 1/(1−c) volte l’integrale di v(u,t) da c a 1, se la media di coda è finita. Con una distribuzione continua coincide con la perdita media oltre la soglia VaR. Se alla soglia c’è una massa di probabilità, la definizione tramite integrale dei quantili include solo la quota necessaria di quella massa.
Il punteggio deve rispettare la convenzione usata per le previsioni. Alcuni studi definiscono VaR ed ES sulla coda inferiore dei rendimenti, spesso con valori negativi, e indicano la probabilità di coda con α = 1−c. Con perdite positive si usa la coda superiore e l’ES è almeno pari al VaR. Mescolare le due convenzioni può invertire disuguaglianze e indicatori di eccezione. Specifica segno, livello di confidenza, orizzonte e informazioni disponibili prima dell’esito.
Perché VaR ed ES non hanno lo stesso punteggio autonomo
Un quantile ha un punteggio pinball strettamente coerente. Per una perdita L e il quantile c v, una forma del punteggio VaR è S_VaR(v,L) = (I{L ≤ v}−c)(v−L). Con le condizioni usuali per i quantili, il punteggio atteso è minimo al quantile obiettivo. Il VaR può quindi essere valutato da solo usando previsioni e risultati.
Per l’ES non esiste un punteggio strettamente coerente equivalente che lo renda elicitable da solo nelle ampie classi di distribuzioni delle perdite usate nella gestione del rischio. La portata dell’affermazione è precisa: riguarda una previsione puntuale autonoma il cui punteggio atteso seleziona univocamente l’ES. Non significa che l’ES sia inutile o impossibile da confrontare o testare.
Fissler e Ziegel stabiliscono la distinzione centrale: l’ES non è elicitable da solo in questo senso, mentre la coppia (VaR, ES) lo è congiuntamente sotto condizioni moderate di regolarità e sui momenti. Il loro articolo analizza le condizioni per punteggi strettamente coerenti (Fissler e Ziegel, 2016). Elicitabilità congiunta significa che un’unica funzione usa entrambe le previsioni e l’esito osservato. Non basta sommare due perdite qualsiasi per ottenere un punteggio ES valido.
Che cosa valuta un punteggio Fissler–Ziegel
Indichiamo con S_c(v,e;L) un punteggio congiunto ammissibile al livello c. La stretta coerenza significa che il punteggio atteso, sotto la distribuzione obiettivo, è minimo per la coppia corretta: (VaR_c, ES_c) = arg min su (v,e) di E[S_c(v,e;L)]. Con le condizioni pertinenti il minimo è unico. Il punteggio combina l’informazione sul superamento della soglia VaR con la perdita realizzata nella coda e con la previsione ES. Per le perdite positive, l’ES non dovrebbe essere inferiore al VaR.
Fissler e Ziegel descrivono una classe di punteggi, non una formula obbligatoria unica. Patton, Ziegel e Chen applicano questo risultato a modelli dinamici congiunti di VaR ed ES e al confronto delle previsioni (Patton, Ziegel e Chen, 2019). Un membro comune, FZ0, è scritto per rendimenti nella coda inferiore: Y = −L, α = 1−c e previsioni negative e ≤ v < 0: S_FZ0(Y,v,e;α) = −I{Y ≤ v}(v−Y)/(αe) + v/e + ln(−e) − 1. Questa formula dipende dalla convenzione dei rendimenti e dai segni indicati. Non va applicata senza modifiche ai dati di perdita positiva e non è automaticamente la migliore per ogni dataset. Specifica la regola scelta e verifica che le ipotesi siano rispettate.
Come leggere medie e differenze dei punteggi
Per il modello m calcola S_c(v_hat(m,t),e_hat(m,t);L_t) per ogni coppia previsione-risultato e poi fai la media sulle T osservazioni. Con lo stesso punteggio ammissibile, date, obiettivo e convenzioni, una media più bassa indica una prestazione relativa migliore secondo quella regola. Il valore non è una probabilità, un importo VaR o una previsione di perdita in denaro; la scala dipende dal punteggio.
Per confrontare A e B, calcola d_t = S_A,t − S_B,t. Una media negativa favorisce A secondo il punteggio selezionato. Entrambe le previsioni sono valutate sulla stessa realizzazione, quindi la differenza appaiata è più informativa di due medie arrotondate separatamente. Può comunque essere incerta quando le osservazioni di coda sono poche.
<!-- learn:illustration -->
Confronta gli stessi istanti di previsione, portafoglio o variabile obiettivo, orizzonte, livello di confidenza e versione dei dati. Le previsioni devono essere registrate prima dei risultati. Se gli orizzonti si sovrappongono o le differenze hanno dipendenza seriale, la stima dell’incertezza deve tenerne conto. Riporta un errore standard o un intervallo adeguato: una differenza grezza piccola non è automaticamente una vittoria affidabile.

Perché due perdite autonome non bastano
Può sembrare naturale aggiungere alla perdita pinball del VaR un errore assoluto della previsione ES rispetto a un valore di riferimento. Ma anche quel valore potrebbe non essere adeguato e il valore atteso del secondo termine non deve necessariamente raggiungere il minimo all’ES vero. Una somma con pesi arbitrari non garantisce la coerenza congiunta. Il punteggio FZ è costruito per valutare insieme la coppia VaR–ES.
La classe Fissler–Ziegel comprende più punteggi con scale e sensibilità differenti. Le medie calcolate con funzioni diverse non sono direttamente confrontabili. Patton, Ziegel e Chen discutono FZ0 e alcune proprietà di scala sotto ulteriori ipotesi sui segni; questo non rende FZ0 universalmente superiore. Scegli e documenta la regola prima di esaminare la graduatoria.
Anche la coppia di previsioni deve essere coerente. Un valore ES che sembra ragionevole può ottenere un punteggio negativo se è in contraddizione con il VaR associato. Al contrario, un buon punteggio congiunto non prova che tutta la distribuzione condizionale sia corretta. Si valuta la funzione VaR–ES dichiarata, con il punteggio e il disegno scelti.
Le stesse eccezioni VaR possono nascondere perdite di coda diverse
L’indicatore di eccezione VaR è binario: I_t = 1 se L_t supera il VaR previsto, altrimenti 0. Due modelli possono avere le stesse date e lo stesso numero di eccezioni, mentre le perdite oltre la soglia sono molto diverse. Quattro superamenti non dicono se siano stati piccoli oppure se uno sia arrivato molto più in profondità nella coda. Un semplice conteggio elimina proprio l’informazione sulla grandezza che l’ES dovrebbe aggiungere.
Il punteggio congiunto usa VaR ed ES insieme alla perdita osservata; quindi la grandezza delle perdite di coda può incidere oltre il numero di eccezioni. È la funzione scelta a stabilire il contributo esatto di ogni osservazione. Non decretare un vincitore sulla base di un singolo evento estremo: calcola il punteggio sull’intero campione comune ed esamina la sensibilità.
Il confronto tramite punteggio e il test di calibrazione VaR rispondono a domande diverse. Il primo ordina coppie di previsioni secondo una regola definita; il test delle eccezioni valuta frequenza o raggruppamento temporale dei superamenti. Una graduatoria non è un certificato completo di calibrazione.
I test delle eccezioni e i backtest ES rispondono a domande diverse
I test di Kupiec confrontano il numero di eccezioni VaR con il tasso obiettivo; le estensioni di Christoffersen esaminano anche dipendenza o raggruppamenti. Poiché riducono ogni esito a eccezione o non eccezione, non misurano quanto la perdita abbia superato la soglia né verificano direttamente la previsione ES. La guida su VaR ed Expected Shortfall spiega le informazioni diverse contenute nelle due misure.
Acerbi e Szekely propongono backtest ES non parametrici e osservano che l’elicitabilità riguarda la selezione dei modelli, ma non è un requisito per testare una misura di rischio (Acerbi e Szekely, 2014). Bayer e Dimitriadis sviluppano backtest ES basati su regressioni con struttura congiunta VaR–ES; le diverse varianti hanno ipotesi e requisiti di covarianza specifici (Bayer e Dimitriadis, 2022). Una graduatoria di punteggi non sostituisce un backtest dedicato. Allo stesso modo, la mancata reiezione non dimostra che la coppia di previsioni sia corretta.
Pianifica l’inferenza appaiata ed evita la selezione a posteriori
La sequenza delle differenze d_t è una serie temporale. Per previsioni a un passo non sovrapposte e con ipotesi di dipendenza adeguate, si può valutare un test appaiato della differenza media. Con dipendenza seriale o orizzonti sovrapposti, l’incertezza va stimata con un metodo adeguato, per esempio una varianza di lungo periodo o un ricampionamento a blocchi appropriato. Riporta metodo e parametri, non solo il valore p.
Fissa punteggio, livello di coda, orizzonte, periodo di valutazione e insieme dei modelli prima di confrontare i risultati. Provare molti punteggi, finestre, portafogli e varianti e mostrare solo il valore migliore crea un problema di selezione. Se possibile, conserva un periodo successivo non usato per scegliere il modello e descrivi la ricerca. Gli errori standard ordinari non correggono automaticamente la selezione.
Riporta medie e differenza appaiata con la relativa incertezza, definizione del punteggio, segni e convenzioni, date comuni fuori campione e numero di osservazioni di coda. Se la graduatoria cambia con scelte ragionevoli di punteggio o periodo, mostra questa sensibilità.
Limiti e lista pratica di controllo
Con livelli di confidenza elevati, le osservazioni di coda sono poche e la graduatoria può essere instabile anche con serie lunghe. Eteroschedasticità condizionale, cambi di regime, rendimenti sovrapposti, incertezza della stima, errori nei dati e modifiche del portafoglio possono influire sulle differenze. L’elicitabilità congiunta non elimina questi problemi; fornisce una classe di punteggi fondata sotto condizioni matematiche.
Verifica che la perdita realizzata corrisponda allo stesso portafoglio, orizzonte, criterio di valutazione e segno della previsione. VaR ed ES devono riferirsi alla stessa probabilità di coda. Controlla che i pronostici fossero ex ante e che il punteggio rispetti le proprie ipotesi su distribuzione, momenti e segni. Riporta lunghezza del campione, osservazioni di coda, formula, metodo per l’incertezza e ogni ricerca di modelli o punteggi. La conclusione è limitata a quel disegno.
Un punteggio congiunto più basso è evidenza di una migliore prestazione predittiva relativa secondo una regola specifica. Non dimostra che il modello catturi tutti gli eventi estremi, che le stime siano sicure o che il futuro replichi il campione. Questo articolo illustra metodi statistici e non è consulenza d’investimento.
Domande frequenti
Q1Posso confrontare le previsioni ES con l’errore assoluto?
Non come sostituto generale di un punteggio strettamente coerente. Nel confronto di previsioni puntuali, l’ES viene di norma valutato insieme al VaR; per la calibrazione si può usare un backtest specifico per l’ES.
Q2Un punteggio congiunto indica se un modello di rischio è calibrato?
Confronta la prestazione relativa secondo un punteggio scelto. Calibrazione e specificazione errata sono questioni diverse e richiedono test e diagnosi adeguati.
Q3Due modelli possono avere le stesse eccezioni VaR e punteggi diversi?
Sì. Gli indicatori possono coincidere mentre cambiano la grandezza delle perdite oltre il VaR o le previsioni ES. L’effetto preciso dipende dal punteggio.
Q4Un punteggio basso significa che il modello è sicuro?
No. Il risultato dipende dal campione, dal punteggio e dalle ipotesi. Dati di coda scarsi, cambi di regime, selezione del modello o errori nei dati possono modificarlo. Non è consulenza d’investimento.
Fonti e approfondimenti
Segnala un problema
Prepareremo un’e-mail con il link a questo articolo. Mark riceverà la segnalazione solo dopo l’invio
Controllo rapido
Hai finito la guida? Verifica ciò che hai capito con 3 domande
Domanda 01
Perché Expected Shortfall viene spesso valutato insieme al VaR?
Scegli una risposta per vedere la spiegazione
Glossario delle opzioni
The average loss from a chosen VaR quantile through the worst tail under a precise convention; it measures severity beyond the threshold rather than only its location.
Leggi la guida completaAssignmentThe process that requires an option writer to fulfill the contract after an exercise notice is allocated; it can create or remove an underlying position.
Leggi la guida completaBid-ask spreadThe gap between the best displayed bid and ask, which is a practical trading cost and a signal of how uncertain an immediate fill may be.
Leggi la guida completa