Trasformata integrale di probabilità: calibrazione delle previsioni di densità
Scopri come la PIT valuta previsioni di densità continue e discrete, cosa mostra l’istogramma e perché l’uniformità da sola non basta
In questa guidaPerché una previsione di densità va oltre l’errore puntuale
Breve sintesi
Una previsione di densità assegna probabilità a un intervallo di risultati possibili. La trasformata integrale di probabilità (PIT) converte ogni risultato osservato nella sua probabilità cumulata secondo la previsione. Valori PIT uniformi sono un diagnostico utile sotto ipotesi definite, ma un istogramma uniforme non dimostra da solo calibrazione condizionale o indipendenza nel tempo.
Perché una previsione di densità va oltre l’errore puntuale
Una previsione puntuale può indicare un rendimento di domani pari allo 0,2%. Una previsione di densità assegna probabilità all’intera gamma dei rendimenti, dai movimenti ordinari agli eventi estremi. La valutazione chiede quindi se la distribuzione emessa prima dell’esito sia coerente con ciò che è accaduto. La guida Mincer–Zarnowitz riguarda la calibrazione lineare delle previsioni numeriche puntuali: una domanda diversa.
La PIT misura quanta probabilità cumulata la previsione ha assegnato ai valori non superiori all’esito. È un rango probabilistico, non un rendimento, un segnale di trading o una misura di profitto. La guida Diebold–Mariano confronta le perdite previsive medie secondo uno score scelto; non verifica la stessa cosa della calibrazione di densità.
Trasformare una previsione continua tramite la CDF
Sia (Y_{t+1}) l’esito dopo l’origine previsiva (t), e sia (F_{t+1}(y\mid\mathcal I_t)) la funzione di ripartizione cumulativa (CDF) basata solo sulle informazioni disponibili in (\mathcal I_t). Per una distribuzione continua, si calcola
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ)
La CDF è la probabilità di un valore minore o uguale a (y). Se la CDF prevista è la vera distribuzione condizionale, il teorema PIT implica
Pr(Uₜ₊₁ ≤ u | 𝓘ₜ) = u, for 0 ≤ u ≤ 1
Ogni previsione continua ideale a un passo produce quindi una PIT uniforme condizionatamente. In una sequenza in cui l’informazione include il passato, le PIT ideali sono anche indipendenti tra origini, sotto le ipotesi appropriate. Rosenblatt studiò la trasformazione; Diebold, Gunther e Tay applicarono le sequenze PIT alla valutazione delle previsioni di densità (1952; 1998).
Esempio verificabile: una previsione (N(0,1)) e un’osservazione (y=1) danno (Phi(1)\approx0.8413), cioè circa l’84,13% di probabilità assegnata a valori fino a 1. Un solo dato non determina la calibrazione: serve una sequenza.
Randomizzare la trasformazione per esiti discreti
La CDF discreta salta nei possibili esiti. Il valore ordinario (F(Y)) può quindi assumere solo alcuni livelli e in genere non è Uniform(0,1), anche con una previsione corretta. La PIT randomizzata riempie ogni intervallo di salto:
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ) + Vₜ₊₁ [Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ) − Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ)]
(F(y^-)) è il limite sinistro, ossia la probabilità di un valore strettamente minore di (y); (V) è un’estrazione indipendente Uniform(0,1) usata solo per la valutazione. Per una distribuzione continua il salto è nullo e la formula diventa (F(Y)). Brockwell dimostra la trasformazione randomizzata per distribuzioni arbitrarie, comprese quelle discrete e miste (2007). Per dati di conteggio ordinati, Czado, Gneiting e Held discutono anche una PIT non randomizzata e diagrammi di calibrazione marginale: non trattare i valori discreti di (F(Y)) come se fossero continui e uniformi (2009).
Esempio ipotetico Bernoulli: (P(Y=1)=0.20), quindi (P(Y=0)=0.80). La PIT ordinaria vale 0,80 quando (Y=0) e 1,00 quando (Y=1), dunque non è uniforme. Con randomizzazione, (Y=0) diventa (0.80V) in ([0,0.80]); (Y=1) diventa (0.80+0.20V) in ([0.80,1]). Pesati per le rispettive probabilità, i due intervalli danno densità uno su ([0,1]). L’estrazione serve alla valutazione, non fa parte della previsione.
Separare uniformità marginale, indipendenza e calibrazione condizionale
L’uniformità marginale della PIT è necessaria per previsioni continue ideali, ma non sufficiente. Errori opposti in regimi diversi possono compensarsi nei dati aggregati e produrre un istogramma piatto. Gneiting, Balabdaoui e Raftery mostrano che un PIT quasi uniforme può coesistere con previsioni individuali distorte (2007).
Conta anche l’ordine: una serie può avere un istogramma uniforme e dipendenza seriale, per esempio gruppi o lunghe sequenze di valori simili. Previsioni condizionali ideali implicano più della sola uniformità aggregata. Con orizzonti sovrapposti, il riferimento statistico deve tenerne conto; un test iid non è automaticamente valido.
Esamina distribuzione PIT, ordine temporale, ritardi, variabili all’origine e regimi definiti in anticipo. Grafici raggruppati o test condizionali possono mostrare pattern nascosti, ma le scelte e i limiti del campione contano. Nessun insieme finito di test prova la calibrazione rispetto a ogni possibile variabile condizionante.
Leggere l’istogramma PIT come indizio, non verdetto
Una forma a U è spesso compatibile con previsioni troppo concentrate o sottodisperse; una gobba centrale con previsioni troppo diffuse o sovradisperse. Uno squilibrio laterale può indicare bias di posizione. Sono euristiche, non diagnosi univoche: dipendenza, regimi misti, discrezione, binning e campioni piccoli possono ingannare.
L’istogramma elimina l’ordine temporale, quindi non mostra quando è iniziato un problema né se i valori si raggruppano. Bin ampi possono sembrare piatti con pochi dati; bin stretti possono apparire irregolari per rumore. Riporta numero di previsioni, limiti dei bin e, quando possibile, incertezza. Diebold–Gunther–Tay e Berkowitz propongono test con ipotesi da adattare al disegno. Berkowitz trasforma una PIT interna in (Z_t=\Phi^{-1}(U_t)) e verifica il nullo congiunto di valori normali standard indipendenti contro un’alternativa dinamica specificata, per esempio AR(1). Non è un certificato universale (2001).
<!-- learn:illustration -->

Considerare la stima e valutare fuori campione
Il risultato di uniformità presuppone che la CDF sia la vera legge condizionale. In pratica si stimano parametri, si sceglie una famiglia distributiva e si possono selezionare soglie o variabili. La previsione (F_{t+1}(\cdot;\hat\theta_t)) è quindi parte della procedura. Adattare il modello usando gli esiti del periodo di valutazione e poi presentare le PIT come prova out-of-sample intatta comporta leakage informativo.
In una valutazione rolling, usa solo le informazioni disponibili a ogni origine. Registra finestra di stima, frequenza di ristima, versione dei dati e del modello e passaggi di selezione. Finestre vicine condividono spesso osservazioni; gli orizzonti sovrapposti aggiungono dipendenza.
Dimensione e potenza dei test dipendono da stimatore, campione e procedura. L’istogramma non incorpora l’incertezza parametrica; i riferimenti iid da manuale non valgono per ogni schema stimato o sovrapposto. Per inferenza rilevante, scegli un test adatto o simula/bootstrap il nullo ripetendo l’intera pipeline di stima e previsione. Se la domanda lo richiede, tieni un campione finale fuori dalla selezione del modello.
Distinguere calibrazione e sharpness
La calibrazione riguarda il rapporto tra previsioni ed esiti: gli eventi assegnati a una certa probabilità si verificano con quella frequenza? La sharpness descrive la concentrazione delle distribuzioni previste senza guardare gli esiti. Gneiting, Balabdaoui e Raftery la considerano desiderabile subordinatamente alla calibrazione, non un sostituto.
Una previsione ampia può essere calibrata ma poco informativa. Una previsione stretta può sembrare precisa, ma essere mal calibrata se gli esiti escono troppo spesso dalla sua massa. La PIT valuta la coerenza distributiva; le sintesi di sharpness descrivono ampiezza e concentrazione. Riportare solo una delle due tralascia parte della valutazione.
Una PIT aggregata piatta può nascondere errori per regime di volatilità o orizzonte. Definisci prima le condizioni importanti. La questione è collegata ma distinta da una regressione puntuale e dal test di capacità predittiva condizionale Giacomini–White, che confronta perdite condizionate a un insieme informativo scelto.
Confrontare previsioni complete con score propri sugli stessi esiti
La PIT è soprattutto un diagnostico, non una classifica delle previsioni di densità. Log score e continuous ranked probability score (CRPS) assegnano una perdita scalare a ogni previsione-esito; per definizione, la perdita attesa è minima riportando la vera distribuzione predittiva. Una media osservata non prova che il modello sia corretto. La guida Model Confidence Set tratta confronti basati su insiemi. Confronta le densità con uno score definito per la distribuzione completa e gli stessi esiti.
Specifica target, orizzonte, date comuni, convenzione di perdita e benchmark. Il log score è sensibile a una densità molto bassa sull’osservazione; il CRPS confronta le CDF con sensibilità diversa. L’incertezza delle differenze deve rispettare dipendenza seriale, stima e ricerca di modelli. Usa grafici PIT e score per funzioni diverse.
Né calibrazione né score migliore dimostrano redditività. Un’affermazione di trading richiede una regola decisionale, tempistica informativa, dimensionamento delle posizioni, costi di transazione e finanziamento, e una valutazione out-of-sample dei rendimenti. Una statistica previsiva non è il rendimento di un backtest.
Seguire un flusso PIT riproducibile
Fissa target, orizzonte, orario d’origine, versione dell’esito e natura continua, discreta o mista. Salva ogni CDF o i dati per ricostruirla insieme a risultato osservato e insieme informativo. Calcola (F_t(Y_t)) per distribuzioni continue; con salti, documenta la PIT randomizzata o un diagnostico discreto adatto.
Esamina distribuzione marginale e ordine temporale. Dichiara bin, numerosità, trattamento dei pareggi e seed o procedura di randomizzazione ripetuta. Aggiungi test di indipendenza o condizionali per domande predefinite, con inferenza adatta a finestre rolling, orizzonti sovrapposti e stima. Confronta i modelli separatamente con score propri sugli stessi esiti holdout. La conclusione riguarda previsioni e condizioni definite, non garantisce calibrazione futura o profitti.
Domande frequenti
Q1Una PIT uniforme prova che una previsione di densità è corretta?
No. È una condizione diagnostica necessaria per una previsione continua corretta, ma l’uniformità aggregata non prova indipendenza o calibrazione condizionale. Controlla dipendenze temporali e variabili pertinenti.
Q2Dovrei randomizzare la PIT per una previsione discreta?
Sì, se vuoi il riferimento continuo-uniforme sotto una distribuzione discreta corretta. L’estrazione aggiuntiva distribuisce l’esito nel salto della CDF. Registra metodo e seed; valuta diagnostici discreti se vuoi evitare la randomizzazione.
Q3Cosa significa un istogramma PIT a U?
Spesso è compatibile con previsioni troppo concentrate, mentre una gobba centrale lo è con previsioni troppo diffuse. Sono indizi, non diagnosi univoche: controlla dipendenza, regimi, campione e bin.
Q4Un istogramma PIT migliore equivale a uno score migliore?
No. La PIT diagnostica il comportamento distributivo; gli score propri confrontano previsioni sotto una perdita e un target definiti. Riporta entrambi sugli stessi esiti out-of-sample e non interpretarli come profitto di trading. Ricerca primaria - Rosenblatt, “Remarks on a Multivariate Transformation” (1952) - Diebold, Gunther, and Tay, “Evaluating Density Forecasts with Applications to Financial Risk Management” (1998) - Berkowitz, “Testing Density Forecasts, with Applications to Risk Management” (2001) - Gneiting, Balabdaoui, and Raftery, “Probabilistic Forecasts, Calibration and Sharpness” (2007) - Brockwell, “Universal Residuals: A Multivariate Transformation” (2007) - Czado, Gneiting, and Held, “Predictive Model Assessment for Count Data” (2009)
Fonti e approfondimenti
Segnala un problema
Prepareremo un’e-mail con il link a questo articolo. Mark riceverà la segnalazione solo dopo l’invio
Controllo rapido
Hai finito la guida? Verifica ciò che hai capito con 3 domande
Domanda 01
Cosa implica il teorema PIT per una previsione condizionale continua corretta?
Scegli una risposta per vedere la spiegazione