Skip to content
Tutte le guide sulle opzioni
Valutazione delle previsioni probabilistiche12 min di lettura

Brier score e log loss a confronto per le previsioni probabilistiche

Confronta Brier score e log loss per previsioni probabilistiche binarie, impara a calcolarli e interpreta scoring proprio, calibrazione e abilità previsiva

In questa guidaLa percentuale di previsioni corrette scarta la probabilità prevista

Breve sintesi

Una previsione probabilistica indica quanto è probabile un evento, non soltanto quale esito è più probabile. Brier score e log loss confrontano queste probabilità con gli esiti osservati. Entrambi sono proper scoring rules, ma penalizzano gli errori in modo diverso. Perciò uno score più basso è significativo solo dopo aver fissato l’evento, il campione, la convenzione di calcolo e il riferimento.

La percentuale di previsioni corrette scarta la probabilità prevista

Immagina di registrare se un modello ha previsto correttamente “rialzo” o “ribasso”. La percentuale di previsioni corrette tratta allo stesso modo una previsione giusta al 51% e una giusta al 99%. Tratta allo stesso modo anche una previsione sbagliata al 49% e una sbagliata all’1%. Così si perde la fiducia espressa dalla previsione, benché possa contare quando le decisioni hanno payoff o rischi diversi.

Una previsione probabilistica binaria assegna un valore \(p_t\) tra zero e uno a un evento definito con chiarezza all’origine della previsione \(t\). In seguito l’esito è registrato come \(y_t=1\) se l’evento si verifica e \(y_t=0\) altrimenti. Una regola di scoring valuta insieme previsione ed esito. Brier score usa l’errore di probabilità al quadrato; log loss usa il logaritmo negativo della probabilità assegnata a ciò che è effettivamente accaduto.

Questi score sono utili per confrontare previsioni probabilistiche, comprese le probabilità di eventi prodotte da un modello di trading. Da soli non dimostrano che una previsione sia calibrata, superi un riferimento sensato o generi profitti se usata per fare trading. La guida a Mincer–Zarnowitz illustra una diversa regressione lineare di calibrazione per previsioni puntuali numeriche.

Definisci un evento e abbina ogni previsione al suo esito

Prima di calcolare lo score, definisci l’evento in modo che possa essere determinato con coerenza. “L’asset salirà?” è incompleto finché non specifichi l’asset, la fonte del prezzo, gli orari di inizio e fine, la valuta, la convenzione del rendimento e il trattamento dei dati mancanti o corretti. Per un evento economico, registra la pubblicazione e la versione dei dati usati per determinare l’esito. Non confrontare previsioni valutate su definizioni o insiemi di date diversi.

Conserva ogni previsione così come era disponibile alla sua origine. Una probabilità emessa al tempo \(t\) deve usare le informazioni disponibili entro il cutoff dichiarato ed essere abbinata all’esito dello stesso orizzonte. Una serie di dati revisionata, una chiusura di borsa successiva o una regola di classificazione scelta dopo aver visto l’esito possono cambiare silenziosamente il target o introdurre informazioni future.

Per le previsioni rolling, conserva la versione del modello, la versione dei dati in ingresso, il timestamp, la probabilità e la regola di risoluzione. Usa le stesse origini per confrontare i modelli. Se una probabilità manca, documenta l’esclusione e applica a ogni candidato la stessa regola campionaria. Questi dati rendono lo score riproducibile, anziché un riepilogo di un foglio di calcolo che cambia.

Calcola il Brier score dagli errori quadratici di probabilità

Per un singolo evento binario, la Brier loss del caso \(t\) è:

BSₜ = (pₜ − yₜ)²

Il Brier score medio su \(n\) previsioni è:

BS = (1/n) Σₜ (pₜ − yₜ)²

Più basso è meglio, zero è perfetto e questa convenzione per un singolo evento va da zero a uno. Per esempio, se la previsione è \(p=0.70\) e l’evento si verifica, la loss è \((0.70-1)^2=0.09\). Se dopo la stessa previsione l’evento non si verifica, la loss è \((0.70-0)^2=0.49\). Un errore commesso con molta sicurezza costa più di un errore moderato, ma la penalità è limitata.

Controlla la formula quando confronti valori pubblicati. Alcune convenzioni sommano gli errori quadratici di tutte le categorie di una previsione con più esiti; nel caso binario, la somma vettoriale può essere il doppio della loss per evento singolo mostrata sopra. Moltiplicare tutti gli score per due non modifica la classifica all’interno dello stesso evento, ma i livelli numerici non sono confrontabili tra convenzioni se la scala non è dichiarata.

Calcola il log loss e osserva perché gli errori estremi pesano di più

Per un evento binario, il log loss è:

LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]

Se l’evento si verifica, la loss è \(-\log(p_t)\); se non si verifica, è \(-\log(1-p_t)\). Una previsione corretta al 70% riceve quindi \(-\log(0.70)\approx0.357\), mentre la stessa previsione, se sbagliata, riceve \(-\log(0.30)\approx1.204\). Il log loss medio fa la media delle penalità per caso e non ha un limite superiore fisso quando una previsione assegna probabilità quasi nulla all’evento che si verifica.

Con \(p=0\) o \(p=1\), una previsione molto sicura ma sbagliata ha log loss infinito. Se il software applica un clipping delle probabilità a un piccolo valore minimo come \(\varepsilon\) per evitare l’infinito, dichiara quel limite e applicalo in modo uniforme prima di osservare gli esiti. Il clipping cambia la regola numerica di valutazione e non deve essere nascosto come dettaglio di pulizia dei dati.

Brier score e log loss possono ordinare diversamente le stesse previsioni perché le loro curve di penalità sono diverse. Log loss applica un costo particolarmente elevato quando assegna probabilità quasi nulla a un evento verificatosi; la Brier loss binaria è limitata a uno. Decidi in anticipo quale score usare. Se le decisioni dipendono da probabilità estreme, valuta di mostrarli entrambi invece di scegliere a posteriori il risultato più favorevole.

<!-- learn:illustration -->

Gocce di vetro blu sono di fronte a pietre color ambra che rappresentano gli esiti; una previsione molto sicura è lontana dall’evento osservato
Immagine concettuale di probabilità e risultati osservati, con una penalità maggiore per un errore molto sicuro; non mostra dati di mercato, risultati di test o segnali di trading

Il proper scoring premia le probabilità sincere in aspettativa

Uno score è proprio se chi formula la previsione massimizza il reward atteso, o minimizza la loss attesa, comunicando la probabilità in cui crede davvero. È strettamente proprio se quel valore sincero è l’unico ottimo. Secondo le definizioni consuete, Brier e gli score logaritmici sono strictly proper per le previsioni probabilistiche binarie (Gneiting e Raftery, 2007). È un motivo teorico per valutare le probabilità senza convertirle prima in etichette rigide.

“Proprio” è una proprietà in aspettativa, non una promessa per ogni campione osservato. Chi comunica sinceramente una probabilità del 70% può sbagliare in un caso e ottenere uno score su un campione finito peggiore di chi ha tirato a indovinare. Servono previsioni ripetute e confrontabili per apprendere la performance media. Contano anche gli incentivi: se una persona affronta una regola di payoff separata, lo score da solo non garantisce che la probabilità comunicata rifletta la sua convinzione.

Nessuno dei due score misura soltanto la calibrazione. Un valore aggregato può combinare la vicinanza delle probabilità alle frequenze osservate e la capacità di distinguere i casi con esiti diversi. Un modello può produrre previsioni nette e rimanere sistematicamente mal calibrato; un modello che comunica sempre il tasso di base può risultare calibrato nel complesso ma fornire poche informazioni specifiche per ogni caso.

Leggi la decomposizione di Brier come reliability, resolution e uncertainty

La decomposizione di Murphy divide il Brier score medio in tre termini (Murphy, 1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)):

BS = reliability − resolution + uncertainty

Per i gruppi \(k\) di previsioni con probabilità simili, \(w_k\) è la quota campionaria di ciascun gruppo, \(\bar p_k\) la sua probabilità prevista media, \(\bar y_k\) la frequenza osservata dell’evento e \(\bar y\) la frequenza complessiva. Le componenti per bin sono:

reliability = Σₖ wₖ(̅pₖ − ̅yₖ)² resolution = Σₖ wₖ(̅yₖ − ̅y)² uncertainty = ̅y(1 − ̅y)

Un errore di reliability più basso è preferibile: le previsioni nel gruppo dovrebbero coincidere con la frequenza osservata nel gruppo. Una resolution più alta è preferibile: le frequenze degli eventi nei gruppi dovrebbero differire dal tasso di base complessivo. L’incertezza riflette quanto spesso si verifica l’evento nel campione e non è un merito del modello. La decomposizione spiega perché due modelli possano avere lo stesso Brier score e punti di forza diversi.

La decomposizione empirica è esatta quando si raggruppano i casi con la stessa identica probabilità emessa. Se le probabilità continue vengono suddivise in intervalli, la decomposizione è esatta per la previsione raggruppata, non per le differenze tra le probabilità originarie che si perdono negli intervalli. Raggruppare richiede di scegliere i confini dei bin. Un reliability diagram con dieci bin di uguale ampiezza può raccontare una storia diversa da uno con bin per quantili, soprattutto con campioni piccoli o vicino agli estremi di probabilità. Mostra il numero di casi e l’incertezza di ciascun bin e usa la decomposizione raggruppata come diagnostica, non per cancellare l’errore campionario. I grafici di calibrazione non sono una prova indipendente di affidabilità futura.

Scegli un riferimento prima di chiamare uno score “skill”

Uno score grezzo più basso di quello di un altro modello è un confronto, ma non indica ancora un miglioramento rispetto a una base utile. Il Brier skill score confronta un sistema di previsione con un forecast di riferimento dichiarato:

BSS = 1 − BS_model / BS_reference

Secondo questa definizione, zero equivale al riferimento, un valore positivo indica un miglioramento e uno negativo un risultato peggiore. Un valore pari a uno corrisponde a Brier loss del modello pari a zero quando la loss del riferimento è positiva. Scegli il riferimento in base alla decisione e all’insieme informativo. Un tasso di base storico fisso, la frequenza dell’evento nella finestra di training o una procedura di previsione già esistente possono essere sensati in compiti diversi.

Non calcolare il riferimento usando risultati futuri di valutazione se non sarebbero stati disponibili al momento della previsione. Per una serie temporale, una frequenza storica expanding o rolling può essere una baseline operativa più pulita del tasso sull’intero campione. Se lo score del riferimento è zero, il rapporto non è definito; spiega come è stato costruito il benchmark e riporta anche i raw score di modello e riferimento.

Il Brier skill score dipende dal riferimento e dalla frequenza dell’evento. Uno score rispetto a un forecast incondizionato del tasso di base risponde a una domanda diversa da uno score rispetto a un modello di produzione attuale. Non confrontare BSS tra studi senza verificare definizioni degli eventi, forecast di riferimento, periodi campionari e convenzioni binarie o multicategoria.

Confronta i modelli su esiti out-of-sample appaiati

Genera le probabilità in ordine cronologico e riserva un periodo di valutazione che non sia stato usato per ottimizzare il modello, scegliere le variabili o selezionare una soglia. Valuta tutti i modelli sugli stessi esiti risolti e sugli stessi origin. Per la loss scelta, definisci la differenza appaiata come:

dₜ = Lₐ,ₜ − Lᵦ,ₜ

Con questa convenzione di segno, una media positiva significa che il modello B ha avuto una loss media più bassa. Il framework di Diebold–Mariano può testare una differenza media di loss quando le sue ipotesi di confronto e la stima della varianza sono adatte al disegno. Se la domanda è se lo score relativo cambia con condizioni note al momento della previsione, la guida di Giacomini–White tratta il confronto condizionato. Origin ripetuti, finestre di evento sovrapposte e ricerca tra modelli possono rendere dipendenti o selezionate le differenze; un errore standard ingenuo o un singolo p-value non corretto possono sopravvalutare le evidenze.

Definisci evento, orizzonte, campione, score primario, benchmark e direzione del confronto prima di vedere i risultati. Riporta i Brier e log loss medi, le dimensioni dei campioni, le definizioni di modello e riferimento, la regola di clipping e le eventuali correzioni per dipendenza o ricerca. Un reliability plot e le differenze appaiate accanto all’aggregato aiutano a spiegare cosa è cambiato. I metodi di forecast combination possono combinare previsioni, ma la combinazione finale richiede una valutazione separata su dati non usati per selezionarla.

Gli score non condividono la stessa unità. Una differenza Brier di 0.01 non equivale direttamente a una differenza log loss di 0.01. Uno score minore non dimostra neppure che il modello probabilistico sottostante sia corretto: è evidenza sulle previsioni valutate rispetto agli esiti dichiarati.

Tieni separata la qualità delle previsioni dalla redditività del trading

Una probabilità può supportare una decisione di trading solo attraverso una regola che la trasforma in azione. La decisione dipende anche dall’entità dei payoff, dalle perdite in caso di errore, dai prezzi di esecuzione, dagli spread, dalle commissioni, dallo slippage, dal funding, dai costi di borrow, dai limiti di capitale e dal momento in cui la previsione diventa negoziabile. Un proper score valuta una previsione probabilistica; non include questi costi e non sceglie la dimensione della posizione.

Un modello può migliorare il log loss medio senza migliorare una specifica regola di trading, perché la regola potrebbe operare solo in un certo intervallo di probabilità o rispondere a un orizzonte diverso. Al contrario, un segnale utile per la decisione può concentrarsi in pochi casi e contribuire poco allo score complessivo. Dopo aver valutato la previsione, valuta separatamente la regola decisionale prespecificata su date che non siano state usate per selezionarla, con net return realistici e stime di incertezza.

Un report adeguato permette a un altro ricercatore di riprodurre evento, probabilità, esito, formula e convenzione dello score, riferimento, campione e momento della valutazione. Deve specificare se le probabilità sono out-of-sample, se gli esiti si sovrappongono, come sono stati trattati i casi mancanti e quanti modelli o score alternativi sono stati provati. Questa disciplina rende informativo lo score senza trasformarlo in un’affermazione sui profitti futuri.

Domande frequenti

Q1Un Brier score più basso è sempre migliore?

È migliore se definizione dell’evento, campione, convenzione di scoring e codifica dell’esito sono uguali. Score di eventi o convenzioni multicategoria differenti potrebbero non essere confrontabili direttamente.

Q2Un buon Brier score dimostra che le probabilità sono calibrate?

No. Il Brier score aggregato combina reliability, resolution e incertezza dell’evento. Controlla anche le diagnostiche di calibrazione e l’incertezza campionaria.

Q3Dovrei usare Brier score o log loss?

Scegli prima di valutare i risultati. Brier loss è limitata e usa l’errore di probabilità al quadrato; log loss penalizza più severamente le probabilità errate espresse con sicurezza. La scelta dipende dalle conseguenze del compito e dalla sensibilità desiderata.

Q4Uno score probabilistico migliore significa che la strategia di trading è redditizia?

No. Lo score valuta le previsioni, non le decisioni dopo aver considerato payoff, costi di esecuzione, finanziamento, dimensione della posizione e selezione del modello. Ricerca primaria - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)

Fonti e approfondimenti

Segnala un problema

Prepareremo un’e-mail con il link a questo articolo. Mark riceverà la segnalazione solo dopo l’invio

Controllo rapido

Hai finito la guida? Verifica ciò che hai capito con 3 domande

Domanda 1 / 3

Domanda 01

Si verifica un evento binario dopo una previsione del 70%. Qual è il Brier loss con la convenzione per evento singolo?

Scegli una risposta per vedere la spiegazione

Glossario delle opzioni