Brier score versus log loss voor kansvoorspellingen
Vergelijk de Brier score en log loss voor binaire kansvoorspellingen, leer beide berekenen en begrijp proper scoring, kalibratie en voorspellingsvaardigheid
In deze gidsEen hit rate laat de voorspelde kans buiten beschouwing
Korte samenvatting
Een kansvoorspelling geeft aan hoe waarschijnlijk een gebeurtenis is, niet alleen welke uitkomst het waarschijnlijkst is. De Brier score en log loss vergelijken die kansen met uitkomsten die inmiddels bekend zijn. Beide zijn proper scoring rules, maar ze bestraffen fouten op verschillende manieren. Een lagere score is daarom pas betekenisvol als de gebeurtenis, steekproef, scoreconventie en referentie vastliggen.
Een hit rate laat de voorspelde kans buiten beschouwing
Stel dat u bijhoudt of een model correct “omhoog” of “omlaag” voorspelde. Een hit rate behandelt een juiste voorspelling van 51% hetzelfde als een juiste voorspelling van 99%. Een verkeerde voorspelling van 49% wordt ook gelijkgesteld aan een verkeerde voorspelling van 1%. Zo gaat de uitgesproken mate van zekerheid verloren, terwijl die ertoe kan doen wanneer beslissingen verschillende opbrengsten of risico’s hebben.
Een binaire kansvoorspelling kent een waarde \(p_t\) tussen nul en één toe aan een duidelijk omschreven gebeurtenis op het voorspellingstijdstip \(t\). Gebeurt de gebeurtenis later, dan wordt \(y_t=1\) geregistreerd; anders \(y_t=0\). Een scoring rule beoordeelt de voorspelling samen met de uitkomst. De Brier score gebruikt het kwadraat van de kansfout; log loss gebruikt de negatieve logaritme van de kans die is toegekend aan wat daadwerkelijk gebeurde.
Deze scores zijn bruikbaar om kansvoorspellingen te vergelijken, waaronder gebeurteniskansen uit een tradingmodel. Op zichzelf tonen ze niet aan dat een voorspelling gekalibreerd is, een zinvolle referentie verslaat of winst oplevert wanneer u erop handelt. De uitleg van Mincer–Zarnowitz behandelt een andere lineaire kalibratieregressie voor numerieke puntvoorspellingen.
Definieer één gebeurtenis en koppel elke voorspelling aan de uitkomst
Leg vóór het berekenen van scores de gebeurtenis zo vast dat de uitkomst op een consistente manier kan worden bepaald. “Stijgt het activum?” is onvolledig zolang het activum, de prijsbron, begin- en eindtijd, valuta, rendementsconventie en behandeling van ontbrekende of gecorrigeerde registraties niet zijn vastgelegd. Noteer bij een economische gebeurtenis de publicatie en de gegevensvintage die voor de uitkomst zijn gebruikt. Vergelijk geen voorspellingen die op verschillende definities of datumverzamelingen zijn beoordeeld.
Bewaar iedere voorspelling zoals die op het oorspronkelijke tijdstip beschikbaar was. Een op tijdstip \(t\) afgegeven kans mag alleen informatie gebruiken die tot de afgesproken cutoff beschikbaar was en moet worden gekoppeld aan de uitkomst voor dezelfde horizon. Een herziene gegevensreeks, een latere slotkoers of een classificatieregel die pas na het zien van de uitkomst is gekozen, kan het target ongemerkt veranderen of informatie uit de toekomst introduceren.
Bewaar bij rolling forecasts de modelversie, gegevensvintage, timestamp, kans en beslisregel. Gebruik dezelfde forecast origins bij modelvergelijkingen. Ontbreekt een kans, documenteer dan de uitsluiting en pas op elke kandidaat dezelfde steekproefregel toe. Met deze gegevens is een score reproduceerbaar en niet slechts een momentopname van een veranderend spreadsheet.
Bereken de Brier score met gekwadrateerde kansfouten
Voor één binaire gebeurtenis is de Brier loss voor geval \(t\):
BSₜ = (pₜ − yₜ)²
De gemiddelde Brier score voor \(n\) voorspellingen is:
BS = (1/n) Σₜ (pₜ − yₜ)²
Lager is beter, nul is perfect en deze conventie voor één gebeurtenis loopt van nul tot één. Als de voorspelling bijvoorbeeld \(p=0.70\) is en de gebeurtenis optreedt, is de loss \((0.70-1)^2=0.09\). Als de gebeurtenis na dezelfde voorspelling uitblijft, is de loss \((0.70-0)^2=0.49\). Een fout met veel vertrouwen kost meer dan een gematigde fout, maar de straf blijft begrensd.
Controleer de formule wanneer u gepubliceerde cijfers vergelijkt. Sommige conventies tellen de gekwadrateerde fouten van alle categorieën in een voorspelling met meerdere uitkomsten op; bij twee categorieën kan die vectorsom tweemaal zo groot zijn als de loss voor één gebeurtenis hierboven. Alle scores binnen dezelfde gebeurtenis met twee vermenigvuldigen verandert de rangorde niet, maar zonder vermelding van de schaal zijn de numerieke waarden tussen conventies niet vergelijkbaar.
Bereken log loss en zie waarom extreme fouten zwaarder wegen
Voor een binaire gebeurtenis is log loss:
LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]
Als de gebeurtenis optreedt, is de loss \(-\log(p_t)\); zo niet, dan is die \(-\log(1-p_t)\). Een juiste voorspelling van 70% krijgt dus \(-\log(0.70)\approx0.357\), terwijl dezelfde voorspelling bij een verkeerde uitkomst \(-\log(0.30)\approx1.204\) oplevert. De gemiddelde log loss neemt het gemiddelde van deze straffen per geval en heeft geen vaste bovengrens wanneer een voorspelling een vrijwel nul kans toekent aan de gebeurtenis die optreedt.
Bij \(p=0\) of \(p=1\) is log loss oneindig voor een voorspelling die met grote zekerheid fout is. Als software kansen afkapt op een kleine ondergrens zoals \(\varepsilon\) om oneindigheid te vermijden, vermeld die grens dan en pas haar consequent toe voordat u de uitkomsten bekijkt. Clipping verandert de numerieke evaluatieregel en mag niet als een detail van gegevensopschoning worden verborgen.
De Brier score en log loss kunnen dezelfde voorspellingen anders rangschikken doordat hun strafcurves verschillen. Log loss rekent een vrijwel nul kans voor een opgetreden gebeurtenis bijzonder zwaar aan; de binaire Brier loss is begrensd op één. Kies vooraf welke score u gebruikt. Als beslissingen van extreme kansen afhangen, kunt u beide tonen in plaats van achteraf de gunstigste uitkomst te kiezen.
<!-- learn:illustration -->

Proper scoring beloont eerlijke kansen in verwachting
Een score is proper als de voorspeller de verwachte beloning maximaliseert of het verwachte verlies minimaliseert door de kans te rapporteren waarin die werkelijk gelooft. Is die eerlijke kans de enige optimale waarde, dan is de score strictly proper. Volgens de gebruikelijke definities zijn de Brier score en de logaritmische score strictly proper voor binaire kansvoorspellingen (Gneiting en Raftery, 2007). Dat is een principiële reden om kansen te beoordelen in plaats van ze eerst om te zetten in harde labels.
“Proper” is een uitspraak over de verwachting, geen belofte voor iedere waargenomen steekproef. Een voorspeller die eerlijk 70% rapporteert, kan in één geval ongelijk hebben en op een eindige steekproef slechter scoren dan iemand die gokt. Om iets over gemiddelde prestaties te leren, zijn herhaalde, vergelijkbare voorspellingen nodig. Ook prikkels spelen mee: als iemand met een aparte payoffregel te maken heeft, garandeert een score op zichzelf niet dat de gerapporteerde kans de eigen overtuiging weergeeft.
Geen van beide scores meet alleen kalibratie. Een geaggregeerde score kan zowel de overeenkomst tussen kansen en waargenomen frequenties als het vermogen om gevallen met verschillende uitkomsten te scheiden bevatten. Een model kan scherpe voorspellingen doen en toch systematisch verkeerd gekalibreerd zijn. Een model dat altijd het basispercentage voorspelt, kan geaggregeerd gekalibreerd zijn maar weinig informatie per geval geven.
Lees de Brier-decompositie als reliability, resolution en uncertainty
De decompositie van Murphy splitst de gemiddelde Brier score in drie termen (Murphy, 1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)):
BS = reliability − resolution + uncertainty
Neem voor groepen \(k\) met vergelijkbare voorspelde kansen aan dat \(w_k\) het steekproefaandeel van elke groep is, \(\bar p_k\) de gemiddelde voorspelde kans, \(\bar y_k\) de waargenomen gebeurtenisfrequentie en \(\bar y\) de totale gebeurtenisfrequentie. De componenten op basis van bins zijn:
reliability = Σₖ wₖ(̅pₖ − ̅yₖ)² resolution = Σₖ wₖ(̅yₖ − ̅y)² uncertainty = ̅y(1 − ̅y)
Een lagere reliability-fout is beter: voorspellingen binnen een groep horen overeen te komen met de waargenomen frequentie in die groep. Een hogere resolution is beter: gebeurtenisfrequenties van groepen horen af te wijken van het algemene basispercentage. Uncertainty geeft aan hoe vaak de gebeurtenis in de steekproef voorkomt en is geen verdienste van het voorspellingsmodel. De decompositie verklaart waarom twee modellen dezelfde Brier score kunnen hebben en toch verschillende sterke punten.
De empirische decompositie is exact wanneer gevallen met exact dezelfde afgegeven kans bij elkaar worden gegroepeerd. Als continue kansen in bins worden ingedeeld, is de decompositie exact voor de geaggregeerde voorspelling, niet voor de verschillen tussen de oorspronkelijke kansen die binnen de bins verloren gaan. Groeperen vereist een keuze voor bin-grenzen. Een reliability diagram met tien bins van gelijke breedte kan een ander beeld geven dan een diagram met quantielbins, vooral bij kleine steekproeven of aan de uiteinden van het kansbereik. Toon per bin het aantal gevallen en de uncertainty. Gebruik de gegroepeerde decompositie als diagnostiek, niet om steekproeffout weg te poetsen. Kalibratieplots zijn geen onafhankelijk bewijs voor toekomstige betrouwbaarheid.
Kies een referentie voordat u een score skill noemt
Een lagere ruwe score dan die van een ander model is een vergelijking, maar zegt nog niet dat er verbetering is ten opzichte van een bruikbare baseline. De Brier skill score vergelijkt een voorspellingssysteem met een benoemde referentievoorspelling:
BSS = 1 − BS_model / BS_reference
Volgens deze definitie is nul gelijk aan de referentie, wijst een positieve waarde op verbetering en een negatieve waarde op een slechter resultaat. Een waarde van één betekent dat de Brier loss van het model nul is wanneer de loss van de referentie positief is. Kies een referentie die past bij de beslissing en de beschikbare informatie. Een vast historisch basispercentage, de gebeurtenisfrequentie in een trainingsvenster of een bestaande voorspellingsprocedure kan afhankelijk van de taak passend zijn.
Bereken de referentie niet met toekomstige evaluatie-uitkomsten als die bij het maken van de voorspelling niet beschikbaar zouden zijn geweest. Voor een tijdreeks kan een groeiende of rolling historische frequentie een zuiverdere operationele baseline zijn dan de gebeurtenisfrequentie over de volledige steekproef. Als de referentiescore nul is, is de verhouding niet gedefinieerd. Beschrijf hoe de benchmark is gevormd en rapporteer ook de ruwe scores van model en referentie.
Brier skill scores hangen af van de referentie en de gebeurtenisfrequentie. Een score ten opzichte van een onvoorwaardelijke basispercentagevoorspelling beantwoordt een andere vraag dan een score ten opzichte van een huidig productiemodel. Vergelijk BSS-waarden tussen studies niet zonder de gebeurtenisdefinities, referentievoorspellingen, steekproefperioden en binaire of multicategorieconventies te controleren.
Vergelijk modellen op gepaarde out-of-sample-uitkomsten
Genereer kansen chronologisch en reserveer een evaluatieperiode die niet is gebruikt om het model af te stemmen, kenmerken te kiezen of een threshold te selecteren. Beoordeel alle modellen op dezelfde vastgestelde uitkomsten en origins. Definieer voor een gekozen loss het gepaarde verschil als:
dₜ = Lₐ,ₜ − Lᵦ,ₜ
Volgens deze tekenconventie betekent een positief gemiddelde dat model B een lagere gemiddelde loss had. Het Diebold–Mariano-raamwerk kan een gemiddeld lossverschil toetsen wanneer de aannames voor forecastvergelijking en de variantieschatting bij het ontwerp passen. Als de vraag is of de relatieve score verandert met omstandigheden die bij de voorspelling bekend waren, behandelt de Giacomini–White-gids die conditionele vergelijking. Herhaalde origins, overlappende gebeurtenisvensters en modelzoekwerk kunnen verschillen afhankelijk of geselecteerd maken. Een naïeve standaardfout of één ongecorrigeerde p-waarde kan het bewijs dan overdrijven.
Leg gebeurtenis, horizon, steekproef, primaire score, benchmark en vergelijkingsrichting vast voordat u de resultaten bekijkt. Rapporteer de gemiddelde Brier- en log-losswaarden, steekproefgroottes, model- en referentiedefinities, de clippingregel voor kansen en eventuele correcties voor afhankelijkheid of modelzoekwerk. Een reliability plot en gepaarde scoreverschillen naast het aggregaat helpen verklaren wat veranderde. Methoden voor forecast combination kunnen voorspellingen combineren, maar ook de uiteindelijke combinatie moet worden geëvalueerd op een periode die niet voor de selectie is gebruikt.
De scores hebben geen gemeenschappelijke eenheid. Een Brier-verschil van 0.01 is niet rechtstreeks gelijk aan een log-lossverschil van 0.01. Een lagere score bewijst evenmin dat het onderliggende kansmodel juist is; het is bewijs over de geëvalueerde voorspellingen voor de omschreven uitkomsten.
Houd voorspellingskwaliteit gescheiden van tradingwinstgevendheid
Een kans kan een tradingbeslissing alleen ondersteunen via een regel die haar omzet in een actie. De beslissing hangt ook af van de omvang van de opbrengst, het verlies bij een fout, uitvoeringsprijzen, spreads, commissies, slippage, funding, leenlasten, kapitaallimieten en het tijdstip waarop de voorspelling verhandelbaar wordt. Een proper score beoordeelt een kansvoorspelling; de score neemt deze kosten niet mee en bepaalt geen positiegrootte.
Een model kan de gemiddelde log loss verbeteren zonder een specifieke tradingregel te verbeteren, bijvoorbeeld omdat die regel alleen binnen een bepaald kansbereik handelt of op een andere horizon reageert. Omgekeerd kan een nuttig beslissignaal geconcentreerd zijn in een kleine groep gevallen en daardoor weinig bijdragen aan de totaalscore. Evalueer na de voorspelling ook de vooraf vastgelegde beslisregel afzonderlijk, op datums die niet zijn gebruikt om die regel te selecteren, met realistische nettorendementen en onzekerheidsschattingen.
Een degelijk rapport stelt een andere onderzoeker in staat de gebeurtenis, kans, uitkomst, scoreformule en -conventie, referentie, steekproef en evaluatietiming te reproduceren. Vermeld of kansen out-of-sample zijn, of uitkomsten overlappen, hoe ontbrekende gevallen zijn afgehandeld en hoeveel alternatieve modellen of scorekeuzes zijn geprobeerd. Zo blijft de score informatief zonder er een claim over toekomstige winst van te maken.
Veelgestelde vragen
Q1Is een lagere Brier score altijd beter?
Lager is beter als de gebeurtenisdefinitie, steekproef, scoreconventie en codering van de uitkomst gelijk zijn. Scores van andere gebeurtenissen of multicategorieconventies zijn mogelijk niet rechtstreeks vergelijkbaar.
Q2Bewijst een goede Brier score dat de kansen gekalibreerd zijn?
Nee. De geaggregeerde Brier score combineert reliability, resolution en gebeurtenisonzekerheid. Bekijk ook kalibratiediagnostiek en steekproefonzekerheid.
Q3Kan ik beter de Brier score of log loss gebruiken?
Kies dit voordat u de resultaten evalueert. Brier loss is begrensd en gebruikt gekwadrateerde kansfouten; log loss bestraft onjuiste kansen die met veel zekerheid zijn uitgesproken zwaarder. De keuze hangt af van de gevolgen van de taak en de gewenste gevoeligheid.
Q4Betekent een betere kansscore dat een tradingstrategie winstgevend is?
Nee. De score beoordeelt voorspellingen, niet beslissingen na verwerking van opbrengsten, uitvoeringskosten, financiering, positiegrootte en modelselectie. Primair onderzoek - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)
Bronnen en verder lezen
Probleem melden
We bereiden een e-mail met de link naar dit artikel voor. Mark ontvangt je melding pas nadat je die verstuurt
Snelle check
De gids gelezen? Test jezelf met 3 vragen
Vraag 01
Een binaire gebeurtenis treedt op na een voorspelling van 70%. Wat is de Brier loss volgens de conventie voor één gebeurtenis?
Kies een antwoord om de uitleg te zien
Optiewoordenlijst
Heldere definities van belangrijke optiebegrippen, van calls, puts en optieketens tot IV, Greeks, open interest en max pain
Bekijk de optiewoordenlijst