Brier-Score vs. Log Loss für Wahrscheinlichkeitsprognosen
Brier-Score und Log Loss für binäre Wahrscheinlichkeitsprognosen vergleichen, von Hand berechnen und Proper Scoring, Kalibrierung und Prognosegüte einordnen
In diesem LeitfadenEine Trefferquote verwirft die prognostizierte Wahrscheinlichkeit
Kurze Zusammenfassung
Eine Wahrscheinlichkeitsprognose gibt an, wie wahrscheinlich ein Ereignis ist, und nicht nur, welches Ergebnis am wahrscheinlichsten ist. Brier-Score und Log Loss vergleichen diese Wahrscheinlichkeiten mit den später festgestellten Ergebnissen. Beide sind proper scoring rules, bestrafen Fehler aber unterschiedlich. Ein niedrigerer Score ist daher nur aussagekräftig, wenn Ereignis, Stichprobe, Score-Konvention und Referenz feststehen.
Eine Trefferquote verwirft die prognostizierte Wahrscheinlichkeit
Stellen Sie sich vor, Sie erfassen, ob ein Modell „steigt“ oder „fällt“ richtig vorhergesagt hat. Eine Trefferquote behandelt eine richtige Prognose mit 51 % genauso wie eine richtige Prognose mit 99 %. Ebenso behandelt sie eine falsche Prognose mit 49 % genauso wie eine mit 1 %. Damit geht die Zuversicht verloren, obwohl sie bei unterschiedlichen Auszahlungen oder Risiken für Entscheidungen wichtig sein kann.
Eine binäre Wahrscheinlichkeitsprognose weist einem klar definierten Ereignis zum Prognosezeitpunkt \(t\) einen Wert \(p_t\) zwischen null und eins zu. Später wird das Ereignis als \(y_t=1\) erfasst, wenn es eintritt, und als \(y_t=0\), wenn es ausbleibt. Eine scoring rule bewertet Prognose und Ergebnis gemeinsam. Der Brier-Score verwendet den quadrierten Wahrscheinlichkeitsfehler; der Log Loss den negativen Logarithmus der Wahrscheinlichkeit des tatsächlich eingetretenen Ergebnisses.
Diese Scores eignen sich zum Vergleich von Wahrscheinlichkeitsprognosen, auch von Ereigniswahrscheinlichkeiten eines Tradingmodells. Sie zeigen für sich genommen jedoch weder, dass eine Prognose kalibriert ist, noch dass sie eine sinnvolle Referenz übertrifft oder dass der Handel danach profitabel wäre. Der Mincer–Zarnowitz-Leitfaden behandelt eine andere lineare Kalibrierungsregression für numerische Punktprognosen.
Definieren Sie ein Ereignis und ordnen Sie jede Prognose ihrem Ergebnis zu
Legen Sie vor der Bewertung fest, wie das Ereignis eindeutig festgestellt wird. Die Frage „Wird der Vermögenswert steigen?“ ist unvollständig, solange Vermögenswert, Preisquelle, Anfangs- und Endzeit, Währung, Renditekonvention und Behandlung fehlender oder korrigierter Datensätze nicht feststehen. Bei einem wirtschaftlichen Ereignis sollten Sie Veröffentlichung und Datenstand dokumentieren, anhand derer das Ergebnis bestimmt wird. Vergleichen Sie keine Prognosen, die für unterschiedliche Definitionen oder Datumsbereiche bewertet wurden.
Speichern Sie jede Prognose so, wie sie zum damaligen Zeitpunkt verfügbar war. Eine zum Zeitpunkt \(t\) abgegebene Wahrscheinlichkeit darf nur Informationen bis zum festgelegten Stichtag verwenden und muss dem Ergebnis desselben Prognosehorizonts zugeordnet werden. Eine revidierte Datenreihe, ein späterer Börsenschluss oder eine erst nach Kenntnis des Ergebnisses gewählte Klassifikationsregel kann das Ziel unbemerkt ändern oder Look-ahead-Informationen einführen.
Halten Sie bei rollierenden Prognosen Modellversion, Eingabedatenstand, Zeitstempel, Wahrscheinlichkeit und Regel zur Ergebnisfeststellung fest. Verwenden Sie für Modellvergleiche dieselben Prognosezeitpunkte. Fehlt eine Wahrscheinlichkeit, dokumentieren Sie den Ausschluss und wenden Sie dieselbe Stichprobenregel auf alle Kandidaten an. So lässt sich der Score reproduzieren, statt nur eine veränderliche Tabelle zusammenzufassen.
Berechnen Sie den Brier-Score aus quadrierten Wahrscheinlichkeitsfehlern
Für ein binäres Ereignis lautet der Brier-Verlust im Fall \(t\):
BSₜ = (pₜ − yₜ)²
Der mittlere Brier-Score über \(n\) Prognosen ist:
BS = (1/n) Σₜ (pₜ − yₜ)²
Niedriger ist besser, null ist perfekt, und diese Einzelereignis-Konvention reicht von null bis eins. Beträgt die Prognose beispielsweise \(p=0.70\) und das Ereignis tritt ein, ist der Verlust \((0.70-1)^2=0.09\). Bleibt das Ereignis bei derselben Prognose aus, beträgt er \((0.70-0)^2=0.49\). Ein selbstsicherer Fehler kostet mehr als ein moderater Fehler, die Strafe bleibt jedoch begrenzt.
Prüfen Sie die Formel, wenn Sie veröffentlichte Werte vergleichen. Manche Konventionen summieren quadrierte Fehler über alle Kategorien einer Prognose mit mehreren möglichen Ergebnissen. Bei zwei Kategorien kann diese Vektorsumme doppelt so hoch sein wie der oben definierte Einzelereignis-Verlust. Innerhalb desselben Ereignisses ändert eine Multiplikation aller Scores mit zwei die Rangfolge nicht; der Zahlenwert ist ohne Angabe der Skalierung aber nicht mit anderen Konventionen vergleichbar.
Berechnen Sie den Log Loss und erkennen Sie die Wirkung extremer Fehler
Für ein binäres Ereignis lautet der Log Loss:
LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]
Tritt das Ereignis ein, beträgt der Verlust \(-\log(p_t)\); bleibt es aus, beträgt er \(-\log(1-p_t)\). Eine richtige Prognose mit 70 % erhält daher \(-\log(0.70)\approx0.357\), eine falsche Prognose mit 70 % dagegen \(-\log(0.30)\approx1.204\). Der mittlere Log Loss mittelt diese fallweisen Strafen und hat keine feste Obergrenze, wenn eine Prognose dem tatsächlich eingetretenen Ereignis eine verschwindend kleine Wahrscheinlichkeit zuweist.
Bei \(p=0\) oder \(p=1\) ist der Log Loss einer selbstsicheren falschen Prognose unendlich. Begrenzt Software Wahrscheinlichkeiten zur Vermeidung der Unendlichkeit auf einen kleinen Mindestwert wie \(\varepsilon\), müssen Sie diesen Wert offenlegen und einheitlich anwenden, bevor Sie die Ergebnisse sehen. Clipping ändert die numerische Bewertungsregel und darf nicht als nebensächlicher Schritt der Datenbereinigung verborgen werden.
Brier-Score und Log Loss können dieselben Prognosen unterschiedlich ordnen, weil sie Fehler verschieden bestrafen. Der Log Loss reagiert besonders stark, wenn einem eingetretenen Ereignis fast keine Wahrscheinlichkeit zugewiesen wurde; der binäre Brier-Verlust ist auf eins begrenzt. Legen Sie vorab fest, welchen Score Sie verwenden. Hängen Entscheidungen von extremen Wahrscheinlichkeiten ab, zeigen Sie nach Möglichkeit beide, statt nachträglich das günstigere Ergebnis auszuwählen.
<!-- learn:illustration -->

Proper Scoring belohnt ehrliche Wahrscheinlichkeiten im Erwartungswert
Ein Score ist proper, wenn die prognostizierende Person ihre erwartete Belohnung maximiert oder ihren erwarteten Verlust minimiert, indem sie die Wahrscheinlichkeit angibt, die sie tatsächlich für richtig hält. Streng proper ist der Score, wenn genau dieser ehrliche Wert das eindeutige Optimum ist. Brier- und logarithmischer Score sind nach den üblichen Definitionen für binäre Wahrscheinlichkeitsprognosen streng proper (Gneiting und Raftery, 2007). Das ist ein guter Grund, Wahrscheinlichkeiten direkt zu bewerten, statt sie vorher in harte Klassen umzuwandeln.
„Proper“ beschreibt eine Eigenschaft im Erwartungswert und garantiert kein Ergebnis für jede realisierte Stichprobe. Eine Person kann ehrlich 70 % melden und bei einem einzelnen Fall trotzdem falsch liegen; in einer kleinen Stichprobe kann ihr Score schlechter sein als der eines Zufallsratschlags. Für Aussagen zur durchschnittlichen Leistung braucht man wiederholte, vergleichbare Prognosen. Auch Anreize spielen eine Rolle: Bei einer zusätzlichen Auszahlungsregel garantiert der Score allein nicht, dass die angegebene Wahrscheinlichkeit den eigenen Glauben widerspiegelt.
Keiner der beiden Scores misst allein die Kalibrierung. Ein aggregierter Wert kann sowohl abbilden, wie nahe Wahrscheinlichkeiten an beobachteten Häufigkeiten liegen, als auch, wie gut sie Fälle mit unterschiedlichen Ergebnissen trennen. Ein Modell kann sehr unterschiedliche Prognosen abgeben und trotzdem systematisch fehlkalibriert sein. Ein Modell, das immer die Basisrate meldet, kann insgesamt kalibriert sein, liefert aber kaum fallbezogene Information.
Lesen Sie die Brier-Zerlegung als Zuverlässigkeit, Auflösung und Unsicherheit
Murphys Zerlegung teilt den mittleren Brier-Score in drei Terme auf (Murphy, 1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)):
BS = Zuverlässigkeit − Auflösung + Unsicherheit
Für Gruppen \(k\) mit ähnlichen Prognosewahrscheinlichkeiten sei \(w_k\) der Stichprobenanteil jeder Gruppe, ̅pₖ ihre mittlere Prognosewahrscheinlichkeit, ̅yₖ ihre beobachtete Ereignishäufigkeit und ̅y die Gesamthäufigkeit. Die gruppierten Komponenten lauten:
Zuverlässigkeit = Σₖ wₖ(̅pₖ − ̅yₖ)² Auflösung = Σₖ wₖ(̅yₖ − ̅y)² Unsicherheit = ̅y(1 − ̅y)
Ein kleinerer Zuverlässigkeitsfehler ist besser: Die beobachtete Häufigkeit innerhalb einer Gruppe sollte ihrer Prognosewahrscheinlichkeit entsprechen. Eine höhere Auflösung ist besser: Die Ereignishäufigkeiten der Gruppen sollten sich von der Gesamtbasisrate unterscheiden. Unsicherheit spiegelt wider, wie oft das Ereignis in der Stichprobe auftritt, und ist kein Verdienst des Prognosemodells. Die Zerlegung erklärt, warum zwei Modelle denselben Brier-Score haben, aber unterschiedliche Stärken aufweisen können.
Die empirische Zerlegung ist exakt, wenn Fälle mit derselben ausgegebenen Wahrscheinlichkeit gruppiert werden. Werden kontinuierliche Prognosen in Bins eingeteilt, ist die Zerlegung für die gruppierte Prognose exakt, nicht jedoch für die Unterschiede zwischen den ursprünglichen Wahrscheinlichkeiten, die in den Bins verloren gehen. Die Gruppierung erfordert eine Wahl der Bin-Grenzen. Ein Zuverlässigkeitsdiagramm mit zehn gleich breiten Bins kann anders aussehen als eines mit Quantil-Bins, besonders bei kleinen Stichproben oder extremen Wahrscheinlichkeiten. Zeigen Sie die Fallzahlen und Unsicherheit je Bin und nutzen Sie die gruppierte Zerlegung als Diagnose, nicht als Methode, Stichprobenfehler zu beseitigen. Kalibrierungsdiagramme sind kein unabhängiger Beweis für künftige Zuverlässigkeit.
Wählen Sie eine Referenz, bevor Sie einen Score als Skill bezeichnen
Ein niedrigerer Rohscore als der eines anderen Modells ist ein Vergleich, aber noch keine Aussage über eine Verbesserung gegenüber einer sinnvollen Basislinie. Der Brier-Skill-Score vergleicht ein Prognosesystem mit einer ausdrücklich benannten Referenzprognose:
BSS = 1 − BS_model / BS_reference
Ein Wert von null entspricht der Referenz, ein positiver Wert bedeutet eine Verbesserung und ein negativer Wert ein schlechteres Ergebnis nach dieser Definition. Ein Wert von eins bedeutet, dass der Modell-Brier-Verlust null ist, sofern der Referenzverlust positiv ist. Wählen Sie eine Referenz, die zur Entscheidung und zum verfügbaren Informationsstand passt. Je nach Aufgabe können eine feste historische Basisrate, die Ereignishäufigkeit im Trainingsfenster oder ein bestehendes Prognoseverfahren sinnvoll sein.
Berechnen Sie die Referenz nicht aus künftigen Evaluierungsergebnissen, wenn diese bei der Prognose nicht verfügbar gewesen wären. Bei Zeitreihen kann eine wachsende oder rollierende historische Häufigkeit eine bessere operative Basislinie sein als die Ereignisrate der Gesamtstichprobe. Ist der Referenzscore null, ist das Verhältnis nicht definiert. Legen Sie offen, wie die Basislinie gebildet wurde, und berichten Sie neben dem BSS auch die Rohscores von Modell und Referenz.
Brier-Skill-Scores hängen von der Referenz und der Ereignishäufigkeit ab. Ein Score gegenüber einer unbedingten Basisratenprognose beantwortet eine andere Frage als ein Vergleich mit einem aktuellen Produktionsmodell. Vergleichen Sie BSS-Werte verschiedener Studien erst, nachdem Ereignisdefinition, Referenzprognose, Stichprobenzeitraum und binäre oder mehrkategoriale Konvention abgeglichen wurden.
Vergleichen Sie Modelle anhand gepaarter Ergebnisse außerhalb der Stichprobe
Erzeugen Sie Prognosen chronologisch und reservieren Sie einen Evaluierungszeitraum, der weder zum Abstimmen des Modells noch zur Auswahl von Merkmalen oder eines Schwellenwerts verwendet wurde. Bewerten Sie jedes Modell anhand derselben festgestellten Ergebnisse und Prognosezeitpunkte. Für einen gewählten Verlust definieren Sie die gepaarte Differenz als:
dₜ = Lₐ,ₜ − Lᵦ,ₜ
Bei dieser Vorzeichenkonvention bedeutet ein positiver Mittelwert, dass Modell B einen niedrigeren durchschnittlichen Verlust hatte. Das Diebold–Mariano-Verfahren kann eine durchschnittliche Verlustdifferenz testen, wenn seine Vergleichsannahmen und Varianzschätzung zum Design passen. Wenn die Frage lautet, ob sich die relative Score-Qualität mit zum Prognosezeitpunkt bekannten Bedingungen verändert, behandelt der Giacomini–White-Leitfaden diesen bedingten Vergleich. Wiederholte Prognosezeitpunkte, überlappende Ereignisfenster und Modellsuche können die Differenzen abhängig oder selektiert machen; ein naiver Standardfehler oder ein einzelner unkorrigierter p-Wert kann die Evidenz überzeichnen.
Legen Sie Ereignis, Horizont, Stichprobe, primären Score, Referenz und Vergleichsrichtung fest, bevor Sie Ergebnisse ansehen. Berichten Sie mittleren Brier-Score und mittleren Log Loss, jeweilige Fallzahlen, Modell- und Referenzdefinition, Clipping-Regel sowie jede Korrektur für Abhängigkeit oder Suche. Ein Zuverlässigkeitsdiagramm und gepaarte Score-Differenzen neben dem Aggregat helfen zu erklären, was sich geändert hat. Prognosekombinationsverfahren können Prognosen zusammenführen; auch die endgültige Kombination muss aber in einem unberührten Zeitraum bewertet werden.
Die Scores haben keine gemeinsamen Einheiten. Eine Brier-Differenz von 0,01 ist nicht direkt gleichbedeutend mit einer Log-Loss-Differenz von 0,01. Ein niedrigerer Score beweist auch nicht, dass das zugrunde liegende Wahrscheinlichkeitsmodell korrekt ist; er liefert Evidenz zur Leistung der bewerteten Prognosen für die festgelegten Ergebnisse.
Trennen Sie Prognosequalität von Trading-Profitabilität
Eine Wahrscheinlichkeit kann eine Tradingentscheidung nur über eine Regel unterstützen, die sie in eine Handlung übersetzt. Die Entscheidung hängt außerdem von Auszahlungshöhe, Verlusten bei Fehlern, Ausführungspreisen, Spreads, Gebühren, Slippage, Finanzierung, Leihkosten, Kapitalgrenzen und dem Zeitpunkt ab, ab dem die Prognose handelbar ist. Ein proper score bewertet eine Wahrscheinlichkeitsprognose; er enthält diese Kosten nicht und bestimmt keine Positionsgröße.
Ein Modell kann den durchschnittlichen Log Loss verbessern, ohne eine bestimmte Tradingregel zu verbessern, etwa weil die Regel nur in einem Wahrscheinlichkeitsbereich handelt oder auf einen anderen Horizont reagiert. Umgekehrt kann ein nützliches Entscheidungssignal in wenigen Fällen liegen und wenig zum Gesamtscore beitragen. Bewerten Sie nach der Prognose die vorab festgelegte Entscheidungsregel getrennt an Daten, die nicht zu ihrer Auswahl dienten, und verwenden Sie realistische Nettorenditen und Unsicherheitsschätzungen.
Ein ausreichender Bericht ermöglicht anderen Forschenden, Ereignis, Wahrscheinlichkeit, Ergebnis, Score-Formel und Konvention, Referenz, Stichprobe und Evaluierungszeitpunkt nachzuvollziehen. Er sollte angeben, ob Prognosen außerhalb der Stichprobe erzeugt wurden, ob Ergebnisse überlappen, wie fehlende Fälle behandelt wurden und wie viele alternative Modelle oder Score-Varianten ausprobiert wurden. So bleibt ein Prognosescore informativ, ohne zu einer Behauptung über künftige Gewinne zu werden.
Häufige Fragen
Q1Ist ein niedrigerer Brier-Score immer besser?
Niedriger ist besser, wenn Ereignisdefinition, Stichprobe, Score-Konvention und Ergebniscodierung übereinstimmen. Scores verschiedener Ereignisse oder Mehrkategorien-Konventionen sind womöglich nicht direkt vergleichbar.
Q2Beweist ein guter Brier-Score, dass Wahrscheinlichkeiten kalibriert sind?
Nein. Der aggregierte Brier-Score verbindet Zuverlässigkeit, Auflösung und Ereignisunsicherheit. Prüfen Sie auch Kalibrierungsdiagnosen und Stichprobenunsicherheit.
Q3Sollte ich Brier-Score oder Log Loss verwenden?
Legen Sie das vor der Auswertung fest. Der Brier-Verlust ist begrenzt und basiert auf quadriertem Wahrscheinlichkeitsfehler; Log Loss bestraft selbstsichere falsche Wahrscheinlichkeiten stärker. Entscheidend sind Folgen und gewünschte Sensitivität der Aufgabe.
Q4Bedeutet ein besserer Wahrscheinlichkeitsscore, dass eine Tradingstrategie profitabel ist?
Nein. Der Score bewertet Prognosen, nicht Entscheidungen nach Auszahlungen, Ausführungskosten, Finanzierung, Positionsgröße und Modellauswahl. Primärforschung - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)
Quellen und weiterführende Lektüre
Problem melden
Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden
Schnelltest
Fertig gelesen? Prüfe dich mit 3 Fragen
Frage 01
Ein binäres Ereignis tritt nach einer Prognose von 70 % ein. Wie hoch ist der Brier-Verlust nach der Einzelereignis-Konvention?
Wähle eine Antwort, um die Erklärung zu sehen