Brier score a log loss w prognozach probabilistycznych
Porównaj Brier score i log loss dla binarnych prognoz prawdopodobieństwa, naucz się je obliczać oraz poznaj scoring proper, kalibrację i jakość prognoz
W tym przewodnikuHit rate pomija prognozowane prawdopodobieństwo
Krótkie podsumowanie
Prognoza probabilistyczna określa, jak prawdopodobne jest zdarzenie, a nie tylko który wynik jest najbardziej prawdopodobny. Brier score i log loss porównują te prawdopodobieństwa z rozstrzygniętymi wynikami. Oba są proper scoring rules, ale inaczej karzą błędy. Dlatego niższy score ma znaczenie dopiero po ustaleniu zdarzenia, próby, konwencji obliczania score i punktu odniesienia.
Hit rate pomija prognozowane prawdopodobieństwo
Wyobraź sobie, że zapisujesz, czy model poprawnie przewidział „wzrost” albo „spadek”. Hit rate traktuje poprawną prognozę 51% tak samo jak poprawną prognozę 99%. Tak samo zrównuje błędną prognozę 49% i błędną prognozę 1%. W ten sposób pomija pewność wyrażoną w prognozie, choć może ona mieć znaczenie, gdy decyzje wiążą się z różnymi wypłatami lub ryzykiem.
Binarna prognoza probabilistyczna przypisuje wartość \(p_t\) z przedziału od zera do jednego jasno zdefiniowanemu zdarzeniu w chwili prognozy \(t\). Później zapisuje się \(y_t=1\), jeśli zdarzenie nastąpiło, a \(y_t=0\), jeśli nie nastąpiło. Scoring rule ocenia jednocześnie prognozę i wynik. Brier score wykorzystuje kwadrat błędu prawdopodobieństwa; log loss to ujemny logarytm prawdopodobieństwa przypisanego temu, co rzeczywiście się wydarzyło.
Te score’y służą do porównywania prognoz probabilistycznych, w tym prawdopodobieństw zdarzeń z modelu tradingowego. Same w sobie nie pokazują, czy prognoza jest skalibrowana, przewyższa sensowny punkt odniesienia ani czy trading na jej podstawie przyniesie zysk. Przewodnik Mincera–Zarnowitza opisuje inną liniową regresję kalibracyjną dla liczbowych prognoz punktowych.
Zdefiniuj zdarzenie i dopasuj każdą prognozę do jej wyniku
Przed obliczeniem score zdefiniuj zdarzenie tak, aby można je było rozstrzygać w spójny sposób. Pytanie „Czy aktywo wzrośnie?” jest niepełne bez wskazania aktywa, źródła ceny, czasu początku i końca, waluty, konwencji stopy zwrotu oraz sposobu traktowania brakujących lub skorygowanych zapisów. W przypadku zdarzenia gospodarczego zapisz publikację i wersję danych wykorzystaną do ustalenia wyniku. Nie porównuj prognoz ocenionych na podstawie różnych definicji lub zestawów dat.
Zachowuj każdą prognozę w postaci dostępnej w chwili jej powstania. Prawdopodobieństwo podane w czasie \(t\) powinno korzystać z informacji dostępnych do ustalonego cutoffu i być dopasowane do wyniku dla tego samego horyzontu. Zrewidowana seria danych, późniejsza cena zamknięcia giełdy lub reguła klasyfikacji wybrana po poznaniu wyniku mogą po cichu zmienić target albo wprowadzić informację z przyszłości.
W przypadku prognoz rolling zapisuj wersję modelu, wersję danych wejściowych, timestamp, prawdopodobieństwo i regułę rozstrzygnięcia. Do porównywania modeli używaj tych samych forecast origins. Jeśli brakuje prawdopodobieństwa, udokumentuj wykluczenie i zastosuj tę samą regułę próby do każdego kandydata. Dzięki tym zapisom score można odtworzyć, zamiast traktować go jako podsumowanie zmieniającego się arkusza.
Oblicz Brier score z kwadratów błędów prawdopodobieństwa
Dla pojedynczego zdarzenia binarnego Brier loss w przypadku \(t\) wynosi:
BSₜ = (pₜ − yₜ)²
Średni Brier score dla \(n\) prognoz wynosi:
BS = (1/n) Σₜ (pₜ − yₜ)²
Niższy wynik jest lepszy, zero oznacza prognozę idealną, a ta konwencja dla pojedynczego zdarzenia mieści się w zakresie od zera do jednego. Na przykład, jeśli prognoza wynosi \(p=0.70\) i zdarzenie nastąpi, loss wynosi \((0.70-1)^2=0.09\). Jeśli po tej samej prognozie zdarzenie nie nastąpi, loss wynosi \((0.70-0)^2=0.49\). Błąd popełniony z dużą pewnością kosztuje więcej niż umiarkowana pomyłka, ale kara pozostaje ograniczona.
Sprawdź wzór przy porównywaniu opublikowanych liczb. Niektóre konwencje sumują kwadraty błędów ze wszystkich kategorii prognozy wielowynikowej; w przypadku binarnym taka suma wektorowa może być dwukrotnie większa niż przedstawiony wyżej loss dla pojedynczego zdarzenia. Pomnożenie wszystkich score’ów przez dwa nie zmienia rankingu w obrębie tego samego zdarzenia, ale wartości liczbowe nie są porównywalne między konwencjami bez podania skali.
Oblicz log loss i sprawdź, dlaczego skrajne błędy mają większą wagę
Dla zdarzenia binarnego log loss wynosi:
LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]
Jeśli zdarzenie nastąpi, loss wynosi \(-\log(p_t)\); jeśli nie nastąpi, wynosi \(-\log(1-p_t)\). Poprawna prognoza 70% otrzymuje więc \(-\log(0.70)\approx0.357\), a ta sama prognoza, gdy okaże się błędna, daje \(-\log(0.30)\approx1.204\). Średni log loss uśrednia kary dla poszczególnych przypadków i nie ma ustalonej górnej granicy, gdy prognoza przypisuje niemal zerowe prawdopodobieństwo zdarzeniu, które następuje.
Przy \(p=0\) lub \(p=1\) błędna prognoza wyrażona z pełnym przekonaniem daje nieskończony log loss. Jeśli oprogramowanie przycina prawdopodobieństwa do niewielkiego minimum, takiego jak \(\varepsilon\), aby uniknąć nieskończoności, podaj tę wartość i stosuj ją konsekwentnie przed obejrzeniem wyników. Clipping zmienia liczbową regułę oceny i nie powinien być ukrywany jako szczegół czyszczenia danych.
Brier score i log loss mogą inaczej uszeregować te same prognozy, ponieważ ich krzywe kar są różne. Log loss szczególnie mocno karze przypisanie niemal zerowego prawdopodobieństwa zdarzeniu, które nastąpiło; binarny Brier loss jest ograniczony do jednego. Zdecyduj z góry, którego score użyjesz. Jeśli decyzje zależą od skrajnych prawdopodobieństw, rozważ przedstawienie obu zamiast wybierania po fakcie korzystniejszego wyniku.
<!-- learn:illustration -->

Proper scoring nagradza uczciwe prawdopodobieństwa w wartości oczekiwanej
Score jest proper, jeśli osoba prognozująca maksymalizuje oczekiwaną nagrodę lub minimalizuje oczekiwaną stratę, podając prawdopodobieństwo, w które rzeczywiście wierzy. Jest strictly proper, jeśli to uczciwe prawdopodobieństwo jest jedynym optimum. Według standardowych definicji Brier score i score logarytmiczny są strictly proper dla binarnych prognoz probabilistycznych (Gneiting i Raftery, 2007). To uzasadnia ocenianie prawdopodobieństw zamiast wcześniejszego zamieniania ich na twarde etykiety.
„Proper” opisuje wartość oczekiwaną, a nie gwarantowany wynik w każdej zaobserwowanej próbie. Osoba uczciwie podająca prawdopodobieństwo 70% nadal może pomylić się w jednym przypadku i uzyskać gorszy score w skończonej próbie niż ktoś, kto zgadywał. Do wnioskowania o średniej jakości potrzebne są powtarzane, porównywalne prognozy. Znaczenie mają również bodźce: jeśli obowiązuje osobna reguła wypłat, sam score nie gwarantuje, że podane prawdopodobieństwo odzwierciedla przekonanie osoby prognozującej.
Żaden z tych score’ów nie mierzy wyłącznie kalibracji. Wartość zagregowana może łączyć bliskość prognozowanych prawdopodobieństw do zaobserwowanych częstości z umiejętnością rozdzielania przypadków o różnych wynikach. Model może tworzyć wyraźnie zróżnicowane prognozy, a mimo to być systematycznie źle skalibrowany. Model, który zawsze podaje base rate, może być skalibrowany w ujęciu zagregowanym, ale przekazywać niewiele informacji o poszczególnych przypadkach.
Odczytaj dekompozycję Brier jako reliability, resolution i uncertainty
Dekompozycja Murphy’ego rozkłada średni Brier score na trzy składniki (Murphy, 1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)):
BS = reliability − resolution + uncertainty
Dla grup \(k\) prognoz o podobnych prawdopodobieństwach niech \(w_k\) oznacza udział grupy w próbie, \(\bar p_k\) — jej średnie prognozowane prawdopodobieństwo, \(\bar y_k\) — zaobserwowaną częstość zdarzenia, a \(\bar y\) — częstość w całej próbie. Składniki dla przedziałów są następujące:
reliability = Σₖ wₖ(̅pₖ − ̅yₖ)² resolution = Σₖ wₖ(̅yₖ − ̅y)² uncertainty = ̅y(1 − ̅y)
Niższy błąd reliability jest lepszy: prognozy w grupie powinny odpowiadać zaobserwowanej częstości w tej grupie. Wyższa resolution jest lepsza: częstości zdarzeń w grupach powinny różnić się od ogólnego base rate. Uncertainty odzwierciedla częstość zdarzenia w próbie i nie jest zasługą modelu. Dekompozycja wyjaśnia, dlaczego dwa modele mogą mieć ten sam Brier score, a różne mocne strony.
Dekompozycja empiryczna jest dokładna, gdy razem grupuje się przypadki z identycznym podanym prawdopodobieństwem. Jeśli ciągłe prawdopodobieństwa zostaną podzielone na przedziały, dekompozycja jest dokładna dla zagregowanej prognozy, ale nie dla różnic między pierwotnymi prawdopodobieństwami, które znikają wewnątrz przedziałów. Grupowanie wymaga wyboru granic. Reliability diagram z dziesięcioma przedziałami o równej szerokości może wyglądać inaczej niż diagram z przedziałami kwantylowymi, zwłaszcza przy małej próbie lub blisko skrajnych prawdopodobieństw. Pokazuj liczebność i uncertainty każdego przedziału; traktuj dekompozycję przedziałową jako diagnostykę, a nie sposób na usunięcie błędu próby. Wykresy kalibracji nie są niezależnym dowodem przyszłej reliability.
Wybierz punkt odniesienia, zanim nazwiesz score miarą skill
Niższy raw score niż wynik innego modelu to porównanie, ale nie dowód poprawy względem użytecznego baseline’u. Brier skill score porównuje system prognozujący z nazwanym forecastem referencyjnym:
BSS = 1 − BS_model / BS_reference
Według tej definicji zero oznacza wynik równy referencji, wartość dodatnia — poprawę, a ujemna — gorszy wynik. Wartość jeden oznacza zerowy Brier loss modelu, gdy loss referencji jest dodatni. Wybierz punkt odniesienia dopasowany do decyzji i zbioru informacji. W różnych zadaniach sensowne mogą być stały historyczny base rate, częstość zdarzeń w oknie treningowym albo istniejąca procedura prognozowania.
Nie obliczaj referencji na podstawie przyszłych wyników ewaluacyjnych, jeśli nie byłyby dostępne w chwili prognozy. W szeregu czasowym rozszerzająca się lub rolling historyczna częstość może być czystszym operacyjnym baseline’em niż częstość z całej próby. Jeśli reference score wynosi zero, iloraz jest nieokreślony; opisz konstrukcję benchmarku i podaj również raw score modelu oraz referencji.
Brier skill score zależy od referencji i częstości zdarzeń. Score względem bezwarunkowego forecastu base rate odpowiada na inne pytanie niż score względem obecnego modelu produkcyjnego. Nie porównuj wartości BSS między badaniami bez sprawdzenia definicji zdarzeń, forecastów referencyjnych, okresów prób i konwencji binarnych lub wielokategorialnych.
Porównuj modele na sparowanych wynikach out-of-sample
Generuj prawdopodobieństwa chronologicznie i odłóż okres ewaluacji, który nie służył do strojenia modelu, wyboru cech ani progu. Oceniaj wszystkie modele na tych samych rozstrzygniętych wynikach i origins. Dla wybranego loss zdefiniuj sparowaną różnicę:
dₜ = Lₐ,ₜ − Lᵦ,ₜ
Przy tej konwencji znaku dodatnia średnia oznacza, że model B miał niższy średni loss. Ramy Diebolda–Mariano mogą testować średnią różnicę loss, gdy założenia porównania prognoz i estymacja wariancji pasują do projektu. Jeśli pytanie dotyczy tego, czy względny score zmienia się zależnie od warunków znanych w chwili prognozy, przewodnik Giacomini–White’a omawia takie porównanie warunkowe. Powtarzające się origins, nakładające się okna zdarzeń i przeszukiwanie modeli mogą uzależniać lub selekcjonować różnice; naiwny standard error albo pojedyncze niekorygowane p-value mogą zawyżać siłę dowodów.
Przed obejrzeniem wyników ustal zdarzenie, horyzont, próbę, główny score, benchmark i kierunek porównania. Raportuj średnie Brier i log loss, liczebności prób, definicje modelu i referencji, regułę clippingu oraz korekty zależności lub przeszukiwania. Reliability plot i sparowane różnice score obok wartości zagregowanych pomagają wyjaśnić, co się zmieniło. Metody łączenia prognoz pozwalają połączyć prognozy, ale końcowe połączenie również wymaga ewaluacji na okresie, który nie służył do jego wyboru.
Score’y nie mają wspólnych jednostek. Różnica Brier równa 0.01 nie jest bezpośrednio równoważna różnicy log loss równej 0.01. Niższy score nie dowodzi również, że bazowy model prawdopodobieństwa jest poprawny; stanowi dowód dotyczący ocenionych prognoz i określonych wyników.
Oddziel jakość prognozy od zyskowności tradingu
Prawdopodobieństwo może wspierać decyzję tradingową tylko za pośrednictwem reguły, która przekształca je w działanie. Decyzja zależy również od wysokości payoffu, strat przy pomyłce, cen wykonania, spreadów, prowizji, slippage’u, funding, kosztów pożyczki, limitów kapitału i chwili, w której można handlować na podstawie prognozy. Proper score ocenia prognozę prawdopodobieństwa; nie uwzględnia tych kosztów ani nie wybiera wielkości pozycji.
Model może poprawić średni log loss bez poprawy konkretnej reguły tradingowej, ponieważ reguła może handlować tylko w pewnym zakresie prawdopodobieństw lub reagować na inny horyzont. Z kolei użyteczny sygnał decyzyjny może występować w niewielkiej liczbie przypadków i w małym stopniu wpływać na ogólny score. Po ocenie prognozy osobno sprawdź wcześniej ustaloną regułę decyzyjną na datach, które nie służyły do jej wyboru, używając realistycznych net returns i szacunków niepewności.
Dobry raport pozwala innemu badaczowi odtworzyć zdarzenie, prawdopodobieństwo, wynik, formułę i konwencję score, referencję, próbę oraz czas ewaluacji. Powinien informować, czy prawdopodobieństwa są out-of-sample, czy wyniki się nakładają, jak potraktowano brakujące przypadki i ile alternatywnych modeli lub wariantów scoringu sprawdzono. Taka dyscyplina czyni score informacyjnym, ale nie zamienia go w obietnicę przyszłych zysków.
Częste pytania
Q1Czy niższy Brier score zawsze jest lepszy?
Jest lepszy, jeśli definicja zdarzenia, próba, konwencja scoringu i kodowanie wyniku są takie same. Score’y z innych zdarzeń lub konwencji wielokategorialnych mogą nie być bezpośrednio porównywalne.
Q2Czy dobry Brier score dowodzi, że prawdopodobieństwa są skalibrowane?
Nie. Zagregowany Brier score łączy reliability, resolution i niepewność zdarzenia. Sprawdź również diagnostykę kalibracji i niepewność próby.
Q3Czy używać Brier score czy log loss?
Wybierz przed oceną wyników. Brier loss jest ograniczony i wykorzystuje kwadrat błędu prawdopodobieństwa; log loss mocniej karze błędne prawdopodobieństwa podane z dużą pewnością. Wybór zależy od konsekwencji zadania i wymaganej wrażliwości.
Q4Czy lepszy score probabilistyczny oznacza, że strategia tradingowa jest zyskowna?
Nie. Score ocenia prognozy, a nie decyzje po uwzględnieniu payoffów, kosztów wykonania, finansowania, wielkości pozycji i selekcji modelu. Badania źródłowe - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)
Źródła i dalsza lektura
Zgłoś problem
Przygotujemy e-mail z linkiem do tego artykułu. Mark otrzyma zgłoszenie dopiero po jego wysłaniu
Szybki test
Przeczytano? Sprawdź się w 3 pytaniach
Pytanie 01
Zdarzenie binarne następuje po prognozie 70%. Jaki jest Brier loss według konwencji pojedynczego zdarzenia?
Wybierz odpowiedź, aby zobaczyć wyjaśnienie