Skip to content
所有期權指南
概率預測評估12 分鐘閱讀

比較概率預測中的 Brier score 與 log loss

比較二元概率預測的 Brier score 和 log loss,了解計算方法,以及 proper scoring、校準和預測能力的含義

本指南內容命中率會忽略預測概率

簡短摘要

概率預測說明某個事件發生的可能性,而不只是指出哪個結果最可能。Brier score 和 log loss 會將這些概率與已確定的結果作比較。兩者都是 proper scoring rules,但懲罰錯誤的方式不同。因此,只有在事件、樣本、評分方式及參照均已固定後,較低的 score 才有意義。

命中率會忽略預測概率

假設你記錄模型有否正確預測「升」或「跌」。命中率會把正確的 51% 預測和正確的 99% 預測視為一樣,也會把錯誤的 49% 和 1% 預測視為一樣。這樣便會忽略預測所表達的信心;當決策涉及不同回報或風險時,信心可能很重要。

二元概率預測會在預測起點 \(t\),為一個定義清楚的事件指定介乎零與一之間的數值 \(p_t\)。其後,若事件發生便記作 \(y_t=1\),沒有發生則記作 \(y_t=0\)。Scoring rule 會一併評估預測和結果。Brier score 使用概率誤差的平方;log loss 則使用實際結果所對應概率的負對數。

這些 score 可用來比較概率預測,包括交易模型得出的事件概率。但它們本身不能證明預測已經校準、勝過合理的參照,或按預測交易便能獲利。Mincer–Zarnowitz 指南介紹另一種用於數值點預測的線性校準回歸。

定義一個事件,並將每個預測與相應結果配對

計分前,先定義事件,確保結果可以用一致的方法判定。「資產會否上升?」仍未完整;你需要列明資產、價格來源、開始和結束時間、貨幣、回報計算方式,以及如何處理缺漏或修訂紀錄。若屬經濟事件,記錄用來判定結果的公布資料及其版本。不要比較按不同事件定義或日期組合計分的預測。

保存每個預測在其起點實際可用的版本。時間 \(t\) 發出的概率,只可使用指定 cutoff 前已知的資料,並須配對相同 horizon 的結果。修訂過的數據序列、其後才出現的交易所收市價,或看過結果後才選定的分類規則,都可能在不易察覺下改變 target,或引入未來資料。

對 rolling forecast,保存模型版本、輸入資料版本、timestamp、概率及結果判定規則。比較模型時使用相同的 forecast origins。若某個概率缺失,記錄剔除原因,並對所有候選項採用相同的樣本規則。這些紀錄令 score 可以重現,而不只是來自一份不斷變動的 spreadsheet 摘要。

以概率誤差平方計算 Brier score

對單一二元事件,案例 \(t\) 的 Brier loss 是:

BSₜ = (pₜ − yₜ)²

\(n\) 個預測的平均 Brier score 是:

BS = (1/n) Σₜ (pₜ − yₜ)²

越低越好,零代表完美;這個單一事件的計算方式介乎零與一。例如,若預測 \(p=0.70\),而事件發生,loss 是 \((0.70-1)^2=0.09\)。若同一預測之後事件沒有發生,loss 就是 \((0.70-0)^2=0.49\)。很有信心但預測錯誤的代價較高,不過懲罰仍有上限。

比較已發表的數字時,先核對公式。有些計算方式會加總多結果預測中所有類別的平方誤差;在二元情況下,類別向量總和可能是上述單一事件 loss 的兩倍。在同一事件內把所有 score 乘二不會改變排名,但若沒有列明尺度,不同計算方式的數值便不能直接比較。

計算 log loss,了解極端錯誤為何特別突出

二元事件的 log loss 是:

LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]

事件發生時,loss 是 \(-\log(p_t)\);沒有發生時,則是 \(-\log(1-p_t)\)。因此,正確的 70% 預測會得到 \(-\log(0.70)\approx0.357\),同一預測若錯誤,則會得到 \(-\log(0.30)\approx1.204\)。平均 log loss 會取每宗個案的懲罰平均;若預測給實際發生的事件分配近乎零的概率,loss 沒有固定上限。

當 \(p=0\) 或 \(p=1\) 時,極度肯定但錯誤的預測會產生無限大的 log loss。若軟件為避免無限值而把概率截至一個很小的下限,例如 \(\varepsilon\),請披露下限,並在查看結果前一致地套用。Clipping 會改變數值評估規則,不應隱藏為資料清理細節。

由於懲罰曲線不同,Brier score 和 log loss 可能以不同次序排列同一批預測。對已發生的事件,log loss 會特別重罰近乎零的預測概率;二元 Brier loss 的上限則是一。請預先選定主要 score。若決策取決於極端概率,可考慮同時報告兩者,而不是事後挑選較好看的結果。

<!-- learn:illustration -->

藍色玻璃滴與琥珀色結果石相對擺放,一項高度自信的預測與實際發生的事件相距甚遠
以概念圖呈現概率預測、實際結果及自信誤判所受的不同懲罰;並非市場數據、檢驗結果或交易訊號

Proper scoring 在期望上鼓勵如實報告概率

若預測者如實報告自己真正相信的概率,便能令預期獎勵最大化或預期損失最小化,這個 score 就是 proper。若該如實概率是唯一最佳值,則稱為 strictly proper。按一般定義,Brier score 和 logarithmic score 對二元概率預測都是 strictly proper(Gneiting 與 Raftery,2007)。因此,直接評估概率而不是先轉成硬性標籤,有其理論依據。

「Proper」描述的是期望性質,並非保證每個已觀察樣本都表現良好。誠實報告 70% 概率的人仍可能在單一個案中預測錯誤,並在有限樣本中得到比猜測者更差的 score。要了解平均表現,需要重複而且可比較的預測。激勵安排亦很重要:若當事人另受一套 payoff rule 約束,單靠 score 並不能保證其報告的概率反映真正信念。

兩種 score 都不只是量度校準。綜合數值可能同時反映預測概率與觀察頻率的接近程度,以及區分不同結果個案的能力。模型可以作出區分度高的預測,卻仍然系統性地校準失準;經常只報告 base rate 的模型,整體上可能已校準,但對個別個案提供的資訊不多。

將 Brier 分解理解為 reliability、resolution 和 uncertainty

Murphy 分解將平均 Brier score 拆成三項(Murphy,1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)):

BS = reliability − resolution + uncertainty

對於概率相近的預測組別 \(k\),令 \(w_k\) 為各組佔樣本的比例,\(\bar p_k\) 為組內平均預測概率,\(\bar y_k\) 為觀察到的事件頻率,而 \(\bar y\) 為整體事件頻率。按 bin 分組後的組成項為:

reliability = Σₖ wₖ(̅pₖ − ̅yₖ)² resolution = Σₖ wₖ(̅yₖ − ̅y)² uncertainty = ̅y(1 − ̅y)

reliability error 越低越好:組內預測應與該組觀察頻率一致。resolution 越高越好:各組事件頻率應有別於整體 base rate。Uncertainty 反映事件在樣本中出現的頻率,並非預測模型的功勞。這個分解說明,為何兩個模型可有相同 Brier score,卻各有不同強項。

當把相同已發出概率的個案分在一起時,經驗分解是精確的。若把連續概率分入不同 bins,分解只對合併後的預測精確,並不保留 bin 內已失去的原始概率差異。分組時必須選擇 bin 界限。十個等寬 bins 的 reliability diagram,可能與按 quantile 分組的圖表不同,尤其在樣本較小或概率接近極端值時。請顯示每個 bin 的個案數目和 uncertainty,並把分組分解當作診斷工具,而非消除抽樣誤差的方法。校準圖不是未來 reliability 的獨立證明。

選定參照後,才把 score 稱為 skill

raw score 低於另一個模型只代表比較,未必表示勝過有用的 baseline。Brier skill score 會將預測系統與一個明確列出的 reference forecast 比較:

BSS = 1 − BS_model / BS_reference

按此定義,零代表與 reference 相同,正值代表改善,負值則代表較差。若 reference loss 為正,數值一代表模型的 Brier loss 為零。請按決策和可用資料選擇 reference。固定的歷史 base rate、訓練窗口內的事件頻率,或現有預測程序,都可能適合不同任務。

若預測時尚未有未來評估結果,就不要用那些結果計算 reference。對時間序列而言,擴展式或 rolling 的歷史頻率,可能比整個樣本的事件頻率更適合作為實際操作的 baseline。若 reference score 為零,比例沒有定義;請說明 benchmark 如何建立,並同時報告模型和 reference 的 raw scores。

Brier skill score 取決於 reference 和事件頻率。相對於無條件 base-rate forecast 的 score,與相對於現行 production model 的 score,回答的是不同問題。比較不同研究的 BSS 前,應核對事件定義、reference forecasts、樣本期間,以及二元或多類別計算方式。

以配對的 out-of-sample 結果比較模型

按時間先後產生概率,並保留一段沒有用於調整模型、選擇 features 或設定 threshold 的評估期。所有模型都要用相同的已確定結果和 origins 評分。對選定的 loss,配對差異定義如下:

dₜ = Lₐ,ₜ − Lᵦ,ₜ

按這個正負號設定,平均值為正代表模型 B 的平均 loss 較低。Diebold–Mariano framework可檢驗平均 loss 差異,但須視乎其預測比較假設和 variance estimate 是否適合該設計。若問題是相對 score 會否隨預測時已知的條件而改變,Giacomini–White 指南介紹這類條件比較。重複 origins、重疊事件窗口及模型搜尋可能令差異互相依賴或受到選擇;簡單的標準誤或未調整的單一 p-value 可能誇大證據。

在查看結果前,先定好事件、horizon、樣本、主要 score、benchmark 和比較方向。報告平均 Brier 和 log loss、樣本數、模型和 reference 定義、概率 clipping 規則,以及依賴性或搜尋方面的調整。除整體數值外,也可展示 reliability plot 和配對 score 差異,說明結果如何改變。Forecast combination 方法能合併預測,但最後的組合也要在未用來選擇它的資料上評估。

這些 score 的單位並不相同。Brier 差異 0.01 不可以直接當作 log loss 差異 0.01。較低的 score 也不證明基礎概率模型正確;它只反映在指定結果上評估過的預測表現。

將預測質素與交易盈利分開

概率只有透過轉化成行動的規則,才可以支援交易決策。決策亦取決於 payoff 大小、判斷錯誤時的損失、成交價格、spread、佣金、slippage、funding、借貸成本、資金限制,以及預測何時可以用來交易。Proper score 評估概率預測,不包括這些成本,也不會選擇倉位大小。

模型的平均 log loss 可以改善,但某個交易規則未必因此改善,因為規則可能只在特定概率範圍交易,或採用另一個 horizon。相反,有用的決策訊號可能集中在少數個案,對整體 score 影響不大。評估預測後,應另外在沒有用來挑選規則的日期上,測試預先訂明的決策規則,並使用實際可行的淨回報和不確定性估算。

一份充足的報告應讓其他研究者重現事件、概率、結果、score 公式和計算方式、reference、樣本及評估時間。報告也要說明概率是否 out-of-sample、結果是否重疊、如何處理缺漏個案,以及試過多少個替代模型或評分方式。這樣能讓預測 score 保持實用,而不會被誤當成未來獲利的承諾。

常見問題

Q1Brier score 越低是否一定越好?

只有在事件定義、樣本、scoring convention 和結果編碼相同時,較低才較好。不同事件或多類別計算方式的 score 未必可以直接比較。

Q2Brier score 良好是否證明概率已校準?

不是。整體 Brier score 結合 reliability、resolution 和事件 uncertainty。亦要檢視校準診斷及樣本的不確定性。

Q3應該用 Brier score 還是 log loss?

在評估結果前選定。Brier loss 有上限並使用概率誤差平方;log loss 對高信心但錯誤的概率懲罰更大。選擇取決於任務後果和所需敏感度。

Q4較佳的概率 score 是否代表交易策略有盈利?

不是。Score 評估預測,不評估考慮 payoff、執行成本、融資、倉位大小和模型選擇後的決策。 原始研究 - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)

資料來源與延伸閱讀

回報問題

我們會準備一封包含本文連結的電郵。寄出後,Mark 才會收到你的回報

快速檢查

讀完指南後,用 3 道題檢查一下

問題 1 / 3

問題 01

一個二元事件在 70% 預測後發生。按單一事件的計算方式,Brier loss 是多少?

選擇答案即可查看解釋

期權術語表