Skip to content
所有選擇權指南
機率預測評估12 分鐘閱讀

機率預測中的 Brier score 與 log loss 比較

比較二元機率預測的 Brier score 和 log loss,了解計算方式,以及適當評分、校準與預測能力的意義

本指南內容命中率會忽略預測的機率

簡短摘要

機率預測描述事件發生的可能性,而不只是指出哪個結果最可能。Brier score 與 log loss 會將預測機率和已確認的結果相比。兩者都是 proper scoring rules,但對錯誤的懲罰方式不同。因此,只有先固定事件、樣本、評分慣例和比較基準,較低的 score 才有意義。

命中率會忽略預測的機率

假設你記錄模型是否正確預測「上漲」或「下跌」。命中率會把正確的 51% 預測和正確的 99% 預測視為相同,也會把錯誤的 49% 和 1% 預測視為相同。這樣會丟掉預測所表達的信心,但當決策涉及不同報酬或風險時,信心可能很重要。

二元機率預測會在預測起點 \(t\),為一個定義明確的事件指定介於 0 和 1 之間的數值 \(p_t\)。後續若事件發生,記為 \(y_t=1\);若沒有發生,記為 \(y_t=0\)。Scoring rule 會同時評估預測與結果。Brier score 使用機率誤差的平方;log loss 則使用實際發生結果所對應機率的負對數。

這些 score 可用來比較機率預測,包括交易模型產生的事件機率。但它們本身無法說明預測是否校準、是否勝過合理的基準,或依照預測交易是否會獲利。Mincer–Zarnowitz 指南介紹另一種用於數值點預測的線性校準迴歸。

定義一個事件,並將每筆預測和對應結果配對

計分前,先定義事件,確保結果能以一致的方式判定。「資產會不會上漲?」並不完整;還需要指定資產、價格來源、開始與結束時間、幣別、報酬率計算方式,以及如何處理缺漏或更正的紀錄。經濟事件則要記錄用來判定結果的公告及資料版本。不要比較根據不同事件定義或日期集合計分的預測。

保留每筆預測在其起點實際可取得的內容。時間 \(t\) 發出的機率,只能使用指定 cutoff 前可取得的資訊,並配對相同 horizon 的結果。修訂後的資料序列、之後才出現的交易所收盤價,或看過結果後才選定的分類規則,都可能在不知不覺中改變 target,或引入未來資訊。

對 rolling forecast,保存模型版本、輸入資料版本、timestamp、機率和結果判定規則。比較模型時使用相同的 forecast origins。若機率缺漏,請記錄排除原因,並對所有候選模型套用同一套樣本規則。這些紀錄能讓 score 重現,而不只是變動中 spreadsheet 的摘要。

用機率誤差平方計算 Brier score

單一二元事件中,第 \(t\) 個案例的 Brier loss 是:

BSₜ = (pₜ − yₜ)²

\(n\) 筆預測的平均 Brier score 是:

BS = (1/n) Σₜ (pₜ − yₜ)²

數值越低越好,0 代表完美預測;這個單一事件慣例的範圍是 0 到 1。例如,預測 \(p=0.70\) 且事件發生時,loss 為 \((0.70-1)^2=0.09\)。若同一預測之後事件沒有發生,loss 則為 \((0.70-0)^2=0.49\)。高度自信的錯誤比程度較輕的錯誤付出更高代價,但懲罰仍有上限。

比較已發表的數字時,要先確認採用的公式。有些慣例會加總多結果預測中所有類別的誤差平方;在二元情況下,類別向量的總和可能是上述單一事件 loss 的兩倍。同一事件內將所有 score 乘以二不會改變排序,但若沒有註明尺度,不同慣例下的數值便不能直接比較。

計算 log loss,了解極端錯誤為何特別突出

二元事件的 log loss 為:

LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]

事件發生時,loss 為 \(-\log(p_t)\);事件沒有發生時,則為 \(-\log(1-p_t)\)。因此,正確的 70% 預測會得到 \(-\log(0.70)\approx0.357\),同一預測若錯誤則會得到 \(-\log(0.30)\approx1.204\)。平均 log loss 會平均各案例的懲罰;若預測給實際發生的事件分配接近 0 的機率,loss 沒有固定上限。

當 \(p=0\) 或 \(p=1\) 時,極度確信卻錯誤的預測會產生無限大的 log loss。若軟體為避免無限值而將機率限制在很小的下限,例如 \(\varepsilon\),應揭露該下限,並在查看結果之前一致地套用。Clipping 會改變數值評估規則,不應把它隱藏成資料清理細節。

Brier score 和 log loss 的懲罰曲線不同,因此可能以不同順序排列同一組預測。對於實際發生的事件,log loss 會特別重罰接近 0 的預測機率;二元 Brier loss 的上限為 1。請事先選定主要 score。若決策取決於極端機率,可考慮同時呈現兩者,而不是事後挑選較有利的結果。

<!-- learn:illustration -->

藍色玻璃滴與琥珀色結果石相對擺放,一項高度自信的預測與實際發生的事件相距很遠
以概念圖呈現機率預測、實際結果及自信誤判所受的不同懲罰;不是市場資料、檢定結果或交易訊號

Proper scoring 在期望上鼓勵如實回報機率

如果預測者透過回報自己真正相信的機率,能使預期報酬最大或預期損失最小,這個 score 就是 proper。若如實機率是唯一最佳值,則稱為 strictly proper。依照常見定義,Brier score 和 logarithmic score 對二元機率預測都是 strictly proper(Gneiting 與 Raftery,2007)。這提供了直接評估機率,而不是先將它們轉成硬標籤的理論依據。

「Proper」描述的是期望上的性質,不保證每個已觀察樣本都會有好結果。誠實回報 70% 機率的人,在單一案例中仍可能預測錯誤,並在有限樣本中得到比猜測者更差的 score。要了解平均表現,需要重複且可比較的預測。誘因也很重要:如果另有一套 payoff rule,單靠 score 不能保證回報的機率反映預測者的真實信念。

兩個 score 都不只衡量校準。彙總數值可能同時反映預測機率與觀察頻率的接近程度,以及區分不同結果案例的能力。模型可以產生區分度高的預測,卻仍然系統性地校準不佳;總是回報 base rate 的模型,整體上可能已校準,卻很少提供個別案例的資訊。

透過 reliability、resolution 與 uncertainty 解讀 Brier 分解

Murphy 分解將平均 Brier score 拆成三個項目(Murphy,1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)):

BS = reliability − resolution + uncertainty

對預測機率相近的群組 \(k\),令 \(w_k\) 表示每個群組在樣本中的占比,\(\bar p_k\) 表示群組的平均預測機率,\(\bar y_k\) 表示觀察到的事件頻率,\(\bar y\) 表示整體事件頻率。依 bin 分組的組成項為:

reliability = Σₖ wₖ(̅pₖ − ̅yₖ)² resolution = Σₖ wₖ(̅yₖ − ̅y)² uncertainty = ̅y(1 − ̅y)

reliability error 越低越好:群組內的預測機率應符合該群組的觀察頻率。resolution 越高越好:各群組的事件頻率應與整體 base rate 不同。Uncertainty 反映事件在樣本中出現的頻率,並非預測模型的功勞。這個分解說明為什麼兩個模型的 Brier score 可以相同,但強項不同。

若將預測機率完全相同的案例分在一起,經驗分解是精確的。如果把連續機率切分成 bins,分解只對合併後的預測精確,並不保留各 bin 內已消失的原始機率差異。分組需要選擇 bin 邊界。由十個等寬 bins 建立的 reliability diagram,可能與依 quantile 分組的圖不同,尤其在小樣本或接近機率極端值時。請呈現每個 bin 的案例數及 uncertainty,並把分組分解當成診斷工具,而不是消除抽樣誤差的方法。Calibration plot 不是未來 reliability 的獨立證明。

先選定參照,再把 score 稱為 skill

raw score 比另一個模型低只是一種比較,並不代表相較於有用的 baseline 有所改善。Brier skill score 會將預測系統與明確命名的 reference forecast 比較:

BSS = 1 − BS_model / BS_reference

依照這個定義,0 表示與 reference 相同,正值表示改善,負值表示結果較差。當 reference loss 大於 0 時,模型的 Brier loss 為 0 會得到 1。請依照決策和可用資訊選擇 reference。固定的歷史 base rate、訓練期間內的事件頻率,或既有的預測程序,都可能適用於不同工作。

若未來評估結果在做出預測時還不可得,就不要用它們計算 reference。對時間序列來說,expanding 或 rolling 的歷史頻率,可能比整段樣本的事件頻率更適合作為實務 baseline。若 reference score 為 0,比例沒有定義;請說明 benchmark 的建構方式,並一併報告模型與 reference 的 raw scores。

Brier skill score 取決於 reference 和事件頻率。相較於無條件 base-rate forecast 的 score,回答的問題不同於相較於目前 production model 的 score。比較不同研究的 BSS 前,請核對事件定義、reference forecast、樣本期間,以及二元或多類別的計算慣例。

在配對的 out-of-sample 結果上比較模型

依照時間順序產生機率,並保留未用於調整模型、選擇特徵或決定 threshold 的評估期間。所有模型都要在相同的已確定結果和 forecast origins 上評分。對選定的 loss,配對差異定義如下:

dₜ = Lₐ,ₜ − Lᵦ,ₜ

依照這個正負號慣例,平均值為正表示模型 B 的平均 loss 較低。Diebold–Mariano 架構可以檢定平均 loss 差異,但其預測比較假設及變異數估計必須符合研究設計。若問題是相對 score 是否會隨預測當時已知的條件而改變,Giacomini–White 指南介紹了這種條件比較。重複的 origin、重疊的事件窗口和模型搜尋可能使差異彼此相依或受到篩選;天真的標準誤或未調整的單一 p-value 可能誇大證據。

在查看結果前,先固定事件、horizon、樣本、主要 score、benchmark 和比較方向。報告平均 Brier 與 log loss、樣本數、模型和 reference 定義、機率 clipping 規則,以及針對相依性或搜尋所作的調整。除了彙總值,也呈現 reliability plot 和配對 score 差異,有助於解釋改變之處。Forecast combination 方法能合併預測,但最終組合也需要在未用來選擇它的期間評估。

這些 score 的單位並不相同。Brier 差異 0.01 不能直接視為 log loss 差異 0.01。較低的 score 也不代表底層機率模型正確;它只是對特定結果下受評估預測的證據。

將預測品質與交易獲利能力分開

機率只有透過把它轉成行動的規則,才能支援交易決策。決策也取決於 payoff 大小、預測錯誤時的損失、成交價格、spread、手續費、slippage、funding、借款成本、資金限制,以及預測何時能用來交易。Proper score 評估機率預測,不會納入這些成本,也不會替你選擇部位大小。

模型可能改善平均 log loss,卻沒有改善某個特定交易規則,因為該規則可能只在某個機率範圍內交易,或採用不同 horizon。相反地,有用的決策訊號可能只出現在少數案例,因此對整體 score 的貢獻不大。評估預測之後,應另外在未用於選擇規則的日期上,測試事先指定的決策規則,採用合理的淨報酬與不確定性估計。

一份完整的報告應能讓其他研究者重現事件、機率、結果、score 公式和慣例、reference、樣本與評估時間。報告也要指出機率是否為 out-of-sample、結果是否重疊、如何處理缺漏案例,以及測試過多少替代模型或評分選項。這種做法讓預測 score 保持資訊價值,而不會將它包裝成未來獲利的承諾。

常見問題

Q1Brier score 越低一定越好嗎?

只有在事件定義、樣本、評分慣例和結果編碼相同時,較低才較好。不同事件或多類別慣例產生的 score 可能無法直接比較。

Q2Brier score 表現好是否證明機率已校準?

否。彙總 Brier score 結合了 reliability、resolution 和事件的不確定性。也要檢查校準診斷和樣本不確定性。

Q3應該選 Brier score 還是 log loss?

在評估結果前選定。Brier loss 有上限,採用機率誤差平方;log loss 對高信心但錯誤的機率懲罰較重。選擇取決於任務後果和需要的敏感度。

Q4機率 score 較好是否代表交易策略會獲利?

否。Score 評估預測,不評估考慮 payoff、執行成本、融資、部位大小和模型選擇後的決策。 原始研究 - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)

資料來源與延伸閱讀

回報問題

我們會準備一封包含本文連結的電子郵件。寄出後,Mark 才會收到你的回報

快速檢查

讀完指南後,用 3 道題檢查一下

問題 1 / 3

問題 01

二元事件在 70% 預測後發生。依照單一事件的慣例,Brier loss 是多少?

選擇答案即可查看解釋

期權術語表