VaR–ES 聯合評分:Fissler–Ziegel 預測評估
了解為什麼 Value at Risk 與 Expected Shortfall 需要聯合評分規則、如何用 Fissler–Ziegel 分數比較預測,以及它與 VaR 例外檢定的差異。
本指南內容先確認預測組合和尾端慣例
簡短摘要
VaR 是分位數,可以用分位數損失單獨評分。Expected Shortfall(ES)則不同:在廣泛的分配類別中,ES 不能作為獨立點預測而 elicitable。Fissler 和 Ziegel 證明,在適當條件下,可以用嚴格一致的聯合分數同時評估 VaR 和 ES。這樣能比較預測組合,但低分並不代表風險模型已證明正確。
先確認預測組合和尾端慣例
令 L_t 表示損失,數值愈大代表損失愈嚴重;c 是信賴水準,例如 97.5%。條件損失分位數 v(c,t) 是讓 F(L_t ≤ x | 截至 t−1 的資訊) 達到 c 的最小 x。採用正損失上尾慣例時,只要尾端平均有限,ES e(c,t) 就是 v(u,t) 從 c 到 1 的積分乘以 1/(1−c)。在連續分配下,它等於超過 VaR 門檻的平均損失。若門檻有機率質量,分位數積分定義會處理所需比例的質量。
評分必須採用與預測相同的慣例。有些論文以報酬率下尾定義 VaR 和 ES,通常使用負值,並將尾端機率寫成 α = 1−c。採用正損失慣例時,同一風險位於上尾,而且 ES 不會小於 VaR。混用慣例可能讓不等式和例外指標反轉。請記錄正負號、信賴水準、期間,以及結果發生前可取得的資訊。
為什麼 VaR 和 ES 沒有相同的獨立評分
分位數有常見的嚴格一致 pinball 分數。對損失 L 和其 c 分位數 v,一種 VaR 分數是 S_VaR(v,L) = (I{L ≤ v}−c)(v−L)。在一般分位數條件下,期望值於目標分位數達到最小,因此 VaR 可以單獨評估。
對風險管理使用的廣泛損失分配類別而言,沒有相同的嚴格一致分數可以只 elicitable ES。這個說法針對獨立點預測,以及期望分數能唯一選出 ES 的情況。它不代表 ES 沒有意義、無法檢定,或不能作為較完整預測的一部分進行比較。
Fissler 和 Ziegel 說明關鍵差異:ES 單獨在此意義下不可 elicitable,但在適當的正則性和動差條件下,(VaR, ES) 可以共同 elicitable。他們 2016 年的論文為廣泛的嚴格一致分數類別提出必要和充分條件 (Fissler and Ziegel, 2016)。共同 elicitability 表示同一評分函數同時接收兩項預測和實際結果。任意將兩種損失相加,不會自動產生有效的 ES 分數。
Fissler–Ziegel 分數評估什麼
以 S_c(v,e;L) 表示信賴水準 c 下可用的聯合分數。嚴格一致表示在目標分配下,期望分數於正確組合處最低:(VaR_c, ES_c) = arg min over (v,e) of E[S_c(v,e;L)]。在相關條件下,最低點唯一。分數會結合是否越過 VaR 邊界、實際尾端損失和 ES 預測。正損失上尾慣例下,ES 不應低於 VaR。
Fissler–Ziegel 提出的是分數類別,不是唯一必用公式。Patton、Ziegel 和 Chen 將此結果用於動態 VaR–ES 預測的建模與比較 (Patton, Ziegel, and Chen, 2019)。常見成員 FZ0 以報酬率下尾慣例表示:Y = −L、α = 1−c,且負預測 e ≤ v < 0: S_FZ0(Y,v,e;α) = −I{Y ≤ v}(v−Y)/(αe) + v/e + ln(−e) − 1。 這個公式依賴報酬率正負號與負值假設。它不適用於所有正損失資料,也不代表所有聯合分數。請記錄所選分數,確認假設符合資料與預測慣例。
謹慎解讀分數水準與差異
對模型 m,逐一計算預測–結果組合的聯合分數,再求平均:mean_S_m = (1/T) Σ_t S_c(v_hat(m,t), e_hat(m,t); L_t)。若採用相同的 admissible 分數、日期、目標和慣例,平均分數較低代表依該規則的相對表現較佳。分數不是機率、VaR 金額或金錢損失估計;數值尺度取決於所選分數。
比較 A 和 B 時,建立 d_t = S_A,t − S_B,t。平均差為負表示依所選分數 A 較佳。兩個預測面對相同的實際結果,因此配對差異比比較各自四捨五入的平均值更有資訊。不過,尾端觀察值很少時,差異仍可能不穩定。
<!-- learn:illustration -->
請使用相同的預測起點、投資組合或目標、期間、信賴水準和資料版本。預測必須在結果出現前記錄。若期間重疊或分數差有序列相關,不確定性計算須反映這種依賴。請報告適當的標準誤或區間;微小的原始差異本身不代表結果可靠。

為什麼兩種獨立損失不能取代聯合分數
一種看似簡單的方法,是將 VaR pinball 損失加上 ES 預測與代理值之間的絕對誤差。但第二項未必是有效的 ES 分數,任意加權總和也不保證聯合一致性。FZ 分數的設計,是讓預測組合共同對應 VaR–ES 泛函。若任意更改權重或轉換而失去這項性質,評估問題也會跟著改變。
Fissler–Ziegel 類別包含多種敏感度與尺度不同的分數,因此不同分數的差異不能直接比較。Patton、Ziegel 和 Chen 討論分數設計,以及在額外正負號假設下 FZ0 的尺度特性;這不代表 FZ0 在所有情況都是最佳選擇。應在查看排名前選定並公開規則。
預測組合也很重要。數值上看似合理的 ES 預測,可能與配對 VaR 不一致。反過來,聯合分數表現良好也無法證明整個條件分配正確。評估的是所選分數與評估設計下的 VaR–ES 泛函。
相同的 VaR 例外可能掩蓋不同的尾端損失
VaR 例外指標是二元值:若 L_t 超過 VaR 預測,I_t = 1,否則為 0。兩個模型的例外數量與時間可能相同,但超過門檻的損失幅度可能差很多。四次突破並不能說明損失只是稍微超過,還是遠高於 VaR。單純計數會遺失 ES 要描述的尾端嚴重程度。
聯合分數會將 VaR 門檻、ES 預測和實際損失一併考慮,因此尾端損失幅度可能在命中次數之外影響分數。每個觀察值的實際貢獻由所選分數決定。不要只根據單一極端損失判斷勝者;應在完整共同樣本上計算分數並檢查敏感度。
以評分比較預測,和檢查 VaR 例外頻率並非同一件事。聯合分數回答哪個預測組合依共同規則表現較好;它不是完整的校準證明。
例外檢定與 ES 回測回答不同問題
Kupiec 類 VaR 檢定會把例外數量與目標比率比較;Christoffersen 類延伸方法也會檢查依賴或群聚。由於它們把結果簡化為命中或未命中,因此不會衡量 VaR 以上的損失幅度,也不會直接驗證 ES 預測。VaR 與 Expected Shortfall 指南說明例外次數為何忽略尾端嚴重程度。
聯合評分支援相對預測比較;回測則詢問預測在指定程序下是否充分校準。Acerbi 和 Szekely 提出非參數 ES 回測,並指出 elicitability 與模型選擇有關,但不是測試風險衡量的先決條件 (Acerbi and Szekely, 2014)。Bayer 和 Dimitriadis 後來以 VaR–ES 聯合結構發展迴歸式 ES 回測,各變體有不同的假設和共變異數需求 (Bayer and Dimitriadis, 2022)。分數排名不能取代專門回測;未拒絕虛無假設,也不代表預測組合正確。
規劃配對推論,避免選擇偏誤
應把分數差的時間序列當作資料。若是沒有重疊的一步預測,而且依賴假設適當,可以考慮對平均差進行配對檢定。若有序列相關或期間重疊,應採用反映依賴的推論方式,例如長期變異數估計或區塊重抽樣。除了 p 值,也要說明方法及頻寬或區塊規則。
在查看排名之前,先固定分數、尾端水準、期間、評估日期和模型集合。嘗試多種分數、時間窗、資產或預測版本後只公布最好結果,會產生選擇效應。可以的話,保留後續評估期間,並公開候選方案的篩選方式。一般的不確定性計算不會自動考慮這種搜尋。
請一併報告平均分數與配對差異及其不確定性、分數定義、VaR–ES 慣例、共同樣本外日期和尾端觀察數。若合理的分數或期間選擇會改變排名,請呈現敏感度。
限制與實務報告檢查清單
信賴水準愈高,尾端觀察值愈少,因此即使時間序列很長,模型排名仍可能不穩定。條件異質變異、制度轉變、重疊報酬、估計誤差、資料問題和投資組合變更都可能影響分數差。共同 elicitability 不會消除這些問題;它是在數學條件下提供有原則的分數類別。
請確認實際損失是否對應相同投資組合、期間、估值方法與正負號;VaR 和 ES 是否使用相同尾端機率;預測是否在結果發生前產生;以及分數是否符合其假設。報告樣本長度、尾端觀察數、分數公式、配對不確定性方法,以及任何模型或分數搜尋。結論須以這套設計為條件。
較低的聯合分數,是在特定適當評分規則下相對預測表現較佳的證據。它不證明模型涵蓋所有尾端事件、風險估計安全,或未來會與樣本相似。本文提供統計說明,並非投資建議。
常見問題
Q1可以用絕對誤差比較 Expected Shortfall 預測嗎?
不應把它當成嚴格一致分數的一般替代。ES 單獨在廣泛分配類別中不可 elicitable;嚴謹的點預測比較通常會將 ES 和 VaR 一起評分,而校準問題則使用專門 ES 回測。
Q2VaR–ES 聯合分數能說明風險模型是否校準嗎?
它依所選聯合分數比較相對表現。校準和模型設定錯誤是不同問題,還需要適當的回測和診斷。
Q3兩個模型的 VaR 例外相同,聯合分數可以不同嗎?
可以。命中指標相同,但 VaR 以上損失幅度或 ES 預測可能不同;實際影響取決於分數。
Q4分數低代表模型可以安全使用嗎?
不代表。這是在指定假設和分數下的樣本比較。尾端資料稀少、制度變化、模型選擇或資料問題都可能改變結果。本文不是投資建議。
資料來源與延伸閱讀
回報問題
我們會準備一封包含本文連結的電子郵件。寄出後,Mark 才會收到你的回報
快速檢查
讀完指南後,用 3 道題檢查一下
問題 01
為什麼 Expected Shortfall 常和 VaR 一起評分?
選擇答案即可查看解釋