VaR–ES 聯合評分:Fissler–Ziegel 預測評估
了解為何 Value at Risk 與 Expected Shortfall 需要聯合評分規則、如何用 Fissler–Ziegel 分數比較預測,以及它與 VaR 例外檢定的分別。
本指南內容先確定預測組合和尾部定義
簡短摘要
VaR 是一個分位數,可以用分位數損失單獨評分。Expected Shortfall(ES)則不同:在廣泛的分佈類別中,ES 不能作為獨立點預測而 elicitable。Fissler 和 Ziegel 證明,在適當條件下,可以用嚴格一致的聯合分數同時評估 VaR 和 ES。這樣可以比較預測組合,但低分不代表風險模型已獲證明正確。
先確定預測組合和尾部定義
令 L_t 代表損失,數值愈大代表損失愈嚴重;c 是置信水平,例如 97.5%。條件損失分位數 v(c,t) 是令 F(L_t ≤ x | 截至 t−1 的資訊) 達到 c 的最小 x。以正損失的上尾定義來說,只要尾部平均有限,ES e(c,t) 就是 v(u,t) 從 c 到 1 的積分乘以 1/(1−c)。在連續分佈下,它等於超過 VaR 門檻的平均損失。若門檻上有機率質量,分位數積分定義會處理所需比例的質量。
評分必須採用與預測相同的定義。有些論文以收益率下尾定義 VaR 和 ES,通常使用負值,並以 α = 1−c 表示尾部機率。若使用正損失定義,同一風險位於上尾,而且 ES 不會低於 VaR。混用定義可能令不等式和例外指標反轉。請記錄正負號、置信水平、期限,以及結果發生前可取得的資訊。
為何 VaR 和 ES 沒有相同的獨立評分
分位數有一種常用的嚴格一致 pinball 分數。對損失 L 及其 c 分位數 v,一個 VaR 分數是 S_VaR(v,L) = (I{L ≤ v}−c)(v−L)。按一般分位數條件,其期望值在目標分位數最小,因此 VaR 可以獨立評估。
對風險管理常見的廣泛損失分佈類別來說,並沒有相同的嚴格一致分數可以只 elicitable ES。這項說法針對獨立點預測,以及其期望分數能唯一選出 ES 的情況。它並不代表 ES 沒有意義、不能測試,或不能作為較完整預測的一部分比較。
Fissler 和 Ziegel 指出關鍵分別:ES 單獨在此意義下不可 elicitable,但在適當的正則性和矩條件下,(VaR, ES) 可以共同 elicitable。他們 2016 年的論文為廣泛的嚴格一致分數類別提出必要和充分條件 (Fissler and Ziegel, 2016)。共同 elicitability 是指同一評分函數同時接收兩項預測和實際結果。隨意把兩個損失相加,不會自動變成有效的 ES 分數。
Fissler–Ziegel 分數評估甚麼
以 S_c(v,e;L) 表示置信水平 c 下可用的聯合分數。嚴格一致代表在目標分佈下,期望分數在正確組合處最低:(VaR_c, ES_c) = arg min over (v,e) of E[S_c(v,e;L)]。在相關條件下,最低點是唯一的。分數結合是否越過 VaR 界線的資訊、實際尾部損失及 ES 預測。以正損失的上尾定義來說,ES 不應低於 VaR。
Fissler–Ziegel 提出的是分數類別,而非唯一必用公式。Patton、Ziegel 和 Chen 將此結果用於動態 VaR–ES 預測的建模及比較 (Patton, Ziegel, and Chen, 2019)。常見成員 FZ0 以收益率下尾定義表示:Y = −L、α = 1−c,而且負預測 e ≤ v < 0: S_FZ0(Y,v,e;α) = −I{Y ≤ v}(v−Y)/(αe) + v/e + ln(−e) − 1。 這個公式依賴收益率正負號和上述負值假設。它不適用於所有正損失數據,也不代表所有聯合分數。請記錄所選分數,並確認其假設符合數據和預測定義。
小心解讀分數水平和差異
對模型 m,逐一計算預測–結果組合的聯合分數,再求平均:mean_S_m = (1/T) Σ_t S_c(v_hat(m,t), e_hat(m,t); L_t)。若採用相同的 admissible 分數、日期、目標和定義,平均分較低代表按該規則的相對表現較好。分數不是機率、VaR 金額或金錢損失估算;數值尺度取決於所選分數。
比較 A 和 B 時,構造 d_t = S_A,t − S_B,t。平均差為負代表所選分數較支持 A。由於兩個預測面對同一實際結果,配對差異比比較分別四捨五入的平均值更有資訊。不過,尾部觀察值很少時,差異仍可能有很大不確定性。
<!-- learn:illustration -->
請使用相同的預測起點、投資組合或目標、期限、置信水平和數據版本。預測必須在結果出現前記錄。若期限重疊或分數差有序列相關,不確定性計算須反映這種依賴。請報告合適的標準誤或區間;微小的原始差異本身不代表結果可靠。

為何兩個獨立損失不能取代聯合分數
一種看似簡單的方法,是把 VaR pinball 損失加上 ES 預測與代理值之間的絕對誤差。但第二項未必是有效的 ES 分數,任意加權總和亦不保證聯合一致性。FZ 分數的設計目標,是讓整個預測組合共同對應 VaR–ES 泛函。若權重或轉換失去這項性質,評估的問題也會改變。
Fissler–Ziegel 類別包括多種敏感度和尺度不同的分數,不同分數之間的差異不能直接比較。Patton、Ziegel 和 Chen 討論分數設計,以及額外正負號假設下 FZ0 的尺度特性;這不代表 FZ0 在所有情況都是最佳選擇。應在查看排名前選定並公布規則。
預測組合亦很重要。數值上看似合理的 ES 預測,可能與配對的 VaR 不一致。反過來,聯合分數表現良好亦不能證明整個條件分佈正確。評估的只是所選分數和評估設計下的 VaR–ES 泛函。
相同的 VaR 例外可能掩蓋不同的尾部損失
VaR 例外指標是二元值:若 L_t 超過 VaR 預測,I_t = 1,否則為 0。兩個模型的例外數量和時間可以相同,但超過門檻的損失幅度可能相差很大。四次突破並不能說明損失只是稍微超過,還是遠高於 VaR。單純計算次數會失去 ES 所要描述的尾部嚴重程度。
聯合分數會將 VaR 門檻、ES 預測和實際損失一併考慮,因此尾部損失幅度可能在命中次數之外影響分數。每項觀察的實際影響由所選分數決定。不要只憑單一極端損失判斷勝者;應在完整共同樣本上計算分數並檢查敏感度。
以評分比較預測,與檢查 VaR 例外頻率並非同一回事。聯合分數回答哪個預測組合按共同規則表現較好,但它不是完整的校準證明。
例外檢定和 ES 回測回答不同問題
Kupiec 類 VaR 檢定會把例外數量與目標比率比較;Christoffersen 類延伸方法還會檢查依賴或群聚。由於每項結果只記作命中或未命中,這些檢定不會量度超出 VaR 的損失幅度,也不會直接驗證 ES 預測。VaR 與 Expected Shortfall 指南說明例外次數為何忽略尾部嚴重程度。
聯合評分用於相對預測比較;回測則詢問預測在指定程序下是否充分校準。Acerbi 和 Szekely 提出非參數 ES 回測,並指出 elicitability 對模型選擇有用,但不是測試風險指標的先決條件 (Acerbi and Szekely, 2014)。Bayer 和 Dimitriadis 後來以 VaR–ES 聯合結構發展迴歸式 ES 回測,各種方法都有自己的假設和協方差要求 (Bayer and Dimitriadis, 2022)。分數排名不能取代專門回測;未能拒絕虛無假設,也不代表預測組合準確。
規劃配對推斷,避免選擇偏誤
應把分數差的時間序列視作數據。若是沒有重疊的一步預測,而且依賴假設合適,可以考慮對平均差進行配對檢定。若有序列相關或期限重疊,應採用能反映依賴的推斷方式,例如長期變異數估計或區塊重抽樣。除了 p 值,也要交代方法及頻寬或區塊規則。
在查看排名前,先固定分數、尾部水平、期限、評估日期和模型集合。嘗試多個分數、時間窗、資產或預測版本,然後只公布最好結果,會帶來選擇效應。如有可能,保留較後期數據作評估,並披露候選方案的篩選方法。一般不確定性計算不會自動修正這種搜尋。
請一併報告平均分、配對差異及不確定性、分數定義、VaR–ES 定義、共同樣本外日期和尾部觀察數。若合理的分數或期間選擇會改變排名,應展示敏感度。
限制和實用報告清單
高置信水平下尾部觀察值很少,即使時間序列很長,模型排名仍可能不穩定。條件異方差、制度轉變、重疊回報、估計誤差、數據問題和投資組合變化,均可能影響分數差。共同 elicitability 不會消除這些問題;它是在數學條件下提供有原則的分數類別。
請檢查實際損失是否對應相同投資組合、期限、估值方法和正負號;VaR 和 ES 是否使用相同尾部機率;預測是否在結果前產生;以及分數是否符合本身假設。報告樣本長度、尾部觀察數、分數公式、配對不確定性方法,以及任何分數或模型搜尋。結論只適用於這個設計。
較低的聯合分數,是在特定 proper scoring rule 下相對預測表現較好的證據。它不證明模型涵蓋每個尾部事件、風險估算安全,或未來會與樣本相似。本文提供統計說明,並非投資建議。
常見問題
Q1可以用絕對誤差比較 Expected Shortfall 預測嗎?
不宜把它當成嚴格一致分數的一般替代。ES 單獨在廣泛分佈類別中不可 elicitable;嚴謹的點預測比較通常會將 ES 與 VaR 一起評分,而校準問題則使用專門 ES 回測。
Q2VaR–ES 聯合分數能否說明風險模型已校準?
它按所選聯合分數比較相對表現。校準和模型錯置是不同問題,還需要合適的回測與診斷。
Q3兩個模型的 VaR 例外相同,聯合分數可以不同嗎?
可以。命中指標相同,但 VaR 以上損失幅度或 ES 預測可以不同;實際影響取決於分數。
Q4分數低是否代表模型可以安全使用?
不是。這是在指定假設和分數下的樣本比較。尾部數據不足、制度轉變、模型選擇或數據問題都可能改變結果。本文並非投資建議。
資料來源與延伸閱讀
回報問題
我們會準備一封包含本文連結的電郵。寄出後,Mark 才會收到你的回報
快速檢查
讀完指南後,用 3 道題檢查一下
問題 01
為甚麼 Expected Shortfall 常與 VaR 一起評分?
選擇答案即可查看解釋