VaR 回溯測試:Kupiec 與 Christoffersen 檢驗解說
了解 Kupiec POF 及 Christoffersen 條件涵蓋檢驗如何評估 VaR 例外,並透過 250 日例子理解為何未能拒絕假設並不代表模型準確。
本指南內容VaR 回溯測試會檢查甚麼?
簡短摘要
VaR 回溯測試會將每次預測的虧損門檻,與其後實際錄得的虧損比較。Kupiec 檢驗關心例外次數是否符合目標比率;Christoffersen 檢驗亦會查看例外是獨立出現,還是集中在一段時間內。兩者檢查預測的不同特點,均不能證明風險模型正確。
VaR 回溯測試會檢查甚麼?
Value at Risk(VaR,風險值)是在指定信心水平和期限下的虧損門檻。例如一天期 99% VaR 為 10,000 美元,代表模型根據其資料及假設,估計一天虧損超過 10,000 美元的機率為 1%。這不是虧損上限,也不代表越過門檻後虧損最多會有多少。
回溯測試將一系列預測及結果轉成 VaR 例外指示序列。若一天期 99% VaR 模型校準良好,在反覆觀察相若情況時,長期例外比率應接近 1%。這包含兩個不同要求:長期頻率要接近目標,而例外的先後次序亦不應與模型的條件風險預測矛盾。Kupiec 的失敗比例(POF)檢驗集中於頻率;Christoffersen 的獨立性及條件涵蓋檢驗則會將時序納入分析。
這項分別在實際應用中很重要。一個模型一年可能出現四次例外,而且四次都落在市場波動劇烈的一星期;另一模型同樣有四次,卻分散在全年。只計次數的檢驗會將兩者都視為四次,時序檢驗則會看到不同序列。這些測試有助描述預測的特點,但不能取代對持倉、市場資料、模型假設或虧損嚴重程度的檢視。如想了解 GARCH 模型如何描述波動聚集,可參閱 GARCH 與波動聚集指南;波動模型刻畫波動過程,回溯測試則比較風險預測與實際結果。
計數前先界定例外
整個分析應採用一致的正負號慣例。令 Lₜ 為第 t 日實際錄得的虧損,VaRₜ|ₜ₋₁ 為根據 t 日之前可用資料預測的一天期虧損門檻。當 Lₜ > VaRₜ|ₜ₋₁ 時,例外指示變數 Iₜ = 1,否則為 0。99% VaR 的目標例外機率為 α = 1 − 0.99 = 0.01。有些資料以回報定義指示變數,或定義結果是否仍在涵蓋範圍內;只要正負號和機率配合調整,意思相同。請清楚交代採用哪種定義。
預測及結果必須指向同一投資組合、期限、估值時間及虧損定義。若收市後預測下一個交易日 VaR,便要按預先設定的估值規則,與下一個交易日的虧損比較。應預先決定如何處理剛好等於 VaR、假期、缺漏數據、市場休市、日內資料修訂及投資組合變動。例外甚少時,單一分類差異也足以明顯改變結果。
模型選擇和最終評估亦應分開。若看過用於檢驗的同一段期間後才選擇參數或風險門檻,所得 p 值便不再是乾淨的樣本外檢查。滾動預測要記錄每次預測的產生時間,以及當時可用的資料。多日預測互相重疊,可能令例外指示序列出現依賴。以下標準檢驗不會自動處理期限不一致、前視資料、其後修訂的輸入或模型選擇造成的問題。
Kupiec 的 POF 檢驗在問甚麼?
假設有 T 組可比較的預測與結果,當中出現 x 次例外。觀察例外率為 p̂ = x/T。Kupiec 的失敗比例檢驗(見 Kupiec 1995 年論文)亦稱無條件涵蓋檢驗,會比較兩個二項似然:一個將例外機率固定為目標 α,另一個以 p̂ 自由估計。似然比統計量為:
LRᵤ꜀ = −2 ln [ (1−α)^(T−x) α^x / ((1−p̂)^(T−x) p̂^x) ]
在零假設下,例外指示變數是互相獨立、機率為 α 的 Bernoulli 事件。樣本夠大時,統計量近似服從自由度為 1 的卡方分布。統計量偏大,便是拒絕所指定例外頻率的證據。由於對立模型會自由估計觀察比率,例外過多或過少都可能令檢驗拒絕。幾乎從不超過 VaR 門檻的模型,不一定校準良好;它可能過分保守,未能達到原定用途。
POF 使用 x 這個次數,不會使用例外日期。調換同一批指示變數的先後,統計量仍然不變。因此單看 POF,無法知道四次例外是分散出現,還是連續發生。二項參考分布亦假設例外互相獨立。若要檢查例外有否聚集,應加入專門檢查依賴性的檢驗,而不是從 POF 推斷時序。
250 日例子說明如何理解 p 值
考慮一個假設例子:250 日的一天期 99% VaR 預測。目標機率 α = 0.01,因此零假設下預期例外數為 Tα = 250 × 0.01 = 2.5。假設實際出現四次例外,則 p̂ = 4/250 = 0.016,即 1.6%。這高於 1% 目標,但單憑差距仍未能判斷似然比檢驗會否拒絕。
代入 T = 250、x = 4 及 α = 0.01,得出 LRᵤ꜀ ≈ 0.769。採用漸近卡方(1)參考分布,p ≈ 0.38,而 5% 臨界值約為 3.84。按此近似,例子在 5% 水平下不會拒絕無條件涵蓋。這只是示範計算的假設數字,並非實際市場結果或通用的接納門檻。
兩個對數似然值可顯示統計量的來源。將比率固定在目標時,ℓ₀ = 246 ln(0.99) + 4 ln(0.01) ≈ −20.893。按觀察率自由估計時,ℓ₁ = 246 ln(0.984) + 4 ln(0.016) ≈ −20.508。自由估計的對數似然高約 0.385,因此 LRᵤ꜀ = −2(ℓ₀ − ℓ₁) ≈ 0.769。檢驗衡量目標比率模型的擬合損失,並非以美元計算的誤差。
未能拒絕並不證明模型校準良好。250 日只預期有 2.5 次例外,多一兩次已會明顯改變觀察率。卡方計算屬漸近近似,而此樣本規模下,罕見事件檢驗的功效可能有限。應同時考慮預期次數、預測期限、檢驗設計及樣本量。p 值不是 VaR 模型正確的機率。
相同例外次數可以有不同時序
比較兩個假設的 250 日序列,各有四次例外。A 序列在第 20、80、140、220 日出現;B 序列則在第 60、61、180、181 日出現。兩者都是 x = 4、p̂ = 1.6%,所以 Kupiec 統計量相同。但 B 有兩對連續例外,A 則沒有。
下方示意圖以概念方式說明為何要保留例外次序,而不只是記錄總數。圖示不是 250 日實際數據,也不是檢驗結果。例外連續出現,可能值得檢查模型能否跟上波動變化,但少數幾個觀察不足以找出成因。模型設定、突發市況、投資組合變更、重疊期限,以及資料和計時規則都可能造成這類模式。
令 nᵢⱼ 表示前一日指示變數為 i、當日為 j 的轉移次數;0 代表沒有例外,1 代表有例外。撇除序列邊界,完整的轉移次數為:A 有 n₀₀ = 241、n₀₁ = 4、n₁₀ = 4、n₁₁ = 0;B 有 n₀₀ = 243、n₀₁ = 2、n₁₀ = 2、n₁₁ = 2。兩者各有四次,但 B 有兩次例外緊接前一日的例外。這就是一階獨立性檢驗使用的時序資料。
前一日沒有例外後的估計機率為 n₀₁/(n₀₀+n₀₁);前一日有例外後則為 n₁₁/(n₁₀+n₁₁)。A 分別為 4/245 ≈ 1.63% 及 0/4;B 則為 2/245 ≈ 0.82% 及 2/4 = 50%。B 的 50% 只來自例外後四次轉移中的兩次,是這個極小假設序列的特徵,並非對實際模型翌日風險的可靠估計。

Christoffersen 獨立性檢驗有何補充?
Christoffersen 的 1998 年論文 所述獨立性檢驗比較平靜日之後和例外日之後的例外機率。令 π₀ = Pr(Iₜ = 1 | Iₜ₋₁ = 0),π₁ = Pr(Iₜ = 1 | Iₜ₋₁ = 1)。獨立性零假設為 π₀ = π₁,即昨日有否例外不會改變今日的例外機率。對立模型會按 n₀₀、n₀₁、n₁₀、n₁₁ 分別估計兩種轉移機率。
獨立性似然比統計量比較這兩個模型,通常以自由度為 1 的卡方分布評估。與 POF 不同,它取決於指示變數的先後次序。若例外之後常有另一例外,π₁ 可能高於 π₀。這個檢驗針對二元序列的一階依賴,並不涵蓋過往資料、波動或投資組合狀態預測未來虧損的所有方式。
例外次數少時,轉移機率尤其不穩定。若沒有連續例外,π₁ 的估計可能落在零的邊界,但這不代表第二次例外不可能,只表示樣本沒有出現。應連同統計量查看轉移次數及樣本量,不要把稀疏的表格當作翌日尾部風險的精確估計。
條件涵蓋結合頻率和獨立性
條件涵蓋檢驗將 Kupiec 頻率統計量與 Christoffersen 獨立性統計量相加:LR꜀꜀ = LRᵤ꜀ + LRᵢₙd。聯合零假設要求例外機率等於 α,且例外在時間上互相獨立。在標準大樣本設定下,總和會與自由度為 2 的卡方分布比較。
除整體檢驗外,亦應報告各個組成結果。拒絕條件涵蓋代表在檢驗假設下,兩項要求與觀察序列不相符,但不會指出原因。若 POF 被拒絕而獨立性未被拒絕,例外次數可能是較清晰的訊號。若獨立性被拒絕,即使總數接近目標,也應留意例外的時序。若兩者均未被拒絕,樣本仍可能太短,未能發現模型問題。
檢驗的解讀範圍有限。它將每日虧損壓縮成 0/1 指示,無法分辨超過 VaR 一美元與一百萬美元;亦不能驗證整個虧損分布,或證明 Expected Shortfall 正確。VaR 與 Expected Shortfall 回答不同尾部風險問題,可參閱 VaR 與 Expected Shortfall 比較。
例外稀少令短樣本推斷更困難
99% VaR 的 250 日樣本只預期 2.5 次例外。假設 1% 例外互相獨立,在 249 對相鄰日之間,預期「例外接例外」的轉移數約為 249 × 0.01² = 0.025。即使模型校準良好,大部分這類樣本也不會出現連續例外。事件稀少令轉移機率難以準確估計,也可能令依賴性檢驗功效偏低。
Christoffersen 和 Pelletier 2004 年的研究 指出,現有 VaR 回溯檢驗在實際的小樣本中可能功效有限,並研究以例外間隔時間建模的 duration 檢驗。這些結果支持考慮額外診斷,但不代表 duration 檢驗在所有情況都較優,也不代表毋須按風險預測和樣本設計選擇檢驗。觀察數量少時,應明言限制,不要將未能拒絕當成模型可靠的證明。
目標尾部率亦會影響證據量。95% VaR 在 250 日預期有 12.5 次例外;99.9% VaR 則只有 0.25 次。檢驗名稱相同,不代表不同設計下的證據可以直接比較。請報告信心水平、預測期限、觀察數目、目標及實際次數、轉移次數,以及採用漸近計算還是有限樣本方法。
何時應採用其他診斷?
選擇下一個診斷時,先問兩項基本檢驗捨棄了哪些資料。若要測試例外能否由滯後例外、VaR 預測或預測當時已知的其他變數預測,Engle 和 Manganelli 的 CAViaR 論文提出的動態分位數(DQ)檢驗會檢驗中心化例外指示變數及所選工具變數的限制。結論取決於變數選擇及其可用時間;DQ 不是檢驗所有條件失效的通用方法。duration 檢驗則分析例外之間的等待時間,補充的是另一種資料。
若關注超過 VaR 門檻後的虧損幅度,只看頻率和獨立性並不足夠。應檢查超額虧損大小,並選用符合預測及假設的 Expected Shortfall 評估方法。若問題是試過多個模型後挑選歷史表現最佳者,VaR 回溯測試無法處理策略選擇問題;PBO 與 CSCV介紹另一種以候選模型排名為基礎的診斷。
有用的報告應列出投資組合及虧損慣例、預測期限、信心水平、評估日期、預測產生方式、例外定義、預期及實際次數、POF 統計量、轉移次數、獨立性與條件涵蓋結果,並交代短樣本或期限重疊等限制。按時間繪出預測門檻和實際虧損;選擇模型時應保留其後的評估資料,不讓它參與選擇。這些做法有助解讀歷史證據,但不能保證未來風險受控。
常見問題
Q1Kupiec 檢驗未能拒絕,是否代表 VaR 模型準確?
不是。這表示在檢驗假設下,沒有足夠證據反對指定的例外率。短樣本尤其在 99% 或更高信心水平下,可能例外太少,未能顯示模型問題。
Q2兩個 Kupiec 檢驗結果相同的模型,例外模式可以不同嗎?
可以。Kupiec 統計量取決於次數而非次序。Christoffersen 獨立性檢驗會補充例外有否在相鄰觀察中聚集的資料。
Q3這些檢驗會否告訴我超過 VaR 後虧損有多大?
不會。它們只用是否超越門檻的指示,沒有量度超額虧損大小。若尾部虧損嚴重程度很重要,應另行分析超額虧損並評估 Expected Shortfall。
資料來源與延伸閱讀
回報問題
我們會準備一封包含本文連結的電郵。寄出後,Mark 才會收到你的回報
快速檢查
讀完指南後,用 3 道題檢查一下
問題 01
Kupiec 的 POF 檢驗使用哪項特點?
選擇答案即可查看解釋