Skip to content
所有選擇權指南
檢查 VaR 例外發生頻率與時間順序閱讀約12分鐘

VaR 回溯測試:Kupiec 與 Christoffersen 檢定解析

了解 Kupiec POF 與 Christoffersen 條件涵蓋檢定如何評估 VaR 例外,並透過 250 天範例理解為何未拒絕假設不代表模型準確。

本指南內容VaR 回溯測試檢查什麼?

簡短摘要

VaR 回溯測試會將每次預測的損失門檻,與之後實際發生的損失進行比較。Kupiec 檢定關注例外次數是否符合目標比率;Christoffersen 檢定還會檢查例外是獨立發生,還是呈現群聚。兩者檢查預測的不同特性,沒有任何一種檢定能證明風險模型正確。

VaR 回溯測試檢查什麼?

Value at Risk(VaR,風險值)是在指定信賴水準和期間下的損失門檻。若一天期 99% VaR 為 10,000 美元,模型根據所用資訊與假設,估計一天損失超過 10,000 美元的機率為 1%。這不是最大損失上限,也不代表超過門檻後可能損失多少。

回溯測試將預測與結果轉換成一串 VaR 例外指標。若一天期 99% 模型校準良好,在重複觀察相似情境時,長期例外頻率應接近 1%。這裡有兩個不同要求:長期頻率應接近目標,例外的時間順序也不應與模型的條件風險預測矛盾。Kupiec 的失敗比例(POF)檢定著重第一項;Christoffersen 的獨立性與條件涵蓋檢定也會分析例外的順序。

這項差異有實務意義。某模型一年可能有四次例外,而且全都發生在市場波動劇烈的一週;另一模型也有四次,卻分散在全年。只看次數的檢定會把兩者都視為四次,但考慮時間順序的檢定會看到不同序列。以下方法可描述這些特性,不能取代對持倉、市場資料、假設或損失嚴重程度的檢視。若想了解 GARCH 模型如何描述波動群聚,可參考 GARCH 與波動群聚指南;波動模型刻畫波動過程,回溯測試則比較風險預測與實際結果。

計數前先定義例外

在整個分析中使用一致的正負號慣例。令 Lₜ 為第 t 天實際發生的損失,VaRₜ|ₜ₋₁ 為根據 t 天之前可用資訊預測的一天期損失門檻。若 Lₜ > VaRₜ|ₜ₋₁,例外指標 Iₜ = 1,否則為 0。若模型為 99% VaR,目標例外機率 α = 1 − 0.99 = 0.01。有些資料會依報酬定義指標,或定義結果是否落在涵蓋區間內;只要相應調整符號與機率,意義相同。請清楚說明採用的定義。

預測與結果必須對應同一投資組合、期間、估值時間及損失定義。若收盤後產生隔日 VaR 預測,應依照預先決定的估值規則,與隔日的損失比較。預先決定如何處理恰好等於 VaR、假日、缺漏資料、市場休市、盤中資料修正及投資組合變動。例外很少時,單次分類差異就可能大幅影響結果。

將模型選擇與最後評估分開。若在查看用於檢定的同一段期間後才選擇參數或風險門檻,p 值便不再代表乾淨的樣本外檢查。對滾動預測,記錄每次預測的產生時間及當時可用資訊。重疊的多日期限預測可能使例外序列產生相依性。以下標準檢定不會自動修正期間不一致、前視偏誤、修訂後的輸入資料或模型選擇流程。

Kupiec 的 POF 檢定問什麼?

假設有 T 組可比較的預測與結果,其中出現 x 次例外。觀察例外率 p̂ = x/T。Kupiec 的失敗比例(POF)檢定(參見 Kupiec 1995 年論文)也稱無條件涵蓋檢定,比較兩個二項概似函數:一個將例外機率固定在目標值 α,另一個自由估計為觀察到的 p̂。概似比統計量為:

LRᵤ꜀ = −2 ln [ (1−α)^(T−x) α^x / ((1−p̂)^(T−x) p̂^x) ]

在虛無假設下,例外指標是機率為 α 且彼此獨立的 Bernoulli 事件。樣本夠大時,統計量近似服從自由度 1 的卡方分布。統計量偏大,代表有理由拒絕指定的例外頻率。由於對立模型會自由估計觀察比率,例外太多或太少都可能讓檢定拒絕。幾乎從未超過 VaR 門檻的模型不一定校準良好;它可能過度保守,不適合原本的用途。

POF 使用例外次數 x,不使用發生日期。重新排列相同指標不會改變統計量。因此,單看 POF 無法判斷四次例外是分散出現,還是連續發生。二項分布的參考結果也假設例外彼此獨立。如果要檢查例外是否群聚,應加入針對相依性的檢定,而不是從 POF 推論時間型態。

250 天範例說明 p 值需要什麼背景

考慮一個假設情境:250 天的一天期 99% VaR 預測。目標機率 α = 0.01,因此虛無假設下預期例外數為 Tα = 250 × 0.01 = 2.5。假設觀察到四次例外,則 p̂ = 4/250 = 0.016,也就是 1.6%。這高於 1% 目標,但單看差距仍無法判斷概似比檢定會不會拒絕。

代入 T = 250、x = 4、α = 0.01,得到 LRᵤ꜀ ≈ 0.769。使用漸近卡方(1)參考分布時,p ≈ 0.38;5% 臨界值約為 3.84。依此近似,範例在 5% 顯著水準下不會拒絕無條件涵蓋假設。這些是假設數字,用來說明計算方式,不是實證結果或通用的模型驗收門檻。

兩個對數概似值顯示統計量的來源。將機率固定在目標值時,ℓ₀ = 246 ln(0.99) + 4 ln(0.01) ≈ −20.893。根據觀察率自由估計時,ℓ₁ = 246 ln(0.984) + 4 ln(0.016) ≈ −20.508。自由估計的概似值高約 0.385 個對數概似單位,因此 LRᵤ꜀ = −2(ℓ₀ − ℓ₁) ≈ 0.769。檢定衡量目標比率模型的適配損失,不是以美元計算的差距。

未拒絕不代表模型校準良好。250 天只有 2.5 次預期例外,多一、兩次就會明顯改變觀察率。卡方計算屬於漸近近似,而在這種樣本規模下,罕見事件檢定的檢定力可能有限。請搭配預期次數、預測期間、檢定設計及樣本數一起解讀統計量。p 值不是 VaR 模型正確的機率。

例外次數相同,時間順序仍可能不同

比較兩個假設的 250 天序列,各有四次例外。A 序列的例外發生在第 20、80、140、220 天;B 序列發生在第 60、61、180、181 天。兩者都是 x = 4、p̂ = 1.6%,所以 Kupiec 統計量相同。但 B 有兩組相鄰例外,A 則沒有。

下方示意圖概念性地說明為何應保留例外順序,而不只記錄總次數。這不是 250 天的實際資料,也不是檢定結果。連續例外可能值得檢查模型是否跟上波動變化,但少數幾個資料點不足以判定原因。模型設定錯誤、市場衝擊、投資組合變化、重疊期間,以及資料或時間規則都可能造成這種型態。

令 nᵢⱼ 表示前一日指標為 i、當日為 j 的轉移次數;0 表示沒有例外,1 表示有例外。排除序列邊界後,完整的轉移次數為:A 有 n₀₀ = 241、n₀₁ = 4、n₁₀ = 4、n₁₁ = 0;B 有 n₀₀ = 243、n₀₁ = 2、n₁₀ = 2、n₁₁ = 2。兩者都有四次,但 B 有兩次例外緊接前一天的例外。這就是一階獨立性檢定會利用的資訊。

前一日沒有例外時,隔日例外機率估計為 n₀₁/(n₀₀+n₀₁);前一日有例外時則為 n₁₁/(n₁₀+n₁₁)。A 分別是 4/245 ≈ 1.63% 和 0/4;B 則是 2/245 ≈ 0.82% 和 2/4 = 50%。B 的 50% 僅來自例外後四次轉移中的兩次,是這個極小假設序列的特徵,並不是實際模型隔日風險的可靠估計。

無文字概念圖比較兩條長度相同、例外次數相同的 VaR 例外序列:一條分散出現,另一條聚集成相鄰的例外配對。
相同的例外次數可能有不同的時間分布。本示意圖僅呈現群聚情形,不是市場資料或檢定結果。

Christoffersen 獨立性檢定多檢查什麼?

Christoffersen 的 1998 年論文 所述獨立性檢定比較平靜日之後與例外日之後的例外機率。令 π₀ = Pr(Iₜ = 1 | Iₜ₋₁ = 0),π₁ = Pr(Iₜ = 1 | Iₜ₋₁ = 1)。獨立性虛無假設為 π₀ = π₁:前一天的例外狀態不會改變今天的例外機率。對立模型則依 n₀₀、n₀₁、n₁₀、n₁₁ 分別估計兩個轉移機率。

獨立性概似比統計量會比較兩個模型,通常以自由度 1 的卡方分布評估。與 POF 不同,它取決於指標順序。若例外經常接著另一個例外發生,π₁ 可能高於 π₀。此檢定針對二元例外序列的一階相依性,不會檢查過去資訊、波動或投資組合狀態預測未來損失的所有方式。

例外很少時,轉移估計特別不穩定。如果沒有連續例外,π₁ 的估計可能落在零的邊界,但這不表示第二次例外不可能,只代表樣本沒有觀察到。請連同統計量檢查轉移次數與樣本數,不要把稀疏的列聯表解讀為精確的隔日尾部風險估計。

條件涵蓋結合頻率與獨立性

條件涵蓋檢定將 Kupiec 頻率統計量與 Christoffersen 獨立性統計量相加:LR꜀꜀ = LRᵤ꜀ + LRᵢₙd。聯合虛無假設要求例外機率等於 α,且例外在時間上彼此獨立。在標準大樣本設定下,總和會與自由度 2 的卡方分布比較。

除了聯合結果,也要分別報告組成檢定。拒絕條件涵蓋代表在檢定假設下,兩項要求與觀察序列不一致,但不能指出原因。如果 POF 被拒絕而獨立性未被拒絕,次數可能是較明確的訊號。若獨立性被拒絕,即使總次數接近目標,也應留意例外時序。如果兩者都未被拒絕,樣本仍可能太短,無法顯示模型設定錯誤。

這些檢定的解讀範圍有限:它們將每天的損失縮成 0/1 指標,因此無法區分超過 VaR 一美元和一百萬美元;也不能驗證完整的損失分布,或證明 Expected Shortfall 正確。關於 VaR 與 Expected Shortfall 回答不同尾部風險問題的說明,請參考 VaR 與 Expected Shortfall 比較。

例外稀少使短樣本推論更加困難

99% VaR 在 250 天樣本中僅預期 2.5 次例外。若 1% 例外彼此獨立,在 249 組相鄰日中,預期的「例外接續例外」轉移次數約為 249 × 0.01² = 0.025。即使模型校準良好,大多數這類樣本也不會出現連續例外。事件稀少,代表轉移機率難以精確估計,依賴性檢定的檢定力也可能不足。

Christoffersen 和 Pelletier 2004 年的研究 指出,現有 VaR 回溯檢定在實際的小樣本中可能檢定力偏低,並研究以例外間隔時間建模的 duration 檢定。這些結果提供考慮其他診斷的理由,但不表示 duration 檢定在所有情況都更好,也不代表可以不依風險預測和樣本設計選擇方法。觀察值少時,應清楚說明限制,而不是把未拒絕當成模型健康證明。

目標尾端比率也會影響證據量。95% VaR 在 250 天預期有 12.5 次例外;99.9% VaR 則只有 0.25 次。檢定名稱相同,不代表不同設計的證據可以直接比較。請報告信賴水準、預測期間、觀察數、目標與實際例外數、轉移次數,以及使用漸近計算或有限樣本方法。

何時該使用其他診斷方法?

挑選下一種診斷時,先問前兩項檢定忽略了哪些資訊。若要檢查例外是否能由落後例外、VaR 預測值或預測當時已知的其他變數預測,Engle 和 Manganelli 的 CAViaR 論文提出的動態分位數(DQ)檢定會檢定中心化例外指標與所選工具變數的限制。結果取決於工具變數的選擇和可用時間;它不是檢查所有條件式失效的通用檢定。duration 檢定則分析例外之間的等待時間,處理的是另一種資訊。

若關心超過 VaR 門檻後的損失嚴重程度,只看頻率與獨立性還不夠。請檢視超額損失大小,並選擇符合預測及假設的 Expected Shortfall 評估方式。若擔心試過多種模型後只挑歷史表現最好者,VaR 回溯測試無法解決策略選擇問題;PBO 與 CSCV介紹另一種根據候選模型排名的診斷。

實用報告應列出投資組合與損失慣例、預測期間、信賴水準、評估日期、預測產生方式、例外定義、預期及實際次數、POF 統計量、轉移次數、獨立性及條件涵蓋結果,以及短樣本或期間重疊等限制。將預測門檻與實際損失依時間畫出,並在選擇模型時保留後續評估資料。這些做法讓歷史證據更容易解讀,但不保證未來風險能受到控制。

常見問題

Q1Kupiec 檢定未拒絕假設,是否代表我的 VaR 模型準確?

不是。這表示在檢定假設下,沒有足夠證據反對指定的例外率。短樣本尤其在 99% 或更高信賴水準下,可能例外太少,無法顯示問題。

Q2兩個 Kupiec 檢定結果相同的模型,例外模式會不同嗎?

會。Kupiec 統計量只取決於次數,不取決於順序。Christoffersen 獨立性檢定會補充例外是否集中在相鄰觀察值的資訊。

Q3這些檢定能告訴我超過 VaR 後的損失有多大嗎?

不能。它們只使用是否超過門檻的指標,不會測量超額損失大小。若尾端損失嚴重程度很重要,應另外檢查超額損失並評估 Expected Shortfall。

資料來源與延伸閱讀

回報問題

我們會準備一封包含本文連結的電子郵件。寄出後,Mark 才會收到你的回報

快速檢查

讀完指南後,用 3 道題檢查一下

問題 1 / 3

問題 01

Kupiec 的 POF 檢定使用哪項特性?

選擇答案即可查看解釋

期權術語表