VaRバックテスト:Kupiec検定とChristoffersen検定を解説
KupiecのPOF検定とChristoffersenの条件付きカバレッジ検定がVaR例外をどう評価するか、250日例と非棄却が正確さの証明ではない理由を解説します。
このガイドの内容VaRバックテストでは何を確認するのか
短い要約
VaRバックテストは、予測した損失しきい値と、その後に実現した損失を比べます。Kupiec検定は例外の件数が目標比率と整合するかを調べます。Christoffersen検定は、例外が独立して起きるか、集中して起きるかも検証します。両者は異なる特徴を調べるもので、リスクモデルの正しさを証明するものではありません。
VaRバックテストでは何を確認するのか
Value at Risk(VaR)は、信頼水準と期間に対応する損失のしきい値です。1日99% VaRが1万ドルなら、モデルの情報と仮定の下で、1日の損失が1万ドルを超える確率を1%と評価しています。VaRは損失の上限ではなく、しきい値を超えた後に損失がどこまで大きくなるかも示しません。
バックテストでは、予測と実現値を例外の有無に変換します。日次99% VaRが適切に較正されていれば、同じような観測を繰り返したとき、例外はおよそ1%の頻度で起きるはずです。この主張には二つの面があります。長期的な発生頻度が目標に近いこと、そして例外がモデルの条件付きリスク予測に反するパターンで現れないことです。Kupiecのproportion-of-failures(POF)検定は前者を調べます。Christoffersenの独立性検定と条件付きカバレッジ検定は発生順序も扱います。
この違いは実務上も重要です。あるモデルで1年間に4回の例外があっても、それらすべてが荒れた1週間に集中することがあります。別のモデルでは同じ4回が年間に分散するかもしれません。件数だけを見る検定はどちらも4回と数えますが、時点を見る検定は異なる系列として扱います。以下の検定はその特徴を説明する助けになりますが、ポジション、市場データ、仮定、損失の大きさを個別に確認する代わりにはなりません。GARCHとボラティリティ・クラスタリングのガイドではGARCHモデルによるクラスタリングの表現を説明します。分散モデルとバックテストは異なる問いに答えます。
数える前に例外を定義する
符号の規則を一つに決めて一貫して使います。Lₜをt日の実現損失、VaRₜ|ₜ₋₁をt日前に得られた情報で予測した1日の損失しきい値とします。Lₜ > VaRₜ|ₜ₋₁なら例外指標Iₜ = 1、そうでなければIₜ = 0と定義します。99% VaRモデルの目標例外確率はα = 1 − 0.99 = 0.01です。収益率や予測区間への包含を使う資料もありますが、符号と確率を正しく対応させれば同じ考え方です。どの定義を使うか明記してください。
予測と実現値は、同じポートフォリオ、期間、評価時点、損失の定義にそろえます。取引終了後に翌営業日の予測を作るなら、事前に決めた評価規則で翌日の損失と比較します。VaRと等しい値の扱い、休日、欠測値、市場休場、日中の訂正、ポートフォリオ変更をどう扱うかは事前に決めてください。例外が少ないと、こうした選択がヒット系列を変えやすくなります。
モデルの推定と最終評価を分けます。検定に使う期間を見てからパラメータやリスクしきい値を選び直した場合、そのp値は独立したアウト・オブ・サンプル評価を表しません。ローリング予測なら、各予測を作った時点とその時点で使えた情報を記録します。複数日の予測期間が重なると、例外指標に依存が生じることがあります。以下の標準検定は、期間の不一致、未来情報の混入、改訂後の入力、モデル選択を自動的に修正するものではありません。
KupiecのPOF検定は何を問うのか
比較可能な予測と実現値の組がT件あり、例外がx件だったとします。観測された例外率はp̂ = x/Tです。Kupiecのproportion-of-failures(POF)検定は無条件カバレッジ検定とも呼ばれ、1995年の論文で提示されました。Federal Reserveのアーカイブ記録もあります。この検定は二つの二項尤度を比較します。一方は例外確率を目標αに固定し、もう一方はp̂として自由に推定します。尤度比統計量は次の通りです。
LRᵤ꜀ = −2 ln [ (1−α)^(T−x) α^x / ((1−p̂)^(T−x) p̂^x) ].
帰無仮説の下では、例外は確率αの独立なベルヌーイ事象です。十分な標本では、統計量は自由度1のカイ二乗分布に漸近的に従います。値が大きければ、指定した例外頻度を棄却します。対立モデルは観測率を自由に推定するため、例外が多すぎる場合だけでなく少なすぎる場合にも棄却されます。VaRをほとんど超えないモデルでも、自動的に較正済みとは言えません。意図した用途には保守的すぎる可能性があります。
POF検定に使うのは件数xであり、例外が起きた日付ではありません。同じ指標の順序を入れ替えても統計量は変わりません。したがって4回の例外が散らばっていたか連続していたかは分かりません。また、基準となるベルヌーイ尤度は例外指標の独立性を仮定します。集中して起きているかを知りたい場合は、POFの結果だけから読み取らず、依存性を検定する方法を加えます。
250日の例でp値に文脈が必要な理由を見る
99%の日次VaR予測250件からなる仮想系列を考えます。目標率はα = 0.01なので、帰無仮説の下で期待される例外数はTα = 250 × 0.01 = 2.5です。例外が4回あったとすると、観測率はp̂ = 4/250 = 0.016、つまり1.6%です。目標の1%より高いものの、この差だけで尤度比検定が棄却されるかは決まりません。
T = 250、x = 4、α = 0.01を代入するとLRᵤ꜀ ≈ 0.769です。漸近カイ二乗(1)を使うとp ≈ 0.38、5%臨界値は約3.84です。この近似の下では、例は5%水準で無条件カバレッジを棄却しません。この計算は仮想例であり、実証結果でも推奨される合格基準でもありません。
二つの対数尤度から統計量の由来が分かります。目標率を固定した場合、ℓ₀ = 246 ln(0.99) + 4 ln(0.01) ≈ −20.893です。観測率を自由にした場合はℓ₁ = 246 ln(0.984) + 4 ln(0.016) ≈ −20.508です。自由に当てはめた方が対数尤度で約0.385高いため、LRᵤ꜀ = −2(ℓ₀ − ℓ₁) ≈ 0.769です。これは目標率のモデルに比べた当てはまりの低下を測るもので、ドル単位の誤差ではありません。
棄却されなかったからといって、モデルの較正が確認されたわけではありません。期待される例外は2.5回だけなので、1、2回の違いでも観測率が大きく変わります。カイ二乗の基準は漸近近似であり、これほどの標本では稀な事象の検定力が低いことがあります。統計量は期待件数、予測期間、検定設計、標本数とともに読みます。p値はVaRモデルが正しい確率ではありません。
例外の件数が同じでも発生時点は異なる
250日間に例外が4回ずつある、二つの仮想系列を比べます。系列Aでは20、80、140、220日目に発生します。系列Bでは60、61、180、181日目です。どちらもx = 4、p̂ = 1.6%なので、Kupiec統計量は同じです。ただしBには連続日の例外が2組あり、Aにはありません。
下の図は、合計だけでなくヒット系列の順序を保存する意味を示す概念図です。250日分の実データでも検定結果でもありません。連続した例外は、ボラティリティの変化にモデルが対応できていない可能性を示すことがありますが、数点だけでは原因を特定できません。誤ったモデル仕様、市場ショック、ポートフォリオ変更、重複する予測期間、データや時点の規則もパターンに影響します。
前の指標がi、現在の指標がjとなる遷移数をnᵢⱼとします。0は例外なし、1は例外です。標本境界を除くと、系列Aはn₀₁ = 4、n₁₁ = 0、系列Bはn₀₁ = 2、n₁₁ = 2です。どちらも例外は4回ですが、Bでは一部の例外が前日の例外に続いています。1次の独立性検定が使うのはこの順序情報です。
遷移表全体はAでn₀₀ = 241、n₀₁ = 4、n₁₀ = 4、n₁₁ = 0、Bでは順に243、2、2、2です。前日に例外がなかった場合の当てはめられたヒット確率はn₀₁/(n₀₀+n₀₁)、例外があった場合はn₁₁/(n₁₀+n₁₁)です。Aではそれぞれ4/245 ≈ 1.63%と0/4 = 0%、Bでは2/245 ≈ 0.82%と2/4 = 50%になります。Bの50%は、例外後の遷移が4件しかない仮想系列の比率です。実際のモデルが翌日に持つリスクを信頼できる精度で推定した値ではありません。

Christoffersenの独立性検定は何を加えるのか
Christoffersenが1998年の論文で展開した独立性検定は、前日に例外があったかどうかで今日の例外確率が変わるかを調べます。π₀ = Pr(Iₜ = 1 | Iₜ₋₁ = 0)、π₁ = Pr(Iₜ = 1 | Iₜ₋₁ = 1)とします。独立性の帰無仮説はπ₀ = π₁です。対立仮説では、n₀₀、n₀₁、n₁₀、n₁₁から二つの遷移確率を別々に推定します。
尤度比統計量で二つのモデルを比べ、通常は自由度1のカイ二乗分布による漸近近似で評価します。POFと違い、指標の並び方を使います。例外のあとに例外が続きやすければπ₁がπ₀を上回る可能性があります。この検定が対象とするのは二値系列の1次依存性です。過去の情報、ボラティリティ、ポートフォリオ状態が将来損失を予測するあらゆる形を調べるものではありません。
例外が少ないと遷移確率は特に不安定になります。連続したヒットがない系列ではπ₁の推定値が0の境界に達することがありますが、二度目の例外が起きないことを意味するわけではありません。この標本で起きなかったというだけです。統計量とともに遷移数や標本数を確認してください。疎な遷移表を、翌日のテールリスクの精密な推定値のように解釈しないでください。
条件付きカバレッジは頻度と独立性を組み合わせる
条件付きカバレッジ検定は、Kupiecの頻度統計量とChristoffersenの独立性統計量を足します。LR꜀꜀ = LRᵤ꜀ + LRᵢₙdです。結合帰無仮説では例外確率がαであり、例外は時間を通じて独立です。標準的な大標本の設定では、その和を自由度2のカイ二乗分布と比べます。
結合検定だけでなく各構成検定の結果も報告します。条件付きカバレッジの棄却は、検定の仮定の下で二つの条件を同時に満たさないことを意味しますが、原因は特定しません。POFが棄却され独立性は棄却されないなら、総件数がより明確なシグナルかもしれません。独立性検定が棄却されたなら、総数が目標に近くても発生時点を確認します。どちらも棄却されない場合でも、誤りを見つけるには標本が短すぎる可能性があります。
解釈できる範囲は限られます。各日の損失を二値に圧縮するため、VaRを1ドル超えた損失と100万ドル超えた損失を区別しません。残りの損失分布を検証したり、Expected Shortfallが正しいと示したりするものでもありません。テールリスクについてVaRとExpected Shortfallが答える問いの違いは、VaRとExpected Shortfallの比較を参照してください。
例外が少ないと短い標本での推論が難しい
99% VaRでは、250日で期待される例外は2.5回だけです。独立した1%のヒットを仮定すると、隣接する249組におけるヒット後のヒットの期待回数は約249 × 0.01² = 0.025です。モデルが適切に較正されていても、このような標本の大半では連続ヒットが一度も起こりません。観測の少なさにより遷移確率を精密に推定しにくく、依存性検定の検定力も限られます。
ChristoffersenとPelletierは2004年の論文で、現実的な小標本では既存のVaRバックテストの検定力が比較的低いことを報告し、例外の間の日数をモデル化する期間ベースの検定を検討しました。この結果は追加診断を検討する理由になりますが、期間検定が常に優れていることや、リスク予測と標本設計に合わせる必要がなくなることを意味しません。観測数が少ない場合は、非棄却をお墨付きとして扱わず、その制約を明記します。
目標とするテール確率も重要です。95% VaRなら250日で12.5回、99.9% VaRなら0.25回の例外が期待されます。同じ検定名でも設計ごとの証拠が同等とは限りません。信頼水準、予測期間、観測数、目標と実績の件数、遷移数、漸近基準か有限標本法かを示します。
別の診断を使うのはどんなときか
二つの検定が捨てた情報から次の診断を選びます。遅れたヒット、VaR予測値、予測時点で既知のほかの変数から例外を予測できるか調べるなら、EngleとManganelliのCAViaR論文にあるdynamic quantile(DQ)検定は中心化した例外指標と選択した操作変数に関する制約を検定します。結論は操作変数と利用可能だった時点に依存し、考えられるすべての条件付き誤指定を検定するものではありません。期間ベースの検定は例外間の待ち時間を調べ、別の情報を分析に加えます。
VaRを超えた後の損失の大きさが問題なら、頻度と独立性だけでは不十分です。超過損失の規模を見て、予測と仮定に合ったExpected Shortfall評価法を選びます。複数モデルを試した後で最良の結果を選ぶ問題はVaRバックテストでは解決しません。別の順位ベース診断であるPBOとCSCVを参照してください。
有用な報告には、ポートフォリオと損失の規則、予測期間、信頼水準、評価日、予測の生成方法、例外の定義、期待・実績件数、POF統計量、遷移数、独立性・条件付きカバレッジ検定の結果、標本数や重複期間による制約を記載します。予測しきい値と実現損失の図を添え、モデルを選ぶ間は後の評価データを開かないようにします。こうした手順は過去の証拠を解釈しやすくしますが、バックテストの合格が将来のリスク管理を保証するわけではありません。
よくある質問
Q1Kupiec検定で棄却されなければVaRモデルは正確ですか?
いいえ。検定の仮定の下で、指定した例外率に反する十分な証拠が見つからなかったという意味です。特に信頼水準99%以上の短い標本では、問題を示す例外が少なすぎる場合があります。
Q2同じKupiec検定に合格した二つのモデルでも、例外パターンは異なりますか?
はい。Kupiec統計量は件数に依存し、順序は使いません。Christoffersenの独立性検定は、例外が連続する観測に集中するかという情報を加えます。
Q3VaR超過後に損失がどれほど大きくなるか分かりますか?
分かりません。これらの検定は超過の大きさを測らず、違反の有無だけを使います。VaR境界を超えた後の損失規模が重要なら、テール損失を確認しExpected Shortfallを別途評価します。
出典
問題を報告
この記事のリンクを含むメールを準備します。送信すると Mark に報告が届きます
クイックチェック
記事を読み終えたら、3問で確認しましょう
問題 01
KupiecのPOF検定はどの特徴を使いますか?
答えを選ぶと解説を確認できます