VaRとESの共同スコアリング:Fissler–Ziegelによる予測評価
Value at RiskとExpected Shortfallに共同スコアが必要な理由、Fissler–Ziegelスコアによる予測比較、VaR例外検定との違いを解説します。
このガイドの内容予測ペアとテールの定義を確認する
短い要約
VaRは分位点であり、分位点損失で単独評価できます。一方、Expected Shortfall(ES)は幅広い分布クラスで独立した点予測としてelicitableではありません。FisslerとZiegelは、適切な条件のもとでVaRとESを厳密整合的な共同スコアにより評価できることを示しました。これにより予測ペアを比較できますが、スコアが低いからといってリスクモデルの正しさが証明されるわけではありません。
予測ペアとテールの定義を確認する
L_tを損失(値が大きいほど悪い)、cを97.5%などの信頼水準とします。条件付き損失分位点v(c,t)は、F(L_t ≤ x | t−1までの情報)がcに達する最小のxです。損失を正とする上側テールでは、テール平均が有限ならES e(c,t)は、v(u,t)をcから1まで積分した値の1/(1−c)倍です。連続分布ではVaR閾値を超える損失の平均に一致します。閾値に確率質量がある場合、分位点積分の定義は必要な割合の質量を扱います。
スコアには予測と同じ符号規約を使います。収益率の下側テールでVaRとESを定義し、負の値を用いてテール確率をα = 1−cと書く論文もあります。損失を正とする規約では同じリスクは上側テールにあり、ESはVaR以上です。規約を混在させると不等号や例外指標が逆転します。符号、信頼水準、期間、結果判明前に利用可能だった情報を記録してください。
VaRとESの単独スコアが異なる理由
分位点にはよく知られた厳密整合的なpinballスコアがあります。損失Lとc分位点vに対するVaRスコアの一例はS_VaR(v,L) = (I{L ≤ v}−c)(v−L)です。通常の分位点条件のもとでは期待値が目標分位点で最小となるため、VaRは単独で評価できます。
リスク管理で使われる幅広い損失分布クラスでは、ESだけをelicitableにする同等の厳密整合的スコアはありません。これは、期待スコアがESを一意に選ぶ独立した点予測についての主張です。ESが無意味、検定不能、またはより大きな予測の一部として比較できないという意味ではありません。
FisslerとZiegelが示した重要な違いは、ES単独はこの意味でelicitableでない一方、適切な正則性とモーメント条件のもとでは(VaR, ES)のペアが共同でelicitableになることです。2016年の論文は厳密整合的スコアの幅広いクラスに必要十分条件を示します (Fissler and Ziegel, 2016)。共同elicitableとは、一つのスコア関数が両方の予測と実現値を入力として取ることです。任意の二つの損失を足しても、有効なESスコアにはなりません。
Fissler–Ziegelスコアが評価するもの
信頼水準cで許容される共同スコアをS_c(v,e;L)と書きます。厳密整合性とは、対象分布での期待スコアが正しいペアで最小になることです:(VaR_c, ES_c) = arg min over (v,e) of E[S_c(v,e;L)]。該当条件では最小値は一意です。スコアはVaR境界を超えたかという情報を、実現したテール損失とES予測に結び付けます。損失を正とする上側テールではESをVaR未満にしないようにします。
Fissler–Ziegelは単一の必須公式ではなくスコアのクラスを提示しています。Patton、Ziegel、Chenはこの結果を動的なVaR–ES予測のモデル化と比較に用います (Patton, Ziegel, and Chen, 2019)。よく使われる一つの要素FZ0は、下側収益率規約Y = −L、α = 1−c、負の予測e ≤ v < 0で次のように書かれます。 S_FZ0(Y,v,e;α) = −I{Y ≤ v}(v−Y)/(αe) + v/e + ln(−e) − 1. この式には収益率の符号と負値の前提があります。すべての正の損失データやすべての共同スコアにそのまま使える式ではありません。選んだスコアを明記し、データと予測規約が前提に合うか確認してください。
スコア水準と差を正しく読む
モデルmについて各予測・実現値ペアの共同スコアを求め、その平均を計算します:mean_S_m = (1/T) Σ_t S_c(v_hat(m,t), e_hat(m,t); L_t)。同じ許容スコア、日付、対象、規約を使う場合、平均が低いモデルはそのルール上で相対的に良好です。スコアは確率、VaR額、金銭損失の推定値ではなく、数値の尺度は選んだスコアに依存します。
AとBをペア比較する場合はd_t = S_A,t − S_B,tを作ります。平均が負なら選択したスコアではAが有利です。同じ実現値に対する比較なので、ペア差は個別に丸めた平均の比較より有益ですが、テール観測が少なければ差はなお不確かです。
<!-- learn:illustration -->
予測起点、ポートフォリオまたは対象、期間、信頼水準、データ版をそろえてください。予測は結果が出る前に記録されている必要があります。予測期間が重複する場合やスコア差に系列依存がある場合、その依存を不確実性計算に反映します。適切な標準誤差または区間を示してください。小さな生の差だけで優劣は決まりません。

単独の二つの損失を足しても代替にならない理由
VaRのpinball損失と、ES予測と代理値の絶対差を足す方法を考えたくなるかもしれません。しかし後者は有効なESスコアではない可能性があり、任意の加重和には共同整合性があるとは限りません。FZ共同スコアはVaR–ESペア全体を対象に評価します。その性質を持たない重みや変換を使うと、評価する問いそのものが変わります。
Fissler–Ziegelクラスには尺度や感度の異なる複数のスコアがあり、異なるスコアから得た差は直接比較できません。Patton、Ziegel、Chenはスコア設計と追加の符号条件下でのFZ0の尺度特性を論じていますが、FZ0が常に最善という意味ではありません。評価順位を見る前に選択して報告します。
予測ペアも重要です。数値上もっともらしいES予測でも、組み合わされたVaR予測と整合しないことがあります。逆に良い共同スコアでも、条件付き分布全体が正しいとは限りません。評価対象は選んだスコアと設計のもとでのVaR–ES機能です。
VaR例外数が同じでもテール損失は異なり得る
VaR例外指標は二値です。L_tがVaR予測を超えればI_t = 1、そうでなければ0です。二つのモデルで例外の数と時点が同じでも、閾値を超えた損失額は大きく異なる場合があります。例外が4回という数だけでは、超過がわずかだったか大幅だったか分かりません。単なる回数は、ESが表そうとするテール損失の深刻度を記録しません。
共同スコアはVaR閾値とES予測に実現損失を組み合わせるため、ヒット数を超えてテール損失額がスコアに影響することがあります。各観測の正確な寄与は選んだスコアによります。一つの極端な損失だけで勝者を決めず、共通サンプル全体でスコアを計算し、感度も確認してください。
予測比較のためのスコアリングと、VaR例外頻度の検査は別の作業です。前者は共通ルールでどの予測ペアが良かったかを比べるもので、完全な較正証明ではありません。
例外検定とESバックテストは別の問いに答える
Kupiec型VaR検定は例外数を目標率と比較し、Christoffersen型の拡張は依存や集中も調べます。結果をヒットか非ヒットに縮約するため、VaR超過損失の大きさを測らず、ES予測を直接検証しません。VaRとExpected Shortfallのガイドでは、例外数がテールの深刻度を捉えない理由を解説しています。
共同スコアは相対的な予測比較に使い、バックテストは指定された手続きで予測が十分に較正されているかを問います。AcerbiとSzekelyはノンパラメトリックESバックテストを提案し、モデル選択におけるelicitable性とリスク指標の検定可能性を区別しました (Acerbi and Szekely, 2014)。BayerとDimitriadisはVaR–ES共同構造を用いる回帰ベースのESバックテストを開発しましたが、各手法に固有の仮定と共分散要件があります (Bayer and Dimitriadis, 2022)。スコア順位は専用バックテストの代わりではなく、帰無仮説を棄却できないことも精度の証明ではありません。
ペア推論を計画し、選択の漏れを防ぐ
スコア差の時系列をデータとして扱います。重複しない1期先予測で依存について適切な仮定が成り立つ場合は、平均差のペア検定を検討できます。系列依存や重複期間があるなら、長期分散推定やブロック再標本化など依存に合う推論を使います。p値だけでなく、方法と帯域幅またはブロック規則も報告してください。
スコア、テール水準、予測期間、評価日、モデル集合を順位を見る前に固定します。多くのスコア、期間、資産、予測仕様を試して最良のものだけを報告すると選択の影響が生じます。可能なら後続期間を評価用に残し、候補の選別方法を開示します。テスト標本で調整した不確実性は、その探索を自動的に考慮しません。
平均スコアとペア差、その不確実性、スコアの定義、VaR・ES規約、共通のアウト・オブ・サンプル期間、テール観測数を示します。妥当なスコアや期間の選択で順位が変わるなら、その感度も開示してください。
限界と実務的な報告チェックリスト
信頼水準が高いとテール観測が少なくなり、時系列が長くても順位は不安定になり得ます。条件付き分散の変動、レジーム転換、重複収益率、推定誤差、データ誤り、ポートフォリオ変更もスコア差に影響します。共同elicitable性はこれらの問題を消すものではなく、数学的条件下で原理的なスコアクラスを提供します。
実現損失が予測と同じポートフォリオ、期間、評価方法、符号に対応しているか、VaRとESが同じテール確率を使うか、予測が事前に作成されたか、スコアが前提を満たすか確認してください。標本長、テール数、スコア式、ペア不確実性の方法、モデルやスコアの探索を報告します。結論はこの設計に条件付けられます。
共同スコアが低いことは、特定の適切なスコアでの相対的予測性能を示す材料です。モデルがすべてのテール事象を捉える、安全なリスク推定である、将来も同じ結果になると証明するものではありません。この記事は統計的な解説であり、投資助言ではありません。
よくある質問
Q1絶対誤差でExpected Shortfallの予測を比較できますか?
厳密整合的スコアの一般的な代替としてはできません。幅広い分布クラスでES単独はelicitableではなく、点予測の比較ではVaRとの共同評価、較正の検査では専用ESバックテストが一般的です。
Q2共同VaR–ESスコアでリスクモデルの較正が分かりますか?
選んだ共同スコアのもとで相対性能を比較します。較正とモデル誤指定は別の問いなので、適切な検定や診断も必要です。
Q3VaR例外が同じ二つのモデルでスコアが異なることはありますか?
あります。ヒット指標が同じでも、VaR超過損失の大きさやES予測が異なることがあります。正確な影響はスコアによります。
Q4スコアが低ければそのモデルを安全に使えますか?
いいえ。選択した仮定とスコアによる標本内比較です。テールデータの少なさ、レジーム転換、モデル選択、データ問題で結果は変わり得ます。投資助言ではありません。
出典
問題を報告
この記事のリンクを含むメールを準備します。送信すると Mark に報告が届きます
クイックチェック
記事を読み終えたら、3問で確認しましょう
問題 01
Expected ShortfallをVaRと一緒にスコアリングすることが多いのはなぜですか?
答えを選ぶと解説を確認できます