Model Confidence Set(MCS):勝者を無理に決めずに予測モデルを比較する
Model Confidence Setが逐次検定と依存データを扱うブートストラップを使い、証拠から優劣を区別できない予測モデルを残す仕組みを解説します。
このガイドの内容Model Confidence Setは何を問うのか
短い要約
Model Confidence Set(MCS)は、あらかじめ定めた予測手順の集合を、選択した損失関数で比較し、劣っていると示せなかった候補を返します。標本から候補を区別できなければ複数が残ることがあり、結果は候補集合、予測設計、損失、推論手順に依存します。
Model Confidence Setは何を問うのか
翌日のボラティリティを予測する手順が複数あるとします。誤差は同じではなくても、標本が短い、またはノイズが大きければ、どの手順の期待損失が最小かを判断できないことがあります。平均損失が最小の手順を選ぶと、差が標本変動にすぎない場合にも勝者を一つ決めてしまいます。MCSは集合として答え、指定した性能基準で最良と統計的に両立する候補がどれかを示します。
MCSは候補集合 \(\mathcal M_0\)、損失などの基準、信頼水準から始まります。検討中の候補が予測能力で同等かを繰り返し検定し、棄却された場合は事前に定めた除外規則で相対的に劣る候補を一つ除き、縮小した集合を検定します。残った候補がMCSです。Hansen、Lunde、Nasonは、データの不確実性が大きいとパラメータの信頼区間に複数の値が残るのと同様に、指定された候補群で最良のモデルを含む信頼集合としてこの手順を提案しました(2011年論文)。
「最良」は比較の範囲内でのみ成り立ちます。対象、予測期間、各時点で利用可能な情報、評価基準、候補集合が変われば、最良の手順も変わり得ます。MCSは候補の一つが真のデータ生成過程だとは仮定せず、期待損失が同じ候補を複数残すこともあります。残ったモデルが正しい確率を事後確率として示す方法ではありません。
候補集合と予測問題を先に固定する
損失を計算する前に \(\mathcal M_0\) を定めます。候補には、推定モデルと推定・予測更新の規則を合わせたものや、統計モデルで表さない予測手順を含められます。たとえばボラティリティ分布、ローリング窓、パラメータ更新、予測期間を変えられるなら、「GARCH」だけでは候補は十分に特定されません。それぞれが別の候補になり得ます。
各候補は、同じ起点・予測期間で同じ対象を予測し、その時点で利用できた情報だけを使う必要があります。一方が1日分散、他方が5日ボラティリティを予測する場合、損失をそのまま比較できません。共通の評価標本を使い、欠測を明示的に揃え、データの版、初期推定窓、再帰型かローリング型か、改訂データの扱いを記録します。時間的に重なる予測では、近接する起点の損失が観測値を共有することがあります。
結果を見る前に基準を選びます。点予測では二乗誤差、絶対誤差、意思決定に応じた損失で順位が異なることがあります。分散予測にはノイズのあるproxyに適した損失、分位点予測には平均二乗誤差でなくquantile scoreが必要です。一つの損失で良いMCSでも、別の損失で良いとは限りません。同じ評価結果を見て候補を絞った場合、形式上の集合は報告されていない選別に条件付けられ、探索全体を表しません。
共通予測からペア損失差を作る
起点 \(t\) からの予測に対する実現値を \(y_{t+h}\)、候補 \(i\) の予測を \(\hat y_{i,t+h|t}\) とします。事前に決めた損失関数 \(L\) により、候補ごと・共通起点ごとに損失を計算します。
\[ L_{i,t}=L(y_{t+h},\hat y_{i,t+h|t}) \]
損失が小さいほど良いとします。候補 \(i\) と \(j\) のペア差を次のように定義します。
\[ d_{ij,t}=L_{i,t}-L_{j,t}, \qquad \bar d_{ij}=\frac{1}{P}\sum_{t=1}^{P}d_{ij,t} \]
ここで \(P\) は共通する予測起点の数です。この符号規約では、正の \(\bar d_{ij}\) は標本内で候補 \(i\) の平均損失が \(j\) より大きかったことを示し、負なら \(i\) が有利です。両候補が同じ実現値を予測したため、ペア比較が重要です。共通の市場ショックは双方の損失を押し上げる一方、差は相対性能を取り出します。
現在の集合 \(\mathcal M\) に対する予測能力同等性の帰無仮説は次のように書けます。
\[ H_{0,\mathcal M}:\quad \mu_{ij}=E[d_{ij,t}]=0 \quad \text{すべての } i,j\in\mathcal M \text{ について} \]
これは現在の集合に関する同時の仮説であり、無関係なペア検定を一つずつ調べるものではありません。元のMCSは、モデル間の探索を扱うため、同時同等性検定と除外規則を使います。各日に予測が完全に一致するかを問うわけではありません。
現在の集合を検定し、除外規則を決める
MCSは集合レベルの検定と候補除外を交互に行います。\(\mathcal M=\mathcal M_0\) から始め、選んだ有意水準 \(\alpha\) で予測能力の同等性を検定します。棄却できなければ停止して現在の集合を報告します。棄却した場合は事前に定めた規則で候補を一つ除外し、小さくなった集合を再検定します。手順の仮定の下で、残る集合が \((1-\alpha)\) MCSです。
論文ではよく使われる二つの統計量を扱います。Range統計量は、標準化したペア損失差の最大値を調べます。
\[ T_{R,\mathcal M}=\max_{i,j\in\mathcal M}|t_{ij}|, \qquad t_{ij}=\frac{\bar d_{ij}}{\widehat{\mathrm{se}}(\bar d_{ij})} \]
対応する除外規則は、他候補に対する標準化された不利が最大の候補を外します。もう一つの統計量は各候補を現在の集合の平均成績と比較します。
\[ T_{\max,\mathcal M}=\max_{i\in\mathcal M}t_{i\cdot}, \qquad d_{i\cdot,t}=\frac{1}{|\mathcal M|}\sum_{j\in\mathcal M}d_{ij,t} \]
ここで \(t_{i\cdot}\) は \(d_{i\cdot,t}\) の平均を標準化し、対応規則は集合平均より標準化超過損失が最大の候補を外します。統計量と除外規則は組み合わせて選び、報告します。小さい集合を作る方を結果を見てから混ぜてはいけません。棄却検定は候補を選ぶ規則と整合させる必要があります(Hansen, Lunde, and Nason)。
ブートストラップで時間依存性を保つ
最大統計量の分布は候補間の損失差の同時変動に依存します。モデルや日付を独立観測とみなすと、連続する損失の系列依存と、同じ日の候補間のペア依存の両方を壊す可能性があります。そのためMCSのbootstrapは、集合統計量の帰無分布を近似しながら、該当する時系列構造を保つ必要があります。
候補損失または差のベクトルを、時間ブロックごと揃えて再標本化する方法があります。Stationary bootstrapではブロック長をランダムにし、再標本化した系列をランダムに選んだ日から再開できます。PolitisとRomanoは弱依存定常観測のためにこの方法を提案しました(1994年論文)。MCSの論文はblock bootstrapの実装を説明し、付録でstationary bootstrapも挙げています。モデルごとに損失系列を独立再標本化すると同日のペア関係が失われ、比較結果が変わり得ます。
平均ブロック長、bootstrap方式、帰無仮説の下での中心化、反復数、予測期間は不確実性の推定に影響します。重なる長期予測は損失差の依存を長くしがちですが、どの対象・標本にも合う万能のブロック長はありません。設計を説明し、妥当な依存設定で結論が変わるか確認します。bootstrapは仮定に基づく近似で、look-ahead、再利用したholdout、非定常なscore、候補不足を修正するものではありません。
4モデルの仮想比較を計算する
4つの手順A、B、C、Dが、共通する120の日次起点で同じボラティリティ対象を予測するとします。二乗誤差の平均損失は、二乗パーセントポイントという説明用の単位で1.20、1.23、1.45、1.90です。平均ではAが最良、Dが最下位ですが、順位だけでは標本の不確実性は分かりません。
AとBの平均ペア損失差は \(1.20-1.23=-0.03\) です。依存性を考慮した標準誤差が \(0.04\) なら、ペア統計量は \(-0.03/0.04=-0.75\) です。この差だけではAとBに明確な統計差があるとは言えません。MCSはそこで止まらず、4候補すべての同時差を集合統計量で調べます。
例として、120起点の完全な損失系列に対するblock-bootstrap MCSが \(T_R\)、\(\alpha=0.05\)、整合的な最悪候補除外規則を使うとします。全候補のp値が0.018となってDを除外し、次に \(\{A,B,C\}\) のp値が0.11だとします。0.11は0.05を上回るため手順は停止し、仮想的な95% MCSは \(\{A,B,C\}\) です。Cの平均損失はAより大きくても残ります。この仮想例の同時検定はCが劣ると示していません。
ここでのp値は手順を説明するために作った値で、4つの平均損失やA–B差からは再計算できません。実際の結果には起点ごとの全損失系列、候補予測、bootstrap設計、除外順序が必要です。入力を保存し、棄却ごとにどの候補を除いたか報告してください。 <!-- learn:illustration -->

残った集合を誇張せずに解釈する
95%信頼水準のMCSは、正則性条件と検定上の仮定の下で、指定集合の最良候補を少なくとも表記された漸近カバレッジで含むよう設計されています。各モデルが最良である確率が95%という意味ではありません。信頼性は反復標本での手順のカバレッジに関するもので、モデル名の事後分布ではありません。
予測能力同等性を棄却できないことは、期待損失が完全に等しい証明ではありません。評価期間が短い、損失差の変動が大きい、候補が僅差といった場合は検出力が限られます。残る候補が多いことは、データが選択肢を分けられない正直な結果かもしれません。またMCSは候補同士を比べるため、外部基準を満たさず、全候補が絶対的に低品質である可能性もあります。
集合は \(\mathcal M_0\) に含めた候補の範囲に限られます。より良い予測手順を候補から省けばMCSは見つけられません。同じ評価期間を先に確認してモデルを除外した場合、その未記録の探索は名目カバレッジに含まれません。候補の作成・選別履歴を示しましょう。複数候補の期待損失が同じく最小なら、それらを残すことは選択の失敗ではなく手法に沿った結果です。
MCSとペア検定・ベンチマーク検定を区別する
Diebold–Mariano検定は2つの予測手順のペア損失差に焦点を当てます。MCSは集合を繰り返し検定し、同時除外手順で残る候補を報告します。DM検定を多数実行して非有意のペアを残すだけではMCSと同等になりません。同時bootstrapと整合的な除外規則が重要です。
Clark–West検定は、予測モデルが制約付きベンチマークを内包し、推定ノイズが生の差に影響する場合の、より限定的な二乗誤差比較です。MCSに入れ子関係は不要でユーザー指定の損失も使えますが、共通の予測設計は必要です。
WhiteのReality CheckとHansenのSuperior Predictive Ability検定は、探索した候補群の少なくとも一つが指定ベンチマークを上回るかを問います。MCSはベンチマークを必要とせず、比較的優れた候補の集合を示します。いずれも探索と依存性の記録が必要ですが、帰無仮説は異なります。Reality CheckとSPAの解説、およびWhite (2000)、Hansen (2005)の原論文を参照してください。
設計を報告し、予測順位と取引価値を分ける
再現可能な報告には、候補手順、共通の対象と期間、予測起点と情報の規則、推定スケジュール、評価日、欠測の扱い、損失式、どちら向きが良いかを記します。有意水準、検定統計量と除外規則、bootstrap方式、ブロック長、中心化、反復数、各段階のp値、最終集合も報告します。平均損失は参考情報ですが、順位表で同時推論を置き換えないでください。
ボラティリティ評価では観測proxyの作り方とノイズ・改訂の有無を説明します。複数期予測では対象期間の重なりと依存性への対処を開示します。集合に影響する場合は、損失、標本期間、bootstrap設定を妥当な範囲で変えた感度も示します。除外候補や手順の詳細がない小さなp値だけでは再現できません。
MCSは一つの基準に関する予測手順を順位付けします。因果構造や真のデータ生成モデルを特定したり、残った予測が利益を生むと証明したりはしません。ポジション化には閾値、数量、回転率、執行時点、spread、手数料、slippage、資金調達、借入、リスク制約が加わります。凍結した意思決定手順を適切な後続データで別途評価し、コスト控除後の結果を報告します。不完全なproxyでのボラティリティ損失はQLIKEと二乗誤差のガイドも参照してください。
よくある質問
Q1MCSは最良モデルを一つ選びますか?
必ずしもそうではありません。証拠が候補を区別すれば一つだけ残ることも、どれが劣るか分からず複数残ることもあります。実運用向けに一つ選ぶには別の意思決定規則が必要です。
Q2MCSに残ったモデルが正しい確率は95%ですか?
いいえ。信頼水準は、手法の仮定の下で、指定した候補群の最良候補を反復標本でどれだけカバーするかを表します。モデルが真である事後確率ではありません。
Q3ボラティリティ予測以外にもMCSを使えますか?
使えます。意味のある共通基準と適切な標本設計を定めれば、予測、計量モデルなどを比較できます。結果は選択した候補集合と損失に依存します。
Q4MCSは試したすべてのモデルを自動的に考慮しますか?
実際の探索を候補群と評価手順に含めた場合に限ります。記録されていない選別や評価データの反復利用は、後からMCSを計算しても補正されません。
出典
問題を報告
この記事のリンクを含むメールを準備します。送信すると Mark に報告が届きます
クイックチェック
記事を読み終えたら、3問で確認しましょう
問題 01
Model Confidence Setが報告するものは何ですか?
答えを選ぶと解説を確認できます
オプション用語集
コール、プット、オプションチェーンから IV、グリークス、建玉、マックスペインまで、主要用語を正確に解説します
オプション用語集を見る