入れ子予測のClark–West検定:式、例、限界
入れ子になった予測モデルでMSPEを調整して比較する理由、Clark–West統計量の仕組み、片側検定で分かることと分からないことを解説します。
このガイドの内容入れ子予測には専用の比較が必要
短い要約
Clark–West検定は、ある予測モデルがより小さなベンチマークモデルを内包するとき、二乗誤差の比較を調整します。追加パラメータを推定すると、そのパラメータが真の予測情報を加えない場合でも、大きいモデルの予測にノイズが生じることがあります。この調整は推論に使う損失差を変えるもので、どちらの予測も変更せず、大きいモデルの有用性を保証するものでもありません。
入れ子予測には専用の比較が必要
制約付きモデルが定数項で翌月のリターンを予測し、大きいモデルが評価比率を追加するとします。追加係数をゼロにすればベンチマークに戻るため、制約付きモデルは大きいモデルに入れ子です。その係数が実際にゼロでも、推定によって大きいモデルの予測に標本ノイズが加わることがあります。そのため、母集団で両モデルの予測情報が同じでも、観測された平均二乗予測誤差(MSPE)は大きいモデルのほうが高くなる場合があります。
Clark–West調整は、入れ子予測の標本外二乗誤差を比較する際に、この推定ノイズの問題を扱います。この設定のもとで、大きいモデルが制約付きベンチマークを上回る予測価値を持つかを問います。予測損失をペアで一般的に比較するDiebold–Marianoガイドよりも、対象を絞った問いです。DM検定の通常の参照分布が入れ子モデルにも自動的に有効とは限りません。ClarkとMcCrackenは入れ子予測の精度検定と包括性検定に固有の漸近・有限標本特性を分析し、ClarkとWestは調整MSPE手順と近似推論を提案しています。Clark and McCracken (2001)00071-9)、Clark and West (2007)。
入れ子関係を確認し、標本外設計を保つ
制約付きベンチマークは、大きい代替モデルと同じ目的変数(y_{t+h})を予測します。大きいモデルは、通常は追加係数を一つ以上ゼロにすることで、ベンチマーク仕様を特殊ケースとして含まなければなりません。単に複雑であること、変数が多いこと、標本内の適合度が高いことだけでは、入れ子関係は成立しません。
各予測起点では、その時点で利用できる情報だけを使って両方の予測を作成します。時系列順の学習期間でモデルを推定し、その後の評価期間について予測します。目的変数、予測期間、単位、起点、実現値は両モデルで揃えます。再帰的またはローリング方式で再推定してもかまいませんが、方式を明記し、各起点で実際に作成した予測を保存してください。評価期間を何度も確認し、予測変数、変換方法、期間を選べば、その期間は未使用の証拠ではなくモデル選択の一部になります。CAViaRガイドは、裾の分位点予測も平均予測の比較に含めるのではなく、目的に合った損失で評価する必要があることを示しています。
Clark–West調整が扱うのは入れ子モデルの帰無仮説下におけるパラメータ推定ノイズです。先読み、標本の不一致、後日改訂されたデータを当時利用可能だったものとして扱うこと、非開示のモデル探索は修正しません。初期推定期間、予測起点の数、予測期間、データの時点、およびローリング・再帰更新の有無を報告し、何が本当に標本外だったかを読者が判断できるようにします。
調整済み損失差を計算する
制約付き予測を f₀,t+h、大きいモデルの予測を f₁,t+h、予測誤差 j を eⱼ,t+h = yₜ₊ₕ − fⱼ,t+h とします。二乗誤差損失の場合、各期間のClark–West調整差は次のとおりです。
dCW,t+h = (e₀,t+h)² − [(e₁,t+h)² − (f₀,t+h − f₁,t+h)²]
これは、制約付きモデルの二乗誤差から大きいモデルの二乗誤差を引き、さらに両予測の距離の二乗を加えた式と同じです。最後の項は、帰無仮説下で追加推定パラメータに伴う予測ノイズを推定します。ClarkとWestは、比較前に大きいモデルの標本MSPEからこの予測差の項を差し引くことで調整すると説明しています。Clark and West (2007)。
共通の評価起点にわたって調整差を平均します。mean(dCW) = (1/P) Σ dCW,t+h です。結果と予測をベーシスポイントで測る場合、二乗誤差と調整差の単位はベーシスポイントの二乗です。上記の符号規則では、調整平均が正なら大きいモデルに有利な方向を示します。ただし、これは調整済み比較スコアであり、大きいモデルの実現MSPEでも取引に使う予測でもありません。
結果を見る前に片側仮説を定める
一般的なClark–Westの問いは、入れ子になった大きいモデルが制約付きベンチマークより期待MSPEを低くできるかです。帰無仮説は追加要素による予測改善がないことを表し、片側対立仮説は大きいモデルに有利な方向を取ります。上の式では、標準誤差に対して十分に大きい正の調整平均が対立仮説を支持します。
調整損失の表記では、作業仮説は H₀: E[dCW] = 0、H₁: E[dCW] > 0 です。正の方向は、制約付きモデルの損失を先に置く規則によります。差の順序を逆にすれば符号も反転するため、結果とともに規則を明記してください。
検定統計量は通常、dCWの標本平均を推定標準誤差で割った値です。ClarkとWestは、分析対象とした設定について、必要に応じて通常または自己相関整合的な標準誤差を使う近似正規の片側検定を推奨しています。West (1996)は、推定パラメータに依存する予測を含め、標本外の予測と誤差の滑らかな関数のモーメントに関する推論を扱っています。検定方向は結果を見る前に選んでください。Clark–West統計量が正だったからといって、後から両側検定や異なる符号規則に切り替える根拠にはなりません。
4期間の例を計算する
ベーシスポイント単位の仮想的な4観測を考えます。実現値は [0, 1, −1, 0]、制約付きモデルの予測は [−1, 0, 0, 0]、入れ子になった大きいモデルの予測は [−1.5, 0.5, −0.5, 0.5] です。制約付きモデルの二乗誤差は [1, 1, 1, 0] で、平均MSPEは 0.75 bp² です。大きいモデルの二乗誤差は [2.25, 0.25, 0.25, 0.25] で、平均MSPEも 0.75 bp² です。
二乗予測差 (f₀ − f₁)² は [0.25, 0.25, 0.25, 0.25] です。調整差 e₀² − e₁² + (f₀ − f₁)² を計算すると [−1, 1, 1, 0] bp² となります。標本平均は 0.25 bp² です。未調整MSPEは同じですが、大きいモデルの予測推定ノイズを補正するため、調整平均は正になります。
この4期間の例は計算方法だけを示しています。不確実性を信頼できる形で推定したり、統計的有意性を確立したりするには少なすぎます。調整平均が正でも、実際の予測優位性がある証拠にはなりません。値は仮想例であり、市場観測値ではありません。 <!-- learn:illustration -->

予測誤差の依存性と予測期間を考慮する
1期先予測でも、目的変数、予測変数、推定期間が時間とともに変わるため、調整損失差に系列依存性が残ることがあります。複数期先予測の期間が重複すると、隣接する起点で同じ実現対象期間を共有するため、調整差は構造上相関します。各起点を独立とみなす通常の標準誤差では、不確実性を過小評価する可能性があります。
標本設計を反映する推論方法で調整差の系列から標準誤差を推定します。条件が適切なら、不均一分散と自己相関に整合的な長期分散推定量などが使えます。ClarkとWestは、自己相関のある予測誤差について自己相関整合的な標準誤差を明記しています。予測期間、共分散推定量、使用した場合はカーネルと帯域幅、再標本化や臨界値の方法を報告してください。ブロック・ブートストラップガイドは、依存する時系列観測を再標本化する際に順序を保つ必要がある理由を説明しています。一般的なブートストラップがClark–Westの帰無仮説を自動的に実装するわけではありません。
必要な依存性処理は設計によって異なります。長い予測期間、持続性のある目的変数、パラメータの反復推定、ボラティリティの変化は、単純な期間重複以外の依存性を生むことがあります。合理的な推論設定を比較して説明し、最小のp値を与える設定だけを選ばないでください。
正規臨界値は保証ではなく近似として扱う
入れ子モデルの予測検定では、特に推定標本と評価標本が同時に大きくなる場合、帰無仮説下の分布が標準的でないことがあります。ClarkとMcCrackenの分析によると、入れ子予測の精度等価性検定と包括性検定は、よく知られた非入れ子比較とは漸近・有限標本で異なる挙動を示します。ClarkとWestは研究対象の設計で有用な近似正規推論を持つ調整統計量を提示していますが、すべての有限標本に対する保証ではありません。Clark and McCracken (2001)00071-9)、Clark and West (2007)。
評価標本が小さい、追加パラメータが多い、ベンチマークの特定に誤りがある、データに基づいて予測変数を選ぶ、ローリング推定と再帰推定を選択するといった要因は、検定サイズや検出力に影響します。標本や設計が論文で検討された状況と大きく異なる場合は、設計に適した臨界値や、慎重に定めたシミュレーション/ブートストラップ手順を検討してください。推定標本と評価標本のサイズを報告し、p値をどの参照分布から求めたか明確にします。
近接する検定と予測に関する主張を区別する
Diebold–Mariano検定は、一般的なペア損失の枠組みで、二つの予測損失系列の期待損失が等しいかを問います。Clark–West調整は、一方が他方に入れ子であり、推定した追加パラメータが帰無仮説下の未調整MSPE差を歪める二乗誤差の比較を対象とします。無関係な非入れ子モデルにこの調整を適用すると、正当化なく問いを変えることになります。DMの原論文は幅広い損失指標を認め、予測誤差が正規分布や独立性に従わない場合も扱っています。関連する文献ですが、入れ子モデル手順の別名ではありません。Diebold and Mariano (1995)。
どちらの方法も、多数の目的変数、期間、ベンチマーク、予測変数セットを試したことによる研究者の自由度を解消しません。最終比較が広範な探索から選ばれた場合は、候補集合を記録し、探索全体の問いに適した方法を使ってください。White’s Reality CheckとHansen’s SPAガイドは、探索した取引ルールの集合全体に対する推論を扱います。Clark–West検定だけでは、選択後の予測比較が確認的な検定になるわけではありません。
有意な片側結果は、明示した仮定のもとで、検定対象の目的変数と評価設計について大きいモデルが期待二乗予測精度を改善するという証拠です。追加予測変数が因果的であること、シグナルが安定して続くこと、予測を使う戦略が正のリターンを得ることは示しません。予測の改善が意思決定に影響するほど大きくない場合もあり、モデルの最大の改善が取引コストの高い期間に生じる可能性もあります。
取引の収益性を検証するには、別個のルール、未使用の評価データ、現実的なスプレッド、手数料、スリッページ、市場インパクト、資金調達、借入、リスク上限が必要です。因果関係を主張するには問いに適した識別戦略が要ります。標本後の予測比較は因果設計ではありません。Clark–Westの結果が実際に示す内容を述べ、それ以外の主張はそれを検証する証拠に委ねてください。
比較を再現できるよう設計を報告する
制約付きモデルと大きいモデルを示し、入れ子関係を作る正確な制約を特定します。目的変数、予測期間、二乗誤差の単位、推定期間、予測起点のスケジュール、評価日、共通標本の規則も定義します。係数を再帰的に再推定するのかローリング期間で再推定するのか、情報集合とデータの版をどう維持するのか説明します。
未調整の両MSPE、Clark–West調整差の平均、符号規則、標準誤差、片側対立仮説、参照分布または臨界値、p値、依存性の推定方法を報告します。追加パラメータ数、標本サイズ、予測変数と期間の探索、ベンチマーク選択、評価期間がモデル設計に影響したかどうかも開示します。この記録により、調整済み入れ子モデル検定と一般的な予測比較を区別し、残る不確実性を判断できます。
よくある質問
Q1Clark–West検定はDiebold–Mariano検定の代わりになりますか?
いいえ。Clark–Westは入れ子モデルの二乗MSPE比較を扱います。Diebold–Marianoは一般的なペア損失の枠組みであり、通常の参照分布が入れ子予測にも自動的に適用できるとは限りません。
Q2正の調整平均は大きいモデルの優位性を証明しますか?
いいえ。明示された符号規則では大きいモデルに有利な方向を示しますが、推論には適切な標準誤差、信頼できる標本外設計、十分な観測数も必要です。
Q3入れ子でないモデルにもClark–Westを使えますか?
標準的には使えません。この補正は、入れ子モデルの帰無仮説下における推定ノイズを根拠としています。非入れ子の比較には、予測設計と損失に合った検定を選んでください。
Q4Clark–Westの有意な結果は、取引戦略の利益を意味しますか?
いいえ。この検定が評価するのは、一つの目的変数と評価設計に対する予測精度です。取引結果は意思決定ルール、執行、手数料、資金調達、リスク、追加の標本外証拠にも左右されます。 主要研究 - Clark and West, “Approximately Normal Tests for Equal Predictive Accuracy in Nested Models” (2007) - Clark and McCracken, “Tests of Equal Forecast Accuracy and Encompassing for Nested Models” (2001)00071-9) - West, “Asymptotic Inference about Predictive Ability” (1996) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)
出典
問題を報告
この記事のリンクを含むメールを準備します。送信すると Mark に報告が届きます
クイックチェック
記事を読み終えたら、3問で確認しましょう
問題 01
Clark–West調整で二つの予測間の二乗差を加えるのはなぜですか?
答えを選ぶと解説を確認できます