Diebold–Mariano検定とは:予測精度の比較と解釈
Diebold–Mariano検定が比較する対象、損失差と系列相関の扱いを解説し、予測精度の差が売買利益を意味しない理由を説明します。
このガイドの内容検定するのは予測の期待損失の差です
短い要約
Diebold–Mariano(DM)検定は、同じ実現結果を対象にした2つの予測手法で、期待損失が等しいかを検定します。時点ごとの損失差の系列を使うため、損失関数、予測期間、時点間の依存関係が結果に影響します。帰無仮説を棄却しても、指定した評価設計のもとで差があることを支持するだけです。一方のモデルが今後も優位であることや、売買戦略がコスト控除後に利益を生むことは示しません。
検定するのは予測の期待損失の差です
Diebold–Mariano検定は、同じ対象を同じ評価日について予測した2つの結果を比較します。各予測起点で、2つの手法は同じ実現値、予測期間、情報の締切時点を用いる必要があります。そのうえで、損失差が時間とともに変わりうることを認めながら、一方の手法の平均損失が他方と系統的に異なるかを調べます。
DieboldとMarianoの原論文は、平均二乗誤差だけでなく一般の損失関数に対して、競合予測の予測精度が等しいという帰無仮説を検定する方法を示しています(Diebold and Mariano, 1995)。ここでいう「精度」は、比較に選んだ損失関数のもとで期待損失が小さいことです。予測が真実である、因果関係を説明する、分布のあらゆる部分で適切に較正されている、あるいはすべての意思決定で役立つ、という意味ではありません。
モデルAとBが同じ時点に同じ将来リターンを予測するとします。DM検定は、どちらかの係数がゼロかどうかも、推定標本で当てはめ値が一致するかどうかも検定しません。評価標本における予測誤差が、選んだ損失にどのように変換されたかを比較します。
統計量を解釈する前に評価設計を定めます。予測対象、起点、期間、損失関数、欠測結果の扱い、再推定の頻度、片側または両側の対立仮説が検定の問いを決めます。モデルごとにこれらの選択が異なると、損失差は同じ条件での比較を表さなくなります。
対応する予測と損失差を定義します
予測起点 $t$ の実現値を $y_t$、モデルAとBの予測を $\hat y_{A,t}$、$\hat y_{B,t}$ とします。予測誤差は $e_{A,t}=y_t-\hat y_{A,t}$、$e_{B,t}=y_t-\hat y_{B,t}$ です。損失関数を $L$ とすると、時点ごとの損失差は次のように定義できます。
$$ d_t=L(e_{A,t})-L(e_{B,t}) $$
この符号規約では、$d_t$ の平均が負ならAの観測損失が小さく、正ならBの観測損失が小さいことを表します。母集団の帰無仮説は $E[d_t]=0$ です。両側対立仮説は方向を問わず期待損失の差を調べ、片側仮説は事前に定めた方向を調べます。どちらが勝ったかを見た後に方向を選んではいけません。
二乗誤差損失 $L(e)=e^2$ では大きな誤差が相対的に重くなります。絶対誤差損失 $L(e)=|e|$ では、一つの大誤差が順位を左右する度合いが下がります。分位点損失は非対称な予測目標に合わせることができ、別の損失関数は予測性能の別側面を対象にします。損失関数を変えればモデル順位が逆転することもあるため、損失を定める前に「最良の予測」を一意に決めることはできません。Tashmanの標本外予測検定のレビューも、評価方法を予測課題に合わせる必要を指摘しています(Tashman, 200000065-0))。
両モデルで同じ予測起点と実現値を使います。片方だけ難しい日の予測が欠けているとき、その日のみを黙って除外すると比較標本が変わります。実運用で毎月新しいデータを使ってモデルを再推定するなら、評価用予測も同じルールで作ります。パラメータを固定した予測実験は別の問いに答えます。将来情報を使わずに順次予測を作る方法は、ウォークフォワード検証で扱います。
4つの予測起点の例で平均差を確認します
予測起点が4つある仮想例を考え、実現値と予測誤差はパーセントポイントで表します。Aの誤差を $[1,2,0,1]$、Bの誤差を $[2,1,1,1]$ とします。それぞれの組は同じ実現リターンと予測区間を指します。数値は計算の説明だけを目的に作ったものです。
二乗誤差損失を用いると、Aの損失は $[1,4,0,1]$、平均二乗誤差は $(1+4+0+1)/4=1.50$ 平方パーセントポイントです。Bの損失は $[4,1,1,1]$、平均二乗誤差は $(4+1+1+1)/4=1.75$ です。この4件ではAのMSEが0.25平方パーセントポイント小さくなります。
各日の損失差 $d_t=L(e_{A,t})-L(e_{B,t})$ は $[-3,3,-1,0]$ です。その平均 $(-3+3-1+0)/4=-0.25$ は、Aの平均損失からBの平均損失を引いた値と一致します。この符号規約では負の値がAを支持します。ただし、差が標本誤差より大きいかはまだ分かりません。予測の組が4つだけでは、統計的根拠として説得力があるとはいえません。
損失の定義が「良い」の意味を変える例もあります。別の仮想比較で、Cの絶対誤差を $[0,0,0,3]$、Dを $[1,1,1,1]$ とします。絶対損失では平均がCは0.75、Dは1なのでCが優れます。一方、二乗損失ではCが2.25、Dが1なのでDが優れます。どの誤差を重視するか決めなければ、検定でこの不一致を解消することはできません。
<!-- Illustration placement: after this section; text-free conceptual scene showing two forecast paths against one realized path, with visibly different miss distances and no labels or numerical claims. -->
DM統計量は平均損失差をその不確実性で標準化します
標本平均損失差は $\bar d=T^{-1}\sum_{t=1}^{T}d_t$ です。$T$ は対応する予測結果の数です。平均の標準誤差は、ある一時点の分散だけでなく、損失差系列の長期分散に依存します。検定統計量の一般形は次のとおりです。
$$ DM=\frac{\bar d}{\sqrt{\widehat{\Omega}/T}} $$
$\widehat{\Omega}$ は損失差系列の長期分散を推定します。時点間が独立なら、選んだ推定方法では $d_t$ の分散に近づきます。しかし、予測損失はまとまって動くことがあります。高ボラティリティ期には両モデルの誤差が大きくなり、$h$ 期先の目標値が重なると隣接する誤差期間が同じ実現リターンを共有することがあります。正の依存性を無視すると標準誤差を過小評価し、証拠を実際より強く見せるおそれがあります。
一般的なHACの構成では、平均を引いた損失差の自己共分散 $\hat\gamma_k$ を推定し、$\widehat{\Omega}=\hat\gamma_0+2\sum_{k=1}^{q}w_k\hat\gamma_k$ と合成します。Bartlett重みを用いる場合、帯域幅 $q$ まで $w_k=1-k/(q+1)$ です。NeweyとWestは不均一分散と自己相関の両方に整合的な半正定値共分散推定量を提案しました(Newey and West)。カーネルと帯域幅は実装上の選択です。公表し、望ましいp値を得るためではなく予測設計に沿って選んでください。より一般的な共分散推定についてはHAC標準誤差の解説を参照してください。
一定の正則条件のもとでは、標準DM統計量を漸近標準正規分布と比較します。絶対値が大きいほど、観測された平均損失差は推定不確実性に比べ大きいことを示します。符号は定義した順序でどちらの損失が低いかを示しますが、p値は差の大きさや経済価値を測りません。帰無仮説が真である確率でも、将来予測が当たる確率でもありません。
多段階予測は重複するため有限標本の扱いも重要です
各時点から複数期先を予測すると、評価区間が重複します。たとえば毎月、次の3か月の累積リターンを予測すると、1か月後の予測は直前の予測と月次リターン3件のうち2件を共有します。月次リターン自体が独立でも、重複によって予測誤差と損失差に系列相関が生じます。
基本的な $h$ 期先の設定では、少なくとも $h-1$ 期までの依存性を分散計算に反映するのが自然です。ただし、これは一律の帯域幅ルールではありません。ローリング再推定、持続性のある目標値、ボラティリティの集中、損失関数によって、より長い依存が生じることがあります。予測期間、起点の間隔、HACの打ち切りラグまたは別の分散推定法を選んだ理由を記録してください。予測行数が独立した証拠の数と同じとは限りません。
元の漸近検定は、中程度の標本で実際の有意水準からずれることがあります。Harvey、Leybourne、Newboldは平均二乗予測誤差の比較に有限標本修正を提案しました(HLN, 199700719-4))。予測期間 $h$、予測数 $T$ に対する一般的な形ではDM統計量に次の係数を掛けます。
$$ DM_{HLN}=DM\sqrt{\frac{T+1-2h+h(h-1)/T}{T}} $$
入れ子モデルでは別の予測比較の考え方が必要です
モデルAがモデルBの制約版である場合があります。たとえばBにAの変数に加えて説明変数が含まれます。追加変数に母集団の予測力がないという帰無仮説のもとでも、推定係数はBの予測にノイズを加えることがあります。その結果、追加変数が予測過程を改善していなくても、大きいモデルの観測MSEが高くなる可能性があります。非入れ子のモデル間に使う同精度の論理をそのまま適用できるとは限りません。
ClarkとWestは、入れ子モデルの予測精度が等しいかを検定する近似正規検定を示し、大きいモデルの推定ノイズを考慮するよう二乗誤差の比較を調整します(Clark and West, 2007)。この調整はあらゆるDM検定を置き換えるものではなく、特定の入れ子モデルの問い、損失、漸近設定を対象としています。モデル間の包含関係を確認し、その設計に合った帰無分布をもつ検定を選んでください。ソフトウェアの標準DM p値があらゆる関係に適用できると仮定してはいけません。
他の区別も必要です。MSEが低い予測でも、予測区間の被覆率、確率較正、方向的中率、後続の意思決定が改善するとは限りません。標本外比較でも、モデル開発中に何度も確認した検証標本を最終的な独立標本と呼べないことがあります。モデル間の関係、推定方法、予測期間、各予測の作成に使ったデータ範囲を示してください。
予測精度は売買の優位性と同じではありません
DMの結果は予測損失を評価します。売買判断は損益とリスクの過程を評価します。次期リターンのMSEが低くても、シグナルが十分な頻度で売買方向を当て、適切なポジション量を選び、売買回転率、スプレッド、市場インパクト、手数料、借株料、ファンディング、約定遅延に耐えるとは限りません。逆に、平均二乗誤差が多少高くても、戦略のエクスポージャーが大きい局面でより正確なら意思決定を改善することがあります。その主張には、一般的で便利な指標ではなく実際の意思決定を反映した損失関数が必要かもしれません。
統計的に有意な差でも経済的にはごく小さいことがあります。p値や勝者表示だけでなく、解釈できる単位で平均損失差の大きさと不確実性を報告してください。ポートフォリオ成果を主張するなら、固定した意思決定ルール全体を適切な後続データで現実的な取引条件のもとで再生し、ネット成果を別に報告します。損失関数を明示的に設計していない限り、DMはその損益を計算せず、コストも反映しません。
この検定は、多数のモデル、目標期間、損失関数、日付範囲、売買ルールを検索して最も好ましい比較だけ報告する問題も補正しません。ペアごとの検定を繰り返すと別の選択問題が生じます。検索記録を残し、主張の候補群に合う多重検定法を使ってください。多重検定と偽発見率の解説では、広範な検索後に通常の閾値を適用すると誤解を招きうる理由を説明しています。DMは評価ツールであり、データスヌーピングの補正ではありません。
比較を再現できるだけの情報を報告します
明確な報告には、予測対象と単位、情報の締切、起点、期間、再推定スケジュール、共通評価標本を含めます。損失関数と $d_t$ の符号定義、各モデルの平均損失と平均差、事前に選んだ片側または両側仮説を示し、分散推定量、カーネル、帯域幅、検定統計量、参照分布、p値、適切な信頼区間または不確実性の推定値を報告します。
モデルが入れ子かどうか、欠測値や極端値の扱い、検討した代替仕様の数、評価期間がモデル選択に使われたかも開示します。閾値を通過したかだけでなく差の大きさを示します。$d_t$ の時系列や累積損失差の図は、全体平均に隠れた局面変化を示すことがありますが、依存性を考慮した推論の代わりにはなりません。
定量取引では、予測を行動に変える手順も示します。シグナル閾値、ポジションサイズ、リバランス時点、リスク制御、約定価格、コストの仮定です。DM検定が比較するのは与えた予測損失系列だけです。データ処理を保証したり、別々の評価標本を比較可能にしたり、因果性を証明したり、過去の順位が続くと約束したりはしません。時間順序に沿う予測設計と意思決定段階の明示的評価に加え、モデル評価の透明な一要素として使ってください。
よくある質問
Q1Diebold–Mariano検定はモデル係数を比較しますか?
いいえ。同じ結果に対して2つの予測手法が生む誤差の期待損失を比較します。係数検定はモデルのパラメータについて別の問いに答えます。
Q2数期先の予測にも使えますか?
使えますが、目標期間が重なると連続する損失差に系列依存が生じます。期間とモデル設計に合う分散推定と、必要に応じて有限標本補正を使い、選択内容を記録してください。
Q3有意な結果なら、優れた予測で利益が出ますか?
いいえ。指定した評価設計のもとで選んだ予測損失に差があることを支持します。利益は予測をポジションに変える方法、負うリスク、実際の約定や売買コストにも左右されます。
出典
問題を報告
この記事のリンクを含むメールを準備します。送信すると Mark に報告が届きます
クイックチェック
記事を読み終えたら、3問で確認しましょう
問題 01
基本的なDiebold–Mariano比較の帰無仮説は何ですか?
答えを選ぶと解説を確認できます