Mincer–Zarnowitz回帰:予測の偏りとキャリブレーションを検定する
Mincer–Zarnowitz回帰で予測の切片と尺度をどう検定するか、平均誤差がゼロでもキャリブレーションが成立するとは限らない理由、検定で証明できないことを解説します
このガイドの内容平均誤差がゼロでもキャリブレーションの問題は残る
短い要約
Mincer–Zarnowitz(MZ)回帰は、実現値が予測値の水準や尺度に線形に沿っているかを調べるキャリブレーション診断です。一般的な帰無仮説は、切片がゼロ、予測値の傾きが1という共同制約です。平均誤差だけを見るより多くの情報を得られますが、予測者が利用可能な情報をすべて適切に使ったことまでは証明しません。
平均誤差がゼロでもキャリブレーションの問題は残る
モデルが次期リターンを予測する場合や、エコノミストが次四半期の成長率を予測する場合を考えましょう。評価標本における予測誤差の平均がゼロになることはあります。これは平均的な過大予測や過小予測が続いている可能性を低めますが、予測値が後の実現値と一対一で動くことを示しません。予測が極端すぎる、変動幅が小さすぎる、または線形にずれている場合でも、正負の誤差が相殺されれば平均はゼロになります。
MZ回帰は実現値を予測値に回帰し、この別の問いを明らかにします。MincerとZarnowitzは経済予測の評価にこの枠組みを導入しました(1969年の章)。数値目標の点予測、特に二乗誤差損失の下で条件付き平均を予測する場合の診断です。二つのモデルの平均損失を比較する手法ではありません。その問いにはDiebold–Marianoの解説を参照してください。
トレーディング研究でもこの区別は重要です。リターン予測の平均的な偏りが小さくても尺度が適切とは限らず、ボラティリティ予測はある範囲で過大、別の範囲で過小になることがあります。MZ回帰は線形の不一致を示せますが、結果は評価標本、目標の定義、情報が利用可能だった時点、推論方法に依存します。予測を使った売買ルールが利益を生むことを証明する検定ではありません。
予測の起点、目標、データの時点をそろえる
各予測起点 t について、予測値 (fₜ) と、その予測対象だった後日の実現値 (yₜ) を対応させます。各ペアは固定予測期間に対応し、(fₜ) は先行する起点で後の目標 (yₜ) に向けて発行されたものです。以降の式では添字 t をこのペアの簡潔な表記として使います。変数、予測期間、単位、時刻の規約は一致させます。5日リターンの予測を1日リターンの実現値と組み合わせると、本来の目標に対するキャリブレーションを検定できません。
各起点で実際に利用できた予測を使い、予測値、モデルの版、データのビンテージ、情報の締切時刻を保存します。マクロ経済統計の初回公表値は後で改定されることがあります。初回値と後日の確定値のどちらを基準にするか決め、その選択を維持してください。過去の入力を改定値に置き換えると、当時の予測者が持っていなかった情報を評価に与えてしまう可能性があります。
取引データでは、終値間、日中、夜間の各成分を一貫した方法でそろえます。複数期間の目標が重複すると、隣り合う予測誤差にも依存が生まれます。共通の評価標本を使うことも重要です。変動の大きい日に一方のモデルだけ予測が欠けると、日付構成の違いがキャリブレーションの問題に見えることがあります。評価する予測系列で同じ目標と起点の予定を使ってください。
実際に生成した予測と標本内の当てはめ値を区別します。MZ回帰に使う観測値で予測モデルも推定していると、標本内の当てはまりがキャリブレーションに見えることがあります。将来の予測能力を評価するには、時系列順のアウト・オブ・サンプル予測を作り、各起点で当時利用できた情報だけを使って推定し直し、モデルや閾値の選択に使わない最終確認期間を確保します。
Mincer–Zarnowitz回帰を推定し、帰無仮説を明示する
標準的な水準回帰は次のとおりです。
yₜ = α + β fₜ + uₜ
ここで (yₜ) は実現した目標、(fₜ) は予測、(uₜ) は回帰残差です。一般的な共同キャリブレーション制約は
H₀: α = 0 かつ β = 1
です。両方が成立すれば、実現値と予測値の当てはめ関係は恒等線になります。定数のずれは不要で、予測が1単位変われば当てはめられた実現値も1単位変わります。回帰を推定したうえで、標本設計に適した共分散推定を用いてWald検定または同等のF検定で二つの制約を同時に検定します。切片と傾きを別々に検定することは、共同制約を検定することと同じではありません。
回帰残差 (uₜ) は、生の予測誤差 (yₜ − fₜ) と常に同じとは限りません。共同帰無仮説の下では等しくなりますが、仮説から外れると推定切片と傾きが線形のずれや尺度変更を吸収します。係数だけでなく実際の予測誤差も報告し、平均的な外れとキャリブレーション関係の両方を示します。
MZ制約は予測の不偏性や合理性の検定と呼ばれることもあります。用語の定義を明確にしてください。無条件平均予測誤差ゼロの条件は (E[yₜ − fₜ] = 0) です。一方で (α = 0, β = 1) は特定の線形関係を課すため、一般にはより強い条件です。HoldenとPeelは、自らの定式化では従来の共同制約が不偏性の十分条件だが必要条件ではないことを示しています(1990年論文)。検定する制約を示さずに「不偏」と「MZキャリブレーション」を同義語として扱わないでください。
<!-- learn:illustration -->

小さな例で平均バイアスと共同制約を区別する
次の三つの仮想的な予測と後日の実現値を考えます。
| 予測 (fₜ) | 実現値 (yₜ) | 誤差 (yₜ − fₜ) |
|---|---|---|
| 1 | 1.5 | 0.5 |
| 2 | 2.0 | 0.0 |
| 3 | 2.5 | −0.5 |
予測の平均も実現値の平均も2で、予測誤差の平均はゼロです。しかし各値は (yₜ = 1 + 0.5 fₜ) に従うため、MZ回帰の切片は (α = 1)、傾きは (β = 0.5) であり、(0, 1) ではありません。誤差は平均で相殺されても、線形キャリブレーション制約は成立しません。この作例では実現値の変動幅は予測の半分です。
これは計算を説明するために手作業で作った例であり、市場データでも推論用の標本でもありません。ノイズのない3点から意味のあるp値を報告したり、実際の予測システムが失敗したと主張したりするのは適切ではありません。実データの共同検定は推定の不確実性を考慮します。大きな係数差でも推定が不精確な場合があり、観測が十分なら小さな差を精確に推定できることもあります。この例が示すのは、平均誤差とMZ制約が別の問いだという点だけです。
(1 + 0.5 fₜ) のように再キャリブレーションすれば、係数をこの3点から作ったため、同じ値を完全に再現できます。それは将来もうまくいく証拠ではありません。再キャリブレーションが予測手順の一部なら、先行する学習期間で推定し、係数の決定に使っていない後続データで評価してください。
切片、傾き、決定係数を合わせて読む
切片 (α) は予測値がゼロのときの当てはめ値です。実務上の意味はゼロが予測の範囲内または近くにあるかで変わります。傾き (β) は予測値の変化に対して当てはめ値がどの程度変化するかを表します。切片を考慮したうえで、傾きが1未満なら予測の変化の方が大きく、1を超えるなら当てはめ値の変化の方が大きいことになります。もう一方の係数も自由なら、片方だけでは関係を十分に表せません。
(R²) が高くてもキャリブレーション成立を示しません。例えばノイズのない (yₜ = 2 + 1.1 fₜ) は (R² = 1) ですが、MZ帰無仮説を満たしません。(R²) は線形適合が標本変動をどれだけ説明するかを要約しますが、共同検定はその直線が恒等線かを問います。逆にノイズの多い予測では、制約が棄却されなくても (R²) が低くなりえます。キャリブレーションと精度は関連しますが異なる性質です。
二つの個別t統計量だけから結果を推測しないでください。切片と傾きの推定値は相関しうるため、共同Wald/F統計量では共分散を使います。(α)、(β)、それぞれの不確実性、共同統計量とp値、標本数、平均生誤差を報告します。必要なら恒等線付き散布図やビン別比較も示し、データを見てからビンを選んだ場合は明記します。線形検定では曲線的なずれ、レジーム変化、裾での誤差を見落とすことがあります。
キャリブレーションは完全な予測効率性より弱い
二乗誤差損失の下で最適な点予測は、予測者の情報集合を条件とした目標の条件付き期待値です。この条件では、予測時点で利用可能だった情報が後の誤差を予測できないはずです。しかしMZ回帰が検定するのは予測値自体と定数を含む線形関係だけで、情報集合内の他の変数をすべて検定するわけではありません。
より厳しい診断では、事前に選んだ情報変数 (zₜ) を予測誤差回帰に加える方法があります。例えば
yₜ − fₜ = δ₀ + δ₁ zₜ + vₜ
です。予測起点で既知の変数が後の誤差を予測するなら、利用できる情報を活用し損ねた可能性があります。変数の時点を正しく合わせ、慎重に選ぶ必要があります。多くのラグ、市場状態、変換を試すと別の多重探索問題が生じます。短い変数リストから予測力が見つからなくても、情報集合全体に対する効率性の証明にはなりません。
Zarnowitzは調査予測のバイアス、系列相関、標本数、検定力を論じています(NBERワーキングペーパー1070、1983年)。そのためMZは線形キャリブレーション診断、または弱い予測効率性チェックとして説明し、すべての関連情報を最適に利用した証明とは呼ばないでください。Giacomini–Whiteの解説は、選択された損失モーメントに基づく別の条件付き比較を扱います。
推定、重複、有限標本の不確実性を考慮する
特にローリング方式の複数期間予測では、誤差に不均一分散、系列相関、重複がありえます。通常のOLS係数公式だけでは、共同制約に対する有効な標準誤差は保証されません。予測期間、依存構造、推定手順に根拠のある推論方法を選び、明記してください。誤差が独立だと決めつけず、どの設計にも使える単一の帯域幅や補正があるとも考えないでください。
同じ短い標本でモデルのパラメータを推定し、キャリブレーション調整を作り、その調整を検定すると、通常の回帰の不確実性は手順全体を反映しないことがあります。予測モデルが入れ子になっている場合、精度比較の帰無分布が非標準になることもあります。実際の予測生成法に対応した結果を使うか、完全に仕様を決めた調整手順を後のホールドアウト標本で評価します。多数の式、目標、標本を試した後、最後のp値を確認的な結果として扱わないでください。
棄却されなかったからといってキャリブレーションの証明にはなりません。検定力不足や広い信頼区間が理由かもしれません。棄却結果も目標、標本、線形形式、共分散推定に条件づけられます。妥当な評価上の選択に対する感度を調べ、その結果を事前規定の検定と分けて開示してください。予測が強く持続する場合や独立した事例が少ない場合には特に重要です。
予測の問いに合った検定を選ぶ
MZは予測値と実現値について線形キャリブレーション制約を検定します。Diebold–Mariano検定は、選んだスコアの下で二つの予測手法の平均損失が等しいかを問います。ある予測がキャリブレーションされていてもそのスコアでは劣る場合があり、平均精度が高くてもMZ検定を満たさないことがあります。
予測起点で利用可能な情報によって精度が変化するかが問いなら、Giacomini–White検定は選択された条件付き損失モーメントを評価します。多くの予測や売買ルールを試したなら、Model Confidence SetやWhite Reality Check/Hansen SPAのような候補群単位の手法が別の選択問題を扱います。いずれも、明確な目標や正直な予測起点の代わりにはなりません。
標準的なMZ水準回帰は数値目標の点予測を対象とします。分位点、確率、区間、密度の予測には、その対象に合ったキャリブレーション検定とスコアが必要です。平均予測の良好な結果を、根拠なくテールリスク予測やボラティリティ分布に当てはめないでください。
再現できるようにキャリブレーション設計を報告する
目標、期間、単位、情報の締切、評価日、データの版、予測が本当にアウト・オブ・サンプルかを示します。回帰式、予測誤差の定義、検定した制約を記します。「不偏」が平均誤差ゼロを指すのか、共同MZ制約 (α = 0, β = 1) を指すのかも明確にしてください。
係数、標準誤差または信頼区間、共同Wald/F統計量、自由度、p値、予測起点数、平均予測誤差を報告し、(R²) の意味を限定して説明します。特に期間の重複や系列依存がある場合は、共分散推定やリサンプリング方法を述べます。モデル推定、再キャリブレーション、選択、試した別の目標、標本、変換も開示します。
透明な報告によって、平均的な偏り、線形キャリブレーション、情報効率性、相対的な予測精度を区別できます。これらは別々の実証的主張です。回帰制約を一つ満たしてもあらゆる予測利用が正当化されるわけではなく、予測評価だけではコスト控除後の利益も証明できません。
よくある質問
Q1Mincer–Zarnowitz検定は平均予測誤差だけを検定しますか?
いいえ。平均誤差は予測と実現値の平均を比較します。一般的なMZ検定は切片ゼロと傾き1を共同で制約します。HoldenとPeelは、自らの定式化で共同制約が不偏性の十分条件だが必要条件ではないことを示しています。
Q2MZ検定に通れば予測効率性が証明されますか?
いいえ。検定するのは予測値を含む線形関係であり、予測起点で利用可能なすべての情報が誤差を予測できないことではありません。効率性はより強い情報集合の条件を要します。
Q3VaRや分位点の予測にも同じ回帰を使えますか?
キャリブレーションの定義と推論を変えずには使えません。標準的な水準回帰は数値の点予測向けで、分位点やテール予測には専用の検定とスコアが必要です。
Q4キャリブレーションは売買戦略の収益性を証明しますか?
いいえ。キャリブレーションは予測と実現値の関係を表します。収益性には事前に定めた判断規則と、約定、手数料、資金調達、マーケットインパクト、リスクを含む別のアウト・オブ・サンプル評価が必要です。 主要研究 - Mincer and Zarnowitz, “The Evaluation of Economic Forecasts” (1969) - Holden and Peel, “On Testing for Unbiasedness and Efficiency of Forecasts” (1990) - Zarnowitz, “Rational Expectations and Macroeconomic Forecasts” (NBER Working Paper 1070, 1983) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995) - Giacomini and White, “Tests of Conditional Predictive Ability” (2006)
出典
問題を報告
この記事のリンクを含むメールを準備します。送信すると Mark に報告が届きます
クイックチェック
記事を読み終えたら、3問で確認しましょう
問題 01
Mincer–Zarnowitz水準回帰の一般的な共同帰無仮説はどれですか?
答えを選ぶと解説を確認できます
オプション用語集
コール、プット、オプションチェーンから IV、グリークス、建玉、マックスペインまで、主要用語を正確に解説します
オプション用語集を見る