弱い操作変数の診断:第一段階F統計量と頑健な推論
第一段階F統計量、偏R二乗、Stock–Yogo基準、頑健な診断、Anderson–Rubin推論が、弱い操作変数について異なる問いにどう答えるかを解説します。
このガイドの内容操作変数の強さが重要な理由
短い要約
第一段階の統計量は、含めた統制変数を条件とした後、除外操作変数が内生回帰変数をどれだけ説明するかを要約します。これは操作変数の妥当性を示すものではなく、「Fが10を超えれば安全」という普遍的な保証もありません。適切な診断は、内生回帰変数の数と誤差の仮定によって異なります。弱いIVに頑健な信頼集合は、広くなったり非有界になったりする場合があります。 操作変数の強さは識別の一側面にすぎません。第一段階が強くても、除外操作変数が構造誤差から独立であることや、内生回帰変数 (X) を通じてのみ結果に影響することは証明できません。
操作変数の強さが重要な理由
操作変数法では、含めた統制変数 (W) を条件として、除外操作変数 (Z) によって予測される内生回帰変数 (X) の変動を利用します。(Z) が (X) に残る変動をほとんど予測しない場合、この情報源から得られる構造的効果の情報も乏しくなります。
関連性が弱いと、有限標本で2SLS推定値がOLSに偏ることがあり、標本分布は正規近似から大きく外れ得ます。標準誤差が精密に見えても、通常のWald信頼区間の被覆率が悪くなる場合があります。StaigerとStockは弱い操作変数の漸近論を展開し、こうした問題と非標準的な信頼領域の必要性を説明しています(1997年論文)。
強さは識別の一部にすぎません。第一段階が強くても、(Z) が構造誤差から独立か、(X) を介さずに結果へ影響しないかは確認できません。操作変数ガイドでは、これらの別個の仮定と識別される効果を説明しています。
第一段階で条件付きの操作変数変動を分離する
内生回帰変数が1つ、除外操作変数が (q) 個の場合、第一段階を次のように書きます。
\[ X_t = W_t'\delta + Z_t'\pi + v_t. \]
ここで (W_t) は切片を含む場合もある含有外生統制変数、(Z_t) は除外操作変数です。標準的な第一段階F検定は (H_0:\pi=0)、つまり (W_t) の後に除外操作変数が追加の説明力を持たないという共同制約を検定します。
これは条件付き関連性についての問いであり、除外制約や独立性の検定ではありません。含めた統制変数、同時に検定する除外操作変数の数、標本と共分散の仮定、使用した統計量を報告してください。除外操作変数が複数ある場合、個々の係数のt統計量で共同検定を代用できません。
偏R二乗と通常のF統計量
偏 (R^2) は、(W) を取り除いた後に (X) に残る変動のうち、残差化した除外操作変数が説明する割合を測ります。これを (R^2_p) とします。(n) は標本数、(k) は切片を含む場合の含有回帰変数の数、(q) は除外操作変数の数です。
等分散の線形回帰で通常用いる計算では、増分F統計量は次のとおりです。
\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]
分子は除外操作変数の制約1つ当たりの適合度改善を示し、分母は第一段階全体の残差自由度を使って残差分散を推定します。この式は、あらゆる頑健統計量に共通する恒等式ではありません。
頑健な共分散推定量を使うと、検定の計算方法と参照分布が変わります。
偏 (R^2) とFは関連しますが、異なる記述的な問いに答えます。偏 (R^2) は尺度に依存しない適合度の指標であり、Fは標本数と制約数も反映します。
非常に大きな標本では偏 (R^2) が小さくてもFが大きくなることがありますが、あらゆる有限標本IV近似が信頼できるとは限りません。
Fが10を超えても普遍的な閾値ではない
よく知られた10という値は経験則であり、合否を決める定理ではありません。StaigerとStockは特定の弱操作変数の枠組みで実務上の目安として論じましたが、標本、推定量、操作変数の数、誤差過程を問わず推論が有効になる保証ではありません。
StockとYogoは、2SLSの相対的なバイアス上限やWald検定のサイズ歪みという基準で操作変数の弱さを定義し、それぞれの基準に対する臨界値を示しています。したがって臨界値は、選んだ基準とモデルの次元によって異なります。通常の第一段階とCragg–Donaldの結果は、等分散かつ独立な誤差を前提としています。
その表の数値を、あらゆる頑健な設定に変更なしで適用することはできません(著者の章のページ)。
Fが10を超えても、除外制約、独立性、因果解釈が証明されるわけではありません。10未満でも、操作変数が役に立たない、または特定の推定値が無効だと証明されるわけではありません。明記した仮定の下で診断統計量として扱い、設計に合った推論を選んでください。Hansen J検定ガイドでは、過剰識別検定が強さの評価に代わらない理由を説明しています。
<!-- learn:illustration -->

内生回帰変数が複数なら共同の強さを評価する
内生回帰変数が複数ある場合、個別の第一段階F統計量では、識別が弱い線形結合を見落とすことがあります。
各変数が個別には予測されているように見えても、操作変数が生み出す変動では、すべての構造係数を精密に推定するために必要な組み合わせを十分に張れない可能性があります。
等分散の線形IV設定では、Cragg–Donald最小固有値統計量がこの共同識別情報を要約します。Stock–Yogoの臨界値は、この統計量について明示されたバイアスまたはサイズ歪みの基準を対象とします。
仮定は重要です。よく使われる臨界値は、任意の異分散、系列相関、クラスタリングの後でも自動的に有効になるわけではありません。
除外操作変数の数、内生回帰変数の数、第一段階係数行列のランクはいずれも重要です。全体の設定に合う検定を使い、個別の第一段階Fを平均して共同の強さを推測しないでください。
頑健な誤差には設計に合った診断が必要
金融データには、異分散、系列依存、企業・取引所・政策単位ごとのクラスタリングが含まれる場合があります。第二段階の標準誤差をクラスタリングしても、古典的な第一段階FやCragg–Donaldの較正が頑健になるわけではありません。
内生回帰変数が1つの場合、Montiel OleaとPfluegerは、明記された条件の下で異分散、自己相関、クラスタリングを許容するeffective-F検定を開発しました。
これは共分散情報を使って通常の第一段階Fを尺度調整し、その後、基準ごとの臨界値と比較します(2013年論文)。
effective Fは、ソフトウェアが出力するあらゆる頑健Wald Fと同じ量ではありません。
Kleibergen–Paap rk Wald Fは頑健な共分散推定量と併せて広く報告されますが、Stock–Yogoの臨界値は異なる通常の統計量と仮定の下で導出されました。較正尺度が共通であるかのように数値を比較しないでください。
推定量、統計量、共分散推定量、クラスタリングの水準または依存の扱い、臨界値の枠組みを報告してください。
Newey–Westまたはクラスタ頑健共分散推定は、仮定の下で標本不確実性を扱いますが、それだけで弱識別を解消するわけではありません。
| データとモデル | 主な診断 | あわせて示す条件 |
|---|---|---|
| 内生変数1つ、通常の等分散線形モデル | 第一段階Fと対応するStock–Yogo基準 | バイアスまたはサイズ歪みの基準、操作変数数 |
| 内生変数が複数、通常の線形モデル | Cragg–Donald最小固有値統計量 | 内生変数数、等分散・独立誤差の仮定 |
| 内生変数1つ、異分散・系列・クラスタ誤差 | effective Fなど設計に合った診断 | 共分散推定、クラスタ数、対応する臨界値 |
| 弱い関連性の下での係数推論 | Anderson–Rubin検定の反転 | 操作変数の外生性、検定設定、信頼集合の形 |
この表は、すべての研究に単一の統計量を指定するものではありません。現在の設計に近い行と、その設定が診断の根拠にどの程度一致するかを確認するためのチェックリストです。
Anderson–Rubin推論は関連性が弱くても有効であり得る
内生回帰変数が1つのモデルで、候補係数値を \(\beta_0\) とします。その候補値で調整した結果 \(Y-X\beta_0\) を作り、含有統制変数を条件に、除外操作変数がこれを共同で説明するかを検定します。
帰無仮説と操作変数の外生性の下で、これは \(\beta=\beta_0\) に対する Anderson–Rubin 検定です。
推定した第一段階係数で割る検定ではないため、その係数が大きいことに妥当性が依存する必要はありません。
元の Anderson–Rubin 構成はモデルの分布仮定を用います。実際の分析では、共分散推定量と参照分布も標本設計に合っていなければなりません。「頑健」と表示された検定でも、クラスタ数が少ない場合や系列依存を無視してよいわけではありません。
候補値全体で検定を反転すると信頼集合が得られます。情報が弱い場合、その集合は広く、分離し、または非有界になることがあります。これはソフトウェアの失敗ではなく、識別情報が限られていることを示す結果です。Anderson–Rubin検定は検出力が低い場合もあります。
GMM過剰識別ガイドは別の問いを扱うため、弱IVに頑健な係数推論として使うべきではありません。
原論文はAnderson and Rubin (1949)です。
偏F統計量の計算例
仮想的な第一段階で、観測数 (n=200)、切片を含む含有回帰変数が (k=3)、除外操作変数が (q=2)、偏 (R^2_p=0.04) だとします。
通常の等分散公式では、残差自由度は (200-3-2=195) です。
\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]
この計算が示すのは、入力値と仮定の下で通常の共同統計量が4.0625になることです。この値だけで操作変数の無効性を証明したり、Stock–Yogoの基準別の結論を決めたり、異分散やクラスタリング下でも同じ結果だと示したりはできません。
頑健な分析には、設計に合った統計量と較正が必要です。
同じ2つの操作変数をファジー回帰不連続デザインで使う場合、第一段階の不連続性は設計固有の関連性評価の一部です。
上記のF計算は、RDDの仮定、帯域幅の選択、その設計に適した推論の代わりにはなりません。
診断結果と識別の論拠を分けて報告する
内生回帰変数、除外操作変数、含有統制変数、標本、第一段階係数、偏 (R^2)、正確な強さの統計量を明記してください。
内生回帰変数が複数なら共同統計量とその仮定を示し、頑健な設定なら「F = …」だけでなく共分散と臨界値の方法を記載します。
統計量が弱識別を示唆する場合、対象係数について弱IVに頑健な検定または信頼集合を報告します。集合が有界か、その形が実質的な結論をどう変えるかを説明してください。
要約しやすいという理由だけで、情報の乏しい区間を通常のWald区間に置き換えないでください。
最後に、制度的・経済的な根拠を用いて操作変数の独立性と除外経路を論証します。関連性の診断、バランス検定、プラセボ結果、過剰識別検定は問題を明らかにすることがありますが、すべての仮定を証明するものではありません。
差の差デザインは異なる識別仮定を使います。第一段階が強くても、この設計と置き換え可能にはなりません。
よくある質問
Q1第一段階Fが10を超えれば操作変数は妥当ですか?
いいえ。特定の較正の下で関連性を診断する値にすぎません。独立性や除外制約を立証できません。
Q2偏R二乗は第一段階F統計量と同じですか?
いいえ。偏R二乗は追加的な適合度を示します。通常のFは標本数、制約数、残差自由度にも依存します。
Q3頑健なFをStock–Yogoの臨界値と直接比較できますか?
統計量と仮定がその較正に一致する場合に限ります。頑健な統計量では異なる臨界値と解釈が必要になることがよくあります。
Q4操作変数が弱いと思われる場合、何を報告すべきですか?
設計に合った診断と弱IVに頑健な検定または信頼集合を報告し、集合が広い、分離している、または非有界かも示します。
出典
問題を報告
この記事のリンクを含むメールを準備します。送信すると Mark に報告が届きます
クイックチェック
記事を読み終えたら、3問で確認しましょう
問題 01
通常の第一段階F検定は何を評価しますか?
答えを選ぶと解説を確認できます