弱工具變數診斷:第一階段 F 與穩健推論
了解第一階段 F 統計量、偏 R²、Stock–Yogo 準則、穩健診斷與 Anderson–Rubin 推論,分別如何回答弱工具變數的不同問題。
本指南內容為什麼工具變數強度很重要
簡短摘要
第一階段統計量描述在控制納入的變數後,被排除工具變數對內生解釋變數的解釋程度。它無法證明工具變數有效,「F 大於 10」也不是通用保證。 適用的診斷取決於內生解釋變數的數量和誤差假設;弱 IV 穩健推論仍可能得到很寬或無界的信賴集合。
為什麼工具變數強度很重要
工具變數法使用被排除工具變數 \(Z\) 所預測的內生解釋變數 \(X\) 之變異,同時控制納入的控制變數 \(W\)。
如果 \(Z\) 幾乎無法解釋 \(X\) 剩餘的變異,資料便很難從這個來源提供結構效果的資訊。
工具變數關聯性較弱時,有限樣本中的 2SLS 可能向 OLS 偏誤,其抽樣分布也可能明顯偏離常態近似。因此,即使標準誤看起來精確,傳統 Wald 區間的涵蓋率仍可能不佳。
Staiger 和 Stock 提出弱工具變數漸近理論,說明這些問題並支持採用非傳統的信賴區域(1997 年論文)。
強度只是識別的一部分。第一階段很強,無法證明 \(Z\) 與結構誤差獨立,也無法證明 \(Z\) 只透過 \(X\) 影響結果。
工具變數指南會分別討論這些假設和實際識別的效果。
第一階段隔離工具變數的條件變異
對一個內生解釋變數和 \(q\) 個被排除工具變數,第一階段可寫成
\[ X_t = W_t'\delta + Z_t'\pi + v_t. \]
其中 \(W_t\) 包含納入的外生控制變數,通常也包括截距;\(Z_t\) 則包含被排除工具變數。標準第一階段 F 檢定 \(H_0:\pi=0\),也就是被排除工具變數在控制 \(W_t\) 後,整體沒有增加解釋能力這項聯合限制。
這是在問條件關聯性,不是檢定排除限制或獨立性。請說明納入哪些控制變數、檢定幾個被排除工具變數、使用的樣本與變異數假設,以及採用的統計量。
如果有多個被排除工具變數,個別係數的 t 統計量不能取代聯合檢定。
偏 R² 和傳統 F 統計量
偏 \(R^2\) 衡量移除 \(W\) 的影響後,已將 \(W\) 的影響扣除的被排除工具變數,能解釋 \(X\) 剩餘變異的比例。
令 \(R^2_p\) 表示偏 \(R^2\),\(n\) 為樣本數,\(k\) 為納入的迴歸項數目(若使用截距也包含在內),\(q\) 為被排除工具變數的數量。
在傳統同質變異線性迴歸計算下,增量 F 統計量為
\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]
穩健變異數共變異數估計量會改變檢定的計算方法和參考分布。
偏 \(R^2\) 和 F 彼此相關,但回答不同的描述性問題:偏 \(R^2\) 是無單位的配適程度指標,而 F 也受樣本數和限制數量影響。
在非常大的樣本中,即使偏 \(R^2\) 很小,F 仍可能很大;這不代表每一種有限樣本 IV 近似都可靠。
為什麼 F 大於 10 不是通用門檻
常見的 10 是經驗法則,不是通過或不通過的定理。Staiger 和 Stock 在特定弱工具變數架構中將它當成實用參考;它無法保證每種樣本、估計量、工具變數數目或誤差過程都能得到有效推論。
Stock 和 Yogo 以 2SLS 相對偏誤上限或 Wald 檢定規模扭曲上限定義工具變數的弱度,並為這些特定準則整理臨界值。因此,臨界值取決於採用的準則和模型維度。
他們對傳統第一階段及 Cragg–Donald 統計量的結果,假設誤差同質變異且彼此獨立。
那些表格的數值不能不加調整地套用到所有穩健設定(作者託管的章節頁面)。
F 大於 10 不能證明排除限制、獨立性或因果解釋成立。F 小於 10 也不能證明工具變數沒有用途或某個估計無效。
應在明確列出的假設下,把統計量視為診斷,再選擇符合研究設計的推論方法。
Hansen J 檢定指南說明過度識別檢定為什麼不能取代強度評估。
<!-- learn:illustration -->

有多個內生解釋變數時需要聯合評估強度
穩健誤差需要搭配研究設計的診斷
金融觀測值可能有異質變異、序列相依,或依公司、交易場所或政策單位群聚。第二階段標準誤即使採用群聚調整,也不會讓傳統第一階段 F 或 Cragg–Donald 校準自動變得穩健。
對一個內生解釋變數,Montiel Olea 和 Pflueger 提出 effective-F 弱工具變數檢定。在他們列明的條件下,這項檢定可處理異質變異、自相關和群聚。
它會利用變異數共變異數資訊調整傳統第一階段 F,再與特定準則的臨界值比較(2013 年論文)。
effective F 和軟體回報的所有穩健 Wald F 統計量並不是同一個數值。
Kleibergen–Paap rk Wald F 常和穩健變異數共變異數估計量一起報告,但 Stock–Yogo 臨界值是根據不同的傳統統計量和假設推導。不要把兩者當成使用同一校準尺度來比較。
請報告估計量、統計量、變異數共變異數估計量、群聚層級或依賴處理方式,以及臨界值採用的架構。
Newey–West 或 cluster-robust 共變異數估計在相關假設下處理抽樣不確定性,但本身無法解決弱識別。
關聯性弱時,Anderson–Rubin 推論仍可能有效
在只有一個內生解釋變數的模型中,對候選係數值 \(\beta_0\),建立按該候選值調整後的結果 \(Y-X\beta_0\),再檢定控制納入變數後,被排除工具變數是否整體能解釋它。
在虛無假設及工具變數外生性成立時,這是對 \(\beta=\beta_0\) 進行 Anderson–Rubin 檢定。
因為這個檢定不會除以估計出的第一階段係數,所以有效性不需要仰賴該係數夠大。
原始 Anderson–Rubin 方法採用模型的分布假設;實際應用時,變異數共變異數估計量和參考分布也必須配合抽樣設計。「穩健」這個標籤不代表可以忽略群聚數量太少或序列相依。
將候選值範圍內的檢定反轉,即可得到信賴集合。資訊有限時,集合可能很寬、不連續或無界;這代表識別資訊有限,不是軟體失效。Anderson–Rubin 檢定的檢定力也可能偏低。
GMM 過度識別指南處理不同問題,不應視為弱 IV 穩健的係數推論。
原始論文是 Anderson 和 Rubin(1949)。
偏 F 計算範例
假設某個第一階段有 \(n=200\) 筆觀測值,\(k=3\) 個納入的迴歸項(包括截距),\(q=2\) 個被排除工具變數,且偏 \(R^2_p=0.04\)。
依照傳統同質變異公式,殘差自由度為 \(200-3-2=195\)。
\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]
在這些輸入和假設下,計算結果表示傳統聯合統計量為 4.0625。單靠這個數字,無法證明工具變數無效、無法決定 Stock–Yogo 特定準則下的結論,也無法確認異質變異或群聚環境下的結果。
穩健分析需要使用符合研究設計的統計量和校準方法。
如果相同的兩個工具變數用於模糊迴歸不連續設計,第一階段的不連續性就是該設計特定的相關性分析之一部分。
上述 F 計算不能取代 RDD 假設、頻寬選擇或符合該設計的推論方法。
分開報告診斷與識別論證
列出內生解釋變數、被排除工具變數、納入的控制變數、樣本、第一階段係數、偏 \(R^2\) 和精確的強度統計量。
如果有多個內生解釋變數,指出聯合統計量及其假設;穩健設定下,應列明變異數共變異數和臨界值方法,不要只寫「F = …」。
如果統計量顯示識別偏弱,應報告目標係數的弱 IV 穩健檢定或信賴集合。說明集合是否有界,以及集合形狀如何改變實質結論。
不要只因傳統 Wald 區間比較容易摘要,就用它取代資訊不足的區間。
最後,使用制度和經濟證據論證工具變數的獨立性及排除途徑。相關性診斷、平衡檢查、安慰劑結果和過度識別檢定可以找出問題,但無法證明每一項假設。
差異中的差異設計採用不同的識別假設;第一階段較強不代表它可以取代差異中的差異設計。
常見問題
Q1第一階段 F 大於 10 能證明工具變數有效嗎?
不能。它最多是在特定校準條件下的相關性診斷,無法證明獨立性或排除限制。
Q2偏 R² 和第一階段 F 統計量相同嗎?
不同。偏 R² 描述增量配適度。傳統 F 也會受到樣本數、限制數量和殘差自由度影響。
Q3可以直接將穩健 F 和 Stock–Yogo 臨界值比較嗎?
只有統計量與假設都符合該校準方法時才可以。穩健統計量通常需要不同的臨界值和解讀方式。
Q4工具變數看起來偏弱時應報告什麼?
報告符合研究設計的診斷,以及弱 IV 穩健檢定或信賴集合,並說明集合是否很寬、分離或無界。
資料來源與延伸閱讀
回報問題
我們會準備一封包含本文連結的電子郵件。寄出後,Mark 才會收到你的回報
快速檢查
讀完指南後,用 3 道題檢查一下
問題 01
傳統第一階段 F 檢定評估什麼?
選擇答案即可查看解釋