Skip to content
所有選擇權指南
弱識別下的第一階段證據與推論14 分鐘閱讀

弱工具變數診斷:第一階段 F 與穩健推論

了解第一階段 F 統計量、偏 R²、Stock–Yogo 準則、穩健診斷與 Anderson–Rubin 推論,分別如何回答弱工具變數的不同問題。

本指南內容為什麼工具變數強度很重要

簡短摘要

第一階段統計量描述在控制納入的變數後,被排除工具變數對內生解釋變數的解釋程度。它無法證明工具變數有效,「F 大於 10」也不是通用保證。 適用的診斷取決於內生解釋變數的數量和誤差假設;弱 IV 穩健推論仍可能得到很寬或無界的信賴集合。

為什麼工具變數強度很重要

工具變數法使用被排除工具變數 \(Z\) 所預測的內生解釋變數 \(X\) 之變異,同時控制納入的控制變數 \(W\)。

如果 \(Z\) 幾乎無法解釋 \(X\) 剩餘的變異,資料便很難從這個來源提供結構效果的資訊。

工具變數關聯性較弱時,有限樣本中的 2SLS 可能向 OLS 偏誤,其抽樣分布也可能明顯偏離常態近似。因此,即使標準誤看起來精確,傳統 Wald 區間的涵蓋率仍可能不佳。

Staiger 和 Stock 提出弱工具變數漸近理論,說明這些問題並支持採用非傳統的信賴區域(1997 年論文)。

強度只是識別的一部分。第一階段很強,無法證明 \(Z\) 與結構誤差獨立,也無法證明 \(Z\) 只透過 \(X\) 影響結果。

工具變數指南會分別討論這些假設和實際識別的效果。

第一階段隔離工具變數的條件變異

對一個內生解釋變數和 \(q\) 個被排除工具變數,第一階段可寫成

\[ X_t = W_t'\delta + Z_t'\pi + v_t. \]

其中 \(W_t\) 包含納入的外生控制變數,通常也包括截距;\(Z_t\) 則包含被排除工具變數。標準第一階段 F 檢定 \(H_0:\pi=0\),也就是被排除工具變數在控制 \(W_t\) 後,整體沒有增加解釋能力這項聯合限制。

這是在問條件關聯性,不是檢定排除限制或獨立性。請說明納入哪些控制變數、檢定幾個被排除工具變數、使用的樣本與變異數假設,以及採用的統計量。

如果有多個被排除工具變數,個別係數的 t 統計量不能取代聯合檢定。

偏 R² 和傳統 F 統計量

偏 \(R^2\) 衡量移除 \(W\) 的影響後,已將 \(W\) 的影響扣除的被排除工具變數,能解釋 \(X\) 剩餘變異的比例。

令 \(R^2_p\) 表示偏 \(R^2\),\(n\) 為樣本數,\(k\) 為納入的迴歸項數目(若使用截距也包含在內),\(q\) 為被排除工具變數的數量。

在傳統同質變異線性迴歸計算下,增量 F 統計量為

\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]

分子衡量每一項被排除工具變數限制帶來的配適改善;分母利用第一階段完整的殘差自由度估計殘差變異數。這個公式不是所有穩健統計量都適用的通用恆等式。

穩健變異數共變異數估計量會改變檢定的計算方法和參考分布。

偏 \(R^2\) 和 F 彼此相關,但回答不同的描述性問題:偏 \(R^2\) 是無單位的配適程度指標,而 F 也受樣本數和限制數量影響。

在非常大的樣本中,即使偏 \(R^2\) 很小,F 仍可能很大;這不代表每一種有限樣本 IV 近似都可靠。

為什麼 F 大於 10 不是通用門檻

常見的 10 是經驗法則,不是通過或不通過的定理。Staiger 和 Stock 在特定弱工具變數架構中將它當成實用參考;它無法保證每種樣本、估計量、工具變數數目或誤差過程都能得到有效推論。

Stock 和 Yogo 以 2SLS 相對偏誤上限或 Wald 檢定規模扭曲上限定義工具變數的弱度,並為這些特定準則整理臨界值。因此,臨界值取決於採用的準則和模型維度。

他們對傳統第一階段及 Cragg–Donald 統計量的結果,假設誤差同質變異且彼此獨立。

那些表格的數值不能不加調整地套用到所有穩健設定(作者託管的章節頁面)。

F 大於 10 不能證明排除限制、獨立性或因果解釋成立。F 小於 10 也不能證明工具變數沒有用途或某個估計無效。

應在明確列出的假設下,把統計量視為診斷,再選擇符合研究設計的推論方法。

Hansen J 檢定指南說明過度識別檢定為什麼不能取代強度評估。

<!-- learn:illustration -->

一條纖細金色絲線將小琥珀晶體與廣闊薄霧中的大型藍色玻璃球連起來
弱第一階段關聯及其周圍不確定性的概念圖;不是資料或診斷結果。

有多個內生解釋變數時需要聯合評估強度

若內生解釋變數超過一個,分開計算的第一階段 F 可能會漏掉識別較弱的線性組合。

每個解釋變數單獨看來或許都能被預測,但工具變數所帶來的變異未必涵蓋精確估計所有結構係數所需的組合。

在同質變異線性 IV 架構下,Cragg–Donald 最小特徵值統計量會概括這項聯合識別資訊。Stock–Yogo 為它提供的臨界值,是針對已指定的偏誤或檢定規模扭曲準則。

假設條件很重要:有任意異質變異、序列相依或群聚時,常用的臨界值不會自動保持有效。

被排除工具變數的數量、內生解釋變數的數量,以及第一階段係數矩陣的秩都很重要。說明完整設定並採用為該模型設計的檢定;不要把個別第一階段 F 平均後,當作聯合強度的證據。

穩健誤差需要搭配研究設計的診斷

金融觀測值可能有異質變異、序列相依,或依公司、交易場所或政策單位群聚。第二階段標準誤即使採用群聚調整,也不會讓傳統第一階段 F 或 Cragg–Donald 校準自動變得穩健。

對一個內生解釋變數,Montiel Olea 和 Pflueger 提出 effective-F 弱工具變數檢定。在他們列明的條件下,這項檢定可處理異質變異、自相關和群聚。

它會利用變異數共變異數資訊調整傳統第一階段 F,再與特定準則的臨界值比較(2013 年論文)。

effective F 和軟體回報的所有穩健 Wald F 統計量並不是同一個數值。

Kleibergen–Paap rk Wald F 常和穩健變異數共變異數估計量一起報告,但 Stock–Yogo 臨界值是根據不同的傳統統計量和假設推導。不要把兩者當成使用同一校準尺度來比較。

請報告估計量、統計量、變異數共變異數估計量、群聚層級或依賴處理方式,以及臨界值採用的架構。

Newey–West 或 cluster-robust 共變異數估計在相關假設下處理抽樣不確定性,但本身無法解決弱識別。

關聯性弱時,Anderson–Rubin 推論仍可能有效

在只有一個內生解釋變數的模型中,對候選係數值 \(\beta_0\),建立按該候選值調整後的結果 \(Y-X\beta_0\),再檢定控制納入變數後,被排除工具變數是否整體能解釋它。

在虛無假設及工具變數外生性成立時,這是對 \(\beta=\beta_0\) 進行 Anderson–Rubin 檢定。

因為這個檢定不會除以估計出的第一階段係數,所以有效性不需要仰賴該係數夠大。

原始 Anderson–Rubin 方法採用模型的分布假設;實際應用時,變異數共變異數估計量和參考分布也必須配合抽樣設計。「穩健」這個標籤不代表可以忽略群聚數量太少或序列相依。

將候選值範圍內的檢定反轉,即可得到信賴集合。資訊有限時,集合可能很寬、不連續或無界;這代表識別資訊有限,不是軟體失效。Anderson–Rubin 檢定的檢定力也可能偏低。

GMM 過度識別指南處理不同問題,不應視為弱 IV 穩健的係數推論。

原始論文是 Anderson 和 Rubin(1949)。

偏 F 計算範例

假設某個第一階段有 \(n=200\) 筆觀測值,\(k=3\) 個納入的迴歸項(包括截距),\(q=2\) 個被排除工具變數,且偏 \(R^2_p=0.04\)。

依照傳統同質變異公式,殘差自由度為 \(200-3-2=195\)。

\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]

在這些輸入和假設下,計算結果表示傳統聯合統計量為 4.0625。單靠這個數字,無法證明工具變數無效、無法決定 Stock–Yogo 特定準則下的結論,也無法確認異質變異或群聚環境下的結果。

穩健分析需要使用符合研究設計的統計量和校準方法。

如果相同的兩個工具變數用於模糊迴歸不連續設計,第一階段的不連續性就是該設計特定的相關性分析之一部分。

上述 F 計算不能取代 RDD 假設、頻寬選擇或符合該設計的推論方法。

分開報告診斷與識別論證

列出內生解釋變數、被排除工具變數、納入的控制變數、樣本、第一階段係數、偏 \(R^2\) 和精確的強度統計量。

如果有多個內生解釋變數,指出聯合統計量及其假設;穩健設定下,應列明變異數共變異數和臨界值方法,不要只寫「F = …」。

如果統計量顯示識別偏弱,應報告目標係數的弱 IV 穩健檢定或信賴集合。說明集合是否有界,以及集合形狀如何改變實質結論。

不要只因傳統 Wald 區間比較容易摘要,就用它取代資訊不足的區間。

最後,使用制度和經濟證據論證工具變數的獨立性及排除途徑。相關性診斷、平衡檢查、安慰劑結果和過度識別檢定可以找出問題,但無法證明每一項假設。

差異中的差異設計採用不同的識別假設;第一階段較強不代表它可以取代差異中的差異設計。

常見問題

Q1第一階段 F 大於 10 能證明工具變數有效嗎?

不能。它最多是在特定校準條件下的相關性診斷,無法證明獨立性或排除限制。

Q2偏 R² 和第一階段 F 統計量相同嗎?

不同。偏 R² 描述增量配適度。傳統 F 也會受到樣本數、限制數量和殘差自由度影響。

Q3可以直接將穩健 F 和 Stock–Yogo 臨界值比較嗎?

只有統計量與假設都符合該校準方法時才可以。穩健統計量通常需要不同的臨界值和解讀方式。

Q4工具變數看起來偏弱時應報告什麼?

報告符合研究設計的診斷,以及弱 IV 穩健檢定或信賴集合,並說明集合是否很寬、分離或無界。

資料來源與延伸閱讀

回報問題

我們會準備一封包含本文連結的電子郵件。寄出後,Mark 才會收到你的回報

快速檢查

讀完指南後,用 3 道題檢查一下

問題 1 / 3

問題 01

傳統第一階段 F 檢定評估什麼?

選擇答案即可查看解釋

期權術語表