Skip to content
所有期權指南
弱識別下的第一階段證據與推論14 分鐘閱讀

弱工具變數診斷:第一階段 F 與穩健推論

了解第一階段 F 統計量、偏 R²、Stock–Yogo 準則、穩健診斷和 Anderson–Rubin 推論如何分別回答弱工具變數的不同問題。

本指南內容為甚麼工具變數強度重要

簡短摘要

第一階段統計量說明在控制納入變數後,被排除工具變數對內生解釋變數的解釋程度。它不能證明工具變數有效,而「F 高於 10」亦非普遍保證。 相關診斷取決於內生解釋變數的數目及誤差假設;對弱 IV 穩健的推論仍可能很闊,甚至沒有上下界。

為甚麼工具變數強度重要

工具變數方法利用被排除工具變數 \(Z\) 所預測的內生解釋變數 \(X\) 的變動,同時控制納入的控制變數 \(W\)。

如果 \(Z\) 無法解釋 \(X\) 剩餘變動的多少,數據就很難從這個來源取得結構效應的資訊。

工具變數關聯性弱時,有限樣本中的 2SLS 可能偏向 OLS,其抽樣分佈亦可能明顯偏離常態近似。因此,即使標準誤看似精確,常規 Wald 信賴區間的涵蓋率仍可能欠佳。

Staiger 和 Stock 建立弱工具變數漸近理論,解釋這些失效情況,並提出使用非標準信賴區域的理由(1997 年論文)。

強度只是識別的一部分。第一階段強,並不能證明 \(Z\) 與結構誤差獨立,亦不能證明 \(Z\) 只透過 \(X\) 影響結果。

工具變數指南會分開討論這些假設和所識別的效應。

第一階段隔離工具變數的條件變動

對於一個內生解釋變數和 \(q\) 個被排除工具變數,第一階段可寫成

\[ X_t = W_t'\delta + Z_t'\pi + v_t. \]

其中 \(W_t\) 包含納入的外生控制變數,通常亦包括截距;\(Z_t\) 則包含被排除工具變數。標準第一階段 F 檢驗 \(H_0:\pi=0\),即被排除工具變數在控制 \(W_t\) 後,整體上沒有增加解釋力這項聯合限制。

這是條件關聯性的問題,並非檢驗排除限制或獨立性。請列明納入了哪些控制變數、檢驗多少個被排除工具變數、使用的樣本和協方差假設,以及採用哪個統計量。

有多個被排除工具變數時,單一係數的 t 統計量不能取代聯合檢驗。

偏 R² 與常規 F 統計量

偏 \(R^2\) 衡量扣除 \(W\) 的影響後,已殘差化的被排除工具變數能解釋 \(X\) 剩餘變動的比例。

以 \(R^2_p\) 表示偏 \(R^2\),\(n\) 表示樣本數,\(k\) 表示納入的迴歸項數目(如有使用截距,亦計算在內),\(q\) 表示被排除工具變數的數目。

在常規同方差線性迴歸計算下,增量 F 統計量為

\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]

分子衡量每個被排除工具變數限制帶來的配適度改善;分母則利用第一階段完整的殘差自由度估計殘差變異數。這條公式並非所有穩健統計量通用的恆等式。

穩健協方差估計量會改變檢驗的計算方式及參考分佈。

偏 \(R^2\) 和 F 相關,但回答不同的描述性問題:偏 \(R^2\) 是無單位的配適度指標,F 則亦受樣本數和限制數目影響。

在非常大的樣本中,偏 \(R^2\) 即使很小,F 仍可能很大;但這不代表每一種有限樣本 IV 近似都可靠。

為甚麼 F 高於 10 並非普遍門檻

常見的 10 是經驗法則,而非判定合格與否的定理。Staiger 和 Stock 在特定弱工具變數框架下,把它視為實用參考;它不能保證所有樣本、估計量、工具變數數目或誤差過程都能得出有效推論。

Stock 和 Yogo 根據 2SLS 相對偏誤上限或 Wald 檢驗大小扭曲上限來界定工具變數弱度,並為所選準則列出臨界值。因此,臨界值取決於所選準則和模型維度。

他們有關常規第一階段和 Cragg–Donald 統計量的結果,假設誤差同方差且互相獨立。

表格中的數值不能不作調整便套用到所有穩健設定(作者托管的章節頁面)。

F 高於 10 不能證明排除限制、獨立性或因果解讀成立。F 低於 10 亦不能證明工具變數無用或特定估計無效。

應在列明的假設下把統計量當作診斷,再選擇符合研究設計的推論方法。

Hansen J 檢驗指南說明過度識別檢驗為何不能代替強度評估。

<!-- learn:illustration -->

一條纖細金色絲線將小琥珀晶體與廣闊薄霧中的大型藍色玻璃球連起來
弱第一階段關聯及其周圍不確定性的概念圖;並非數據或診斷結果。

多個內生解釋變數需要聯合評估強度

若內生解釋變數多於一個,分開計算的第一階段 F 可能會漏掉識別較弱的線性組合。

每個解釋變數單獨看來或許都能被預測,但工具變數帶來的變動未必涵蓋估計所有結構係數所需的組合。

在同方差線性 IV 設定下,Cragg–Donald 最小特徵值統計量概括這種聯合識別資訊。Stock–Yogo 對應的臨界值針對已列明的偏誤或檢驗大小扭曲準則。

假設非常重要:出現任意異方差、序列相依或群組聚類後,常見臨界值不會自動繼續有效。

被排除工具變數的數目、內生解釋變數的數目,以及第一階段係數矩陣的秩,都會影響結果。請交代完整設定並使用專為該設定設計的檢驗;不要把個別第一階段 F 平均後,便當作聯合強度的證據。

穩健誤差需要配合研究設計的診斷

金融觀測值可能有異方差、序列相依,或按公司、交易場所或政策單位聚類。第二階段標準誤採用群組聚類,不會令經典第一階段 F 或 Cragg–Donald 校準自動變得穩健。

對單一內生解釋變數,Montiel Olea 和 Pflueger 提出 effective-F 弱工具變數檢驗;在其列明的條件下,該檢驗容許異方差、自相關和群組聚類。

它利用協方差資訊調整常規第一階段 F,再與特定準則的臨界值比較(2013 年論文)。

effective F 並不等同軟件報告的所有穩健 Wald F 數值。

Kleibergen–Paap rk Wald F 經常配合穩健協方差估計量報告,但 Stock–Yogo 臨界值是為不同的常規統計量和假設推導。不要假設兩者使用相同的校準尺度來比較。

請報告估計量、統計量、協方差估計量、聚類層級或依賴處理方式,以及臨界值所依據的框架。

Newey–West 或 cluster-robust 協方差估計在其假設下處理抽樣不確定性;單靠它不能修復弱識別。

關聯性弱時 Anderson–Rubin 推論仍可能有效

對單一內生解釋變數模型中的候選係數值 \(\beta_0\),先建立按該候選值調整後的結果 \(Y-X\beta_0\),再檢驗控制納入變數後,被排除工具變數能否整體解釋該結果。

在虛無假設和工具變數外生性成立時,這是檢驗 \(\beta=\beta_0\) 的 Anderson–Rubin 檢驗。

由於檢驗不需要除以估計的第一階段係數,其有效性不必依賴該係數夠大。

原始 Anderson–Rubin 建構採用模型的分佈假設;實際應用時,協方差估計量和參考分佈亦須符合抽樣設計。「穩健」標籤不代表可忽略群組數目太少或序列相依。

把候選值上的檢驗反轉後,可得信賴集合。資訊不足時,集合可能很闊、互不連通或沒有界限;這反映識別資訊有限,並非軟件出錯。Anderson–Rubin 檢驗的檢驗力亦可能較低。

GMM 過度識別指南處理的是另一個問題,不應被視為弱 IV 穩健係數推論。

偏 F 的計算例子

假設某個第一階段有 \(n=200\) 個觀測值、\(k=3\) 個納入迴歸項(包括截距)、\(q=2\) 個被排除工具變數,以及偏 \(R^2_p=0.04\)。

按照常規同方差公式,殘差自由度為 \(200-3-2=195\)。

\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]

按這些輸入和假設,計算結果是常規聯合統計量 4.0625。單靠它不能證明工具變數無效、不能決定 Stock–Yogo 特定準則下的結論,也不能確立異方差或群組聚類下的結果。

穩健分析需要使用符合研究設計的統計量和校準方法。

如果在模糊迴歸不連續設計中使用相同的兩個工具變數,第一階段的不連續性便是該設計特有的相關性分析一部分。

上述 F 計算不能代替 RDD 假設、頻寬選擇或符合該設計的推論。

分開報告診斷結果和識別論據

列明內生解釋變數、被排除工具變數、納入的控制變數、樣本、第一階段係數、偏 \(R^2\),以及準確的強度統計量。

若有多個內生解釋變數,指出聯合統計量及其假設;穩健設定下,應寫明協方差和臨界值方法,不要只寫「F = …」。

若統計量顯示識別偏弱,請報告目標係數的弱 IV 穩健檢驗或信賴集合。說明集合是否有界,以及其形狀如何影響實質結論。

不要只因常規 Wald 區間較容易概括,便用它取代資訊不足的區間。

最後,利用制度及經濟證據論證工具變數的獨立性和排除路徑。相關性診斷、平衡檢查、安慰劑結果和過度識別檢驗可以揭示問題,但不能證明所有假設。

雙重差分設計採用不同的識別假設;第一階段較強不代表它可以代替雙重差分。

常見問題

Q1第一階段 F 高於 10 是否證明工具變數有效?

否。它最多是在特定校準下的相關性診斷,不能證明獨立性或排除限制。

Q2偏 R² 是否等同第一階段 F 統計量?

否。偏 R² 描述增量配適度。常規 F 亦取決於樣本數、限制數目和殘差自由度。

Q3可以直接把穩健 F 與 Stock–Yogo 臨界值比較嗎?

只有統計量和假設符合該校準方法時才可以。穩健統計量通常需要不同的臨界值和解讀方式。

Q4工具變數看來偏弱時應報告甚麼?

報告符合研究設計的診斷,以及弱 IV 穩健檢驗或信賴集合,並說明集合是否很闊、斷開或沒有界限。

資料來源與延伸閱讀

回報問題

我們會準備一封包含本文連結的電郵。寄出後,Mark 才會收到你的回報

快速檢查

讀完指南後,用 3 道題檢查一下

問題 1 / 3

問題 01

常規第一階段 F 檢驗評估甚麼?

選擇答案即可查看解釋

期權術語表