弱工具变量诊断:第一阶段 F 与稳健推断
了解第一阶段 F 统计量、偏 R²、Stock–Yogo 标准、稳健诊断和 Anderson–Rubin 推断分别如何回答弱工具变量问题。
本指南内容为什么工具变量强度很重要
简短摘要
第一阶段统计量描述了在控制纳入变量后,被排除的工具变量对内生解释变量的解释程度。它不能证明工具变量有效,“F 大于 10”也不是普遍保证。 适用的诊断取决于内生解释变量的数量和误差假设;弱 IV 稳健推断的置信集合仍可能很宽或无界。
为什么工具变量强度很重要
第一阶段隔离工具变量的条件变异
偏 R² 与常规 F 统计量
偏 \(R^2\) 衡量在剔除 \(W\) 的影响后,残差化的被排除工具变量能够解释 \(X\) 剩余变异的比例。
令 \(R^2_p\) 表示偏 \(R^2\),\(n\) 表示样本量,\(k\) 表示纳入回归项的数量(若使用截距,也计入其中),\(q\) 表示被排除工具变量的数量。
在常规同方差线性回归计算下,增量 F 统计量为
\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]
分子衡量每个被排除工具变量限制带来的拟合改善;分母使用第一阶段完整的残差自由度来估计残差方差。这个公式不是所有稳健统计量都适用的通用恒等式。
稳健协方差估计量会改变检验计算和参考分布。
偏 \(R^2\) 与 F 相关,但回答的是不同的描述性问题:偏 \(R^2\) 是无量纲的拟合指标,而 F 还会受样本量和限制数量影响。
在非常大的样本中,即使偏 \(R^2\) 很小,也可能得到较大的 F;这并不意味着所有有限样本 IV 近似都可靠。
为什么 F 大于 10 不是普遍阈值
常见的 10 是经验法则,不是判定有效与否的定理。Staiger 和 Stock 在特定弱工具变量框架中将其作为实用参考;它不能保证对每个样本、估计量、工具变量数量或误差过程都能得到有效推断。
Stock 和 Yogo 根据 2SLS 相对偏误界限或 Wald 检验尺寸扭曲界限定义工具变量弱度,并为这些特定标准列出临界值。因此,临界值取决于所选标准和模型维度。
他们关于常规第一阶段及 Cragg–Donald 统计量的结果依赖同方差、独立误差假设。
表格中的数字不能不加调整地用于所有稳健设定(作者托管的章节页面)。
F 大于 10 不能证明排除限制、独立性或因果解释成立。F 小于 10 也不能证明工具变量没有用,或某个特定估计无效。
应将该统计量视为依赖明确假设的诊断,然后选择与研究设计相匹配的推断方法。
Hansen J 检验指南解释了为何过度识别检验不能取代强度评估。
<!-- learn:illustration -->

多个内生解释变量需要联合强度评估
如果内生解释变量不止一个,分别计算的第一阶段 F 可能遗漏某个识别较弱的线性组合。
每个解释变量单独看起来都可能能被预测,但工具变量诱发的变异未必覆盖估计全部结构系数所需的组合。
对于同方差线性 IV 设定,Cragg–Donald 最小特征值统计量概括了这种联合识别信息。对应的 Stock–Yogo 临界值针对明确给出的偏误或检验尺寸扭曲标准。
假设条件很重要:出现任意形式的异方差、序列相关或聚类时,常用临界值不会自动继续有效。
被排除工具变量的数量、内生解释变量的数量,以及第一阶段系数矩阵的秩都很重要。应完整说明设定,并使用为该设定设计的检验;不要通过平均各个第一阶段 F 来推断联合强度。
稳健误差需要与研究设计相配的诊断
金融观测值可能存在异方差、序列相关,或按公司、交易场所、政策单元聚类。第二阶段标准误采用聚类调整,并不会让经典第一阶段 F 或 Cragg–Donald 校准自动变得稳健。
对于一个内生解释变量,Montiel Olea 和 Pflueger 提出了 effective-F 弱工具变量检验。在其明确条件下,该检验允许异方差、自相关和聚类。
它利用协方差信息缩放常规第一阶段 F,再与针对特定标准的临界值比较(2013 年论文)。
effective F 并不等同于软件报告的所有稳健 Wald F 统计量。
Kleibergen–Paap rk Wald F 常与稳健协方差估计量一起报告,但 Stock–Yogo 临界值针对的是不同的常规统计量和假设。不要把两者当成处于同一校准尺度后直接比较。
报告估计量、统计量、协方差估计量、聚类层级或依赖处理方式,以及临界值所依据的框架。
Newey–West 或 cluster-robust 协方差估计在相应假设下处理抽样不确定性;它本身不能解决弱识别问题。
弱相关下 Anderson–Rubin 推断仍可能有效
对于单个内生解释变量模型中的候选系数值 \(\beta_0\),构造按该候选值调整后的结果 \(Y-X\beta_0\),然后检验在控制纳入变量后,被排除工具变量是否整体上能够解释它。
在原假设和工具变量外生性成立时,这是对 \(\beta=\beta_0\) 的 Anderson–Rubin 检验。
由于该检验不需要除以估计的第一阶段系数,其有效性不必依赖该系数足够大。
原始 Anderson–Rubin 构造依赖模型的分布假设;在应用中,协方差估计量和参考分布也必须与抽样设计相符。给检验贴上“稳健”标签,并不意味着可以忽略聚类数量过少或序列相关。
对候选值反演检验会得到置信集合。信息较弱时,该集合可能很宽、不连续或无界;这反映了识别信息有限,而不是软件故障。Anderson–Rubin 检验也可能检验力较低。
GMM 过度识别指南回答的是另一个问题,不应将其当成弱 IV 稳健的系数推断。
原始论文为 Anderson 和 Rubin(1949)。
偏 F 的计算示例
假设第一阶段有 \(n=200\) 个观测值、\(k=3\) 个纳入回归项(包括截距)、\(q=2\) 个被排除工具变量,且偏 \(R^2_p=0.04\)。
按常规同方差公式,残差自由度为 \(200-3-2=195\)。
\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]
在这些输入和假设下,计算结果说明常规联合统计量为 4.0625。单凭这一结果,不能证明工具变量无效,不能确定 Stock–Yogo 特定标准下的结论,也不能说明异方差或聚类环境下的结果。
稳健分析需要使用与研究设计相匹配的统计量和校准方法。
如果同样的两个工具变量用于模糊回归不连续设计,第一阶段的不连续性属于该设计中特定的相关性评估。
上面的 F 计算不能替代 RDD 假设、带宽选择或适用于该设计的推断。
分开报告诊断结果与识别论证
说明内生解释变量、被排除工具变量、纳入控制变量、样本、第一阶段系数、偏 \(R^2\) 以及准确的强度统计量。
如果有多个内生解释变量,应指出联合统计量及其假设;在稳健设定中,应说明协方差和临界值方法,而不是只写“F = …”。
如果统计量表明识别较弱,应报告针对目标系数的弱 IV 稳健检验或置信集合。说明该集合是否有界,以及其形状如何影响实质性结论。
不要仅仅因为常规 Wald 区间更容易概括,就用它替换信息不足的区间。
最后,应利用制度和经济证据论证工具变量的独立性与排除路径。相关性诊断、平衡性检查、安慰剂结果和过度识别检验可以揭示问题,却无法证明所有假设。
双重差分设计依赖不同的识别假设;第一阶段更强并不意味着它可以与双重差分互换。
常见问题
Q1第一阶段 F 大于 10 能证明工具变量有效吗?
不能。它至多是在特定校准条件下的相关性诊断,无法证明独立性或排除限制。
Q2偏 R² 和第一阶段 F 统计量相同吗?
不相同。偏 R² 描述额外拟合程度。常规 F 还取决于样本量、限制数量和残差自由度。
Q3可以把稳健 F 直接与 Stock–Yogo 临界值比较吗?
只有统计量和假设与该校准方法一致时才可以。稳健统计量通常需要不同的临界值和解释方式。
Q4工具变量看起来较弱时应报告什么?
报告与研究设计相符的诊断,以及弱 IV 稳健检验或置信集合,并说明集合是否很宽、断开或无界。
资料来源与延伸阅读
报告问题
我们会准备一封包含本文链接的邮件。发送后,Mark 才会收到你的反馈
快速检查
读完指南后,用 3 道题检查一下
问题 01
常规第一阶段 F 检验评估什么?
选择答案即可查看解释