Skip to content
全部期权指南
弱识别下的第一阶段证据与推断14 分钟阅读

弱工具变量诊断:第一阶段 F 与稳健推断

了解第一阶段 F 统计量、偏 R²、Stock–Yogo 标准、稳健诊断和 Anderson–Rubin 推断分别如何回答弱工具变量问题。

本指南内容为什么工具变量强度很重要

简短摘要

第一阶段统计量描述了在控制纳入变量后,被排除的工具变量对内生解释变量的解释程度。它不能证明工具变量有效,“F 大于 10”也不是普遍保证。 适用的诊断取决于内生解释变量的数量和误差假设;弱 IV 稳健推断的置信集合仍可能很宽或无界。

为什么工具变量强度很重要

工具变量法利用被排除工具变量 \(Z\) 所预测的内生解释变量 \(X\) 的变动,同时控制纳入的控制变量 \(W\)。

如果 \(Z\) 对 \(X\) 剩余变动的解释力很小,数据就很难通过这一来源提供结构效应的信息。

工具变量相关性较弱时,有限样本中的 2SLS 可能向 OLS 偏误,其抽样分布也可能明显偏离正态近似。因此,即使标准误看起来很精确,常规 Wald 区间的覆盖率仍可能较差。

Staiger 和 Stock 提出了弱工具变量渐近理论,用来解释这些问题,并说明为什么需要非标准置信区域(1997 年论文)。

工具变量强度只是识别的一部分。第一阶段很强,并不能证明 \(Z\) 与结构误差独立,也不能证明 \(Z\) 只通过 \(X\) 影响结果。

工具变量指南分别讨论这些假设以及被识别的效应。

第一阶段隔离工具变量的条件变异

对于一个内生解释变量和 \(q\) 个被排除的工具变量,第一阶段可写为

\[ X_t = W_t'\delta + Z_t'\pi + v_t. \]

这里 \(W_t\) 包含纳入的外生控制变量,通常也包括截距;\(Z_t\) 包含被排除的工具变量。标准第一阶段 F 检验 \(H_0:\pi=0\),即在控制 \(W_t\) 后,被排除的工具变量整体上不增加解释力这一联合限制。

这是一个条件相关性问题,不是排除限制或独立性检验。报告纳入了哪些控制变量、检验了多少个被排除工具变量、使用的样本、协方差假设,以及采用的统计量。

当有多个被排除工具变量时,单个系数的 t 统计量不能替代联合检验。

偏 R² 与常规 F 统计量

偏 \(R^2\) 衡量在剔除 \(W\) 的影响后,残差化的被排除工具变量能够解释 \(X\) 剩余变异的比例。

令 \(R^2_p\) 表示偏 \(R^2\),\(n\) 表示样本量,\(k\) 表示纳入回归项的数量(若使用截距,也计入其中),\(q\) 表示被排除工具变量的数量。

在常规同方差线性回归计算下,增量 F 统计量为

\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]

分子衡量每个被排除工具变量限制带来的拟合改善;分母使用第一阶段完整的残差自由度来估计残差方差。这个公式不是所有稳健统计量都适用的通用恒等式。

稳健协方差估计量会改变检验计算和参考分布。

偏 \(R^2\) 与 F 相关,但回答的是不同的描述性问题:偏 \(R^2\) 是无量纲的拟合指标,而 F 还会受样本量和限制数量影响。

在非常大的样本中,即使偏 \(R^2\) 很小,也可能得到较大的 F;这并不意味着所有有限样本 IV 近似都可靠。

为什么 F 大于 10 不是普遍阈值

常见的 10 是经验法则,不是判定有效与否的定理。Staiger 和 Stock 在特定弱工具变量框架中将其作为实用参考;它不能保证对每个样本、估计量、工具变量数量或误差过程都能得到有效推断。

Stock 和 Yogo 根据 2SLS 相对偏误界限或 Wald 检验尺寸扭曲界限定义工具变量弱度,并为这些特定标准列出临界值。因此,临界值取决于所选标准和模型维度。

他们关于常规第一阶段及 Cragg–Donald 统计量的结果依赖同方差、独立误差假设。

表格中的数字不能不加调整地用于所有稳健设定(作者托管的章节页面)。

F 大于 10 不能证明排除限制、独立性或因果解释成立。F 小于 10 也不能证明工具变量没有用,或某个特定估计无效。

应将该统计量视为依赖明确假设的诊断,然后选择与研究设计相匹配的推断方法。

Hansen J 检验指南解释了为何过度识别检验不能取代强度评估。

<!-- learn:illustration -->

一根纤细的金色丝线将小琥珀晶体与宽阔薄雾中的大型蓝色玻璃球相连
弱第一阶段关联及其周围不确定性的概念图;不是数据或诊断结果。

多个内生解释变量需要联合强度评估

如果内生解释变量不止一个,分别计算的第一阶段 F 可能遗漏某个识别较弱的线性组合。

每个解释变量单独看起来都可能能被预测,但工具变量诱发的变异未必覆盖估计全部结构系数所需的组合。

对于同方差线性 IV 设定,Cragg–Donald 最小特征值统计量概括了这种联合识别信息。对应的 Stock–Yogo 临界值针对明确给出的偏误或检验尺寸扭曲标准。

假设条件很重要:出现任意形式的异方差、序列相关或聚类时,常用临界值不会自动继续有效。

被排除工具变量的数量、内生解释变量的数量,以及第一阶段系数矩阵的秩都很重要。应完整说明设定,并使用为该设定设计的检验;不要通过平均各个第一阶段 F 来推断联合强度。

稳健误差需要与研究设计相配的诊断

金融观测值可能存在异方差、序列相关,或按公司、交易场所、政策单元聚类。第二阶段标准误采用聚类调整,并不会让经典第一阶段 F 或 Cragg–Donald 校准自动变得稳健。

对于一个内生解释变量,Montiel Olea 和 Pflueger 提出了 effective-F 弱工具变量检验。在其明确条件下,该检验允许异方差、自相关和聚类。

它利用协方差信息缩放常规第一阶段 F,再与针对特定标准的临界值比较(2013 年论文)。

effective F 并不等同于软件报告的所有稳健 Wald F 统计量。

Kleibergen–Paap rk Wald F 常与稳健协方差估计量一起报告,但 Stock–Yogo 临界值针对的是不同的常规统计量和假设。不要把两者当成处于同一校准尺度后直接比较。

报告估计量、统计量、协方差估计量、聚类层级或依赖处理方式,以及临界值所依据的框架。

Newey–West 或 cluster-robust 协方差估计在相应假设下处理抽样不确定性;它本身不能解决弱识别问题。

弱相关下 Anderson–Rubin 推断仍可能有效

对于单个内生解释变量模型中的候选系数值 \(\beta_0\),构造按该候选值调整后的结果 \(Y-X\beta_0\),然后检验在控制纳入变量后,被排除工具变量是否整体上能够解释它。

在原假设和工具变量外生性成立时,这是对 \(\beta=\beta_0\) 的 Anderson–Rubin 检验。

由于该检验不需要除以估计的第一阶段系数,其有效性不必依赖该系数足够大。

原始 Anderson–Rubin 构造依赖模型的分布假设;在应用中,协方差估计量和参考分布也必须与抽样设计相符。给检验贴上“稳健”标签,并不意味着可以忽略聚类数量过少或序列相关。

对候选值反演检验会得到置信集合。信息较弱时,该集合可能很宽、不连续或无界;这反映了识别信息有限,而不是软件故障。Anderson–Rubin 检验也可能检验力较低。

GMM 过度识别指南回答的是另一个问题,不应将其当成弱 IV 稳健的系数推断。

原始论文为 Anderson 和 Rubin(1949)。

偏 F 的计算示例

假设第一阶段有 \(n=200\) 个观测值、\(k=3\) 个纳入回归项(包括截距)、\(q=2\) 个被排除工具变量,且偏 \(R^2_p=0.04\)。

按常规同方差公式,残差自由度为 \(200-3-2=195\)。

\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]

在这些输入和假设下,计算结果说明常规联合统计量为 4.0625。单凭这一结果,不能证明工具变量无效,不能确定 Stock–Yogo 特定标准下的结论,也不能说明异方差或聚类环境下的结果。

稳健分析需要使用与研究设计相匹配的统计量和校准方法。

如果同样的两个工具变量用于模糊回归不连续设计,第一阶段的不连续性属于该设计中特定的相关性评估。

上面的 F 计算不能替代 RDD 假设、带宽选择或适用于该设计的推断。

分开报告诊断结果与识别论证

说明内生解释变量、被排除工具变量、纳入控制变量、样本、第一阶段系数、偏 \(R^2\) 以及准确的强度统计量。

如果有多个内生解释变量,应指出联合统计量及其假设;在稳健设定中,应说明协方差和临界值方法,而不是只写“F = …”。

如果统计量表明识别较弱,应报告针对目标系数的弱 IV 稳健检验或置信集合。说明该集合是否有界,以及其形状如何影响实质性结论。

不要仅仅因为常规 Wald 区间更容易概括,就用它替换信息不足的区间。

最后,应利用制度和经济证据论证工具变量的独立性与排除路径。相关性诊断、平衡性检查、安慰剂结果和过度识别检验可以揭示问题,却无法证明所有假设。

双重差分设计依赖不同的识别假设;第一阶段更强并不意味着它可以与双重差分互换。

常见问题

Q1第一阶段 F 大于 10 能证明工具变量有效吗?

不能。它至多是在特定校准条件下的相关性诊断,无法证明独立性或排除限制。

Q2偏 R² 和第一阶段 F 统计量相同吗?

不相同。偏 R² 描述额外拟合程度。常规 F 还取决于样本量、限制数量和残差自由度。

Q3可以把稳健 F 直接与 Stock–Yogo 临界值比较吗?

只有统计量和假设与该校准方法一致时才可以。稳健统计量通常需要不同的临界值和解释方式。

Q4工具变量看起来较弱时应报告什么?

报告与研究设计相符的诊断,以及弱 IV 稳健检验或置信集合,并说明集合是否很宽、断开或无界。

资料来源与延伸阅读

报告问题

我们会准备一封包含本文链接的邮件。发送后,Mark 才会收到你的反馈

快速检查

读完指南后,用 3 道题检查一下

问题 1 / 3

问题 01

常规第一阶段 F 检验评估什么?

选择答案即可查看解释

期权术语表