Hansen J 检验:GMM 过度识别约束详解
了解 Hansen J 统计量如何检验 GMM 的过度识别矩条件、如何解读自由度和 p 值,以及为何检验未拒绝并不能证明工具变量有效。
本指南内容J 检验将这些约束作为一个整体考察
简短摘要
Hansen J 检验评估:在指定的加权和协方差假设下,过度识别的 GMM 模型之样本矩条件是否整体上足够接近零。在原假设和正则条件成立时,最小化后的 GMM 目标函数近似服从卡方分布,自由度等于矩条件数减去估计参数数。拒绝表示这组约束难以与数据相容;不拒绝并不能验证每个工具变量,也不能证明模型正确。
J 检验将这些约束作为一个整体考察
广义矩估计法(GMM)通过让理论矩条件的样本版本尽量接近零来估计参数。在工具变量模型中,一个矩条件可以表示:当结构参数为真值时,所提出的工具变量与结构误差不相关。资产定价方程、欧拉方程或面板数据约束也可以推导出其他矩条件。
如果模型的矩条件数量多于未知参数,估计后就会留下可检验的额外约束。Hansen J 统计量使用指定的加权矩阵,将估计后样本矩仍偏离零的程度概括为一个数值。这是在该模型设定下进行的联合规格检验,并不是直接审查工具变量、给其中某一个贴上“有效”或“无效”标签。
这一区分对金融和量化研究很重要。交易或资产定价模型可以提供多个矩条件,但检验结果取决于这些条件所使用的收益、因子、工具变量、日期范围和协方差假设。较小的 p 值可能构成反对这组假设的证据;较大的 p 值则不是所有假设都成立的独立证据。
样本矩形成加权 GMM 距离
令 \(g_t(\theta)\) 表示日期 \(t\) 在参数向量 \(\theta\) 下的矩贡献向量,其包含 \(q\) 个分量。样本平均为:
\[ \bar g_T(\theta) = \frac{1}{T}\sum_{t=1}^{T}g_t(\theta). \]
GMM 选择 \(\hat\theta\),使下面这种加权二次距离最小:
\[ Q_T(\theta) = T\,\bar g_T(\theta)'W_T\bar g_T(\theta), \qquad J = Q_T(\hat\theta), \]
其中 \(W_T\) 是正定加权矩阵。加权方式决定各矩条件的不一致对目标函数贡献多大。在所声明的抽样假设下,有效 GMM 会使用一个与矩条件长期协方差矩阵逆相关的权重。J 检验考察的是参数估计后的最小目标函数,不是未经估计就随意选定参数时的目标函数值。
公式虽然简洁,组成部分却不能互换。改变工具变量会改变 \(g_t\);改变样本会改变平均值;改变协方差估计方法会改变权重;改变估计方法也可能改变拟合参数。因此,可复现的 J 统计量不只是一个数字再加上“稳健”二字。
自由度计算估计后剩余的约束
如果有 \(q\) 个相互独立的矩条件和 \(k\) 个局部可识别参数,常规过度识别自由度为 \(q-k\)。例如,用三个独立矩条件估计两个参数,就剩下一个过度识别约束。在所有总体矩条件均成立的原假设下,如果权重构造正确,J 统计量渐近服从相应自由度的卡方分布。
当矩条件数等于参数数时,模型是恰好识别的,通常可以让拟合矩条件为零。此时没有多余约束供 J 统计量检验:自由度为零,也就没有过度识别检验。如果参数多于独立矩条件,出现的是另一种识别问题;它不会产生负自由度,也不会因此得到有意义的 J 检验。
应计算有效且独立的矩约束数,而不只是软件输出中的列数。重复工具变量或线性相关的矩条件可能降低有效秩。常规卡方参考分布还依赖识别和其他大样本条件。名义上的 \(q-k\) 无法补救奇异或估计不稳定的矩协方差矩阵。
用假设的 J 值看 p 值在比较什么
假设模型使用三个矩条件估计两个参数,因此常规自由度为 \(3-2=1\)。再假设软件按旨在符合所述协方差假设的加权程序,报告 J 统计量为 5.4。以自由度为 1 的常规卡方分布作参考,p 值约为 0.020。如果事先选定的显著性水平为 5%,研究者会拒绝“三个总体矩条件全部为零”的联合原假设。
这个结论比“工具变量 2 无效”更窄。J 统计量衡量整个系统的一个加权距离,不会指出哪个矩条件造成冲突。导致相同结果的原因可能是某项工具变量无效、结构方程设定错误、遗漏动态特征、协方差模型错误,或维持的其他假设不成立。要调查来源,还需要后续诊断和对研究对象的专业判断。
如果 p 值是 0.20,正确结论是:在所选显著性水平下,这项检验没有拒绝联合约束。不能写成“工具变量已被证明有效”。未能拒绝可能是因为约束看起来合理、检验力有限,或样本太小、噪声太大而无法区分违反情形。应在查看一组模型变体之前选定判断门槛;若不断搜索直到某个 p 值看起来可以接受,就又引入了选择问题。

拒绝挑战的是维持的假设体系,而非某个单独假设
原假设是一组总体约束,必须在模型和渐近条件成立、参考分布有效的前提下解释。J 检验拒绝时,意味着在所用加权下,这组维持的约束至少有一部分难以与样本相容。检验本身无法区分:排除限制错误、函数形式错误、遗漏状态依赖、数据构造错误,还是长期协方差估计不合适。
该检验也不能确立因果关系。在工具变量设计中,过度识别检验可以评估模型下额外约束能否彼此相容,却不能证明每个工具变量都满足排除限制,尤其是所有工具变量可能共享同一违规路径时。工具变量相关性与排除限制含义不同:相关性应使用第一阶段和弱识别诊断;排除限制则要解释其经济作用路径。
在线性资产定价应用中,J 类统计量可能检验某个因子模型与测试资产集合所隐含的联合定价约束。拒绝不会自动指出遗漏了哪个因子,也不表示另一项可交易策略会获得收益;不拒绝也不证明模型在经济意义上为真。相关的横截面风险价格程序及其推断边界见 [Fama–MacBeth 指南](/zh-CN/learn/fama-macbeth-two-pass-regression-risk-premium-explained)。
Sargan 与 Hansen 版本采用不同的协方差假设
经典 Sargan 检验源于工具变量估计,并依赖较严格的协方差假设,通常包括误差同方差。Hansen J 检验则是 GMM 过度识别统计量,它使用估计的矩协方差;可以反映异方差,在使用合适的长期协方差估计时也可反映时间依赖。称为“Hansen”并不意味着实现对所有模型设定错误都稳健;协方差和加权选择应符合矩过程的特征。
对时间序列矩而言,序列相关会改变样本平均的长期方差。在假设和滞后选择适用于数据时,Newey–West 等 HAC 估计可以用于适当的协方差计算。面板或聚类观测可能需要不同的协方差构造。若只对系数标准误使用协方差修正,并不意味着 J 目标函数也用了相容的加权矩阵。
一步、两步和迭代 GMM 可能使用不同权重来估计参数。在有效两步程序中,权重本身是估计出来的,因此会增加有限样本不确定性;当相对观测数而言矩条件很多时,标准误和检验表现可能不稳。Windmeijer 研究的有限样本修正,针对特定线性有效两步 GMM 设定下的方差估计,并不是适用于所有 J 统计量的通用修正。
弱识别与工具变量过多会造成误导性的安心
J 检验不检验工具变量强度。信息量弱的工具变量会令参数估计和常规近似不可靠;应使用针对弱识别设计的检验,而不能把看起来令人安心的 J p 值当作强度诊断。大样本卡方校准也不保证短金融样本符合渐近近似。
添加工具变量或矩条件似乎能带来更多信息。但在动态面板 GMM 中,工具变量过多可能让内生变量在样本内被过度拟合,削弱规格检验发现违规的能力。因此,使用庞大工具变量集合后得到很高的 p 值,可能几乎不能让人放心。应报告工具变量数量、时滞或构造窗口,并在适用时比较有依据的精简方案,例如折叠后的工具变量集合。
小样本、近似共线的矩条件、协方差估计不良、参数边界和弱识别,都可能破坏教科书式解释。此时需要做敏感性分析,并采用合适的替代推断方法,而不是机械地说“J 检验通过”。如果模型选择涉及许多工具变量、滞后范围、因子或样本切分,应记录搜索范围,不要把事后最理想的结果包装成预先指定的检验。
差分 Hansen 检验有条件地评估嵌套子集
一些动态面板工作流程会报告差分 Hansen 检验或 C 检验,针对一部分矩条件,例如额外的一组工具变量。从概念上说,这种嵌套比较会询问:加入该组后,新增约束是否仍与其余维持的矩条件相容。它的结论以其余规格为条件,并不是对每个工具变量单独颁发的有效证明。
两个 J 统计量之差只有在相关嵌套、估计和协方差条件成立时,才有相应参考分布。比较模型应使用相容的样本和矩条件定义,并考虑加权及有限样本表现。如果完整工具变量集合很大,子集检验的检验力也可能下降。若检验多个分组,应报告所有比较,而非只挑选结果有利的一项。
报告检验,使读者能够复现其含义
应说明样本、参数向量、矩条件定义、观测数、约束数量与有效秩,以及自由度。还应说明使用一步、两步还是迭代 GMM;加权矩阵如何得到;允许何种协方差结构;是否使用小样本调整。报告 J 统计量、参考分布、p 值,以及分析前选定的判断门槛。
展示工具变量数量及其构造、第一阶段或相关性诊断,以及估计结果对合理矩条件集合变更的敏感度。解释工具变量为何满足经济时间顺序与排除限制的论证;过度识别检验未拒绝,不能代替这项论证。若使用子集检验,应明确指出子集及比较方式。IV 假设可参阅[内生性与工具变量指南](/zh-CN/learn/endogeneity-instrumental-variables-finance-explained);协方差选择可参阅[稳健标准误与 HAC 指南](/zh-CN/learn/robust-standard-errors-heteroskedasticity-hac-finance-explained)。
Hansen 的 GMM 渐近理论、Sargan 的工具变量检验、Stock 和 Wright 对弱识别的分析、Roodman 对工具变量过度扩张的研究、Windmeijer 对两步方差有限样本性质的分析,以及 Newey 和 West 的 HAC 协方差估计,分别讨论这套设计中的不同部分。各项结论适用于其明确写出的假设,并不等于对实证模型作出笼统认可。
常见问题
Q1Hansen J 检验未拒绝,能证明每个工具变量都有效吗?
不能。不拒绝表示在相关假设下,检验没有在所选显著性水平检测到联合冲突。工具变量可能共同存在相同的违规,而且检验力也可能不足。
Q2如果模型恰好识别,会怎样?
独立矩条件数等于已识别参数数时,没有额外约束可供检验。常规过度识别自由度为零。
Q3Hansen J 检验是弱工具变量检验吗?
不是。它评估过度识别约束。工具变量相关性和弱识别需要单独诊断;识别较弱时,也应避免依赖常规渐近近似。
资料来源与延伸阅读
报告问题
我们会准备一封包含本文链接的邮件。发送后,Mark 才会收到你的反馈
快速检查
读完指南后,用 3 道题检查一下
问题 01
过度识别的 GMM 模型中,Hansen J 统计量检验什么?
选择答案即可查看解释