Mincer–Zarnowitz 回归:检验预测偏误与校准
了解 Mincer–Zarnowitz 回归如何检验预测的截距与尺度、为何平均误差为零不等于校准,以及这项检验无法证明什么。
本指南内容平均误差为零,仍可能有校准问题
简短摘要
Mincer–Zarnowitz(MZ)回归以线性校准的方式,检查实际值是否符合预测的水平与尺度。常见的原假设是截距为零、预测系数为一。这项联合限制比只看平均误差提供更多信息,但无法证明预测者已妥善使用所有可用信息。
平均误差为零,仍可能有校准问题
假设策略模型预测下一期收益,或经济学家预测下一季增长率。评估样本中的预测误差平均值可能为零。这有助于检查预测是否持续偏高或偏低,但不代表预测值与后续结果会一对一变动。预测可能波动过大、过度收敛或线性偏移,只是正负误差刚好互相抵销。
MZ 回归把实际结果对预测值进行回归,让第二个问题显现出来。Mincer 与 Zarnowitz 在评估经济预测时提出此架构(1969 年论文)。它是数值目标点预测的诊断工具,尤其适用于以平方误差损失预测条件平均数的情况。它并非比较两个模型何者平均损失较低;这是另一个问题,可参考 [Diebold–Mariano 指南](/zh-CN/learn/diebold-mariano-forecast-accuracy-test-explained)。
这项区别也与交易研究有关。收益预测的平均偏误可能很小,但尺度仍不正确;波动率预测可能在某个区间持续过高、另一个区间持续过低。回归可以指出线性不匹配,但结果取决于评估样本、目标定义、信息时间点和推论方法。单靠这项检验,无法证明预测能转化为获利的交易规则。
对齐预测起点、目标与数据版本
对每个预测起点 (t),将预测 (f_{t+h\mid t}) 与它要预测的后续实际目标 (y_{t+h}) 配对,并使用固定期间 (h)。为了简化公式,下文把配对后的观测写成 ((f_t,y_t));下标只是标记每一组配对,预测本身仍是在较早的信息截止点产生。两个数值必须对应相同变量、期间、单位和时间戳规则。若预测五日收益,却配上一日收益,回归就不再检验原定目标的校准情形。
使用每个起点当时确实可取得的预测,并保存预测值、模型版本、数据版本和信息截止点。总体经济目标的初次公布值之后可能修订;应先决定以初值还是后续定稿值评估校准,并一致沿用。以修订后数据替换历史输入,可能让评估使用原预测者当时无法取得的信息。
交易序列要一致对齐收盘到收盘、日内和隔夜收益的组成。重叠的多期目标也会让相邻预测误差相依。共用评估样本同样重要:如果某模型恰好在波动大的日期缺少预测,不同日期组成可能看起来像校准差异。评估预测序列时应使用相同目标与起点时程。
请区分实际产生的预测与模型内拟合值。如果模型是用 MZ 回归的同一批观测估计,样本内拟合可能造成校准良好的假象。若要主张未来预测能力,应依时间顺序建立样本外预测序列,在每个起点只用当时可得信息重新估计,并保留未参与模型或门槛选择的最终确认期间。
拟合 Mincer–Zarnowitz 回归并明确写出原假设
标准水平回归式为
yₜ = α + β fₜ + uₜ
其中 (yₜ) 是实际目标,(fₜ) 是预测,(uₜ) 是回归残差。常见的联合校准限制为
H₀: α = 0 且 β = 1
若两项限制皆成立,实际结果与预测之间拟合出的线性关系就是恒等线。不需要固定位移,预测增加一单位时,拟合结果也增加一单位。完成回归估计后,应使用符合抽样设计的协方差估计,透过 Wald 或等价的 F 检验同时检验两项限制。分别检验截距和斜率,不等于检验联合限制。
回归残差 (uₜ) 不一定等于原始预测误差 (yₜ − fₜ)。在联合原假设下两者相等;若限制不成立,估计的截距与斜率会吸收线性位移与尺度调整。请同时报告原始预测误差与回归系数,让读者看见平均偏差和校准关系。
MZ 限制有时也称为预测不偏性或理性检验。应说明采用的定义。无条件平均误差为零的条件是 (E[yₜ − fₜ] = 0);限制 ((α = 0, β = 1)) 则指定一种特定线性关系,通常更强。Holden 与 Peel 指出,在其形式化定义下,传统联合限制是预测不偏性的充分条件,但不是必要条件(1990 年论文)。未说明检验限制前,不要把「不偏」与「符合 MZ 校准」当成同义词。
<!-- learn:illustration -->

简单例子区分平均偏误与联合限制
考虑三组假设性的预测与后续结果:
| 预测值 (fₜ) | 实际值 (yₜ) | 误差 (yₜ − fₜ) |
|---|---|---|
| 1 | 1.5 | 0.5 |
| 2 | 2.0 | 0.0 |
| 3 | 2.5 | −0.5 |
预测平均值为 2,结果平均值也为 2,平均预测误差为零。然而,这些数值符合 (yₜ = 1 + 0.5 fₜ),因此 MZ 回归截距为 (α = 1)、斜率为 (β = 0.5),而不是 ((0,1))。误差虽在平均上互相抵销,线性校准限制仍不成立:在这个刻意构造的例子中,实际值的变动幅度只有预测的一半。
这是用来说明算术的例子,不是市场数据,也不是推论样本。对三个没有噪声的点报告有意义的 p 值,或声称真实预测系统失效,都不合理。在实际样本中,联合检验会纳入估计不确定性;系数偏离幅度大,估计仍可能不精确,偏离幅度小则可能在观测数足够时被精确估计。此例只说明平均误差与 MZ 限制回答不同问题。
重新校准式 (1 + 0.5 fₜ) 会精确重现这三个结果,因为它就是由这些数据建构而成。这不代表日后也有效。如果重新校准是预测流程的一部分,应在较早的训练区段估计系数,并用未参与系数估计的后续数据评估调整后预测。
一起解读截距、斜率与 R 平方
截距 (α) 是预测为零时拟合出的结果,因此其实务意义取决于零是否落在预测范围内或附近。斜率 (β) 描述拟合结果随预测值变动的幅度。纳入截距后,斜率低于一表示预测变动幅度大于拟合结果;斜率高于一则表示拟合结果变动较大。若另一个系数也不受限制,单看任一系数都无法完整描述关系。
高 (R²) 无法证明校准良好。例如,没有噪声的关系 (yₜ = 2 + 1.1 fₜ) 有 (R² = 1),但其截距和斜率不符合 MZ 原假设。(R²) 概括线性拟合解释了多少变化;联合检验则问该拟合是否为恒等线。反过来说,即使不拒绝联合限制,噪声较多的预测也可能有低 (R²)。校准与精确度相关,但不是同一项性质。
不要只根据两个个别 t 统计量推断校准结果。截距与斜率估计可能相关,因此联合 Wald/F 统计量会使用两者的协方差。请报告 (α)、(β)、估计不确定性、联合统计量与 p 值、样本量,以及原始平均误差。必要时可附上含恒等线的散点图或分组比较;若分组是在查看数据后才决定,应坦白说明。线性检验可能漏掉曲线型校准错误、制度转变或尾端特有误差。
校准比完整的预测效率范围更窄
在平方误差损失下,最佳点预测是依预测者信息集合计算的目标条件期望值。这项要求意味着,预测当时已知的信息不应能用来预测后续误差。MZ 回归只检查常数项与预测本身形成的线性关系,不会自动检查信息集合中的其他变量。
更强的诊断可把事先指定的信息变量 (zₜ) 加入预测误差回归,例如:
yₜ − fₜ = δ₀ + δ₁ zₜ + vₜ
若预测起点时已知的变量能预测后续误差,预测可能没有充分利用可用信息。变量的时间点必须对齐,选择也要谨慎;测试许多落后期、市场状态和转换方式会再度产生多重搜索问题。若短清单中找不到预测力,也不能证明相对于完整信息集合具有效率。
Zarnowitz 在评估调查预测时讨论偏误、序列相关、样本量与检验功效(NBER 工作论文 1070,1983)。因此,应将 MZ 描述为线性校准诊断或有限的预测效率检查,而非预测者已最佳利用所有相关信息的证明。[Giacomini–White 指南](/zh-CN/learn/giacomini-white-conditional-predictive-ability-test-explained)讨论的是另一种依选定损失矩进行的条件比较。
纳入估计方式、期间重叠与有限样本的不确定性
预测误差可能有异方差、序列相关或期间重叠,尤其是滚动式多步预测。一般 OLS 系数公式本身不保证联合限制的标准误有效。应使用并报告符合预测期间、相依结构与估计程序的推论方法。没有一种自动频宽或修正方式适用所有设计。
使用估计值产生的预测另有问题。如果同一个短样本用来估计模型参数、建构校准调整,再检验该调整,通常的回归不确定性可能未反映整个程序。比较巢状预测模型的准确度时,虚无分配也可能不是标准形式。应使用针对实际预测生成方式推导的结果,或完整指定校准步骤,再用后续保留样本评估。不要尝试多种回归形式、目标和样本后,再把最后一个 p 值当成确认性证据。
未拒绝原假设不代表已证明预测经过校准;原因可能是检验功效低或置信区间很宽。拒绝结果也以目标、样本、线性形式和协方差估计为条件。可以检查合理评估选项下的敏感度,但要揭露这些检查,并与事先指定的检验区分。当预测高度持续,或评估样本只有少数独立事件时,这点尤其重要。
选择符合预测问题的检验
MZ 检验的是预测值与实际目标之间的线性校准限制。[Diebold–Mariano 检验](/zh-CN/learn/diebold-mariano-forecast-accuracy-test-explained)则是在选定评分函数下,检验两个预测程序的平均损失是否相等。某个预测可能校准良好,却依该评分函数较不准确;另一个预测也可能平均更准确,但不符合 MZ 校准限制。
若问题是准确度是否随预测起点已知信息而变化,[Giacomini–White 检验](/zh-CN/learn/giacomini-white-conditional-predictive-ability-test-explained)会评估选定的条件损失矩。若搜索过许多预测或交易规则,并要对候选集合做结论,[Model Confidence Set](/zh-CN/learn/model-confidence-set-forecast-comparison-explained)或 [White Reality Check/Hansen SPA](/zh-CN/learn/white-reality-check-vs-hansen-spa-test-trading-rules-explained)等集合层级程序处理的是另一种选择问题。这些方法都不能取代清楚界定目标和诚实设定预测起点。
标准 MZ 水平回归适用于数值目标的点预测。分位数、机率、区间与密度预测需要符合其预测物件的校准检验与评分规则。若没有另外论证,不应把平均数预测的良好结果延伸到尾端风险预测或波动率分配。
报告校准设计,让他人能够重现
说明预测目标、期间、单位、信息截止点、评估日期、数据版本,以及预测是否确实为样本外预测。提供精确的回归式、预测误差定义和受检验限制。厘清「不偏性」指平均误差为零,还是联合 MZ 限制 ((α = 0, β = 1))。
报告系数估计、标准误或置信区间、联合 Wald/F 统计量、自由度、p 值、预测起点数、原始平均误差和 (R²),并说明 (R²) 的解读限制。若期间重叠或误差有序列相依,应说明协方差或重抽样方法。揭露模型估计、重新校准、选择流程,以及曾尝试的替代目标、样本或转换方式。
透明的报告能让读者区分平均偏误、线性校准、信息效率和比较准确度。这些是不同的实证主张。通过一项回归限制,不代表预测的所有用途都已验证;单次预测评估也不能证明扣除交易成本后仍有获利。
常见问题
Q1Mincer–Zarnowitz 检验只是检验平均预测误差吗?
不是。平均误差检查预测与结果的平均值是否不同。传统 MZ 检验同时限制截距为零、斜率为一。依 Holden 与 Peel 的形式化定义,这项联合限制是不偏性的充分条件,但不是必要条件。
Q2通过 MZ 检验能证明预测有效率吗?
不能。它检验包含预测值的线性关系,并未检验预测起点可得的所有信息是否都无法预测误差。效率要求更强的信息集合条件。
Q3VaR 或分位数预测可以使用相同回归吗?
不能直接套用而不调整校准定义与推论方法。标准水平回归适用于数值点预测;分位数和尾端预测需要为其预测物件设计的检验与评分方式。
Q4校准能证明交易策略获利吗?
不能。校准关注预测与结果之间的关系。交易主张需要事先定义决策规则,并另外进行样本外评估,纳入执行、手续费、融资、市场冲击和风险。 主要研究 - Mincer and Zarnowitz, “The Evaluation of Economic Forecasts” (1969) - Holden and Peel, “On Testing for Unbiasedness and Efficiency of Forecasts” (1990) - Zarnowitz, “Rational Expectations and Macroeconomic Forecasts” (NBER Working Paper 1070, 1983) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995) - Giacomini and White, “Tests of Conditional Predictive Ability” (2006)
资料来源与延伸阅读
报告问题
我们会准备一封包含本文链接的邮件。发送后,Mark 才会收到你的反馈
快速检查
读完指南后,用 3 道题检查一下
问题 01
Mincer–Zarnowitz 水平回归的传统联合原假设是什么?
选择答案即可查看解释
期权术语表
清楚解释从看涨、看跌和期权链到 IV、希腊字母、未平仓量与最大痛点等核心期权术语
浏览期权术语表