Skip to content
全部期权指南
嵌套预测模型比较12 分钟阅读

嵌套预测的 Clark–West 检验:公式、示例与局限

了解为什么嵌套预测模型的 MSPE 比较需要调整、Clark–West 检验如何计算,以及单侧结果不能证明什么。

本指南内容为什么嵌套预测需要单独比较

简短摘要

Clark–West 检验会调整嵌套预测模型之间的平方误差比较,因为其中一个模型包含一个规模较小的基准模型。即使新增参数没有带来真实的预测信息,估计这些参数仍可能给较大模型的预测带来噪声。该调整改变的是用于推断的损失差,不会改变预测值,也不保证较大模型有用。

为什么嵌套预测需要单独比较

假设一个受限模型用常数预测下个月的收益率,而较大的模型再加入一个估值比率。将新增系数设为零,就能得到受限模型,因此它嵌套在较大模型中。即使该系数的真实值为零,估计它仍可能给较大模型的预测带来样本噪声。因此,即使两个模型在总体中的预测信息相同,较大模型的平均平方预测误差(MSPE)也可能更高。

Clark–West 调整针对嵌套模型的样本外 MSPE 比较中的这种估计噪声,检验较大模型在该设计中是否比受限基准模型多提供了预测价值。这比 Diebold–Mariano 检验指南中的一般成对损失比较更具体;DM 的常用参考分布并不会自动适用于嵌套模型。Clark 和 McCracken 研究了嵌套预测准确度与 encompassing 检验不同的渐近和有限样本性质;Clark 和 West 则提出调整后的 MSPE 方法及其近似推断。Clark 和 McCracken(2001)00071-9);Clark 和 West(2007)。

确认嵌套关系并保留样本外设计

受限模型和较大的备选模型必须预测同一个目标 yₜ₊ₕ。较大模型必须将受限模型包含为一个特例,通常是把一个或多个新增系数设为零。变量更多、结构更复杂或样本内拟合更好,本身都不能证明模型彼此嵌套。

在每个预测时点,只使用当时可获得的信息生成两个预测。按时间顺序在训练窗口估计模型,再用更晚的评估期检验。两个模型必须对齐目标、预测期、单位、预测起点和实际结果。递归重估或滚动窗口都可能合适,但要说明采用哪种方法,并保留每个时点实际生成的预测。反复查看评估期来挑选预测变量、变换方式或预测期,会让评估期也参与模型选择。CAViaR 指南说明,尾部分位数预测需要使用适合其目标的损失函数进行评估,不能不加区分地并入均值预测比较。

Clark–West 调整不能修复前视、样本不一致、把事后修订的数据当作当时已知数据,或未披露的模型搜索。请报告初始估计窗口、预测起点数量、预测期、数据版本,以及滚动或递归更新方式。

计算调整后的损失差

设 f₀,t+h 为受限模型的预测,f₁,t+h 为较大模型的预测,eⱼ,t+h = yₜ₊ₕ − fⱼ,t+h 为第 j 个预测误差。使用平方损失时,每期的 Clark–West 调整差为:

dCW,t+h = (e₀,t+h)² − [(e₁,t+h)² − (f₀,t+h − f₁,t+h)²]

这等于受限模型的平方误差减去较大模型的平方误差,再加上两个预测之间距离的平方。最后一项估计了零假设下新增估计参数带来的额外预测噪声。Clark 和 West 建议在比较前从较大模型的样本 MSPE 中减去这项预测差距调整。Clark 和 West(2007)。

对 P 个共同评估时点的调整差取平均:mean(dCW) = (1/P) Σ dCW,t+h。如果结果和预测以基点计量,平方误差与差值的单位就是 bp²。按上述符号约定,调整后的均值为正代表较大模型方向更有利。它是调整后的比较分数,不是较大模型的实际 MSPE,也不是可以直接用于交易的预测。

事先明确单侧假设

Clark–West 通常检验:嵌套的较大模型是否具有低于受限基准模型的预期 MSPE。零假设表示新增模型成分没有提高预测能力;单侧备择假设则支持较大模型。按照上述公式,调整后均值相对于标准误足够大且为正,才支持这一备择方向。

在调整损失的记号下,工作假设为 H₀: E[dCW] = 0,对比 H₁: E[dCW] > 0。正方向来自先取受限模型的损失。若把减法顺序颠倒,符号也会反转,因此应在结果旁说明符号约定。

检验统计量通常写作 dCW 样本均值除以其估计标准误。Clark 和 West 对其研究的设计建议采用近似正态的单侧检验,并视情况使用常规或对自相关稳健的标准误。West(1996)研究了样本外预测和误差的平滑函数矩的推断,也涵盖预测依赖于估计参数的情形。p 值取决于嵌套关系、预测生成方式、目标、损失函数和抽样假设;它不是较大模型为真的概率,也不是因果证据。

演算一个四期示例

设四个假设的实际值以基点计为 [0, 1, −1, 0]。受限模型预测为 [−1, 0, 0, 0],嵌套的较大模型预测为 [−1.5, 0.5, −0.5, 0.5]。受限模型的平方误差为 [1, 1, 1, 0],平均 MSPE 为 0.75 bp²。较大模型的平方误差为 [2.25, 0.25, 0.25, 0.25],平均 MSPE 也为 0.75 bp²。

预测差的平方 (f₀ − f₁)² 为 [0.25, 0.25, 0.25, 0.25]。代入 e₀² − e₁² + (f₀ − f₁)² 后,调整差为 [−1, 1, 1, 0] bp²,均值为 0.25 bp²。原始 MSPE 相同,但调整后的均值为正,因为校正考虑了较大模型的估计噪声。

这四期数据只用于说明计算方法,远不足以可靠估计不确定性或判断统计显著性。调整后的均值为正本身并不能证明真实预测优势;所有数字都是假设值,并非市场观测。

<!-- learn:illustration -->

两条蓝色和琥珀色的半透明嵌套路径弯曲上升至共同地平线;下方有四组由透明弧线连接的蓝色与琥珀色球体,分别示意预测与结果
无文字、无坐标轴的概念图;这些配对仅作示意,不是实证数据、预测或交易信号

考虑预测误差的依赖性和预测期

即使是单期预测,目标变量、预测变量或估计窗口随时间变化,也可能令调整损失差出现序列相关。多期预测期彼此重叠时,相邻预测起点会共享实际结果。若标准误把所有起点都视为独立,可能低估不确定性。

应根据抽样设计,从调整差序列估计标准误;条件合适时,可使用对异方差和自相关稳健的长期方差估计。Clark 和 West 指出,预测误差存在自相关时应使用自相关稳健标准误。请说明预测期、协方差估计量、所用核函数和带宽,以及是否重抽样。区块自助法指南说明了为何依赖时间序列的重抽样需要保留顺序结构;一般的自助法不会自动实现 Clark–West 零假设。

应对依赖性的方式取决于设计。较长预测期、持续性目标、重复估计参数和波动变化都可能带来超出简单重叠模式的依赖。应比较并解释合理的推断设定,不要只挑 p 值最小的设定。

把正态临界值视为近似,而非保证

嵌套模型预测检验的零分布可能不是标准分布,尤其在估计样本和评估样本同时扩大时。Clark 和 McCracken 表明,嵌套预测中的准确度相等与 encompassing 检验具有不同于非嵌套比较的渐近和有限样本性质。Clark 和 West 在研究的设计中论证了有用的近似正态推断,但这并不保证每个有限样本都准确。Clark 和 McCracken(2001)00071-9);Clark 和 West(2007)。

评估样本较小、额外参数较多、基准模型设定错误、根据数据挑选预测变量,以及采用滚动还是递归估计,都会影响检验的尺寸和功效。如果样本或设计与相关研究明显不同,应考虑适合该设计的临界值,或经过严谨设定的模拟/自助程序。报告估计样本和评估样本的规模,并说明 p 值使用的参考分布。

区分相近检验并限定结论范围

Diebold–Mariano 检验在一般成对损失框架下检验两个预测的期望损失是否相同。Clark–West 调整适用于平方误差比较,前提是一个模型嵌套于另一个模型,并且新增参数估计会在零假设下扭曲原始 MSPE 差。没有理由时,不要把它用于非嵌套模型。DM 原文允许使用多种损失指标,也讨论了误差不服从正态分布或不独立的情形。两者相关,但不是同一种检验。Diebold 和 Mariano(1995)。

这两种检验都不能解决反复尝试目标、预测期、基准模型和预测变量所造成的选择问题。如果最终比较来自广泛搜索,请记录完整候选集合,并采用针对搜索层面问题的方法。White Reality Check 与 Hansen SPA 指南讨论了对搜索过的交易规则集合进行推断。

在所述假设下,显著的单侧结果表明较大模型针对该目标和评估设计降低了预期平方误差。它不能证明因果关系、信号稳定性或策略盈利。盈利评估还需要单独定义规则、未参与模型选择的评估数据,以及现实的价差、手续费、滑点、市场冲击、融资成本和风险限额。

报告设计细节以便他人复现

列出受限模型和较大模型的名称、确立嵌套关系的具体限制、目标、预测期、单位、估计窗口、预测起点安排、评估日期和共同样本规则。说明参数如何重估,以及每个预测时点可用的信息和数据版本如何保存。

报告两个原始 MSPE、Clark–West 调整差的均值、符号约定、标准误、单侧备择、参考分布或临界值、p 值及依赖性估计方法。也要披露新增参数数量、样本规模、尝试过的模型和评估期是否影响模型设计。这样读者才能把嵌套模型调整检验与一般预测比较区分开,并评估剩余的不确定性。

常见问题

Q1Clark–West 检验会取代 Diebold–Mariano 检验吗?

不会。Clark–West 用于嵌套模型的 MSPE 比较。Diebold–Mariano 是一般成对损失框架,不能默认其常见参考分布也适用于嵌套预测。

Q2调整后的均值为正,能证明较大模型更好吗?

不能。按照所述符号约定,它有利于较大模型,但推断仍需要合适的标准误、可信的样本外设计和足够的观测值。

Q3Clark–West 可以用于非嵌套模型吗?

不能默认这样做。该调整针对嵌套零假设下的估计噪声。比较非嵌套模型时,应选择符合预测设计和损失函数的检验。

Q4Clark–West 结果显著是否意味着交易策略盈利?

不意味着。它检验一个目标和评估设计下的预测准确度。交易结果还取决于决策规则、执行、费用、融资、风险和额外的样本外证据。 主要研究 - Clark 和 West, “Approximately Normal Tests for Equal Predictive Accuracy in Nested Models” (2007) - Clark 和 McCracken, “Tests of Equal Forecast Accuracy and Encompassing for Nested Models” (2001)00071-9) - West, “Asymptotic Inference about Predictive Ability” (1996) - Diebold 和 Mariano, “Comparing Predictive Accuracy” (1995)

资料来源与延伸阅读

报告问题

我们会准备一封包含本文链接的邮件。发送后,Mark 才会收到你的反馈

快速检查

读完指南后,用 3 道题检查一下

问题 1 / 3

问题 01

Clark–West 调整为何要加上两个预测差的平方?

选择答案即可查看解释

期权术语表