Skip to content
全部期权指南
预测评估13 分钟阅读

预测组合:等权与估计权重

了解如何组合多个模型的预测、为什么等权可能优于拟合权重,以及如何避免前视偏差来检验结果

本指南内容预测组合是什么意思

简短摘要

预测组合把同一目标、同一预测期限的多个预测值合在一起。等权提供透明的基准;根据过去预测误差估计权重可以反映模型差异,但估计噪声可能使权重在样本外不稳定。

预测组合是什么意思

预测组合将两个或更多针对同一数量的预测合成为一个预测。如果模型 A、B、C 都预测明天实现的方差,可以对预测值取平均,也可以分配不同权重。组合后的数值是一个新预测,而不是对哪个模型正确的投票。

各输入必须在目标、预测时点、期限、单位和信息截止时间上保持一致。不能仅因为都被称为波动率,就直接平均一个单日方差预测和一个月度波动率预测。应先定义共同的量和区间,再对齐预测。

当多个合理模型刻画序列的不同特征,或无法确定哪个模型会持续表现最好时,组合预测可能有用。各模型不必采用完全不同的算法。对组合而言,关键在于它们的误差如何共同变化,而不是模型名称听起来有多不同。

Bates 和 Granger 的早期应用发现,在航空旅客数据示例中,组合预测的均方误差可以低于两个组成预测各自的误差。这为检验组合方法提供了理由,但不保证它在其他市场、目标、时期或损失函数下有所改善(Bates 和 Granger,1969)。

从等权基准开始

对于 (K) 个预测,等权组合为

\[ \widehat{y}_{t+h\mid t}^{\,EW} = \frac{1}{K}\sum_{k=1}^{K}\widehat{y}_{k,t+h\mid t} \]

每个组成预测贡献相同。该规则不需要用训练样本估计权重,而且容易复现。即使最终方法会估计或约束权重,它仍是有用的基准。

等权不表示所有预测同样准确、相互独立或对经济决策同样重要。它只表示组合程序不根据过去表现单独估计权重。如果所有输入都遗漏同一个因素,等权预测仍可能继承共同偏差。

模型名称的数量不能衡量信息多样性。三个波动率模型可能使用相同的收益序列、交易时段边界和采样间隔,也可能同时遗漏隔夜变动。取平均不会自动弥补这一遗漏。应检查存档的样本外误差是否存在有用差异,不要因为标签不同就假定证据彼此独立。

假设三个模型对下一交易时段的波动率预测分别为 12、15 和 20 个基点。等权预测为 \((12+15+20)/3=15.67\) 个基点。这个算式只展示了如何形成组合;单个预测时点无法说明该规则是否准确或有盈利能力。

对于波动率,要确认输入是方差还是标准差。先平均三个方差预测再开平方,通常不等同于直接平均标准差预测。后续评分时应使用一致的目标定义和单位。

根据过去的预测误差估计权重

估计权重的线性组合可以写成

\[ \widehat{y}_{t+h\mid t}^{\,C} = \sum_{k=1}^{K} w_k \widehat{y}_{k,t+h\mid t} \]

一种常见的理论结果假设每个预测误差的均值为零、预测目标一致且权重之和为一。令 \(\Sigma_e\) 表示组成预测误差的协方差矩阵。如果该矩阵已知且可逆,则在这些约束下使方差最小的权重为

\[ w^{*} = \frac{\Sigma_e^{-1}\mathbf{1}}{\mathbf{1}'\Sigma_e^{-1}\mathbf{1}} \]

该公式是参考点,并不是让人去求逆含噪声的样本协方差矩阵。实际中,\(\Sigma_e\) 是根据有限的预测误差存档估计的。高度相关的输入可能令矩阵接近奇异,因此数据的细微变动就可能造成权重的大幅变化。

对于误差方差均为 \(\sigma^2\) 的两个预测,其等权平均的方差为 \(\sigma^2(1+\rho)/2\),其中 \(\rho\) 是误差间的相关系数。如果每个误差方差为 4 且相关性为零,平均后的方差为 2;如果相关性为 0.90,方差则为 3.8。平均可以降低多少方差取决于误差的共同变化,而不是模型名称。这一计算针对误差方差;如果组成预测有偏,均方误差还包括偏差平方。

另一种做法是用存档中的组成预测回归实际观测目标,通常也加入截距。Granger 和 Ramanathan 讨论了权重之和不必为一的线性回归方法。截距和不受约束的权重可以调整训练样本中的平均偏差,但结果的解释也会变化:这些系数是拟合出的预测调整项,不一定是类似投资组合份额的权重(Granger 和 Ramanathan,1984)。

在评估前确定约束。非负且总和为一的权重会形成凸组合,使结果落在最小和最大组成预测之间。允许负权重或截距可能使结果超出该范围。这有时适合校准预测,但对方差等必须非负的目标可能不合适。

计算一个组合示例

假设三个模型对同一下一时段目标分别预测 12、15 和 20 个基点。仅根据更早预测时点估计的加权规则给出 0.50、0.30 和 0.20 的权重,则组合预测为

\[ 0.50(12) + 0.30(15) + 0.20(20) = 14.5\ \text{个基点} \]

权重非负且总和为一,因此这是凸组合,结果位于各组成预测之间。它与 15.67 个基点的等权结果不同,只是因为权重不同;这并不能说明加权预测更好。

时点 \(t\) 的权重只能根据当时已经知道结果的预测误差来估计。在历史回测中,时点 \(t\) 的 14.5 个基点预测可以使用截至 \(t\) 时可用的信息,不能使用 \(t+1\) 或之后才实现的目标。

目标观测到之后,应记录各组成预测、组合预测、实际值或代理值以及损失函数。在之后的预测时点重复此过程,可以在共同日期上比较规则,但一个演算示例仍不是持续优势的证据。

为什么拟合权重可能不尽如人意

已知总体误差协方差时的最佳权重,与从短样本估计出来的权重并不相同。估计会带来额外的不确定性。组成预测相似时,误差可能高度相关;优化过程可能利用历史上的细小差异,而这些差异未必持续。

Kang 的模拟和宏观经济预测应用发现,组合权重可能不稳定,而在其考察的情形中,简单平均在实践中可能表现更好(Kang,1986)。Timmermann 的综述讨论了估计误差、模型不稳定和误差依赖对预测组合的影响(Timmermann,200601004-9))。

之后关于预测组合悖论的分析指出了同一个有限样本问题:针对固定“最优”权重推导出的结论,在权重本身也需要估计时未必仍然成立(Claeskens 等,2016)。这些发现并不证明等权总是胜出,而是说明更复杂的加权规则必须在样本外比较中证明价值。

<!-- learn:illustration -->

可考虑从等权开始、限制输入数量、将估计权重向等份收缩,或施加简单约束。每种选择都在灵活性与估计噪声之间权衡。应使用训练数据选择并报告规则,不要看过最终测试期后再挑最有吸引力的版本。

三条蓝色、琥珀色和白色的透明玻璃路径汇入水晶棱镜,随后延伸出一条路径
概念图展示如何将多个预测合成为一个组合预测;不含实测市场数据、估计权重或交易信号

建立实时预测存档

存档中的每个组成预测都应当能在所标注的预测时点实际生成。只用当时可用的数据重新构建各模型,并保存预测时间戳、模型版本和目标定义。样本内拟合值不能代替真实的历史预测,因为模型可能用到了当时尚未知的观测值。

按目标和预测时点对齐存档。每一行中的组成预测应针对同一未来区间,训练信息也必须在同一决策时刻截止。估计组合前应处理或明确说明缺失预测;悄然改变输入集合会使权重在不同日期代表不同含义。

将权重估计与最终评估分开。滚动预测起点流程可以只用 \(t\) 之前已观测到目标的预测来估计权重,在 \(t\) 发出组合,再于目标可见后评分。扩展窗口使用所有符合条件的过去起点;滚动窗口则按预先设定的长度遗忘更早的起点。表现变化时,两种方法的适应方式不同。

如果在查看留出期后才选择组成模型、转换方式、预测期限、权重约束或损失函数,该留出期就已成为模型开发的一部分。应保留新的测试期,或使用嵌套评估,将每一步选择都限制在训练数据中。

在同一损失函数下比较组合

在相同预测时点、针对同一实际目标,比较等权规则、估计或收缩权重规则以及单个模型预测。报告损失函数和共同样本。否则,某种方法可能只是因为在更容易的日期或不同目标定义上评分而显得更好。

损失函数应符合目标和问题。平方误差对较大偏差施加平方惩罚;绝对误差对大偏差赋予不同权重。用含噪声的已实现度量评价波动率预测时,代理变量条件和损失选择都很重要;[QLIKE 与平方误差指南](/zh-CN/learn/qlike-vs-squared-error-volatility-forecasts-noisy-proxies-explained)说明了这些区别。不要看到哪种方法占优后才选择损失函数。

预测比较检验有助于判断观察到的损失差异是否符合抽样波动。[Diebold–Mariano 指南](/zh-CN/learn/diebold-mariano-forecast-accuracy-test-explained)介绍了配对损失比较,以及预测误差重叠或仍有依赖时需要考虑的假设。检验结果无法修复前视偏差,也不能证明经济价值。

如果尝试了许多模型组合、权重约束或损失规则,并在同一个评估期中保留表现最好的一种,报告的比较也反映了这次搜索。[White Reality Check 指南](/zh-CN/learn/white-reality-check-data-snooping-strategy-backtest-explained)和[回测过拟合概率指南](/zh-CN/learn/probability-of-backtest-overfitting-cscv-explained)讨论了从许多交易规则中选择的问题。它们都不能替代干净的预测存档或预先设计的评估。

验证设计应反映实际使用的期限。如果每日预测起点对应相互重叠的多日目标,相邻损失可能互相依赖。估计不确定性时应考虑这种依赖,不要把大量重叠行当成同样数量的独立实验。

让组合与决策相匹配

组合之前先确认各模型预测的对象。条件均值、方差、分位数和完整概率分布是不同的预测对象。对点预测做线性平均不会自动产生校准良好的密度预测或可靠的尾部风险估计。

对于方差等严格非负的量,应用前应检查组合值。非负预测的凸平均仍然非负;含负权重或截距的拟合回归则不一定如此。将负值截为零会改变预测规则,必须在评估前明确规定。

预测数量也很重要。加入较弱或几乎重复的输入,可能增加需要拟合的权重数量,却没有带来多少新信息。如果历史存档相对于 \(K\) 较短,应优先选择透明、低维的规则,并展示结论并非由某一个组成预测决定。

组合模型预测与组合交易头寸不是一回事。统计损失较低,并不能说明使用该预测的策略扣除费用、买卖价差、滑点、市场冲击和风险限制后会赚得更多。预测构建和使用预测的交易规则需要分别提供样本外证据。

报告足以复现结果的信息

有用的报告应说明预测目标、期限、单位、组成模型、预测起点时间戳、存档期间和缺失数据规则。还应说明权重是等权、估计、受约束、收缩处理还是随时间变化,并交代各项调参选择的方式。

在相同评估日期上展示等权基准、选定组合和表现最好的单个预测。列出损失函数、不确定性估计方法以及对重叠目标的处理。如果权重在不同窗口间大幅变化,应呈现这种不稳定性,而不只是最终权重。

最后,把经验结论与决策结论区分开。“在此样本和此损失函数下,该组合的平均损失较低”比“组合预测改善交易”范围更明确,也更容易复现。前者可以用保存的预测存档检验;后者还需要策略、执行假设和单独的评估证据。

常见问题

Q1等权组合总是优于单个模型吗?

不是。它是不需要拟合权重的有用基准,但准确性取决于组成预测和目标。应在相同样本外日期上与每个单独预测比较。

Q2预测权重之和必须始终为一吗?

不必。为便于解释为凸组合,受约束的加权平均通常会采用这一条件。含截距的回归估计的是另一类预测调整;应说明所用设定及其含义。

Q3可以用样本内拟合值估计组合权重吗?

这可能形成不现实的存档,因为底层模型可能使用了各历史时点尚不可用的信息。应优先使用仅根据当时可用数据生成的真实滚动起点预测。

Q4组合预测更准确能证明存在交易优势吗?

不能。预测准确度是在指定目标、代理变量、样本和损失函数下的统计结果。交易主张还需要明确的策略、执行成本、风险约束和单独的样本外评估。 主要研究 - Bates and Granger (1969), “The Combination of Forecasts,” *Journal of the Operational Research Society*, 20(4), 451–468. - Granger and Ramanathan (1984), “Improved Methods of Combining Forecasts,” *Journal of Forecasting*, 3(2), 197–204. - Kang (1986), “Unstable Weights in the Combination of Forecasts,” *Management Science*, 32(6), 683–695. - Timmermann (2006), “Forecast Combinations,” *Handbook of Economic Forecasting*, 1, 135–196.01004-9) - Claeskens, Magnus, Vasnev, and Wang (2016), “The Forecast Combination Puzzle: A Simple Theoretical Explanation,” *International Journal of Forecasting*, 32(3), 754–762.

资料来源与延伸阅读

报告问题

我们会准备一封包含本文链接的邮件。发送后,Mark 才会收到你的反馈

快速检查

读完指南后,用 3 道题检查一下

问题 1 / 3

问题 01

组合两个模型的预测前,必须对齐哪些内容?

选择答案即可查看解释

期权术语表

清楚解释从看涨、看跌和期权链到 IV、希腊字母、未平仓量与最大痛点等核心期权术语

浏览期权术语表