Skip to content
全部期权指南
混合频率计量经济学13分钟

MIDAS回归:混合频率数据与波动率预测

了解MIDAS回归如何用简约的滞后权重组合日度与周度金融数据、如何构建波动率预测,以及混合频率模型可能产生误导的地方。

本指南内容MIDAS用于处理观测频率不匹配

简短摘要

MIDAS(mixed data sampling,混合数据采样)回归连接不同频率记录的观测值,而不必先把所有序列强行放到同一日历上。少量估计参数为高频观测的历史赋予权重,可以帮助预测低频金融目标。权重描述的是特定模型下的预测模式;它不能证明因果关系或交易优势。

MIDAS用于处理观测频率不匹配

金融和经济数据并不会按照同一时钟到达。波动率目标可能按周衡量,而候选预测变量可能是日收益率或日内已实现指标。宏观经济序列可能按季度发布,资产价格却每天交易。普通回归要求目标变量和预测变量每个观测对应一行,因此在估计熟悉的模型前,分析者必须决定如何处理这些不同的日历。

一种做法是把日度输入汇总成周均值或周总和。这样很简单,但它给每一天规定了特定权重,也可能丢失一周内变动发生的时间。另一种做法是把季度值重复填入每日行,或对其插值。重复填值可能让变化缓慢的数据看起来像许多新观测;插值则可能制造出从未实际观测到的平滑路径。两种操作都不会创造新信息。

MIDAS提供了直接连接不同频率的方法。它让目标变量保持自然的低频,并纳入高频序列的结构化滞后项。MIDAS这个名称指混合数据采样,并不代表某一种波动率模型。研究者用MIDAS回归预测波动率,也用于预测变量采样间隔比结果更细的其他场景。核心问题是纳入多少近期高频历史,以及如何约束其权重。

加权滞后项把许多观测压缩成一个简洁的预测变量

设\(y_{t+1}\)为低频目标,例如在第\(t+1\)周结束后观测到的下周已实现方差。设\(x_{t-j}\)为日度预测变量,它在第\(t\)周末的预测起点之前\(j\)个交易时段观测到。一个简单的MIDAS回归为\(y_{t+1}=a+b\sum_{j=1}^{K}w_j(\theta)x_{t-j}+u_{t+1}\),其中\(K\)是日度滞后数,\(w_j(\theta)\)是由少量参数控制的权重,\(u_{t+1}\)是预测误差。

权重通常归一化为\(\sum_{j=1}^{K}w_j(\theta)=1\)。这样加权和更容易理解为加权历史,而\(b\)控制该摘要与目标变量之间关系的强弱。归一化并不意味着日度观测彼此独立或信息量相同;它只是表示滞后权重形状的一种便利参数化方式。

分析者可以选择 \(x\) 为日收益率平方、绝对收益率、由日内收益率构成的已实现方差指标,或预测起点时可获得的其他变量作为预测变量。结果变量 \(y\) 可以是未来周方差、月度宏观经济发布值,或其他低频目标。目标的定义决定了系数的含义。已实现方差代理变量的模型不会自动变成潜在瞬时方差、期权隐含方差或价格收益率的模型。

MIDAS是回归框架,而非通用估计量。响应变量可以按水平值、对数或连接函数建模,估计结果取决于所选权重族和误差假设。对非负方差代理变量使用线性回归,若不约束预测值或转换目标变量,可能得到负的拟合值。模型易于使用,并不免除检查目标变量取值范围和单位的必要性。

权重函数以灵活性换取稳定性

不受约束的分布滞后回归会为\(K\)个日度输入分别估计系数。如果相对于周度目标观测数而言\(K\)较大,估计可能噪声较多且彼此高度相关。MIDAS则用低维函数定义滞后系数。一个示例性的指数Almon权重形式为\(w_j(\theta)=\frac{\exp(\theta_1j+\theta_2j^2)}{\sum_{\ell=1}^{K}\exp(\theta_1\ell+\theta_2\ell^2)}\)。归一化Beta多项式形式也很常见。

这些权重形式可以给近期时段更高权重、逐步衰减,或相对提高滞后窗口中间部分的权重。参数描述所选的平滑曲线,并不能无条件地说明每一天的重要性。如果数据支持短暂反应,而选定函数强制加入较长的平滑尾部,拟合系数就会带有这种限制。反过来,估计过多自由的日度系数可能是在拟合噪声,而非稳定动态。

权重限制属于模型假设。非负且归一化的权重可以让方差预测更容易解释为加权平均,但会排除正负滞后效应相互抵消的情况。灵活的形式可以允许凸起或斜率变化,但形状参数过多可能难以识别。应比较少数合理的权重形式,说明可用滞后范围,并评估改变权重族是否会显著改变预测。

\(K\)没有通用的取值。较长窗口可能捕捉持续性信息,但会增加参数或强制更长的权重形状;较短窗口则可能漏掉缓慢动态。滞后数应根据估计期内可用的信息来选择,并在不使用未来评估目标的情况下验证。样本内拟合良好本身不能说明滞后窗口捕捉到了可重复的信号。

高频观测值经过滞后权重曲线汇总,较近观测获得更高权重,再生成低频预测值的概念图
展示混合频率输入、滞后权重与低频预测的概念图,不代表实测数据

让预测起点与各项数据的可得时间对齐

频率标签本身不足以构成有效的预测设计。假设目标是未来五个交易时段的方差,预测在周五收盘后发布。预测变量可以包含截至周五收盘的日度观测,但不能包含用下周收益率计算的已实现方差统计量。如果目标是已发布的周度或月度统计,其发布时间可能晚于它所描述的期间。回测必须使用当时实际可得的数值,而不是后来修订或发布的数值。

建模前先写下预测起点表:预测何时生成、每个预测变量允许使用的最新时间戳、目标期间,以及目标何时可以观测到。对于金融收益率,应说明收盘到收盘收益率是否包含隔夜区间、哪个市场时段定义一天,以及节假日或缺失K线如何改变日度滞后数。五个交易时段与七个日历日并非相同区间。

数据发布日历会形成不齐整的边界。某个日期,一个预测变量可能有最新日度值,另一个月度序列却尚未发布。如果模型把上期月度值视为预测起点已知的滞后信息,向前延用可能是合理的。用后来发布的数据填补尚未发布的观测则不合理。历史修订会带来更隐蔽的前视问题:当前数据库可能包含实时预测者当时无法看到的修订版宏观序列。

不同步的市场又带来对齐问题。日度股票收盘价和加密资产收盘价可能对应不同的UTC区间;日内波动率估计也可能纳入预测时点之后才结束的K线。时区转换、夏令时调整、交易场所停市和K线构造都属于信息集的一部分。不要假设日期相同的行拥有相同的信息截止时间,应说明具体处理方式。

假设示例:把日度输入转成周度预测

假设目标是下周的已实现方差,预测在周五收盘时发布。模型使用刚结束一周的五个日度已实现方差输入。从最近到最早估计的权重为\(0.40, 0.25, 0.16, 0.11, 0.08\),总和为1。相应日度输入以收益率平方为单位,分别为\(0.0004, 0.0001, 0.0009, 0.0004, 0.0001\)。

加权历史值为\(0.40(0.0004)+0.25(0.0001)+0.16(0.0009)+0.11(0.0004)+0.08(0.0001)=0.000381\)。假设这个虚构拟合模型的截距为\(a=0.00012\),斜率为\(b=0.80\)。则下周方差预测为\(0.00012+0.80(0.000381)=0.0004248\)。如果需要用标准差概括,其平方根约为\(0.02061\),按所选目标定义,相当于目标周的\(2.06\%\)。

这项计算展示了如何将日度预测变量映射到未来周度目标;这些数值和拟合系数都是虚构的。它并不表示列出的某一天导致下周方差,也不代表资产很可能上涨或下跌。近期时段的权重说明的是,在样本和限制条件下,指定的预测模型如何组合观测输入;它不是因果响应的估计值。

这个示例也揭示了单位问题。日度和周度已实现方差都是收益率方差,但对应的累积区间不同。斜率 \(b\)、截距和目标构造都是针对该特定约定估计的;不能把日度输入简单重新标记为周度方差。如果目标是周方差的对数,模型输出的单位就是对数,指数化条件对数均值通常不等于条件方差均值。要转换回水平值,必须明确预测目标,并在适当时进行反变换校正。

估计取决于目标变量和滞后限制

给定固定的权重向量后,回归对截距和斜率是线性的。如果权重取决于未知非线性参数\(\theta\),估计通常使用非线性最小二乘或相关的似然方法。估计量可以同时搜索权重形状参数和回归系数,也可以针对每种候选形状剖面化消去线性系数。初始值、参数边界、收敛标准和局部最优解的数量都可能影响结果;不应隐瞒未收敛或边界解。

如果 \(y\) 是非负波动率指标,普通线性设定可能产生负的拟合值,尤其是在样本外。可选方法包括确保水平预测非负的限制、正值连接函数,或对目标变量取对数。这些选择会改变估计对象和预测解释。对数目标模型预测对数方差的条件均值,并不会自动得到方差的条件均值;误差分布和反变换方式都很重要。

抽样不确定性也取决于目标变量的构造方式。用日内收益率构造的周度已实现方差带有测量误差,并可能对微观结构噪声、采样间隔、跳跃和缺失值敏感。如果周度目标窗口重叠,相邻预测起点的误差就会共享相同的基础收益率。此时,假设预测误差相互独立的标准误和比较可能不适用。应采用与预测期和依赖结构相匹配的推断方法,并报告目标的测量流程。

参数稳定性同样值得关注。估计出的权重形状是整个估计样本的平均;如果市场结构变化,这条曲线可能无法很好地描述任何当前状态。扩展窗口和滚动窗口估计回答的问题不同:前者使用更多历史,但保留旧动态;后者适应更快,但观测更少、估计噪声更大。预先设定更新规则,并在按时间顺序的评估中与固定基准比较。

MIDAS与GARCH-MIDAS相关,但并不相同

MIDAS指通过加权滞后连接不同采样频率观测值的方法。MIDAS回归可以利用过去的日度或日内指标,直接预测未来已实现波动率目标。它不必指定GARCH模型中的一步条件方差递归。

GARCH-MIDAS是另一类模型,通常把由低频变量驱动、变化较慢的长期波动率成分,与递归变化的短期条件方差成分结合起来。两个成分各自有参数化方式和假设。看到论文或软件包使用GARCH-MIDAS这一名称时,应检查具体方程:MIDAS权重可能控制长期成分,GARCH递归则处理短期冲击。仅凭名称无法判断目标变量、预测的是潜在波动率还是已实现波动率,也不能知道如何确保正值。

早期关于金融波动率的MIDAS研究,在简约的预测框架中比较不同预测变量、频率和滞后长度。后续方法研究发展了混合频率回归模型的估计和检验性质,包括与传统时间聚合方法的比较。这些研究支持的是方法机制,并不意味着MIDAS总能胜过GARCH,或高频预测变量总能改善预测。结果取决于资产、样本、目标、预测变量、预测期和评估设计。

应根据问题选择模型。如果目标是用日度历史预测未来已实现波动率指标,直接MIDAS回归可以作为候选。如果目标是递归建模条件方差,应比较合适的GARCH设定。如果要将季度宏观发布与日度金融目标结合,混合频率回归可能需要控制数据发布版本。名称相似的模型可能回答不同问题,因此比较表现前要先对齐预测起点、目标定义和信息集。

测量误差和模型选择可能盖过权重曲线的作用

高频数据能提供更细的时间信息,也可能增加测量噪声。过短的K线包含买卖价反弹、价格离散性、过时报价、异步交易和数据源错误。不断缩短间隔并累加收益率平方,并不能保证得到更好的已实现方差估计。应在查看预测表现前选定采样网格和清理规则,并对合理替代方案做敏感性分析。

限制可学习信息量的是低频结果数量,而不是看起来很多的日度预测变量行数。十年日度输入与周度目标配对,在缺失值和留出评估期之前也只有大约500个周度结果。平滑权重函数比自由估计每日滞后系数所需参数更少,但在样本较短、预测变量高度持久或候选滞后冗余时,曲线形状仍可能难以识别。

分析者尝试多种高频指标、滞后长度、权重形式、变换、市场、预测期和评价损失后只报告最佳结果,会造成选择偏差。样本内拟合尤其容易受影响,因为同一批目标同时引导参数估计和模型选择。保留尝试过的模型族记录,预先确定主要指标,并使用后续的时间序列留出样本或考虑选择过程的比较方法。如果在相同日期比较许多预测,应考虑依赖性和多重检验,而不要把每个结果都当成独立确认。

拟合出的权重曲线不是因果解释。高频输入可能代理新闻、流动性或市场活动;未观测因素可能同时驱动预测变量和未来波动率。预测价值需要稳定的时序和样本外证据。因果解释则需要MIDAS滞后方程以外的识别设计和假设。

预测本身不等于有利可图的交易决策

波动率预测可以为风险预算、对冲规模或情景区间提供参考,但它不能决定收益率符号或持仓方向。预测的周度标准差\(2.06\%\)不是承诺的价格变动、最大亏损或期权隐含波动率报价。它是在拟合模型和样本下针对特定离散程度指标的预测;实际收益率仍可能远高于或低于该值。

研究策略时,要在测试前定义信号时间、下单时间、工具、敞口规则和退出方式。每个历史预测起点都只能用当时可得的信息重新估计MIDAS参数。先用预先设定的基准和与目标相符的损失函数评估预测,再单独模拟扣除价差、费用、资金费率、借券、市场冲击和换手后的收益。方差预测在统计上更好,并不保证成本后收益改善。

报告目标变量及其采样流程、预测变量定义和单位、低频与高频、预测起点、滞后数、权重函数和限制、估计窗口和更新计划、缺失数据与数据版本处理、损失函数、基准,以及按时间顺序划分的测试日期。如果滞后权重形状的选择会显著影响结果,也应展示预测不确定性或敏感性。相关背景可参阅已实现波动率、波动率聚集与GARCH和预测准确度比较指南。

主要来源包括Ghysels、Santa-Clara和Valkanov的MIDAS波动率预测研究,Ghysels、Sinko和Valkanov的方法综述与扩展,以及Andreou、Ghysels和Kourtellos对混合频率回归模型的分析。这些实证结果只适用于相应研究的样本和设计,不保证在当前市场或其他资产类别中有相同表现。

常见问题

Q1MIDAS是否意味着把所有数据都平均到一个频率?

不是。MIDAS回归让目标保持在选定频率,并对高频预测变量使用结构化的加权滞后项。它不需要把所有序列插值到逐行一致的共同日历上。

Q2MIDAS回归和GARCH-MIDAS是同一种模型吗?

不是。MIDAS是混合频率加权滞后的框架。GARCH-MIDAS把MIDAS式的长期成分与短期GARCH方差递归结合起来。要识别目标和各组成部分,应查看模型方程。

Q3MIDAS波动率预测更准后,能否直接作为交易信号?

不能仅凭这一点。波动率预测描述的是选定的离散程度指标。策略还需要单独设定方向或风险规则、现实的执行成本,以及按时间顺序进行的成本后评估。

资料来源与延伸阅读

报告问题

我们会准备一封包含本文链接的邮件。发送后,Mark 才会收到你的反馈

快速检查

读完指南后,用 3 道题检查一下

问题 1 / 3

问题 01

MIDAS权重函数的主要作用是什么?

选择答案即可查看解释

期权术语表