HAR-RV 模型详解:日度、周度与月度波动率预测
了解 HAR-RV 如何结合日度、周度和月度已实现波动率预测未来时期,并理解其长期记忆解释与预测边界
本指南内容HAR-RV 预测什么
简短摘要
HAR-RV 根据不同时间范围的近期汇总指标预测未来已实现波动率。日度、周度和月度项构成紧凑的回归,可以模拟某些类似长期记忆的模式;但模型本身并不具有真正的长期记忆,预测结果取决于波动率的定义和预测期限
HAR-RV 预测什么
已实现波动率异质自回归模型通常简称 HAR-RV。它利用近期已实现波动率指标在不同期限上的汇总值,预测未来的已实现波动率指标。常见的日度设定使用一个已结束交易日、五个交易日的平均值和 22 个交易日的平均值。这些窗口是回归的输入;预测下一交易日的 HAR-RV 仍然是一天期预测。
HAR-RV 可作为解释已实现波动率持续性的透明基准。其加法结构便于用线性回归估计,也便于与基于收益率的模型(例如 GARCH)比较。它是一种预测设定,并非决定何时入场、仓位多大或某项资产是否有吸引力的规则。
Corsi 的原始论文将其描述为不同时间尺度波动率成分的加法级联。异质市场期限的想法提供了动机,但回归并不识别具体交易者,也不能证明某些投资者群体导致了观察到的持续性。应把日度、周度和月度项视为对过去波动率的统计汇总。
定义已实现波动率输入
对于已结束的交易时段 \(t\),一种常见的已实现方差指标是将日内收益率平方后求和:
\[ RV_t = \sum_{i=1}^{M} r_{t,i}^{2} \]
其中,\(r_{t,i}\) 是第 \(i\) 个日内区间的收益率,\(M\) 是纳入计算的区间数。该总和的单位是收益率平方。 本指南有意在所有 HAR 项和预测示例中都使用收益率平方尺度上的已实现方差。Corsi(2009)的原始 HAR-RV 则使用平方根尺度上的已实现波动率指标。两种约定彼此相关,但不能混在同一个回归中。日、周、月输入以及预测目标必须保持同一尺度。 已实现波动率计算指南介绍了相关测量选择。
采样间隔、价格来源、市场时段以及隔夜收益的处理方式共同决定 \(RV_t\) 的含义。例如,只对常规交易时段内的日内收益率求和,并不会自动包含收盘至开盘的变动。日内样本也可能受到报价噪声及其他市场微观结构特征影响。Hansen 和 Lunde(2006)研究了市场微观结构噪声对已实现方差测量的影响。Andersen、Bollerslev、Diebold 和 Labys 讨论高频观测、已实现波动率与较低频收益变动之间的联系;他们的框架并不意味着各种采样规则可以互换。
历史数据、预测变量和预测目标应采用一致的定义。把五分钟收益率改为一分钟收益率,或把常规时段数据改成收盘到收盘数据,都可能改变所得序列。这不只是格式差异:估计系数和被评价的预测也可能随之改变。
汇总日度、周度和月度指标
令 \(RV_t^{(d)}=RV_t\) 表示日度指标。一种常见做法是用最近五个已结束日度值的平均数构造周度成分,用最近 22 个值的平均数构造月度成分:
\[ RV_t^{(w)} = \frac{1}{5}\sum_{j=0}^{4}RV_{t-j}, \qquad RV_t^{(m)} = \frac{1}{22}\sum_{j=0}^{21}RV_{t-j} \]
除以窗口长度后,得到的是窗口内平均每日已实现方差。若改用求和,则表示整个窗口累计的已实现方差。单独定义的模型可以采用任一种约定,但公式、目标和单位必须相互一致。
这些窗口彼此重叠。最新的日度观测也包含在周度和月度平均值中,周度窗口里的观测也属于月度窗口。因此,预测变量汇总的是同一段历史中相互关联的部分,并非彼此独立的测量。也不应把三个系数解读为三个独立期限各自的因果效应。
五个和 22 个观测通常指交易时段,而不一定是日历周和日历月。市场假日、缺失时段或不同的期货交易日历都需要明确规则。在比较不同资产的估计结果前,应记录观测日历及不完整窗口的处理方式。
写出 HAR-RV 回归式
基本的一步日度 HAR-RV 回归为
\[ RV_{t+1}^{(d)} = \beta_0 + \beta_d RV_t^{(d)} + \beta_w RV_t^{(w)} + \beta_m RV_t^{(m)} + \varepsilon_{t+1} \]
左侧是下一已结束交易时段的已实现方差。每个预测变量在时段 \(t\) 结束时都已知。截距 \(\beta_0\) 和系数 \(\beta_d,\beta_w,\beta_m\) 由历史观测估计;\(\varepsilon_{t+1}\) 是使用预测变量后仍剩余的回归误差。
普通最小二乘法会选择使既定目标的样本内预测误差平方和最小的系数。这样便能形成紧凑的线性基准,无需为每一个日度滞后分别估计系数。Corsi(2009)提出 HAR-RV 构造,并报告了该论文数据和设定下的预测结果。这些经验结果不能保证其他资产、时期或已实现波动率指标也具有相同系数或准确度。
不同论文的记号并不一致。有些 HAR 设定使用对数、其他已实现波动率估计量、额外滞后项或不同窗口。应说明使用的目标和变换,而不要把所有名称中含有“HAR”的模型都视作同一个方程。
将估计方程转换为预测
估计系数后,将最新的日度、周度和月度值代入,计算下一时段的点预测。预测时无法知道未来回归误差,因此预测式中不包含它:
\[ \widehat{RV}_{t+1\mid t}^{(d)} = \widehat{\beta}_0 + \widehat{\beta}_d RV_t^{(d)} + \widehat{\beta}_w RV_t^{(w)} + \widehat{\beta}_m RV_t^{(m)} \]
假设截距估计值为 \(0.10\ \mathrm{bp}^2\),三个系数依次为 \(0.50\)、\(0.30\) 和 \(0.15\)。再假设最新日度指标为 \(4\ \mathrm{bp}^2\),五日均值为 \(3\ \mathrm{bp}^2\),22 日均值为 \(2\ \mathrm{bp}^2\),则
\[ 0.10 + 0.50(4) + 0.30(3) + 0.15(2) = 3.30\ \mathrm{bp}^2 \]
这是虚构的算术示例,不是市场数据、估计结果或绩效主张。它是在上述目标和单位下对下一时段的预测。开平方后会得到同一时段以基点表示的波动率;年化需要另外说明所采用的约定。
预测完整一周或一个月时,不能简单地把下一日预测改称周度或月度预测。一种做法是直接估计模型,让左侧成为目标未来窗口内累计或平均的已实现方差。另一种做法是迭代一步预测,但必须明确未来日度、周度和月度预测变量的更新规则。评分前应先确定预测期限。 <!-- learn:illustration -->

为什么称为长期记忆的近似模型
波动率往往在许多滞后期内保持持续性。较长的自回归模型能够表示这种依赖关系,但需要很多参数。HAR-RV 将历史压缩为少数重叠平均值,用较少的系数再现类似长期记忆的经验模式。
“近似”一词很重要。Corsi 的论文明确指出 HAR-RV 模型没有真正的长期记忆性质,同时展示模拟可以再现与长期记忆金融收益相关的一些特征。因此,HAR-RV 是对特定模式的实用近似,而不是因为数据依赖缓慢衰减就成为分数积分过程。
日度、周度和月度成分也不是对恰好按这些频率交易的投资者所作的直接统计。异质期限的想法为级联结构提供动机,但估计出的回归不能区分投资者类型或意图,也不能确立因果机制。应围绕模型实际使用的输入和预测表现进行解释。
跳跃可能促使扩展 HAR 模型
较大的价格跳跃可能含有单一总方差指标无法显示的未来波动信息。Corsi、Pirino 和 Reno(2010)通过阈值双幂方法分离连续与不连续变动,并研究跳跃信息对波动率预测的作用。其报告的预测改进,特别是跳跃之后的改进,适用于该研究使用的估计量、数据和实证设计。
考虑跳跃的 HAR 设定可以分别纳入连续成分和跳跃相关指标,或它们的滞后汇总值。这会带来新的选择:如何识别跳跃、如何估计连续成分,以及跳跃指标在预测时是否可用。“连续”和“跳跃”描述的是模型下估计量的成分,并不表示分解没有误差。
增加更多项可能改善一个样本中的预测,也可能在另一个样本中增加估计噪声。比较跳跃扩展与简单 HAR-RV 基准时,应使用相同的预测时点、期限、目标指标和信息集。不能据此推断每次跳跃都会预示更高波动率,也不能认为扩展模型在所有市场都会表现更好。
测量方式和预测期限会改变结果
HAR-RV 系数取决于用于估计的已实现波动率序列。采样频率、交易时段边界、价格清理和缺失观测都可能改变该序列。周度和月度预测变量是已测量日度值的平均数,因此也继承这些选择。
应区分预测时点和目标区间。如果模型在交易时段收盘时估计,下一时段目标应与历史目标使用相同的资产、收益率约定、时段覆盖范围和单位。如果指标不含隔夜收益,在没有调整的情况下就不要把预测描述为完整的收盘到收盘方差。日历窗口、重叠的多日期限和不同的假日规则都需要单独定义。
检查预测有效性并公平比较模型
已实现方差非负,但不受约束的线性回归不会限制系数或预测值必须非负。对于某些数据,普通最小二乘法可能产生负的样本外预测。对数设定或受约束估计可以用另一种方式处理正值要求,但会改变模型及其系数含义。设置预测下限也是建模选择;应在评估前确定,而不是看到哪个模型获胜后再调整。
应在估计样本外评价预测,并保存每个预测时点实际可用的数值。使代理指标、预测目标、期限、交易时段覆盖范围、单位和共同评价日期保持一致。说明预测如何估计或更新,并与明确指定的基准比较。如果已实现指标只是有误差的代理,预期排名取决于它与目标的关系以及损失函数。Patton(2011)解释了为什么代理噪声并不意味着所有比较都自动可靠。QLIKE 与平方误差指南讨论了这些评价假设。
较低的预测损失只表示模型在所选目标、代理、样本和损失函数下得分更好。它不能证明模型导致了波动率,也不能说明日度预测是交易信号,或使用该预测的策略扣除执行成本并遵守风险限制后会盈利。
常见问题
Q1HAR-RV 和 GARCH 是同一个模型吗?
不是。基本 HAR-RV 回归使用按多个期限汇总的滞后已实现波动率指标。GARCH 则通过自己的收益率递推式建模条件方差,不过扩展模型也可以加入其他输入。
Q2HAR-RV 能证明交易者按日度、周度和月度周期进行交易吗?
不能。这些名称指统计汇总窗口。回归不会识别实际投资者群体,也不证明他们造成了波动率持续性。
Q3标准 HAR-RV 预测可能为负吗?
可能。普通最小二乘不会将拟合值限制为非负。变换后的模型或带约束的模型可以避免负预测,但应明确说明其设定和评价方法。
Q4下一日 HAR-RV 预测等于一周波动率预测吗?
不等于。一周目标应定义为未来一周的累计或平均指标,或通过明确说明的递归程序构造。预测期限和区间覆盖范围应与预定用途一致。 主要研究 - Corsi (2009), “A Simple Approximate Long-Memory Model of Realized Volatility,” *Journal of Financial Econometrics*, 7(2), 174–196. - Andersen, Bollerslev, Diebold, and Labys (2003), “Modeling and Forecasting Realized Volatility,” *Econometrica*, 71(2), 579–625. - Corsi, Pirino, and Reno (2010), “Threshold Bipower Variation and the Impact of Jumps on Volatility Forecasting,” *Journal of Econometrics*, 159(2), 276–288. - Hansen and Lunde (2006), “Realized Variance and Market Microstructure Noise,” *Journal of Business & Economic Statistics*, 24(2), 127–161. - Patton (2011), “Volatility Forecast Comparison Using Imperfect Volatility Proxies,” *Journal of Econometrics*, 160(1), 246–256.
资料来源与延伸阅读
报告问题
我们会准备一封包含本文链接的邮件。发送后,Mark 才会收到你的反馈
快速检查
读完指南后,用 3 道题检查一下
问题 01
在基本的日度 HAR-RV 模型中,周度和月度项代表什么?
选择答案即可查看解释