双尺度已实现波动率:存在微观结构噪声时如何估计方差
了解双尺度已实现波动率如何结合密集与稀疏价格网格,降低独立微观结构噪声造成的偏差,并查看计算示例、假设和局限。
本指南内容为什么增加高频观测可能让方差估计变差
简短摘要
双尺度已实现波动率(TSRV)将每个观测值形成的含噪估计,与多个较稀疏采样网格上的平均值结合起来。在明确的加性独立噪声模型下,密集网格估计可帮助估计并扣除稀疏网格的噪声偏差。该方法估计积分方差;它不会把含噪观测变成精确价格,也不预测下一期收益。
为什么增加高频观测可能让方差估计变差
已实现方差通常由收益平方求和得到。如果观测到的对数价格完全跟随有效价格,增加观测可以更完整地捕捉价格路径。但实际成交价和报价还会受买卖价反弹、价格离散、延迟和其他市场微观结构效应影响。在极短间隔内,这些效应可能大于两次观测之间有效价格的变动。
因此,即使资产在整个交易时段的积分方差没有变化,采样越频繁,朴素已实现方差也可能越高。这不一定表示资产的经济波动率上升;反复平方并累加含噪价格差也会产生这种现象。已实现波动率计算指南介绍普通的收益平方和;本文聚焦于修正一种特定的高频偏差来源。
Zhang、Mykland 和 Aït-Sahalia 在最初的双时间尺度研究中提出 TSRV,用两个采样分辨率完成不同任务。稀疏网格减少受噪声污染的增量数量;对多个错开的稀疏网格取平均,可以避免依赖一个任意起点;完整密集网格则提供一个按比例缩放后可扣除的噪声估计。这个逻辑依赖模型假设和有限样本选择,因此结果仍是带有不确定性的估计,而不是经过“清洗”的真实价格路径。
将有效对数价格与观测噪声分开
令 \(X_t\) 表示潜在有效对数价格,并假设它在所研究窗口内是局部方差速率为 \(\sigma_t^2\) 的连续过程。目标是其积分方差: \[ IV_T=\int_0^T\sigma_t^2\,dt. \]
在观测时点 \(t_i\),记录的对数价格为 \[ Y_{t_i}=X_{t_i}+\epsilon_{t_i}, \] 其中 \(\epsilon_{t_i}\) 是观测噪声。经典推导采用一个基准模型:噪声均值为零、各观测时点之间相互独立、与有效价格过程独立,且方差恒为 \(\omega^2\)。模型还假定采样网格规则,并且窗口内有效价格过程满足适当的连续性条件。这些是模型条件,并非所有交易所数据都具备的普遍事实。
观测增量为 \(\Delta Y_i=\Delta X_i+\epsilon_i-\epsilon_{i-1}\)。噪声以相反符号进入相邻收益:某一观测的正价格误差会抬高一期收益、压低下一期收益。这就是为什么由含噪价格计算的收益不等同于相互独立的测量误差。二次变差指南解释了在无噪声情况下,平方增量和为何以路径变差为目标。
这里的目标是指定时间窗口内的方差,不是买卖价差估计、预测或实际成交成本。若要研究另一类成交价格问题,可参阅Roll 买卖价差估计。明确目标很重要,因为多种市场微观结构方法都使用高频价格,却估计不同的量。
为什么全 tick 已实现方差会被噪声主导
对密集网格上的 \(n\) 个收益,定义 \[ RV_{\mathrm{all}}=\sum_{i=1}^{n}(Y_{t_i}-Y_{t_{i-1}})^2. \] 基准模型下,单个观测收益的噪声部分为 \(\eta_i=\epsilon_i-\epsilon_{i-1}\),其方差为 \(\operatorname{Var}(\eta_i)=2\omega^2\)。在独立性假设下,忽略期望为零的交叉项,可得 \[ E[RV_{\mathrm{all}}]\approx IV_T+2n\omega^2. \]
第一项是目标积分方差,第二项则为每个密集收益累积一份噪声贡献。采样间隔缩短、\(n\) 增大时,噪声项可能占主导。因此忽略测量噪声时,“采样越频繁越好”并不是安全规则。Aït-Sahalia、Mykland 和 Zhang 在存在微观结构噪声时的采样研究中分析了有限样本下的最优采样频率。
这是特定模型下的期望近似。具体样本还含有有效价格增量与噪声增量之间的随机交叉项,所以实际值未必等于期望。若噪声方差在日内变化、误差存在序列相关或采样不规则,简单的 \(2n\omega^2\) 未必能描述偏差。此时,熟悉的公式可能算出看似精确的数字,却修正了错误的部分。
对错开的稀疏网格取平均,而不是任意选一个网格
选择整数间距 \(K>1\)。对每个偏移 \(k=0,\ldots,K-1\),每隔 \(K\) 个观测价格取一个点,计算稀疏网格已实现方差: \[ RV_{K,k}=\sum_j\left(Y_{t_{k+jK}}-Y_{t_{k+(j-1)K}}\right)^2. \] 每个稀疏增量跨越更长时间,但网格覆盖的总体观测窗口大致相同。对可用的偏移取平均: \[ \overline{RV}_K=\frac{1}{K}\sum_{k=0}^{K-1}RV_{K,k}. \]
偏移起点会影响结果。单一稀疏网格可能恰好在大幅波动前或后开始,导致估计依赖起点。对错开的网格取平均可降低这种依赖,但不会生成 \(K\) 份相互独立的数据:这些网格重复使用同一批观测,在统计上相互依赖。
若观测噪声独立且方差相同,稀疏收益两端的噪声来自不同观测,其差仍有 \(2\omega^2\) 的方差。稀疏收益数量少于密集收益,因此稀疏估计的平均值累积的噪声偏差较小。由于稀疏增量覆盖整个窗口而非其中一小段,其信号部分仍大致对应相同的积分方差。
本文插图为概念示意:它将锯齿状观测路径与围绕较平滑潜在路径的多个错位稀疏视图进行比较。图中不含市场数据,也不是实际估计结果。若关注基于最高价和最低价而非双网格构造的估计,请参阅OHLC 区间波动率估计指南。
<!-- learn:illustration -->

扣除按比例缩放的密集方差,并进行有限样本标准化
令 \(\bar n\) 为各偏移网格中稀疏收益数量的平均值,并设 \(\lambda=\bar n/n\)。基准模型下,平均稀疏网格的噪声偏差约为 \(2\bar n\omega^2\)。密集网格估计的噪声偏差约为 \(2n\omega^2\),所以 \(\lambda RV_{\mathrm{all}}\) 大约贡献 \(2\bar n\omega^2\)。两者相减可抵消主要噪声项: \[ TSRV_{\mathrm{raw}}=\overline{RV}_K-\lambda RV_{\mathrm{all}}. \]
这个原始差值也会扣掉比例为 \(\lambda\) 的积分方差信号,因为两个已实现方差项都含有信号。常见的有限样本标准化为 \[ \widehat{IV}_{TSRV}=\frac{\overline{RV}_K-\lambda RV_{\mathrm{all}}}{1-\lambda}. \] 在简单期望计算中,分母恢复信号系数。不同实现对端点的处理和定义可能不同,应记录 \(n\) 的确切定义、偏移集合及 \(\bar n\) 的计算方式。这项修正不会消除抽样不确定性,也不能修复错误的噪声模型。经典渐近设置下,样本增大时 \(\lambda\) 会变小;但在短窗口中,有限样本因子仍可能重要。
若 \(\overline{RV}_K<\lambda RV_{\mathrm{all}}\),估计值可能为负。负值不表示物理变差为负,而表示有限样本下噪声扣除量超过了稀疏网格估计。为了展示方便而将其改为零,会改变估计量并增加截断规则。分析时应保留并报告原始估计,检查尺度和假设,并明确披露后续截断。
用六个假设收益逐步计算
假设七个虚构的对数价格观测产生六个密集网格收益,单位为基点:\([1,1,-1,-1,1,1]\) bp。这个特意构造的小序列只用于演示算术,不是交易所数据。密集网格已实现方差为 \[ RV_{\mathrm{all}}=1^2+1^2+(-1)^2+(-1)^2+1^2+1^2=6\,\mathrm{bp}^2. \]
设 \(K=2\)。第一个偏移将相邻密集收益合并为 \([2,-2,2]\) bp,平方和为 \(4+4+4=12\,\mathrm{bp}^2\)。错开的第二个偏移得到 \([0,0]\) bp,平方和为 0。两个网格估计的平均值为 \(\overline{RV}_K=(12+0)/2=6\,\mathrm{bp}^2\)。
六个密集收益对应两个偏移,稀疏收益的平均数量为 \(\bar n=(3+2)/2=2.5\)。因此 \(\lambda=2.5/6=5/12\),并且 \[ \widehat{IV}_{TSRV}=\frac{6-(5/12)6}{1-5/12}=\frac{3.5}{7/12}=6\,\mathrm{bp}^2. \]
方差估计为 \(6\,\mathrm{bp}^2=6\times10^{-8}\),单位是十进制收益的平方。平方根约为该假设窗口内的 \(2.45\) bp;这个数值没有年化。这个小型构造序列恰好与密集网格 RV 相同,并不表示 TSRV 恒等于 RV。其他价格路径可能产生更高、更低甚至负的估计。
这项算术也显示了模型限制:潜在路径与噪声没有分别观测,因此单凭该样本无法证明 \(6\,\mathrm{bp}^2\) 等于真实积分方差。可以核对求和、尺度和单位,却不能从例子中推断隐藏分解。实证文献还研究 realized-kernel 等其他高频噪声修正方法;它们同样有各自的假设和实现选择。
两个尺度估计什么,以及如何选择 K
\(K\) 决定稀疏收益数量、平均处理和噪声修正之间的权衡。\(K\) 很小时,短增量仍很多,噪声敏感性可能较强。\(K\) 很大时,粗网格收益过少,稀疏估计会不稳定,也更易受窗口长度有限的影响。偏移平均有助于处理网格对齐,却无法补足短样本或低质量样本中不存在的信息。
在最初的渐近分析中,最优稀疏间距随样本量增加;按该文的记号和基准条件,其阶数为 \(n^{2/3}\)。这是理论尺度关系,不是必须选用某个秒数或观测数的通用指令。最优值取决于噪声与信号的比例及模型假设;后续研究和实务实现也可能采用不同调参规则和端点约定。为便于复现,应报告采样间隔、\(K\)、偏移集合、交易时段边界和有限样本标准化方式。
稳健的分析可以比较预先设定的一组合理 \(K\) 值并展示敏感性,而不是事后挑选最“好看”的结果。如果估计明显变化,这种不稳定本身就是发现的一部分。尺度应根据数据设计和记录在案的规则选择,不能在看到期望的波动率结果后再调整。可以与更粗采样的已实现方差或抗噪替代方法比较,但要明确区分这些指标。
经典 TSRV 假设不成立时
经典修正针对特定噪声结构推导。买卖价反弹等微观结构效应可能存在序列相关、日内变化、依赖流动性,或与有效价格增量相关。Hansen 与 Lunde 在已实现方差研究中指出,实现方差与微观结构噪声的相互作用可能包括时间依赖,以及噪声与有效价格变化的相关性。随后 Aït-Sahalia、Mykland 和 Zhang 提出了适用于相关微观结构噪声的双尺度方法。这一扩展说明,应把修正后的估计量与原始独立噪声公式区分开,而不能假设原式能处理所有依赖结构。
其他实际问题包括不规则观测时间、多资产不同步、陈旧报价、价格离散、跳跃、错误成交、开收盘效应和缺失观测。这些因素会影响密集网格修正项,以及进入稀疏网格的收益。跳跃是否属于目标二次变差、或应另行拆分,取决于研究问题;TSRV 本身不替研究者决定这一建模选择。过滤观测也会改变网格,应当记录。
抗噪不代表免受所有数据问题影响。在把估计解释为潜在方差之前,应说明输入是成交价、报价还是中间价,明确收益变换和时钟,检查观测是否等间隔,记录清洗和交易时段规则,并评估对 \(K\) 的敏感性。如果噪声过程违反基准假设,应使用针对该情形设计的方法并说明其假设。不要把负估计称为负波动率,也不要悄悄将它改成正数。
报告估计量,不要把它说成预测
透明报告应注明目标窗口、输入价格序列、采样间隔、密集收益数量、稀疏间距 \(K\)、偏移集合、端点规则、噪声假设、标准化、单位及任何截断。可以同时展示原始差值、标准化估计,以及预先设定尺度下的敏感性范围。这些信息让计算可审计,也避免把方差估计误认为报价、未来预测或盈利交易规则的证据。
积分方差针对已观测窗口。年化需要明确的时间约定,而且不应掩盖日内模式、隔夜区间或交易中断。开平方会把单位转成该窗口内的波动率,但不会自动生成预测期限。历史已实现指标可以作为模型输入;预测表现必须另用未参与选择估计设置的数据评估。
TSRV 的主要贡献是方法层面的:在明确的加性噪声模型下,它用两个采样尺度降低使朴素高频已实现方差无法一致估计目标的主要噪声偏差。它不能识别每次价格波动的来源、消除模型风险,也不能告诉你下一期波动率。报告数字时应同时说明这些边界。
常见问题
Q1TSRV 是否使用每个观测值?
密集网格已实现方差使用所有观测,错开的稀疏网格也会重复使用这些观测。每个稀疏网格单独看采样频率较低。该方法会结合这些部分,不会丢弃密集观测,也不会把各网格变成独立样本。
Q2双尺度已实现波动率是波动率预测吗?
不是。标准目标是已观测窗口内的积分方差。开平方会得到该窗口的波动率单位;若要预测后续期间,还需要单独的模型和样本外评估。
Q3负的 TSRV 估计应该改成零吗?
不应在不说明的情况下修改。若按比例缩放的密集网格修正超过稀疏估计,有限样本值可能为负。截为零会改变估计量并影响平均值与推断;应报告原始值及任何后续处理规则。
Q4原始 TSRV 公式能处理所有微观结构噪声吗?
不能。经典推导采用包括观测误差独立性在内的基准噪声模型。随时间变化或序列相关的噪声、不规则采样,以及噪声与有效价格变化之间的依赖,可能需要采用不同或修正后的估计量。
资料来源与延伸阅读
报告问题
我们会准备一封包含本文链接的邮件。发送后,Mark 才会收到你的反馈
快速检查
读完指南后,用 3 道题检查一下
问题 01
为什么采样间隔极短时,朴素已实现方差可能上升?
选择答案即可查看解释