Skip to content
全部期权指南
概括依赖性在不同时间尺度上如何扩展的统计量阅读约 16 分钟

赫斯特指数与 R/S 分析:长记忆的估计、计算与交易局限

了解重标极差分析如何估计赫斯特指数,通过假设数据逐步计算,并理解为什么持续性并不等于有利可图的交易信号。

本指南内容赫斯特指数描述标度关系,不预测下一次价格变动

简短摘要

赫斯特指数概括了观察窗口变长时,重标极差等统计量的增长速度。在特定的标度模型下,大于 0.5 的值与增量持续性相符,小于 0.5 的值与反持续性相符。单凭估计值,不能证明价格可预测、策略能盈利,也不能证明测得的模式确实来自长记忆。

赫斯特指数描述标度关系,不预测下一次价格变动

赫斯特指数记作 \(H\),表示时间尺度与该尺度下波动幅度之间关系的斜率。在重标极差分析中,累计偏差的极差会除以序列的标准差。如果平均比值随区块长度 \(n\) 增加而近似按 \(n^H\) 增长,那么对数—对数关系的斜率就是 \(H\) 的估计值。这个系数源自 H. E. Hurst 对水库储水容量的研究:水库需要多大的容量才能应对变化的河流流量。它并不是为买卖信号而设计的。Hurst 的原始论文《水库的长期储水能力》介绍了如何根据年度流量相对均值的累计偏差计算极差。

“持续”“反持续”和“类似随机”等解释,取决于研究的过程以及采用的标度假设。在常见的平稳增量基准下,\(H=0.5\) 对应平方根时间标度;\(H>0.5\) 与正向持续性相关,\(H<0.5\) 与反持续性相关。这些术语描述的是所选尺度上被测序列的依赖关系,并不表示下一期收益率取某个方向的概率。

输入序列不同,研究的问题也会改变。把同一种方法用于原始收益率、绝对收益率、收益率平方、价格水平或累计收益率,得到的结果不能互换。收益率方向依赖性不明显的序列,其绝对收益率仍可能表现出持续的波动聚集。带趋势或积分的价格水平也可能出现标度关系,但原因与平稳收益率中的长记忆不同。报告 \(H\) 时,请说明变量、采样间隔和采用的尺度范围。

重标极差分析把每个区块变成尺度统计量

取一个包含 \(n\) 个观测值 \(x_1,\ldots,x_n\) 的区块。先计算区块均值 \(\bar{x}_n\),从每个观测值中减去均值,再将中心化后的数值逐步累加:

\[ Y_{k,n}=\sum_{t=1}^{k}(x_t-\bar{x}_n), \qquad k=1,\ldots,n. \]

即使中心化观测值在区块末尾的总和为零,累计路径仍会在中间上下波动。极差等于累计值的最高点减去最低点:

\[ R_n=\max_{1\leq k\leq n}Y_{k,n}-\min_{1\leq k\leq n}Y_{k,n}. \]

按明确说明的约定计算区块标准差。这里分母取 \(n\):

\[ S_n=\sqrt{\frac{1}{n}\sum_{t=1}^{n}(x_t-\bar{x}_n)^2}, \qquad Q_n=\frac{R_n}{S_n}. \]

比值 \(Q_n\) 用区块自身普通波动的单位表示累计极差。常数区块的 \(S_n=0\),因此比值没有定义,不能悄悄当作零贡献。在实际操作中,将记录划分为指定长度的区块,计算每个有效区块的比值并取平均,再对预先设定的一系列区块长度重复计算。Mandelbrot 和 Wallis 在1969 年论文中研究了多种模拟分布和依赖模式下 R/S 的表现。他们的分析使 R/S 成为广泛使用的标度诊断工具,但这不代表它能免受所有模型设定错误的影响。

如果所选尺度上的区块均值统计量大致满足 \(\overline{Q}_n\approx Cn^H\),取对数后得到:

\[ \log \overline{Q}_n=\log C+H\log n+\varepsilon_n. \]

将 \(\log \overline{Q}_n\) 对 \(\log n\) 拟合后得到的斜率,就是指数估计值。在狭窄或看过结果后挑选的区间里,图线看起来笔直本身并不是有力证据。许多有限样本在少数尺度上都可能近似线性,同一条记录的不同部分也可能出现不同斜率。

三个窗口长度分别展示中心化观测值与累计偏差路径;每条路径的最高点与最低点之间的范围,和观测值的离散程度并列呈现
在多个尺度重复进行R/S分析的概念图:对每个窗口减去均值、累计偏差,再将累计极差与窗口内离散程度比较。仅为示意,不代表市场数据、估计的H值、预测或交易信号

一个小型假设样本展示每一步计算

考虑八个假设收益率,单位为任意基点:\(3,1,0,-1,2,0,-2,-3\)。全样本均值为零。对每个区块长度,把序列拆成相邻且互不重叠的区块,计算每个区块的 \(R_n/S_n\),再对比值取平均。示例采用分母为 \(n\) 的总体型标准差;采用其他约定会使结果略有变化。

当 \(n=2\) 时,每一对的极差与标准差之比均为 1,平均值也是 1。当 \(n=4\) 时,两个区块的 \((R,S)\) 约为 \((2.500,1.479)\) 和 \((3.500,1.920)\),比值约为 1.690 和 1.823,平均值约为 1.756。当 \(n=8\) 时,中心化累计路径为 \(3,4,4,3,5,5,3,0\),因此极差为 5。标准差为 \(\sqrt{3.5}\approx1.871\),比值约为 2.673。

区块长度 \(n\)平均 \(R/S\)
21.000
41.756
82.673

这三个对数尺度点间距相等,因此普通最小二乘斜率等于两端点的斜率:

\[ \widehat{H}=\frac{\log(2.673)-\log(1.000)}{\log(8)-\log(2)}\approx0.709. \]

这是基于八个虚构数值、可重复计算的例子,并不是长记忆的可信证据。该估计会受到个别观测值很大影响,只有三个尺度,也没有不确定性区间。如果序列包含结构变化,或是在看到结果后才挑选尺度,单纯增加观测数量并不能自动解决问题。

<!-- 插图位置:本节之后;以无文字概念图表现短区块和长区块尺度上的中心化观测如何累积成极差,以及极差增长快于区块内标准差的情形。不要添加坐标轴、标签或数值结论。 -->

接近 0.5 的估计值需要结合模型和不确定性解读

对于方差有限且只有短程依赖的平稳序列,许多常见的长期标度结果会给出接近 0.5 的指数。在分数高斯噪声一类的模型下,\(H>0.5\) 与正向长程依赖相符:与基准相比,同方向偏差更容易接着出现,相关性也会缓慢衰减。小于 0.5 的指数与反持续性相关,此时反转或符号相反的依赖关系主导标度行为。

“在模型假设下”这一限定很重要。普通 R/S 斜率是一个估计值,并不是对某种唯一经济机制的直接检验。小样本偏差会使估计值偏离 0.5;重叠区块、分母约定、尺度端点和自相关也会影响结果。置信区间包含 0.5,不代表独立性已获证明;区间不包含 0.5,也不代表观测值必然由稳定的长记忆模型生成。

不要把 \(H=0.7\) 解释为“趋势延续概率为 70%”“收益率会持续 70 天”或“胜率为 70%”。\(H\) 不是概率,也不是持仓期限;它描述的是估计出来的标度关系。要提供依赖关系的统计证据,还需要模型、不确定性评估,以及对短期相关、条件异方差、确定性趋势或制度转换等替代解释的检验。

短期自相关和波动聚集可能看起来像持续性

经典 R/S 不只会对真正的长程依赖作出反应。短暂的 AR 模式可能让同号偏差靠得更近,从而扩大累计极差。Lo 指出,短程序列相关会使经典统计量向上偏,令短记忆过程看起来具有持续性。他提出修正 R/S 方法,以在考虑短程依赖的同时检验长记忆。在他研究的股票收益率指数中,控制短期自相关后,长记忆证据消失了;这是他所用样本和检验的结果,并不代表对所有资产或之后时期的结论。请参阅 Lo 的1991 年论文。

波动聚集带来另一种误读。收益率符号可以正负交替,但收益幅度仍可能成簇出现。对收益率使用 R/S,研究的是带符号的累计偏差;对绝对收益率或平方收益率使用,则研究幅度上的持续性。若 \(|r_t|\) 的估计值较高,它可能说明风险成簇,而不代表价格方向可以预测。条件方差依赖性的另一项诊断见 [ARCH LM 检验指南](/zh-CN/learn/arch-lm-test-volatility-clustering-finance-explained)。[方差比检验指南](/zh-CN/learn/variance-ratio-test-random-walk-horizon-scaling-explained)介绍了跨持有期概括收益率依赖性的另一种方法。

厚尾分布和离群值也很重要。Mandelbrot 和 Wallis 在许多非高斯模拟中发现了一些有用的稳健性,但这并不表示一次极端波动、波动率状态切换或均值模型设定错误都无关紧要。严谨分析应报告所选原始序列的结果,并检查结果在合理替代方案下如何变化,而不是不断删除不方便的观测值,直到指数看起来熟悉为止。

趋势、结构变化和尺度选择可能制造虚假的长记忆

从每个区块中减去区块均值可以移除固定水平,但不能移除所有确定性模式或变化模式。缓慢趋势、一次性水平跳变、样本构成改变或波动率突变,都可能产生较长的累计偏移。拟合后的对数关系可能看起来符合幂律,但序列实际并不一定存在稳定的长记忆机制。变点检验或分段回归处理的是另一类问题;请参阅[中断时间序列回归指南](/zh-CN/learn/interrupted-time-series-segmented-regression-finance-explained)。

尺度选择本身也是模型的一部分。很短的区块主要反映局部噪声和市场微观结构;很长的区块则剩下很少可用片段。使用重叠窗口可以增加计算出的比值数量,却不会相应增加同样多的独立信息。短尺度一个斜率、长尺度另一个斜率的交叉现象,可能表示不同动态、结构变化、季节性,也可能只是估计噪声。没有解释就把它压成一个 \(H\) 并不妥当。

请明确输入是价格、对数价格、收益率、绝对收益率还是过滤后的残差,区块是否重叠。解释结果前先确定区块范围和最小区块数,报告每个尺度使用的观测数,并展示对合理端点的敏感性。如果价格是积分序列,针对平稳收益率的常见解释不能原样套用。去趋势并非万能修复:它会改变测量对象,也可能连同无关趋势一起删除具有经济意义的波动。

Lo 的修正 R/S 在分母中使用长期方差估计

Lo 的修改保留了中心化累计偏差的极差,但将普通区块标准差换成长程方差估计,其中包含短滞后自协方差。常见记法如下:

\[ Q_n^{\mathrm{Lo}}(q)=\frac{R_n}{\widehat{\sigma}_n(q)},\qquad \widehat{\sigma}_n^2(q)=\widehat{\gamma}_0+ 2\sum_{j=1}^{q}\left(1-\frac{j}{q+1}\right)\widehat{\gamma}_j. \]

其中 \(\widehat{\gamma}_j\) 是滞后 \(j\) 的样本自协方差,\(q\) 是截断带宽。三角权重会降低接近截断位置的自协方差权重。修正统计量应与相应的零分布比较;它不只是分母更合适的经典 R/S 估计,其数值也不会自动变成调整后的 \(H\)。

带宽决定方差估计会纳入哪些短期相关性。\(q\) 太小可能遗漏重要的短程依赖;\(q\) 太大则会让估计更嘈杂,还可能吸收原本要区分的模式。应报告带宽规则、采样频率、检验统计量、零假设和 p 值,并考虑预先设定的敏感性范围。Lo 的论文说明了这种区别为何重要:经典 R/S 会对短记忆作出反应,而修正检验针对的是一个允许弱短期依赖的更广泛零假设。

DFA 和频域估计采用不同的数据变换

去趋势波动分析(DFA)先将去均值观测值积分成剖面,再把剖面分成多个窗口,在每个窗口内拟合局部多项式,并计算残差波动的均方根 \(F(s)\),其中 \(s\) 是窗口长度。回归 \(\log F(s)\) 对 \(\log s\) 得到标度斜率。局部拟合可以降低对特定阶数多项式趋势的敏感性,但去趋势阶数、窗口长度和序列类型仍然重要。DFA 也无法消除结构变化、波动变化或看过图之后才选择尺度区间带来的影响。

频域方法通过周期图估计低频行为。在某种平稳长记忆模型下,如果零频附近的谱功率满足 \(f(\lambda)\propto|\lambda|^{-\beta}\),那么对分数噪声型收益率过程有 \(H=(\beta+1)/2\)。低频带宽决定哪些观测值影响拟合斜率;季节性峰值、结构变化以及少量低频点都可能主导结果。谱参数与 \(H\) 的关系取决于输入是平稳增量序列还是积分后的水平值。

这些是有限样本表现各异的替代估计法,不能默认视为三项独立验证。Weron 的有限样本比较(DOI:10.1016/S0378-4371(02)00961-5)用模拟高斯白噪声比较 R/S、DFA 和周期图回归,并强调估计值与置信区间会随方法和样本长度而异。这并未证明 DFA 对金融数据总是最好,而是说明推断应针对实际程序和数据生成条件进行校准。

交易假设需要扣除成本后的样本外证据

估计指数可以描述历史标度模式,或帮助提出清晰的假设。但它不会给出进场和出场规则、预测时点、仓位规模、风险限额,也不会解释某个已观测关系为何在公开后仍会持续。如果研究者检验滚动 \(H\) 是否能预测收益率,必须在评估前固定预测期限和决策时点,并确保每项输入在当时都已经可用。

反复调整窗口长度、区块大小、资产、收益率变换、去趋势阶数和阈值,直到某一组合显示较高 \(H\),属于多重检验。看起来最好的结果是从同一批用于评估的数据中选出的。应将完整搜索过程纳入研究记录,使用未触碰的数据或正确的前向链式评估,并计入候选方案搜索的影响。[回测过拟合概率指南](/zh-CN/learn/probability-of-backtest-overfitting-cscv-explained)和 [White Reality Check 指南](/zh-CN/learn/white-reality-check-data-snooping-strategy-backtest-explained)介绍了相关的选择偏差问题。

统计关联不等于扣除成本后的交易优势。评估策略时要扣除买卖价差、佣金、滑点、市场冲击、资金或融资成本、借券成本和换手率。持续波动可能增加风险和回撤,却不改善收益方向的预测能力。报告估计的不确定性,与短记忆和结构变化等替代解释比较,在最终测试前锁定规则,并把历史诊断和策略表现区分开来。

只有当重采样设计与要研究的依赖结构相匹配时,它才有帮助。独立抽取单个收益率的 iid bootstrap 会破坏时间顺序。区块 bootstrap 保留每个选定区块内的局部连续性,但区块太短可能遗漏缓慢依赖,太长则留下更少有效的不同片段;两者都不会消除结构变化。如果尺度、窗口或资产是根据数据挑选的,要在每次重采样中重复选择步骤,才能估计考虑搜索过程后的不确定性。只重采样最终选中的指数,会低估搜索带来的不确定性。

常见问题

Q1赫斯特指数大于 0.5 表示什么?

在常见的平稳增量标度模型下,它可能与所分析尺度上序列的持续依赖性相符。它不代表价格上涨概率为 50% 或 70%,也不能证明存在盈利信号。

Q2R/S 分析和 Lo 的修正 R/S 检验是同一种方法吗?

不是。经典 R/S 用区块内普通波动除累计偏差极差。Lo 的修正统计量使用含有加权短滞后自协方差的长期方差估计,并在允许短期依赖的零假设下检验。

Q3可以用赫斯特指数来选择交易策略吗?

它可以启发研究假设,但指数本身不给出进场、出场或仓位规则。提出策略还需要预先固定的规格、不确定性与替代模型检查、样本外评估以及现实的执行成本。

资料来源与延伸阅读

报告问题

我们会准备一封包含本文链接的邮件。发送后,Mark 才会收到你的反馈

快速检查

读完指南后,用 3 道题检查一下

问题 1 / 3

问题 01

将 log R/S 对 log 区块长度回归时,斜率估计什么?

选择答案即可查看解释

期权术语表