Skip to content
所有期權指南
概括依賴性在不同時間尺度上如何擴展的統計量閱讀約 16 分鐘

赫斯特指數與 R/S 分析:長記憶的估算、計算與交易限制

了解重標極差分析如何估算赫斯特指數,透過假設數據逐步計算,並理解持續性為何不等於有利可圖的交易訊號。

本指南內容赫斯特指數描述尺度關係,不預測下一次價格變動

簡短摘要

赫斯特指數概括觀察窗口變長時,重標極差等統計量的增長速度。在指定的尺度模型之下,大於 0.5 的數值與增量持續性相符,小於 0.5 的數值則與反持續性相符。單憑估算值,不能證明價格可預測、策略會獲利,也不能證明量度到的模式確實來自長記憶。

赫斯特指數描述尺度關係,不預測下一次價格變動

赫斯特指數記作 \(H\),是時間尺度與該尺度下量度到的波幅之間關係的斜率。在重標極差分析中,累積偏差的極差會除以序列的標準差。如果平均比率隨區塊長度 \(n\) 增加而大致按 \(n^H\) 增長,對數—對數關係的斜率就是 \(H\) 的估算值。這個係數源自 H. E. Hurst 對水庫儲水容量的研究:水庫需要多大的容量才可應付變化不定的河流流量。它並非為買賣訊號而設。Hurst 的原著《水庫的長期儲水能力》介紹如何利用年度流量相對平均值的累積偏差計算極差。

「持續」、「反持續」和「類似隨機」等解讀,取決於研究的過程和採用的尺度假設。在常見的平穩增量基準之下,\(H=0.5\) 對應平方根時間尺度;\(H>0.5\) 與正向持續性有關,\(H<0.5\) 則與反持續性有關。這些用語描述在所分析尺度下量度到的序列依賴性,並非下一期回報取某個方向的機率。

輸入序列不同,研究問題也不同。把同一方法用於原始回報、絕對回報、平方回報、價格水平或累積回報,所得結果不能互換。方向依賴性不明顯的回報序列,其絕對回報仍可能呈現持續的波幅聚集。帶有趨勢或積分特徵的價格水平,也可能因為不同於平穩回報長記憶的原因而呈現尺度關係。報告 \(H\) 時,請列明變數、抽樣間隔和所用的尺度範圍。

重標極差分析把每個區塊轉成尺度統計量

取一個包含 \(n\) 個觀察值 \(x_1,\ldots,x_n\) 的區塊。先計算區塊平均值 \(\bar{x}_n\),再從每個觀察值減去平均值,並把中心化後的數值逐步累加:

\[ Y_{k,n}=\sum_{t=1}^{k}(x_t-\bar{x}_n), \qquad k=1,\ldots,n. \]

即使中心化觀察值在區塊末端的總和為零,累積路徑仍會在中途上下起伏。極差等於累積值的最高點減去最低點:

\[ R_n=\max_{1\leq k\leq n}Y_{k,n}-\min_{1\leq k\leq n}Y_{k,n}. \]

按清楚列明的慣例計算區塊標準差。此處使用 \(n\) 作為分母:

\[ S_n=\sqrt{\frac{1}{n}\sum_{t=1}^{n}(x_t-\bar{x}_n)^2}, \qquad Q_n=\frac{R_n}{S_n}. \]

比率 \(Q_n\) 以區塊內一般波幅作單位,表示累積極差。若區塊是常數,\(S_n=0\),所以比率沒有定義,不能默默當成零貢獻。實際分析時,把紀錄按指定長度分成區塊,計算每個有效區塊的比率並取平均,再對預先設定的一系列區塊長度重複計算。Mandelbrot 和 Wallis 在1969年的論文中,研究了多種模擬分佈和依賴模式下 R/S 的表現。他們的分析令 R/S 成為常用的尺度診斷工具,但不代表它能免疫所有模型設定錯誤。

如果所選尺度上的區塊平均統計量大致符合 \(\overline{Q}_n\approx Cn^H\),取對數後可得:

\[ \log \overline{Q}_n=\log C+H\log n+\varepsilon_n. \]

把 \(\log \overline{Q}_n\) 對 \(\log n\) 擬合後,所得斜率就是指數的估算值。窄小範圍或看過結果後才選出的區間即使看起來像直線,本身仍只是較弱的證據。很多有限樣本在少數尺度上也可能呈線性,同一紀錄的不同部分亦可能有不同斜率。

三個窗口長度分別展示中心化觀測值與累積偏差路徑;每條路徑最高點與最低點之間的範圍,與觀測值的離散程度並列呈現
在多個尺度重複進行R/S分析的概念圖:每個窗口扣除平均值、累積偏差,再將累積範圍與窗口內的離散程度比較。僅作示意,不代表市場數據、估算的H值、預測或交易訊號

小型假設樣本展示每一步計算

考慮八個假設回報,單位為任意基點:\(3,1,0,-1,2,0,-2,-3\)。全樣本平均值為零。對每個區塊長度,把序列分成相鄰且互不重疊的區塊,計算每個區塊的 \(R_n/S_n\),再取比率平均值。例子採用分母為 \(n\) 的母體形式標準差;使用其他慣例會令數字略有不同。

在 \(n=2\) 時,每一對的極差與標準差比率都是 1,因此平均值也是 1。在 \(n=4\) 時,兩個區塊的 \((R,S)\) 約為 \((2.500,1.479)\) 和 \((3.500,1.920)\)。比率約為 1.690 和 1.823,平均值約為 1.756。在 \(n=8\) 時,中心化累積路徑為 \(3,4,4,3,5,5,3,0\),所以極差為 5。標準差為 \(\sqrt{3.5}\approx1.871\),比率約為 2.673。

區塊長度 \(n\)平均 \(R/S\)
21.000
41.756
82.673

這三個對數尺度點之間的距離相同,因此普通最小二乘斜率等於兩端點的斜率:

\[ \widehat{H}=\frac{\log(2.673)-\log(1.000)}{\log(8)-\log(2)}\approx0.709. \]

這是以八個虛構數值作出的可重複計算,並非長記憶的可靠證據。估算值對個別觀察值非常敏感,只有三個尺度,也沒有不確定性區間。如果序列含有結構轉變,或是在看過結果後才選擇尺度,增加觀察值不會自動解決問題。

<!-- 插圖位置:本節之後;以無文字概念圖展示中心化觀察值在短區塊和長區塊尺度下累積成極差,以及極差增長速度超過區塊內標準差的情況。不要加入座標軸、標籤或數值主張。 -->

接近 0.5 的數值要連同模型和不確定性理解

對有限變異數和短程依賴的平穩序列,許多常見的長期尺度結果都會得出接近 0.5 的指數。在分數高斯雜訊一類的模型之下,\(H>0.5\) 與正向長程依賴相符:相對於基準,同方向偏差較常接續出現,而相關性會緩慢衰減。低於 0.5 的指數則與反持續性有關,此時反轉或相反符號的依賴主導尺度行為。

「在模型之下」這個限定很重要。一般 R/S 斜率是估算值,不是直接檢驗某一個明確的經濟機制。小樣本偏差可令估算值偏離 0.5;重疊區塊、分母慣例、尺度端點和自相關也會影響結果。信賴區間包括 0.5,不代表已證明獨立;不包括 0.5,也不代表觀察值一定來自穩定的長記憶模型。

不要把 \(H=0.7\) 解讀為「趨勢延續機率是 70%」、「回報會持續 70 日」或「成功率為 70%」。\(H\) 不是機率或持倉期限,而是描述估算出的尺度關係。要提供依賴性的統計證據,仍需建立模型、評估不確定性,並檢查短期相關、條件異方差、確定性趨勢或狀態轉換等替代解釋。

短期自相關和波幅聚集可能看似持續性

傳統 R/S 不只對真正的長程依賴有反應。短暫的 AR 模式可能令同符號偏差聚在一起,從而擴大累積極差。Lo 指出,短程序列相關可令傳統統計量向上偏,令短記憶過程看起來具持續性。他的修正 R/S 方法旨在考慮短程依賴後檢驗長記憶。在他分析的股票回報指數中,納入短期自相關後,長記憶證據消失;這是他所用樣本和檢驗的結果,不是對所有資產或之後時期的判斷。請參閱 Lo 的1991年論文。

波幅聚集會造成另一種陷阱。回報正負號可以交替,但回報幅度仍會成群出現。對回報使用 R/S,研究的是有正負號的累積偏差;對絕對回報或平方回報使用,研究的則是幅度持續性。若 \(|r_t|\) 的估算值偏高,可能表示風險聚集,而不是價格方向可預測。如要另行診斷條件變異數依賴,可參考 [ARCH LM 檢定指南](/zh-HK/learn/arch-lm-test-volatility-clustering-finance-explained);[變異數比率指南](/zh-HK/learn/variance-ratio-test-random-walk-horizon-scaling-explained)則介紹另一種概括不同持有期回報依賴性的方法。

厚尾和離群值也很重要。Mandelbrot 和 Wallis 在多種非高斯模擬中發現有用的穩健性特徵,但不代表單一極端變動、波幅狀態轉換或平均值設定錯誤都無關緊要。嚴謹分析會報告所選原始序列的結果,並檢視合理替代設定下結果如何改變,而不是一直刪除不方便的觀察值,直到指數看起來熟悉為止。

趨勢、結構轉變和尺度選擇可能製造假長記憶

從每個區塊減去區塊平均值,可以移除固定水平,但不會移除所有確定性或變化模式。緩慢趨勢、一次性的水平跳變、樣本組成改變或波幅轉變都可形成較長的累積偏移。擬合後的對數關係可能看似冪律,即使序列並沒有穩定的長記憶機制。結構轉變檢定或分段迴歸回答的是另一個問題;請參閱[中斷時間序列迴歸指南](/zh-HK/learn/interrupted-time-series-segmented-regression-finance-explained)。

尺度選擇本身就是模型的一部分。很短的區塊主要反映局部雜訊和市場微觀結構;很長的區塊則只剩少量可用片段。重疊窗口可增加計算所得比率的數目,卻不會同時增加同等數量的獨立資訊。短尺度一個斜率、長尺度另一個斜率的交叉現象,可能表示動態不同、結構轉變、季節性,亦可能只是估算雜訊。沒有解釋就把它們合併成一個 \(H\) 並不恰當。

請明確說明輸入是價格、對數價格、回報、絕對回報還是過濾後殘差,以及區塊是否重疊。解讀結果前先選定區塊範圍和最少區塊數,報告每個尺度所用的觀察值數目,並展示合理端點下的敏感度。如果價格是積分序列,針對平穩回報的常見解讀不能原封不動套用。去趨勢不是萬用修正:它會改變量度對象,也可能連同無關趨勢一起移除具經濟意義的變化。

Lo 的修正 R/S 在分母使用長期變異數估算值

Lo 的修正保留中心化累積偏差的極差,但把普通區塊標準差改為包含短滯後自協方差的長期變異數估算值。常見寫法如下:

\[ Q_n^{\mathrm{Lo}}(q)=\frac{R_n}{\widehat{\sigma}_n(q)},\qquad \widehat{\sigma}_n^2(q)=\widehat{\gamma}_0+ 2\sum_{j=1}^{q}\left(1-\frac{j}{q+1}\right)\widehat{\gamma}_j. \]

此處 \(\widehat{\gamma}_j\) 是滯後 \(j\) 的樣本自協方差,\(q\) 是截斷帶寬。三角權重會降低接近截斷位置的自協方差權重。修正後的統計量要和相應的虛無分佈比較;它不只是分母看起來較好的傳統 R/S 估算值,其數值也不會自動成為調整後的 \(H\)。

帶寬決定哪些短期相關會納入變異數估算。\(q\) 太小,可能未處理重要短程依賴;\(q\) 太大,估算會更嘈雜,也可能吸收原本要區分的模式。請報告帶寬規則、抽樣頻率、檢定統計量、虛無假設和 p 值,並考慮預先設定的敏感度範圍。Lo 的論文說明這個差異為何重要:傳統 R/S 可能對短記憶有反應,而修正檢定針對的是容許弱短期依賴的較廣泛虛無假設。

DFA 和頻域估算使用不同資料轉換

去趨勢波動分析(DFA)先以去平均值後的觀察值建立積分輪廓,把輪廓分成多個窗口,在每個窗口內擬合局部多項式,再計算殘差波動的均方根 \(F(s)\),其中 \(s\) 是窗口長度。把 \(\log F(s)\) 對 \(\log s\) 迴歸,可估算尺度斜率。局部擬合可降低對指定多項式趨勢的敏感度,但去趨勢階數、窗口長度和序列類型仍然重要。DFA 也不能避開結構轉變、波幅變化,或看過圖後才選擇尺度區間所帶來的影響。

頻域方法由週期圖估算低頻行為。在某種平穩長記憶模型下,如果零頻附近的頻譜功率符合 \(f(\lambda)\propto|\lambda|^{-\beta}\),則分數雜訊型回報過程的 \(H=(\beta+1)/2\)。低頻帶寬決定哪些觀察值會影響擬合斜率;季節性高峰、結構轉變和少數低頻點都可能主導結果。頻譜參數與 \(H\) 的關係,取決於輸入是平穩增量序列還是積分後的水平值。

這些是有限樣本表現各異的替代估算方法,不能預設為三項互相獨立的確認。Weron 的有限樣本比較(DOI:10.1016/S0378-4371(02)00961-5)以模擬高斯白噪音比較 R/S、DFA 和週期圖迴歸,並指出估算值和信賴區間會隨方法及樣本長度而異。結果並非證明 DFA 對金融數據永遠最好,而是說明推斷要按實際程序和數據生成條件校準。

交易假設需要扣除成本後的樣本外證據

估算出的指數可以描述歷史尺度模式,或幫助提出清楚的假設,但它不會給出入市和離市規則、預測時點、持倉規模、風險限額,也不會說明某個已知關係為何會持續。如果研究人員測試滾動 \(H\) 是否可預測回報,必須在評估前固定預測期限和決策時間,並確認每項輸入在當時已經可得。

反覆測試窗口長度、區塊大小、資產、回報轉換、去趨勢階數和門檻,直到找到較高的 \(H\),就是多重檢定。看似最佳的結果,是從同一批用來評估的數據中挑選出來。應把整個搜尋過程記錄在研究紀錄內,採用未使用數據或正確的前向鏈式評估,並計及候選方案搜尋的影響。[回測過度擬合機率指南](/zh-HK/learn/probability-of-backtest-overfitting-cscv-explained)和 [White’s Reality Check 指南](/zh-HK/learn/white-reality-check-data-snooping-strategy-backtest-explained)討論相關的選擇問題。

統計關聯不等於扣除成本後的交易優勢。策略評估須扣除買賣差價、佣金、滑點、市場衝擊、資金或融資成本、借貨成本和換手率。持續波幅可能增加風險和回撤,卻不會改善回報方向的可預測性。報告估算的不確定性,與短記憶和結構轉變等替代解釋比較,在最終測試前鎖定規則,並把歷史診斷與策略表現分開。

只有當重抽樣設計符合所研究的依賴結構時,它才有幫助。把每個回報獨立抽取的 iid bootstrap 會破壞時間次序。區塊 bootstrap 保留每個選定區塊內的局部連續性,但區塊太短可能漏掉緩慢依賴,區塊太長則留下較少有效的不同片段;兩者都不能消除結構轉變。如果尺度、窗口或資產是從數據中挑選的,要在每次重抽樣中重複整個選擇步驟,才可估算已計及搜尋過程的不確定性。只重抽樣最後選出的指數,會低估搜尋帶來的不確定性。

常見問題

Q1赫斯特指數高於 0.5 是甚麼意思?

在常見的平穩增量尺度模型下,它可能與所分析尺度上的持續依賴性相符。它不代表價格上升機率是 50% 或 70%,亦不是有利可圖訊號的證明。

Q2R/S 分析和 Lo 的修正 R/S 檢定是否相同?

不同。傳統 R/S 以區塊內一般波動除累積偏差極差。Lo 的修正統計量使用包含加權短滯後自協方差的長期變異數估算值,並在容許短期依賴的虛無假設下進行檢定。

Q3可以用赫斯特指數選擇交易策略嗎?

它可以啟發研究假設,但單憑估算值不能決定入市、離市或持倉規則。任何策略都需要事先固定規格、檢查不確定性和替代模型、進行樣本外評估,並計入實際執行成本。

資料來源與延伸閱讀

回報問題

我們會準備一封包含本文連結的電郵。寄出後,Mark 才會收到你的回報

快速檢查

讀完指南後,用 3 道題檢查一下

問題 1 / 3

問題 01

把 log R/S 對 log 區塊長度擬合時,斜率估算甚麼?

選擇答案即可查看解釋

期權術語表