Skip to content
所有期權指南
在高頻價格含有雜訊時估算積分方差14 分鐘閱讀

雙尺度已實現波幅:含微觀結構雜訊下的方差估計

了解 TSRV 如何結合密集與疏落價格網格,減少獨立微觀結構雜訊造成的偏差,並查看計算例子、假設和限制。

本指南內容為甚麼更多高頻觀測可能令方差估算變差

簡短摘要

雙尺度已實現波幅(TSRV)將每個觀測值產生的含雜訊估算,與多個較疏落採樣網格的平均值結合。在明確的加性獨立雜訊模型下,密集網格估算有助估計並扣除疏落網格的雜訊偏差。此方法估算積分方差;它不會把含雜訊觀測變成精確價格,也不會預測下一期回報。

為甚麼更多高頻觀測可能令方差估算變差

已實現方差通常透過加總回報平方計算。如果觀測到的對數價格完全跟隨有效價格,更多觀測便能更完整地捕捉價格路徑。但實際成交價和報價亦受買賣價反彈、價格離散、延遲及其他市場微觀結構效應影響。在極短間隔內,這些效應可能大於兩次觀測之間的有效價格變動。

因此,即使資產在整個交易時段的積分方差沒有改變,採樣愈頻密,樸素已實現方差也可能愈高。這不一定表示資產的經濟波幅上升;反覆把含雜訊價格差平方並加總亦會造成這種現象。已實現波幅計算指南介紹一般的回報平方和;本文聚焦修正一種特定的高頻偏差來源。

Zhang、Mykland 和 Aït-Sahalia 在最初的雙時間尺度研究提出 TSRV,以兩種採樣解像度完成不同任務。疏落網格減少受雜訊污染的增量數目;平均多個錯開的疏落網格,可避免依賴單一任意起點;完整密集網格則提供可按比例縮放後扣除的雜訊估算。這套邏輯取決於模型假設和有限樣本選擇,因此結果仍是帶有不確定性的估算,而非經「清理」的真實價格路徑。

將有效對數價格與觀測雜訊分開

令 \(X_t\) 表示潛在有效對數價格,並假設它在研究窗口內是局部方差速率為 \(\sigma_t^2\) 的連續過程。目標是其積分方差: \[ IV_T=\int_0^T\sigma_t^2\,dt. \]

在觀測時點 \(t_i\),記錄的對數價格為 \[ Y_{t_i}=X_{t_i}+\epsilon_{t_i}, \] 其中 \(\epsilon_{t_i}\) 是觀測雜訊。經典推導採用一個基準模型:雜訊均值為零、不同觀測時點之間互相獨立、與有效價格過程獨立,而且方差固定為 \(\omega^2\)。模型亦假設採樣網格規則,且窗口內的有效價格過程符合適當的連續過程設定。這些是模型條件,並非所有交易所數據都必然如此。

觀測增量為 \(\Delta Y_i=\Delta X_i+\epsilon_i-\epsilon_{i-1}\)。雜訊以相反符號進入相鄰回報:某次觀測的正價格誤差會提高一期回報、壓低下一期回報。這解釋了為甚麼由含雜訊價格計算的回報不等同互相獨立的測量誤差。二次變差指南說明在沒有雜訊時,平方增量總和為何以路徑變差為目標。

此處估算的是指定時間窗口內的方差,不是買賣差價估算、預測或實際成交成本。若要研究另一類成交價問題,可參閱Roll 買賣差價估算。明確界定目標很重要,因為多種市場微觀結構方法都使用高頻價格,卻估算不同數值。

為甚麼全 tick 已實現方差會被雜訊主導

對密集網格上的 \(n\) 個回報,定義 \[ RV_{\mathrm{all}}=\sum_{i=1}^{n}(Y_{t_i}-Y_{t_{i-1}})^2. \] 在基準模型下,單一觀測回報的雜訊部分為 \(\eta_i=\epsilon_i-\epsilon_{i-1}\),其方差為 \(\operatorname{Var}(\eta_i)=2\omega^2\)。在獨立性假設下,忽略期望值為零的交叉項,便有 \[ E[RV_{\mathrm{all}}]\approx IV_T+2n\omega^2. \]

第一項是目標積分方差,第二項則為每個密集回報累積一份雜訊貢獻。採樣間隔愈短、\(n\) 愈大,雜訊項便可能佔主導。因此,忽略測量雜訊時,「愈頻密採樣愈好」並非安全規則。Aït-Sahalia、Mykland 和 Zhang 在存在微觀結構雜訊時的採樣研究分析有限樣本下的最佳採樣頻率。

這是特定模型下的期望近似。具體樣本還包含有效價格增量與雜訊增量之間的隨機交叉項,所以實際值未必等於期望值。如果雜訊方差在日內改變、誤差有序列依賴,或採樣不規則,簡單的 \(2n\omega^2\) 未必能描述偏差。此時,熟悉的公式可能算出看似精確、實際卻修正錯誤部分的數值。

平均錯開的疏落網格,而非任意選取單一網格

選擇整數間距 \(K>1\)。對每個偏移 \(k=0,\ldots,K-1\),每隔 \(K\) 個觀測價格取一點,計算疏落網格已實現方差: \[ RV_{K,k}=\sum_j\left(Y_{t_{k+jK}}-Y_{t_{k+(j-1)K}}\right)^2. \] 每個疏落增量涵蓋較長間隔,但網格仍大致覆蓋同一觀測窗口。把可用偏移取平均: \[ \overline{RV}_K=\frac{1}{K}\sum_{k=0}^{K-1}RV_{K,k}. \]

偏移起點會影響結果。單一疏落網格可能剛好在大幅變動前或後開始,令結果受起點選擇影響。平均錯開的網格可以減少這種依賴,但不會產生 \(K\) 組互相獨立的數據:各網格重用相同觀測值,在統計上互相依賴。

如果觀測雜訊獨立且方差相同,疏落回報兩端的雜訊來自不同觀測,其差的方差仍為 \(2\omega^2\)。疏落回報數目少於密集回報,所以疏落網格平均值累積的雜訊偏差較小。由於疏落增量涵蓋整個窗口,而不是只涵蓋其中一部分,其訊號部分仍大致對應相同的積分方差。

本文插圖屬概念示意:比較鋸齒狀的觀測路徑,以及圍繞較平滑潛在路徑的多個錯開疏落視角。圖中沒有市場數據或實際估算結果。如要了解基於最高價和最低價,而非雙網格結構的估算,可參閱OHLC 區間波幅估算指南。

<!-- learn:illustration -->

鋸齒狀的觀測價格路徑,以及圍繞較平滑潛在路徑的多個錯開疏落採樣網格
密集觀測含有微觀結構雜訊、多個疏落網格互相重疊的概念示意圖。並非市場數據或估算結果。

扣除按比例縮放的密集方差,並作有限樣本標準化

令 \(\bar n\) 為各偏移網格內疏落回報數目的平均值,並設 \(\lambda=\bar n/n\)。在基準模型下,平均疏落網格的雜訊偏差約為 \(2\bar n\omega^2\)。密集網格估算的雜訊偏差約為 \(2n\omega^2\),所以 \(\lambda RV_{\mathrm{all}}\) 約提供 \(2\bar n\omega^2\)。兩者相減會抵銷主要雜訊項: \[ TSRV_{\mathrm{raw}}=\overline{RV}_K-\lambda RV_{\mathrm{all}}. \]

這個原始差值亦會扣掉比例為 \(\lambda\) 的積分方差信號,因為兩個已實現方差項都包含信號。因此,常見的有限樣本標準化為 \[ \widehat{IV}_{TSRV}=\frac{\overline{RV}_K-\lambda RV_{\mathrm{all}}}{1-\lambda}. \] 在簡單的期望計算中,分母會還原訊號係數。不同實作可能採用不同端點處理和慣例,因此應記錄 \(n\) 的確切定義、偏移集合及 \(\bar n\) 的計算方法。這項修正不會消除採樣不確定性,也不能修補錯誤的雜訊模型。經典漸近設定下,樣本增加時 \(\lambda\) 會變小;但在短窗口中,有限樣本因子仍可能重要。

如果 \(\overline{RV}_K<\lambda RV_{\mathrm{all}}\),估算值可能為負。這不代表物理變差為負,而是有限樣本中的雜訊扣除量超過疏落網格估算。把它改成零或許方便顯示,但會改變估算量並加入截尾規則。分析時應保留及報告原始估算、檢查所選尺度和假設,並明確披露任何後續截尾。

用六個假設回報逐步計算

假設七個虛構的對數價格觀測產生六個密集網格回報,單位為基點:\([1,1,-1,-1,1,1]\) bp。這個刻意設計的小序列只用來示範計算,並非交易所數據。密集網格已實現方差為 \[ RV_{\mathrm{all}}=1^2+1^2+(-1)^2+(-1)^2+1^2+1^2=6\,\mathrm{bp}^2. \]

設 \(K=2\)。第一個偏移把相鄰密集回報組成 \([2,-2,2]\) bp 的疏落回報,平方和為 \(4+4+4=12\,\mathrm{bp}^2\)。錯開的第二個偏移得到 \([0,0]\) bp,平方和為 0。兩個網格估算的平均值為 \(\overline{RV}_K=(12+0)/2=6\,\mathrm{bp}^2\)。

六個密集回報配合兩個偏移,平均疏落回報數為 \(\bar n=(3+2)/2=2.5\)。因此 \(\lambda=2.5/6=5/12\),而 \[ \widehat{IV}_{TSRV}=\frac{6-(5/12)6}{1-5/12}=\frac{3.5}{7/12}=6\,\mathrm{bp}^2. \]

方差估算為 \(6\,\mathrm{bp}^2=6\times10^{-8}\),單位是十進制回報的平方。平方根約為這個假設窗口內的 \(2.45\) bp;此數值沒有年化。這個小型構造序列恰巧與密集網格 RV 相等,並非 TSRV 的恆等式。其他價格路徑可能產生更高、更低甚至負數的估算。

這個計算亦顯示模型的限制:由於潛在路徑和雜訊沒有分開觀測,單憑此樣本無法證明 \(6\,\mathrm{bp}^2\) 等於實際積分方差。可以核對總和、尺度和單位,但不能從例子還原隱藏的分解。實證文獻亦討論 realized-kernel 等其他高頻雜訊修正方法;它們同樣有各自的假設和實作選擇。

兩個尺度估算甚麼,以及如何選擇 K

\(K\) 在疏落回報數目、平均處理和雜訊修正之間取捨。\(K\) 太小會保留很多短增量,可能仍對雜訊敏感。\(K\) 太大則只剩少量粗粒度回報,令疏落估算不穩定,也更受有限窗口影響。平均偏移有助網格對齊,但無法補足短樣本或低質素樣本欠缺的資訊。

在最初的漸近分析中,最佳疏落間距會隨樣本量增加;按該文的記號和基準條件,其階數為 \(n^{2/3}\)。這是理論尺度結果,不是要求採用某個秒數或觀測數目的通用指示。最佳值取決於雜訊與訊號比例及模型假設;後續研究和實務實作亦可能採用不同調校規則及端點慣例。為方便重現,應報告採樣間隔、\(K\)、偏移集合、交易時段邊界及有限樣本標準化方法。

可靠分析可比較一組預先訂定的合理 \(K\) 值並展示敏感度,而不是事後挑選最吸引的結果。如果估算有明顯變化,這種不穩定性本身就是結果的一部分。應按數據設計和有記錄的規則選擇尺度,而不是看過波幅估算後再調整。可以加入較疏落已實現方差或抗雜訊替代方法作比較,但要清楚區分各項指標。

經典 TSRV 假設不成立時

經典修正是針對特定雜訊結構推導。買賣價反彈等微觀結構效應可能有序列依賴、在交易時段內改變、受流動性影響,或與有效價格增量相關。Hansen 和 Lunde 在已實現方差研究指出,已實現方差與微觀結構雜訊的相互作用可包含時間依賴,以及雜訊與有效價格變化的相關。Aït-Sahalia、Mykland 和 Zhang 之後發展出適用於依賴微觀結構雜訊的雙尺度方法。這項延伸提醒我們須把修改後的估算量與原始獨立雜訊公式分開,而非假設原公式能處理所有依賴模式。

其他實際問題包括不規則觀測時間、多項資產不同步、過時報價、價格離散、跳躍、錯誤成交、開市與收市效應,以及缺失觀測。它們會影響密集網格修正項,也會影響哪些回報進入疏落網格。跳躍是否屬於目標二次變差、還是需要分開處理,取決於研究問題;TSRV 不會自行決定這項建模選擇。篩選觀測值亦會改變網格,應予以記錄。

抗雜訊不等於對所有數據問題免疫。把估算解讀為潛在方差前,應說明輸入是成交價、報價還是中間價,列出回報轉換和時間尺度,檢查觀測是否等距,記錄清理及交易時段規則,並評估對 \(K\) 的敏感度。如果雜訊過程違反基準假設,便應使用為該情況設計的方法並說明其假設。不要把負估算稱為負波幅,也不要悄悄把它改成正數。

報告估算量,不要把它當作預測

透明報告會列明目標窗口、輸入價格序列、採樣間隔、密集回報數、疏落間距 \(K\)、偏移集合、端點規則、雜訊假設、標準化、單位和任何截尾。可以同時呈現原始差值、標準化估算,以及預先設定尺度下的敏感度範圍。這些細節令計算可審核,亦可避免把方差估算誤當報價、未來預測或盈利交易規則的證據。

積分方差是按已觀測窗口計算。年化時須說明時間慣例,避免掩蓋日內模式、隔夜區間或交易中斷。開平方會把單位轉為該窗口的波幅,卻不會自動產生預測期限。歷史已實現指標可以是模型輸入,但預測表現須用未曾用來選擇估算設定的數據另行評估。

TSRV 的主要貢獻在方法層面:在明確的加性雜訊模型下,兩種採樣尺度可減少令樸素高頻已實現方差無法一致估算目標的主要雜訊偏差。它不會識別每次價格變動的來源、不會消除模型風險,也不會告訴你下一期波幅。報告數值時應同時說明這些界線。

常見問題

Q1TSRV 是否使用每個觀測值?

密集網格已實現方差會使用所有觀測值,而不同錯開疏落網格亦會重用這些觀測。每個疏落網格單獨採樣的頻率較低。此方法結合這些部分,不會丟棄密集觀測,也不會令各網格成為獨立樣本。

Q2雙尺度已實現波幅是波幅預測嗎?

不是。標準目標是已觀測窗口內的積分方差。開平方會以該窗口的波幅單位表達數值;預測後續期間則需要另一個模型和樣本外評估。

Q3負的 TSRV 估算應否改為零?

除非清楚說明修改,否則不應。按比例縮放的密集網格修正超過疏落估算時,有限樣本值可能為負。截為零會改變估算量,亦可能影響平均值和推論;應報告原值及任何後續處理規則。

Q4原始 TSRV 公式能處理所有微觀結構雜訊嗎?

不能。經典推導採用包括觀測誤差獨立在內的基準雜訊模型。隨時間改變或有序列依賴的雜訊、不規則採樣,以及雜訊與有效價格變動之間的依賴,可能需要不同或經修改的估算量。

資料來源與延伸閱讀

回報問題

我們會準備一封包含本文連結的電郵。寄出後,Mark 才會收到你的回報

快速檢查

讀完指南後,用 3 道題檢查一下

問題 1 / 3

問題 01

為甚麼採樣間隔極短時,樸素已實現方差可能上升?

選擇答案即可查看解釋

期權術語表