雙尺度已實現波動率:含微觀結構雜訊下的變異數估計
了解 TSRV 如何結合密集與稀疏價格網格,減少獨立微觀結構雜訊造成的偏差,並查看計算例子、假設和限制。
本指南內容為什麼更多高頻觀測可能令變異數估計變差
簡短摘要
雙尺度已實現波動率(TSRV)將每個觀測值產生的含雜訊估計,與多個較稀疏取樣網格的平均值結合。在明確的加性獨立雜訊模型下,密集網格估計有助估計並扣除稀疏網格的雜訊偏差。此方法估計積分變異數;它不會把含雜訊觀測變成精確價格,也不會預測下一期報酬。
為什麼更多高頻觀測可能令變異數估計變差
已實現變異數通常透過加總報酬平方計算。如果觀測到的對數價格完全跟隨有效價格,更多觀測便能更完整地捕捉價格路徑。但實際成交價和報價亦受買賣價反彈、價格離散、延遲及其他市場微觀結構效應影響。在極短間隔內,這些效應可能大於兩次觀測之間的有效價格變動。
因此,即使資產在整個交易時段的積分變異數沒有改變,取樣越頻繁,樸素已實現變異數也可能愈高。這不一定表示資產的經濟波動率上升;反覆把含雜訊價格差平方並加總亦會造成這種現象。已實現波動率計算指南介紹一般的報酬平方和;本文聚焦修正一種特定的高頻偏差來源。
Zhang、Mykland 和 Aït-Sahalia 在最初的雙時間尺度研究提出 TSRV,以兩種取樣解像度完成不同任務。稀疏網格減少受雜訊污染的增量數目;平均多個錯開的稀疏網格,可避免依賴單一任意起點;完整密集網格則提供可按比例縮放後扣除的雜訊估計。這套邏輯取決於模型假設和有限樣本選擇,因此結果仍是帶有不確定性的估計,而非經「清理」的真實價格路徑。
將有效對數價格與觀測雜訊分開
令 \(X_t\) 表示潛在有效對數價格,並假設它在研究區間內是局部變異數速率為 \(\sigma_t^2\) 的連續過程。目標是其積分變異數: \[ IV_T=\int_0^T\sigma_t^2\,dt. \]
在觀測時點 \(t_i\),記錄的對數價格為 \[ Y_{t_i}=X_{t_i}+\epsilon_{t_i}, \] 其中 \(\epsilon_{t_i}\) 是觀測雜訊。經典推導採用一個基準模型:雜訊均值為零、不同觀測時點之間互相獨立、與有效價格過程獨立,而且變異數固定為 \(\omega^2\)。模型亦假設取樣網格規則,且區間內的有效價格過程符合適當的連續過程設定。這些是模型條件,並非所有交易所資料都必然如此。
觀測增量為 \(\Delta Y_i=\Delta X_i+\epsilon_i-\epsilon_{i-1}\)。雜訊以相反符號進入相鄰報酬:某次觀測的正價格誤差會提高一期報酬、壓低下一期報酬。這解釋了為什麼由含雜訊價格計算的報酬不等同互相獨立的測量誤差。二次變差指南說明在沒有雜訊時,平方增量總和為何以路徑變差為目標。
此處估計的是指定時間區間內的變異數,不是買賣差價估計、預測或實際成交成本。若要研究另一類成交價問題,可參閱Roll 買賣差價估計。明確界定目標很重要,因為多種市場微觀結構方法都使用高頻價格,卻估計不同數值。
為什麼全 tick 已實現變異數會被雜訊主導
對密集網格上的 \(n\) 個報酬,定義 \[ RV_{\mathrm{all}}=\sum_{i=1}^{n}(Y_{t_i}-Y_{t_{i-1}})^2. \] 在基準模型下,單一觀測報酬的雜訊部分為 \(\eta_i=\epsilon_i-\epsilon_{i-1}\),其變異數為 \(\operatorname{Var}(\eta_i)=2\omega^2\)。在獨立性假設下,忽略期望值為零的交叉項,便有 \[ E[RV_{\mathrm{all}}]\approx IV_T+2n\omega^2. \]
第一項是目標積分變異數,第二項則為每個密集報酬累積一份雜訊貢獻。取樣間隔愈短、\(n\) 愈大,雜訊項便可能佔主導。因此,忽略測量雜訊時,「越頻繁取樣愈好」並非安全規則。Aït-Sahalia、Mykland 和 Zhang 在存在微觀結構雜訊時的取樣研究分析有限樣本下的最佳取樣頻率。
這是特定模型下的期望近似。具體樣本還包含有效價格增量與雜訊增量之間的隨機交叉項,所以實際值未必等於期望值。如果雜訊變異數在日內改變、誤差有序列依賴,或取樣不規則,簡單的 \(2n\omega^2\) 未必能描述偏差。此時,熟悉的公式可能算出看似精確、實際卻修正錯誤部分的數值。
平均錯開的稀疏網格,而非任意選取單一網格
選擇整數間距 \(K>1\)。對每個偏移 \(k=0,\ldots,K-1\),每隔 \(K\) 個觀測價格取一點,計算稀疏網格已實現變異數: \[ RV_{K,k}=\sum_j\left(Y_{t_{k+jK}}-Y_{t_{k+(j-1)K}}\right)^2. \] 每個稀疏增量涵蓋較長間隔,但網格仍大致覆蓋同一觀測區間。把可用偏移取平均: \[ \overline{RV}_K=\frac{1}{K}\sum_{k=0}^{K-1}RV_{K,k}. \]
偏移起點會影響結果。單一稀疏網格可能剛好在大幅變動前或後開始,令結果受起點選擇影響。平均錯開的網格可以減少這種依賴,但不會產生 \(K\) 組互相獨立的資料:各網格重用相同觀測值,在統計上互相依賴。
如果觀測雜訊獨立且變異數相同,稀疏報酬兩端的雜訊來自不同觀測,其差的變異數仍為 \(2\omega^2\)。稀疏報酬數目少於密集報酬,所以稀疏網格平均值累積的雜訊偏差較小。由於稀疏增量涵蓋整個區間,而不是只涵蓋其中一部分,其訊號部分仍大致對應相同的積分變異數。
本文插圖屬概念示意:比較鋸齒狀的觀測路徑,以及圍繞較平滑潛在路徑的多個錯開稀疏視角。圖中沒有市場資料或實際估計結果。如要了解基於最高價和最低價,而非雙網格結構的估計,可參閱OHLC 區間波動率估計指南。
<!-- learn:illustration -->

扣除按比例縮放的密集變異數,並作有限樣本標準化
令 \(\bar n\) 為各偏移網格內稀疏報酬數目的平均值,並設 \(\lambda=\bar n/n\)。在基準模型下,平均稀疏網格的雜訊偏差約為 \(2\bar n\omega^2\)。密集網格估計的雜訊偏差約為 \(2n\omega^2\),所以 \(\lambda RV_{\mathrm{all}}\) 約提供 \(2\bar n\omega^2\)。兩者相減會抵銷主要雜訊項: \[ TSRV_{\mathrm{raw}}=\overline{RV}_K-\lambda RV_{\mathrm{all}}. \]
這個原始差值亦會扣掉比例為 \(\lambda\) 的積分變異數信號,因為兩個已實現變異數項都包含信號。因此,常見的有限樣本標準化為 \[ \widehat{IV}_{TSRV}=\frac{\overline{RV}_K-\lambda RV_{\mathrm{all}}}{1-\lambda}. \] 在簡單的期望計算中,分母會還原訊號係數。不同實作可能採用不同端點處理和慣例,因此應記錄 \(n\) 的確切定義、偏移集合及 \(\bar n\) 的計算方法。這項修正不會消除取樣不確定性,也不能修補錯誤的雜訊模型。經典漸近設定下,樣本增加時 \(\lambda\) 會變小;但在短區間中,有限樣本因子仍可能重要。
如果 \(\overline{RV}_K<\lambda RV_{\mathrm{all}}\),估計值可能為負。這不代表物理變差為負,而是有限樣本中的雜訊扣除量超過稀疏網格估計。把它改成零或許方便顯示,但會改變估計量並加入截尾規則。分析時應保留及報告原始估計、檢查所選尺度和假設,並明確披露任何後續截尾。
用六個假設報酬逐步計算
假設七個虛構的對數價格觀測產生六個密集網格報酬,單位為基點:\([1,1,-1,-1,1,1]\) bp。這個刻意設計的小序列只用來示範計算,並非交易所資料。密集網格已實現變異數為 \[ RV_{\mathrm{all}}=1^2+1^2+(-1)^2+(-1)^2+1^2+1^2=6\,\mathrm{bp}^2. \]
設 \(K=2\)。第一個偏移把相鄰密集報酬組成 \([2,-2,2]\) bp 的稀疏報酬,平方和為 \(4+4+4=12\,\mathrm{bp}^2\)。錯開的第二個偏移得到 \([0,0]\) bp,平方和為 0。兩個網格估計的平均值為 \(\overline{RV}_K=(12+0)/2=6\,\mathrm{bp}^2\)。
六個密集報酬配合兩個偏移,平均稀疏報酬數為 \(\bar n=(3+2)/2=2.5\)。因此 \(\lambda=2.5/6=5/12\),而 \[ \widehat{IV}_{TSRV}=\frac{6-(5/12)6}{1-5/12}=\frac{3.5}{7/12}=6\,\mathrm{bp}^2. \]
變異數估計為 \(6\,\mathrm{bp}^2=6\times10^{-8}\),單位是十進制報酬的平方。平方根約為這個假設區間內的 \(2.45\) bp;此數值沒有年化。這個小型構造序列恰巧與密集網格 RV 相等,並非 TSRV 的恆等式。其他價格路徑可能產生更高、更低甚至負數的估計。
這個計算亦顯示模型的限制:由於潛在路徑和雜訊沒有分開觀測,單憑此樣本無法證明 \(6\,\mathrm{bp}^2\) 等於實際積分變異數。可以核對總和、尺度和單位,但不能從例子還原隱藏的分解。實證文獻亦討論 realized-kernel 等其他高頻雜訊修正方法;它們同樣有各自的假設和實作選擇。
兩個尺度估計什麼,以及如何選擇 K
\(K\) 在稀疏報酬數目、平均處理和雜訊修正之間取捨。\(K\) 太小會保留很多短增量,可能仍對雜訊敏感。\(K\) 太大則只剩少量粗粒度報酬,令稀疏估計不穩定,也更受有限區間影響。平均偏移有助網格對齊,但無法補足短樣本或低質素樣本欠缺的資訊。
在最初的漸近分析中,最佳稀疏間距會隨樣本量增加;按該文的記號和基準條件,其階數為 \(n^{2/3}\)。這是理論尺度結果,不是要求採用某個秒數或觀測數目的通用指示。最佳值取決於雜訊與訊號比例及模型假設;後續研究和實務實作亦可能採用不同調校規則及端點規則。為方便重現,應報告取樣間隔、\(K\)、偏移集合、交易時段邊界及有限樣本標準化方法。
可靠分析可比較一組預先訂定的合理 \(K\) 值並展示敏感度,而不是事後挑選最吸引的結果。如果估計有明顯變化,這種不穩定性本身就是結果的一部分。應按資料設計和有記錄的規則選擇尺度,而不是看過波動率估計後再調整。可以加入較稀疏已實現變異數或抗雜訊替代方法作比較,但要清楚區分各項指標。
經典 TSRV 假設不成立時
經典修正是針對特定雜訊結構推導。買賣價反彈等微觀結構效應可能有序列依賴、在交易時段內改變、受流動性影響,或與有效價格增量相關。Hansen 和 Lunde 在已實現變異數研究指出,已實現變異數與微觀結構雜訊的相互作用可包含時間依賴,以及雜訊與有效價格變化的相關。Aït-Sahalia、Mykland 和 Zhang 之後發展出適用於依賴微觀結構雜訊的雙尺度方法。這項延伸提醒我們須把修改後的估計量與原始獨立雜訊公式分開,而非假設原公式能處理所有依賴模式。
其他實際問題包括不規則觀測時間、多項資產不同步、過時報價、價格離散、跳躍、錯誤成交、開市與收市效應,以及缺失觀測。它們會影響密集網格修正項,也會影響哪些報酬進入稀疏網格。跳躍是否屬於目標二次變差、還是需要分開處理,取決於研究問題;TSRV 不會自行決定這項建模選擇。篩選觀測值亦會改變網格,應予以記錄。
抗雜訊不等於對所有資料問題免疫。把估計解讀為潛在變異數前,應說明輸入是成交價、報價還是中間價,列出報酬轉換和時間尺度,檢查觀測是否等距,記錄清理及交易時段規則,並評估對 \(K\) 的敏感度。如果雜訊過程違反基準假設,便應使用為該情況設計的方法並說明其假設。不要把負估計稱為負波動率,也不要悄悄把它改成正數。
報告估計量,不要把它當作預測
透明報告會列明目標區間、輸入價格序列、取樣間隔、密集報酬數、稀疏間距 \(K\)、偏移集合、端點規則、雜訊假設、標準化、單位和任何截尾。可以同時呈現原始差值、標準化估計,以及預先設定尺度下的敏感度範圍。這些細節令計算可審核,亦可避免把變異數估計誤當報價、未來預測或盈利交易規則的證據。
積分變異數是按已觀測區間計算。年化時須說明時間慣例,避免掩蓋日內模式、隔夜區間或交易中斷。開平方會把單位轉為該區間的波動率,卻不會自動產生預測期限。歷史已實現指標可以是模型輸入,但預測表現須用未曾用來選擇估計設定的資料另行評估。
TSRV 的主要貢獻在方法層面:在明確的加性雜訊模型下,兩種取樣尺度可減少令樸素高頻已實現變異數無法一致估計目標的主要雜訊偏差。它不會識別每次價格變動的來源、不會消除模型風險,也不會告訴你下一期波動率。報告數值時應同時說明這些界線。
常見問題
Q1TSRV 是否使用每個觀測值?
密集網格已實現變異數會使用所有觀測值,而不同錯開稀疏網格亦會重用這些觀測。每個稀疏網格單獨取樣的頻率較低。此方法結合這些部分,不會丟棄密集觀測,也不會令各網格成為獨立樣本。
Q2雙尺度已實現波動率是波動率預測嗎?
不是。標準目標是已觀測區間內的積分變異數。開平方會以該區間的波動率單位表達數值;預測後續期間則需要另一個模型和樣本外評估。
Q3負的 TSRV 估計應否改為零?
除非清楚說明修改,否則不應。按比例縮放的密集網格修正超過稀疏估計時,有限樣本值可能為負。截為零會改變估計量,亦可能影響平均值和推論;應報告原值及任何後續處理規則。
Q4原始 TSRV 公式能處理所有微觀結構雜訊嗎?
不能。經典推導採用包括觀測誤差獨立在內的基準雜訊模型。隨時間改變或有序列依賴的雜訊、不規則取樣,以及雜訊與有效價格變動之間的依賴,可能需要不同或經修改的估計量。
資料來源與延伸閱讀
回報問題
我們會準備一封包含本文連結的電子郵件。寄出後,Mark 才會收到你的回報
快速檢查
讀完指南後,用 3 道題檢查一下
問題 01
為什麼取樣間隔極短時,樸素已實現變異數可能上升?
選擇答案即可查看解釋