實現核估計量:在微結構雜訊下衡量波動率
了解實現核如何對報酬自共變異數加權,以在微結構雜訊下估計高頻價格變動,並透過 Parzen 核例子說明頻寬選擇和實際限制。
本指南內容取樣更密卻增加雜訊時,核方法為何有用
簡短摘要
實現核利用高頻報酬估計價格變動,同時處理觀測價格雜訊所造成的序列依賴。它會計算多個落後期的報酬自共變異數,再用平滑的核權重將各項合併。頻寬決定納入多少個落後期。這是在指定取樣區間內、基於模型衡量價格變動的方法,並非波動率預測,也不保證所有市場資料誤差都已消除。
取樣更密卻增加雜訊時,核方法為何有用
在沒有雜訊的情況下,把日內報酬平方後相加,是估計觀測區間價格變動的自然做法。但成交價或報價可能受買賣價跳動、價格離散、延遲或記錄錯誤影響。對兩個含雜訊的價格取差,會把誤差帶入報酬;相鄰報酬亦會以相反符號共用其中一項誤差。因此,報酬的序列自共變異數包含觀測雜訊的資訊。
普通實現變異數只使用零階落後的報酬乘積,即把報酬平方後相加。在極高頻取樣下,這個總和累積雜訊的速度可能快於它捕捉潛在價格新變動的速度。實現核除了零階項,還會使用正、負落後期的加權自共變異數。在適當假設和頻寬增長條件下,非零落後期項有助抵銷主要雜訊效應,同時保留有效價格變動的資訊。
Barndorff-Nielsen、Hansen、Lunde 和 Shephard 在其 Econometrica 原始論文中提出實現核,用來估計存在市場摩擦時一段已完成區間內的價格變動。他們把核估計視為經審慎加權的長期變異數計算,而不是不檢查資料便使用每個可用逐筆觀測的指引。較簡單的高頻基準可參閱實現波動率計算指南。本文聚焦核修正及其選擇。
區分有效價格與記錄價格
設 \(X_t\) 為潛在有效對數價格,\(Y_{t_i}\) 為時點 \(t_i\) 記錄的對數價格:
\[ Y_{t_i}=X_{t_i}+\epsilon_{t_i}, \]
其中 \(\epsilon_{t_i}\) 代表市場微結構雜訊。常見的基準設定把潛在價格視為局部變異數率為 \(\sigma_t^2\) 的連續過程,而固定區間 \([0,T]\) 的目標是積分變異數:
\[ IV_T=\int_0^T \sigma_t^2\,dt. \]
最簡單的推導假設雜訊平均值為零、時間上互相獨立、與有效價格過程獨立,而且變異數穩定。這些假設有助看清修正項的來源。真實成交和報價可能不符合這些條件:雜訊可能有序列依賴、隨時間變化、與有效價格相關,或受到觀測時間選擇方式影響。
如果潛在過程有跳躍,二次變差也會包括跳躍平方。是否把它們納入目標,取決於模型和研究問題。連續價格推導的目標是積分變異數;除非加入抗跳躍結構,否則不應聲稱實現核能把連續變異數和跳躍分開。二次變差指南說明積分變異數與路徑總變動的分別。
這個設定估計的是已完成區間。它不會精確還原潛在價格、不會預測下一個區間,也不會給出交易可以成交的價格。高頻輸入亦需要清楚的慣例:使用成交價、報價中間價還是其他價格代理,會形成不同的報酬序列和雜訊特徵。
報酬自共變異數揭示雜訊模式
對 \(n\) 個觀測報酬 \(r_i=Y_{t_i}-Y_{t_{i-1}}\),定義未標準化的 \(h\) 階落後自共變異數總和:
\[ \Gamma_h=\sum_{i=h+1}^{n} r_i r_{i-h}, \qquad \Gamma_{-h}=\Gamma_h. \]
在零階落後,\(\Gamma_0=\sum_{i=1}^n r_i^2\),即一般的實現變異數。在一階落後,乘積配對相鄰報酬。在加性獨立價格雜訊模型下,相鄰報酬中的雜訊成分符號相反:向上的觀測誤差會推高一個報酬,並拉低下一個報酬。這通常會形成負的一階落後自共變異數。更一般而言,跨多個落後期的序列模式可顯示雜訊如何影響報酬序列。
落後期總和不會除以乘積數目。這一點重要,因為實現核會把它們與實現變異數總和放在同一尺度上合併。該估計量與異質變異及自相關穩健的長期變異數估計有關,但並非任意相加已標準化樣本自相關。端點和精確的求和慣例亦是估計量定義的一部分。
自共變異數不會把個別逐筆觀測標記為「雜訊」或「訊號」,而是彙總整個區間的交叉乘積。負的 \(\Gamma_1\) 與買賣價跳動相符,但單憑這一點不能證明特定機制。如果真實報酬有序列依賴,或觀測雜訊結構不同,同一自共變異數可能反映多種影響。估計依據的是已說明的模型和核權重,而不是把每個落後期視作直接的市場診斷。
用平滑核權重合併近端與較遠落後期
對最大落後期 \(H\),一種常見的有限樣本慣例定義如下:
\[ \widehat{IV}_{RK}(H)=\Gamma_0+2\sum_{h=1}^{H} k\!\left(\frac{h}{H}\right)\Gamma_h. \]
係數 2 把對稱的負落後期項一起計入。這裏 \(k(x)\) 是定義於 \(0\le x\le1\) 的核權重,\(k(0)=1\),而權重會在頻寬邊界附近逐漸減至零。論文和軟體可能使用略有不同的端點及索引慣例,例如分母採用 \(H+1\)。重現結果時應註明慣例,並始終一致地使用。
Parzen 核是常見的非負選擇:
\[ k(x)= \begin{cases} 1-6x^2+6x^3, & 0\le x\le \tfrac12,\\ 2(1-x)^3, & \tfrac12 < x\le1,\\ 0, & x>1. \end{cases} \]
它為短落後期賦予較大權重,並平滑地降低較遠滯後的權重。高頻雜訊可能令報酬之間產生依賴,而較遠滯後的估計會愈來愈不穩,因此這種平滑遞減很有用。在所述實作下,非負的 Parzen 結構旨在令單變量實現核估計保持非負。其他核不一定具備這項性質。平頂核(flat-top)可能有利於偏差,但有限樣本估計仍可能為負。
下方插圖以類比方式呈現這種遞減:較近落後期的貢獻較突出,遠端則逐漸淡去。它不是實測報酬圖、特定樣本的實證權重圖,也不是波動率估計。
<!-- learn:illustration --> <!-- 無文字概念圖:對稱的報酬回聲由明亮中心向外平滑淡去,表示有限頻寬內落後期權重逐漸減弱。並非市場資料或估計結果。 -->

頻寬決定偏差與變異數的取捨
頻寬 \(H\) 是納入總和的最大落後期。若太小,估計可能未能充分處理觀測雜訊造成的重要序列依賴;若太大,則會加入較雜的落後期乘積,令抽樣變異數增加。因此,頻寬是統計調整選擇,並非要剔除的觀測數目,也不是適用於所有資產的通用時間區間。
Parzen 實現核的漸近理論指出,最優頻寬以 \(n^{3/5}\) 的階數增長。文獻中使用的一個實務表達式為:
\[ H^*=c^*\,\xi^{4/5}n^{3/5}, \qquad c^*_{\text{Parzen}}=3.5134, \]
其中 \(n\) 是細網格報酬的數目,\(\xi\) 概括相對雜訊水平和潛在價格的積分四階矩。一個尺度表達式是:
\[ \xi^2=\frac{\omega^2}{\sqrt{T\int_0^T\sigma_u^4\,du}}, \]
其中 \(\omega^2\) 是觀測雜訊變異數。實際上這些量未知,需要估計,常見做法是使用雜訊變異數和積分四階矩的先導估計。公式說明,最優滯後數同時取決於樣本數量和雜訊相對於訊號的環境,並非固定通用設定。
漸近設計要求頻寬增加,但相對於樣本數仍然較小,通常寫成 \(H\to\infty\) 且 \(H/n\to0\)。在論文的模型及核條件下,\(n^{3/5}\) 規則平衡主要偏差與變異數。在有限交易時段中,如果先導雜訊或四階矩估計不佳,代入估計可能不穩定。應報告所選的 \(H\)、索引慣例、先導輸入值,以及對合理替代方案的敏感度分析。
四個報酬的假設計算
考慮一組刻意縮小、以基點為單位的假設報酬:
\[ (r_1,r_2,r_3,r_4)=(1,-1,1,-1)\ \mathrm{bp}. \]
這組數值只用來核對算術,並非市場資料;四個報酬亦遠不足以支持漸近頻寬選擇。零階落後總和為:
\[ \Gamma_0=1^2+(-1)^2+1^2+(-1)^2=4\ \mathrm{bp}^2. \]
一階落後乘積是 \((-1),(-1),(-1)\),因此 \(\Gamma_1=-3\ \mathrm{bp}^2\)。在二階落後,\(r_3r_1=1\) 和 \(r_4r_2=1\),所以 \(\Gamma_2=2\ \mathrm{bp}^2\)。
只為示範公式,令 \(H=2\)。使用 Parzen 核時,\(k(1/2)=1-6(1/4)+6(1/8)=1/4\),而 \(k(1)=0\)。因此:
\[ \widehat{IV}_{RK}=4+2\left(\tfrac14\right)(-3)+2(0)(2) =2.5\ \mathrm{bp}^2. \]
普通實現變異數為 \(4\ \mathrm{bp}^2\);在這個例子中,加權的一階負落後期項會降低核估計。第二階落後總和沒有貢獻,因為 Parzen 權重在邊界為零。結果是非負的,但單憑這項計算不能證明它等於未觀測的有效價格變動。潛在路徑沒有被觀察,沒有計算不確定區間,也不能由此得出預測或交易結論。其平方根約為 \(1.58\) bp,只是這個假設區間的標準差尺度。
這個例子亦說明為何報告估計時要一起提供頻寬和索引規則。不同的 \(H\)、端點慣例或報酬會改變權重或納入的乘積。由於每個報酬、落後期總和、權重和單位都已列出,數值結果可以重現。
端點處理和資料清理也是方法的一部分
未標準化的落後期總和可能令端點觀測有不成比例的影響,尤其當第一個或最後一個記錄價格有較大的雜訊誤差時。實現核實務論文討論用局部平均(常稱為 jittering)減少端點效應。一種常見實作是在計算報酬前,以相鄰觀測的局部平均取代端點價格。確切窗口大小,以及平均一端還是兩端,都是實作選擇,應清楚交代。
資料清理的重要性可能不亞於公式。單一錯誤成交、過時報價、交叉市場、重複時間戳或價格尺度錯誤,都會產生進入多項總和的報酬與落後期乘積。應記錄價格欄位、時間戳對齊方式、交易時段邊界、重複資料處理、篩選規則,以及如何處理拍賣或市場休市。清理規則應獨立制定,不應視乎它們能否令最終估計看起來更合理。
2009 年的實現核實務研究討論成交與報價資料、端點效應、局部趨勢和非負 Parzen 核。它的實務啟示是,「對雜訊穩健」不等於「毋須理會資料特性」。短窗口內緩慢移動的價格成分、變化中的市場摩擦或報價構造方式,都可能令基準解讀受到挑戰。局部平均可以減少一種端點問題,但不能修正對齊錯誤的序列或樣本中段的錯誤觀測。
模型假設和重要限制
經典理論對潛在價格過程、取樣、雜訊、核的正則性和頻寬作出假設。某些實現核構造可處理比簡單獨立雜訊例子更廣泛的序列相關雜訊和內生觀測時間。但這種穩健性取決於具體定理:必須採用符合相關條件的核和頻寬。Aït-Sahalia、Mykland 和 Zhang 關於相依微結構雜訊的研究,說明為何應明確處理雜訊依賴,而不是假設所有擴展性質都會自動從基準公式成立。
核的選擇很重要。Parzen 核常用於非負的單變量估計。平頂權重針對不同偏差特性,有限樣本下可能產生負估計。不要因為熟悉某個 HAC 核便任意替換:實現核文獻指出,在所分析的構造中,某些看似熟悉的選擇(包括 Bartlett 核)不會得到相同的一致性結果。若估計為負,應說明核和有限樣本規則;不要默默截斷至零,亦不要稱為負的物理變異數。
結果亦承受價格代理和目標量的限制。跳躍可以是二次變差的一部分;離群值可主導乘積;不規則或非同步觀測可能改變被估計的量;波動率和雜訊亦可能在區間內變化。單變量實現核本身不會解決多變量非同步取樣、消除跳躍,或把買賣價跳動與其他所有報酬依賴來源區分開。估計量只是在明確模型內穩健,並非對所有可能資料缺陷免疫。
報告區間估計,而非預測或成交報價
可重現的報告應列明價格序列及取樣設計、觀測窗口、報酬單位、核函數、最大落後期 \(H\)、端點慣例、端點平均規則和資料清理方式。如使用代入頻寬,應報告估計的雜訊和四階矩輸入,或提供足夠細節供重現。亦應說明結果是積分變異數估計、包括跳躍的二次變差估計,還是轉換後的波動率衡量。
估計描述取樣區間內的變動。除非另一個預測模型把歷史衡量映射至未來期限,並經過樣本外評估,否則它不是未來波動率預測。它亦不是報價價差或成交成本估計:Roll 買賣價差指南用報酬自共變異數估計的是另一種量。雙尺度實現波動率指南介紹另一種修正結構不同的抗雜訊方法。
關鍵判斷不只是要否使用實現核,而是價格資料、取樣方案、目標量、核和頻寬是否足夠配合研究問題,以支持所報告的解讀。敏感度表和清楚列明的模型限制有助審核這項判斷。即使謹慎估計,它仍是帶有抽樣不確定性的歷史衡量;不能證明交易規則有利可圖,也不保證微觀結構效應已消失。
常見問題
Q1實現核會消除所有微結構雜訊嗎?
不會。在指定假設、合適的核和適當頻寬下,它可以減低雜訊影響。資料錯誤、變化或相依的雜訊、取樣問題和模型設定錯誤,仍可能影響估計。
Q2Parzen 核和頻寬是同一回事嗎?
不是。核是為落後期指定相對權重的函數。頻寬是納入的最大落後期,並設定權重衰減的範圍。
Q3為什麼不同實作會得到不同的實現核?
它們可能採用不同頻寬、端點索引、局部平均窗口、價格欄位、清理規則或核慣例。這些選擇會改變自共變異數總和,因此應一起報告。
Q4實現核估計是波動率預測嗎?
單靠估計本身不是。它衡量已觀測區間內的變動。預測未來期限需要另一個模型及樣本外評估。
資料來源與延伸閱讀
回報問題
我們會準備一封包含本文連結的電子郵件。寄出後,Mark 才會收到你的回報
快速檢查
讀完指南後,用 3 道題檢查一下
問題 01
實現核在普通實現變異數總和上加入什麼?
選擇答案即可查看解釋