Hayashi–Yoshida 共變異數估計量:非同步價格解析
了解 Hayashi–Yoshida 估計量如何利用重疊報酬區間,在資產於不同時間交易時估計積分共變異數,以及方法的適用限制。
本指南內容交易時間不同時,為什麼資產價格共變異數難以估計
簡短摘要
Hayashi–Yoshida(HY)估計量會根據兩個在不同時間觀察到的價格序列,衡量積分共變異數。只有當報酬增量所涵蓋的時間區間重疊時,方法才會配對,因此不必先把一項資產的價格內插到另一項資產的時間戳。經典 HY 在擴散模型下處理非同步抽樣;它不會消除市場微結構雜訊,也不會將共變異數估計變成預測。
交易時間不同時,為什麼資產價格共變異數難以估計
兩項資產即使在相同市場時段交易,成交時間仍可能不同。流動性高的股票可能頻繁成交,較不活躍的股票則可能暫時沒有新成交或報價。觀察到的價格變動因此落在不同時間網格上。研究目標或許是兩者的同期共同變動,但觀察報酬不一定有一對恰好涵蓋相同區間。
常見作法是把兩個序列放到固定時間網格,沿用每項資產最近一次觀察價格。如此能產生對齊的報酬欄位,但重複沿用的舊價格並不是潛在價格的新獨立觀察。重複的零報酬和延遲補償變動可能扭曲共同變動的衡量。Epps 指出,測量間隔縮短時,觀察到的股票報酬相關性可能下降;非同步觀察是其中一種機制,市場資料還有其他影響。這種短間隔現象通常稱為 Epps 效應(Epps, 1979)。
Hayashi 和 Yoshida 提出的估計量直接使用原始非同步增量,不必先選定內插規則。早期研究在高頻抽樣條件下證明擴散價格估計量的一致性(Hayashi & Yoshida, 2005);後續研究則在一般非同步抽樣架構下推導漸近常態性(Hayashi & Yoshida, 2008)。核心規則是依時間區間是否重疊配對,而不是只看時間戳是否接近。
計算前先定義共變異數目標
令 \(X_t\) 與 \(Y_t\) 為共同區間 \([0,T]\) 內兩項資產的潛在有效對數價格。簡單的連續擴散模型可寫成
\[ dX_t=\mu^X_t\,dt+\sigma^X_t\,dW^X_t,\qquad dY_t=\mu^Y_t\,dt+\sigma^Y_t\,dW^Y_t, \]
瞬時布朗相關為 \(d[W^X,W^Y]_t=\rho_t\,dt\)。目標量是積分共變異數:
\[ [X,Y]_T=\int_0^T \sigma^X_t\sigma^Y_t\rho_t\,dt. \]
這是在所選觀察視窗內沿價格路徑累積的量,不是兩個靜態價格水準的共變異數,也不會自動等於相關係數。單位是兩種報酬單位的乘積:若對數報酬以百分點表示,估計值的單位便是百分點平方。已實現波動度計算指南介紹單一序列的平方報酬指標;二次變差指南說明多變量已實現共變異數延伸的路徑量。
目標值可以為正或負。正的積分共變異數表示同一視窗內,同號報酬增量產生的交叉乘積整體占優;負值則代表異號乘積占優。單看正負號無法證明資產為何共同變動、是否有因果關係,或某種投資組合規則是否有利可圖。
用最近價格同步資料,為什麼會扭曲估計
計算一般已實現共變異數時,分析者可能選擇固定時間點,並使用每項資產當時最新可得的價格。這很方便,但結果可能取決於網格間距和內插規則。價格過時時,多個網格觀察會重複同一筆報價;之後的價格更新就可能看起來像涵蓋較長期間的單筆報酬,與另一項資產配對的區間不一致。
這可能把同期共變異數移到虛假的領先—落後項,或在網格愈密時使估計值趨近零。Epps 的早期實證結果描述短測量間隔下觀察到的共同變動改變;後續研究則推導,在非同步抽樣且觀察價格含雜訊時,前值同步共變異數會產生偏誤。因此,高頻相關性下降是一種待診斷的現象,不能證明非同步時間是唯一原因。
HY 保留每筆觀察報酬自己的時間區間,避開特定的同步選擇。不過時間戳仍須可靠:兩項資產需要共用時間標準、正確的交易時段邊界,以及明確的分析起訖規則。此方法也無法修正含雜訊的成交價、錯誤報價,或混合不同交易時段的目標資料。
配對觀察區間有重疊的報酬
假設資產 \(X\) 在 \(0=t_0<t_1<\cdots<t_n=T\) 時觀察,資產 \(Y\) 則在 \(0=s_0<s_1<\cdots<s_m=T\) 時觀察。觀察到的對數報酬增量為
\[ \Delta X_i=X_{t_i}-X_{t_{i-1}},\qquad \Delta Y_j=Y_{s_j}-Y_{s_{j-1}}. \]
各增量對應的時間區間為 \(I_i=(t_{i-1},t_i]\) 與 \(J_j=(s_{j-1},s_j]\)。HY 估計量是
\[ \widehat{[X,Y]}^{HY}_T =\sum_{i=1}^{n}\sum_{j=1}^{m} \Delta X_i\,\Delta Y_j\, \mathbf{1}\{|I_i\cap J_j|>0\}. \]
只有當兩段報酬區間重疊一段正時間,指示函數才會納入交叉乘積。只共用一個端點不算正時間重疊。一個增量可能與另一項資產的多個增量重疊,每組配對各計一次。此程序不會沿用價格,也不會把報酬拆成虛構的子報酬。
在經典連續擴散架構中,若觀察足夠密集且抽樣條件合適,最大區間長度縮小時,總和會收斂至積分共變異數。經典結果針對非同步觀察,並假設觀察價格未受原始 tick 資料常見的市場微結構雜訊污染。
<!-- learn:illustration -->

重算一個假設的區間重疊例子
假設兩項資產在同一個長度為五個時間單位的交易時段內觀察。表格列出假設的對數報酬(單位為百分點)和各自涵蓋的區間。觀察時間錯開,因此報酬端點不會全部吻合。
| 資產 X 區間 | 報酬 | 資產 Y 區間 | 報酬 | 重疊乘積 |
|---|---|---|---|---|
| \((0,1.8]\) | \(+0.40\%\) | \((0,1.0]\) | \(+0.30\%\) | \(+0.12\ \mathrm{pp}^2\) |
| \((0,1.8]\) | \(+0.40\%\) | \((1.0,2.4]\) | \(+0.50\%\) | \(+0.20\ \mathrm{pp}^2\) |
| \((1.8,3.2]\) | \(+0.20\%\) | \((1.0,2.4]\) | \(+0.50\%\) | \(+0.10\ \mathrm{pp}^2\) |
| \((1.8,3.2]\) | \(+0.20\%\) | \((2.4,3.9]\) | \(-0.20\%\) | \(-0.04\ \mathrm{pp}^2\) |
| \((3.2,5]\) | \(-0.10\%\) | \((2.4,3.9]\) | \(-0.20\%\) | \(+0.02\ \mathrm{pp}^2\) |
| \((3.2,5]\) | \(-0.10\%\) | \((3.9,5]\) | \(+0.10\%\) | \(-0.01\ \mathrm{pp}^2\) |
例如,第一段 \(X\) 區間與第一段 \(Y\) 區間在 0 至 1.0 間重疊,並與第二段在 1.0 至 1.8 間重疊,因此兩項交叉乘積都會納入。下一段 \(X\) 報酬與第二段 \(Y\) 報酬在 1.8 至 2.4 間重疊,並與第三段在 2.4 至 3.2 間重疊。最後一段 \(X\) 的兩個重疊部分貢獻 \(0.02-0.01\ \mathrm{pp}^2\)。六個納入的乘積總和為
\[ \widehat{[X,Y]}^{HY}_T =0.12+0.20+0.10-0.04+0.02-0.01 =0.39\ \mathrm{pp}^2. \]
一個百分點等於十進位報酬單位的 \(0.01\),因此 \(0.39\ \mathrm{pp}^2=3.9\times10^{-5}\) 個十進位對數報酬平方單位。輸入值純為演示可重算的算術而假設。結果是該視窗的累積共變異數估計,不是 0.39% 報酬、相關係數或實際市場觀察值。
解讀正負號與尺度,但不要把共變異數當成訊號
例中的正總和表示同號交叉乘積整體大於負乘積。這不代表兩項資產各上漲 0.39%,也不代表其價格變動有 39% 是共同的。共變異數會隨報酬單位、視窗長度和交易活躍度而改變;數值較大可能是單位或期間不同,而非標準化相依性較強。
相關係數沒有單位,須以波動度估計值縮放。由分別抽樣或估計的變異數項組成簡單比值,不會自動成為有效的相關係數;有限樣本中甚至可能超出 \([-1,1]\)。積分共變異數本身也無法區分共同消息、價格延遲調整、共同曝險或其他機制。
用於投資組合時,請說明資產權重、期間、報酬單位和共變異數慣例。不要把正 HY 估計當成買進訊號,也不要把負值當成避險指示。外匯貨幣對相關性指南說明相關性與共同曝險仍須謹慎解讀。已實現指標描述選定的歷史視窗,不會預測下一段報酬,也不保證避險可以抵銷未來損失。
了解經典 HY 的抽樣和價格假設
經典估計量是為離散、非同步觀察的擴散型價格而發展。實務近似要求各序列的最大觀察間隔,相對分析視窗而言夠短。長時間沒有交易的區間可能涵蓋許多不同變動;公式仍能計算,但高頻抽樣近似可能較弱。
觀察到的成交價常有買賣價跳動、價格離散、過時報價、延遲及其他測量影響。HY 的重疊規則解決時間錯位,不會消除價格誤差。Griffin 和 Oomen 研究有獨立同分布微結構雜訊的非同步抽樣下,已實現共變異數、領先—落後調整和 HY 表現,並指出有限樣本的相對表現取決於雜訊與相關條件(Griffin & Oomen, 2011)。因此,不要把一般 HY 描述成普遍抗雜訊。
也要設定合理的共同觀察期間。如果一個市場比另一個市場早收盤,名義上相同的日曆視窗可能並未涵蓋相同的活躍交易時間。時區轉換、日光節約時間、拍賣、公司事件、資料缺漏和異常值篩選都會改變重疊集合。請記錄這些選擇,而不是把時間戳當成無關細節。
將統計推論和雜訊處理與點估計分開
點估計不是信賴區間。Hayashi 和 Yoshida 在一般非同步抽樣架構下推導漸近常態性;但實際標準誤仍需要可行的變異數估計量,以及符合抽樣設計的假設。觀察稀疏或極不平均時,即使重疊總和看起來穩定,不確定性仍可能很高。
對含雜訊的高頻價格,請採用同時針對雜訊與非同步問題設計的方法,或說明抽樣與前處理選擇的理由。Christensen、Kinnebrock 和 Podolskij 為含雜訊擴散模型的非同步資料發展預平均共變異數估計量,其中包括不必先對齊原始價格的預平均 HY 類估計量(Christensen et al., 2010)。Barndorff-Nielsen 等人的多變量已實現核,針對雜訊及非同步交易下的共同變動,並設計為產生半正定共變異數估計(Barndorff-Nielsen et al., 2011)。詳見已實現核估計量指南。
若投資組合最佳化器或風險系統需要一致的共變異數矩陣,半正定性很重要。不同重疊集合算出的兩兩 HY 估計,組成矩陣後並不自動保證半正定。不要悄悄修改特徵值來「修復」矩陣;投影、收縮或替代估計量應另列為建模步驟。抗雜訊估計方法也有參數選擇和假設。
報告可重現的估計結果及其限制
報告應列出兩個價格序列及資料類型(成交價、報價或中間價)、共同時鐘和交易時段、\([0,T]\) 起訖點、報酬轉換、重疊慣例、抽樣間隔摘要和所用估計量。標示共變異數單位與視窗,並說明如何處理過時觀察、異常值、跳躍、拍賣和市場微結構雜訊。如果資料非同步,請說明使用原始區間,或先同步價格。
不要習慣性地將積分共變異數年化。若要把視窗估計轉成速率或年化數字,請說明時間縮放假設,以及隔夜和市場休市時間的處理方式。若估算相關係數,請列出分母中的變異數估計並檢查矩陣限制。這些選擇與重疊公式一樣會影響解讀。
Hayashi–Yoshida 估計量的優點,是能直接且可重現地累加非同步區間的交叉乘積,不必虛構同步價格。其經典保證有條件:必須符合適當的無雜訊擴散架構,並有足夠密集的抽樣。它不能證明因果關係、解決市場微結構雜訊,也不保證避險或交易規則可靠。
常見問題
Q1HY 是否要求兩項資產在同一時刻交易?
不需要。它正是為處理交易時間錯位而設計。只要報酬時間區間重疊,即使觀察時間戳不同,也會將兩者相乘。
Q2HY 能直接用於含雜訊的成交價嗎?
經典估計量處理的是擴散模型下的非同步抽樣,不是任意市場微結構雜訊。買賣價跳動、價格離散和過時報價可能需要另外的抗雜訊方法,或經過審慎論證的抽樣程序。
Q3HY 估計值是相關係數嗎?
不是。它估計積分共變異數,單位是兩種報酬單位的乘積。相關係數需以波動度縮放;來自非同步資料的有限樣本估計可能不符合相關矩陣的所有限制。
Q4可以把正的 HY 估計當成交易訊號嗎?
不能單獨使用。它彙整歷史視窗內的交叉乘積,不證明因果關係、不預測未來共同變動,也不考量執行成本和風險變化。
資料來源與延伸閱讀
回報問題
我們會準備一封包含本文連結的電子郵件。寄出後,Mark 才會收到你的回報
快速檢查
讀完指南後,用 3 道題檢查一下
問題 01
哪些報酬配對會納入經典 Hayashi–Yoshida 總和?
選擇答案即可查看解釋