Hayashi–Yoshida 協方差估計量:非同步價格解說
了解 Hayashi–Yoshida 估計量如何利用重疊回報區間,估計在不同時間交易的資產之積分協方差,以及方法的適用界線。
本指南內容交易時鐘不同,為何資產價格協方差較難估計
簡短摘要
Hayashi–Yoshida(HY)估計量以兩個在不同時間觀察的價格序列,量度積分協方差。只有當回報增量所屬的時間區間重疊時,方法才會將兩者配對,因此毋須先把一項資產的價格插值至另一項資產的時間戳。經典 HY 在擴散模型下處理非同步抽樣;它不會消除市場微觀結構噪音,也不會將協方差估計變成預測。
交易時鐘不同,為何資產價格協方差較難估計
兩項資產即使在相同市場時段交易,成交時間仍可能不同。流通量高的股票可能頻密成交,交易較少的股票則可能沒有新成交或報價。觀察到的價格變動因而落在不同時間網格上。研究目標或許是兩者同期的共同變動,但觀察回報未必有一對剛好涵蓋相同區間。
常見做法是將兩個序列放到固定時鐘上,沿用每項資產最近一次觀察價格。這會產生對齊的回報欄,但重複沿用的舊價格並非潛在價格的新獨立觀察。重複的零回報和延遲補償變動可能扭曲共同變動的量度。Epps 指出,量度間隔縮短時,觀察到的股票回報相關性可能下降;非同步觀察是其中一項機制,市場數據亦有其他影響。這種短間隔現象一般稱為 Epps 效應(Epps, 1979)。
Hayashi 和 Yoshida 提出的估計量直接使用原有非同步增量,毋須先選擇插值規則。早期研究證明,在高頻抽樣條件下,擴散價格的估計量具一致性(Hayashi & Yoshida, 2005);後續研究則在一般非同步抽樣方案下推導漸近常態性(Hayashi & Yoshida, 2008)。核心規則是根據時間區間是否重疊配對,而非只看時間戳是否接近。
計算前先界定協方差目標
令 \(X_t\) 和 \(Y_t\) 為共同區間 \([0,T]\) 內兩項資產的潛在有效對數價格。簡單的連續擴散模型可寫成
\[ dX_t=\mu^X_t\,dt+\sigma^X_t\,dW^X_t,\qquad dY_t=\mu^Y_t\,dt+\sigma^Y_t\,dW^Y_t, \]
即時布朗相關為 \(d[W^X,W^Y]_t=\rho_t\,dt\)。目標量是積分協方差
\[ [X,Y]_T=\int_0^T \sigma^X_t\sigma^Y_t\rho_t\,dt. \]
這是在選定觀察窗口內沿價格路徑累積的量,不是兩個靜態價格水平的協方差,也不會自動等於相關系數。單位是兩項回報單位的乘積:若對數回報以百分點表示,估計值便以百分點平方計。已實現波幅計算指南介紹單一序列的平方回報指標;二次變差指南說明多變量已實現協方差所延伸的路徑量。
目標值可以正也可以負。正值代表同一窗口內,同號回報增量所產生的交叉乘積整體佔優;負值代表異號乘積佔優。單憑正負號,不能證明資產為何共同變動、是否存在因果關係,或某種投資組合規則會否獲利。
沿用最近價格來同步資料,為何會扭曲估計
計算一般已實現協方差時,分析者可能選擇固定時間點,並使用每項資產當時最新可得的價格。這種做法方便,但結果可能視乎網格間距和插值慣例。價格長時間沒有更新時,多個網格觀察會重複同一報價;其後的價格更新看來便像一筆跨越較長時間的回報,與另一項資產配對的區間不一致。
這可能將同期協方差移至虛假的領先—滯後部分,或在網格變密時令估計減弱至接近零。Epps 的早期實證結果描述短量度間隔下觀察到的共同變動變化;後續研究則推導在非同步抽樣和價格含噪時,按前值同步協方差的偏差。因此,高頻相關性下跌是一項診斷現象,不能證明非同步時間是唯一原因。
HY 保留每筆觀察回報自己的時間區間,避開某一種同步選擇。但時間戳仍須準確:兩項資產要採用共同時鐘標準、正確交易時段邊界,以及清晰的分析起止點。此方法亦不能修正嘈雜成交價、錯誤報價,或混合不同交易時段的目標資料。
配對觀察區間有重疊的回報
假設資產 \(X\) 在 \(0=t_0<t_1<\cdots<t_n=T\) 時觀察,資產 \(Y\) 則在 \(0=s_0<s_1<\cdots<s_m=T\) 時觀察。觀察到的對數回報增量為
\[ \Delta X_i=X_{t_i}-X_{t_{i-1}},\qquad \Delta Y_j=Y_{s_j}-Y_{s_{j-1}}. \]
各增量的時間區間分別為 \(I_i=(t_{i-1},t_i]\) 和 \(J_j=(s_{j-1},s_j]\)。HY 估計量為
\[ \widehat{[X,Y]}^{HY}_T =\sum_{i=1}^{n}\sum_{j=1}^{m} \Delta X_i\,\Delta Y_j\, \mathbf{1}\{|I_i\cap J_j|>0\}. \]
只有當兩個回報區間重疊一段正時長,指示函數才會將交叉乘積納入。單是共用一個端點並不算正時長重疊。一項增量可以與另一項資產的多項增量重疊,每組配對只計一次。此方法不會沿用價格,也不會把回報拆成虛構子回報。
在經典連續擴散設定下,若觀察間隔足夠密且抽樣條件合適,最大區間長度縮小時,總和會收斂至積分協方差。這項結果針對非同步觀察,並假設觀察價格沒有原始 tick 數據常見的市場微觀結構噪音。
<!-- learn:illustration -->

重算一個假設的區間重疊例子
假設兩項資產在同一個長五個時間單位的交易時段內觀察。下表列出假設的對數回報(單位為百分點)及其涵蓋區間。觀察時間錯開,因此回報端點不會全部吻合。
| 資產 X 區間 | 回報 | 資產 Y 區間 | 回報 | 重疊乘積 |
|---|---|---|---|---|
| \((0,1.8]\) | \(+0.40\%\) | \((0,1.0]\) | \(+0.30\%\) | \(+0.12\ \mathrm{pp}^2\) |
| \((0,1.8]\) | \(+0.40\%\) | \((1.0,2.4]\) | \(+0.50\%\) | \(+0.20\ \mathrm{pp}^2\) |
| \((1.8,3.2]\) | \(+0.20\%\) | \((1.0,2.4]\) | \(+0.50\%\) | \(+0.10\ \mathrm{pp}^2\) |
| \((1.8,3.2]\) | \(+0.20\%\) | \((2.4,3.9]\) | \(-0.20\%\) | \(-0.04\ \mathrm{pp}^2\) |
| \((3.2,5]\) | \(-0.10\%\) | \((2.4,3.9]\) | \(-0.20\%\) | \(+0.02\ \mathrm{pp}^2\) |
| \((3.2,5]\) | \(-0.10\%\) | \((3.9,5]\) | \(+0.10\%\) | \(-0.01\ \mathrm{pp}^2\) |
例如,第一段 \(X\) 區間與第一段 \(Y\) 區間在 0 至 1.0 重疊,與第二段則在 1.0 至 1.8 重疊,故兩項交叉乘積都會計入。下一段 \(X\) 回報與第二段 \(Y\) 回報在 1.8 至 2.4 重疊,與第三段則在 2.4 至 3.2 重疊。最後一段 \(X\) 的兩個重疊部分合共貢獻 \(0.02-0.01\ \mathrm{pp}^2\)。六項乘積總和為
\[ \widehat{[X,Y]}^{HY}_T =0.12+0.20+0.10-0.04+0.02-0.01 =0.39\ \mathrm{pp}^2. \]
一個百分點相當於十進制回報單位的 \(0.01\),因此 \(0.39\ \mathrm{pp}^2=3.9\times10^{-5}\) 個十進制對數回報平方單位。輸入數值純屬假設,只為示範可重算的算術。結果是該窗口的累積協方差估計,不是 0.39% 回報、相關系數或真實市場觀察。
解讀正負號和尺度,不要將協方差當成訊號
例子中的正總和表示同號交叉乘積整體多於負乘積。它不代表兩項資產各自上升 0.39%,也不代表 39% 的價格變動是共同的。協方差會隨回報單位、窗口長度和市場活躍度而改變;數值較大可能只是單位或窗口不同,而非標準化依賴性較強。
相關系數沒有單位,須按波幅估計縮放。若用分開抽樣或估計的方差項組成簡單比率,結果不會自動成為有效相關系數;有限樣本下甚至可能超出 \([-1,1]\)。積分協方差本身也無法區分共同消息、價格延遲調整、共同風險敞口或其他機制。
用於投資組合分析時,請列出資產權重、窗口、回報單位和協方差定義。不要將正 HY 估計視作買入訊號,亦不要將負值視作對沖指示。外匯貨幣對相關性指南說明為何相關性和共同風險敞口仍須小心解讀。已實現指標只描述所選歷史窗口,不會預測下一段回報,也不保證對沖能抵銷未來損失。
了解經典 HY 的抽樣和價格假設
經典估計量針對在離散、非同步時間觀察到的擴散型價格。實際近似要求每個序列的最大觀察間隔,相對分析窗口而言足夠短。長時間沒有交易的區間會涵蓋許多可能變動;公式仍可計算,但高頻抽樣近似可能較弱。
成交價通常帶有買賣價跳動、價格離散、過時報價、延遲及其他測量誤差。HY 的重疊規則處理時間錯位,不會消除價格誤差。Griffin 和 Oomen 研究有獨立同分佈微觀結構噪音的非同步抽樣下,已實現協方差、領先—滯後調整及 HY 的表現,並指出有限樣本表現取決於噪音和相關條件(Griffin & Oomen, 2011)。因此,不要把一般 HY 稱為普遍抗噪。
亦要界定合理的共同觀察窗口。如果一個市場比另一個市場早收市,名義上相同的日曆窗口未必代表相同活躍交易時段。時區轉換、夏令時間、拍賣、公司行動、缺失區間和異常值篩選都會改變重疊集合。應記錄這些選擇,不要把時間戳當成無關細節。
將統計推論和噪音處理與點估計分開
點估計並非信賴區間。Hayashi 和 Yoshida 在一般非同步抽樣方案下推導漸近常態性;但實際標準誤仍須有可行的方差估計量,並採用符合抽樣設計的假設。觀察稀疏或極不均勻時,即使重疊總和看似穩定,不確定性仍可能很大。
面對含噪的高頻價格,應採用同時處理噪音和非同步性的估計方法,或為抽樣與前處理方式提供理據。Christensen、Kinnebrock 和 Podolskij 為含噪擴散模型的非同步數據提出預平均協方差估計量,包括毋須先對齊原始價格的預平均 HY 類估計量(Christensen et al., 2010)。Barndorff-Nielsen 等人的多變量已實現核,針對含噪和非同步交易下的協變動,並設計成產生半正定協方差估計(Barndorff-Nielsen et al., 2011)。詳情見已實現核估計量指南。
報告可重現的估計結果及其限制
報告應列出兩個價格序列及其類型(成交價、報價或中間價)、共同時鐘和交易時段、\([0,T]\) 的起止點、回報轉換、重疊規則、抽樣間隔概況和估計量。標明協方差單位及窗口,並說明如何處理過時觀察、異常值、跳躍、拍賣和微觀結構噪音。若數據非同步,應交代使用原始區間,還是先同步價格。
不要習慣性地把積分協方差年化。若要把窗口估計轉成速率或年化數字,請說明時間縮放假設,以及如何處理隔夜時段和市場休市。若估算相關系數,須列出分母中的方差估計並檢查矩陣限制。這些選擇與重疊公式一樣會影響解讀。
Hayashi–Yoshida 估計量的用途,是毋須虛構同步價格,便能直接、可重現地累加非同步區間的交叉乘積。其經典保證有條件:須符合無噪擴散框架,且抽樣足夠密集。它不能證明因果關係、解決微觀結構噪音,也不保證對沖或交易規則可靠。
常見問題
Q1HY 是否要求兩項資產在同一刻交易?
不需要。它正是用來處理交易時間錯位。只要回報時間區間重疊,即使觀察時間戳不同,也會將兩者相乘。
Q2HY 可以直接套用於含噪成交價嗎?
經典估計量處理的是擴散模型下的非同步抽樣,並非任意市場微觀結構噪音。買賣價跳動、離散價格和過時報價可能需要獨立的抗噪方法,或有充分理據的抽樣程序。
Q3HY 估計值是相關系數嗎?
不是。它估計積分協方差,單位是兩項回報單位的乘積。相關系數須按波幅縮放;來自非同步數據的有限樣本估計可能不符合相關矩陣的所有限制。
Q4可以將正的 HY 估計當作交易訊號嗎?
不能單獨使用。它總結歷史窗口中的交叉乘積,不會證明因果關係、預測未來共同變動,也不會計及執行成本和風險變化。
資料來源與延伸閱讀
回報問題
我們會準備一封包含本文連結的電郵。寄出後,Mark 才會收到你的回報
快速檢查
讀完指南後,用 3 道題檢查一下
問題 01
哪些回報配對會納入經典 Hayashi–Yoshida 總和?
選擇答案即可查看解釋