MIDAS回歸:混合頻率數據與波幅預測
了解MIDAS回歸如何以簡約的滯後權重結合每日及每週金融數據、如何建立波幅預測,以及混合頻率模型有哪些容易造成誤解之處。
本指南內容MIDAS處理觀察頻率不一致的問題
簡短摘要
MIDAS(mixed data sampling,混合數據抽樣)回歸把不同頻率記錄的觀察值連繫起來,毋須先把所有序列硬性套入同一個日曆。少量估計參數會為較高頻率觀察值的歷史加權,有助預測較低頻率的金融目標。這些權重描述所選模型之下的預測模式,並不能證明因果關係或交易優勢。
MIDAS處理觀察頻率不一致的問題
金融和經濟數據不會按同一個時間表出現。波幅目標可以每週量度,候選預測變數則可能是每日回報或日內已實現指標。宏觀經濟序列可以按季公布,資產價格卻每日都有觀察值。一般回歸要求目標和預測變數每項觀察各佔一行,因此在估計熟悉的模型前,分析者要先決定如何處理這些不同的日曆。
其中一個做法是把每日輸入彙總為每週平均值或總和。做法簡單,但會強制每日採用特定權重,也可能失去一週之內變動發生的時間。另一個做法是把季度數值重複填入每日行,或進行插值。重複填值可能令變化緩慢的數值看似許多新觀察;插值則可能創造從未觀察到的平滑路徑。兩種做法都不會帶來新資訊。
MIDAS提供直接連接不同頻率的方法。它讓目標維持自然的較低頻率,並納入較高頻率序列的結構化滯後項。MIDAS這個名稱指混合數據抽樣,並非某一種波幅模型。研究者會用MIDAS回歸預測波幅,也會在預測變數的抽樣間隔比結果更細的其他情況中使用。重點是要納入多少近期高頻歷史,以及如何限制權重。
加權滯後項把大量觀察濃縮成簡潔的預測變數
設\(y_{t+1}\)為較低頻率的目標,例如在第\(t+1\)週結束後觀察到的下週已實現方差。設\(x_{t-j}\)為每日預測變數,在第\(t\)週末的預測起點之前\(j\)個交易時段觀察到。簡單的MIDAS回歸為\(y_{t+1}=a+b\sum_{j=1}^{K}w_j(\theta)x_{t-j}+u_{t+1}\),其中\(K\)是每日滯後數目,\(w_j(\theta)\)是由少數參數控制的權重,\(u_{t+1}\)是預測誤差。
權重通常會正規化,使\(\sum_{j=1}^{K}w_j(\theta)=1\)。這樣加權總和較容易理解為加權歷史,而\(b\)則控制該摘要與目標的關係強度。正規化不代表每日觀察值互相獨立或資訊量相同,只是表示滯後分布的方便參數化方法。
分析者可以選擇 \(x\) 作為每日平方回報、絕對回報、由日內回報構成的已實現方差指標,或預測起點時可用的其他變數作為預測變數。結果 \(y\) 可以是未來每週方差、每月宏觀經濟公布值,或其他低頻目標。目標的定義會決定係數的意思。已實現方差代理指標的模型不會自動成為潛在即時方差、期權引伸方差或價格回報的模型。
MIDAS是一種回歸框架,並非通用估計量。反應變數可以按水平值、對數或連結函數建模,估計結果取決於所選權重類別和誤差假設。若沒有對預測加上限制或轉換目標,非負方差代理指標的線性回歸可能產生負的擬合值。模型較方便,不代表可以略過檢查目標的取值範圍和單位。
權重函數以彈性換取穩定性
不受限制的分布滯後回歸會為\(K\)個每日輸入各自估計一個係數。如果相對於每週目標觀察數目而言,\(K\)很大,估計值可能噪音較多而且高度相關。MIDAS則以低維函數定義滯後係數。例如,指數Almon形式可寫成\(w_j(\theta)=\frac{\exp(\theta_1j+\theta_2j^2)}{\sum_{\ell=1}^{K}\exp(\theta_1\ell+\theta_2\ell^2)}\)。正規化Beta多項式形式亦很常見。
這些形式可以讓近期交易時段的權重較大、逐步減少權重,或相對提高滯後窗口中段的權重。參數描述所選的平滑曲線,並非毫無條件地表示每一天的重要性。即使數據支持短暫反應,所選函數若強制加入較長的平滑尾部,擬合係數便會受到該限制。相反,估計過多自由的每日係數,也可能只是在擬合噪音而非穩定動態。
權重限制屬於模型假設。非負且正規化的權重可以令方差預測較容易解讀為加權平均,但會排除正負滯後效應互相抵銷的情況。彈性較高的形式可以容許凸起或斜率轉變,但形狀參數過多可能難以識別。應比較少數合理形式、列明可用滯後範圍,並檢查改變權重類別會否令預測大幅變動。
沒有適用於所有情況的\(K\)。較長窗口可能捕捉持續資訊,但會增加參數或強制較長的形狀;較短窗口則可能錯過較慢的動態。應使用估計期內可得的資訊選擇滯後數目,並避免用未來評估目標作驗證。樣本內擬合良好,並不足以證明滯後窗口捕捉到可重複的訊號。

預測起點要配合每項數據的可用時間
頻率標籤不足以確立有效的預測設計。假設目標是未來五個交易時段的方差,預測在星期五收市後發出。預測變數可以包括截至星期五收市的每日觀察值,但不能使用由下週回報計算的已實現方差統計。如果目標是已公布的每週或每月統計,公布時間可能晚於它所描述的期間。回測必須使用當時實際可取得的數值,而非其後修訂或公布的數值。
估計模型前先寫下預測起點表:預測發出的時間、每項預測變數容許使用的最晚時間戳、目標期間,以及目標何時可以觀察。就金融回報而言,說明收市至收市回報是否包括隔夜時段、哪個市場時段界定一天,以及假期或缺少的圖表棒如何改變每日滯後數目。五個交易時段和七個曆日是不同時段。
公布日程會形成不整齊的邊界。某個日期,一項預測變數可能已有最新的每日數值,另一項每月序列卻尚未公布。如果模型把上一個已公布的每月數值視為預測起點時已知的舊資訊,沿用該值可能合理。用日後公布的資料填補尚未發布的觀察則不合理。歷史修訂會帶來較隱蔽的前視問題:目前的數據庫可能含有實時預測者當時無法看到的修訂版宏觀序列。
不同步的市場還有另一個對齊問題。每日股票收市價和每日加密資產收市價可能代表不同的UTC時段;日內波幅估計也可能包括預測時間之後才結束的圖表棒。時區轉換、夏令時間變化、交易場所休市和圖表棒的建立方法,全都是資訊集合的一部分。不要假設日期相同的行具有相同資訊截止時間,應說明處理方法。
假設例子:把每日輸入轉成每週預測
假設目標是下週的已實現方差,並在星期五收市時發出預測。模型使用剛結束一週的五個每日已實現方差輸入。由最近至最舊的估計權重為\(0.40, 0.25, 0.16, 0.11, 0.08\),總和為1。相應的每日輸入以回報平方為單位,分別是\(0.0004, 0.0001, 0.0009, 0.0004, 0.0001\)。
加權歷史值為\(0.40(0.0004)+0.25(0.0001)+0.16(0.0009)+0.11(0.0004)+0.08(0.0001)=0.000381\)。假設這個虛構的擬合模型截距為\(a=0.00012\),斜率為\(b=0.80\)。下週的方差預測是\(0.00012+0.80(0.000381)=0.0004248\)。如需用標準差作摘要,其平方根約為\(0.02061\),按所選目標定義相當於目標週的\(2.06\%\)。
這項計算展示每日預測變數如何對應到未來的每週目標;數值和擬合係數都是虛構的。它不表示任何列出的日子導致下週方差,也不表示資產很可能上升或下跌。近期交易時段的權重說明所指定的預測模型如何在樣本和限制條件下結合觀察值,並非因果反應估計。
例子亦帶出單位問題。每日和每週已實現方差都是回報方差,但涉及不同累積時段。斜率 \(b\)、截距和目標構造都是按該特定慣例估計;不能把每日輸入直接改稱每週方差。如果目標是每週方差的對數,模型輸出便是對數單位,而把條件對數平均值取指數,通常不等於方差的條件平均值。轉回水平值時,必須明確界定預測目標,並在適當情況下作反轉換修正。
估計方法取決於目標和滯後限制
權重向量固定時,回歸對截距和斜率是線性的。如果權重取決於未知的非線性參數\(\theta\),估計通常使用非線性最小二乘法或相關的似然方法。估計量會一併搜尋權重形狀參數和回歸係數,或按每種候選形狀剖面化消去線性係數。起始值、參數界限、收斂準則和局部最佳解的數目都可能重要;不應隱瞞未收斂或落在邊界的解。
如果 \(y\) 是非負波幅指標,普通線性規格可能產生負的擬合值,尤其在樣本外。可選方法包括限制水平預測為非負、使用正值連結函數,或對目標取對數。這些選擇會改變估計對象和預測解讀。對數目標模型預測對數方差的條件平均值,並不會自動得到方差的條件平均值;誤差分布和反轉換方式都重要。
抽樣不確定性亦受目標構造方式影響。由日內回報計算的每週已實現方差有測量誤差,而且可能受微觀結構噪音、抽樣間隔、跳躍和缺失觀察影響。如果每週目標窗口重疊,相鄰預測起點的誤差會共用底層回報。假設預測誤差獨立的標準誤和比較方法可能因此不適用。應採用配合預測時距及依存結構的推論方法,並報告目標的量度程序。
參數穩定性亦是問題。估計出的權重形狀是整個估計樣本的平均;如果市場結構改變,曲線可能無法充分描述任何當前狀態。擴展窗口和滾動窗口估計回答不同問題:前者使用較多歷史,但保留較舊的動態;後者適應較快,但觀察較少且估計噪音較大。預先訂明更新規則,並在按時間排序的評估中與固定基準比較。
MIDAS與GARCH-MIDAS相關,但並不相同
GARCH-MIDAS是另一類模型,會把變化緩慢、通常由低頻變數帶動的長期波幅成分,與遞歸演變的短期條件方差成分結合。兩個成分各有自己的參數化方式和假設。論文或軟件套件採用GARCH-MIDAS這個名稱時,應細看其方程:MIDAS權重可能控制長期成分,GARCH遞歸則處理短期衝擊。單看名稱無法知道目標、預測的是潛在還是已實現波幅,或模型如何確保正值。
早期金融MIDAS波幅研究在簡約預測框架中比較不同預測變數、頻率和滯後長度。其後的方法研究發展混合頻率回歸模型的估計及檢驗性質,包括與傳統時間彙總方法的比較。這些研究支持其運作原理,並不代表MIDAS必定勝過GARCH,或高頻預測變數必定改善預測。結果會受資產、樣本、目標、預測變數、時距和評估設計影響。
應按問題選模型。若要以每日歷史預測未來的已實現波幅指標,直接MIDAS回歸可以是合理候選。若要遞歸建模條件方差,應比較合適的GARCH規格。若把季度宏觀公布與每日金融目標結合,混合頻率回歸可能需要控制公布時可用的數據版本。名稱相近的模型可能回答不同問題,故比較表現前應先對齊預測起點、目標定義和資訊集合。
測量誤差和選擇可能掩蓋權重曲線的作用
高頻數據可以提供更細的時間資訊,但也可能增加測量噪音。過短的圖表棒包含買賣報價來回、價格離散、過時報價、不同步交易和數據源錯誤。把平方回報在愈來愈短的時段內相加,並不保證得到更好的已實現方差估計。應在查看預測表現前選定抽樣網格和清理規則,並測試合理替代方案的敏感度。
限制可學習內容的,是低頻結果數目,而非表面上很多的每日預測變數行數。十年每日輸入配對每週目標,在扣除缺失值和留出評估期之前,仍只有約五百個每週結果。平滑權重函數所需係數少於自由的每日滯後項,但若樣本短、預測變數高度持續,或候選滯後重複,其形狀仍可能難以識別。
嘗試多種高頻指標、滯後長度、權重形式、轉換、市場、預測時距和評估損失,然後只報告最佳結果,會產生選擇偏差。樣本內擬合尤其容易受影響,因為同一批目標同時引導參數和模型選擇。保存曾測試的模型類別、預先訂定主要指標,並使用較後的按時間排序留出樣本或考慮選擇過程的比較方法。如果在相同日期比較多項預測,應考慮依存關係和多重比較,不要把每項結果都當作獨立確認。
擬合出的權重曲線不是因果解釋。高頻輸入可能是新聞、流動性或市場活動的代理變數;未觀察因素可能同時推動預測變數和未來波幅。預測價值需要穩定的時間安排和樣本外證據。因果解讀則需要MIDAS滯後方程以外的獨立識別設計和假設。
預測本身不會帶來有利可圖的交易決策
波幅預測可以協助制定風險預算、對沖規模或情境範圍,但不會指出回報正負或持倉方向。預測每週標準差為\(2.06\%\),不代表保證的價格變動、最大虧損或期權引伸波幅報價。它是在擬合模型和樣本下,針對所選離散程度指標的預測;實際回報仍可遠高於或低於它。
研究策略時,應在測試前界定訊號時間、落盤時間、工具、曝險規則和退出方式。每個歷史預測起點只可用當時可用的資訊重新估計MIDAS參數。先以預先指定的基準和符合目標的損失函數評估預測,再另行模擬扣除差價、費用、資金費、借貸、市場衝擊和換手後的回報。方差預測的統計表現可以改善,但扣除成本後的回報未必提高。
報告目標及其抽樣程序、預測變數定義和單位、低頻和高頻、預測起點、滯後數目、權重函數及限制、估計窗口和更新時間表、缺失數據和數據版本的處理、損失函數、基準,以及按時間排序的測試日期。如果滯後形狀會大幅影響結果,亦應展示預測不確定性或敏感度。相關背景可參閱已實現波幅、波幅群聚和GARCH,以及預測準確度比較指南。
主要原始研究包括Ghysels、Santa-Clara和Valkanov的MIDAS波幅預測研究,Ghysels、Sinko和Valkanov的方法論回顧及延伸,以及Andreou、Ghysels和Kourtellos對混合頻率回歸模型的分析。實證結果只適用於相關研究的樣本和設計,不保證在當前市場或其他資產類別有相同表現。
常見問題
Q1MIDAS是否代表把所有數據平均到同一頻率?
不是。MIDAS回歸讓目標維持在所選頻率,並使用高頻預測變數的結構化加權滯後項。它毋須把所有序列插值到逐行相同的共同日曆。
Q2MIDAS回歸是否等同GARCH-MIDAS?
不是。MIDAS是混合頻率加權滯後框架。GARCH-MIDAS把MIDAS式的長期成分與短期GARCH方差遞歸結合。要識別目標和各項成分,應查看模型方程。
Q3MIDAS波幅預測改善後,可以直接當作交易訊號嗎?
不能單靠這點。波幅預測描述所選的離散程度指標。策略另需明確設定方向或風險規則、切合實際的執行成本,以及按時間排序的成本後評估。
資料來源與延伸閱讀
回報問題
我們會準備一封包含本文連結的電郵。寄出後,Mark 才會收到你的回報
快速檢查
讀完指南後,用 3 道題檢查一下
問題 01
MIDAS權重函數的主要作用是甚麼?
選擇答案即可查看解釋