Skip to content
所有期權指南
預測模型比較約14分鐘

Model Confidence Set(MCS):比較預測模型,而不強行選出勝者

了解 Model Confidence Set 如何透過序貫檢定及處理相依資料的 bootstrap,保留現有證據無法區分的預測模型。

本指南內容Model Confidence Set 回答甚麼問題?

簡短摘要

Model Confidence Set(MCS)比較一組預先定義的預測程序,並回傳在所選損失函數下尚未被證明較差的候選模型。若樣本未能區分它們,可能會保留多個模型;結果取決於候選集合、預測設計、損失函數及推論程序。

Model Confidence Set 回答甚麼問題?

假設有多種程序預測下一個交易日的波幅。它們的誤差不同,但樣本可能太短或雜訊太大,無法判斷哪種程序的預期損失最低。選擇平均損失最低的程序,會強行選出勝者,即使差距可能只是抽樣變異。MCS 提供集合式答案:在指定的表現準則下,哪些候選仍與「最佳」這個判斷在統計上相容?

MCS 由候選集合 \(\mathcal M_0\)、損失或其他準則,以及信心水平開始。它會反覆檢定仍在考慮的候選是否具備相同預測能力。若檢定拒絕,剔除規則會移除相對較弱的候選,再在較小集合上繼續檢定。剩餘候選構成 MCS。Hansen、Lunde 和 Nason 提出此程序,作為指定候選集合中最佳模型的信賴集合;這類似於資料不夠精確時,參數信賴區間可包含多個數值(2011年論文)。

「最佳」只在這次比較範圍內成立:相對於納入的候選、目標、預測期、每個預測起點當時可用的資料,以及評分準則。MCS 不要求某個候選是真實的資料生成過程,也可以保留多個預期表現同樣最佳的候選。它不是「保留模型正確」的後驗機率。

預先固定候選集合及預測問題

計算損失前,先定義 \(\mathcal M_0\)。候選可以是估計模型連同其估計及預測更新規則,也可以是沒有用統計模型描述的預測程序。例如,如果波幅分佈、滾動視窗、參數更新及預測期都可能改變,只說「GARCH」並未完整指定候選;每種設定都可能是不同候選。

每個候選都應使用當時可用的資料,在相同預測起點及期間預測同一目標。若一個模型預測一日方差,另一個預測五日波幅,原始損失便不能直接公平比較。使用共同評估樣本,明確對齊缺漏觀測,並記錄資料版本、初始估計視窗、遞迴或滾動安排,以及如何處理修訂後輸入。時間上重疊的預測可能令相鄰起點的損失共用觀測值。

在查看結果前選定準則。平方誤差、絕對誤差或針對決策的損失,可能對點預測給出不同排序。方差預測可能需要適合含雜訊 proxy 的波幅損失;分位數預測則需要 quantile score,而非均方誤差。某一損失下表現良好的 MCS,不代表另一種損失下也好。若在查看同一批評估結果後縮窄候選名單,正式集合便以未有披露的篩選為條件,不能代表完整搜尋。

將共同預測轉成配對損失差

令 \(y_{t+h}\) 為預測起點 \(t\) 對應的實際目標,\(\hat y_{i,t+h|t}\) 為候選 \(i\) 的預測。對預先選定的損失函數 \(L\),在每個共同起點計算每個候選的損失:

\[ L_{i,t}=L(y_{t+h},\hat y_{i,t+h|t}) \]

假設損失越低越好。候選 \(i\) 和 \(j\) 的配對差定義如下:

\[ d_{ij,t}=L_{i,t}-L_{j,t}, \qquad \bar d_{ij}=\frac{1}{P}\sum_{t=1}^{P}d_{ij,t} \]

其中 \(P\) 是共同預測起點的數目。按照此符號慣例,正的 \(\bar d_{ij}\) 表示樣本中候選 \(i\) 的平均損失高於 \(j\);負值則有利於 \(i\)。配對很重要,因為兩個候選面對同一組實際結果。共同市場衝擊可能同時推高兩者損失,而差值可抽出相對表現。

目前集合 \(\mathcal M\) 的預測能力相等零假設可寫成:

\[ H_{0,\mathcal M}:\quad \mu_{ij}=E[d_{ij,t}]=0 \quad \text{對所有 } i,j\in\mathcal M \]

這是對目前集合的聯合陳述,並非一組互不相關、逐一查看的配對檢定。原始 MCS 框架透過聯合等價檢定及剔除規則處理模型搜尋。它並不要求預測在每個日期完全一樣。

檢定目前集合並界定剔除規則

MCS 程序交替執行集合層級檢定和剔除步驟。由 \(\mathcal M=\mathcal M_0\) 開始,在選定的 \(\alpha\) 水平檢定預測能力是否相等。若未能拒絕零假設,便停止並回報目前集合。若拒絕,則按預先指定的規則移除一個候選,再於較小集合重做檢定。在程序假設成立下,剩餘集合為 \((1-\alpha)\) MCS。

論文討論兩個常見統計量。Range 統計量尋找最大的標準化配對損失差:

\[ T_{R,\mathcal M}=\max_{i,j\in\mathcal M}|t_{ij}|, \qquad t_{ij}=\frac{\bar d_{ij}}{\widehat{\mathrm{se}}(\bar d_{ij})} \]

配套的剔除規則會移除相對另一候選有最大標準化劣勢的候選。第二個統計量將每個候選與目前集合的平均表現比較:

\[ T_{\max,\mathcal M}=\max_{i\in\mathcal M}t_{i\cdot}, \qquad d_{i\cdot,t}=\frac{1}{|\mathcal M|}\sum_{j\in\mathcal M}d_{ij,t} \]

此處 \(t_{i\cdot}\) 將 \(d_{i\cdot,t}\) 的平均值標準化;配套規則會移除相對集合平均值有最大標準化超額損失的候選。統計量與剔除規則是一對,應一併選擇及回報,不要在看到哪一組得出較小集合後才混用。MCS 論文解釋拒絕檢定為何須與識別待移除候選的規則一致(Hansen、Lunde 和 Nason)。

在 bootstrap 中保留時間相依性

最大統計量的分佈取決於各候選損失差的聯合變動。把每個模型或日期當成獨立觀測,可能破壞兩類相依性:相鄰損失可能有序列關係,而同一日期不同候選的損失是配對資料。因此,MCS bootstrap 在近似集合統計量的零分佈時,必須保留相關的聯合時間序列結構。

其中一種做法是對候選損失或差值向量中對齊的時間區塊重新抽樣。Stationary bootstrap 的區塊長度是隨機的,重新抽樣後的序列可從隨機選取的日期重新開始。Politis 和 Romano 為弱相依的平穩觀測提出此方法(1994年論文)。MCS 作者介紹 block bootstrap 實作,並在附錄提及 stationary bootstrap 作為替代方案。若將各模型損失序列分開抽樣,便會破壞同日配對,可能改變比較結果。

平均區塊長度、bootstrap 變體、在能力相等零假設下的中心化方式、重複次數及預測期間都會影響不確定性估計。較長的重疊預測期間通常會延長損失差的相依性,但沒有一個區塊長度適用所有目標及樣本。請說明設計,並檢視合理改變相依設定後結論是否改變。Bootstrap 輸出是在其假設下的近似,不能修正前視偏差、重複使用 holdout、非平穩評分或候選集合不完整。

計算四個模型的假設比較

假設 A、B、C、D 四個程序在 120 個共同每日起點預測同一波幅目標。以平方百分點作示例單位,平均平方誤差損失分別為 1.20、1.23、1.45、1.90。平均值將 A 排在首位、D 排在末位,但排序本身沒有反映抽樣不確定性。

A 相對 B 的平均配對損失差是 \(1.20-1.23=-0.03\)。若考慮相依性的標準誤是 \(0.04\),配對統計量便是 \(-0.03/0.04=-0.75\)。單一差值不足以顯示 A 和 B 有明確的統計差異。MCS 不會只看這一對,而會以集合統計量考慮四個候選的聯合差異。

作為示例,假設對 120 個起點的完整損失序列執行 block-bootstrap MCS,使用 \(T_R\)、\(\alpha=0.05\) 和一致的最差候選剔除規則。假設完整集合的 p-value 為 0.018,D 被移除後,\(\{A,B,C\}\) 的 p-value 是 0.11。由於 0.11 大於 0.05,程序停止,並將 \(\{A,B,C\}\) 列為假設性的 95% MCS。C 的平均損失雖高於 A,仍會留下:這次假設的聯合檢定未能證明 C 較差。

以上 p-value 是為示範步驟而編造,不能從四個平均損失或 A–B 差值推算。真實結果需要每個起點的完整損失序列、候選預測、bootstrap 設計及剔除次序。保存這些輸入,並報告完整次序,讓讀者看見每次拒絕時移除了哪個候選。 <!-- learn:illustration -->

多條預測路徑在柔和色帶內彼此接近,較遠的路徑逐漸淡去,最後保留一個集合而非單一勝者
保留多個統計上無法區分候選模型的預測比較概念圖;並非實際觀測的預測、實證結果或交易訊號。

謹慎解讀剩餘集合

在 95% 信心水平下,按程序的正則條件及檢定假設,MCS 的設計目標是在至少所述的漸近涵蓋率下,包含指定集合中最好的候選。這不表示每個保留模型有 95% 機會是最佳。信心陳述指程序在重複抽樣下的涵蓋率,不是模型名稱的後驗分佈。

未能拒絕預測能力相等,不代表候選的預期損失完全相同。若評估期短、損失差波動大,或多個候選非常接近,檢定能力可能有限。保留集合很大,可能誠實反映資料無法區分各方案。集合內亦可能全是絕對表現欠佳的模型,因為 MCS 比較的是候選彼此之間,而非某個必須達到的外部標準。

集合範圍受限於 \(\mathcal M_0\) 中的候選。若漏掉真正更好的預測程序,MCS 無法找出它。若在查看同一評估期後先行移除某模型,名義涵蓋率不會計入這次未有披露的搜尋。請交代候選的建立及篩選歷史。若多個候選共有最低預期損失,保留多個符合方法設計,並非無法選擇。

區分 MCS、配對檢定及基準檢定

Diebold–Mariano 檢定着重兩種預測程序之間的配對損失差。MCS 會反覆檢定整個集合,並回報通過聯合剔除程序的候選。執行多個 DM 檢定後保留不顯著的配對,並不自動等同 MCS;聯合 bootstrap 及一致的剔除規則很重要。

Clark–West 檢定針對較窄的平方誤差比較:一個模型包含受限制的基準模型,而估計雜訊影響原始差值。MCS 不要求候選模型有巢狀關係,亦可使用由使用者指定的損失函數,但仍需要共同的預測設計。

White 的 Reality Check 及 Hansen 的 Superior Predictive Ability 檢定,會問搜尋過的候選家族中是否至少有一個成員勝過指定基準。MCS 不依賴基準,而是描述相對較優的候選集合。這些程序都要如實交代搜尋及相依性,但檢定不同的零假設。參閱 Reality Check 及 SPA 指南,以及 White (2000) 和 Hansen (2005) 的原始論文。

回報設計,並把預測排名與交易價值分開

可重現的 MCS 報告應列出每項候選程序、共同目標及期間、預測起點和資料規則、估計安排、評估日期、缺漏資料處理、損失公式及較佳方向。亦要交代顯著性水平、檢定統計量與剔除規則、bootstrap 類型、區塊長度、中心化方法、重複次數、每一步的 p-value 及最終成員。平均損失可作背景,但不應以排名表取代聯合推論。

評估波幅時,說明觀察 proxy 的構造方式,以及它是否有雜訊或經過修訂。多步預測要披露目標視窗是否重疊及處理相依性的方法。若合理改變損失、樣本期或 bootstrap 設定會影響成員,應展示敏感度。只提供一個很小的 p-value,卻沒有說明被剔除候選和程序細節,並不足以重現結果。

MCS 按一項準則排列預測程序。它不會證明因果結構、不會識別資料生成模型,也不會證明剩餘預測可以帶來獲利交易。把預測轉成持倉,還涉及門檻、倉位大小、換手、執行時間、差價、費用、滑點、融資、借貸和風險限制。應在合適的後續資料上另行評估固定的決策程序,並分開回報扣除成本後的交易結果。若使用不完美 proxy 評估波幅,可參閱 QLIKE 與平方誤差損失指南。

常見問題

Q1MCS 會選出唯一的最佳模型嗎?

不一定。若資料能區分某一候選,可能只剩一個;若樣本未能證明誰較差,則可能保留多個。要選一個模型投入使用,須另設決策規則。

Q2MCS 中的模型有 95% 機會正確嗎?

不是。信心水平描述在方法假設下,指定候選家族的最佳候選在重複抽樣中的涵蓋率;它不是模型為真的後驗機率。

Q3MCS 可否用於波幅預測以外的比較?

可以。只要定義有意義的共同準則及合適抽樣設計,就可比較預測、計量模型或其他候選。結果仍取決於候選集合和所選損失。

Q4MCS 會自動計及我試過的所有模型嗎?

只有在實際搜尋反映於候選家族及評估程序時才會。未有記錄的篩選或重複使用評估資料,不會因為事後執行 MCS 而得到修正。

資料來源與延伸閱讀

回報問題

我們會準備一封包含本文連結的電郵。寄出後,Mark 才會收到你的回報

快速檢查

讀完指南後,用 3 道題檢查一下

問題 1 / 3

問題 01

Model Confidence Set 回報甚麼?

選擇答案即可查看解釋

期權術語表

清楚解釋從認購、認沽和期權鏈到 IV、希臘值、未平倉合約與最大痛點等核心期權術語

瀏覽期權術語表