Skip to content
所有選擇權指南
預測模型比較約14分鐘

Model Confidence Set(MCS):比較預測模型,不強迫選出贏家

了解 Model Confidence Set 如何透過序列檢定與處理相依資料的 bootstrap,保留現有證據無法區分的預測模型。

本指南內容Model Confidence Set 回答什麼問題?

簡短摘要

Model Confidence Set(MCS)比較一組預先定義的預測程序,並回傳在所選損失函數下尚未被證明較差的候選模型。若樣本無法區分它們,可能會保留多個模型;結果取決於候選集合、預測設計、損失函數與推論程序。

Model Confidence Set 回答什麼問題?

假設有多種程序預測下一個交易日的波動度。它們的誤差不同,但樣本可能太短或雜訊太大,無法判斷哪種程序的預期損失最低。選擇平均損失最低的程序會強行指定贏家,即使差距可能只是抽樣變異。MCS 提供集合式答案:在指定的表現標準下,哪些候選仍與「最佳」的判斷在統計上相容?

MCS 從候選集合 \(\mathcal M_0\)、損失或其他標準,以及信心水準開始。它會重複檢定仍在考慮中的候選是否具有相同預測能力。若檢定拒絕,剔除規則會移除相對較弱的候選,再於縮小後的集合繼續檢定。留下的候選構成 MCS。Hansen、Lunde 和 Nason 提出這項程序,作為指定候選集合中最佳模型的信賴集合;這類似資料不精確時,參數信賴區間可以包含多個數值(2011年論文)。

「最佳」只在這次比較範圍內成立:相對於納入的候選、目標、預測期、各預測起點可用的資訊,以及評分標準。MCS 不要求任何候選就是真實的資料生成過程,也可以保留多個預期表現同樣最佳的候選。它不是「保留模型正確」的後驗機率。

先固定候選集合與預測問題

計算損失前,先定義 \(\mathcal M_0\)。候選可以是估計模型連同其估計與預測更新規則,也可以是不以統計模型描述的預測程序。例如,若波動度分配、滾動視窗、參數更新和預測期都可能不同,只說「GARCH」並未完整定義候選;每項選擇都可能形成另一個候選。

每個候選都應使用當時可用的資訊,在相同預測起點和期間預測同一目標。如果一個模型預測一天的變異數,另一個預測五天波動度,原始損失便不能公平地直接比較。使用共同評估樣本,明確對齊缺漏觀測,並記錄資料版本、初始估計視窗、遞迴或滾動安排,以及修訂輸入的處理方式。時間上重疊的預測可能讓相鄰起點的損失共用觀測值。

在看結果前選擇標準。平方誤差、絕對誤差或特定決策的損失,可能對點預測給出不同排序。變異數預測可能需要適合含雜訊 proxy 的波動度損失;分位數預測則需要 quantile score,而不是均方誤差。一種損失下的良好 MCS,不保證另一種損失下也良好。如果在查看同一批評估結果後縮小候選清單,正式集合就會以未揭露的篩選為條件,無法代表完整搜尋。

將共同預測轉為配對損失差

令 \(y_{t+h}\) 為預測起點 \(t\) 對應的實際目標,\(\hat y_{i,t+h|t}\) 為候選 \(i\) 的預測。對預先選定的損失函數 \(L\),在每個共同起點計算各候選的損失:

\[ L_{i,t}=L(y_{t+h},\hat y_{i,t+h|t}) \]

假設損失越低越好。候選 \(i\) 和 \(j\) 的配對差定義如下:

\[ d_{ij,t}=L_{i,t}-L_{j,t}, \qquad \bar d_{ij}=\frac{1}{P}\sum_{t=1}^{P}d_{ij,t} \]

其中 \(P\) 是共同預測起點數。依照這個符號慣例,正的 \(\bar d_{ij}\) 表示樣本中候選 \(i\) 的平均損失高於 \(j\);負值則有利於 \(i\)。配對很重要,因為兩個候選面對的是相同實際結果。共同市場衝擊可能同時推高兩者損失,而差值可以隔離相對表現。

目前集合 \(\mathcal M\) 的預測能力相等虛無假設可寫成:

\[ H_{0,\mathcal M}:\quad \mu_{ij}=E[d_{ij,t}]=0 \quad \text{對所有 } i,j\in\mathcal M \]

這是對目前集合的聯合陳述,不是一組逐一檢視、彼此無關的配對檢定。原始 MCS 架構使用聯合等價檢定與剔除規則來處理模型間的搜尋。它並不要求預測在每個日期完全相同。

檢定目前集合並定義剔除規則

MCS 程序交替執行集合層級檢定與剔除步驟。從 \(\mathcal M=\mathcal M_0\) 開始,在選定的 \(\alpha\) 水準檢定預測能力是否相等。若未拒絕虛無假設,就停止並回報目前集合。若拒絕,則依照事先指定的規則移除一個候選,再於較小集合重做檢定。程序假設成立時,留下的集合就是 \((1-\alpha)\) MCS。

論文討論兩個常見統計量。Range 統計量尋找最大的標準化配對損失差:

\[ T_{R,\mathcal M}=\max_{i,j\in\mathcal M}|t_{ij}|, \qquad t_{ij}=\frac{\bar d_{ij}}{\widehat{\mathrm{se}}(\bar d_{ij})} \]

相應的剔除規則會移除相對其他候選有最大標準化劣勢的候選。另一個統計量將每個候選與目前集合的平均表現比較:

\[ T_{\max,\mathcal M}=\max_{i\in\mathcal M}t_{i\cdot}, \qquad d_{i\cdot,t}=\frac{1}{|\mathcal M|}\sum_{j\in\mathcal M}d_{ij,t} \]

這裡 \(t_{i\cdot}\) 將 \(d_{i\cdot,t}\) 的平均值標準化;相應規則會移除相對集合平均值有最大標準化超額損失的候選。統計量和剔除規則是一對,應一起選擇和回報,不要在看到哪一種能產生較小集合後才混用。MCS 論文說明拒絕檢定為何須與識別待移除候選的規則一致(Hansen、Lunde 和 Nason)。

在 bootstrap 中保留時間相依性

最大統計量的分配取決於候選損失差的共同變動。把每個模型或日期當成獨立觀測,可能破壞兩種相依性:連續損失可能有序列關係,而同一日期不同候選的損失是配對的。因此,MCS bootstrap 必須在近似集合統計量的虛無分配時,保留相關的共同時間序列結構。

一種方法是對候選損失或差值向量中對齊的時間區塊重新抽樣。Stationary bootstrap 的區塊長度是隨機的,重新抽樣的序列可能從隨機選出的日期重新開始。Politis 和 Romano 為弱相依的平穩觀測提出此方法(1994年論文)。MCS 作者描述 block bootstrap 的實作,並將 stationary bootstrap 列為替代方法。若各模型的損失序列分開抽樣,同日配對會被破壞,並可能改變比較結果。

平均區塊長度、bootstrap 變體、在能力相等虛無假設下的中心化方式、重複次數和預測期都會影響不確定性估計。較長且重疊的預測期通常會延長損失差的相依性,但不存在適用所有目標和樣本的通用區塊長度。說明設計,並檢查合理改變相依設定後結論是否改變。Bootstrap 輸出是在其假設下的近似,不能修正前視偏差、重複使用 holdout、非平穩評分或不完整的候選集合。

計算四個模型的假設比較

假設 A、B、C、D 四個程序在 120 個共同日頻起點預測同一波動度目標。平均平方誤差損失以平方百分點作為示例單位,依序為 1.20、1.23、1.45、1.90。這些平均值將 A 排在第一、D 排在最後,但排名本身無法說明抽樣不確定性。

A 相對 B 的平均配對損失差為 \(1.20-1.23=-0.03\)。若考慮相依性的標準誤是 \(0.04\),配對統計量便是 \(-0.03/0.04=-0.75\)。單一差值不足以顯示 A 與 B 有明確的統計差異。MCS 不會停在這裡:集合統計量會考慮四個候選間的共同差異。

作為示例,假設對完整的 120 起點損失序列執行 block-bootstrap MCS,採用 \(T_R\)、\(\alpha=0.05\) 及一致的最差候選剔除規則。假設完整集合的 p-value 為 0.018,D 被剔除後,\(\{A,B,C\}\) 的 p-value 是 0.11。由於 0.11 大於 0.05,程序停止,並將 \(\{A,B,C\}\) 列為假設的 95% MCS。C 的平均損失雖高於 A,仍然保留:這個假設的聯合檢定未能證明 C 較差。

這些 p-value 是為了示範步驟而編造,不能從四個平均損失或 A–B 差值還原。實際結果需要每個起點的完整損失序列、候選預測、bootstrap 設計及剔除次序。請保存這些輸入,並回報完整次序,讓讀者看見每次拒絕時移除了哪個候選。 <!-- learn:illustration -->

多條預測路徑在柔和色帶內彼此接近,較遠的路徑逐漸淡去,最後保留一個集合而非單一勝者
保留多個統計上無法區分候選模型的預測比較概念圖;不是實際觀測的預測、實證結果或交易訊號。

謹慎解讀留下的集合

在 95% 信心水準下,依照正則條件及檢定假設,MCS 的設計是以至少所述的漸近涵蓋率,包含指定集合中的最佳候選。這不代表每個留下的模型有 95% 機會是最佳。信心陳述指程序在重複抽樣下的涵蓋率,而非模型名稱的後驗分配。

未能拒絕預測能力相等,不代表候選的預期損失完全相同。若評估期間短、損失差波動大,或有多個候選非常接近,檢定力可能不足。留下大型集合,可能誠實反映資料無法區分各方案。集合內的模型也可能全部在絕對層面表現欠佳,因為 MCS 是彼此比較候選,而不是跟必須達到的外部標準比較。

集合範圍受限於 \(\mathcal M_0\) 中納入的候選。若漏掉真正更佳的預測程序,MCS 無法找出它。若在查看同一評估期間後先行移除某模型,名義涵蓋率不會計入這次未有記錄的搜尋。請說明候選如何建立及篩選。若多個候選共有最低預期損失,保留多個符合方法設計,並非未能作出選擇。

區分 MCS、配對檢定和基準檢定

Diebold–Mariano 檢定聚焦兩個預測程序之間的配對損失差。MCS 會反覆檢定一個集合,並回報通過聯合剔除程序的候選。執行多個 DM 檢定後保留不顯著的配對,不會自動等同 MCS;共同 bootstrap 和一致的剔除規則很重要。

Clark–West 檢定適用於範圍較窄的平方誤差比較:一個模型包含受限制的基準模型,而估計雜訊會影響原始差值。MCS 不要求候選模型有巢狀關係,也可使用使用者指定的損失函數,但仍需要共同的預測設計。

White 的 Reality Check 和 Hansen 的 Superior Predictive Ability 檢定,會問被搜尋的候選家族中是否至少有一個成員勝過指定基準。MCS 不依賴基準,而是描述相對較優候選的集合。所有程序都要準確交代搜尋和相依性,但檢定的虛無假設不同。參閱 Reality Check 和 SPA 指南,以及 White (2000) 和 Hansen (2005) 的原始論文。

回報設計,並將預測排名與交易價值分開

可重現的 MCS 報告應列出每項候選程序、共同目標及預測期、預測起點與資料規則、估計時程、評估日期、缺漏資料處理方式、損失公式及較佳方向。亦應交代顯著性水準、檢定統計量與剔除規則、bootstrap 類型、區塊長度、中心化方法、重複次數、每一步的 p-value 和最終成員。平均損失可以提供背景,但不應以排名表取代聯合推論。

評估波動度時,說明觀察 proxy 的建立方式,以及它是否含雜訊或經過修訂。多步預測要揭露目標視窗的重疊和相依性處理方法。如果損失、樣本期間或 bootstrap 設定的合理變動會影響集合成員,應呈現敏感度。只提供一個很小的 p-value,卻沒有交代剔除候選與程序細節,並不足以重現結果。

MCS 按單一準則排列預測程序。它不會證明因果結構、不會識別資料生成模型,也不會證明留下的預測能帶來獲利交易。將預測轉成部位,還涉及門檻、部位大小、周轉、執行時點、價差、費用、滑價、融資、借貸及風險限制。應在合適的後續資料上另外評估固定的決策規則,並分開回報扣除成本後的交易結果。使用不完美 proxy 評估波動度時,可參閱 QLIKE 與平方誤差損失指南。

常見問題

Q1MCS 會選出唯一的最佳模型嗎?

不一定。若資料能區分某候選,可能只剩一個;若樣本無法證明哪個較差,也可能留下多個。要挑選一個部署,須另訂決策規則。

Q2MCS 中的模型有 95% 機率正確嗎?

沒有。信心水準描述在方法假設下,指定候選家族最佳候選於重複抽樣中的涵蓋率;它不是模型為真的後驗機率。

Q3MCS 可用於波動度預測以外的情境嗎?

可以。只要定義有意義的共同準則和合適的抽樣設計,就可比較預測、計量模型或其他候選。結果仍取決於所選候選集合及損失函數。

Q4MCS 會自動計入我試過的所有模型嗎?

只有在實際搜尋反映於候選家族及評估程序時才會。未記錄的篩選或重複使用評估資料,不會因為事後執行 MCS 而得到修正。

資料來源與延伸閱讀

回報問題

我們會準備一封包含本文連結的電子郵件。寄出後,Mark 才會收到你的回報

快速檢查

讀完指南後,用 3 道題檢查一下

問題 1 / 3

問題 01

Model Confidence Set 回報甚麼?

選擇答案即可查看解釋

期權術語表

清楚解釋從買權、賣權和選擇權鏈到 IV、希臘字母、未平倉量與最大痛點等核心選擇權術語

瀏覽期權術語表