Skip to content
所有期權指南
預測檢驗13 分鐘閱讀

Giacomini–White 檢驗:條件預測準確性

了解 Giacomini–White 檢驗如何判斷預測準確性會否隨已知條件改變、如何選擇檢驗函數,以及結果可以說明甚麼

本指南內容平均準確性與條件準確性回答不同問題

簡短摘要

Giacomini–White(GW)框架探討的是:預測時已知的資訊會否與兩種預測的相對損失有關。它可能揭示平均分數掩蓋的差異,但結論取決於預測方法、評估期間、損失函數,以及事先選定的條件變數

平均準確性與條件準確性回答不同問題

假設在測試樣本期間,預測 A 的平均損失低於預測 B。這個平均值可能掩蓋一個有用的模式:A 在市場平靜時表現較好,B 則在波動較高時表現較佳。如果問題是哪種預測的平均表現較好,無條件比較便合適;如果問題是預測時已知的資訊能否幫助判斷哪種預測之後會表現較好,評估對象就是條件預測能力。

Giacomini 和 White 提出這個框架,在指定損失函數和資訊集的情況下比較預測方法。只要損失函數適合預測任務,便可用於點預測、區間預測、機率預測或密度預測。方法亦會考慮用來產生每項預測的估計程序。因此,滾動視窗、固定訓練樣本或加權規則,都是受評估方法的一部分,而不是可以在看到結果後隨意更改的小細節 (Giacomini 和 White, 2006)。

這個區分與結構轉變檢驗有關,但兩者並不相同。條件檢驗問的是相對預測損失會否與所選資訊有系統地相關;轉變檢驗則問參數或關係會否在未知或指定的時間點改變。[Diebold–Mariano 指南](/zh-HK/learn/diebold-mariano-forecast-accuracy-test-explained)介紹無條件平均損失比較;條件問題則需要明確說明用哪些資訊設定條件。

先對齊預測、結果和資訊

令 \(Y_{t+1}\) 為預測起點 \(t\) 之後觀察到的目標。預測 \(\hat y^A_{t+1}\) 和 \(\hat y^B_{t+1}\) 必須針對相同目標、預測期、單位和資訊截止時間。若損失函數 \(L\) 的數值愈低愈好,損失差定義如下:

dₜ₊₁ = L(Yₜ₊₁, ŷA,ₜ₊₁) − L(Yₜ₊₁, ŷB,ₜ₊₁)

按照這個正負號約定,正值代表 A 的損失較大,故該起點上 B 較好;負值則有利 A。每個預測起點記錄一列,並用同一個實際結果為兩項預測評分。保留預測在當時可用的版本,以及相應的資料版本和模型版本。不要以後來修訂的輸入或事後取得的資訊重建歷史預測。

條件變數也必須在預測起點已知。例子包括滯後波動率估計、預先公布的事件指標、滯後損失差,或只用過往觀察值計算的市場狀態變數。若某個變數在 \(t\) 之後才量度,便不能在沒有前視偏差的情況下,用它解釋哪項預測在 \(t+1\) 會較好。

評分指標要配合目標。平方誤差可用於條件平均數預測,但不會自動適用於波動率、分位數或密度預測。如果一個模型預測方差,另一個預測標準差,應先把兩者轉成對同一數值的預測。檢驗不能修正評分問題本身不一致的情況。

評估波動率預測時,兩者都應採用相同的實現方差定義和取樣間隔。如果一項預測涵蓋日內價格,另一項亦把隔夜回報納入,損失差可能反映目標不同,而非預測能力不同。預先決定如何處理市場休市期間的價格變動、取樣頻率、缺失觀察值和實現值指標,並一致套用。如果實現值代理指標有噪音,量度誤差會影響兩者的損失分數,也應納入解讀。

說明條件虛無假設並選擇檢驗函數

令 \(\mathcal{G}_t\) 代表用來設定比較條件的資訊。理想化的虛無假設為

H₀: E[dₜ₊₁ | 𝒢ₜ] = 0

這表示在指定資訊條件下,預期損失差為零。單步 GW 檢驗利用預先選定的檢驗函數向量 \(h_t\),把條件命題轉化為一組矩條件;每個函數都必須能以 \(t\) 時點可取得的資訊計算:

H₀,ₕ: E[hₜ dₜ₊₁] = 0

\(h_t\) 中的常數項包含平均損失差的矩條件。其他項目可以代表市場狀態、滯後相對損失,或在查看結果前選定的非線性轉換。例如,令 \(h_t=(1,S_t)'\),其中 \(S_t\) 是在 \(t\) 已知的二元高波動指標;這樣會同時檢驗常數矩條件,以及損失差會否與該狀態有關。

有限個檢驗函數只會檢驗所選的矩條件。拒絕虛無假設代表在檢驗假設下,至少一個所選矩條件與零不一致;這不會找出普遍最佳的模型,也不能證明所有可能的狀態變數都重要。未能拒絕亦不等於證明條件表現相同。只使用常數項的檢驗是無條件矩比較,而非廣泛搜尋所有可能條件。

在查看哪個模型勝出前,先選好損失函數、工具變數、轉換方式、樣本和預測期。看過結果後才增加許多狀態指標、門檻和滯後項,會產生另一個搜尋問題。條件檢驗本身不會修正這種選擇造成的影響。

固定建立每個狀態變數時所用的資訊時間。如果「高波動」代表全樣本波動率最高的 20%,未來觀察值便參與設定過去預測起點的門檻。應只用各起點當時可取得的資訊估計門檻,或採用該日期之前已公布的規則。對連續狀態變數,應預先界定單位、中心化和縮放方式。多個近似相同的指標可能令矩條件冗餘,並令協方差矩陣難以求逆,因此應使用能清楚解釋的最小集合。

建立 Wald 統計量並解讀參考分布

對 \(q\) 個檢驗函數,建立向量 \(g_{t+1}=h_t d_{t+1}\)。樣本平均數為

ḡ = (1/n) Σₜ gₜ₊₁

單步 GW 統計量具有 Wald 形式:

GW = n ḡ′ Ω̂⁻¹ ḡ

其中 \(\hat\Omega\) 估計矩向量的協方差矩陣。在虛無假設和原論文的正則條件下,此統計量漸近服從自由度為 \(q\) 的卡方參考分布。因此,檢驗函數數量會影響參考分布,也可能影響檢驗力。加入大量較弱或重複的工具變數,可能令協方差估計不穩定,卻沒有增加有用資訊。

在單步設定中,虛無假設意味著矩向量具有鞅差結構,因此原始檢驗可以使用樣本二階矩估計。對於其他預測期、結果重疊,或偏離該設定的情況,方差估計必須符合檢驗的假設和相依結構。請依照所選實作的設定,不要自動照搬其他檢驗的 HAC 頻寬。一般 HAC 協方差方法,包括 Newey 和 West(1987) 的估計量,是在確有需要時使用的工具,並非 GW 的通用頻寬規定。結果的可信度取決於背後的協方差估計與預測設計。

也要檢查能否根據所選矩條件估計 \(\hat\Omega\)。幾乎重複的檢驗函數、某一狀態中觀察值極少的指標,或過多的交互作用,都可能令矩陣奇異或不穩定。此時矩陣求逆可能因小幅資料修訂而大幅改變,扭曲檢驗統計量。每個函數都應有與某項條件或預測表現差異相關的理由;請報告函數數目及矩協方差。看過結果後才移除無用函數,是另一項選擇步驟,應予以披露。

p 值是在參考分布下反對所述矩限制的證據。它不是 A 或 B 為真實模型的機率,也不是交易規則獲利的機會。請報告統計量、自由度、p 值和實際檢驗的矩條件,讓讀者了解拒絕代表甚麼。

<!-- learn:illustration -->

三塊透明玻璃板上,藍色與琥珀色路徑的相對位置交替變化,表示預測表現可能隨條件改變
概念圖展示不同條件下預測相對表現的變化;並非實測市場數據、檢驗結果或交易訊號

兩種狀態的例子說明平均值可能掩蓋甚麼

考慮八個假設性的單步預測起點。令 \(S_t=0\) 代表平靜狀態,\(S_t=1\) 代表高波動狀態。假設損失差 \(d_{t+1}=L_A-L_B\) 在四個平靜起點依次為 −2、−2、−2、−2;在四個高波動起點則依次為 +2、+2、+2、+2。負差有利 A;正差有利 B。

八個起點的整體平均數為零,因此這個小例子沒有顯示無條件損失差。平靜狀態的平均數為 −2,高波動狀態則為 +2。相對排名會隨狀態反轉。使用 \(h_t=(1,S_t)'\) 的檢驗同時包含常數矩條件和能反映此模式的高波動矩條件。

這八個數值只是教學示例,不足以支持可靠的統計推論。真實資料的檢驗必須考慮預測如何估計、狀態變數是否事先固定、可用的預測起點數目,以及損失差矩條件如何隨時間改變。單靠圖表按狀態劃分,不能證明這種模式會持續。

將估計視窗視為方法的一部分

原始 GW 漸近理論會將最大估計視窗長度維持在有限值,同時增加樣本外預測數目,以保留預測估計的不確定性。滾動視窗和固定估計樣本符合這個核心設定。視窗長度和任何依據資料選擇視窗的規則,都是各預測方法的一部分,應預先設定並報告。

這在重新估計預測模型時尤其重要。忽略參數估計的比較,可能漏掉每種方法從過往資料學習所帶來的不確定性。在指定條件下,GW 可處理巢狀或非巢狀模型的預測,但不代表所有擴展視窗實作或估計量都適用。在原始單步框架中,常見的擴展視窗不符合有限視窗假設。如果設定不同,應採用針對實際預測建構方式推導的結果。

檢驗亦不會代你選擇合適視窗。短視窗可能較快適應近期環境,但使用的觀察較少;長視窗或擴展視窗可能令估計更穩定,卻保留已過時的關係。應以事先規劃的評估比較這些選項,並記錄視窗選擇程序。Giacomini 和 Rossi(2010)為不穩定環境下相對預測表現的時間路徑發展了另一類檢驗;時間路徑問題雖然相關,但所用統計量並非基本 GW 條件檢驗。

條件拒絕本身亦不會提供一套可在即時環境選出正確預測的交易規則。工具變數可能在評估資料中與損失差有關,卻不一定能產生穩定或可實行的切換規則。如果要用當下資訊選擇預測,應用過往觀察值定義該規則,再於之後一段未曾使用的預測起點上評估,並納入規則本身的估計和決策不確定性。

區分 GW、DM、巢狀模型檢驗與不穩定性檢驗

[Diebold–Mariano 檢驗](/zh-HK/learn/diebold-mariano-forecast-accuracy-test-explained)詢問兩種預測在評估樣本中的平均損失是否相同。GW 檢驗所選資訊會否與相對損失有關,並可將無條件比較納入為特別的矩限制。正如兩種狀態的例子所示,模型平均分數可能相同,但相對表現仍可因條件而異。

如果預測來自巢狀模型,而研究問題是比較 MSPE 是否相等,像是 [Clark–West 調整](/zh-HK/learn/clark-west-test-nested-forecast-accuracy-adjustment-explained)這類巢狀模型方法,會處理不同的虛無假設與估計雜訊問題。如果研究者搜尋許多交易規則或預測方法,並詢問是否有任何候選方法具有較強預測能力,應採用 [White Reality Check 或 Hansen SPA 檢驗](/zh-HK/learn/white-reality-check-vs-hansen-spa-test-trading-rules-explained)等家族層級程序。對已選定的一對預測進行條件檢驗,不能消除更廣泛搜尋所帶來的影響。

最後,相對準確性會隨時間改變的證據,不能指出特定的轉變日期。如果研究問題關注相對表現的時間路徑,而非其與所選工具變數的關係,局部不穩定或反轉檢驗可能更合適。Giacomini 和 Rossi(2010)研究這類預測比較。選擇符合研究問題的方法,不要把每次拒絕都解讀為支持市場狀態切換交易策略的證據。

考慮檢驗力不足和重複檢驗

條件檢驗可能需要大量資料。將樣本分為平靜與高波動狀態,會減少每組比較可用的觀察數目。增加函數會提高矩條件數目和自由度。如果多個條件與相對損失只有微弱關係,即使存在條件差異,檢驗力仍可能偏低。

McCracken 的聖路易斯聯邦儲備銀行工作論文,以簡單的二次損失例子研究 GW 檢驗的存在、尺寸和檢驗力。模擬結果顯示,在所研究的設定中,檢驗尺寸通常控制準確,但檢驗力往往較低 (McCracken, 2020)。這是解讀時的提醒,不是適用於所有應用的通用數值預測。未能拒絕可能反映資訊有限或檢驗力不足,不應描述為已證明兩種預測可以互換。

反覆嘗試不同的狀態定義、門檻、預測期、損失函數和評估日期,會提高偶然發現的機會。記錄所有候選檢驗,並將探索性分析與預先指定的確認樣本分開。如果要聲稱某個策略家族中有候選方法具備預測能力,應對該家族採用合適的多重檢驗或資料探勘方法。增加條件工具變數不會自動令證據更有說服力。

如果仍在比較多個預測模型,家族層級程序回答的問題與成對條件檢驗不同。[模型信賴集合指南](/zh-HK/learn/model-confidence-set-forecast-comparison-explained)說明如何透過重複比較,保留在指定水準下無法區分的一組模型;它不能取代 GW 分析中預先指定條件變數的步驟。

報告設計,讓其他人能夠重現

列出兩種預測方法、各自如何估計、模型是否巢狀、目標和預測期,以及評估日期。清楚說明損失函數和 \(d_{t+1}\) 的正負號定義。描述 \(h_t\) 每個元素如何建立、何時可觀察,以及是否在查看結果前選定。

報告預測起點安排、估計視窗規則、資料版本、共同樣本規則、樣本外起點數目、檢驗函數數目、協方差估計量、參考分布、檢驗統計量、自由度和 p 值。說明預測期是否重疊,以及如何處理相依性。除了檢驗結果,也列出平均損失和相應的損失差摘要。

列出曾試過的其他工具變數、門檻、視窗、損失函數和預測配對。如果同一批觀察既用於選擇模型或條件變數,又用於檢驗,請明確說明。結果即使不是確認性證據,仍可能有參考價值;透明報告讓讀者評估適用範圍,並設計獨立驗證。

常見問題

Q1Giacomini–White 檢驗與 Diebold–Mariano 檢驗相同嗎?

不同。Diebold–Mariano 關注平均損失是否相同。單步 GW 框架檢驗所選的條件矩,並將無條件矩納入為其中一項可能限制。

Q2拒絕虛無假設能否指出每種市場狀態下應採用哪種預測?

不能。這表示在檢驗假設下,至少一個所選矩與零不一致。結果取決於所選工具變數、樣本和損失函數,亦不保證每種狀態下都表現較佳。

Q3我可以不斷增加波動率門檻,直到檢驗拒絕嗎?

這會形成對條件變數的搜尋。可行情況下應預先指定變數、報告試過的所有設定;如果要提出廣泛的預測主張,應使用獨立確認樣本或適當的家族層級校正。

Q4條件預測能力是否代表交易策略會獲利?

不是。檢驗比較預測損失。交易主張還需要明確的決策規則,以及對執行、費用、融資、市場衝擊和風險作獨立評估。 主要研究 - Giacomini 和 White, “Tests of Conditional Predictive Ability” (2006) - Giacomini 和 Rossi, “Forecast Comparisons in Unstable Environments” (2010) - McCracken, “Tests of Conditional Predictive Ability: Existence, Size, and Power” (聖路易斯聯邦儲備銀行工作論文, 2020) - Diebold 和 Mariano, “Comparing Predictive Accuracy” (1995) - Newey 和 West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)

資料來源與延伸閱讀

回報問題

我們會準備一封包含本文連結的電郵。寄出後,Mark 才會收到你的回報

快速檢查

讀完指南後,用 3 道題檢查一下

問題 1 / 3

問題 01

若 dₜ₊₁ = L(A) − L(B),正的損失差代表甚麼?

選擇答案即可查看解釋

期權術語表