Skip to content
所有選擇權指南
預測檢定13 分鐘閱讀

Giacomini–White 檢定:條件預測準確性

了解 Giacomini–White 檢定如何判斷預測準確性是否隨已知條件改變、如何選擇檢定函數,以及結果能說明什麼

本指南內容平均準確性與條件準確性回答不同問題

簡短摘要

Giacomini–White(GW)架構探討的是:預測時已知的資訊是否與兩種預測的相對損失有關。它可能揭示平均分數所掩蓋的差異,但結論取決於預測方法、評估期間、損失函數,以及事先選定的條件變數

平均準確性與條件準確性回答不同問題

假設在測試樣本中,預測 A 的平均損失低於預測 B。這個平均值可能掩蓋有用的模式:A 在市場平靜時表現較好,B 則在波動較高時表現較佳。如果問題是哪一種預測的平均表現較好,無條件比較是合適的;如果問題是預測當下已知的資訊,能否協助判斷哪一種預測之後會表現較佳,評估對象就是條件預測能力。

Giacomini 和 White 提出此架構,用特定損失函數與資訊集合比較預測方法。只要損失函數符合預測任務,就可以評估點預測、區間預測、機率預測或密度預測。此方法也將產生各項預測的估計程序納入評估。因此,滾動視窗、固定訓練樣本或加權規則,都是受評估方法的一部分,而非看過結果後就能任意改動的細節 (Giacomini 和 White, 2006)。

這個區分與結構變化檢定相關,但並不相同。條件檢定詢問相對預測損失是否與所選資訊存在系統性關聯;結構變化檢定則詢問參數或關係是否在未知或指定的時間點改變。[Diebold–Mariano 指南](/zh-TW/learn/diebold-mariano-forecast-accuracy-test-explained)介紹無條件平均損失比較;條件問題則需要明確說明用哪些資訊來設定條件。

先對齊預測、結果與資訊

令 \(Y_{t+1}\) 為預測起點 \(t\) 之後觀察到的目標。預測 \(\hat y^A_{t+1}\) 和 \(\hat y^B_{t+1}\) 必須使用相同的目標、預測期間、單位與資訊截止時間。若損失函數 \(L\) 的數值愈低愈好,損失差定義如下:

dₜ₊₁ = L(Yₜ₊₁, ŷA,ₜ₊₁) − L(Yₜ₊₁, ŷB,ₜ₊₁)

依照這個正負號定義,正值代表 A 的損失較大,因此該起點上 B 較佳;負值則有利於 A。每個預測起點記錄一列,並以同一個實際值為兩種預測評分。保留預測在當時可取得的樣貌,以及資料版本和模型版本。不要用後來修訂的輸入資料或事後才取得的資訊,重新建立歷史預測。

條件變數也必須在預測起點已知。例子包括落後一期的波動率估計、事先公布的事件指標、落後一期的損失差,或僅以過去觀測值計算的市場狀態變數。在 \(t\) 之後才測得的變數,無法在沒有前視偏誤的情況下,解釋哪種預測在 \(t+1\) 會較好。

評分方式應配合目標。平方誤差可用於條件平均數預測,但不會自動適用於波動率、分位數或密度預測。如果一種模型預測變異數,另一種預測標準差,應先將兩者轉成相同數量的預測。檢定無法修正評分問題本身不一致的情況。

評估波動率預測時,兩者都應使用相同的實現變異數定義和取樣間隔。如果一種預測涵蓋盤中價格,另一種也將隔夜報酬納入,損失差可能反映目標不同,而非預測能力不同。事先決定如何處理市場休市期間的價格變動、取樣頻率、缺漏觀測及實現值指標,並一致套用。如果實現值代理指標含有雜訊,測量誤差會影響兩者的損失分數,也應納入解讀。

說明條件虛無假設並選擇檢定函數

令 \(\mathcal{G}_t\) 代表用來設定比較條件的資訊。理想化的虛無假設為

H₀: E[dₜ₊₁ | 𝒢ₜ] = 0

這表示在指定資訊條件下,預期損失差為零。單期 GW 檢定使用事先選定的檢定函數向量 \(h_t\),將條件命題轉為一組動差;每個函數都必須能以 \(t\) 時點可取得的資訊計算:

H₀,ₕ: E[hₜ dₜ₊₁] = 0

\(h_t\) 中的常數項包含平均損失差的動差。其他項目可以代表市場狀態、落後的相對損失,或在檢視結果前選定的非線性轉換。例如,令 \(h_t=(1,S_t)'\),其中 \(S_t\) 是在 \(t\) 已知的二元高波動指標;如此可同時檢定常數動差,以及損失差是否與該狀態有關。

有限個檢定函數只會檢定所選的動差。拒絕虛無假設代表在檢定假設下,至少一個所選動差與零不一致;它不會找出普遍最佳的模型,也不能證明所有可能的狀態變數都重要。未能拒絕並不證明條件表現相同。只使用常數項的檢定是無條件動差比較,並非廣泛搜尋所有可能條件。

在查看哪個模型勝出前,先選好損失函數、工具變數、轉換方式、樣本與預測期間。看過結果後才增加許多狀態指標、門檻與落後期,會產生另一個搜尋問題。條件檢定本身不會修正這種選擇造成的影響。

固定建構每個狀態變數時使用的資訊時點。如果「高波動」代表全樣本波動率最高的 20%,未來觀測值就參與設定了過去預測起點的門檻。應只用各起點當時可取得的資訊估計門檻,或採用該日期之前已公布的規則。對連續狀態變數,應事先界定單位、中心化與縮放方式。多個近似相同的指標可能造成動差冗餘,並使共變異數矩陣難以反矩陣,因此應使用能清楚解釋的最小集合。

建立 Wald 統計量並解讀其參考分布

對 \(q\) 個檢定函數,建立向量 \(g_{t+1}=h_t d_{t+1}\)。樣本平均數為

ḡ = (1/n) Σₜ gₜ₊₁

單期 GW 統計量具有 Wald 形式:

GW = n ḡ′ Ω̂⁻¹ ḡ

其中 \(\hat\Omega\) 估計動差向量的共變異數矩陣。在虛無假設與原論文的正則條件下,此統計量漸近服從自由度為 \(q\) 的卡方參考分布。因此,檢定函數數量會影響參考分布,也可能影響檢定力。加入大量較弱或重複的工具變數,可能讓共變異數估計不穩定,卻沒有增加有用資訊。

在單期設定中,虛無假設意味著動差向量具有鞅差結構,因此原始檢定可以使用樣本二階動差估計。對於其他預測期間、結果重疊,或偏離該設定的情況,變異數估計必須符合檢定的假設與相依結構。請依照所選實作的設定,不要自動照搬其他檢定的 HAC 頻寬。一般 HAC 共變異數方法,包括 Newey 和 West(1987) 的估計量,是在確有需要時使用的工具,並非 GW 的通用頻寬規定。結果的可信度取決於背後的共變異數估計與預測設計。

也要檢查能否根據所選動差估計 \(\hat\Omega\)。幾乎重複的檢定函數、某一狀態中觀測值極少的指標,或過多的交互作用,都可能使矩陣奇異或不穩定。此時,矩陣反轉可能因資料稍微修訂就劇烈改變,扭曲檢定統計量。每個函數都應有與某項條件或預測表現差異相關的理由;報告其數量與動差共變異數。看過結果後才刪除無用函數,是另一項選擇步驟,應予以揭露。

p 值是在參考分布下反對所述動差限制的證據。它不是 A 或 B 為真實模型的機率,也不是交易規則獲利的可能性。請報告統計量、自由度、p 值,以及實際檢定的動差,讓讀者了解拒絕代表什麼。

<!-- learn:illustration -->

三片透明玻璃板上,藍色與琥珀色路徑的相對位置交替變化,表示預測表現可能隨條件改變
概念圖展示不同條件下預測相對表現的變化;不是實測市場資料、檢定結果或交易訊號

兩種狀態的例子說明平均數可能掩蓋什麼

考慮八個假設性的單期預測起點。令 \(S_t=0\) 表示平靜狀態,\(S_t=1\) 表示高波動狀態。假設損失差 \(d_{t+1}=L_A-L_B\) 在四個平靜起點依序為 −2、−2、−2、−2;在四個高波動起點則依序為 +2、+2、+2、+2。負差有利於 A;正差有利於 B。

八個起點的整體平均數為零,因此這個小例子沒有呈現無條件損失差。平靜狀態的平均數為 −2,高波動狀態則為 +2。相對排名會隨狀態反轉。使用 \(h_t=(1,S_t)'\) 的檢定包含常數動差,以及可反映此模式的高波動動差。

這八個數值只是教學示例,不足以支持可靠的統計推論。真實資料的檢定必須考量預測的估計方式、狀態變數是否事先固定、可用起點數量,以及損失差動差如何隨時間變動。只看圖形並依狀態切分,不能證明這種模式會持續。

將估計視窗視為方法的一部分

原始 GW 漸近理論會將最大估計視窗長度維持在有限值,同時讓樣本外預測數量增加,以保留預測估計的不確定性。滾動視窗與固定估計樣本符合此核心設定。視窗長度與任何依資料決定的視窗規則,都是各預測方法的一部分,應事先設定並報告。

模型重新估計時,這點尤其重要。忽略參數估計的比較可能漏掉每種方法從過去資料學習時帶來的不確定性。在既定條件下,GW 可處理巢狀或非巢狀模型的預測,但不代表每種擴張視窗實作或估計量都適用。在原始單期架構中,常見的擴張視窗不符合有限視窗假設。如果設定不同,應採用針對實際預測建構方式推導的結果。

檢定也不會替你選擇合適視窗。短視窗可能適應近期狀況,但可用觀測較少;長視窗或擴張視窗可能使估計更穩定,卻也保留過時關係。應以事先規劃的評估比較這些選項,並記錄視窗選擇程序。Giacomini 和 Rossi(2010) 為不穩定環境下相對預測表現隨時間變化的路徑,發展了不同的檢定;時間路徑問題雖然相關,但其統計量與基礎 GW 條件檢定不同。

條件拒絕本身也不會提供一套能在即時市場中選出正確預測的交易規則。工具變數可能在評估資料中與損失差相關,卻無法產生穩定或可執行的切換規則。如果要以當下資訊選擇預測,應使用過去觀測值定義該規則,再於之後未曾使用的一段預測起點上評估,並納入規則本身的估計與決策不確定性。

區分 GW、DM、巢狀模型檢定與不穩定性檢定

[Diebold–Mariano 檢定](/zh-TW/learn/diebold-mariano-forecast-accuracy-test-explained)詢問兩種預測在評估樣本中的平均損失是否相等。GW 檢定所選資訊是否與相對損失有關;無條件比較也可作為特殊的動差限制納入。正如兩狀態例子所示,模型平均分數可能相同,但相對表現仍會因條件而異。

若預測來自巢狀模型,且問題明確是比較 MSPE 是否相等,像是[Clark–West 調整](/zh-TW/learn/clark-west-test-nested-forecast-accuracy-adjustment-explained)這類巢狀模型方法,處理的是不同的虛無假設與估計雜訊問題。若研究者搜尋許多交易規則或預測方法,並詢問是否有任何候選者具備較強預測能力,應使用[White Reality Check 或 Hansen SPA 檢定](/zh-TW/learn/white-reality-check-vs-hansen-spa-test-trading-rules-explained)等家族層級程序。對已選定的單一預測組合進行條件檢定,無法消除更廣泛搜尋造成的影響。

最後,相對準確性隨時間改變的證據,無法指出特定的轉折日期。如果研究問題關注相對表現的路徑,而非其與所選工具變數的關聯,局部不穩定或反轉檢定可能更適合。Giacomini 和 Rossi(2010)研究了這類預測比較。選擇符合問題的方法,不要把每次拒絕都當成支持市場狀態切換交易策略的證據。

考量檢定力不足與重複檢定

條件檢定可能需要大量資料。將樣本拆分為平靜與高波動狀態,會減少各組比較可用的觀測值。增加函數會提高動差數量和自由度。如果數個條件與相對損失只有微弱關聯,即使存在條件差異,檢定力也可能很低。

McCracken 的聖路易聯邦準備銀行工作論文,以簡單的二次損失例子研究 GW 檢定的存在、尺寸與檢定力。模擬結果顯示,在研究的設定中,檢定尺寸通常能準確控制,但檢定力往往偏低 (McCracken, 2020)。這是解讀結果時的提醒,並非適用於所有應用的通用數值預測。未能拒絕可能反映資訊有限或檢定力不足,不應說成已證明兩種預測可互換。

反覆嘗試不同狀態定義、門檻、預測期間、損失函數與評估日期,會提高偶然發現的機率。記錄所有候選檢定,並將探索性分析與事先指定的確認樣本分開。如果要主張某一策略家族中有策略具備預測力,應對該家族採用適當的多重檢定或資料探勘方法。增加條件工具變數,不會自動帶來更有說服力的證據。

若仍有多個預測模型需要比較,家族層級程序回答的問題與成對條件檢定不同。[模型信賴集合指南](/zh-TW/learn/model-confidence-set-forecast-comparison-explained)說明如何透過反覆比較,保留在所選水準下無法區分的一組模型;它不能取代 GW 分析事先指定條件變數的步驟。

報告設計,讓其他人能重現

列出兩種預測方法、各自的估計方式、模型是否巢狀、目標與期間,以及評估日期。完整說明損失函數和 \(d_{t+1}\) 的正負號定義。描述 \(h_t\) 每個元素的構造方式、何時可以觀察,以及是否在查看結果前選定。

報告預測起點排程、估計視窗規則、資料版本、共同樣本規則、樣本外起點數、檢定函數數、共變異數估計量、參考分布、檢定統計量、自由度與 p 值。說明預測期間是否重疊,以及如何處理相依性。除了檢定結果,也應提供平均損失與相應的損失差摘要。

列出曾嘗試的其他工具變數、門檻、視窗、損失函數與預測配對。如果同一批觀測既用來選擇模型或條件變數,又用來檢定,請明確說明。即使結果不足以確認假設,仍可能有參考價值;透明報告能讓讀者判斷適用範圍並設計獨立驗證。

常見問題

Q1Giacomini–White 檢定與 Diebold–Mariano 檢定相同嗎?

不同。Diebold–Mariano 關注平均損失是否相同。單期 GW 架構檢定所選的條件動差,並將無條件動差納入可能的限制之一。

Q2拒絕虛無假設能指出每種市場狀態下應使用哪種預測嗎?

不能。它表示在檢定假設下,至少一項所選動差與零不一致。結果取決於所選工具變數、樣本與損失函數,也不保證每種狀態下都表現較佳。

Q3我可以不斷增加波動率門檻,直到檢定拒絕嗎?

這會形成對條件變數的搜尋。可行時應預先指定變數、報告所有試過的設定;若要提出廣泛的預測主張,應使用獨立的確認樣本或適當的家族層級校正。

Q4條件預測能力代表交易策略會獲利嗎?

不代表。此檢定比較預測損失。交易主張還需要明確的決策規則,以及對執行、費用、融資、市場衝擊與風險的獨立評估。 主要研究 - Giacomini 和 White, “Tests of Conditional Predictive Ability” (2006) - Giacomini 和 Rossi, “Forecast Comparisons in Unstable Environments” (2010) - McCracken, “Tests of Conditional Predictive Ability: Existence, Size, and Power” (聖路易聯邦準備銀行工作論文, 2020) - Diebold 和 Mariano, “Comparing Predictive Accuracy” (1995) - Newey 和 West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)

資料來源與延伸閱讀

回報問題

我們會準備一封包含本文連結的電子郵件。寄出後,Mark 才會收到你的回報

快速檢查

讀完指南後,用 3 道題檢查一下

問題 1 / 3

問題 01

若 dₜ₊₁ = L(A) − L(B),正的損失差代表什麼?

選擇答案即可查看解釋

期權術語表