巢狀預測的 Clark–West 檢定:公式、範例與限制
了解巢狀預測模型的 MSPE 比較為何需要調整、Clark–West 檢定如何計算,以及單尾結果不能證明什麼。
本指南內容為什麼巢狀預測需要單獨比較
簡短摘要
Clark–West 檢定會調整平方誤差比較,因為其中一個預測模型包含一個規模較小的基準模型。即使新增參數沒有帶來真正的預測資訊,估計這些參數仍可能讓較大模型的預測帶有雜訊。調整會改變用來推論的損失差異,但不會改變預測,也不保證較大模型有用。
為什麼巢狀預測需要單獨比較
假設一個受限模型用常數預測下個月的報酬,較大的模型則額外加入一個估值比率。將新增係數設為零即可得到受限模型,因此受限模型包含於較大模型之中。即使該係數的真實值為零,估計它仍可能把樣本雜訊帶進較大模型的預測。因此,即使兩個模型在母體中有相同的預測資訊,較大模型的平均平方預測誤差(MSPE)仍可能比較高。
Clark–West 調整針對巢狀預測的樣本外 MSPE 比較中的這種估計雜訊,檢驗較大模型在該設計下是否比受限基準模型多提供預測價值。這比Diebold–Mariano 檢定指南的一般配對損失比較更具體;DM 常用的參考分布不會自動適用於巢狀模型。Clark 和 McCracken 研究巢狀預測準確度與 encompassing 檢定不同的漸近和有限樣本特性;Clark 和 West 則發展 MSPE 調整方法及近似推論。Clark 和 McCracken(2001)00071-9);Clark 和 West(2007)。
確認巢狀關係並保留樣本外設計
受限模型和較大的替代模型必須預測同一個目標 yₜ₊ₕ。較大模型必須包含受限模型作為特例,通常只要將一個或多個新增係數設為零即可。變數較多、模型較複雜或樣本內配適較好,本身都無法證明兩者巢狀。
每個預測起點都只使用當時可取得的資訊。按時間順序在訓練視窗中估計模型,再用較晚的評估期間檢驗。兩個模型要使用相同的目標、預測期間、單位、預測起點和實際結果。遞迴重估或滾動視窗都可能合適,但請說明採用的方式並保存每個起點實際產生的預測。若反覆查看評估期間來挑選預測變數、轉換方式或預測期間,該期間也參與了模型選擇。CAViaR 指南說明,尾部分位數預測需要用符合其目標的損失函數評估,不應不加區分地併入均值預測比較。
Clark–West 調整無法修正前視偏誤、樣本不一致、把後來修訂的資料當成當時已知,或未揭露的模型搜尋。請報告初始估計視窗、預測起點數、預測期間、資料版本,以及滾動或遞迴更新方式。
計算調整後的損失差異
令 f₀,t+h 代表受限模型預測,f₁,t+h 代表較大模型預測,而 eⱼ,t+h = yₜ₊ₕ − fⱼ,t+h 代表第 j 個預測誤差。採用平方損失時,每期的 Clark–West 調整差異為:
dCW,t+h = (e₀,t+h)² − [(e₁,t+h)² − (f₀,t+h − f₁,t+h)²]
這等於受限模型的平方誤差減去較大模型的平方誤差,再加上兩個預測之間距離的平方。最後一項估計零假設下估計新增參數所帶來的額外預測雜訊。Clark 和 West 建議在比較前,從較大模型的樣本 MSPE 扣掉這個預測差距調整。Clark 和 West(2007)。
對 P 個共同評估起點的調整差異取平均:mean(dCW) = (1/P) Σ dCW,t+h。若結果和預測以基點計算,平方誤差與差異的單位是 bp²。依照上述符號慣例,調整後平均值為正代表較大模型方向較有利。這是調整後的比較分數,不是較大模型實際的 MSPE,也不是可直接用於交易的預測。
在查看結果前先訂定單尾假設
Clark–West 通常要檢驗巢狀的較大模型是否比受限基準模型有更低的預期 MSPE。零假設代表新增的模型成分沒有改善預測;單尾對立假設則支持較大模型。依照上述公式,調整後平均值相對於標準誤夠大且為正時,才支持這個對立方向。
在調整後損失的符號中,工作假設為 H₀: E[dCW] = 0,對上 H₁: E[dCW] > 0。正方向來自先取受限模型的損失。若顛倒相減順序,符號也會反轉,報告結果時要一併說明符號慣例。
檢定統計量通常是 dCW 樣本平均值除以其估計標準誤。Clark 和 West 建議在他們研究的設計中採用近似常態的單尾檢定,並視情況使用一般或自我相關穩健標準誤。West(1996)發展了對樣本外預測和誤差之平滑函數動差的推論,也包含預測依賴估計參數的情況。p 值取決於巢狀關係、預測生成方式、目標、損失函數與抽樣假設;它不是較大模型為真的機率,也不是因果證據。
計算四期範例
假設四個實際結果以基點計為 [0, 1, −1, 0]。受限模型的預測是 [−1, 0, 0, 0],巢狀的較大模型預測則是 [−1.5, 0.5, −0.5, 0.5]。受限模型的平方誤差為 [1, 1, 1, 0],平均 MSPE 是 0.75 bp²。較大模型的平方誤差為 [2.25, 0.25, 0.25, 0.25],平均 MSPE 也同樣是 0.75 bp²。
預測差異的平方 (f₀ − f₁)² 為 [0.25, 0.25, 0.25, 0.25]。代入 e₀² − e₁² + (f₀ − f₁)² 後,調整差異為 [−1, 1, 1, 0] bp²,平均值是 0.25 bp²。原始 MSPE 相同,但調整後平均值為正,因為校正納入了較大模型的估計雜訊。
這四期只用來說明計算方式,遠不足以可靠估計不確定性或判斷統計顯著性。調整後平均值為正本身不能證明真實的預測優勢;所有數字都是假設值,並非市場觀察資料。
<!-- learn:illustration -->

考量預測誤差的相依性與預測期間
即使是單期預測,目標、預測變數或估計視窗隨時間變化,也可能讓調整後損失差異出現序列相關。多期預測期間彼此重疊時,相鄰預測起點會共用實際結果。若標準誤把每個起點都當成獨立,可能低估不確定性。
應根據抽樣設計,從調整差異序列估計標準誤;條件適合時,可使用對異質變異和自我相關穩健的長期變異數估計。Clark 和 West 指出,預測誤差有自我相關時應採用自我相關穩健標準誤。請說明預測期間、共變異數估計量、使用的核心函數和頻寬,以及重抽樣方法(如果有)。區塊自助法指南說明相依時間序列的重抽樣為何要保留順序結構;一般自助法不會自動實現 Clark–West 零假設。
相依性的處理方式視設計而定。較長的預測期間、持續性目標、反覆估計參數和波動變化,都可能造成超出簡單重疊模式的相依性。應比較合理的推論設定並說明,不要只挑 p 值最小的一種。
將常態臨界值視為近似值,而非保證
巢狀模型預測檢定的零分布可能不是標準分布,尤其估計樣本與評估樣本同時增加時。Clark 和 McCracken 指出,巢狀預測的準確度相等與 encompassing 檢定,在漸近和有限樣本方面都不同於非巢狀比較。Clark 和 West 則為他們研究的設計提供實用的近似常態推論,但不保證每個有限樣本都準確。Clark 和 McCracken(2001)00071-9);Clark 和 West(2007)。
評估樣本很小、額外參數很多、基準模型設定錯誤、根據資料挑選預測變數,以及選擇滾動或遞迴估計,都會影響檢定大小與檢定力。若樣本或設計和研究文獻中的情境差異很大,應考慮符合設計的臨界值,或經過審慎設定的模擬/自助程序。報告兩種樣本的大小,並說明 p 值使用的參考分布。
區分相近檢定並限定結論
Diebold–Mariano 檢定在一般配對損失架構下,檢驗兩個預測的預期損失是否相同。Clark–West 調整適用於平方誤差比較,前提是一個模型包含另一個模型,且新增參數估計會在零假設下扭曲原始 MSPE 差異。沒有理由時,不要把它用在非巢狀模型。DM 原始論文允許多種損失指標,也討論誤差不必服從常態分布或互相獨立的情況。兩者相關,但不是同一個檢定。Diebold 和 Mariano(1995)。
這兩種檢定都無法處理反覆嘗試許多目標、預測期間、基準模型和預測變數造成的選擇問題。如果最後的比較來自廣泛搜尋,請記錄完整候選集合,並使用適合搜尋層級問題的方法。White Reality Check 與 Hansen SPA 指南介紹如何對搜尋過的交易規則集合進行推論。
報告設計細節,讓其他人可以重現
列出受限模型與較大模型、確立巢狀關係的限制、目標、預測期間、單位、估計視窗、預測起點安排、評估日期和共同樣本規則。說明參數如何重新估計,以及每個預測時點可用的資訊和資料版本如何保存。
報告兩個原始 MSPE、Clark–West 調整差異的平均值、符號慣例、標準誤、單尾對立假設、參考分布或臨界值、p 值和相依性估計方法。也要揭露額外參數數量、樣本大小、曾嘗試的模型,以及評估期間是否影響模型設計。這些資訊讓讀者可以把巢狀模型的調整檢定和一般預測比較區分開來,並評估剩餘的不確定性。
常見問題
Q1Clark–West 會取代 Diebold–Mariano 檢定嗎?
不會。Clark–West 處理巢狀模型的 MSPE 比較。Diebold–Mariano 是一般配對損失架構,不能假設其常用參考分布自動適用於巢狀預測。
Q2調整後平均值為正,是否證明較大模型較好?
不是。依照上述符號慣例,它傾向較大模型,但推論仍需要適當的標準誤、可信的樣本外設計和足夠的觀測值。
Q3Clark–West 可以用於非巢狀模型嗎?
不應預設可以。這項調整的原因是巢狀零假設下的估計雜訊。比較非巢狀模型時,請選擇符合預測設計和損失函數的檢定。
Q4Clark–West 結果顯著是否代表交易策略有獲利?
不是。檢定衡量單一目標和評估設計下的預測準確度。交易結果還取決於決策規則、執行、費用、融資、風險和額外的樣本外證據。 主要研究 - Clark 和 West, “Approximately Normal Tests for Equal Predictive Accuracy in Nested Models” (2007) - Clark 和 McCracken, “Tests of Equal Forecast Accuracy and Encompassing for Nested Models” (2001)00071-9) - West, “Asymptotic Inference about Predictive Ability” (1996) - Diebold 和 Mariano, “Comparing Predictive Accuracy” (1995)
資料來源與延伸閱讀
回報問題
我們會準備一封包含本文連結的電子郵件。寄出後,Mark 才會收到你的回報
快速檢查
讀完指南後,用 3 道題檢查一下
問題 01
Clark–West 調整為什麼要加上兩個預測差異的平方?
選擇答案即可查看解釋