巢狀預測的 Clark–West 檢驗:公式、例子與限制
了解巢狀預測模型的 MSPE 比較為何需要調整、Clark–West 檢驗的計算方法,以及單尾結果不能證明甚麼。
本指南內容為何巢狀預測需要單獨比較
簡短摘要
Clark–West 檢驗會調整平方誤差比較,因為其中一個預測模型包含一個規模較小的基準模型。即使新增參數沒有帶來真正的預測資訊,估算這些參數仍可能令較大模型的預測帶有雜訊。調整改變的是用於推論的損失差異,不會改變預測本身,也不保證較大模型有用。
為何巢狀預測需要單獨比較
假設一個受限模型以常數預測下月回報,而較大模型再加入一個估值比率。只要把新增係數設為零,便會還原受限模型,因此受限模型包含在較大模型之中。即使該係數的真實值是零,估算它仍可能把樣本雜訊帶入較大模型的預測。因此,即使兩個模型在總體中有相同的預測資訊,較大模型的平均平方預測誤差(MSPE)仍可能較高。
Clark–West 調整旨在處理巢狀預測樣本外 MSPE 比較中的這種估算雜訊,並檢驗較大模型在該設計中有否比受限基準模型提供更多預測價值。這比 Diebold–Mariano 檢驗指南所述的一般配對損失比較更具體;DM 的常用參考分佈並不會自動適用於巢狀模型。Clark 與 McCracken 研究巢狀預測準確度及 encompassing 檢驗不同的漸近和有限樣本特性;Clark 與 West 則提出 MSPE 調整程序及近似推論。Clark 與 McCracken(2001)00071-9);Clark 與 West(2007)。
確認巢狀關係並保留樣本外設計
受限模型和較大的替代模型必須預測同一個目標 yₜ₊ₕ。較大模型須包含受限模型作為特例,通常是把一個或多個新增係數設為零。變數較多、模型較複雜或樣本內配適較好,本身都不能證明兩者巢狀。
在每個預測起點,只使用當時可取得的資訊產生兩個預測。按時間次序以訓練視窗估算模型,再於較後的評估期檢驗。兩者須對齊目標、預測期、單位、預測起點和實際結果。遞迴重估或滾動視窗都可能合適,但要說明採用的方法,並保留每個起點實際產生的預測。若反覆查看評估期來挑選預測變數、轉換方法或預測期,評估期也就參與了模型選擇。CAViaR 指南說明,尾部分位數預測需要以適合其目標的損失函數評估,不應不加區分地併入均值預測比較。
Clark–West 調整不能修正前視偏誤、樣本不一致、把事後修訂數據當成當時已知,或未披露的模型搜尋。請報告初始估算視窗、預測起點數目、預測期、數據版本,以及滾動或遞迴更新方式。
計算調整後的損失差異
令 f₀,t+h 為受限模型的預測,f₁,t+h 為較大模型的預測,而 eⱼ,t+h = yₜ₊ₕ − fⱼ,t+h 為第 j 個預測誤差。採用平方損失時,每期的 Clark–West 調整差異為:
dCW,t+h = (e₀,t+h)² − [(e₁,t+h)² − (f₀,t+h − f₁,t+h)²]
這等於受限模型的平方誤差減去較大模型的平方誤差,再加上兩個預測之間距離的平方。最後一項估算零假設下估計新增參數所帶來的額外預測雜訊。Clark 與 West 建議在比較前,從較大模型的樣本 MSPE 扣除這項預測差距調整。Clark 與 West(2007)。
對 P 個共同評估起點的調整差異取平均:mean(dCW) = (1/P) Σ dCW,t+h。若結果和預測以基點計量,平方誤差及差異的單位是 bp²。依上述符號慣例,調整後平均值為正便傾向較大模型。這是調整後的比較分數,並非較大模型的實際 MSPE,也不是可直接用於交易的預測。
在查看結果前訂明單尾假設
Clark–West 通常檢驗巢狀較大模型的預期 MSPE 是否低於受限基準模型。零假設表示新增模型部分沒有改善預測;單尾對立假設則支持較大模型。按上述公式,調整後平均值相對於標準誤足夠大而為正,才支持該對立方向。
以調整後損失表示,工作假設為 H₀: E[dCW] = 0,對比 H₁: E[dCW] > 0。正方向來自先取受限模型的損失。若倒轉相減次序,符號也會反轉,所以報告時要一併說明符號慣例。
檢驗統計量通常是 dCW 的樣本平均值除以其估算標準誤。Clark 與 West 建議在其研究的設計中採用近似正態單尾檢驗,並按情況使用一般或自相關穩健標準誤。West(1996)發展了對樣本外預測和誤差之平滑函數矩的推論,亦包括預測依賴估算參數的情況。p 值取決於巢狀關係、預測生成方式、目標、損失函數和抽樣假設;它不是較大模型為真的機率,也不是因果證據。
計算四期例子
設四個假設實際值以基點計為 [0, 1, −1, 0]。受限模型的預測為 [−1, 0, 0, 0],巢狀較大模型則為 [−1.5, 0.5, −0.5, 0.5]。受限模型的平方誤差是 [1, 1, 1, 0],平均 MSPE 為 0.75 bp²。較大模型的平方誤差是 [2.25, 0.25, 0.25, 0.25],平均 MSPE 同樣是 0.75 bp²。
預測差異的平方 (f₀ − f₁)² 是 [0.25, 0.25, 0.25, 0.25]。代入 e₀² − e₁² + (f₀ − f₁)²,調整差異為 [−1, 1, 1, 0] bp²,平均值為 0.25 bp²。原始 MSPE 相同,但調整後的平均值為正,因為校正已計入較大模型的估算雜訊。
這四期只用來示範計算,遠不足以可靠估算不確定性或判定統計顯著性。調整後平均值為正本身並不能證明真實的預測優勢;所有數值都是假設值,並非市場觀察數據。
<!-- learn:illustration -->

考慮預測誤差的依賴性和預測期
即使是單期預測,目標、預測變數或估算視窗隨時間變動,也可能令調整損失差異出現序列相關。多期預測視窗互相重疊時,相鄰預測起點會共用實際結果。若標準誤把所有起點都視為獨立,可能低估不確定性。
應根據抽樣設計,從調整差異序列估算標準誤;條件合適時,可使用同時對異質變異和自相關穩健的長期變異估計。Clark 與 West 指出,預測誤差有自相關時應使用自相關穩健標準誤。請說明預測期、協方差估計量、所用核函數和頻寬,以及重抽樣方法(如有)。區塊自助法指南解釋依賴時間序列的重抽樣為何要保留次序結構;一般自助法不會自動實現 Clark–West 零假設。
所需的依賴性處理視乎設計而定。較長預測期、持續性目標、反覆估算參數和波幅改變,都可能造成超出簡單重疊模式的依賴。應比較合理的推論設定並解釋,而不是只選擇 p 值最小的一種。
將正態臨界值視為近似值,而非保證
巢狀模型預測檢驗的零分佈可能並非標準分佈,尤其在估算和評估樣本同時增長時。Clark 與 McCracken 顯示,巢狀預測的準確度相等及 encompassing 檢驗,在漸近和有限樣本方面均有別於非巢狀比較。Clark 與 West 為其研究設計下有用的近似正態推論提供理據,但這並不保證任何有限樣本都準確。Clark 與 McCracken(2001)00071-9);Clark 與 West(2007)。
評估樣本較小、新增參數很多、基準模型設定錯誤、按數據選擇預測變數,以及選用滾動或遞迴估算,都會影響檢驗大小與檢驗力。如果樣本或設計與文獻所分析的情況差異很大,應考慮合適的臨界值或謹慎設計的模擬/自助程序。報告兩個樣本的大小,並說明 p 值採用的參考分佈。
區分相關檢驗並限制結論範圍
Diebold–Mariano 檢驗在一般配對損失框架下,檢驗兩個預測的預期損失是否相同。Clark–West 調整適用於平方誤差比較,前提是一個模型包含另一個模型,而額外參數估算會在零假設下扭曲原始 MSPE 差異。沒有理據時,不要把它套用到非巢狀模型。DM 原文容許多種損失指標,也討論誤差不必服從正態分佈或互相獨立的情況。兩者有關,但並非同一檢驗。Diebold 與 Mariano(1995)。
兩種檢驗都不能解決反覆嘗試多個目標、預測期、基準模型和預測變數造成的選擇問題。若最終比較來自廣泛搜尋,請記錄完整候選集合,並使用針對搜尋層面問題的方法。White Reality Check 和 Hansen SPA 指南介紹對搜尋過的交易規則家族進行推論。
報告設計,讓其他人可以重現比較
列出受限模型和較大模型、確立巢狀關係的限制、目標、預測期、單位、估算視窗、預測起點安排、評估日期和共同樣本規則。說明參數如何重新估算,以及如何保存每個預測時點可用的資訊和數據版本。
報告兩個原始 MSPE、Clark–West 調整差異的平均值、符號慣例、標準誤、單尾對立假設、參考分佈或臨界值、p 值和依賴性估計方法。同時披露新增參數數目、樣本大小、嘗試過的模型,以及評估期有否影響設計。這些資料讓讀者分辨嵌套模型調整檢驗和一般預測比較,並判斷尚存的不確定性。
常見問題
Q1Clark–West 會取代 Diebold–Mariano 檢驗嗎?
不會。Clark–West 處理巢狀模型的 MSPE 比較。Diebold–Mariano 是一般配對損失框架,不能假設其常用參考分佈自動適用於巢狀預測。
Q2調整後平均值為正,是否證明較大模型較好?
不是。按所述符號慣例,它傾向較大模型,但推論仍需要合適的標準誤、可信的樣本外設計和足夠觀測值。
Q3Clark–West 可以用於非巢狀模型嗎?
不應預設可以。這項調整源於巢狀零假設下的估算雜訊。比較非巢狀模型時,應選擇配合預測設計和損失函數的檢驗。
Q4Clark–West 結果顯著是否代表交易策略有盈利?
不是。檢驗只衡量一個目標和評估設計下的預測準確度。交易結果還取決於決策規則、執行、費用、融資、風險和額外的樣本外證據。 主要研究 - Clark 與 West, “Approximately Normal Tests for Equal Predictive Accuracy in Nested Models” (2007) - Clark 與 McCracken, “Tests of Equal Forecast Accuracy and Encompassing for Nested Models” (2001)00071-9) - West, “Asymptotic Inference about Predictive Ability” (1996) - Diebold 與 Mariano, “Comparing Predictive Accuracy” (1995)
資料來源與延伸閱讀
回報問題
我們會準備一封包含本文連結的電郵。寄出後,Mark 才會收到你的回報
快速檢查
讀完指南後,用 3 道題檢查一下
問題 01
Clark–West 調整為何要加上兩個預測差異的平方?
選擇答案即可查看解釋