機率積分轉換:如何評估密度預測的校準
了解 PIT 如何評估連續與離散密度預測、直方圖能說明甚麼,以及為何單靠均勻性並不足夠
本指南內容為甚麼密度預測不能只看點預測誤差
簡短摘要
密度預測會為一系列可能結果分配機率。機率積分轉換(PIT)將每個觀察結果轉成預測分布下的累積機率。在特定假設下,均勻 PIT 是有用的診斷;但直方圖看似平坦,不能單獨證明條件校準或時間獨立性。
為甚麼密度預測不能只看點預測誤差
點預測可能表示翌日回報為 0.2%;密度預測則為整個回報範圍分配機率,涵蓋一般波動與極端事件。評估要問:結果發生前發布的分布,是否符合之後的觀察?Mincer–Zarnowitz 指南討論數值點預測的線性校準,是另一個問題。
PIT 衡量預測分配給「不高於實際值」的累積機率。它是機率排名,不是回報、交易訊號或盈利指標。Diebold–Mariano 指南按指定評分比較平均預測損失,與密度校準回答的問題不同。
用累積分布函數轉換連續預測
令預測起點 (t) 後的結果為 (Y_{t+1}),令 (F_{t+1}(y\mid\mathcal I_t)) 為只根據當時可得資訊 (\mathcal I_t) 的預測累積分布函數(CDF)。連續分布的 PIT 為
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ)
CDF 表示取值不高於 (y) 的機率。如果預測 CDF 是真實條件分布,PIT 定理給出
Pr(Uₜ₊₁ ≤ u | 𝓘ₜ) = u, for 0 ≤ u ≤ 1
因此,理想的連續一步預測會在給定預測資訊時產生均勻 PIT。若序列的資訊集合包括過去,在適當假設下,理想 PIT 在預測起點之間亦互相獨立。Rosenblatt 研究此轉換;Diebold、Gunther 與 Tay 將 PIT 序列用於密度預測評估(1952;1998)。
手動示例:預測為 (N(0,1)),觀察值為 (y=1),則 PIT 為 (Phi(1)\approx0.8413),即預測分配約 84.13% 機率予不高於 1 的值。單一觀察無法判斷校準,須要一組預測及結果。
離散結果要隨機化轉換
離散 CDF 會在可能結果處跳躍,所以一般的 (F(Y)) 只會取有限數值,即使預測正確通常亦不均勻。隨機 PIT 會填滿每個跳躍區間:
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ) + Vₜ₊₁ [Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ) − Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ)]
(F(y^-)) 是左極限,即結果嚴格小於 (y) 的機率;(V) 是只用於評估的獨立 Uniform(0,1) 隨機值。連續分布沒有跳躍,公式便簡化為 (F(Y))。Brockwell 證明此隨機轉換適用於一般分布,包括離散和混合分布(2007)。對有序計數資料,Czado、Gneiting 與 Held 亦討論非隨機 PIT 和邊際校準圖;不可將離散 (F(Y)) 當成連續均勻變數評估(2009)。
假設 Bernoulli 預測滿足 (P(Y=1)=0.20) 和 (P(Y=0)=0.80)。一般 PIT 在 (Y=0) 時是 0.80,在 (Y=1) 時是 1.00,因此不均勻。隨機化後,(Y=0) 映射至 ([0,0.80]) 中的 (0.80V),(Y=1) 映射至 ([0.80,1]) 中的 (0.80+0.20V)。按事件機率加權後,整體密度在 ([0,1]) 上均勻。隨機值只供評估,並非預測的一部分。
分清邊際均勻、獨立與條件校準
PIT 邊際分布均勻是理想連續預測的必要條件,但並不足夠。不同市場狀態中的相反錯誤,匯總後可能互相抵銷,令直方圖看似平坦。Gneiting、Balabdaoui 與 Raftery 指出,PIT 近乎均勻仍可與個別預測偏差並存(2007)。
次序亦重要:序列的邊際直方圖可以均勻,但仍有時間依賴,例如數值聚集或長串相近值。理想條件預測所要求的多於匯總均勻性。若預測期重疊,參考分布和獨立性條件亦須反映重疊;不可假設 iid 檢驗必定適用。
除 PIT 分布外,也要檢查它與時間、滯後值、預測起點變數及預先設定狀態的關係。分組圖或條件檢驗可揭示隱藏模式,但分組選擇及有限樣本仍有限制。有限的檢驗組合不能證明對所有可能條件變數都已校準。
把 PIT 直方圖當作線索,不是結論
U 形通常與預測過度集中或離散程度不足相符;中央隆起通常與預測過度分散相符;左右不對稱可能提示位置偏差。這些是經驗線索,不是唯一診斷:依賴、狀態混合、離散結果、分箱和小樣本均可造成誤讀。
直方圖會丟失觀察次序,無法顯示問題何時開始、極端 PIT 是否聚集或某個子群是否失準。分箱太闊可能掩蓋問題;太窄則可能受抽樣噪音影響。盡可能報告預測數量、箱界及不確定性。Diebold–Gunther–Tay 框架和 Berkowitz 檢驗均須配合設計假設。Berkowitz 把內部 PIT 轉成 (Z_t=\Phi^{-1}(U_t)),檢驗獨立標準常態值的聯合原假設,對比指定的動態備擇(例如 AR(1));它不是通用合格證(2001)。
<!-- learn:illustration -->

納入估計因素,並作樣本外評估
均勻性結果假設 CDF 是真實條件分布。實務上要估計參數、選擇分布族,也可能調整門檻和特徵。因此 (F_{t+1}(\cdot;\hat\theta_t)) 是預測程序的一部分。若用評估期結果擬合模型,再把 PIT 說成未受影響的樣本外證據,便會造成資料洩漏。
滾動評估要在每個預測起點只使用當時可得資料,並記錄估計視窗、重新估計頻率、資料版本、模型版本和選擇步驟。相鄰視窗通常共享觀察值;結果重疊亦會增加依賴。
檢驗大小與檢力取決於估計量、樣本和方法。PIT 直方圖不會處理參數不確定性;課本的 iid 參考值亦不適用於所有估計或重疊設計。若推論重要,選擇符合設計的檢驗,或重做整個估計與預測流程來模擬/bootstrap 原假設。需要時,把最後評估樣本留在模型選擇之外。
區分校準與銳度
校準關乎預測與結果的關係:獲分配某一機率的事件,是否以相應頻率發生?銳度描述預測分布本身的集中程度,不查看結果。Gneiting、Balabdaoui 與 Raftery 認為銳度應以校準為前提追求,而非校準的替代品。
較寬的預測可以校準良好,但資訊較少;較窄的預測看似精確,若結果頻繁落在其機率質量以外,仍可能校準欠佳。PIT 檢查分布一致性,銳度摘要描述分散程度或區間寬度。只報告其中一項會遺漏部分評估。
匯總 PIT 平坦仍可能掩蓋波動狀態或預測期的錯誤。重要條件應預先界定。這與點預測迴歸及 Giacomini–White 條件預測能力檢驗相關但不同;後者按指定資訊比較條件預測損失。
在相同結果上以適當評分比較完整預測
PIT 主要是診斷,不會單獨為密度預測排名。對數評分和連續排序機率評分(CRPS)為每個預測—結果配對給出標量損失;按定義,真實預測分布的期望損失最低。但單一樣本的平均值不能證明模型正確。Model Confidence Set 指南說明集合式比較。比較密度預測時,應使用針對完整分布定義的評分,並套用於相同結果。
交代目標、預測期、共同日期、損失慣例及基準。對數評分對觀察值位置的極低密度特別敏感;CRPS 以不同方式比較 CDF。評分差異的不確定性要考慮時間依賴、估計和模型搜尋。PIT 圖和評分各有用途,可一併報告。
校準或較佳評分均不能證明交易盈利。交易主張另須交代決策規則、資訊可用時間、持倉規模、交易與資金成本,並作樣本外回報評估。預測評估統計量不是回測回報。
使用可重現的 PIT 流程
先固定目標、預測期、起點時間、結果版本,以及分布屬連續、離散或混合。保存每個預測 CDF 或足以重建它的資料,連同實際值和資訊集合。連續情況計算 (F_t(Y_t));有跳躍時記錄隨機 PIT 方法,或採用合適的離散診斷。
檢查邊際分布和時間次序,交代分箱、樣本量、相同值處理,以及隨機種子或重複隨機化方法。針對預先界定的問題加入獨立性或條件檢查,並採用適合滾動、重疊或估計設計的推論方法。另用適當評分在相同留出結果上比較模型。結論只適用於已界定的預測和條件,不保證未來校準或交易盈利。
常見問題
Q1PIT 均勻能證明密度預測正確嗎?
不能。它是正確連續預測的必要診斷條件,但匯總均勻性不能證明獨立或條件校準。亦要檢查時間依賴和相關條件變數。
Q2離散預測應否使用隨機 PIT?
若要在正確離散分布下使用連續均勻參考,便可採用。額外隨機值會把結果散布在其 CDF 跳躍內。記錄方法和種子;若不想隨機化,可考慮離散專用診斷。
Q3U 形 PIT 直方圖代表甚麼?
通常與過度集中的預測相符;中央隆起則常與過度分散相符。這是提示而非唯一診斷,應再檢查依賴、狀態、樣本及分箱。
Q4PIT 直方圖較好是否等於預測評分較好?
不是。PIT 診斷分布行為;適當評分按指定損失和目標比較預測。應在同一批樣本外結果上報告兩者,不要將任何一者解讀為交易盈利。 原始研究 - Rosenblatt, “Remarks on a Multivariate Transformation” (1952) - Diebold, Gunther, and Tay, “Evaluating Density Forecasts with Applications to Financial Risk Management” (1998) - Berkowitz, “Testing Density Forecasts, with Applications to Risk Management” (2001) - Gneiting, Balabdaoui, and Raftery, “Probabilistic Forecasts, Calibration and Sharpness” (2007) - Brockwell, “Universal Residuals: A Multivariate Transformation” (2007) - Czado, Gneiting, and Held, “Predictive Model Assessment for Count Data” (2009)
資料來源與延伸閱讀
回報問題
我們會準備一封包含本文連結的電郵。寄出後,Mark 才會收到你的回報
快速檢查
讀完指南後,用 3 道題檢查一下
問題 01
正確的連續一步條件預測有甚麼 PIT 結論?
選擇答案即可查看解釋