概率积分变换:如何评估密度预测的校准
了解 PIT 如何评估连续与离散密度预测、直方图能说明什么,以及为什么仅有均匀性并不充分
本指南内容为什么密度预测不能只看点预测误差
简短摘要
密度预测会为一系列可能结果分配概率。概率积分变换(PIT)将每个观测结果转成预测分布下的累积概率。在特定假设下,均匀 PIT 是有用的诊断;但直方图看似平坦,并不能单独证明条件校准或时间独立性。
为什么密度预测不能只看点预测误差
点预测可能说次日收益率为 0.2%;密度预测则为整个收益率范围分配概率,覆盖常见波动与极端事件。评估要问的是:结果发生前发布的分布是否与之后的观测相符。Mincer–Zarnowitz 指南讨论数值点预测的线性校准,是另一个问题。
PIT 衡量预测分配给“不高于实际值”的累积概率。它是概率秩,不是收益、交易信号或利润指标。Diebold–Mariano 指南按选定评分比较平均预测损失,回答的问题不同于密度校准。
用累积分布函数变换连续预测
令预测起点 (t) 之后的结果为 (Y_{t+1}),令 (F_{t+1}(y\mid\mathcal I_t)) 为仅基于当时可用信息 (\mathcal I_t) 的预测累积分布函数(CDF)。连续分布的 PIT 为
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ)
CDF 表示取值不超过 (y) 的概率。若预测 CDF 是真实条件分布,PIT 定理给出
Pr(Uₜ₊₁ ≤ u | 𝓘ₜ) = u, for 0 ≤ u ≤ 1
因此,理想的连续一步预测会在给定预测信息时产生均匀 PIT。若序列信息包含过去,且假设成立,理想 PIT 在各预测起点之间也独立。Rosenblatt 研究了这一变换;Diebold、Gunther 与 Tay 将 PIT 序列用于密度预测评估(1952;1998)。
手算示例:预测为 (N(0,1)),观察值为 (y=1),则 PIT 为 (Phi(1)\approx0.8413),表示约 84.13% 的预测概率位于 1 以下。单次观测无法判定校准,需要一组预测与结果。
离散结果要随机化变换
离散 CDF 会在可能结果处跳跃,因此普通 (F(Y)) 只能取有限的若干值,即使预测正确也通常不服从 Uniform(0,1)。随机 PIT 用随机数填满每个跳跃区间:
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ) + Vₜ₊₁ [Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ) − Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ)]
(F(y^-)) 是左极限,即结果严格小于 (y) 的概率;(V) 是仅用于评估的独立 Uniform(0,1) 随机数。连续分布没有跳跃,公式就化为 (F(Y))。Brockwell 证明该随机变换适用于一般分布,包括离散和混合分布(2007)。对于有序计数数据,Czado、Gneiting 与 Held 还讨论了非随机 PIT 和边际校准图;不要把离散 (F(Y)) 当作连续均匀变量来评估(2009)。
假设 Bernoulli 预测满足 (P(Y=1)=0.20)、(P(Y=0)=0.80)。普通 PIT 在 (Y=0) 时为 0.80,在 (Y=1) 时为 1.00,并不均匀。随机化后,(Y=0) 映射到 ([0,0.80]) 中的 (0.80V),(Y=1) 映射到 ([0.80,1]) 中的 (0.80+0.20V)。按事件概率加权后,整体密度在 ([0,1]) 上均匀。随机数只是评估工具,不属于预测本身。
区分边际均匀、独立与条件校准
边际 PIT 均匀是理想连续预测的必要条件,但并非充分条件。不同市场状态中的相反错误可能在汇总后抵消,使直方图看上去平坦。Gneiting、Balabdaoui 与 Raftery 展示了 PIT 近似均匀、个别预测却有偏的情况(2007)。
顺序同样重要:序列的边际直方图可以均匀,却仍存在时间依赖,例如聚集或长串相似值。理想条件预测蕴含的内容超过汇总均匀性。若预测期重叠,参考分布和独立性条件也要反映重叠;不能默认 iid 检验适用。
除 PIT 分布外,也要检查它与时间、滞后值、预测起点变量及预先定义状态的关系。分组图或条件检验可揭示被汇总掩盖的模式,但分组选择和有限样本会带来限制。有限组检验不能证明对所有可能条件变量都已校准。
把 PIT 直方图当线索,而非结论
U 形常与预测过度集中或离散程度不足相符;中间隆起常与预测过度分散相符;左右不对称可能提示位置偏差。这些只是启发式线索,并非唯一诊断:依赖、状态混合、离散结果、分箱方式和小样本都可能造成误读。
直方图丢掉了观测顺序,无法显示问题何时开始、极端 PIT 是否聚集或某个子群体是否失准。分箱过宽会掩盖问题,过窄则可能显出抽样噪声。尽可能报告预测数量、箱界和不确定性。Diebold–Gunther–Tay 框架与 Berkowitz 检验都是需要匹配研究设计假设的正式方法。Berkowitz 将内部 PIT 转换为 (Z_t=\Phi^{-1}(U_t)),检验独立标准正态的联合原假设,对比指定的动态备择(如 AR(1));这不是通用合格证(2001)。
<!-- learn:illustration -->

纳入参数估计,并进行样本外评估
均匀性结论假设 CDF 就是真实条件分布。实际中参数需要估计,分布族、阈值和特征也要选择,因此 (F_{t+1}(\cdot;\hat\theta_t)) 属于预测流程的一部分。若用评估期结果拟合模型,再把 PIT 称为未触碰的样本外证据,就是信息泄漏。
滚动评估要在每个起点只用当时可用的信息,并记录估计窗口、重估频率、数据版本、模型版本和选择步骤。相邻窗口通常共享观测,重叠结果会进一步造成依赖。
检验的尺寸与功效取决于估计量、样本和程序。PIT 直方图不包含参数不确定性;教材里的 iid 参考值也不适用于所有估计或重叠设计。若推断重要,应选与设计匹配的检验,或重复完整估计与预测流程来模拟/自助法构造原假设分布。必要时,将最终评估样本留在模型选择之外。
区分校准与锐度
校准关注预测和结果之间的关系:被赋予某个概率的事件是否以相应频率发生?锐度描述预测分布自身的集中程度,不看结果。Gneiting、Balabdaoui 与 Raftery 指出,锐度应在校准成立的前提下追求,不能替代校准。
较宽的预测可能校准良好但信息量有限。较窄的预测看似精确;若结果频繁落在其概率质量范围外,仍可能校准不佳。PIT 检查分布一致性,锐度摘要描述离散程度或区间宽度。只报告其中之一会遗漏一部分评价。
总体 PIT 平坦可能掩盖波动状态或预测期下的错误。重要条件应提前定义。这与点预测回归以及Giacomini–White 条件预测能力检验相关但不同;后者按选定信息比较条件预测损失。
在相同结果上用适当评分比较完整预测
PIT 主要是诊断工具,不会单独给密度预测排序。对数评分与连续排序概率评分(CRPS)为每个预测—结果组合分配标量损失;按定义,报告真实预测分布可使期望损失最小。但单个样本的平均值不能证明模型正确。Model Confidence Set 指南介绍集合式比较。比较密度预测时,应使用针对完整分布定义的评分,并在相同结果上计算。
说明预测目标、预测期、共同日期、损失约定与基准。对数评分对观测点处极低密度尤其敏感;CRPS 比较 CDF,敏感性不同。评分差的不确定性应考虑序列依赖、估计和模型搜索。PIT 图与评分各有作用,可一并报告。
校准或更优评分都不能证明交易盈利。交易主张还需独立定义决策规则、信息可用时点、头寸规模、交易与资金成本以及样本外收益评估。预测评价统计量不是回测收益。
使用可复现的 PIT 流程
先固定目标、预测期、起点时间、结果版本,以及分布属于连续、离散还是混合。保存每个预测 CDF 或足以重建它的数据,并记录实际值和信息集。连续情形计算 (F_t(Y_t));有跳跃时,记录随机 PIT 方法或使用适用于离散数据的诊断。
检查边际分布和时间顺序,说明分箱、样本量、并列值处理以及随机种子/重复随机化方案。针对事先定义的问题添加独立性或条件检验,并采用适用于滚动、重叠或估计流程的推断。模型比较另用适当评分,在相同留出结果上进行。结论只适用于所定义的预测和条件,不保证未来校准或交易收益。
常见问题
Q1PIT 均匀能证明密度预测正确吗?
不能。对于正确连续预测,它是必要的诊断条件,但汇总均匀性不能证明独立或条件校准。还应检查时间依赖和相关条件变量。
Q2离散预测是否应使用随机 PIT?
若希望在正确离散分布下采用连续均匀参照,可以使用。额外随机数将结果分散到其 CDF 跳跃区间内。记录方法和种子;若不想随机化,可考虑离散专用诊断。
Q3U 形 PIT 直方图意味着什么?
常与预测过度集中相符;中间隆起常与预测过度分散相符。应视为线索,并检查依赖、状态、样本量和分箱。
Q4更好的 PIT 直方图等于更好的预测评分吗?
不等于。PIT 诊断分布行为;适当评分在给定损失和目标下比较预测。应使用相同样本外结果报告两者,也不要将其解释为交易利润。 原始研究 - Rosenblatt, “Remarks on a Multivariate Transformation” (1952) - Diebold, Gunther, and Tay, “Evaluating Density Forecasts with Applications to Financial Risk Management” (1998) - Berkowitz, “Testing Density Forecasts, with Applications to Risk Management” (2001) - Gneiting, Balabdaoui, and Raftery, “Probabilistic Forecasts, Calibration and Sharpness” (2007) - Brockwell, “Universal Residuals: A Multivariate Transformation” (2007) - Czado, Gneiting, and Held, “Predictive Model Assessment for Count Data” (2009)
资料来源与延伸阅读
报告问题
我们会准备一封包含本文链接的邮件。发送后,Mark 才会收到你的反馈
快速检查
读完指南后,用 3 道题检查一下
问题 01
正确的连续一步条件预测会带来什么 PIT 结论?
选择答案即可查看解释