VaR 回溯测试:Kupiec 与 Christoffersen 检验详解
了解 Kupiec POF 和 Christoffersen 条件覆盖检验如何评估 VaR 例外,如何解读 250 天示例,以及为什么未拒绝假设并不证明模型准确。
本指南内容VaR 回溯测试检查什么?
简短摘要
VaR 回溯测试会把每次预测的亏损阈值与之后实际发生的亏损比较。Kupiec 检验关注例外次数是否符合目标比例;Christoffersen 检验还会考察例外是独立出现还是聚集出现。它们检验的是预测的不同特征,没有任何一个检验能证明风险模型正确。
VaR 回溯测试检查什么?
Value at Risk(VaR,风险价值)是在给定置信水平和期限下的亏损阈值。如果一天期 99% VaR 为 10,000 美元,模型根据自身所用信息和假设,认为一天亏损超过 10,000 美元的概率为 1%。这不是最大亏损上限,也不说明突破阈值后的损失会有多大。
回溯测试把一串预测和结果转换成 VaR 例外指示序列。若 99% 的一天期模型校准良好,在重复观察可比情形时,长期例外频率应接近 1%。这里有两个不同要求:长期频率应接近目标;例外的时间顺序也不应与模型的条件风险预测相矛盾。Kupiec 的失败比例(POF)检验主要关注第一项。Christoffersen 的独立性检验和条件覆盖检验则把例外顺序纳入分析。
这个区别有实际意义。某模型一年出现四次例外,可能全部集中在一个波动剧烈的星期;另一模型也有四次,但分散在全年。只看次数的检验会把两者都记为四次;关注时序的检验则会看到不同的例外序列。以下检验有助于描述这些特征,但不能替代对持仓、市场数据、假设或亏损严重程度的审查。关于 GARCH 模型如何刻画波动率聚集,可参阅波动率聚集与 GARCH 指南;波动模型描述波动过程,回溯测试则检查风险预测与实际结果是否相符。
计数前先定义例外
整个分析使用一致的符号约定。令 Lₜ 表示第 t 天实现的亏损,VaRₜ|ₜ₋₁ 表示根据 t 日之前可用信息预测的一天期亏损阈值。当 Lₜ > VaRₜ|ₜ₋₁ 时,例外指示变量 Iₜ = 1,否则为 0。若模型是 99% VaR,目标例外概率为 α = 1 − 0.99 = 0.01。有些资料用收益定义指示变量,或定义为结果是否落在覆盖区间内;只要相应调整符号和概率,含义等价。应说明实际采用的定义。
预测和结果必须对应同一投资组合、期限、估值时点和亏损定义。如果收盘后预测下一交易日 VaR,就应按预先确定的估值规则,与下一交易日亏损比较。事先决定如何处理恰好等于 VaR 阈值、节假日、缺失观察、市场休市、盘中数据修订和投资组合变化。例外稀少时,一次分类差异就可能明显影响结果。
Kupiec 的 POF 检验问什么?
假设有 T 组可比较的预测与结果,其中出现 x 次例外。观察到的例外率为 p̂ = x/T。Kupiec 的失败比例检验(参见 Kupiec 1995 年论文)也称无条件覆盖检验,它比较两个二项似然:一个将例外概率固定为目标值 α,另一个则用 p̂ 自由估计。似然比统计量为:
LRᵤ꜀ = −2 ln [ (1−α)^(T−x) α^x / ((1−p̂)^(T−x) p̂^x) ]
在零假设下,例外指示变量是相互独立、概率为 α 的伯努利事件。样本足够大时,该统计量近似服从自由度为 1 的卡方分布。统计量较大时,有理由拒绝所指定的例外频率。由于备择模型会自由估计观察到的比率,例外过多或过少都可能导致拒绝。几乎从未突破 VaR 阈值的模型并不自动代表校准良好;它可能过于保守,不适合预定用途。
POF 使用次数 x,不使用例外发生的日期。调换同一组指示变量的顺序不会改变统计量。因此,单凭 POF 结果无法判断四次例外是分散出现还是连续出现。二项分布的参考结果也假设例外相互独立。如果问题是例外是否聚集,应另加针对依赖性的检验,而不要从 POF 结果推断时序。
250 天示例说明如何解读 p 值
考虑一个假设情景:250 天的一天期 99% VaR 预测。目标概率为 α = 0.01,因此零假设下预期例外数为 Tα = 250 × 0.01 = 2.5。假设实际出现四次例外,则 p̂ = 4/250 = 0.016,即 1.6%。它高于 1% 目标,但仅凭差距还不能判断似然比检验是否拒绝。
代入 T = 250、x = 4 和 α = 0.01,得到 LRᵤ꜀ ≈ 0.769。采用渐近卡方(1)参考分布时,p ≈ 0.38;5% 临界值约为 3.84。按这一近似,该示例在 5% 显著性水平下不会拒绝无条件覆盖假设。这只是用于说明计算的假设例子,并非实证结果或推荐的通用验收标准。
两个对数似然值能显示统计量的来源。将概率固定在目标值时,ℓ₀ = 246 ln(0.99) + 4 ln(0.01) ≈ −20.893。按观察率自由估计时,ℓ₁ = 246 ln(0.984) + 4 ln(0.016) ≈ −20.508。自由模型的对数似然高约 0.385,因此 LRᵤ꜀ = −2(ℓ₀ − ℓ₁) ≈ 0.769。检验衡量相对于目标频率模型的拟合损失,不是以美元计量的误差。
未拒绝并不证明模型校准良好。250 天中预期例外仅为 2.5 次,因此多一两次就会明显改变观察频率。卡方计算是渐近近似,对这种样本规模下的罕见事件,检验功效可能有限。应结合预期次数、预测期限、检验设计和样本量解读统计量。p 值不是 VaR 模型为真的概率。
相同的例外次数可能对应不同的时序
比较两个假设的 250 天序列,每个都有四次例外。A 序列的例外出现在第 20、80、140、220 天;B 序列出现在第 60、61、180、181 天。两者都有 x = 4、p̂ = 1.6%,所以 Kupiec 统计量相同。但 B 有两对相邻例外,而 A 没有。
下方示意图从概念上说明为什么要保留例外序列,而不能只记录总数。它不是 250 天的实际数据,也不是检验结果。连续出现的例外可以促使人们检查模型是否跟上了波动变化,但少数几个点无法单独诊断原因。模型设定错误、市场冲击、投资组合变化、重叠期限或数据与计时规则都可能影响这种模式。
令 nᵢⱼ 表示前一日指示变量为 i、当日为 j 的转移次数,0 表示未发生例外,1 表示发生例外。在不计序列边界的情况下,完整的转移计数为:A 有 n₀₀ = 241、n₀₁ = 4、n₁₀ = 4、n₁₁ = 0;B 有 n₀₀ = 243、n₀₁ = 2、n₁₀ = 2、n₁₁ = 2。两者都是四次,但 B 有两次例外紧跟在前一天的例外之后。这正是一阶独立性检验使用的信息。
例外后一天未发生例外时,估计的例外概率为 n₀₁/(n₀₀+n₀₁);例外后一天又发生例外的概率为 n₁₁/(n₁₀+n₁₁)。A 的估计分别为 4/245 ≈ 1.63% 和 0/4;B 为 2/245 ≈ 0.82% 和 2/4 = 50%。B 中的 50% 只基于四次例外后的转移,是这个微型假设序列的特征,不是对真实模型次日风险的可靠估计。

Christoffersen 独立性检验增加了什么?
Christoffersen 的 1998 年论文 所述独立性检验比较平静日之后与例外日之后的例外概率。令 π₀ = Pr(Iₜ = 1 | Iₜ₋₁ = 0),π₁ = Pr(Iₜ = 1 | Iₜ₋₁ = 1)。独立性零假设为 π₀ = π₁:前一天是否发生例外不会改变今天发生例外的概率。备择模型则根据 n₀₀、n₀₁、n₁₀、n₁₁ 分别估计两种转移概率。
独立性似然比统计量比较这两个模型,通常以自由度为 1 的卡方分布评估。它与 POF 不同,会使用指示变量的顺序。如果例外之后经常紧跟另一次例外,π₁ 可能高于 π₀。该检验针对二元序列的一阶依赖性,并不检验过去信息、波动率或投资组合状态预测未来亏损的所有方式。
例外次数很少时,转移概率估计尤其不稳定。如果没有连续例外,π₁ 的估计可能落在零的边界;这不表示第二次例外不可能,只表示样本中没有观察到。应同时检查转移次数和样本量。不要把稀疏列联表解释成对次日尾部风险的精确估计。
条件覆盖结合频率与独立性
条件覆盖检验将 Kupiec 频率统计量与 Christoffersen 独立性统计量相加:LR꜀꜀ = LRᵤ꜀ + LRᵢₙd。联合零假设要求例外概率等于 α,且例外在时间上相互独立。在标准的大样本设定下,总和与自由度为 2 的卡方分布比较。
除联合检验外,也应报告各组成检验。拒绝条件覆盖表示在检验假设下,联合要求与观察到的序列不相容,但不能指出原因。如果 POF 被拒绝而独立性未被拒绝,次数可能是更明确的信号。如果独立性被拒绝,即使总数接近目标,也应关注例外时序。如果两者都未被拒绝,样本仍可能太短,无法揭示模型设定问题。
检验的解释范围很窄:每天的亏损被压缩成 0/1 指示变量,因此无法区分超过 VaR 1 美元与超过 100 万美元。它也不能验证完整亏损分布,或证明 Expected Shortfall 正确。有关 VaR 和 Expected Shortfall 回答不同风险问题的说明,请看 VaR 与 Expected Shortfall 对比。
例外稀少会让短样本推断更困难
99% VaR 在 250 天样本中只有 2.5 次预期例外。若 1% 的例外彼此独立,在 249 个相邻日对中,预期的连续例外转移数约为 249 × 0.01² = 0.025。即使模型校准良好,大多数此类样本也不会出现连续例外。事件稀少使转移概率难以精确估计,也可能导致依赖性检验功效不足。
Christoffersen 与 Pelletier 2004 年的研究 指出现有 VaR 回溯检验在现实的小样本中可能功效较低,并研究了对例外间隔时间建模的 duration 检验。这些结果说明可以考虑增加诊断方法,但并不意味着 duration 检验在所有情况下都更优,也不免除根据风险预测和样本设计选择检验的需要。观测较少时,应说明限制,而不要把未拒绝当成模型健康证明。
目标尾部率也会改变证据量。95% VaR 在 250 天中预期有 12.5 次例外;99.9% VaR 则只有 0.25 次。检验名称相同,不代表不同设计下的证据可直接比较。应报告置信水平、预测期限、观测数、目标与实际次数、转移数,以及使用的是渐近计算还是有限样本方法。
什么时候应该使用其他诊断?
选择下一个诊断时,先问前两个检验舍弃了什么信息。如果要检验例外是否能由滞后例外、VaR 预测或预测时已知的其他变量预测,Engle 与 Manganelli 的 CAViaR 论文提出的动态分位数(DQ)检验会检验中心化例外指示变量及所选工具变量的约束。结论取决于变量选择和变量在预测时是否可用;它不是对所有条件失效的检验。duration 检验则研究例外之间的等待时间,扩展的是另一类信息。
如果关注超过 VaR 阈值后的亏损严重程度,仅看频率和独立性还不够。应检查超额损失大小,并选择符合预测与假设的 Expected Shortfall 评估方法。如果担心尝试许多模型后只挑出历史表现最好的结果,VaR 回溯测试无法解决策略选择问题;PBO 与 CSCV介绍了另一种基于候选模型排名的诊断。
一份有用的报告应说明投资组合和亏损约定、预测期限、置信水平、评估日期、预测生成方式、例外定义、预期和实际次数、POF 统计量、转移次数、独立性与条件覆盖结果,以及短样本或期限重叠带来的限制。按时间绘出预测阈值与实际亏损,并在模型选择期间封存后续评估数据。这些做法让历史证据更易解释,但不能保证未来风险得到控制。
常见问题
Q1Kupiec 检验未拒绝假设,是否表示我的 VaR 模型准确?
不是。这表示在检验假设下,没有发现足够证据反对指定的例外率。样本较短时,尤其是 99% 或更高置信水平,例外可能少到无法暴露问题。
Q2两个 Kupiec 检验结果相同的模型,例外模式会不同吗?
会。Kupiec 统计量只取决于次数,不取决于顺序。Christoffersen 独立性检验会补充例外是否在相邻观测中聚集的信息。
Q3这些检验能告诉我超过 VaR 后亏损会有多大吗?
不能。它们只使用是否突破阈值的指示变量,不衡量超额亏损大小。如果尾部亏损严重程度很重要,应单独检查超额损失并评估 Expected Shortfall。
资料来源与延伸阅读
报告问题
我们会准备一封包含本文链接的邮件。发送后,Mark 才会收到你的反馈
快速检查
读完指南后,用 3 道题检查一下
问题 01
Kupiec 的 POF 检验使用什么特征?
选择答案即可查看解释