Skip to content
全部期权指南
尾部风险预测的联合评估14 min

VaR–ES 联合评分:Fissler–Ziegel 预测评估

了解为什么 Value at Risk 与 Expected Shortfall 需要联合评分规则、如何用 Fissler–Ziegel 分数比较预测,以及它与 VaR 例外检验的区别。

本指南内容先明确预测对和尾部约定

简短摘要

VaR 是一个分位数,可以用分位数损失单独评分。Expected Shortfall(ES)则不同:在较广泛的分布类别中,ES 不能作为独立点预测被 elicitable。Fissler 和 Ziegel 证明,在适当条件下,可以用严格一致的联合分数同时评估 VaR 和 ES。这使预测对可以进行比较,但低分并不能证明风险模型正确。

先明确预测对和尾部约定

令 L_t 表示损失,数值越大越差;c 表示置信水平,例如 97.5%。条件损失分位数 v(c,t) 是使 F(L_t ≤ x | 截至 t−1 可得的信息) 达到 c 的最小 x。对正损失的上尾约定,若尾部均值有限,ES e(c,t) 等于 v(u,t) 从 c 到 1 的积分乘以 1/(1−c)。在连续分布下,它等于超过 VaR 阈值后的平均损失。如果阈值处有概率质量,分位数积分定义会计入所需比例的质量。

评分必须采用与预测相同的约定。一些论文针对收益率下尾定义 VaR 和 ES,通常使用负值,并以 α = 1−c 表示尾部概率。对正损失约定,同一风险位于上尾,且 ES 不小于 VaR。混用约定可能颠倒不等式和例外指标。应记录符号、置信水平、预测期限,以及结果发生前可用的信息。

为什么 VaR 和 ES 没有相同的独立评分

分位数有熟悉的严格一致 pinball 分数。对损失 L 和其 c 分位数 v,一个 VaR 分数为 S_VaR(v,L) = (I{L ≤ v}−c)(v−L)。在通常的分位数条件下,其期望值在目标分位数处最小,因此 VaR 可以单独评估。

对于风险管理中常见的广泛损失分布类别,不存在一个同等的严格一致分数可以只 elicitable ES。这个结论针对独立点预测,以及其期望分数能唯一选出 ES 的情况。它不表示 ES 没有意义、无法检验,或不能作为更完整预测的一部分进行比较。

Fissler 和 Ziegel 揭示了关键区别:ES 单独而言在此意义下不可 elicitable,但在适当的正则性和矩条件下,(VaR, ES) 可以联合 elicitable。他们 2016 年的论文给出了广泛严格一致分数类别的必要和充分条件 (Fissler and Ziegel, 2016)。联合 elicitability 指一个评分函数同时接收两项预测和实际结果。随意相加两个损失并不会自动得到有效的 ES 分数。

Fissler–Ziegel 分数评估什么

用 S_c(v,e;L) 表示置信水平 c 下可用的联合分数。严格一致表示在目标分布下,期望分数在正确预测对处最小:(VaR_c, ES_c) = arg min over (v,e) of E[S_c(v,e;L)]。在相关条件下,最小值唯一。分数将是否越过 VaR 边界的信息,与实际尾部损失和 ES 预测结合起来。对正损失上尾,ES 不应低于 VaR。

Fissler–Ziegel 描述的是一类分数,而不是唯一必用公式。Patton、Ziegel 和 Chen 将该结果用于动态 VaR–ES 预测的建模与比较 (Patton, Ziegel, and Chen, 2019)。一个常用成员 FZ0 针对收益率下尾约定书写:Y = −L、α = 1−c,且负预测 e ≤ v < 0: S_FZ0(Y,v,e;α) = −I{Y ≤ v}(v−Y)/(αe) + v/e + ln(−e) − 1。 这个表达式依赖收益率符号约定及上述负值假设。它不能直接用于所有正损失数据或所有联合分数。应说明选用的分数,并核对其假设是否符合数据和预测约定。

谨慎解读分数水平与差值

对模型 m,在每个预测—结果对上计算联合分数,再求平均:mean_S_m = (1/T) Σ_t S_c(v_hat(m,t), e_hat(m,t); L_t)。当采用相同的可用分数、日期、目标和约定时,较低均值表示按该规则相对表现更好。分数不是概率、VaR 金额或货币损失估计;数值尺度取决于所选分数。

比较 A 和 B 时,构造 d_t = S_A,t − S_B,t。平均差为负表示按所选分数 A 更优。两个预测面对相同的实际结果,因此配对差值比比较分别取整的平均值更有信息。不过,尾部观测很少时,差值仍可能不稳定。

<!-- learn:illustration -->

比较时应统一预测起点、投资组合或目标、期限、置信水平和数据版本。预测必须在结果出现前记录。如果期限重叠或分数差存在序列相关,不确定性计算应反映这种依赖。报告适当的标准误或区间;很小的原始差值本身并不说明结果可靠。

两条抽象损失分布曲线显示一条竖直阈值线和突出显示的尾部,下方两个相连的容器象征对VaR与ES预测进行联合比较。图中没有数据或文字标签。
阈值、尾部及VaR–ES联合评估的概念示意图,不代表观测到的分布或预测。

为什么两个独立损失不能替代

一种看似自然的做法,是把 VaR pinball 损失与 ES 预测和某个代理值之间的绝对误差相加。但第二项未必是有效的 ES 分数,任意加权和也不保证联合一致性。FZ 分数经过构造,使预测对共同针对 VaR–ES 泛函。若任意改动权重或变换而失去该性质,评估的问题也会改变。

Fissler–Ziegel 类别包含多个灵敏度和尺度不同的分数,因此不同分数产生的差值不能直接比较。Patton、Ziegel 和 Chen 讨论了分数设计,以及在额外符号假设下 FZ0 的尺度性质;这不意味着 FZ0 在所有场景中都最佳。应在查看排名前选定并报告评分规则。

预测对本身也很重要。数值上看似合理的 ES 预测可能与配套 VaR 不一致。反过来,联合分数表现良好,也不能证明整个条件分布正确。分数评估的是所选规则和评估设计下的 VaR–ES 泛函。

相同的 VaR 例外可能掩盖不同的尾部损失

VaR 例外指标是二元的:L_t 超过 VaR 预测时 I_t = 1,否则为 0。两个模型可能有相同的例外次数和发生时间,但阈值以上的损失规模差异很大。四次突破并不能说明损失只是略微超出还是远超 VaR。仅计数会丢掉 ES 所描述的尾部严重程度。

联合分数会同时使用 VaR 阈值、ES 预测和实际损失,因此尾部损失规模可能在命中次数之外继续影响分数。每个观测的具体贡献由所选分数决定。不要依据一次极端损失判断胜者;应在完整共同样本上计算分数并检查敏感性。

用评分进行预测比较,与检验 VaR 例外频率不是同一件事。联合分数用于判断哪个预测对在共同规则下表现较好,它本身不是完整的校准证明。

例外检验与 ES 回测回答不同问题

Kupiec 类 VaR 检验将例外数与目标频率比较;Christoffersen 类扩展还检查依赖或聚集。由于它们将每次结果简化为命中或未命中,因此不衡量 VaR 以上的损失规模,也不直接验证 ES 预测。VaR 与 Expected Shortfall 指南说明了为什么例外计数会漏掉尾部严重程度。

联合评分支持相对预测比较,而回测询问预测在指定程序下是否得到充分校准。Acerbi 和 Szekely 提出非参数 ES 回测,并指出 elicitability 对模型选择有用,却不是检验风险度量的前提 (Acerbi and Szekely, 2014)。Bayer 和 Dimitriadis 后来提出基于回归的 ES 回测,利用 VaR–ES 联合结构;不同变体各有假设与协方差要求 (Bayer and Dimitriadis, 2022)。分数排名不能代替专门的回测,未拒绝原假设也不证明预测对准确。

规划配对推断,避免选择信息泄漏

应把分数差序列视作时间序列数据。若是一阶、非重叠预测且依赖假设适当,可以考虑对平均差进行配对检验。存在序列相关或期限重叠时,应使用能反映该依赖的推断方法,例如长期方差估计或区块重抽样。除 p 值外,还应说明方法和带宽或区块规则。

在查看排名前固定分数、尾部水平、期限、评估日期和模型集合。尝试多个分数、窗口、资产或预测版本后只报告最佳者,会产生选择效应。条件允许时保留后续评估期,并披露筛选方案的过程。通常的不确定性计算不会自动考虑这种搜索。

同时报告平均分数、配对差值及其不确定性、分数定义、VaR 与 ES 约定、共同样本外日期和尾部观测数。如果合理的分数或期间选择会改变排名,应展示这种敏感性。

局限与实用报告清单

置信水平越高,尾部观测越少,即使时间序列很长,模型排名也可能不稳定。条件异方差、制度变化、收益重叠、估计误差、数据问题和投资组合变化都可能影响分数差。联合 elicitability 不会消除这些问题;它是在数学条件下提供有原则的评分类别。

检查实际损失是否与预测对应同一投资组合、期限、估值方法和符号;VaR 与 ES 是否采用相同尾部概率;预测是否事先生成;评分是否满足自身假设。报告样本长度、尾部数量、分数公式、配对不确定性方法及任何模型或分数搜索。结论以该评估设计为条件。

较低的联合分数是在特定适当评分规则下相对预测表现更好的证据。它不能证明模型捕捉了所有尾部事件、风险估计安全,或未来会与样本相似。本文提供统计信息,不构成投资建议。

常见问题

Q1可以用绝对误差比较 Expected Shortfall 预测吗?

不能把它作为严格一致评分的一般替代。ES 单独在广泛分布类别中不可 elicitable;严谨的点预测比较通常将 ES 与 VaR 联合评分,若问题是校准则使用专门的 ES 回测。

Q2VaR–ES 联合分数能说明风险模型是否校准吗?

它按所选联合分数比较相对表现。校准与模型设定错误是不同问题,还需配合适当的回测和诊断。

Q3两个模型的 VaR 例外相同,联合分数会不同吗?

会。命中指标可以相同,但 VaR 以上的损失规模或 ES 预测可能不同。具体影响取决于分数。

Q4低分是否意味着模型可以安全使用?

不是。这只是基于所选分数和假设的样本比较。尾部数据稀少、制度变化、模型选择或数据问题都可能改变结果。本文不是投资建议。

资料来源与延伸阅读

报告问题

我们会准备一封包含本文链接的邮件。发送后,Mark 才会收到你的反馈

快速检查

读完指南后,用 3 道题检查一下

问题 1 / 3

问题 01

为什么通常将 Expected Shortfall 与 VaR 一起评分?

选择答案即可查看解释

期权术语表