Skip to content
Todos os guias de opções e contratos futuros
Avaliação conjunta de previsões de risco de cauda14 min

Pontuação conjunta de VaR e ES: Fissler–Ziegel explicado

Entenda por que Value at Risk e Expected Shortfall precisam de uma regra de pontuação conjunta, como comparar previsões com Fissler–Ziegel e como isso difere dos testes de exceções de VaR.

Neste guiaComece pelo par de previsões e pela convenção da cauda

Resumo breve

VaR é um quantil e pode ser avaliado separadamente com uma perda quantílica. Expected Shortfall (ES) é diferente: em classes amplas de distribuições, não é elicitável como previsão pontual isolada. Fissler e Ziegel mostram que VaR e ES podem ser avaliados em conjunto por meio de uma pontuação estritamente consistente sob certas condições. Isso permite comparar pares de previsões, mas uma pontuação baixa não prova que um modelo esteja correto.

Comece pelo par de previsões e pela convenção da cauda

Considere L_t uma perda, em que valores maiores são piores, e c um nível de confiança, por exemplo 97,5%. O quantil condicional da perda v(c,t) é o menor x para o qual F(L_t ≤ x | informação disponível até t−1) alcança c. Para a cauda superior das perdas, ES é e(c,t) = 1/(1−c) vezes a integral de v(u,t) de c até 1, desde que a média da cauda seja finita. Em uma distribuição contínua, isso corresponde à perda média acima do limite de VaR. Se houver massa de probabilidade no limite, a definição pela integral dos quantis inclui apenas a fração necessária dessa massa.

A pontuação precisa usar a mesma convenção das previsões. Alguns estudos definem VaR e ES para a cauda inferior dos retornos, muitas vezes com valores negativos, e chamam a probabilidade de cauda de α = 1−c. Para perdas positivas, usa-se a cauda superior e ES é pelo menos tão grande quanto VaR. Misturar as convenções pode inverter desigualdades e indicadores de exceção. Registre o sinal, o nível de confiança, o horizonte e as informações disponíveis antes do resultado.

Por que VaR e ES não têm a mesma pontuação isolada

Um quantil tem uma pontuação pinball estritamente consistente. Para uma perda L e seu quantil c v, uma pontuação de VaR é S_VaR(v,L) = (I{L ≤ v}−c)(v−L). Sob as condições usuais para quantis, a pontuação esperada é minimizada no quantil-alvo. Assim, VaR pode ser avaliado separadamente usando previsões e observações posteriores.

Para ES, não existe uma pontuação estritamente consistente equivalente que o elicite sozinho nas amplas classes de distribuições de perdas usadas em gestão de risco. A afirmação tem um escopo específico: refere-se a uma previsão pontual isolada cuja pontuação esperada seleciona ES de forma única. Isso não significa que ES seja inútil ou impossível de comparar ou testar.

Fissler e Ziegel mostram a distinção central: ES não é elicitável sozinho nesse sentido, mas o par (VaR, ES) é elicitável em conjunto sob condições moderadas de regularidade e de momentos. O artigo analisa as condições para pontuações estritamente consistentes (Fissler e Ziegel, 2016). Elicitabilidade conjunta quer dizer que uma única função usa ambas as previsões e o resultado observado. Somar duas perdas quaisquer não produz uma pontuação válida para ES.

O que uma pontuação Fissler–Ziegel avalia

Denote por S_c(v,e;L) uma pontuação conjunta admissível no nível c. Consistência estrita significa que a pontuação esperada sob a distribuição-alvo é minimizada pelo par correto: (VaR_c, ES_c) = arg min sobre (v,e) de E[S_c(v,e;L)]. Sob as condições pertinentes, o mínimo é único. A pontuação combina informações sobre o cruzamento do limite VaR, a perda realizada na cauda e a previsão de ES. Para perdas positivas, ES não deve ficar abaixo de VaR.

Fissler e Ziegel descrevem uma classe de pontuações, não uma única fórmula obrigatória. Patton, Ziegel e Chen usam esse resultado para modelos dinâmicos conjuntos de VaR e ES e para comparar previsões (Patton, Ziegel e Chen, 2019). Uma forma comum, FZ0, é escrita para retornos na cauda inferior: Y = −L, α = 1−c e previsões negativas e ≤ v < 0: S_FZ0(Y,v,e;α) = −I{Y ≤ v}(v−Y)/(αe) + v/e + ln(−e) − 1. Essa fórmula depende da convenção de retorno e dos sinais indicados. Não a aplique sem ajustes a dados de perda positiva, nem presuma que seja a melhor para qualquer conjunto de dados. Informe a regra escolhida e confira suas hipóteses.

Como interpretar médias e diferenças de pontuação

Para o modelo m, calcule S_c(v_hat(m,t),e_hat(m,t);L_t) para cada par previsão–resultado e tire a média nas T observações. Com a mesma pontuação admissível, datas, alvo e convenções, uma média menor indica desempenho relativo melhor segundo essa regra. O valor não é uma probabilidade, um valor monetário de VaR nem uma previsão de perda em dinheiro; sua escala depende da pontuação.

Para comparar A e B de forma pareada, calcule d_t = S_A,t − S_B,t. Uma média negativa favorece A segundo a pontuação escolhida. Como ambas as previsões enfrentam a mesma realização, essa diferença pareada informa mais do que duas médias arredondadas separadamente. Ainda assim, pode haver bastante incerteza quando há poucas observações na cauda.

<!-- learn:illustration -->

Compare os mesmos momentos de previsão, carteira ou variável-alvo, horizonte, nível de confiança e versão dos dados. As previsões devem ser registradas antes dos resultados. Se os horizontes se sobrepõem ou as diferenças tiverem dependência serial, a estimativa da incerteza deve refletir isso. Informe um erro padrão ou intervalo adequado; uma pequena diferença bruta não é automaticamente uma vitória confiável.

Duas curvas abstratas de distribuição de perdas mostram um limite vertical e uma cauda destacada, acima de duas bacias conectadas que representam a comparação conjunta de previsões de VaR e ES. A imagem não contém dados nem rótulos.
Ilustração conceitual de limite, cauda e avaliação conjunta das previsões de VaR e ES; não representa uma distribuição observada nem uma previsão.

Por que duas perdas isoladas não bastam

Pode parecer natural somar à perda pinball de VaR um erro absoluto da previsão de ES em relação a algum valor de referência. Mas o próprio valor de referência pode ser inadequado, e o valor esperado desse segundo termo não precisa ser minimizado no ES verdadeiro. Uma soma com pesos arbitrários não garante consistência conjunta. A pontuação FZ é construída para avaliar o par VaR–ES em conjunto.

A classe Fissler–Ziegel contém várias pontuações com escalas e ênfases diferentes. Médias de funções distintas não são diretamente comparáveis. Patton, Ziegel e Chen discutem FZ0 e propriedades de escala sob hipóteses adicionais de sinal; isso não torna FZ0 universalmente superior. Escolha e documente a regra antes de analisar a classificação.

O par de previsões também precisa ser coerente. Uma previsão de ES aparentemente razoável pode pontuar mal se contradizer o VaR associado. Por outro lado, uma boa pontuação conjunta não prova que toda a distribuição condicional esteja correta. A avaliação se refere à função VaR–ES especificada, sob a pontuação e o desenho escolhidos.

As mesmas exceções de VaR podem esconder perdas de cauda diferentes

O indicador de exceção de VaR é binário: I_t = 1 quando L_t ultrapassa o VaR previsto e 0 caso contrário. Dois modelos podem ter as mesmas datas e o mesmo número de exceções, embora as perdas além do limite tenham tamanhos bem diferentes. Quatro violações não mostram se todas foram pequenas ou se uma foi muito maior. Uma simples contagem descarta justamente a magnitude que ES pretende acrescentar.

Uma pontuação conjunta usa as previsões de VaR e ES junto com a perda realizada; por isso, a magnitude das perdas de cauda pode afetar o resultado além da contagem. A função escolhida define a contribuição exata de cada observação. Não declare um vencedor com base em um único evento extremo: calcule a pontuação em toda a amostra comum e examine a sensibilidade.

A comparação por pontuação e o teste de calibração de VaR respondem a perguntas diferentes. A primeira ordena pares de previsões segundo uma regra fixada. Um teste de exceções de VaR examina frequência ou padrões temporais de violações. A classificação não é um certificado completo de calibração.

Testes de exceções e backtests de ES respondem a outras perguntas

Os testes de Kupiec comparam a quantidade de exceções de VaR à taxa-alvo; extensões de Christoffersen também analisam dependência ou agrupamento. Como reduzem cada resultado a exceção ou não exceção, não medem o tamanho das perdas acima do VaR nem validam diretamente a previsão de ES. O guia sobre VaR e Expected Shortfall explica as informações diferentes que as duas medidas carregam.

Acerbi e Szekely propõem backtests não paramétricos de ES e argumentam que a elicitabilidade é relevante para seleção de modelos, mas não é pré-requisito para testar uma medida de risco (Acerbi e Szekely, 2014). Bayer e Dimitriadis desenvolvem backtests de ES baseados em regressão e estrutura conjunta VaR–ES; as variantes têm hipóteses e exigências de covariância próprias (Bayer e Dimitriadis, 2022). Uma classificação por pontuação não substitui um backtest específico. Da mesma forma, deixar de rejeitar não prova que o par de previsões esteja correto.

Planeje a inferência pareada e evite a seleção posterior

A sequência de diferenças de pontuação d_t é uma série temporal. Para previsões de um passo sem sobreposição e hipóteses adequadas de dependência, pode-se considerar um teste pareado da diferença média. Com dependência serial ou horizontes sobrepostos, use uma estimativa de incerteza compatível, como uma variância de longo prazo ou reamostragem em blocos adequada. Informe método e parâmetros, não apenas o valor p.

Defina a pontuação, o nível de cauda, o horizonte, o período de avaliação e o conjunto de modelos antes de examinar os resultados. Testar muitas pontuações, janelas, carteiras e variantes e mostrar apenas o menor resultado cria um problema de seleção. Se possível, reserve um período posterior ainda não usado para escolher o modelo e descreva a busca. Erros padrão comuns não corrigem automaticamente essa seleção.

Informe as médias e a diferença pareada com sua incerteza, a definição da pontuação, os sinais e convenções, as datas comuns fora da amostra e o número de observações na cauda. Se a classificação mudar com escolhas razoáveis de pontuação ou período, mostre essa sensibilidade.

Limitações e lista prática de verificação

Em níveis altos de confiança, há poucas observações na cauda e a classificação pode ser instável até em séries longas. Heterocedasticidade condicional, mudanças de regime, retornos sobrepostos, incerteza de estimação, erros de dados e alterações na carteira também podem afetar diferenças de pontuação. A elicitabilidade conjunta não elimina esses problemas; fornece uma classe de pontuações justificada sob condições matemáticas.

Verifique se a perda realizada corresponde à mesma carteira, horizonte, método de avaliação e sinal da previsão. VaR e ES devem usar a mesma probabilidade de cauda. Confirme que as previsões foram feitas ex ante e que a pontuação satisfaz as hipóteses de distribuição, momentos e sinais. Informe tamanho da amostra, observações de cauda, fórmula, método de incerteza e buscas de modelos ou pontuações. A conclusão fica limitada a esse desenho.

Uma pontuação conjunta menor é evidência de melhor desempenho preditivo relativo sob uma regra específica. Não demonstra que o modelo capture todos os extremos, que sua estimativa seja segura ou que o futuro repita a amostra. Este artigo explica métodos estatísticos e não é recomendação de investimento.

Perguntas frequentes

Q1Posso comparar previsões de ES com erro absoluto?

Não como substituto geral para uma pontuação estritamente consistente. Na comparação de previsões pontuais, ES costuma ser avaliado junto com VaR; para calibração, use um backtest específico de ES.

Q2Uma pontuação conjunta mostra se o modelo de risco está calibrado?

Ela compara o desempenho relativo sob uma pontuação escolhida. Calibração e especificação do modelo são questões distintas e exigem testes e diagnósticos adequados.

Q3Dois modelos podem ter as mesmas exceções VaR e pontuações diferentes?

Sim. Os indicadores podem coincidir, mas diferir o tamanho das perdas além do VaR ou as previsões de ES. O efeito exato depende da função de pontuação.

Q4Uma pontuação baixa significa que o modelo é seguro?

Não. O resultado depende da amostra, da pontuação e das hipóteses. Poucos dados de cauda, mudanças de regime, seleção de modelo ou erros de dados podem alterá-lo. Não é recomendação de investimento.

Fontes e leituras adicionais

Relatar um problema

Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar

Verificação rápida

Terminou o guia? Confira o que aprendeu com 3 perguntas

Pergunta 1 / 3

Pergunta 01

Por que Expected Shortfall costuma ser pontuado junto com VaR?

Escolha uma resposta para ver a explicação

Glossário de opções