Skip to content
Todos os guias de opções e contratos futuros
Teste a frequência e o momento das violações de VaR12 min de leitura

Backtesting de VaR: testes de Kupiec e Christoffersen explicados

Entenda como o teste POF de Kupiec e os testes de cobertura condicional de Christoffersen avaliam violações de VaR, como ler um exemplo de 250 dias e por que não rejeitar não prova precisão.

Neste guiaO que um backtest de VaR verifica?

Resumo breve

O backtest de VaR compara o limite de perda previsto com a perda que ocorreu depois. O teste de Kupiec verifica se o número de violações é compatível com a taxa-alvo. Os testes de Christoffersen também avaliam se as violações ocorrem de forma independente ou se aparecem agrupadas. Eles examinam aspectos diferentes da previsão; nenhum deles prova que o modelo de risco está correto.

O que um backtest de VaR verifica?

Value at Risk (VaR) é um limite de perda associado a um nível de confiança e a um horizonte. Se o VaR diário de 99% for de US$ 10.000, o modelo atribui uma probabilidade de 1% a uma perda diária superior a US$ 10.000, dadas as informações e premissas especificadas. VaR não é um limite máximo de perda e não descreve o tamanho de uma perda depois que esse limite é ultrapassado.

O backtest transforma uma sequência de previsões e resultados em uma sequência de indicadores de violação. Com um VaR diário de 99%, um modelo bem calibrado deve produzir violações em cerca de 1% das observações comparáveis ao longo de repetições. Essa afirmação tem duas partes: a frequência de longo prazo deve ficar perto da taxa-alvo, e as violações não devem aparecer em um padrão incompatível com as previsões condicionais de risco do modelo. O teste proportion-of-failures (POF) de Kupiec se concentra na primeira parte. Os testes de independência e de cobertura condicional de Christoffersen também consideram a ordem das violações.

A distinção é prática. Um modelo pode ter quatro violações em um ano, todas concentradas em uma semana turbulenta. Outro pode ter as mesmas quatro violações distribuídas pelo ano. Um teste baseado apenas na contagem vê quatro nos dois casos; um teste que considera o momento vê sequências diferentes. Os testes abaixo ajudam a descrever essas características, mas não substituem a análise das posições, dos dados de mercado, das premissas ou da severidade das perdas. O guia separado sobre GARCH e agrupamento de volatilidade explica como modelos GARCH representam esse agrupamento; um modelo de variância e um backtest respondem a perguntas diferentes.

Defina a violação antes de contá-la

Use uma única convenção de sinal em toda a análise. Seja Lₜ a perda realizada no dia t e VaRₜ|ₜ₋₁ o limite de um dia previsto com as informações disponíveis antes do dia t. Defina o indicador de violação como Iₜ = 1 quando Lₜ > VaRₜ|ₜ₋₁ e Iₜ = 0 caso contrário. Para um modelo de VaR de 99%, a probabilidade-alvo de violação é α = 1 − 0.99 = 0.01. Algumas fontes definem o indicador usando retornos ou a inclusão em um intervalo; as convenções são equivalentes quando o sinal e a probabilidade são traduzidos corretamente. Informe qual delas está usando.

Previsão e resultado precisam se referir à mesma carteira, horizonte, horário de avaliação e definição de perda. Se a previsão é feita após o fechamento para o próximo pregão, compare-a com a perda desse próximo dia usando uma regra de avaliação consistente. Defina antes como tratar igualdade no limite de VaR, feriados, observações ausentes, fechamentos de mercado, correções intradiárias e mudanças na carteira. Essas escolhas podem alterar a sequência de hits, principalmente quando as violações são raras.

Mantenha a estimação do modelo separada da avaliação final. Se parâmetros ou limites de risco foram escolhidos depois de examinar o mesmo período usado no teste, o valor-p já não representa uma verificação out-of-sample limpa. Em previsões móveis, registre quando cada previsão foi feita e quais informações estavam disponíveis naquele momento. Previsões de vários dias com períodos sobrepostos podem tornar os indicadores de violação dependentes. Os testes padrão abaixo não corrigem automaticamente horizontes incompatíveis, informação futura, dados revisados ou o processo de seleção do modelo.

Que pergunta o teste POF de Kupiec responde?

Suponha que existam T pares comparáveis de previsão e resultado e x violações. A taxa observada é p̂ = x/T. O teste proportion-of-failures (POF) de Kupiec, também chamado de teste de cobertura incondicional, compara duas verossimilhanças binomiais: uma fixa a probabilidade de violação na meta α; a outra estima essa probabilidade livremente como p̂. O teste foi apresentado no artigo de Kupiec de 1995; há também um registro no arquivo do Federal Reserve. A estatística da razão de verossimilhanças é

LRᵤ꜀ = −2 ln [ (1−α)^(T−x) α^x / ((1−p̂)^(T−x) p̂^x) ].

Sob a hipótese nula, as violações são eventos Bernoulli independentes com probabilidade α. Em uma amostra suficientemente grande, a estatística tem distribuição assintótica qui-quadrado com um grau de liberdade. Um valor alto rejeita a frequência de violações especificada. Como a hipótese alternativa estima livremente a taxa observada, o teste pode rejeitar tanto quando há violações demais quanto quando há de menos. Um modelo cuja VaR quase nunca é ultrapassada não está automaticamente calibrado: pode ser conservador demais para o objetivo pretendido.

O teste POF usa a contagem x, não as datas das violações. Reordenar os mesmos indicadores não muda a estatística. Portanto, o resultado não distingue quatro violações espalhadas de quatro violações consecutivas. A verossimilhança Bernoulli também pressupõe independência dos indicadores para sua distribuição de referência. Se a pergunta é sobre agrupamento, acrescente um teste de dependência em vez de inferir agrupamento a partir do POF.

Um exemplo de 250 dias mostra por que o valor-p precisa de contexto

Considere uma série hipotética de 250 previsões de VaR diária a 99%. A taxa-alvo é α = 0.01; sob a hipótese nula, o número esperado de violações é Tα = 250 × 0.01 = 2.5. Suponha que a série tenha quatro violações. A taxa observada é p̂ = 4/250 = 0.016, ou 1.6%. Ela está acima da meta de 1%, mas essa diferença, por si só, não determina se o teste da razão de verossimilhanças rejeita.

Substituindo T = 250, x = 4 e α = 0.01, obtemos LRᵤ꜀ ≈ 0.769. Usando a referência assintótica qui-quadrado(1), p ≈ 0.38; o valor crítico de 5% é aproximadamente 3.84. Por essa aproximação, o exemplo não rejeita a hipótese de cobertura incondicional no nível de 5%. O cálculo é hipotético, não um resultado empírico nem um limite de aceitação recomendado.

As duas log-verossimilhanças mostram de onde vem a estatística. Com a taxa-alvo fixa, ℓ₀ = 246 ln(0.99) + 4 ln(0.01) ≈ −20.893. Com a taxa observada irrestrita, ℓ₁ = 246 ln(0.984) + 4 ln(0.016) ≈ −20.508. O ajuste irrestrito é cerca de 0.385 unidade de log-verossimilhança maior; por isso LRᵤ꜀ = −2(ℓ₀ − ℓ₁) ≈ 0.769. O teste mede a perda de ajuste em relação ao modelo da taxa-alvo, não uma diferença em reais.

Não rejeitar não demonstra que o modelo esteja bem calibrado. Eram esperadas apenas 2.5 violações, então um ou dois eventos a mais mudam visivelmente a taxa observada. A referência qui-quadrado é assintótica, e testes de eventos raros podem ter pouco poder em uma amostra desse tamanho. Leia a estatística junto com a contagem esperada, o horizonte de previsão, o desenho do teste e o tamanho da amostra. O valor-p não é a probabilidade de o modelo de VaR ser verdadeiro.

A mesma contagem de violações pode esconder momentos diferentes

Compare duas sequências hipotéticas de 250 dias, cada uma com quatro violações. Na sequência A, elas ocorrem nos dias 20, 80, 140 e 220. Na sequência B, nos dias 60, 61, 180 e 181. Ambas têm x = 4 e p̂ = 1.6%, portanto a estatística de Kupiec é idêntica. Mas B contém dois pares de violações em dias consecutivos, enquanto A não contém nenhum.

O esquema abaixo mostra por que vale a pena preservar a ordem da sequência de hits, e não apenas o total. É conceitual, não representa uma série de dados de 250 dias nem o resultado de um teste. Violações consecutivas podem ser compatíveis com um modelo que demora a responder a mudanças de volatilidade, mas poucos pontos não identificam a causa. O padrão também pode refletir especificação incorreta, choque de mercado, mudanças na carteira, horizontes sobrepostos ou convenções de dados e horário.

Seja nᵢⱼ o número de transições em que o indicador anterior é i e o atual é j; 0 significa sem violação e 1 significa violação. Desconsiderando os limites da amostra, a sequência A tem n₀₁ = 4 e n₁₁ = 0; B tem n₀₁ = 2 e n₁₁ = 2. Ambas têm quatro violações, mas algumas ocorrências de B vêm depois de outra violação. Essa é a informação usada por um teste de independência de primeira ordem.

A tabela completa de transições é A: n₀₀ = 241, n₀₁ = 4, n₁₀ = 4, n₁₁ = 0; B: respectivamente 243, 2, 2 e 2. A probabilidade estimada de hit após um dia sem violação é n₀₁/(n₀₀+n₀₁); depois de um hit é n₁₁/(n₁₀+n₁₁). Para A, são 4/245 ≈ 1.63% e 0/4 = 0%. Para B, 2/245 ≈ 0.82% e 2/4 = 50%. Esse valor de 50% vem de apenas quatro transições hipotéticas após um hit; não é uma estimativa confiável do risco do modelo real no dia seguinte.

Diagrama conceitual sem texto compara duas sequências de violações de VaR com o mesmo comprimento e o mesmo número de violações: uma dispersa e outra agrupada em pares de dias consecutivos.
A mesma contagem de violações pode ter momentos diferentes. O esquema mostra apenas o agrupamento; não é dado de mercado nem resultado de teste.

O que o teste de independência de Christoffersen acrescenta?

O teste de independência de Christoffersen avalia se a probabilidade de violação hoje muda conforme houve ou não uma violação ontem. Escreva π₀ = Pr(Iₜ = 1 | Iₜ₋₁ = 0) e π₁ = Pr(Iₜ = 1 | Iₜ₋₁ = 1). Sob a hipótese nula de independência, π₀ = π₁. Sob a alternativa, as duas probabilidades de transição são estimadas separadamente a partir de n₀₀, n₀₁, n₁₀ e n₁₁.

A estatística da razão de verossimilhanças compara os dois modelos e costuma ser avaliada pela referência assintótica qui-quadrado com um grau de liberdade. Ao contrário do POF, ela depende da ordem dos indicadores. Se as violações tendem a ser seguidas por outras violações, π₁ pode superar π₀. O teste trata especificamente da dependência de primeira ordem na sequência binária; não verifica todas as formas pelas quais informações passadas, volatilidade ou estado da carteira podem prever perdas futuras. O artigo de Christoffersen de 1998 desenvolve a avaliação de cobertura condicional de previsões de intervalo.

Com poucas violações, as estimativas de transição podem ser especialmente instáveis. Uma sequência sem hits consecutivos pode produzir uma estimativa de fronteira π₁ = 0, mas isso não mostra que um segundo hit seja impossível. Significa apenas que nenhum ocorreu nessa amostra. Examine as contagens de transição e o tamanho da amostra junto com a estatística. Não interprete uma tabela esparsa como estimativa precisa do risco de cauda para o dia seguinte.

A cobertura condicional combina frequência e independência

O teste de cobertura condicional combina a estatística de frequência de Kupiec com a estatística de independência de Christoffersen: LR꜀꜀ = LRᵤ꜀ + LRᵢₙd. A hipótese nula conjunta diz que a probabilidade de violação é α e que as violações são independentes ao longo do tempo. Na configuração assintótica padrão, a soma é comparada com uma distribuição qui-quadrado com dois graus de liberdade.

Relate também os resultados dos componentes, não apenas o teste conjunto. Rejeitar a cobertura condicional significa que os dois requisitos em conjunto são incompatíveis com a sequência observada sob as premissas do teste, mas não identifica a causa. Se o POF rejeitar e a independência não, a contagem total pode ser o sinal mais claro. Se o teste de independência rejeitar, examine o momento das violações mesmo quando o total está próximo da meta. Se nenhum rejeitar, a amostra ainda pode ser curta demais para revelar uma especificação incorreta.

A interpretação é limitada. O teste comprime cada dia em um resultado binário, então não distingue uma perda que ultrapassou VaR em US$ 1 de outra que ultrapassou em US$ 1 milhão. Também não valida o restante da distribuição de perdas nem comprova que o Expected Shortfall está correto. Para entender as perguntas diferentes sobre risco de cauda que VaR e Expected Shortfall respondem, consulte o guia de VaR versus Expected Shortfall.

Violações raras dificultam a inferência em amostras curtas

Com VaR de 99%, uma amostra de 250 dias tem apenas 2.5 violações esperadas. Sob hits independentes com probabilidade de 1%, o número esperado de transições hit-após-hit em 249 pares adjacentes é aproximadamente 249 × 0.01² = 0.025. A maioria dessas amostras não terá um par consecutivo, mesmo quando o modelo estiver calibrado. Essa escassez dificulta estimar as probabilidades de transição com precisão e pode limitar o poder do teste de dependência.

Christoffersen e Pelletier relatam que os backtests de VaR existentes podem ter poder relativamente baixo em amostras pequenas realistas e estudam testes baseados na duração entre violações no artigo de 2004. Os resultados justificam considerar outra ferramenta de diagnóstico; não provam que um teste de duração seja sempre superior nem eliminam a necessidade de adequar o teste à previsão de risco e ao desenho da amostra. Quando há poucas observações, declare essa limitação em vez de tratar a não rejeição como aprovação.

A taxa de cauda-alvo também importa. Com VaR de 95%, 250 dias implicam 12.5 violações esperadas; com VaR de 99.9%, apenas 0.25. O mesmo nome de teste não torna comparáveis as evidências desses desenhos. Informe o nível de confiança, o horizonte, o número de observações, a contagem-alvo e a observada, o número de transições e se o cálculo usa uma referência assintótica ou um método de amostra finita.

Quando usar outro diagnóstico?

Escolha o próximo diagnóstico perguntando que informação os dois testes descartaram. Se quiser verificar se as violações são previsíveis a partir de hits defasados, previsões de VaR ou outras variáveis conhecidas no momento da previsão, o teste dynamic quantile (DQ) de Engle e Manganelli verifica restrições sobre indicadores de violação centrados e um conjunto escolhido de instrumentos. A conclusão depende dos instrumentos e do momento em que estavam disponíveis; não é um teste de toda forma possível de falha condicional. Um teste de duração, por sua vez, examina o tempo de espera entre violações e amplia outra parte da análise. O artigo CAViaR apresenta a estrutura DQ.

Se a preocupação é o tamanho da perda após ultrapassar o limite VaR, frequência e independência não bastam. Examine a magnitude das perdas excedentes e escolha um método de avaliação do Expected Shortfall compatível com a previsão e as premissas. Se a questão é ter selecionado o melhor resultado depois de testar muitos modelos, o backtesting de VaR não resolve o risco de seleção de estratégia; veja PBO e CSCV para um diagnóstico diferente, baseado em posições relativas.

Um relatório útil informa a carteira e a convenção de perda, horizonte de previsão, nível de confiança, datas de avaliação, como as previsões foram geradas, definição de violação, contagens esperada e observada, estatística POF, contagens de transição, resultados de independência e cobertura condicional, além das limitações por tamanho da amostra ou horizontes sobrepostos. Inclua gráficos dos limites previstos e das perdas realizadas e mantenha dados posteriores de avaliação fora da escolha do modelo. Essas etapas tornam a evidência histórica interpretável, mas um backtest aprovado não garante controle de risco futuro.

Perguntas frequentes

Q1Se o teste de Kupiec não rejeitar, meu modelo de VaR é preciso?

Não. Isso significa que, sob as premissas do teste, não houve evidência suficiente contra a taxa de violação especificada. Uma amostra curta, especialmente com nível de confiança de 99% ou mais, pode ter poucas violações para revelar um problema.

Q2Dois modelos podem passar no mesmo teste de Kupiec e ainda apresentar padrões de violação diferentes?

Sim. A estatística de Kupiec depende da contagem, não da ordem. O teste de independência de Christoffersen acrescenta informações sobre o agrupamento de violações em observações próximas.

Q3Esses testes dizem qual pode ser o tamanho da perda depois que o VaR é excedido?

Não. Eles usam um indicador binário de violação e não medem o tamanho da perda excedente. Se a severidade depois do limite de VaR for relevante, examine as perdas de cauda e avalie o Expected Shortfall separadamente.

Fontes e leituras adicionais

Relatar um problema

Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar

Verificação rápida

Terminou o guia? Confira o que aprendeu com 3 perguntas

Pergunta 1 / 3

Pergunta 01

Que característica o teste POF de Kupiec utiliza?

Escolha uma resposta para ver a explicação

Glossário de opções