Skip to content
Todos os guias de opções e contratos futuros
Avaliação da precisão das previsões14 min de leitura

Teste Diebold–Mariano: como comparar a precisão de previsões

Veja como o teste Diebold–Mariano compara perdas de previsões pareadas, trata horizontes sobrepostos e por que um valor-p baixo não prova habilidade de trading.

Neste guiaUm erro menor no backtest ainda não prova que a previsão é melhor

Resumo breve

O teste Diebold–Mariano compara duas previsões observando a diferença entre suas perdas nos mesmos resultados realizados. O resultado depende da função de perda, da amostra de avaliação, do horizonte de previsão e da estimativa de incerteza. Um erro amostral menor não prova automaticamente uma precisão esperada maior, e uma previsão mais precisa não equivale a uma estratégia de trading lucrativa.

Um erro menor no backtest ainda não prova que a previsão é melhor

Suponha que dois modelos prevejam o mesmo retorno, a mesma volatilidade ou a mesma variável econômica nas mesmas datas. Na amostra de avaliação, o erro médio do modelo A é menor que o do modelo B. Isso descreve a amostra, mas não mostra se A é consistentemente mais preciso ou se a diferença observada reflete apenas a variação normal das datas que, por acaso, foram testadas.

O teste Diebold–Mariano (DM) transforma essa comparação em uma série temporal pareada. Em cada origem de previsão, ele compara as duas previsões com o mesmo resultado realizado, atribui pontuações usando uma função de perda definida previamente e analisa a sequência de diferenças entre as perdas. O pareamento importa: um dia volátil pode elevar as perdas dos dois modelos, enquanto a comparação pergunta qual deles costuma perder menos exatamente nesses mesmos dias.

A estrutura original não se limita ao erro quadrático nem pressupõe erros de previsão normalmente distribuídos. Ela pode comparar diferentes funções de perda, inclusive assimétricas, quando as pontuações correspondem à pergunta de previsão. Ainda assim, é preciso ter um desenho de avaliação defensável e estimar a incerteza da diferença média entre as perdas. Diebold e Mariano (1995) apresentaram o teste de igualdade de precisão preditiva; Harvey, Leybourne e Newbold (1997)00719-4) estudaram uma modificação para amostras pequenas.

Compare previsões equivalentes antes de calcular uma estatística

Cada linha deve representar uma origem de previsão comparável. Os dois modelos precisam prever o mesmo alvo e horizonte, usando apenas as informações disponíveis naquela origem. Alinhe resultados realizados, marcas de tempo, moeda ou unidade, versão dos dados e regras para observações ausentes antes de comparar as perdas. Se um modelo prevê o fechamento de amanhã e outro prevê a média de cinco dias, os erros respondem a perguntas diferentes.

Use previsões produzidas sem olhar para o futuro. Um holdout cronológico ou uma avaliação pseudo-out-of-sample móvel pode ajudar, mas a separação, por si só, não basta se o mesmo holdout foi usado repetidamente para ajustar atributos, limites ou versões do modelo. Preserve a previsão realmente feita em cada origem histórica, incluindo as versões dos dados e do modelo que a geraram. Dados macroeconômicos revisados, filtros de viés de sobrevivência ou ajustes decorrentes de eventos corporativos futuros podem alterar a avaliação retrospectivamente.

Avalie os dois modelos usando o mesmo conjunto de origens. Excluir datas difíceis para um modelo, mas não para o outro, desfaz a comparação pareada. Se faltarem previsões, defina uma amostra comum ou justifique o tratamento das ausências; não deixe que cada modelo enfrente regimes de mercado diferentes sem explicação. Escolha as datas inicial e final antes de verificar qual intervalo produz o resultado desejado.

A função de perda define o que significa “mais preciso”

Seja yₜ o valor realizado na origem t e sejam ŷA,ₜ e ŷB,ₜ as previsões dos modelos A e B. Os erros são eA,ₜ = yₜ − ŷA,ₜ e eB,ₜ = yₜ − ŷB,ₜ. Uma função de perda L transforma cada erro em uma pontuação na qual um valor menor é melhor. A perda quadrática L(e) = e² penaliza mais os erros grandes. A perda absoluta L(e) = |e| cresce linearmente com o tamanho do erro. Uma previsão de quantil pode usar a perda pinball assimétrica, pois os custos de prever abaixo e acima do valor são diferentes.

A pontuação escolhida pode mudar qual modelo parece melhor. Considere dois pares hipotéticos de erros medidos nas mesmas unidades: os erros do modelo A são 0 e 2; os do modelo B são 1 e 1. Com a perda quadrática, as perdas médias são 2 e 1, então B tem a melhor pontuação. Com a perda absoluta, a média de ambos é 1. Nenhum cálculo é universalmente correto: cada um responde a uma pergunta diferente sobre quais erros importam.

Para previsões de retorno, o erro quadrático pode ser útil para uma previsão da média condicional; uma previsão de volatilidade precisa de uma pontuação adequada ao alvo, enquanto uma previsão de Value-at-Risk precisa de uma pontuação de quantil ou de um backtest específico de risco. Escolher a função de perda depois de ver qual modelo venceu transforma o teste em mais uma busca. Defina a pontuação e o sentido de “melhor” antes de examinar a comparação.

Uma previsão de VaR tem como alvo um quantil da cauda, e não uma previsão pontual comum. O guia de backtesting de VaR explica como testes de frequência e de momento das exceções avaliam essa previsão de risco distinta.

Calcule diferenças pareadas entre perdas e declare a hipótese nula

Para uma função de perda em que um valor menor é melhor, defina a diferença no período t como

dₜ = L(eA,ₜ) − L(eB,ₜ)

Com essa convenção de sinal, um dₜ positivo significa que a perda de A foi maior e, portanto, a perda de B foi menor naquela origem; um valor negativo favorece A. A média amostral é d̄ = (1/n) Σ dₜ. A hipótese nula de precisão incondicional igual é E[dₜ] = 0. A alternativa bilateral pergunta se as perdas esperadas diferem em qualquer direção. Uma alternativa unilateral definida previamente pode perguntar se um modelo específico tem perda esperada menor.

A estatística básica é

DM = d̄ / √(Ŝd / n)

Aqui, Ŝd estima a variância de longo prazo da série de diferenças de perdas, e não apenas a variância dos erros de previsão de um dos modelos. Sob a hipótese nula e condições de regularidade apropriadas, a estatística tem distribuição assintótica normal padrão. Valores positivos grandes favorecem B pela convenção de sinal acima; valores negativos grandes favorecem A. O valor-p mede a compatibilidade dos dados com a hipótese nula especificada e as premissas de amostragem, não a probabilidade de que algum dos modelos seja verdadeiro.

O pareamento elimina diferenças irrelevantes entre as escalas gerais de erro dos dois modelos apenas na medida em que as diferenças por origem as capturam. Ele não torna a série de perdas independente, não elimina automaticamente a incerteza da estimação dos parâmetros e não corrige uma busca entre muitos alvos e especificações. Essas escolhas fazem parte do desenho e do cálculo de incerteza.

Um exemplo de um passo separa diferença amostral de evidência

Suponha 100 previsões hipotéticas pareadas de um passo. A perda quadrática média do modelo A é 0.26 e a do modelo B é 0.23, em unidades de pontos percentuais ao quadrado. A diferença média é, portanto, d̄ = 0.26 − 0.23 = 0.03, favorecendo B na amostra. Para simplificar o exemplo, suponha que a variância de longo prazo estimada de dₜ seja 0.04 e que não haja covariância serial entre as origens.

O erro-padrão estimado da diferença média é √(0.04 / 100) = 0.02. A estatística sem ajuste é 0.03 / 0.02 = 1.50. Para horizonte h = 1 e T = 100, o fator de amostra pequena de Harvey–Leybourne–Newbold é √[(T + 1 − 2h + h(h − 1)/T) / T] = √0.99 ≈ 0.995. Multiplicar por esse fator dá uma estatística ajustada próxima de 1.49; usando como referência aproximada a distribuição t₉₉, o valor-p bilateral é cerca de 0.14.

B tem um erro quadrático médio observado menor, mas este exemplo não oferece evidência forte contra a igualdade de precisão esperada nos níveis de significância convencionais. Não rejeitar não prova que os modelos tenham a mesma precisão; rejeitar também continuaria condicionado à pontuação, às origens e às premissas escolhidas. O valor da variância e todas as perdas são dados hipotéticos para ensinar o cálculo, não resultados empíricos.

As raízes quadradas das perdas quadráticas médias são RMSE de aproximadamente 0.510 e 0.480 ponto percentual, uma diferença descritiva de 0.030. Porém, a estatística DM testa as diferenças pareadas das perdas quadráticas; ela não é um teste t da diferença entre essas duas raízes.

Diagrama conceitual em três painéis: duas linhas de previsão comparadas com a mesma trajetória realizada, marcas de perdas pareadas por origem e barras com sinal das diferenças de perda ao redor da média e de uma faixa de incerteza.
Ilustração conceitual da comparação de duas previsões na mesma trajetória realizada e do resumo das diferenças pareadas entre perdas. Não representa dados de mercado nem resultado empírico do teste.

Horizontes sobrepostos tornam as diferenças de perda dependentes

Se previsões para cinco dias à frente forem emitidas diariamente, previsões adjacentes compartilham quatro dos cinco dias-alvo. Seus erros, perdas e diferenças de perda podem, portanto, se mover juntos. Tratar 100 origens diárias como 100 comparações independentes pode subestimar a incerteza e fazer a estatística parecer grande demais.

A variância de longo prazo considera a covariância serial em dₜ. Um estimador comum consistente para heterocedasticidade e autocorrelação (HAC) tem a forma

Ŝd = γ̂₀ + 2 Σₖ₌₁ᵐ wₖ γ̂ₖ

em que γ̂ₖ é a autocovariância amostral de d na defasagem k, wₖ é um peso do kernel e m é a largura de banda escolhida. Newey e West (1987) apresentam um estimador de covariância HAC semidefinido positivo. Para erros de previsão ideais de h passos, sob as premissas pertinentes, a sobreposição costuma induzir dependência por pelo menos h − 1 defasagens; a formulação original do DM discute um estimador truncado para esse caso. Dados reais podem ter dependência mais longa por causa de alvos persistentes, estimação móvel ou construção da estratégia. Portanto, h − 1 não é uma regra universal de largura de banda.

Informe o horizonte, o kernel, a largura de banda e qualquer ajuste para amostra pequena. Mostre se as conclusões mudam sob configurações razoáveis de dependência, em vez de escolher uma largura de banda porque produz o valor-p preferido. Se as origens de avaliação forem espaçadas para evitar sobreposição, explique essa decisão e qual informação ou tamanho amostral ela sacrifica. A incerteza que considera dependência faz parte do teste, não é uma opção de apresentação.

Modelos aninhados e habilidade variável exigem perguntas diferentes

A comparação DM usual é mais fácil de interpretar quando as previsões não são aninhadas sob a hipótese nula de precisão igual. Se um modelo maior contém um modelo de referência menor, os coeficientes adicionais estimados podem acrescentar ruído à previsão, mesmo quando seus valores verdadeiros são zero. Sob essa hipótese nula, a diferença entre os erros quadráticos médios pode ter uma distribuição não padrão. Para comparações de MSPE fora da amostra entre modelos aninhados, um método como o ajuste de Clark–West considera esse efeito do ruído de estimação; ele não substitui o DM de forma geral em todo desenho de modelo. Consulte Clark e West (2007).

A hipótese nula comum do DM trata da perda média incondicional em toda a amostra de avaliação. Ela pode esconder mudanças ao longo do tempo: A pode ter desempenho melhor em períodos tranquilos e B em períodos voláteis, embora as médias gerais sejam parecidas. Se a pergunta é se a precisão relativa depende de informações conhecidas na data da previsão, os testes de capacidade preditiva condicional combinam as diferenças de perda com instrumentos especificados previamente. Giacomini e White (2006) desenvolveram essa estrutura. As premissas e o desenho da janela de avaliação importam; acrescentar indicadores arbitrários depois de olhar os resultados não é um atalho válido.

A escolha do teste deve acompanhar a estrutura da comparação: previsões independentes, modelos aninhados, capacidade condicional variável ou uma família escolhida entre muitos candidatos são casos distintos. Para o último caso, o guia sobre White Reality Check e Hansen SPA explica a correção para toda a família após uma busca por muitas regras de trading.

Uma perda de previsão menor não prova uma estratégia lucrativa

Uma previsão pode ser estatisticamente mais precisa sem melhorar o resultado líquido das operações. Uma estratégia precisa transformar a previsão em posição, escolher quando operar e arcar com spread, comissões, slippage, impacto de mercado, financiamento, empréstimo e limites de risco. Uma pequena melhora no erro quadrático médio dos retornos pode não ajudar nas decisões; um modelo com erro médio um pouco maior pode identificar melhor um evento de cauda importante para determinada regra.

Mantenha a avaliação de previsão e a avaliação de portfólio como etapas distintas. Primeiro, teste a previsão contra um alvo e uma perda que correspondam à tarefa preditiva declarada. Depois, avalie uma regra de trading totalmente especificada em dados que não foram usados para selecionar a previsão, com premissas realistas de execução e financiamento. O valor-p de um teste de previsão não é um retorno de backtest, uma razão de Sharpe nem uma probabilidade de lucro futuro.

Experimentar repetidamente modelos, alvos, horizontes, funções de perda e janelas amostrais cria viés de seleção, mesmo quando cada cálculo individual do DM está correto. Registre a busca completa e use um método para toda a família se a pergunta de pesquisa for se algum candidato sobreviveu à busca. O guia sobre block bootstrap trata da incerteza que preserva dependência para uma estatística previamente definida; por si só, não corrige uma busca de modelos não documentada.

Relate detalhes suficientes para que outra pessoa reproduza a análise

Identifique os dois modelos de previsão, a relação com o benchmark, o alvo, o horizonte, o calendário das origens de previsão, as datas de avaliação, o conjunto de informações, a versão dos dados e a regra da amostra comum. Defina matematicamente a função de perda e informe se dₜ positivo favorece A ou B. Relate n, a perda média de cada modelo, d̄, o estimador de variância de longo prazo, o kernel e a largura de banda HAC, o ajuste de amostra pequena, a distribuição de referência, a direção do teste e o valor-p.

Informe também se os modelos são aninhados, como os parâmetros foram estimados, se a comparação foi escolhida antes ou depois de examinar os resultados e quais outras variantes foram testadas. Se a amostra foi usada para selecionar o modelo, identifique o teste como parte desse processo, em vez de chamá-lo de evidência out-of-sample intocada. Um relato claro permite que leitores vejam exatamente o que está sendo comparado e quais problemas de incerteza ou seleção ficam fora da análise.

Perguntas frequentes

Q1O teste Diebold–Mariano exige que os erros de previsão tenham distribuição normal?

Não. A estrutura pode lidar com erros de previsão não normais. Ainda assim, o teste precisa de uma estimativa adequada da variância das diferenças de perda e de condições de regularidade para a distribuição de referência.

Q2Posso comparar dois modelos que preveem horizontes diferentes?

Não como uma comparação equivalente de precisão. Primeiro alinhe o alvo e o horizonte; caso contrário, cada modelo responde a uma pergunta de previsão diferente.

Q3Um resultado significativo do teste DM basta para escolher um modelo de trading?

Não. Ele é uma evidência sobre a perda esperada de previsão em uma comparação especificada. Ainda é preciso considerar a busca de modelos, as regras de decisão, os custos de execução, o financiamento e o desempenho da estratégia fora da amostra. Pesquisas principais - Diebold e Mariano, “Comparing Predictive Accuracy” (1995) - Harvey, Leybourne e Newbold, “Testing the Equality of Prediction Mean Squared Errors” (1997)00719-4) - Giacomini e White, “Tests of Conditional Predictive Ability” (2006) - Clark e West, “Approximately Normal Tests for Equal Predictive Accuracy in Nested Models” (2007) - Newey e West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)

Fontes e leituras adicionais

Relatar um problema

Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar

Verificação rápida

Terminou o guia? Confira o que aprendeu com 3 perguntas

Pergunta 1 / 3

Pergunta 01

Com dₜ = L(eA,ₜ) − L(eB,ₜ), o que uma média amostral positiva favorece?

Escolha uma resposta para ver a explicação

Glossário de opções