Teste de Diebold–Mariano: comparação da precisão de previsões
Entenda o que o teste de Diebold–Mariano compara, como diferenças de perda e correlação serial afetam a estatística e por que precisão de previsão não é lucro no trading.
Neste guiaO teste compara a perda esperada das previsões
Resumo breve
O teste de Diebold–Mariano (DM) pergunta se dois procedimentos de previsão têm a mesma perda esperada para resultados pareados. Ele usa uma série de diferenças de perda, então a função de perda, o horizonte e a dependência entre datas afetam o resultado. Rejeitar a hipótese nula sustenta uma diferença no desenho de avaliação especificado; não demonstra que um modelo continuará superior nem que uma estratégia será lucrativa depois dos custos.
O teste compara a perda esperada das previsões
O teste de Diebold–Mariano compara duas previsões do mesmo alvo nas mesmas datas de avaliação. Em cada origem, os dois procedimentos devem usar o mesmo resultado realizado, horizonte e instante de corte das informações. Em seguida, o teste verifica se a perda média de um procedimento difere sistematicamente da do outro, permitindo que as diferenças de perda variem ao longo do tempo.
Diebold e Mariano formularam a questão para uma função de perda geral, não apenas para o erro quadrático médio. O artigo original apresenta testes para a hipótese nula de que previsões concorrentes têm igual precisão preditiva (Diebold e Mariano, 1995). Aqui, “precisão” significa menor perda esperada segundo a função escolhida para a comparação. Não significa que uma previsão seja verdadeira, explique causalidade, esteja bem calibrada em toda a distribuição ou sirva para qualquer decisão.
Suponha que os modelos A e B prevejam o mesmo retorno futuro no mesmo momento. O teste DM não verifica se algum coeficiente de um modelo é zero nem se os valores ajustados coincidem na amostra de estimação. Ele compara como os erros de previsão se convertem na perda escolhida dentro da amostra de avaliação.
Defina o desenho antes de interpretar a estatística. Alvo, origens das previsões, horizonte, função de perda, tratamento de resultados ausentes, cronograma de reestimação e hipótese unilateral ou bilateral determinam a pergunta. Se essas escolhas diferirem entre modelos, a diferença de perdas deixa de ser uma comparação em condições equivalentes.
Defina previsões pareadas e uma diferença de perda
Seja $y_t$ o valor realizado do alvo na origem da previsão $t$, e sejam $\hat y_{A,t}$ e $\hat y_{B,t}$ as previsões dos modelos A e B. Os erros são $e_{A,t}=y_t-\hat y_{A,t}$ e $e_{B,t}=y_t-\hat y_{B,t}$. Para uma função de perda $L$, defina a diferença de perda por data como:
$$ d_t=L(e_{A,t})-L(e_{B,t}) $$
Com essa convenção de sinais, uma média negativa de $d_t$ significa que A teve menor perda observada; uma média positiva significa que B teve menor perda. A hipótese nula populacional é $E[d_t]=0$. A alternativa bilateral pergunta se as perdas esperadas diferem em qualquer sentido; a unilateral testa uma direção escolhida antes. Não escolha a direção depois de descobrir qual modelo venceu.
Na perda quadrática $L(e)=e^2$, erros grandes pesam desproporcionalmente. Na perda absoluta $L(e)=|e|$, a classificação é menos dominada por um único erro grande. A perda quantílica pode refletir um alvo assimétrico; outras funções podem avaliar dimensões diferentes da previsão. Como outra perda pode inverter a ordem dos modelos, “melhor previsão” não tem um significado único antes de especificar a perda. A revisão de Tashman sobre testes de previsões fora da amostra também ressalta que a avaliação deve corresponder ao problema de previsão (Tashman, 200000065-0)).
Use as mesmas origens e resultados para os dois modelos. Se uma previsão difícil estiver ausente em apenas um deles, excluí-la silenciosamente só para aquele modelo altera a amostra de comparação. Se na operação real o modelo será reestimado todo mês com dados novos, gere as previsões de avaliação seguindo essa regra; um experimento com parâmetros fixos responde a outra pergunta. Uma avaliação sequencial, como a [validação walk-forward](/pt-BR/learn/walk-forward-validation-expanding-vs-rolling-windows-explained), mostra como gerar previsões posteriores sem usar dados futuros.
Um exemplo com quatro origens mostra o significado da diferença média
Considere quatro origens hipotéticas e meça o alvo e os erros em pontos percentuais. Os erros do modelo A são $[1,2,0,1]$; os do modelo B, $[2,1,1,1]$. Cada par se refere ao mesmo retorno realizado e ao mesmo intervalo de previsão. Os valores são inventados apenas para demonstrar a conta.
Com perda quadrática, A tem perdas $[1,4,0,1]$ e erro quadrático médio $(1+4+0+1)/4=1.50$ ponto percentual ao quadrado. B tem perdas $[4,1,1,1]$ e erro quadrático médio $(4+1+1+1)/4=1.75$. Nesses quatro resultados, o MSE de A é 0.25 ponto percentual ao quadrado menor.
As diferenças por data, $d_t=L(e_{A,t})-L(e_{B,t})$, são $[-3,3,-1,0]$. A média é $(-3+3-1+0)/4=-0.25$, igual ao MSE médio de A menos o de B. O sinal negativo favorece A nessa convenção. Isso ainda não mostra se a diferença supera o ruído amostral: quatro pares de previsões não constituem evidência estatística convincente.
A definição de perda também muda o que significa “melhor”. Em outro exemplo hipotético, C tem erros absolutos $[0,0,0,3]$ e D tem $[1,1,1,1]$. Com perda absoluta, as médias são 0.75 para C e 1 para D, então C é preferível. Com perda quadrática, as médias são 2.25 para C e 1 para D, então D é preferível. O teste não resolve essa divergência sem uma escolha sobre quais erros são mais importantes.
<!-- Illustration placement: after this section; text-free conceptual scene showing two forecast paths against one realized path, with visibly different miss distances and no labels or numerical claims. -->
A estatística DM relaciona a diferença média à sua incerteza
A diferença média amostral é $\bar d=T^{-1}\sum_{t=1}^{T}d_t$, em que $T$ é o número de resultados de previsão pareados. Seu erro-padrão depende da variância de longo prazo de $d_t$, não apenas da variância em uma data. Uma forma geral da estatística é:
$$ DM=\frac{\bar d}{\sqrt{\widehat{\Omega}/T}} $$
$\widehat{\Omega}$ estima a variância de longo prazo da série de diferenças de perda. Se as datas fossem independentes, ela se reduziria à variância de $d_t$ conforme o estimador escolhido. Porém, perdas de previsão costumam se agrupar: em períodos de alta volatilidade, os erros dos dois modelos podem aumentar, e um alvo a $h$ passos pode fazer janelas adjacentes compartilharem retornos realizados. Ignorar dependência positiva pode subestimar o erro-padrão e exagerar a força da evidência.
Uma construção HAC comum estima as autocovariâncias $\hat\gamma_k$ das diferenças de perda centralizadas e as combina como $\widehat{\Omega}=\hat\gamma_0+2\sum_{k=1}^{q}w_k\hat\gamma_k$. Com pesos de Bartlett até a banda $q$, $w_k=1-k/(q+1)$. Newey e West propuseram um estimador de covariância semidefinido positivo e consistente diante de heterocedasticidade e autocorrelação (Newey e West). Kernel e banda são decisões de implementação: informe-as e escolha valores compatíveis com o desenho da previsão, sem ajustá-los para obter um p-valor desejado. O guia de [erros-padrão HAC](/pt-BR/learn/robust-standard-errors-heteroskedasticity-hac-finance-explained) explica o problema mais amplo da estimação de covariância.
Sob condições regulares, compara-se a estatística DM padrão com uma distribuição normal padrão assintótica. Um valor absoluto grande indica que a diferença média observada é grande em relação à incerteza estimada. O sinal identifica qual modelo teve a menor perda na ordem definida; o p-valor não mede a magnitude nem o valor econômico da diferença. Também não é a probabilidade de a hipótese nula ser verdadeira ou de uma previsão funcionar no futuro.
Previsões de vários passos se sobrepõem; a amostra finita também importa
Quando se prevê, a cada período, um alvo de vários períodos adiante, as janelas de avaliação se sobrepõem. Uma previsão mensal do retorno acumulado dos próximos três meses, por exemplo, compartilha dois desses três retornos com a previsão emitida um mês depois. Mesmo que os retornos mensais fossem independentes, a sobreposição pode induzir correlação serial nos erros de previsão e nas diferenças de perda.
Em um desenho básico de $h$ passos, é natural refletir na variância pelo menos a dependência até a defasagem $h-1$. Isso não é uma regra universal para a banda: reestimação móvel, alvos persistentes, agrupamento de volatilidade e a função de perda podem criar dependência adicional. Registre o horizonte, o espaçamento das origens e o motivo da defasagem de truncamento HAC ou de outro estimador de variância. O número de linhas de previsão não equivale automaticamente ao número de evidências independentes.
O teste assintótico original pode ter tamanho efetivo inadequado em amostras moderadas. Harvey, Leybourne e Newbold propuseram um ajuste para amostra finita ao comparar erros quadráticos médios de previsão (HLN, 199700719-4)). Uma forma comum para horizonte $h$ e $T$ previsões multiplica a estatística DM por:
$$ DM_{HLN}=DM\sqrt{\frac{T+1-2h+h(h-1)/T}{T}} $$
A estatística ajustada costuma ser comparada a uma distribuição $t$ com $T-1$ graus de liberdade. Para $T=60$ e $h=5$, o multiplicador é cerca de $0.925$. O exemplo mostra somente a conta do ajuste; não afirma que 60 observações sejam suficientes para um modelo específico ou que as hipóteses se sustentem. A correção trata um problema definido de amostra pequena, mas não corrige vazamento de informação, alvo inválido, dependência não modelada, seleção repetida de modelos ou perda mal especificada.
Modelos aninhados exigem outro raciocínio para comparar previsões
O modelo A pode ser uma versão restrita do B; por exemplo, B pode acrescentar preditores. Mesmo sob a hipótese nula de que os preditores extras não têm valor preditivo populacional, seus coeficientes estimados podem adicionar ruído às previsões de B. Assim, o modelo maior pode apresentar MSE observado mais alto mesmo sem que as variáveis adicionais melhorem o processo de previsão subjacente. A lógica usual de igualdade de precisão para modelos não aninhados não se aplica automaticamente sem ajustes.
Clark e West desenvolvem testes aproximadamente normais de igualdade de precisão preditiva em modelos aninhados e ajustam a comparação dos erros quadráticos pelo ruído de estimação introduzido pelo modelo maior (Clark e West, 2007). Esse ajuste não substitui todos os testes DM: foi projetado para uma pergunta, uma perda e um cenário assintótico específicos. Verifique se um modelo está aninhado no outro e escolha um teste cuja distribuição nula corresponda ao desenho. Não presuma que o p-valor DM padrão de um software cubra todas as relações entre modelos.
Outras distinções também importam. Uma previsão com MSE menor pode não melhorar a cobertura de intervalos, a calibração de probabilidades, a precisão direcional ou uma decisão posterior. Uma comparação pode ser fora da amostra e ainda usar uma validação inadequada que foi consultada repetidamente durante o desenvolvimento. Informe a relação entre os modelos, o método de estimação, o horizonte e os dados usados para gerar cada previsão.
Precisão de previsão não é vantagem de trading
Um resultado DM avalia a perda preditiva; uma decisão de trading avalia um processo de retorno e risco. Um MSE menor para o retorno do próximo período não garante que o sinal escolha o lado certo com frequência suficiente, dimensione as posições corretamente ou resista a giro, spread, impacto de mercado, taxas, custo de empréstimo, funding e atraso de execução. Por outro lado, uma previsão com erro quadrático médio um pouco maior ainda pode melhorar uma decisão se for mais precisa nos momentos em que a estratégia está mais exposta. Para sustentar essa afirmação, a perda talvez deva representar a decisão real, e não uma métrica geral conveniente.
Uma diferença estatisticamente significativa também pode ser economicamente pequena. Informe o tamanho da diferença média de perda em unidades interpretáveis junto com a incerteza, e não apenas o p-valor ou um rótulo de vencedor. Se a alegação for sobre resultado de carteira, reaplique a regra de decisão completa e congelada a dados posteriores adequados, sob premissas de trading realistas, e reporte os resultados líquidos separadamente. O DM não calcula esses resultados nem desconta custos, a menos que a função de perda tenha sido criada explicitamente para isso.
O teste também não corrige a busca entre muitos modelos, alvos, horizontes, funções de perda, períodos ou regras de trading seguida da divulgação apenas da comparação mais favorável. Repetir testes pareados cria um problema próprio de seleção. Guarde o registro da busca e aplique um método de testes múltiplos adequado à família de alegações. O guia de [testes múltiplos e taxa de falsas descobertas](/pt-BR/learn/multiple-testing-false-discovery-rate-finance-explained) explica por que limiares comuns podem induzir a erro após uma busca ampla. O DM é uma ferramenta de avaliação, não uma correção para data snooping.
Informe detalhes suficientes para reproduzir a comparação
Um relato claro identifica alvo e unidades, corte das informações, origens das previsões, horizonte, cronograma de reestimação e amostra de avaliação comum. Especifica a função de perda e o sinal de $d_t$, mostra a perda média de cada modelo e a diferença média, identifica a hipótese unilateral ou bilateral definida previamente e informa estimador de variância, kernel, banda, estatística, distribuição de referência, p-valor e, quando apropriado, intervalo de confiança ou medida de incerteza.
Informe também se os modelos são aninhados, como resultados ausentes e valores extremos foram tratados, quantas especificações alternativas foram examinadas e se o período de avaliação influenciou escolhas do modelo. Mostre a magnitude da diferença, não apenas se passou de um limiar. Uma série temporal de $d_t$ ou um gráfico das diferenças de perdas acumuladas pode revelar mudanças de regime escondidas pela média geral; o gráfico não substitui a inferência que considera a dependência.
Em trading quantitativo, descreva ainda como a previsão vira ação: limiar do sinal, tamanho da posição, momento do rebalanceamento, controles de risco, preço de execução e premissas de custos. O DM compara apenas a série de perdas preditivas fornecida. Não certifica o fluxo de dados, não torna amostras distintas comparáveis, não prova causalidade nem garante que os rankings históricos persistam. Use-o como uma parte transparente da avaliação de modelos, junto com um desenho temporalmente ordenado e uma análise explícita da decisão.
Perguntas frequentes
Q1O teste de Diebold–Mariano compara coeficientes dos modelos?
Não. Ele compara a perda esperada dos erros gerados por dois procedimentos de previsão para resultados pareados. Um teste de coeficiente aborda outra questão sobre um parâmetro do modelo.
Q2Posso usar o teste para previsões de vários períodos à frente?
Sim, mas janelas-alvo sobrepostas podem tornar as diferenças de perda sucessivas serialmente dependentes. Use uma estimativa de variância e, quando apropriado, uma correção para amostra finita adequadas ao horizonte e ao desenho; registre suas escolhas.
Q3Um resultado significativo quer dizer que a melhor previsão dará lucro?
Não. Ele sustenta uma diferença na perda escolhida dentro do desenho de avaliação. A rentabilidade também depende de como as previsões viram posições, dos riscos assumidos e dos custos e da execução realizados.
Fontes e leituras adicionais
Relatar um problema
Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar
Verificação rápida
Terminou o guia? Confira o que aprendeu com 3 perguntas
Pergunta 01
Qual é a hipótese nula na comparação básica de Diebold–Mariano?
Escolha uma resposta para ver a explicação
Glossário de opções
Variation in the conditional error variance across regressor values or states, invalidating an equal-variance covariance formula.
Ler o guia completoFamily-wise error rateThe probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
Ler o guia completo