Teste Clark–West para Previsões Aninhadas: Fórmula, Exemplo e Limitações
Entenda por que modelos de previsão aninhados precisam de uma comparação ajustada de MSPE, como funciona a estatística Clark–West e o que um resultado unilateral pode ou não demonstrar.
Neste guiaPor que previsões aninhadas exigem uma comparação própria
Resumo breve
O teste Clark–West ajusta uma comparação de erros quadráticos quando um modelo de previsão contém um benchmark menor. Parâmetros adicionais estimados podem acrescentar ruído às previsões do modelo maior mesmo quando não trazem informação preditiva verdadeira. O ajuste altera a diferença de perdas usada na inferência; ele não modifica nenhuma das previsões nem garante que o modelo maior seja útil.
Por que previsões aninhadas exigem uma comparação própria
Suponha que um modelo restrito preveja o retorno do próximo mês usando uma constante, enquanto um modelo maior acrescente uma razão de valuation. O modelo restrito está aninhado no maior: basta definir o coeficiente adicional como zero para recuperar o benchmark. Mesmo que esse coeficiente seja realmente zero, estimá-lo ainda pode introduzir ruído amostral nas previsões do modelo maior. Assim, seu erro quadrático médio de previsão observado (MSPE) pode ser maior mesmo quando os dois modelos têm o mesmo conteúdo preditivo na população.
O ajuste Clark–West trata esse problema de ruído de estimação em comparações fora da amostra de erros quadráticos entre previsões aninhadas. Nesse contexto, pergunta se o modelo maior agrega valor preditivo além do benchmark restrito. É uma questão mais específica do que a comparação geral do guia Diebold–Mariano, que compara perdas de previsão pareadas e cuja distribuição de referência usual não é automaticamente válida para modelos aninhados. Clark e McCracken estudam o comportamento assintótico e em amostras finitas das medidas de acurácia e encompassing para previsões aninhadas; Clark e West desenvolvem o procedimento de MSPE ajustado e uma inferência aproximada. Clark e McCracken (2001)00071-9); Clark e West (2007).
Confirme o aninhamento e preserve o desenho fora da amostra
Considere que o benchmark restrito prevê o mesmo alvo (y_{t+h}) que a alternativa maior. O modelo maior precisa conter a especificação do benchmark como caso particular, normalmente quando um ou mais coeficientes adicionais são definidos como zero. Ser apenas mais complexo, usar mais variáveis ou apresentar melhor ajuste dentro da amostra não comprova esse aninhamento.
Em cada origem da previsão, gere as duas estimativas usando apenas as informações disponíveis naquele momento. Estime os modelos em uma janela cronológica de treinamento, faça previsões em uma janela de avaliação posterior e use o mesmo alvo, horizonte, unidades, origens e observações realizadas para ambos. Reestimações recursivas ou móveis podem ser adequadas, mas informe qual procedimento usou e preserve as previsões efetivamente feitas em cada origem. Consultar repetidamente a janela de avaliação para escolher variáveis preditoras, transformações ou horizontes faz com que ela passe a integrar a seleção do modelo, em vez de continuar sendo evidência intocada. O guia CAViaR ilustra por que uma previsão de quantil de cauda também precisa ser avaliada com uma perda adequada ao seu alvo, em vez de ser incluída em uma comparação de previsões da média.
O ajuste Clark–West trata do ruído de estimação de parâmetros sob a hipótese nula de modelos aninhados; ele não corrige look-ahead, amostras incompatíveis, dados revisados tratados como se fossem conhecidos antes ou buscas de modelos não divulgadas. Informe a janela inicial de estimação, o número de origens, o horizonte, a versão dos dados e as atualizações móveis ou recursivas para que o leitor possa avaliar se a análise foi realmente fora da amostra.
Calcule a diferença de perdas ajustada
Seja f₀,t+h a previsão restrita, f₁,t+h a previsão do modelo maior e eⱼ,t+h = yₜ₊ₕ − fⱼ,t+h o erro de previsão j. Para a perda por erro quadrático, a diferença ajustada Clark–West em cada período é
dCW,t+h = (e₀,t+h)² − [(e₁,t+h)² − (f₀,t+h − f₁,t+h)²]
De forma equivalente, subtraia o erro quadrático do modelo maior do erro quadrático do restrito e some a distância quadrática entre as previsões. O último termo estima o ruído adicional nas previsões associado aos parâmetros extras ajustados sob a hipótese nula. Clark e West descrevem o ajuste como a redução do MSPE amostral do modelo maior por esse termo de diferença entre previsões antes de compará-lo ao modelo restrito. Clark e West (2007).
Calcule a média das diferenças ajustadas nas origens comuns de avaliação: mean(dCW) = (1/P) Σ dCW,t+h. Se os resultados e as previsões forem medidos em pontos-base, cada erro quadrático e cada diferença ajustada estará em pontos-base ao quadrado. Uma média ajustada positiva favorece o modelo maior segundo a convenção acima. É uma medida comparativa ajustada, não o MSPE realizado do modelo maior nem uma previsão para usar em operações.
Defina a hipótese unilateral antes de ler o resultado
A pergunta usual do Clark–West é se o modelo aninhado maior tem MSPE esperado inferior ao do benchmark restrito. A hipótese nula representa a ausência de melhora preditiva incremental pelo componente adicional; a alternativa unilateral favorece o modelo maior. Com a fórmula acima, a evidência para essa alternativa aparece como uma média ajustada suficientemente positiva em relação ao erro-padrão.
Na notação de perda ajustada, as hipóteses operacionais são H₀: E[dCW] = 0 contra H₁: E[dCW] > 0. A direção positiva decorre de colocar primeiro a perda do modelo restrito. Se a subtração for invertida, o sinal também se inverte; informe a convenção junto com o resultado.
A estatística de teste costuma ser a média amostral de dCW dividida pelo erro-padrão estimado. Clark e West recomendam um teste unilateral aproximadamente normal para as configurações que estudam, com erro-padrão convencional ou consistente à autocorrelação, conforme apropriado. West (1996) desenvolve inferência para momentos de funções suaves de previsões e erros fora da amostra, inclusive em situações em que as previsões dependem de parâmetros estimados. A direção deve ser escolhida antes de ver os resultados: uma estatística Clark–West positiva não autoriza trocar para um teste bilateral ou outra convenção de sinal depois de observar a amostra.
O valor-p informado é condicional ao aninhamento, à construção das previsões, ao alvo, à perda, ao método de inferência e às hipóteses de amostragem. Ele não é a probabilidade de o modelo maior ser verdadeiro nem demonstra que um preditor adicional causa mudanças no alvo.
Percorra um exemplo de quatro períodos
Considere quatro observações hipotéticas em pontos-base. Os valores realizados são [0, 1, −1, 0], as previsões restritas [−1, 0, 0, 0] e as previsões do modelo aninhado maior [−1.5, 0.5, −0.5, 0.5]. Os erros quadráticos do modelo restrito são [1, 1, 1, 0], com MSPE médio de 0.75 bp². Os erros quadráticos do modelo maior são [2.25, 0.25, 0.25, 0.25], também com MSPE médio de 0.75 bp².
As diferenças quadráticas entre as previsões (f₀ − f₁)² são [0.25, 0.25, 0.25, 0.25]. Aplicando a diferença ajustada e₀² − e₁² + (f₀ − f₁)², obtemos [−1, 1, 1, 0] bp². A média amostral é 0.25 bp². Os MSPEs brutos empatam, mas a média ajustada é positiva porque a correção considera o ruído de estimação das previsões do modelo maior.
Esses quatro períodos ilustram apenas a aritmética. São insuficientes para estimar a incerteza com credibilidade ou estabelecer significância estatística. A média ajustada positiva, sozinha, não comprova uma vantagem real de previsão; os valores são hipotéticos, não observações de mercado. <!-- learn:illustration -->

Considere a dependência dos erros e os horizontes
Mesmo em previsões de um passo, as diferenças de perdas ajustadas podem apresentar dependência serial porque o alvo, os preditores ou a janela de estimação evoluem no tempo. Em previsões de vários passos sobrepostas, origens próximas compartilham períodos realizados do alvo; por construção, suas diferenças ajustadas podem ser correlacionadas. Um erro-padrão convencional que trate cada origem como independente pode subestimar a incerteza.
Estime o erro-padrão a partir da série de diferenças ajustadas usando um método de inferência que reflita o desenho amostral, como uma estimativa de variância de longo prazo consistente à heterocedasticidade e à autocorrelação, quando as condições forem adequadas. Clark e West mencionam explicitamente erros-padrão consistentes à autocorrelação para erros de previsão autocorrelacionados. Informe o horizonte, o estimador de covariância, o kernel e a largura de banda, se usados, e qualquer método de reamostragem ou de valores críticos. O guia de bootstrap em blocos explica por que a reamostragem de séries temporais dependentes precisa preservar sua ordem; um bootstrap genérico não implementa automaticamente a hipótese nula Clark–West.
O tratamento de dependência necessário depende do desenho. Horizontes longos, alvos persistentes, reestimações repetidas e mudanças de volatilidade podem gerar dependência além da sobreposição simples. Compare configurações de inferência razoáveis e explique-as, em vez de selecionar a que produz o menor valor-p.
Trate os valores críticos normais como aproximação, não garantia
Testes de previsão entre modelos aninhados podem ter distribuições nulas não convencionais, sobretudo quando as amostras de estimação e avaliação crescem juntas. A análise de Clark e McCracken mostra que os testes de igualdade de acurácia e de encompassing para previsões aninhadas têm comportamento assintótico e em amostras finitas diferente da comparação familiar entre modelos não aninhados. Clark e West justificam uma estatística ajustada com inferência aproximadamente normal útil nos desenhos estudados, mas isso não é uma garantia universal para amostras finitas. Clark e McCracken (2001)00071-9); Clark e West (2007).
Amostras de avaliação pequenas, muitos parâmetros adicionais, benchmarks mal especificados, seleção de preditores orientada pelos dados e a escolha entre estimação móvel e recursiva podem afetar o tamanho e o poder do teste. Se a amostra ou o desenho diferir materialmente das condições estudadas nos artigos, considere valores críticos adequados ao desenho ou um procedimento de simulação/bootstrap cuidadosamente especificado. Informe os tamanhos das amostras de estimação e avaliação e deixe claro qual distribuição de referência gerou o valor-p.
Diferencie testes próximos e limite as afirmações sobre previsões
O teste Diebold–Mariano pergunta se duas séries de perdas de previsão têm a mesma perda esperada em uma estrutura geral de perdas pareadas. O ajuste Clark–West é voltado a comparações de erros quadráticos em que um modelo contém o outro e os parâmetros adicionais estimados distorcem a diferença bruta de MSPE sob a hipótese nula. Aplicar o ajuste a modelos não aninhados e sem relação muda a pergunta sem justificativa. O artigo original de DM permite diversas medidas de perda e discute erros de previsão que não precisam ser gaussianos nem independentes; ele é um trabalho relacionado, não sinônimo do procedimento para modelos aninhados. Diebold e Mariano (1995).
Nenhum dos dois métodos resolve os graus de liberdade do pesquisador ao testar vários alvos, horizontes, benchmarks e conjuntos de preditores. Se a comparação final surgiu de uma busca ampla, registre a família de candidatos e use um método concebido para a questão no nível da busca. O guia White’s Reality Check e Hansen’s SPA aborda inferência para toda a família de regras de negociação pesquisadas; o teste Clark–West, por si só, não transforma uma comparação selecionada em confirmação.
Um resultado unilateral significativo é evidência, sob as hipóteses declaradas, de que o modelo maior melhora a acurácia esperada dos erros quadráticos para o alvo e o desenho de avaliação testados. Ele não mostra que o preditor adicional é causal, que o sinal continuará estável ou que uma estratégia com a previsão terá retornos positivos. A melhora pode ser pequena demais para influenciar decisões, e os maiores ganhos do modelo podem ocorrer em períodos caros para operar.
A rentabilidade de uma estratégia exige uma regra separada, dados de avaliação intocados e spreads, taxas, slippage, impacto de mercado, financiamento, custos de empréstimo e limites de risco realistas. Afirmações causais exigem uma estratégia de identificação adequada à pergunta; uma comparação de previsões após a amostra não é um desenho causal. Declare o que o resultado Clark–West de fato demonstra e deixe as demais afirmações para evidências que as testem.
Relate o desenho para permitir a reprodução da comparação
Nomeie o modelo restrito e o maior, identifique as restrições exatas que os tornam aninhados e defina alvo, horizonte, unidades dos erros quadráticos, janela de estimação, agenda das origens de previsão, datas de avaliação e regra de amostra comum. Explique se os coeficientes são reestimados recursivamente ou em uma janela móvel e como o conjunto de informações e as versões dos dados são preservados.
Informe os dois MSPEs brutos, a média da diferença ajustada Clark–West, a convenção de sinal, o erro-padrão, a alternativa unilateral, a distribuição de referência ou os valores críticos, o valor-p e o estimador de dependência. Divulgue também o número de parâmetros adicionais, os tamanhos das amostras, as buscas por preditores e horizontes, a escolha do benchmark e se a janela de avaliação influenciou o desenho do modelo. Esse registro ajuda a distinguir um teste ajustado de modelo aninhado de uma comparação geral de previsões e a avaliar a incerteza restante.
Perguntas frequentes
Q1O teste Clark–West substitui o teste Diebold–Mariano?
Não. Clark–West trata da comparação de MSPE quadrático entre modelos aninhados. Diebold–Mariano é uma estrutura geral de perdas pareadas, e não se deve presumir que sua distribuição de referência usual trate modelos aninhados automaticamente.
Q2Uma média ajustada positiva prova que o modelo maior é melhor?
Não. Ela aponta para o modelo maior conforme a convenção de sinal declarada, mas a inferência também exige erro-padrão adequado, desenho fora da amostra confiável e observações suficientes.
Q3Posso usar Clark–West com modelos que não são aninhados?
Não por padrão. A correção é motivada pelo ruído de estimação sob uma hipótese nula de modelos aninhados. Para modelos não aninhados, escolha um teste compatível com o desenho da previsão e a função de perda.
Q4Um resultado Clark–West significativo implica uma estratégia de negociação lucrativa?
Não. O teste avalia a acurácia da previsão para um alvo e desenho de avaliação. O resultado de uma estratégia também depende da regra de decisão, execução, custos, financiamento, risco e novas evidências fora da amostra. Pesquisa principal - Clark e West, “Approximately Normal Tests for Equal Predictive Accuracy in Nested Models” (2007) - Clark e McCracken, “Tests of Equal Forecast Accuracy and Encompassing for Nested Models” (2001)00071-9) - West, “Asymptotic Inference about Predictive Ability” (1996) - Diebold e Mariano, “Comparing Predictive Accuracy” (1995)
Fontes e leituras adicionais
Relatar um problema
Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar
Verificação rápida
Terminou o guia? Confira o que aprendeu com 3 perguntas
Pergunta 01
Por que o ajuste Clark–West adiciona a diferença quadrática entre as duas previsões?
Escolha uma resposta para ver a explicação