Teste Giacomini–White: acurácia preditiva condicional
Entenda como o teste Giacomini–White verifica se a acurácia da previsão varia com condições conhecidas, como escolher instrumentos e quais conclusões o resultado permite
Neste guiaA acurácia média e a condicional respondem a perguntas diferentes
Resumo breve
A estrutura de Giacomini–White (GW) pergunta se informações disponíveis no momento da previsão estão relacionadas à perda relativa de duas previsões. Ela pode revelar diferenças escondidas por uma pontuação média, mas a conclusão depende dos métodos de previsão, da janela de avaliação, da função de perda e das variáveis condicionantes escolhidas previamente.
A acurácia média e a condicional respondem a perguntas diferentes
Suponha que a previsão A tenha uma perda média menor que a previsão B na amostra de teste. Essa média pode esconder um padrão útil: A pode se sair melhor em mercados tranquilos, enquanto B pode ser melhor quando a volatilidade está alta. Se a pergunta é qual previsão teve o melhor resultado em média, uma comparação incondicional é adequada. Se a pergunta é se informações conhecidas na data da previsão ajudam a identificar qual método terá melhor desempenho, o objeto é a capacidade preditiva condicional.
Giacomini e White formulam essa comparação entre métodos de previsão sob uma função de perda e um conjunto de informações especificados. A estrutura se aplica a previsões pontuais, intervalares, probabilísticas ou de densidade quando a perda é definida de acordo com a tarefa. O procedimento de estimação que gera cada previsão também faz parte do objeto avaliado. Por isso, uma janela móvel, uma amostra de treinamento fixa ou uma regra de ponderação não são detalhes inofensivos que possam ser alterados depois de ver os resultados; fazem parte do método comparado (Giacomini e White, 2006).
Um teste condicional tem relação com um teste de quebra estrutural, mas não é a mesma coisa. O teste condicional pergunta se a perda relativa está sistematicamente associada às informações escolhidas. O teste de quebra pergunta se os parâmetros ou uma relação mudaram em um momento desconhecido ou especificado. O [guia do teste de Diebold–Mariano](/pt-BR/learn/diebold-mariano-forecast-accuracy-test-explained) aborda a comparação incondicional de perdas médias; para uma pergunta condicional, é preciso especificar quais informações serão usadas como condição.
Alinhe as previsões, os resultados e o momento das informações primeiro
Considere (Y_{t+1}) o alvo observado depois da origem da previsão (t). As previsões ŷA,t+1 e ŷB,t+1 devem se referir ao mesmo alvo, horizonte, unidade e horário-limite das informações. Para uma função de perda (L) em que valores menores são melhores, defina a diferença entre as perdas assim:
dₜ₊₁ = L(Yₜ₊₁, ŷA,ₜ₊₁) − L(Yₜ₊₁, ŷB,ₜ₊₁)
Com essa convenção de sinal, um valor positivo significa que A teve uma perda maior e B foi melhor naquela origem; um valor negativo favorece A. Use uma linha por origem da previsão e avalie as duas previsões contra a mesma realização. Guarde os valores como estavam disponíveis naquele momento, junto com as versões dos dados e do modelo. Não reconstrua previsões históricas com dados revisados ou informações que só chegaram depois.
As variáveis condicionantes também precisam ser conhecidas na origem da previsão. Alguns exemplos são uma estimativa defasada de volatilidade, um indicador de evento anunciado previamente, a diferença defasada de perdas ou uma variável de estado do mercado calculada apenas com observações passadas. Uma variável medida depois de (t) não pode explicar qual previsão teria sido melhor em (t+1) sem introduzir viés de antecipação.
Escolha o escore de acordo com o alvo. O erro quadrático é uma opção para a previsão da média condicional, mas não é automaticamente apropriado para previsões de volatilidade, quantis ou densidade. Se um modelo prevê variância e outro prevê desvio padrão, primeiro transforme as previsões para que ambas se refiram à mesma quantidade. O teste não corrige uma incompatibilidade na pergunta avaliada.
Para previsões de volatilidade, use a mesma definição de variância realizada e o mesmo intervalo de amostragem ao avaliar ambas. Se uma previsão cobre preços intradiários e a outra também inclui retornos durante a noite, a diferença de perda pode refletir alvos diferentes, em vez de habilidade preditiva. Decida como tratar movimentos enquanto o mercado está fechado, frequência de amostragem, observações ausentes e a medida realizada; depois aplique as escolhas de forma consistente. Se a proxy realizada tiver ruído, esse erro de mensuração afeta os dois escores de perda e deve entrar na interpretação.
Declare a hipótese nula condicional e escolha as funções de teste
Seja (𝒢ₜ) o conjunto de informações usado para condicionar a comparação. A hipótese nula idealizada é
H₀: E[dₜ₊₁ | 𝒢ₜ] = 0
Isso significa que a diferença esperada entre as perdas é zero, dadas as informações especificadas. O teste GW de um passo transforma essa afirmação condicional em um conjunto de momentos, usando um vetor de funções de teste (h_t) escolhido previamente e mensurável com as informações disponíveis em (t):
H₀,ₕ: E[hₜ dₜ₊₁] = 0
O vetor (h_t) pode conter uma constante, que inclui a diferença média entre as perdas. Outros elementos podem representar um estado do mercado, uma perda relativa defasada ou uma transformação não linear definida antes de examinar os resultados. Por exemplo, se (S_t) é um indicador binário de alta volatilidade conhecido em (t), usar (h_t=(1,S_t)') testa tanto um momento constante quanto a associação entre a diferença de perdas e esse estado.
Um conjunto finito de funções de teste avalia apenas os momentos que ele define. A rejeição indica que pelo menos um dos momentos escolhidos é incompatível com zero sob as hipóteses do teste; não identifica um modelo universalmente melhor nem comprova que toda variável de estado possível seja relevante. Deixar de rejeitar não prova igualdade de desempenho condicional. Um teste apenas com uma constante é uma comparação de momento incondicional, não uma busca abrangente por todas as condições possíveis.
Defina a perda, os instrumentos, as transformações, a amostra e o horizonte da previsão antes de observar qual modelo vence. Acrescentar muitos indicadores de estado, limiares e defasagens depois de ver os resultados cria outro problema de busca. O próprio teste condicional não corrige essa seleção.
Fixe também o momento em que cada variável de estado é construída. Se “alta volatilidade” significa os 20% maiores valores da amostra completa, observações futuras ajudam a definir o limiar para origens passadas. Estime o limiar apenas com as informações disponíveis até cada origem ou use uma regra anunciada antes daquela data. Para uma variável de estado contínua, determine previamente as unidades e qualquer centralização ou padronização. Vários indicadores quase idênticos podem tornar os momentos redundantes e dificultar a inversão da matriz de covariância; use o menor conjunto que tenha interpretação clara.
Calcule a estatística de Wald e interprete sua distribuição de referência
Para (q) funções de teste, forme o vetor de momentos (g_{t+1}=h_t d_{t+1}). Sua média amostral é
ḡ = (1/n) Σₜ gₜ₊₁
A estatística GW de um passo tem a forma de Wald:
GW = n ḡ′ Ω̂⁻¹ ḡ
(Ω̂) estima a matriz de covariância do vetor de momentos. Sob a hipótese nula e as condições de regularidade do artigo original, a estatística segue assintoticamente uma distribuição qui-quadrado de referência com (q) graus de liberdade. Portanto, o número de funções de teste determina a distribuição de referência e pode afetar o poder. Muitos instrumentos fracos ou redundantes podem tornar a estimativa de covariância instável sem acrescentar informação útil.
Na configuração de um passo, a hipótese nula implica uma estrutura de diferença de martingal para o vetor de momentos, permitindo que o teste original use uma estimativa baseada nos segundos momentos amostrais. Para outros horizontes, resultados sobrepostos ou desvios dessa configuração, a estimativa da variância precisa corresponder às hipóteses e à estrutura de dependência do teste. Não copie automaticamente a largura de banda HAC de outro teste; siga a formulação da implementação escolhida. Métodos gerais de covariância HAC, incluindo o estimador de Newey e West (1987), são ferramentas para as situações que precisam deles, não uma regra universal de largura de banda para o GW. A credibilidade do resultado depende da estimativa de covariância e do desenho das previsões.
Verifique também se é possível estimar (Ω̂) a partir dos momentos selecionados. Funções de teste quase duplicadas, um indicador com pouquíssimas observações em um estado ou interações demais podem deixar a matriz singular ou instável. Nesse caso, a inversa pode mudar muito após uma pequena revisão dos dados e distorcer a estatística do teste. Cada função deve ter uma justificativa ligada a uma condição ou diferença de desempenho; informe o número de funções e a covariância dos momentos. Remover uma função pouco útil depois de observar o resultado é outra etapa de seleção e deve ser relatada.
O valor-p é uma evidência contra as restrições de momentos declaradas, dadas a distribuição de referência e as hipóteses do teste. Não é a probabilidade de A ou B ser o modelo verdadeiro, nem a chance de uma regra de negociação ser lucrativa. Informe a estatística, os graus de liberdade, o valor-p e os momentos exatos testados para que o leitor entenda o que a rejeição significa.
<!-- learn:illustration -->

Um exemplo com dois estados mostra o que a média pode esconder
Considere oito origens hipotéticas de previsão de um passo. Seja (S_t=0) um estado calmo e (S_t=1) um estado de alta volatilidade. Suponha que as diferenças hipotéticas de perda (d_{t+1}=L_A-L_B) sejam −2, −2, −2 e −2 nas quatro origens calmas, e +2, +2, +2 e +2 nas quatro origens de alta volatilidade. Diferenças negativas favorecem A; positivas favorecem B.
A média das oito origens é zero, portanto este pequeno exemplo não mostra diferença incondicional de perda. Mas a média no estado calmo é −2 e, no estado de alta volatilidade, +2. A classificação relativa se inverte conforme o estado. Um teste com (h_t=(1,S_t)') inclui um momento constante e um momento de alta volatilidade que podem refletir esse padrão.
Esses oito valores são uma ilustração didática, não uma amostra suficiente para uma inferência confiável. Em dados reais, considere como as previsões foram estimadas, se a variável de estado foi definida previamente, quantas origens existem e como os momentos das diferenças de perda variam ao longo do tempo. Um gráfico separado por estado não demonstra que o padrão persistirá.
Trate a janela de estimação como parte do método
A assintótica original de GW mantém finito o tamanho máximo da janela de estimação enquanto aumenta o número de previsões fora da amostra. Janelas móveis e uma amostra fixa de estimação se enquadram nessa configuração central. O tamanho da janela e qualquer regra de escolha baseada nos dados fazem parte de cada método de previsão e devem ser definidos e informados.
Isso importa quando os modelos de previsão são reestimados. Uma comparação que ignora a estimação dos parâmetros pode deixar de considerar a incerteza criada pela forma como cada método aprende com os dados passados. O GW pode acomodar previsões de modelos aninhados ou não aninhados sob as condições estabelecidas, mas isso não garante validade para qualquer implementação com janela expansiva nem para todo estimador. Na estrutura original de um passo, a hipótese central é uma janela finita. Uma janela expansiva convencional está fora dessa hipótese. Se a configuração diferir, use um resultado desenvolvido para a construção de previsão efetivamente utilizada.
O teste também não escolhe uma janela adequada para você. Uma janela curta pode se adaptar às condições recentes, mas usa menos observações. Uma janela longa ou expansiva pode estabilizar as estimativas e, ao mesmo tempo, preservar relações desatualizadas. Compare as opções com uma avaliação planejada e registre a própria seleção da janela. Giacomini e Rossi (2010) desenvolvem testes separados para a trajetória do desempenho relativo em ambientes instáveis; é uma pergunta relacionada, mas não a mesma estatística do teste condicional básico de GW.
Uma rejeição condicional, por si só, também não produz uma regra de negociação que escolha a previsão certa em tempo real. Um instrumento pode estar associado à diferença de perdas na amostra de avaliação sem gerar uma regra de alternância estável ou executável. Se quiser usar informações atuais para selecionar previsões, defina a regra com observações passadas e avalie-a em uma sequência posterior, ainda não utilizada, de origens, incluindo a incerteza de estimação e decisão.
Diferencie GW de DM, testes de modelos aninhados e testes de instabilidade
O [teste de Diebold–Mariano](/pt-BR/learn/diebold-mariano-forecast-accuracy-test-explained) pergunta se duas previsões têm a mesma perda média na amostra de avaliação. O GW pergunta se as informações escolhidas se associam à perda relativa, incluindo a comparação incondicional como uma restrição de momento especial. Como mostra o exemplo de dois estados, os modelos podem ter a mesma pontuação média e ainda apresentar desempenho relativo diferente conforme o estado.
Se as previsões vêm de modelos aninhados e a pergunta é especificamente sobre igualdade de MSPE, um método como o [ajuste de Clark–West](/pt-BR/learn/clark-west-test-nested-forecast-accuracy-adjustment-explained) trata uma hipótese nula e uma questão de ruído de estimação diferentes. Se muitas regras de negociação ou previsões foram pesquisadas e a pergunta é se algum candidato tem superioridade preditiva, use um procedimento para a família, como o [Reality Check de White ou o teste SPA de Hansen](/pt-BR/learn/white-reality-check-vs-hansen-spa-test-trading-rules-explained). Um teste condicional para um único par selecionado não desfaz uma busca mais ampla.
Por fim, evidências de que a acurácia relativa varia ao longo do tempo não identificam uma data de quebra específica. Um teste de instabilidade local ou de reversões pode ser mais adequado se a pergunta de pesquisa tratar da trajetória do desempenho relativo, e não da associação com instrumentos selecionados. Giacomini e Rossi (2010) estudam essas comparações. Escolha o método de acordo com a pergunta, em vez de tratar toda rejeição como evidência para uma estratégia de negociação que troca de regime.
Quando ainda há vários modelos em comparação, um procedimento para a família pode responder a uma pergunta diferente do teste condicional por pares. O [guia do Model Confidence Set](/pt-BR/learn/model-confidence-set-forecast-comparison-explained) explica como uma comparação iterativa pode manter um conjunto de modelos que não se distinguem no nível escolhido; isso não substitui a definição prévia das condições de uma análise GW.
Considere o baixo poder e os testes repetidos
Testes condicionais podem exigir muitos dados. Dividir a amostra entre estados calmos e voláteis reduz o número de observações que sustentam cada comparação. Acrescentar funções aumenta o número de momentos e os graus de liberdade. Se diversas condições tiverem pouca relação com a perda relativa, o teste pode ter baixo poder mesmo quando existem diferenças condicionais.
Um texto de trabalho de McCracken, do Federal Reserve Bank of St. Louis, estuda a existência, o tamanho e o poder do teste GW em um exemplo simples de perda quadrática. As simulações indicam que, nas configurações examinadas, o teste pode manter o tamanho correto, mas geralmente tem baixo poder (McCracken, 2020). Esse resultado é um alerta para a interpretação, não uma previsão numérica universal para toda aplicação. A não rejeição pode refletir pouca informação ou baixo poder; não deve ser descrita como prova de que as previsões são intercambiáveis.
Testar repetidamente outras definições de estado, limiares, horizontes, funções de perda e datas de avaliação aumenta a chance de uma descoberta casual. Registre todos os testes candidatos e separe a análise exploratória da amostra de confirmação pré-especificada. Se o objetivo é afirmar que alguma estratégia de uma família tem capacidade preditiva, aplique um método apropriado de correção por testes múltiplos ou data snooping a toda essa família. Mais instrumentos condicionais não criam automaticamente evidências melhores.
Quando vários modelos seguem em comparação, um procedimento para a família pode responder a outra pergunta além do teste condicional por pares. O [guia do Model Confidence Set](/pt-BR/learn/model-confidence-set-forecast-comparison-explained) descreve como uma comparação iterativa mantém um conjunto de modelos indistinguíveis no nível escolhido. Isso não define antecipadamente as condições usadas na análise GW.
Relate o desenho para que outra pessoa possa reproduzi-lo
Identifique os dois métodos de previsão, como cada um é estimado, se os modelos são aninhados, o alvo, o horizonte e as datas de avaliação. Informe exatamente a função de perda e a convenção de sinal para (d_{t+1}). Descreva cada elemento de (h_t), como ele é construído, quando se torna observável e se foi escolhido antes de consultar os resultados.
Informe o calendário das origens de previsão, a regra da janela de estimação, a versão dos dados, a regra da amostra comum, o número de origens fora da amostra, o número de funções de teste, o estimador de covariância, a distribuição de referência, a estatística, os graus de liberdade e o valor-p. Diga se os horizontes se sobrepõem e como a dependência é tratada. Apresente as perdas médias e os resumos das diferenças de perda, não apenas o resultado do teste.
Liste os outros instrumentos, limiares, janelas, funções de perda e pares de previsões que foram testados. Se as mesmas observações escolheram o modelo ou as variáveis condicionantes e depois foram usadas no teste, informe isso. Um resultado pode ser informativo sem ser confirmatório; transparência permite ao leitor avaliar seu alcance e planejar uma validação separada.
Perguntas frequentes
Q1O teste Giacomini–White é igual ao teste Diebold–Mariano?
Não. Diebold–Mariano se concentra na igualdade da perda média. A estrutura GW de um passo testa momentos condicionais escolhidos e inclui um momento incondicional como uma restrição possível.
Q2A rejeição identifica qual previsão usar em todo regime de mercado?
Não. Ela mostra que pelo menos um momento escolhido é incompatível com zero sob as hipóteses do teste. O resultado depende dos instrumentos, da amostra e da perda escolhidos e não garante desempenho em todos os estados.
Q3Posso continuar adicionando limiares de volatilidade até o teste rejeitar?
Isso cria uma busca entre variáveis condicionantes. Sempre que possível, especifique as variáveis de antemão e relate todas as configurações testadas. Para uma afirmação preditiva abrangente, use uma amostra de confirmação separada ou uma correção apropriada para toda a família de candidatos.
Q4Capacidade preditiva condicional significa que uma estratégia de negociação é lucrativa?
Não. O teste compara perdas de previsão. Uma afirmação sobre negociação exige uma regra de decisão definida e avaliações separadas de execução, taxas, financiamento, impacto de mercado e risco. Pesquisas principais - Giacomini and White, “Tests of Conditional Predictive Ability” (2006) - Giacomini and Rossi, “Forecast Comparisons in Unstable Environments” (2010) - McCracken, “Tests of Conditional Predictive Ability: Existence, Size, and Power” (Federal Reserve Bank of St. Louis Working Paper, 2020) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995) - Newey and West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)
Fontes e leituras adicionais
Relatar um problema
Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar
Verificação rápida
Terminou o guia? Confira o que aprendeu com 3 perguntas
Pergunta 01
Com dₜ₊₁ = L(A) − L(B), o que significa uma diferença de perda positiva?
Escolha uma resposta para ver a explicação