Regressão de Mincer–Zarnowitz: teste o viés e a calibração da previsão
Entenda como a regressão de Mincer–Zarnowitz testa o intercepto e a escala de uma previsão, por que erro médio zero não significa calibração e o que o teste não comprova
Neste guiaErro médio zero ainda pode esconder um problema de calibração
Resumo breve
A regressão de Mincer–Zarnowitz (MZ) é um diagnóstico linear de calibração: verifica se os valores realizados acompanham o nível e a escala das previsões. A hipótese nula mais comum fixa o intercepto em zero e a inclinação da previsão em um. Essa restrição conjunta informa mais do que olhar apenas o erro médio, mas não prova que o previsor tenha usado bem todas as informações disponíveis.
Erro médio zero ainda pode esconder um problema de calibração
Imagine um modelo que prevê o retorno do próximo período ou uma economista que estima o crescimento do próximo trimestre. A média dos erros de previsão na amostra de avaliação pode ser zero. Isso é um indício contrário a uma superestimação ou subestimação média persistente, mas não mostra que os valores previstos variam na mesma proporção que os resultados posteriores. As previsões podem ser extremas demais, comprimidas demais ou deslocadas linearmente, enquanto erros positivos e negativos se cancelam.
A regressão MZ torna essa segunda questão visível ao regredir o resultado realizado sobre a previsão. Mincer e Zarnowitz apresentaram esse método ao avaliar previsões econômicas (capítulo de 1969). É um diagnóstico para previsões pontuais de um alvo numérico, especialmente quando se busca a média condicional sob perda quadrática. Não compara qual de dois modelos tem a menor perda média; para essa pergunta, consulte o guia de Diebold–Mariano.
A distinção também importa em pesquisas de trading. Uma previsão de retorno pode ter pouco viés médio e ainda assim estar na escala errada; uma previsão de volatilidade pode ficar alta demais em uma faixa e baixa demais em outra. A regressão pode apontar uma incompatibilidade linear, mas o resultado depende da amostra de avaliação, da definição do alvo, do momento em que as informações estavam disponíveis e do método de inferência. Ela não prova que uma previsão possa se transformar em uma regra de trading lucrativa.
Alinhe a origem da previsão, o alvo e a versão dos dados
Para cada origem de previsão t, associe uma previsão (fₜ) ao alvo realizado depois (yₜ) que ela pretendia antecipar. Cada par tem horizonte fixo: (fₜ) foi emitida em uma origem anterior para o alvo posterior (yₜ); nas equações seguintes, o índice t é uma notação compacta para esses pares. Os dois valores devem se referir à mesma variável, horizonte, unidade e convenção de horário. Associar a previsão de retorno de cinco dias a um retorno realizado de um dia não testa a calibração para o alvo pretendido.
Use previsões que realmente estavam disponíveis em cada origem e preserve o valor previsto, a versão do modelo, a versão histórica dos dados e o horário de corte da informação. Os primeiros dados macroeconômicos divulgados podem ser revisados mais tarde. Decida se a calibração será avaliada contra a divulgação inicial ou contra um valor final revisado e mantenha essa escolha. Substituir os dados históricos de entrada por valores revisados pode dar à avaliação informações que o previsor original não tinha.
Em séries de trading, alinhe de forma consistente os componentes de fechamento a fechamento, intradiário e overnight. Alvos de vários períodos sobrepostos também criam dependência entre erros de previsão consecutivos. Uma amostra de avaliação comum é importante: se faltam previsões de um modelo justamente nos dias voláteis, uma diferença na composição das datas pode parecer um problema de calibração. Use os mesmos alvos e o mesmo calendário de origens para todas as séries avaliadas.
Separe previsões realmente geradas de valores ajustados. Se o modelo foi estimado com as mesmas observações usadas na regressão MZ, o ajuste dentro da amostra pode dar a impressão de calibração. Para fazer uma afirmação sobre previsões futuras, construa uma sequência cronológica fora da amostra, reestime o modelo em cada origem usando somente o que estava disponível naquele momento e reserve um período final de confirmação que não tenha sido usado para escolher modelo ou limiar.
Estime a regressão de Mincer–Zarnowitz e declare a hipótese nula
A regressão padrão em níveis é
yₜ = α + β fₜ + uₜ
em que (yₜ) é o alvo realizado, (fₜ) é a previsão e (uₜ) é o resíduo da regressão. A restrição conjunta de calibração mais usada é
H₀: α = 0 e β = 1
Se ambas as restrições forem válidas, a relação linear ajustada entre resultado e previsão será a linha de identidade. Não será necessário um deslocamento constante, e um aumento de uma unidade na previsão corresponderá a um aumento de uma unidade no resultado ajustado. Estime a regressão e teste as duas restrições em conjunto com Wald ou um teste F equivalente, usando uma estimativa de covariância compatível com o desenho amostral. Testar o intercepto e a inclinação separadamente não equivale a testar a restrição conjunta.
O resíduo (uₜ) não é automaticamente o erro bruto de previsão (yₜ − fₜ). Eles são iguais sob a hipótese nula conjunta; fora dela, o intercepto e a inclinação estimados absorvem um deslocamento e uma mudança linear de escala. Informe também o erro de previsão observado, além dos coeficientes, para mostrar tanto o erro médio quanto a relação de calibração.
A restrição MZ às vezes é chamada de teste de não tendenciosidade ou racionalidade da previsão. Defina o termo com precisão. A condição de erro médio incondicional zero é (E[yₜ − fₜ] = 0); as restrições (α = 0, β = 1) impõem uma relação linear específica e, em geral, são mais fortes. Holden e Peel mostram que, na formulação deles, a restrição conjunta convencional é suficiente, mas não necessária, para a não tendenciosidade (1990). Não trate “não tendenciosa” e “calibrada por MZ” como sinônimos sem explicar qual restrição foi testada.
<!-- learn:illustration -->

Um exemplo pequeno separa o viés médio da restrição conjunta
Considere três previsões hipotéticas e os resultados posteriores:
| Previsão (fₜ) | Valor realizado (yₜ) | Erro (yₜ − fₜ) |
|---|---|---|
| 1 | 1.5 | 0.5 |
| 2 | 2.0 | 0.0 |
| 3 | 2.5 | −0.5 |
A média das previsões é 2, assim como a média dos resultados, e o erro médio de previsão é zero. Mesmo assim, os valores seguem (yₜ = 1 + 0.5 fₜ), então a regressão MZ tem intercepto (α = 1) e inclinação (β = 0.5), e não (0, 1). Os erros se anulam na média, mas a restrição de calibração linear falha: neste exemplo construído, o resultado varia apenas metade do que varia a previsão.
Esta é uma ilustração aritmética montada para explicar o conceito, não são dados de mercado nem uma amostra para inferência. Três pontos sem ruído não justificam um valor-p significativo ou a conclusão de que um sistema real de previsão falhou. Em uma amostra verdadeira, o teste conjunto considera a incerteza da estimação. Um grande desvio de coeficiente pode ser estimado com pouca precisão; um pequeno pode ser estimado com precisão quando há observações suficientes. O exemplo mostra apenas que erro médio e restrição MZ respondem a perguntas diferentes.
Um recalibrador como (1 + 0.5 fₜ) reproduziria exatamente esses três resultados por ter sido construído com eles. Isso não demonstra que funcionará depois. Se a recalibração faz parte do procedimento, estime-a em um segmento de treino anterior e avalie a previsão ajustada em dados posteriores que não determinaram aqueles coeficientes.
Leia juntos o intercepto, a inclinação e o R-quadrado
O intercepto (α) é o resultado ajustado quando a previsão é zero; seu sentido prático depende de zero estar dentro ou perto da faixa prevista. A inclinação (β) descreve o quanto o resultado ajustado muda com a previsão. Considerando o intercepto, uma inclinação abaixo de um significa que a previsão varia mais por unidade do que o resultado ajustado; acima de um significa o contrário. Nenhum dos coeficientes, sozinho, descreve toda a relação quando o outro também é livre.
Um (R²) alto não comprova calibração. Por exemplo, a relação sem ruído (yₜ = 2 + 1.1 fₜ) tem (R² = 1), mas não satisfaz a hipótese nula MZ. O (R²) resume quanto da variação amostral é explicado pelo ajuste linear; o teste conjunto pergunta se a reta ajustada é a linha de identidade. Por outro lado, uma previsão ruidosa pode ter (R²) baixo mesmo sem rejeição da restrição conjunta. Calibração e precisão estão relacionadas, mas são propriedades diferentes.
Não deduza o resultado de calibração apenas pelos dois testes t individuais. As estimativas do intercepto e da inclinação podem ser correlacionadas, e a estatística Wald/F conjunta usa essa covariância. Informe α, β e sua incerteza, a estatística conjunta e o valor-p, o tamanho da amostra e o erro bruto médio. Um gráfico de dispersão com a linha de identidade ou uma comparação por grupos pode ajudar; avise se os grupos foram escolhidos depois de examinar os dados. Um teste linear pode não identificar relação curva, mudança de regime ou erros específicos nas caudas.
Calibração é mais fraca do que eficiência preditiva completa
Sob perda quadrática, a previsão pontual ótima é a esperança condicional do alvo dado o conjunto de informações do previsor. Isso implica que informações disponíveis na origem não deveriam prever erros posteriores. Mas a regressão MZ verifica somente uma relação linear que envolve a própria previsão e uma constante; não testa todas as outras variáveis desse conjunto de informações.
Um diagnóstico mais rigoroso pode incluir variáveis informativas (zₜ), definidas de antemão, em uma regressão do erro, por exemplo:
yₜ − fₜ = δ₀ + δ₁ zₜ + vₜ
Se uma variável conhecida na origem prevê erros posteriores, pode ter ficado informação útil de fora. O momento em que cada variável estava disponível e sua seleção precisam ser cuidadosos; experimentar muitos atrasos, estados de mercado e transformações cria outro problema de busca múltipla. Não encontrar previsibilidade em uma lista curta não prova eficiência em relação a todo o conjunto de informações.
Zarnowitz discute viés, correlação serial, tamanho amostral e poder dos testes para previsões de pesquisas (NBER Working Paper 1070, 1983). Por isso, descreva MZ como diagnóstico de calibração linear ou verificação fraca de eficiência, não como prova de que todas as informações relevantes foram usadas da melhor forma. O guia Giacomini–White trata de uma comparação condicional diferente, baseada em momentos de perda selecionados.
Considere a estimação, a sobreposição e a incerteza em amostras finitas
Erros de previsão podem ser heterocedásticos, autocorrelacionados ou sobrepostos, especialmente em previsões móveis de múltiplos passos. As fórmulas usuais de OLS não garantem, por si sós, erros-padrão válidos para a restrição conjunta. Use uma inferência justificada pelo horizonte, padrão de dependência e esquema de estimação, e informe o método em vez de presumir independência. Não existe uma largura de banda ou correção única para todo desenho.
Se os parâmetros do modelo, um ajuste de calibração e seu teste forem construídos na mesma amostra curta, a incerteza convencional da regressão talvez não cubra o procedimento inteiro. Previsões aninhadas também podem gerar distribuições nulas não padrão em comparações de acurácia. Use um método derivado para a construção real da previsão ou avalie um passo de calibração completamente especificado em um conjunto de teste posterior. Não tente muitas equações, alvos e amostras para depois tratar o último valor-p como confirmação.
Não rejeitar não prova calibração; o teste pode ter baixo poder ou intervalo amplo. Rejeitar também depende do alvo, da amostra, da forma linear e da estimativa de covariância. Verifique a sensibilidade a escolhas razoáveis de avaliação, divulgue essas verificações e diferencie-as de um teste definido previamente. Isso importa especialmente para previsões persistentes ou poucos episódios independentes.
Escolha o teste adequado à pergunta sobre a previsão
MZ testa uma restrição linear de calibração entre previsão e alvo realizado. O teste de Diebold–Mariano, por sua vez, pergunta se dois procedimentos de previsão têm a mesma perda média segundo uma métrica escolhida. Uma previsão pode estar calibrada e ainda ter desempenho pior nessa métrica, ou ser mais precisa em média e falhar na calibração MZ.
Se a pergunta é se a acurácia muda com informações conhecidas na origem da previsão, o teste Giacomini–White avalia momentos condicionais de perda selecionados. Se muitas previsões ou regras de trading foram pesquisadas, o Model Confidence Set ou White Reality Check/Hansen SPA aborda outro problema de seleção entre candidatos. Nenhum desses métodos substitui um alvo bem definido e origens de previsão honestas.
A regressão MZ padrão em níveis se aplica a previsões pontuais de um alvo numérico. Previsões de quantis, probabilidades, intervalos e densidades precisam de testes de calibração e métricas adequados a esses objetos. Um bom resultado para a média não se transfere automaticamente para uma previsão de risco de cauda ou uma distribuição de volatilidade.
Relate o desenho de calibração para que possa ser reproduzido
Informe o alvo, horizonte, unidades, corte de informação, datas de avaliação, versão dos dados e se as previsões foram realmente geradas fora da amostra. Apresente a equação, a definição de erro de previsão e as restrições testadas. Esclareça se “não tendenciosa” significa erro médio zero ou a restrição MZ conjunta (α = 0, β = 1).
Apresente as estimativas dos coeficientes, erros-padrão ou intervalos, estatística Wald/F conjunta, graus de liberdade, valor-p, número de origens, erro médio de previsão e (R²) com interpretação limitada. Explique a covariância ou o método de reamostragem, principalmente quando há horizontes sobrepostos ou dependência serial. Informe a estimação do modelo, a recalibração, a seleção e quaisquer alvos, amostras ou transformações alternativos testados.
Um relato transparente permite distinguir viés médio, calibração linear, eficiência informacional e acurácia comparativa. São afirmações empíricas diferentes. Atender a uma restrição de regressão não valida todos os usos da previsão, e uma avaliação de previsão, sozinha, não comprova rentabilidade de trading após os custos.
Perguntas frequentes
Q1O teste de Mincer–Zarnowitz verifica apenas o erro médio de previsão?
Não. O erro médio compara as médias da previsão e do resultado. O teste MZ convencional restringe conjuntamente o intercepto a zero e a inclinação a um. Holden e Peel mostram que essa restrição é suficiente, mas não necessária, para a não tendenciosidade em sua formulação.
Q2Passar no teste MZ prova que uma previsão é eficiente?
Não. Ele testa uma relação linear que inclui a previsão, não se todas as informações disponíveis na origem são incapazes de prever erros. Eficiência exige uma condição mais forte sobre o conjunto de informações.
Q3Posso usar a mesma regressão para uma previsão de VaR ou de quantil?
Não sem ajustar a definição de calibração e a inferência. A regressão padrão em níveis é para previsões pontuais numéricas; quantis e previsões de cauda exigem testes e métricas próprios.
Q4A calibração prova que uma estratégia de trading é lucrativa?
Não. Calibração trata da relação entre previsões e resultados. Uma afirmação de lucratividade exige uma regra de decisão definida previamente e uma avaliação separada fora da amostra que inclua execução, taxas, financiamento, impacto de mercado e risco. Pesquisa primária - Mincer e Zarnowitz, “The Evaluation of Economic Forecasts” (1969) - Holden e Peel, “On Testing for Unbiasedness and Efficiency of Forecasts” (1990) - Zarnowitz, “Rational Expectations and Macroeconomic Forecasts” (NBER Working Paper 1070, 1983) - Diebold e Mariano, “Comparing Predictive Accuracy” (1995) - Giacomini e White, “Tests of Conditional Predictive Ability” (2006)
Fontes e leituras adicionais
Relatar um problema
Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar
Verificação rápida
Terminou o guia? Confira o que aprendeu com 3 perguntas
Pergunta 01
Qual é a hipótese nula conjunta convencional da regressão MZ em níveis?
Escolha uma resposta para ver a explicação
Glossário de opções
Definições claras dos termos essenciais, de calls, puts e cadeia de opções a IV, gregas e spread bid-ask
Ver o glossário de opções