Skip to content
Todos os guias de opções e contratos futuros
O que o teste de sobreidentificação GMM pode e não pode demonstrar17 min de leitura

Teste J de Hansen: restrições de sobreidentificação no GMM

Entenda como a estatística J de Hansen testa as restrições de momentos sobreidentificadoras em um modelo GMM, como interpretar graus de liberdade e valor p e por que não rejeitar não comprova a validade dos instrumentos.

Neste guiaO teste J avalia as restrições em conjunto

Resumo breve

O teste J de Hansen avalia se as condições de momentos amostrais de um modelo GMM sobreidentificado são, em conjunto, suficientemente próximas de zero sob as hipóteses de ponderação e covariância escolhidas. Sob a hipótese nula e condições de regularidade, a função objetivo GMM minimizada tem distribuição aproximadamente qui-quadrado, com graus de liberdade iguais ao número de momentos menos o número de parâmetros estimados. A rejeição indica que o conjunto de restrições é difícil de conciliar com os dados; a não rejeição não valida cada instrumento nem prova que o modelo esteja correto.

O teste J avalia as restrições em conjunto

O método dos momentos generalizados (GMM) estima parâmetros tornando as versões amostrais das condições teóricas de momentos tão próximas de zero quanto possível. Em um modelo de variáveis instrumentais, uma condição pode afirmar que um instrumento proposto não é correlacionado com o erro estrutural no parâmetro verdadeiro. Outros modelos usam implicações de equações de precificação de ativos, equações de Euler ou restrições de dados em painel.

Se o modelo tem mais condições de momentos do que parâmetros desconhecidos, algumas restrições permanecem disponíveis para avaliação após a estimação. A estatística J de Hansen resume o quanto os momentos amostrais ajustados continuam distantes de zero depois da aplicação de uma matriz de ponderação especificada. É um teste conjunto de especificação dentro daquela estrutura. Não é uma auditoria direta capaz de classificar um instrumento específico como “válido” ou “inválido”.

Essa diferença importa em finanças e pesquisa quantitativa. Um modelo de negociação ou de precificação de ativos pode oferecer várias condições de momentos, mas o resultado depende dos retornos, fatores, instrumentos, datas e hipóteses de covariância que definem esses momentos. Um valor p pequeno pode ser evidência contra esse conjunto de hipóteses; um valor p grande não é evidência independente de que todas sejam verdadeiras.

Momentos amostrais formam uma distância GMM ponderada

Seja \(g_t(\theta)\) um vetor com \(q\) componentes de contribuições aos momentos na data \(t\), avaliado no vetor de parâmetros \(\theta\). Sua média amostral é:

\[ \bar g_T(\theta) = \frac{1}{T}\sum_{t=1}^{T}g_t(\theta). \]

O GMM escolhe \(\hat\theta\) para minimizar uma distância quadrática ponderada como:

\[ Q_T(\theta) = T\,\bar g_T(\theta)'W_T\bar g_T(\theta), \qquad J = Q_T(\hat\theta), \]

em que \(W_T\) é uma matriz de ponderação positiva. A ponderação determina quanto a divergência entre as condições de momentos contribui para o critério. Sob as hipóteses amostrais declaradas, o GMM eficiente estima uma ponderação relacionada à inversa da matriz de covariância de longo prazo dos momentos. O teste J usa o critério minimizado, não o valor da função objetivo em parâmetros escolhidos sem estimação.

A fórmula é compacta, mas as definições não são intercambiáveis. Mudar os instrumentos altera \(g_t\); mudar a amostra altera a média; mudar o estimador de covariância altera a ponderação; e mudar o estimador pode alterar os parâmetros ajustados. Portanto, uma estatística J reproduzível exige mais do que um número acompanhado da palavra “robusto”.

Os graus de liberdade contam as restrições que restam após o ajuste

Se há \(q\) condições de momentos independentes e \(k\) parâmetros localmente identificados, os graus de liberdade convencionais de sobreidentificação são \(q-k\). Por exemplo, três momentos independentes usados para estimar dois parâmetros deixam uma restrição sobreidentificadora. Sob a hipótese nula de que todos os momentos populacionais valem, uma estatística J corretamente ponderada é comparada assintoticamente com uma distribuição qui-quadrado com esse número de graus de liberdade.

Quando a quantidade de momentos é igual à de parâmetros, o modelo é exatamente identificado e os momentos ajustados geralmente podem ser levados a zero. Não há restrições excedentes para a estatística J avaliar: os graus de liberdade são zero e não existe teste de sobreidentificação. Mais parâmetros do que momentos independentes gera um problema de identificação distinto, não graus de liberdade negativos nem um teste J significativo.

Conte as restrições de momentos independentes efetivas, não apenas as colunas exibidas pelo software. Instrumentos redundantes ou momentos linearmente dependentes podem reduzir o posto efetivo. A referência qui-quadrado usual também depende de identificação e de outras condições de grandes amostras. Um valor nominal de \(q-k\) não corrige uma matriz de covariância de momentos singular ou mal estimada.

Um valor J hipotético mostra o que o valor p compara

Suponha que um modelo use três condições de momentos para estimar dois parâmetros; os graus de liberdade convencionais são \(3-2=1\). Considere que o software reporte uma estatística J de \(5.4\), usando um procedimento de ponderação concebido para ser consistente com as hipóteses de covariância declaradas. Em relação à referência qui-quadrado com um grau de liberdade, o valor p é aproximadamente \(0.020\). Com nível de 5% definido previamente, o pesquisador rejeitaria a hipótese nula conjunta de que os três momentos populacionais são zero.

Essa conclusão é mais restrita do que “o instrumento 2 é inválido”. A estatística J é uma única distância ponderada para o sistema como um todo e o teste não identifica qual momento causa o conflito. O mesmo resultado pode refletir um instrumento inválido, uma equação estrutural mal especificada, uma dinâmica omitida, um modelo de covariância errado ou outra falha da estrutura mantida. Diagnósticos adicionais e conhecimento do tema são necessários para investigar a origem.

Se o valor p fosse \(0.20\), a conclusão correta seria que o teste não rejeita as restrições conjuntas no nível escolhido. Isso não significa que “os instrumentos foram comprovados válidos”. O teste pode não rejeitar porque as restrições são plausíveis, porque seu poder é limitado ou porque a amostra é pequena ou ruidosa demais para distinguir violações. Defina o corte antes de examinar várias versões do modelo; procurar até encontrar um valor p aparentemente aceitável cria outro problema de seleção.

Várias condições de momentos amostrais passam pelo ajuste dos parâmetros, mas um vetor residual permanece em um campo com formato de covariância.
Ilustração conceitual da distância ponderada dos momentos residuais após o ajuste; não contém estimativas empíricas nem identifica um instrumento inválido específico.

A rejeição questiona o sistema mantido, não uma hipótese específica

A hipótese nula é um conjunto de restrições populacionais, interpretado sob o modelo e as condições assintóticas que justificam a distribuição de referência. Quando J rejeita, pelo menos parte desse sistema mantido é difícil de conciliar com a amostra observada sob a ponderação do teste. O teste, por si só, não separa uma restrição de exclusão inadequada de uma forma funcional errada, dependência do estado omitida, erro na construção dos dados ou estimativa inadequada da covariância de longo prazo.

O teste também não estabelece causalidade. Em um desenho IV, um teste de sobreidentificação pode avaliar se restrições adicionais são conjuntamente consistentes entre si sob o modelo. Não pode estabelecer a restrição de exclusão para cada instrumento, especialmente quando todos podem compartilhar uma violação. Relevância e exclusão têm significados diferentes: use diagnósticos de primeiro estágio e de identificação fraca para relevância e explique o mecanismo econômico que sustenta a exclusão.

Em uma aplicação linear de precificação de ativos, uma estatística do tipo J pode testar restrições conjuntas de precificação implicadas por determinado modelo de fatores e conjunto de ativos de teste. A rejeição não identifica automaticamente o fator ausente nem mostra que outra estratégia negociável renderá ganhos. A não rejeição tampouco comprova a verdade econômica do modelo. O [guia Fama–MacBeth](/pt-BR/learn/fama-macbeth-two-pass-regression-risk-premium-explained) aborda um procedimento relacionado de preço de risco transversal e seus limites inferenciais.

As versões de Sargan e Hansen dependem de hipóteses de covariância diferentes

O teste clássico de Sargan surgiu na estimação por variáveis instrumentais sob hipóteses restritivas de covariância, normalmente erros homocedásticos. O teste J de Hansen é a estatística GMM de sobreidentificação construída com uma covariância estimada dos momentos; ela pode considerar heterocedasticidade e, com uma estimativa adequada de covariância de longo prazo, dependência temporal. O rótulo “Hansen” não torna a implementação robusta a toda especificação incorreta; as escolhas de covariância e ponderação precisam corresponder ao processo dos momentos.

Para momentos de séries temporais, a dependência serial altera a variância de longo prazo da média amostral. Uma estimativa HAC como Newey–West pode fazer parte de um cálculo apropriado de covariância quando suas hipóteses e a escolha de defasagens se ajustam aos dados. Observações em painel ou agrupadas podem exigir outra construção de covariância. Uma correção usada somente nos erros-padrão dos coeficientes não significa automaticamente que a função objetivo J foi construída com uma matriz de ponderação compatível.

GMM de uma etapa, duas etapas e iterado pode estimar parâmetros com ponderações distintas. Nos procedimentos eficientes de duas etapas, a ponderação estimada também acrescenta incerteza amostral em amostras finitas; erros-padrão e comportamento dos testes podem ser frágeis, sobretudo quando há muitos momentos em relação às observações. As correções de amostra finita estudadas por Windmeijer dizem respeito à estimação de variância em configurações específicas de GMM linear eficiente em duas etapas. Não são um ajuste universal para toda estatística J.

Identificação fraca e instrumentos em excesso podem dar uma falsa sensação de segurança

O teste J não avalia a força dos instrumentos. Instrumentos pouco informativos podem tornar as estimativas de parâmetros e as aproximações convencionais pouco confiáveis; use métodos próprios para identificação fraca, em vez de interpretar um valor p J aparentemente confortável como diagnóstico de força. A calibração qui-quadrado de grandes amostras não garante que uma amostra financeira curta se comporte como seu limite assintótico.

Adicionar instrumentos ou condições de momentos pode parecer atraente por aparentar aumentar a informação. No GMM de painel dinâmico, a proliferação de instrumentos pode ajustar excessivamente variáveis endógenas e reduzir a capacidade dos testes de especificação de detectar violações. Assim, um valor p muito alto após a criação de um grande conjunto de instrumentos pode oferecer pouca segurança. Informe a quantidade, explique as defasagens ou a janela de construção e compare conjuntos menores defensáveis ou instrumentos colapsados quando pertinente.

Amostras pequenas, momentos quase colineares, estimativas de covariância ruins, parâmetros no limite e identificação fraca podem comprometer interpretações de livro-texto. Esses casos pedem análise de sensibilidade e inferência alternativa adequada, não a afirmação automática de que o teste J “passou”. Se a seleção do modelo envolveu muitos instrumentos, faixas de defasagens, fatores ou recortes amostrais, registre essa busca e não apresente o resultado mais favorável como se tivesse sido pré-especificado.

O teste de diferença de Hansen avalia condicionalmente um subconjunto aninhado

Alguns fluxos de trabalho com painéis dinâmicos relatam um teste de diferença de Hansen ou teste C para um subconjunto de condições de momentos, como um bloco adicional de instrumentos. Conceitualmente, a comparação de modelos aninhados pergunta se esse bloco acrescenta restrições compatíveis com os demais momentos mantidos. A conclusão é condicional ao restante da especificação; não é um certificado independente para cada instrumento.

A diferença entre duas estatísticas J só tem uma distribuição de referência sob as condições pertinentes de aninhamento, estimação e covariância. Os modelos comparados precisam usar amostras e definições de momentos compatíveis; a ponderação e o comportamento em amostras finitas também devem ser considerados. Um teste de subconjunto pode ter pouco poder quando o conjunto completo de instrumentos é grande. Se vários blocos forem testados, informe todas as comparações em vez de selecionar apenas um resultado favorável.

Relate o teste para que seu significado possa ser reproduzido

Informe a amostra, o vetor de parâmetros, as definições dos momentos, o número de observações, a quantidade e o posto efetivo das restrições e os graus de liberdade. Declare se o estimador foi de uma etapa, duas etapas ou iterado; como a matriz de ponderação foi obtida; qual estrutura de covariância foi permitida; e que ajuste para amostra pequena, se algum, foi utilizado. Relate a estatística J, a distribuição de referência, o valor p e o limiar de decisão especificado para a análise.

Mostre a quantidade e a construção dos instrumentos, diagnósticos de primeiro estágio ou relevância e a sensibilidade das estimativas a mudanças razoáveis no conjunto de momentos. Explique por que os instrumentos satisfazem o argumento econômico de temporalidade e exclusão; a não rejeição no teste de sobreidentificação não substitui essa justificativa. Se usar um teste de subconjunto, defina o subconjunto e a comparação explicitamente. Consulte [endogeneidade e variáveis instrumentais](/pt-BR/learn/endogeneity-instrumental-variables-finance-explained) para as hipóteses de IV e [erros-padrão robustos e HAC](/pt-BR/learn/robust-standard-errors-heteroskedasticity-hac-finance-explained) para as escolhas de covariância.

A teoria assintótica GMM de Hansen (DOI), o teste de variáveis instrumentais de Sargan (DOI), a análise de identificação fraca de Stock e Wright (DOI), o estudo de Roodman sobre proliferação de instrumentos (DOI), a análise de amostras finitas da variância em duas etapas de Windmeijer (DOI) e o estimador de covariância HAC de Newey e West (DOI) tratam de aspectos diferentes desse desenho. Seus resultados valem sob as hipóteses declaradas, não como aprovação genérica de um modelo empírico.

Perguntas frequentes

Q1Se o teste J de Hansen não rejeitar, isso prova que todos os instrumentos são válidos?

Não. A não rejeição significa que, sob as hipóteses do teste, não foi detectado um conflito conjunto no nível escolhido. Os instrumentos podem compartilhar uma violação e o poder do teste pode ser limitado.

Q2O que acontece quando um modelo é exatamente identificado?

Quando o número de momentos independentes é igual ao de parâmetros identificados, não há restrições adicionais para testar. Os graus de liberdade convencionais de sobreidentificação são zero.

Q3O teste J de Hansen testa instrumentos fracos?

Não. Ele avalia restrições de sobreidentificação. Use diagnósticos separados de relevância e identificação fraca e evite depender de aproximações assintóticas convencionais quando a identificação for fraca.

Fontes e leituras adicionais

Relatar um problema

Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar

Verificação rápida

Terminou o guia? Confira o que aprendeu com 3 perguntas

Pergunta 1 / 3

Pergunta 01

O que a estatística J de Hansen testa em um modelo GMM sobreidentificado?

Escolha uma resposta para ver a explicação

Glossário de opções