Diagnósticos de instrumentos fracos: F do primeiro estágio e inferência robusta
Entenda como o F do primeiro estágio, o R² parcial, os critérios de Stock–Yogo, os diagnósticos robustos e a inferência de Anderson–Rubin respondem a perguntas diferentes sobre instrumentos fracos.
Neste guiaPor que a força do instrumento importa
Resumo breve
Uma estatística de primeiro estágio resume quanto os instrumentos excluídos explicam um regressor endógeno, condicionando às variáveis de controle incluídas. Ela não comprova a validade do instrumento, e “F acima de 10” não é uma garantia universal. O diagnóstico adequado depende do número de regressores endógenos e das hipóteses sobre os erros; a inferência robusta a instrumentos fracos ainda pode gerar um conjunto amplo ou ilimitado. A força é apenas uma parte da identificação. Um primeiro estágio forte não demonstra que (Z) seja independente do erro estrutural nem que afete o resultado somente por meio de (X).
Por que a força do instrumento importa
Variáveis instrumentais usam a variação de um regressor endógeno (X) prevista pelos instrumentos excluídos (Z), condicionando às variáveis de controle incluídas (W). Se (Z) prevê pouco da variação restante de (X), os dados contêm pouca informação sobre o efeito estrutural que essa fonte identifica.
Com relevância fraca, o 2SLS pode ser enviesado em direção ao OLS em amostras finitas e sua distribuição amostral pode se afastar bastante da aproximação normal. Um intervalo de Wald convencional pode ter cobertura ruim mesmo quando o erro-padrão parece preciso. Staiger e Stock desenvolvem uma teoria assintótica para instrumentos fracos que explica esses problemas e motiva regiões de confiança não convencionais (artigo de 1997).
A força é apenas uma parte da identificação. Um primeiro estágio forte não demonstra que (Z) é independente do erro estrutural nem que afeta o resultado apenas por meio de (X). O guia de variáveis instrumentais aborda essas hipóteses separadas e o efeito identificado.
O primeiro estágio isola a variação condicional do instrumento
Com um regressor endógeno e (q) instrumentos excluídos, escreva o primeiro estágio como
\[ X_t = W_t'\delta + Z_t'\pi + v_t. \]
Aqui, (W_t) contém os controles exógenos incluídos, muitas vezes com uma constante, enquanto (Z_t) contém os instrumentos excluídos. O teste F padrão do primeiro estágio avalia (H_0:\pi=0), uma restrição conjunta de que os instrumentos excluídos não acrescentam poder explicativo depois de (W_t).
Essa é uma pergunta sobre relevância condicional, não um teste da restrição de exclusão ou de independência. Informe quais controles foram incluídos, quantos instrumentos excluídos são testados em conjunto, a amostra, as hipóteses de covariância e a estatística usada. Se houver vários instrumentos excluídos, o t individual de um coeficiente não substitui o teste conjunto.
R² parcial e a estatística F convencional
O (R^2) parcial mede a parcela da variação residual de (X), após remover (W), explicada pelos instrumentos excluídos residualizados. Denote esse valor por (R^2_p), o tamanho da amostra por (n), o número de regressores incluídos — contando a constante, se houver — por (k), e a quantidade de instrumentos excluídos por (q).
No cálculo convencional de uma regressão linear homocedástica, a estatística F incremental é
\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]
O numerador mede o ganho de ajuste por restrição sobre instrumentos excluídos; o denominador estima a variância residual usando todos os graus de liberdade residuais do primeiro estágio. Essa fórmula não é uma identidade universal para estatísticas robustas.
Um estimador de covariância robusto altera o cálculo do teste e sua distribuição de referência.
O R² parcial e o F são relacionados, mas respondem a perguntas descritivas diferentes: o R² parcial é uma medida de ajuste independente de escala, enquanto o F também reflete o tamanho amostral e o número de restrições.
Uma amostra muito grande pode produzir F elevado mesmo com R² parcial pequeno, sem tornar confiável toda aproximação IV de amostra finita.
F acima de 10 não é um limite universal
O valor conhecido de 10 é uma regra prática, não um teorema de aprovação ou reprovação. Staiger e Stock o apresentam como orientação em um modelo específico de instrumentos fracos; ele não garante inferência válida para toda amostra, estimador, quantidade de instrumentos ou processo de erro.
Stock e Yogo definem a fraqueza do instrumento por limites do viés relativo do 2SLS ou da distorção do tamanho do teste Wald e tabulam valores críticos para esses critérios. Portanto, o valor crítico depende do critério escolhido e das dimensões do modelo. Os resultados convencionais do primeiro estágio e de Cragg–Donald pressupõem erros homocedásticos e independentes.
Os números dessas tabelas não podem ser transportados sem ajustes para qualquer configuração robusta (página do capítulo hospedada pelo autor).
Um valor acima de 10 não comprova exclusão, independência ou interpretação causal. Um valor abaixo de 10 não prova que o instrumento seja inútil nem que determinada estimativa seja inválida. Trate a estatística como diagnóstico sob hipóteses declaradas e escolha a inferência adequada ao desenho. O guia do teste J de Hansen explica por que um teste de sobreidentificação não substitui a avaliação de força.
<!-- learn:illustration -->

Vários regressores endógenos exigem uma avaliação conjunta da força
Se houver mais de um regressor endógeno, estatísticas F de primeiros estágios separados podem deixar passar uma combinação linear fracamente identificada.
Cada regressor pode parecer previsto individualmente, mesmo que a variação induzida pelos instrumentos não cubra as combinações necessárias para estimar todos os coeficientes estruturais com precisão.
Na configuração IV linear homocedástica, a estatística do menor autovalor de Cragg–Donald resume essa informação conjunta de identificação. Os valores críticos de Stock–Yogo para ela visam critérios específicos de viés ou distorção do tamanho.
As hipóteses importam: os valores críticos conhecidos não são automaticamente válidos sob heterocedasticidade arbitrária, dependência serial ou agrupamento.
A quantidade de instrumentos excluídos, a quantidade de regressores endógenos e o posto da matriz de coeficientes do primeiro estágio são relevantes. Descreva a configuração completa e use um teste criado para ela; não infira a força conjunta pela média dos F individuais.
Erros robustos exigem diagnósticos compatíveis com o desenho
Dados financeiros podem ter heterocedasticidade, dependência serial ou agrupamento por empresa, plataforma ou unidade de política. O F clássico do primeiro estágio e a calibração Cragg–Donald não se tornam robustos apenas porque os erros-padrão do segundo estágio foram agrupados.
Para um regressor endógeno, Montiel Olea e Pflueger desenvolvem um teste effective-F para instrumentos fracos que permite heterocedasticidade, autocorrelação e agrupamento sob as condições especificadas.
Ele ajusta um F convencional do primeiro estágio usando informações de covariância e compara o resultado com valores críticos específicos do critério (artigo de 2013).
Effective F não é a mesma quantidade que todo F de Wald robusto informado por programas estatísticos.
O F de Wald rk de Kleibergen–Paap é frequentemente informado com estimadores robustos de covariância, mas os valores críticos de Stock–Yogo foram derivados para outras estatísticas convencionais e hipóteses. Não compare esses valores como se estivessem na mesma escala calibrada.
Informe o estimador, a estatística, o estimador de covariância, o nível de agrupamento ou tratamento da dependência e o referencial dos valores críticos.
A covariância Newey–West ou robusta a clusters trata a incerteza amostral sob suas hipóteses; ela não corrige, por si só, a identificação fraca.
A inferência de Anderson–Rubin pode continuar válida com relevância fraca
Para um valor candidato (eta_0) em um modelo com um único regressor endógeno, forme o resultado ajustado por esse valor, (Y-Xeta_0), e teste se os instrumentos excluídos o explicam em conjunto após os controles incluídos.
Sob a hipótese nula e a exogeneidade dos instrumentos, esse é um teste Anderson–Rubin de (eta=eta_0).
Como o teste não divide por um coeficiente estimado do primeiro estágio, sua validade não precisa depender de esse coeficiente ser grande.
A construção original de Anderson–Rubin usa as hipóteses distributivas do modelo. Na prática, o estimador de covariância e a distribuição de referência também precisam corresponder ao desenho amostral. O rótulo “robusto” não permite ignorar poucos clusters ou dependência serial.
A inversão do teste sobre valores candidatos produz um conjunto de confiança. Com pouca informação, esse conjunto pode ser amplo, desconexo ou ilimitado; isso indica informação identificadora limitada, não uma falha do software. Os testes Anderson–Rubin também podem ter baixo poder.
O guia de sobreidentificação GMM trata de outra pergunta e não deve ser confundido com inferência de coeficientes robusta a weak-IV.
O artigo original é Anderson e Rubin (1949).
Exemplo de cálculo do F parcial
Considere um primeiro estágio hipotético com (n=200) observações, (k=3) regressores incluídos contando a constante, (q=2) instrumentos excluídos e (R^2_p=0.04).
Pela fórmula homocedástica convencional, os graus de liberdade residuais são (200-3-2=195).
\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]
A conta mostra que, sob esses valores e hipóteses, a estatística conjunta convencional é 4.0625. Sozinha, ela não prova invalidade, não determina a conclusão específica dos critérios Stock–Yogo nem confirma que o resultado valha sob heterocedasticidade ou agrupamento.
Uma análise robusta exige estatística e calibração próprias, compatíveis com o desenho.
Se os mesmos dois instrumentos forem usados em um desenho de regressão descontínua fuzzy, a descontinuidade do primeiro estágio integra a análise de relevância específica do desenho.
O cálculo de F acima não substitui as hipóteses do RDD, as escolhas de largura de banda ou a inferência adequada a esse desenho.
Relate o diagnóstico e o argumento de identificação separadamente
Informe os regressores endógenos, instrumentos excluídos, controles incluídos, amostra, coeficientes do primeiro estágio, R² parcial e a estatística de força exata.
Com vários regressores endógenos, identifique a estatística conjunta e suas hipóteses; em configurações robustas, nomeie a covariância e o método dos valores críticos em vez de escrever apenas “F = …”.
Se a estatística sugerir identificação fraca, informe um teste ou conjunto de confiança robusto a weak-IV para o coeficiente de interesse. Explique se o conjunto é limitado e como seu formato altera a conclusão substantiva.
Não substitua um intervalo pouco informativo por um intervalo Wald convencional só porque é mais fácil resumi-lo.
Por fim, justifique os caminhos de independência e exclusão do instrumento com evidências institucionais e econômicas. Diagnósticos de relevância, verificações de equilíbrio, resultados placebo e um teste de sobreidentificação podem revelar problemas, mas não provam todas as hipóteses.
Um desenho de diferenças-em-diferenças usa hipóteses de identificação diferentes; um primeiro estágio mais forte não torna os desenhos intercambiáveis.
Perguntas frequentes
Q1Um F de primeiro estágio acima de 10 prova que o instrumento é válido?
Não. No máximo, é um diagnóstico de relevância sob uma calibração específica. Não comprova independência nem exclusão.
Q2O R² parcial é a mesma coisa que o F do primeiro estágio?
Não. O R² parcial descreve o ajuste incremental. O F convencional também depende do tamanho da amostra, do número de restrições e dos graus de liberdade residuais.
Q3Posso comparar diretamente um F robusto com valores críticos de Stock–Yogo?
Somente quando a estatística e as hipóteses correspondem à calibração. Estatísticas robustas frequentemente exigem outros valores críticos e outra interpretação.
Q4O que devo informar se o instrumento parecer fraco?
Informe o diagnóstico compatível com o desenho e um teste ou conjunto de confiança robusto a weak-IV, incluindo se o conjunto é amplo, desconexo ou ilimitado.
Fontes e leituras adicionais
Relatar um problema
Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar
Verificação rápida
Terminou o guia? Confira o que aprendeu com 3 perguntas
Pergunta 01
O que o teste F convencional do primeiro estágio avalia?
Escolha uma resposta para ver a explicação
Glossário de opções
Correlation between a regressor and the regression disturbance, causing OLS to mix a target effect with omitted pathways, simultaneity, or measurement error.
Ler o guia completoRegression discontinuity designA design using a treatment-probability jump at a known running-variable cutoff plus potential-outcome continuity to identify a local effect.
Ler o guia completoDifference-in-differencesA quasi-experimental method subtracting the comparison group's contemporaneous change from the treated group's change to construct an untreated counterfactual.
Ler o guia completo