Diagnóstico de instrumentos débiles: F de primera etapa e inferencia robusta
Aprende cómo el estadístico F de primera etapa, el R² parcial, los criterios de Stock–Yogo, los diagnósticos robustos y la inferencia de Anderson–Rubin responden a distintas preguntas sobre instrumentos débiles.
En esta guíaPor qué importa la fuerza del instrumento
Resumen breve
Un estadístico de primera etapa resume cuánto explican los instrumentos excluidos de un regresor endógeno una vez condicionados los controles incluidos. No demuestra que el instrumento sea válido y «F superior a 10» no es una garantía universal. El diagnóstico apropiado depende del número de regresores endógenos y de los supuestos sobre los errores; la inferencia robusta a instrumentos débiles puede seguir siendo amplia o no acotada. La fuerza es solo una parte de la identificación. Una primera etapa fuerte no demuestra que (Z) sea independiente del error estructural ni que afecte al resultado únicamente a través de (X).
Por qué importa la fuerza del instrumento
Las variables instrumentales aprovechan la variación de un regresor endógeno (X) que predicen los instrumentos excluidos (Z), condicionada a los controles incluidos (W). Si (Z) predice poco de la variación restante de (X), los datos contienen poca información sobre el efecto estructural que procede de esa fuente.
Con relevancia débil, el 2SLS puede presentar sesgo hacia OLS en muestras finitas y su distribución muestral puede apartarse considerablemente de la aproximación normal. Por eso, un intervalo de Wald convencional puede tener una cobertura deficiente aunque el error estándar parezca preciso. Staiger y Stock desarrollan una teoría asintótica de instrumentos débiles que explica estos problemas y motiva regiones de confianza no estándar (artículo de 1997).
La fuerza es solo una parte de la identificación. Una primera etapa fuerte no permite saber si (Z) es independiente del error estructural ni si afecta al resultado solo a través de (X). La guía de variables instrumentales trata por separado esos supuestos y el efecto que se identifica.
La primera etapa aísla la variación condicional del instrumento
Con un regresor endógeno y (q) instrumentos excluidos, la primera etapa se escribe así:
\[ X_t = W_t'\delta + Z_t'\pi + v_t. \]
Aquí (W_t) contiene controles exógenos incluidos, a menudo con una constante, y (Z_t) los instrumentos excluidos. El contraste F estándar de primera etapa evalúa (H_0:\pi=0): de forma conjunta, los instrumentos excluidos no añaden poder explicativo después de (W_t).
Esta es una pregunta de relevancia condicional, no un contraste de la restricción de exclusión o de independencia. Informa de los controles incluidos, cuántos instrumentos excluidos se contrastan, la muestra, los supuestos de covarianza y el estadístico usado. Si hay varios instrumentos excluidos, el estadístico t individual de un coeficiente no sustituye el contraste conjunto.
R² parcial y estadístico F convencional
El (R^2) parcial mide qué proporción de la variación residual de (X), después de eliminar (W), explican los instrumentos excluidos residualizados. Llamemos (R^2_p) a ese valor, (n) al tamaño de la muestra, (k) al número de regresores incluidos (también la constante, si se utiliza) y (q) al número de instrumentos excluidos.
En el cálculo convencional de una regresión lineal homocedástica, el estadístico F incremental es
\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]
El numerador mide la mejora del ajuste por cada restricción sobre los instrumentos excluidos; el denominador estima la varianza residual con todos los grados de libertad residuales de la primera etapa. Esta fórmula no es una identidad válida para cualquier estadístico robusto.
Un estimador de covarianza robusto cambia el cálculo del contraste y su distribución de referencia.
El R² parcial y F están relacionados, pero responden a preguntas descriptivas distintas: el R² parcial mide el ajuste sin escala, mientras que F también refleja el tamaño muestral y el número de restricciones.
Un R² parcial pequeño puede producir un F grande con una muestra enorme, sin que todas las aproximaciones IV de muestra finita sean fiables.
F superior a 10 no es un umbral universal
El conocido valor 10 es una regla práctica, no un teorema de aprobado o suspenso. Staiger y Stock lo plantean como orientación en un marco concreto de instrumentos débiles; no garantiza inferencia válida para todas las muestras, estimadores, cantidades de instrumentos o procesos de error.
Stock y Yogo definen la debilidad del instrumento mediante límites del sesgo relativo de 2SLS o de la distorsión del tamaño del contraste Wald y tabulan valores críticos para esos criterios. Por tanto, el valor crítico depende del criterio elegido y de las dimensiones del modelo. Sus resultados convencionales de primera etapa y Cragg–Donald presuponen errores homocedásticos e independientes.
No se pueden trasladar sin cambios los números de esas tablas a cualquier contexto robusto (página del capítulo alojada por el autor).
Un valor superior a 10 no demuestra exclusión, independencia ni una interpretación causal. Un valor inferior a 10 tampoco demuestra que el instrumento sea inútil o que una estimación concreta sea inválida. Interpreta el estadístico como diagnóstico bajo supuestos explícitos y elige una inferencia que corresponda al diseño. La guía del test J de Hansen explica por qué un contraste de sobreidentificación no sustituye la evaluación de fuerza.
<!-- learn:illustration -->

Con varios regresores endógenos se necesita evaluar la fuerza conjunta
Si hay más de un regresor endógeno, los estadísticos F individuales de primera etapa pueden pasar por alto una combinación lineal débilmente identificada.
Cada regresor puede parecer bien predicho por separado aunque la variación inducida por los instrumentos no abarque las combinaciones necesarias para estimar todos los coeficientes estructurales con precisión.
En el modelo IV lineal homocedástico, el estadístico de autovalor mínimo de Cragg–Donald resume esta información conjunta de identificación. Los valores críticos de Stock–Yogo para este estadístico se refieren a criterios especificados de sesgo o distorsión del tamaño.
Los supuestos importan: los valores críticos habituales no son automáticamente válidos ante cualquier heterocedasticidad, dependencia serial o agrupación.
Importan el número de instrumentos excluidos, el número de regresores endógenos y el rango de la matriz de coeficientes de primera etapa. Describe el modelo completo y utiliza un contraste diseñado para él; no infieras la fuerza conjunta promediando los F individuales de primera etapa.
Los errores robustos requieren diagnósticos adaptados al diseño
Los datos financieros pueden ser heterocedásticos, presentar dependencia serial o estar agrupados por empresa, centro de negociación o unidad de política. El F clásico de primera etapa y la calibración de Cragg–Donald no se vuelven robustos solo por agrupar los errores estándar de segunda etapa.
Para un regresor endógeno, Montiel Olea y Pflueger desarrollan un contraste effective-F de instrumentos débiles que permite heterocedasticidad, autocorrelación y agrupación bajo las condiciones especificadas.
Escala el F convencional de primera etapa con información de covarianza y luego lo compara con valores críticos específicos del criterio (artículo de 2013).
El effective F no equivale a todos los F de Wald robustos que informa un programa estadístico.
El F de Wald rk de Kleibergen–Paap suele informarse con estimadores de covarianza robustos, pero los valores críticos de Stock–Yogo se derivaron para otros estadísticos convencionales y otros supuestos. No compares las cifras como si compartieran una escala calibrada.
Informa del estimador, el estadístico, el estimador de covarianza, el nivel de agrupación o el tratamiento de dependencia y el marco de valores críticos.
La estimación de covarianza Newey–West o robusta por conglomerados aborda la incertidumbre muestral bajo sus supuestos; por sí sola no resuelve la identificación débil.
La inferencia Anderson–Rubin puede seguir siendo válida con relevancia débil
Para un valor candidato del coeficiente (eta_0) en un modelo con un único regresor endógeno, forma el resultado ajustado por ese valor, (Y-Xeta_0), y contrasta si los instrumentos excluidos lo explican conjuntamente después de los controles incluidos.
Bajo la hipótesis nula y la exogeneidad del instrumento, este es un contraste Anderson–Rubin de (eta=eta_0).
Como el contraste no divide por un coeficiente estimado de primera etapa, su validez no necesita depender de que ese coeficiente sea grande.
La construcción original de Anderson–Rubin utiliza los supuestos distributivos del modelo. En aplicaciones, el estimador de covarianza y la distribución de referencia también deben corresponder al diseño muestral. Que un contraste se etiquete como «robusto» no permite ignorar que haya pocos grupos o dependencia serial.
Invertir el contraste sobre valores candidatos produce un conjunto de confianza. Con poca información, puede ser amplio, disjunto o no acotado; esto revela información identificadora limitada, no un fallo del programa. Los contrastes Anderson–Rubin también pueden tener poca potencia.
La guía de sobreidentificación GMM responde a otra pregunta y no debe tratarse como inferencia de coeficientes robusta a weak-IV.
El artículo original es Anderson y Rubin (1949).
Ejemplo de cálculo del F parcial
Considera una primera etapa hipotética con (n=200) observaciones, (k=3) regresores incluidos contando la constante, (q=2) instrumentos excluidos y (R^2_p=0.04).
Con la fórmula homocedástica convencional, los grados de libertad residuales son (200-3-2=195).
\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]
El cálculo indica que, con esos datos y supuestos, el estadístico conjunto convencional es 4.0625. Por sí solo no demuestra invalidez, no determina la conclusión específica de los criterios Stock–Yogo ni establece que el resultado se mantenga con heterocedasticidad o agrupación.
Un análisis robusto necesita un estadístico y una calibración propios, adaptados al diseño.
Si los mismos dos instrumentos se usan en un diseño de regresión discontinua difusa, la discontinuidad de primera etapa forma parte del análisis de relevancia específico del diseño.
El cálculo F anterior no sustituye los supuestos del RDD, las decisiones sobre ancho de banda ni la inferencia adecuada para ese diseño.
Informa por separado del diagnóstico y del argumento de identificación
Indica los regresores endógenos, los instrumentos excluidos, los controles incluidos, la muestra, los coeficientes de primera etapa, el R² parcial y el estadístico exacto de fuerza.
Si hay varios regresores endógenos, identifica el estadístico conjunto y sus supuestos. En contextos robustos, nombra la covarianza y el método de valores críticos en vez de escribir solo «F = …».
Si el estadístico apunta a una identificación débil, informa de un contraste o conjunto de confianza robusto a weak-IV para el coeficiente objetivo. Explica si el conjunto está acotado y cómo su forma cambia la conclusión sustantiva.
No reemplaces un intervalo poco informativo por uno de Wald convencional solo porque sea más fácil de resumir.
Por último, defiende la independencia y las vías de exclusión del instrumento con evidencia institucional y económica. Los diagnósticos de relevancia, las comprobaciones de balance, los resultados placebo y un contraste de sobreidentificación pueden revelar problemas, pero no demuestran todos los supuestos.
Un diseño de diferencias en diferencias utiliza otros supuestos de identificación; una primera etapa más fuerte no hace que ambos diseños sean intercambiables.
Preguntas frecuentes
Q1¿Un F de primera etapa superior a 10 demuestra que el instrumento es válido?
No. Como mucho, es un diagnóstico de relevancia bajo una calibración concreta. No establece independencia ni exclusión.
Q2¿El R² parcial es lo mismo que el estadístico F de primera etapa?
No. El R² parcial describe el ajuste incremental. El F convencional también depende del tamaño de la muestra, el número de restricciones y los grados de libertad residuales.
Q3¿Puedo comparar directamente un F robusto con los valores críticos de Stock–Yogo?
Solo si el estadístico y los supuestos coinciden con la calibración. Los estadísticos robustos suelen requerir valores críticos e interpretaciones distintos.
Q4¿Qué debo informar si el instrumento parece débil?
Informa del diagnóstico adaptado al diseño y de un contraste o conjunto de confianza robusto a weak-IV; especifica si el conjunto es amplio, está desconectado o no tiene límites.
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
¿Qué evalúa el contraste F convencional de primera etapa?
Elige una respuesta para ver la explicación
Glosario de opciones
Correlación entre un regresor y la perturbación que mezcla el efecto buscado con vías omitidas, simultaneidad o error de medición.
Leer la guía detalladaDiseño de regresión discontinuaDiseño que usa un salto de tratamiento en un umbral conocido y continuidad de resultados potenciales para identificar un efecto local.
Leer la guía detalladaDiferencias en diferenciasMétodo cuasiexperimental que resta el cambio contemporáneo comparador al cambio tratado para construir un contrafactual sin tratamiento.
Leer la guía detallada