Prueba J de Hansen: restricciones de sobreidentificación en GMM
Aprende cómo el estadístico J de Hansen contrasta las restricciones de momentos sobreidentificadas de un modelo, cómo interpretar sus grados de libertad y el valor p, y por qué no rechazar no demuestra la validez de los instrumentos.
En esta guíaLa prueba J evalúa las restricciones en conjunto
Resumen breve
La prueba J de Hansen evalúa si, bajo los supuestos elegidos de ponderación y covarianza, los momentos muestrales de un modelo GMM sobreidentificado están conjuntamente lo bastante cerca de cero. Bajo la hipótesis nula y las condiciones de regularidad, el objetivo GMM minimizado sigue aproximadamente una distribución chi-cuadrado, con grados de libertad iguales al número de momentos menos el número de parámetros estimados. Rechazar indica que el conjunto de restricciones es difícil de conciliar con los datos; no rechazar no verifica cada instrumento ni demuestra que el modelo sea correcto.
La prueba J evalúa las restricciones en conjunto
El método generalizado de momentos (GMM) estima parámetros haciendo que las versiones muestrales de las condiciones de momento teóricas se acerquen lo máximo posible a cero. En un modelo de variables instrumentales, un momento puede indicar que el instrumento propuesto no está correlacionado con el error estructural en el parámetro verdadero. Otros modelos generan condiciones de momento a partir de ecuaciones de valoración de activos, ecuaciones de Euler o restricciones de datos de panel.
Si el modelo tiene más condiciones de momento que parámetros desconocidos, después de estimar quedan restricciones adicionales que se pueden contrastar. El estadístico J de Hansen resume cuánto se alejan de cero los momentos muestrales ajustados tras aplicar una matriz de ponderación determinada. Es una prueba conjunta de especificación dentro de ese planteamiento. No es una auditoría directa que pueda etiquetar un instrumento concreto como «válido» o «no válido».
Esta distinción importa en finanzas y en la investigación cuantitativa. Un modelo de negociación o de valoración de activos puede proporcionar varias condiciones de momento, pero el resultado depende de qué rendimientos, factores, instrumentos, fechas y supuestos de covarianza las definan. Un valor p pequeño puede ser evidencia contra ese conjunto de supuestos; uno grande no es evidencia independiente de que todos sean ciertos.
Los momentos muestrales se convierten en una distancia GMM ponderada
Sea \(g_t(\theta)\) un vector de \(q\) componentes con las contribuciones a los momentos en la fecha \(t\), evaluado en el vector de parámetros \(\theta\). Su promedio muestral es:
\[ \bar g_T(\theta) = \frac{1}{T}\sum_{t=1}^{T}g_t(\theta). \]
GMM elige \(\hat\theta\) minimizando una distancia cuadrática ponderada como:
\[ Q_T(\theta) = T\,\bar g_T(\theta)'W_T\bar g_T(\theta), \qquad J = Q_T(\hat\theta), \]
donde \(W_T\) es una matriz de ponderación positiva. La ponderación determina cuánto contribuyen al criterio las discrepancias entre condiciones de momento. Bajo los supuestos de muestreo indicados, GMM eficiente emplea una ponderación relacionada con la inversa de la matriz de covarianza de largo plazo de los momentos. La prueba J utiliza el criterio minimizado, no el valor de la función objetivo para un parámetro elegido sin estimación.
La fórmula es compacta, pero sus componentes no son intercambiables. Cambiar los instrumentos modifica \(g_t\); cambiar la muestra modifica el promedio; cambiar el estimador de covarianza cambia la ponderación; y cambiar el estimador puede modificar los parámetros ajustados. Por eso, para reproducir un estadístico J se necesita más que un número y la palabra «robusto».
Los grados de libertad cuentan las restricciones que quedan tras el ajuste
Si hay \(q\) condiciones de momento independientes y \(k\) parámetros identificados localmente, los grados de libertad convencionales de sobreidentificación son \(q-k\). Por ejemplo, tres momentos independientes usados para estimar dos parámetros dejan una restricción sobreidentificada. Bajo la hipótesis nula de que se cumplen todos los momentos poblacionales, un estadístico J correctamente ponderado se compara asintóticamente con una distribución chi-cuadrado con esos grados de libertad.
Cuando el número de momentos y el de parámetros coinciden, el modelo está exactamente identificado y, por lo general, los momentos ajustados pueden llevarse a cero. No quedan restricciones sobrantes que la prueba J pueda evaluar: tiene cero grados de libertad y no permite comprobar la sobreidentificación. Tener más parámetros que momentos independientes plantea otro problema de identificación; no genera grados de libertad negativos ni una prueba J con sentido.
Cuenta las restricciones de momento independientes efectivas, no solo el número de columnas que muestra el software. Los instrumentos redundantes o los momentos linealmente dependientes pueden reducir el rango efectivo. La referencia chi-cuadrado convencional también exige identificación y otras condiciones de muestras grandes. Un valor nominal de \(q-k\) no corrige una matriz de covarianza de momentos singular o estimada con poca precisión.
Un valor J hipotético muestra qué compara el valor p
Supongamos que un modelo utiliza tres condiciones de momento para estimar dos parámetros, de modo que los grados de libertad convencionales son \(3-2=1\). Un programa informa de un estadístico J de (5{,}4) mediante un procedimiento de ponderación que debería ser coherente con los supuestos de covarianza indicados. Con la referencia chi-cuadrado convencional de un grado de libertad, el valor p es aproximadamente (0{,}020). Con un nivel del 5 % fijado de antemano, el investigador rechazaría la hipótesis nula conjunta de que los tres momentos poblacionales son cero.
La conclusión es más limitada que «el instrumento 2 no es válido». El estadístico J es una distancia ponderada para todo el sistema y no identifica qué momento genera el conflicto. El mismo resultado podría deberse a un instrumento no válido, una ecuación estructural mal especificada, una característica dinámica omitida, un modelo de covarianza incorrecto u otro fallo del planteamiento asumido. Para investigar la causa hacen falta diagnósticos posteriores y razonamiento especializado.
Si el valor p fuera (0{,}20), la conclusión correcta sería que la prueba no rechaza las restricciones conjuntas al nivel elegido. No significa que «se haya demostrado que los instrumentos son válidos». Puede no rechazarse porque las restricciones sean plausibles, la prueba tenga poca potencia o la muestra sea demasiado pequeña o ruidosa para distinguir las violaciones. El umbral debe fijarse antes de examinar variantes del modelo; buscar hasta encontrar un valor p aceptable crea otro problema de selección.

El rechazo cuestiona el sistema asumido, no una hipótesis concreta
La hipótesis nula es un conjunto de restricciones poblacionales que se interpreta bajo el modelo y las condiciones asintóticas que justifican la distribución de referencia del estadístico. Si J rechaza, al menos una parte de ese sistema asumido es difícil de conciliar con la muestra bajo la ponderación empleada. La prueba por sí sola no permite distinguir una restricción de exclusión incorrecta de una forma funcional errónea, una dependencia del estado omitida, un error al construir los datos o una estimación inadecuada de la covarianza de largo plazo.
La prueba tampoco demuestra causalidad. En un diseño de variables instrumentales, una prueba de sobreidentificación puede evaluar si las restricciones adicionales son conjuntamente compatibles entre sí bajo el modelo. No puede confirmar la restricción de exclusión para cada instrumento, sobre todo si todos podrían compartir una misma violación. Relevancia y exclusión significan cosas distintas: usa diagnósticos de primera etapa e identificación débil para evaluar la relevancia, y explica el mecanismo económico que respalda la exclusión.
En una aplicación lineal de valoración de activos, un estadístico tipo J puede contrastar las restricciones conjuntas de valoración que implica un modelo factorial concreto para un conjunto de activos de prueba. Rechazar no identifica automáticamente el factor omitido ni demuestra que otra estrategia negociable vaya a generar rentabilidad. No rechazar tampoco establece la verdad económica del modelo. La guía de Fama–MacBeth explica un procedimiento relacionado de precios de riesgo transversales y sus propios límites inferenciales.
Las versiones de Sargan y Hansen se apoyan en distintos supuestos de covarianza
La prueba clásica de Sargan surgió en la estimación con variables instrumentales bajo supuestos restrictivos de covarianza, normalmente perturbaciones homocedásticas. La prueba J de Hansen es el estadístico GMM de sobreidentificación construido con una covarianza estimada de los momentos, que puede tener en cuenta la heterocedasticidad y, con una estimación adecuada de largo plazo, la dependencia temporal. La etiqueta «Hansen» no vuelve la implementación robusta a toda forma de mala especificación; las decisiones sobre covarianza y ponderación deben corresponderse con el proceso de momentos.
En los momentos de series temporales, la dependencia serial cambia la varianza de largo plazo de su promedio muestral. Una estimación HAC como la de Newey–West puede formar parte de un cálculo de covarianza adecuado si sus supuestos y la elección de retardos se ajustan a los datos. Los datos de panel o las observaciones agrupadas pueden requerir otra construcción de covarianza. Corregir la covarianza solo para los errores estándar de los coeficientes no implica automáticamente que el objetivo J se haya construido con una matriz de ponderación compatible.
GMM de una etapa, dos etapas e iterativa puede estimar parámetros con ponderaciones distintas. En los procedimientos eficientes de dos etapas, la propia ponderación estimada añade incertidumbre en muestras finitas; los errores estándar y el comportamiento de la prueba pueden ser frágiles, especialmente cuando hay muchos momentos en relación con las observaciones. Las correcciones de muestra finita estudiadas por Windmeijer se refieren a la estimación de varianzas en ciertos modelos lineales GMM eficientes de dos etapas. No son un ajuste universal para cualquier estadístico J.
La identificación débil y el exceso de instrumentos pueden dar una falsa tranquilidad
La prueba J no evalúa la fuerza de los instrumentos. Los instrumentos con poca información pueden hacer que las estimaciones de parámetros y las aproximaciones convencionales no sean fiables; utiliza métodos diseñados para la identificación débil, no un valor p de J aparentemente tranquilizador como diagnóstico de fuerza. La calibración chi-cuadrado de grandes muestras tampoco garantiza que una muestra financiera breve se comporte como su límite asintótico.
Añadir instrumentos o condiciones de momento puede parecer atractivo porque da la impresión de aportar información. Sin embargo, en GMM de panel dinámico, la proliferación de instrumentos puede sobreajustar variables endógenas y reducir la capacidad de las pruebas de especificación para detectar una violación. Un valor p muy alto tras crear un conjunto enorme de instrumentos puede ofrecer poca tranquilidad. Informa del número, explica los retardos o el período de construcción y compara conjuntos reducidos defendibles o instrumentos colapsados cuando corresponda.
Las muestras pequeñas, los momentos casi colineales, las estimaciones de covarianza deficientes, los parámetros en el límite y la identificación débil pueden invalidar las interpretaciones de manual. Estos casos requieren análisis de sensibilidad e inferencia alternativa adecuada, no afirmar mecánicamente que J «pasó». Si la selección del modelo incluyó muchos instrumentos, rangos de retardos, factores o cortes de muestra, registra esa búsqueda y no presentes el resultado más favorable como si se hubiera preespecificado.
Las pruebas diferencia-en-Hansen evalúan condicionalmente un subconjunto anidado
Algunos flujos de trabajo de panel dinámico informan de una prueba diferencia-en-Hansen o una prueba C para un subconjunto de condiciones de momento, como un bloque adicional de instrumentos. Conceptualmente, la comparación anidada pregunta si ese bloque añade restricciones compatibles con los demás momentos asumidos. El resultado está condicionado a la especificación restante; no es un certificado independiente de validez para cada instrumento.
La diferencia entre dos estadísticos J solo tiene una distribución de referencia cuando se cumplen las condiciones pertinentes de anidamiento, estimación y covarianza. Los modelos comparados deben usar muestras y definiciones de momentos compatibles, y hay que considerar la ponderación y el comportamiento en muestras finitas. Una prueba de subconjunto también puede tener poca potencia si el conjunto completo de instrumentos es grande. Si se prueban varios bloques, informa del conjunto de comparaciones en vez de elegir solo un resultado favorable.
Informa de la prueba de modo que se pueda reproducir su significado
Indica la muestra, el vector de parámetros, las definiciones de los momentos, el número de observaciones, el número y el rango efectivo de las restricciones y los grados de libertad. Especifica si el estimador es de una etapa, dos etapas o iterativo; cómo se obtuvo la matriz de ponderación; qué estructura de covarianza se permitió; y si se usó algún ajuste para muestras pequeñas. Informa del estadístico J, su distribución de referencia, el valor p y el umbral de decisión establecido para el análisis.
Muestra el número y la construcción de los instrumentos, los diagnósticos de primera etapa o relevancia y la sensibilidad de las estimaciones a cambios razonables en el conjunto de momentos. Explica por qué los instrumentos satisfacen el argumento económico de temporalidad y exclusión; no sustituyas ese argumento por el hecho de que una prueba de sobreidentificación no haya rechazado. Si usas una prueba de subconjunto, define explícitamente el subconjunto y la comparación. Para consultar los supuestos de IV, lee la guía sobre endogeneidad y variables instrumentales; para elegir covarianzas, consulta la guía de errores estándar robustos y HAC.
La teoría asintótica de GMM de Hansen, la prueba de variables instrumentales de Sargan, el análisis de identificación débil de Stock y Wright, el estudio de proliferación de instrumentos de Roodman, el análisis de muestra finita de la varianza en dos etapas de Windmeijer y el estimador de covarianza HAC de Newey y West abordan aspectos distintos de este diseño. Sus resultados se aplican bajo los supuestos indicados en cada trabajo; no constituyen una aprobación general de un modelo empírico.
Preguntas frecuentes
Q1¿No rechazar la prueba J de Hansen demuestra que cada instrumento es válido?
No. No rechazar significa que, bajo los supuestos de la prueba y al nivel elegido, esta no detectó un conflicto conjunto. Los instrumentos pueden compartir una violación y la potencia de la prueba puede ser limitada.
Q2¿Qué ocurre cuando un modelo está exactamente identificado?
Cuando el número de momentos independientes coincide con el de parámetros identificados, no hay restricciones adicionales que contrastar. Los grados de libertad convencionales de sobreidentificación son cero.
Q3¿Es la prueba J de Hansen una prueba de instrumentos débiles?
No. Evalúa restricciones de sobreidentificación. Usa diagnósticos independientes de relevancia e identificación débil y, si la identificación es débil, evita depender de aproximaciones convencionales.
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
¿Qué contrasta el estadístico J de Hansen en un modelo GMM sobreidentificado?
Elige una respuesta para ver la explicación
Glosario de opciones
Correlación entre un regresor y la perturbación que mezcla el efecto buscado con vías omitidas, simultaneidad o error de medición.
Leer la guía detalladaHeterocedasticidadCambio de la varianza condicional del error entre valores o estados, que invalida una fórmula de covarianza con varianza constante.
Leer la guía detalladaAt the moneyCall o put cuyo precio de ejercicio está cerca del precio del subyacente; tiene poco valor intrínseco y suele ser sensible al tiempo y la volatilidad
Leer la guía detallada