Hansen-J-Test: Überidentifizierende Restriktionen in GMM erklärt
Erfahren Sie, wie die Hansen-J-Statistik überidentifizierende Momentrestriktionen eines Modells prüft, wie Freiheitsgrade und p-Wert zu lesen sind und warum ein Nichtverwerfen die Gültigkeit der Instrumente nicht beweist.
In diesem LeitfadenDer J-Test prüft die Restriktionen als Gruppe
Kurze Zusammenfassung
Der Hansen-J-Test bewertet, ob die Stichprobenmomentbedingungen eines überidentifizierten GMM-Modells unter den gewählten Gewichtungs- und Kovarianzannahmen gemeinsam hinreichend nahe bei null liegen. Unter der Nullhypothese und den Regularitätsbedingungen folgt die minimierte GMM-Zielfunktion näherungsweise einer Chi-Quadrat-Verteilung. Ihre Freiheitsgrade entsprechen der Zahl der Momente abzüglich der Zahl der geschätzten Parameter. Eine Verwerfung bedeutet, dass sich die Gesamtheit der Restriktionen nur schwer mit den Daten vereinbaren lässt. Ein Nichtverwerfen bestätigt weder jedes Instrument noch die Richtigkeit des Modells.
Der J-Test prüft die Restriktionen als Gruppe
Die verallgemeinerte Momentenmethode (GMM) schätzt Parameter, indem sie Stichprobenversionen theoretischer Momentbedingungen so nahe wie möglich an null bringt. In einem Instrumentvariablenmodell kann eine Momentbedingung aussagen, dass ein vorgeschlagenes Instrument beim wahren Parameter unkorreliert mit dem strukturellen Fehler ist. Weitere Momentbedingungen ergeben sich etwa aus Asset-Pricing-Gleichungen, Euler-Gleichungen oder Restriktionen in Paneldaten.
Enthält das Modell mehr Momentbedingungen als unbekannte Parameter, bleiben nach der Schätzung zusätzliche Restriktionen zur Prüfung übrig. Die Hansen-J-Statistik fasst zusammen, wie weit die angepassten Stichprobenmomente nach Anwendung einer festgelegten Gewichtungsmatrix noch von null entfernt sind. Sie ist ein gemeinsamer Spezifikationstest innerhalb dieses Modells. Sie prüft nicht direkt jedes einzelne Instrument und versieht es mit dem Etikett „gültig“ oder „ungültig“.
Diese Unterscheidung ist in der Finanz- und quantitativen Forschung wichtig. Ein Handels- oder Asset-Pricing-Modell kann mehrere Momentbedingungen liefern. Das Testergebnis hängt jedoch davon ab, welche Renditen, Faktoren, Instrumente, Zeiträume und Kovarianzannahmen diese Momente definieren. Ein kleiner p-Wert kann gegen dieses Annahmenbündel sprechen; ein großer p-Wert ist kein unabhängiger Beleg dafür, dass alle Annahmen gelten.
Stichprobenmomente werden zu einer gewichteten GMM-Distanz
Sei \(g_t(\theta)\) ein Vektor mit \(q\) Momentbeiträgen zum Zeitpunkt \(t\), ausgewertet beim Parametervektor \(\theta\). Sein Stichprobenmittel lautet:
\[ \bar g_T(\theta) = \frac{1}{T}\sum_{t=1}^{T}g_t(\theta). \]
GMM wählt \(\hat\theta\), indem eine gewichtete quadratische Distanz minimiert wird, zum Beispiel:
\[ Q_T(\theta) = T\,\bar g_T(\theta)'W_T\bar g_T(\theta), \qquad J = Q_T(\hat\theta), \]
wobei \(W_T\) eine positive Gewichtungsmatrix ist. Die Gewichtung bestimmt, wie stark Abweichungen zwischen den Momentbedingungen in das Kriterium eingehen. Effiziente GMM verwendet unter den angegebenen Stichprobenannahmen ein Gewicht, das mit der inversen langfristigen Kovarianzmatrix der Momente zusammenhängt. Der J-Test verwendet das minimierte Kriterium, nicht den Zielfunktionswert bei einem ohne Schätzung gewählten Parameter.
Die Formel ist kompakt, ihre Bestandteile sind aber nicht austauschbar. Andere Instrumente ändern \(g_t\); eine andere Stichprobe ändert den Mittelwert; ein anderer Kovarianzschätzer ändert das Gewicht; und ein anderer Schätzer kann die angepassten Parameter verändern. Um eine J-Statistik reproduzieren zu können, braucht es daher mehr als einen Zahlenwert und das Wort „robust“.
Freiheitsgrade zählen die nach der Anpassung verbleibenden Restriktionen
Bei \(q\) unabhängigen Momentbedingungen und \(k\) lokal identifizierten Parametern betragen die üblichen Freiheitsgrade für Überidentifikation \(q-k\). Werden beispielsweise zwei Parameter mit drei unabhängigen Momenten geschätzt, bleibt eine überidentifizierende Restriktion übrig. Unter der Nullhypothese, dass alle Populationsmomente gelten, wird eine korrekt gewichtete J-Statistik asymptotisch mit einer Chi-Quadrat-Verteilung mit diesen Freiheitsgraden verglichen.
Bei gleich vielen Momenten und Parametern ist das Modell exakt identifiziert; die angepassten Momente lassen sich im Allgemeinen auf null bringen. Für die J-Statistik bleiben keine zusätzlichen Restriktionen zu prüfen. Der Test hat daher null Freiheitsgrade und bietet keine Überidentifikationsprüfung. Mehr Parameter als unabhängige Momente weisen auf ein anderes Identifikationsproblem hin; sie erzeugen weder negative Freiheitsgrade noch einen sinnvollen J-Test.
Zählen Sie die tatsächlich unabhängigen Momentrestriktionen und nicht nur die Spalten in einer Softwareausgabe. Redundante Instrumente oder linear abhängige Momente können den effektiven Rang verringern. Auch die übliche Chi-Quadrat-Referenz setzt Identifikation und weitere Großstichprobenbedingungen voraus. Ein nomineller Wert \(q-k\) behebt keine singuläre oder schlecht geschätzte Momentkovarianzmatrix.
Ein hypothetischer J-Wert zeigt, worauf sich der p-Wert bezieht
Angenommen, ein Modell schätzt zwei Parameter mit drei Momentbedingungen. Dann betragen die üblichen Freiheitsgrade \(3-2=1\). Eine Software meldet eine J-Statistik von (5{,}4), berechnet mit einem Gewichtungsverfahren, das mit den genannten Kovarianzannahmen konsistent sein soll. Unter der üblichen Chi-Quadrat-Referenz mit einem Freiheitsgrad ergibt sich ein p-Wert von ungefähr (0{,}020). Bei einem vorab festgelegten Signifikanzniveau von 5 % würde die Forschende oder der Forschende die gemeinsame Nullhypothese verwerfen, dass alle drei Populationsmomente null sind.
Diese Schlussfolgerung ist enger als „Instrument 2 ist ungültig“. Die J-Statistik misst eine gewichtete Distanz des Gesamtsystems und zeigt nicht, welches Moment den Konflikt verursacht. Dasselbe Ergebnis kann auf ein ungültiges Instrument, eine falsch spezifizierte Strukturgleichung, ein ausgelassenes dynamisches Merkmal, ein falsches Kovarianzmodell oder ein anderes Versagen der zugrunde gelegten Spezifikation zurückgehen. Zur Ursachenanalyse braucht es weitere Diagnostik und Sachkenntnis.
Bei einem p-Wert von (0{,}20) lautet die richtige Schlussfolgerung, dass der Test die gemeinsamen Restriktionen beim gewählten Niveau nicht verwirft. Das bedeutet nicht: „Die Instrumente sind nachweislich gültig.“ Ein Nichtverwerfen kann heißen, dass die Restriktionen plausibel sind, der Test wenig Trennschärfe hat oder die Stichprobe zu klein beziehungsweise zu verrauscht ist, um Verstöße zu erkennen. Legen Sie den Schwellenwert fest, bevor Sie mehrere Modellvarianten ansehen. Eine Suche nach einem akzeptablen p-Wert erzeugt ein zusätzliches Selektionsproblem.

Eine Verwerfung stellt das zugrunde gelegte System infrage, nicht eine bestimmte Annahme
Die Nullhypothese ist eine Gruppe von Populationsrestriktionen. Sie ist im Rahmen des Modells und der asymptotischen Bedingungen zu interpretieren, die die Referenzverteilung der Statistik rechtfertigen. Verwirft der J-Test, ist zumindest ein Teil dieses angenommenen Systems unter der verwendeten Gewichtung schwer mit der Stichprobe vereinbar. Der Test allein kann nicht unterscheiden, ob eine fehlerhafte Ausschlussrestriktion, eine falsche Funktionsform, ausgelassene Zustandsabhängigkeit, ein Fehler in der Datenkonstruktion oder eine ungeeignete Schätzung der langfristigen Kovarianz verantwortlich ist.
Der Test weist auch keine Kausalität nach. In einem IV-Design kann ein Überidentifikationstest bewerten, ob zusätzliche Restriktionen unter dem Modell gemeinsam miteinander vereinbar sind. Er kann die Ausschlussrestriktion nicht für jedes Instrument bestätigen, insbesondere wenn alle Instrumente denselben Verstoß aufweisen könnten. Relevanz und Ausschluss haben unterschiedliche Bedeutungen: Für Relevanz sind First-Stage- und Schwache-Identifikations-Diagnostik nötig; für den Ausschluss muss der wirtschaftliche Wirkungsweg erläutert werden.
Bei einer linearen Asset-Pricing-Anwendung kann eine J-artige Statistik gemeinsame Preisrestriktionen prüfen, die ein bestimmtes Faktormodell und eine Menge von Testanlagen implizieren. Eine Verwerfung benennt nicht automatisch den fehlenden Faktor und zeigt nicht, dass eine andere handelbare Strategie eine Rendite erzielt. Ein Nichtverwerfen beweist ebenso wenig die ökonomische Wahrheit des Modells. Der Fama–MacBeth-Leitfaden behandelt ein verwandtes querschnittliches Verfahren zur Risikopreisbestimmung und dessen eigene Grenzen für Schlussfolgerungen.
Sargan- und Hansen-Varianten beruhen auf unterschiedlichen Kovarianzannahmen
Der klassische Sargan-Test entstand für Instrumentvariablenschätzungen unter restriktiven Kovarianzannahmen, üblicherweise mit homoskedastischen Störtermen. Ein Hansen-J-Test ist die GMM-Überidentifikationsstatistik auf Basis einer geschätzten Momentkovarianz. Diese kann Heteroskedastizität und mit einer passenden Schätzung der langfristigen Kovarianz auch zeitliche Abhängigkeit berücksichtigen. Die Bezeichnung „Hansen“ macht eine Implementierung nicht robust gegen jede Art von Fehlspezifikation; Kovarianz- und Gewichtungswahl müssen zum Momentprozess passen.
Bei Zeitreihenmomenten verändert serielle Abhängigkeit die langfristige Varianz ihres Stichprobenmittels. Eine HAC-Schätzung wie Newey–West kann Teil einer passenden Kovarianzberechnung sein, wenn Annahmen und Lag-Wahl zu den Daten passen. Panel- oder Clusterbeobachtungen können eine andere Kovarianzkonstruktion erfordern. Eine Kovarianzkorrektur nur für Koeffizienten-Standardfehler bedeutet nicht automatisch, dass auch die J-Zielfunktion mit einer passenden Gewichtungsmatrix gebildet wurde.
Ein-, Zwei-Schritt- und iterierte GMM können Parameter mit unterschiedlichen Gewichten schätzen. Bei effizienten Zwei-Schritt-Verfahren erhöht die geschätzte Gewichtsmatrix selbst die Unsicherheit in endlichen Stichproben. Standardfehler und Testverhalten können fragil sein, besonders wenn es im Verhältnis zur Zahl der Beobachtungen viele Momente gibt. Die von Windmeijer untersuchten Korrekturen für endliche Stichproben betreffen die Varianzschätzung in bestimmten linearen effizienten Zwei-Schritt-GMM-Modellen. Sie sind keine allgemeine Anpassung für jede J-Statistik.
Schwache Identifikation und zu viele Instrumente können falsche Sicherheit erzeugen
Der J-Test prüft nicht die Stärke der Instrumente. Schwach informative Instrumente können Parameterschätzungen und übliche Approximationen unzuverlässig machen. Verwenden Sie Methoden für schwache Identifikation, statt einen beruhigend wirkenden J-p-Wert als Stärkediagnostik zu deuten. Die Chi-Quadrat-Kalibrierung für große Stichproben garantiert nicht, dass eine kurze Finanzstichprobe ihrem asymptotischen Grenzfall entspricht.
Zusätzliche Instrumente oder Momentbedingungen wirken attraktiv, weil sie scheinbar mehr Information liefern. In dynamischer Panel-GMM kann eine Instrumentenflut jedoch endogene Variablen überanpassen und die Fähigkeit von Spezifikationstests mindern, Verstöße zu erkennen. Ein sehr hoher p-Wert nach dem Aufbau einer großen Instrumentenmenge bietet daher womöglich kaum Sicherheit. Berichten Sie die Anzahl, erläutern Sie Instrumentenlags oder Konstruktionsfenster und vergleichen Sie gegebenenfalls vertretbare reduzierte oder zusammengefasste Instrumentensätze.
Kleine Stichproben, nahezu kollineare Momente, schlechte Kovarianzschätzungen, Parametergrenzen und schwache Identifikation können Lehrbuchinterpretationen untergraben. Dann sind Sensitivitätsanalysen und geeignete alternative Inferenz gefragt, nicht die mechanische Aussage, der J-Test habe „bestanden“. Wurden viele Instrumente, Lag-Bereiche, Faktoren oder Stichprobenabgrenzungen für die Modellauswahl durchsucht, dokumentieren Sie diese Suche und stellen Sie das günstigste Testergebnis nicht als vorab festgelegt dar.
Differenz-in-Hansen-Tests prüfen eine verschachtelte Teilmenge bedingt
Einige dynamische Panel-Workflows berichten einen Differenz-in-Hansen- oder C-Test für eine Teilmenge der Momentbedingungen, etwa einen zusätzlichen Instrumentenblock. Konzeptionell fragt der verschachtelte Vergleich, ob dieser Block Restriktionen hinzufügt, die mit den übrigen zugrunde gelegten Momenten vereinbar sind. Das Ergebnis gilt bedingt auf die restliche Spezifikation; es ist kein unabhängiges Gütesiegel für jedes Instrument.
Die Differenz zweier J-Statistiken hat nur unter den relevanten Verschachtelungs-, Schätz- und Kovarianzbedingungen eine Referenzverteilung. Die verglichenen Modelle sollten kompatible Stichproben und Momentdefinitionen verwenden; auch Gewichtung und Verhalten in endlichen Stichproben sind zu berücksichtigen. Bei einer großen Gesamtmenge an Instrumenten kann zudem die Teststärke des Teilmengentests sinken. Wenn mehrere Blöcke geprüft werden, berichten Sie die Gesamtheit der Vergleiche und wählen Sie nicht nur ein günstiges Ergebnis aus.
Berichten Sie den Test so, dass seine Bedeutung nachvollziehbar ist
Geben Sie Stichprobe, Parametervektor, Momentdefinitionen, Beobachtungszahl, Anzahl und effektiven Rang der Restriktionen sowie Freiheitsgrade an. Nennen Sie Ein-Schritt-, Zwei-Schritt- oder iterierte Schätzung, die Herleitung der Gewichtungsmatrix, die berücksichtigte Kovarianzstruktur und gegebenenfalls Korrekturen für kleine Stichproben. Berichten Sie J-Statistik, Referenzverteilung, p-Wert und die für die Analyse festgelegte Entscheidungsschwelle.
Zeigen Sie Anzahl und Konstruktion der Instrumente, First-Stage- oder Relevanzdiagnostik und die Sensitivität der Schätzungen gegenüber plausiblen Änderungen der Momentmengen. Erklären Sie, warum die Instrumente die ökonomische Timing- und Ausschlussbegründung erfüllen; ersetzen Sie diese Begründung nicht durch ein Nichtverwerfen des Überidentifikationstests. Definieren Sie bei einem Teilmengentest die Teilmenge und den Vergleich ausdrücklich. Hintergrund zu IV-Annahmen finden Sie im Leitfaden zu Endogenität und Instrumentvariablen, zu Kovarianzwahlen im Leitfaden zu robusten Standardfehlern und HAC.
Hansen behandelt in seiner asymptotischen GMM-Theorie, Sargan in seinem Instrumentvariablentest, Stock und Wright in ihrer Analyse schwacher Identifikation, Roodman in seiner Studie zur Instrumentenflut, Windmeijer in seiner Analyse der Varianz im Zwei-Schritt-Verfahren für endliche Stichproben und Newey und West in ihrem HAC-Kovarianzschätzer verschiedene Aspekte dieses Designs. Ihre Ergebnisse gelten unter den jeweils genannten Annahmen und sind keine pauschale Bestätigung eines empirischen Modells.
Häufige Fragen
Q1Beweist ein nicht verworfener Hansen-J-Test, dass jedes Instrument gültig ist?
Nein. Ein Nichtverwerfen bedeutet, dass der Test unter seinen Annahmen beim gewählten Niveau keinen gemeinsamen Konflikt entdeckt hat. Instrumente können denselben Verstoß aufweisen, und die Teststärke kann begrenzt sein.
Q2Was geschieht bei einem exakt identifizierten Modell?
Sind Zahl der unabhängigen Momente und Zahl der identifizierten Parameter gleich, gibt es keine zusätzlichen Restriktionen zu prüfen. Die üblichen Freiheitsgrade für Überidentifikation sind null.
Q3Ist der Hansen-J-Test ein Test auf schwache Instrumente?
Nein. Er bewertet überidentifizierende Restriktionen. Prüfen Sie Relevanz und schwache Identifikation gesondert und verlassen Sie sich bei schwacher Identifikation nicht auf übliche Approximationen.
Quellen und weiterführende Lektüre
Problem melden
Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden
Schnelltest
Fertig gelesen? Prüfe dich mit 3 Fragen
Frage 01
Was prüft die Hansen-J-Statistik in einem überidentifizierten GMM-Modell?
Wähle eine Antwort, um die Erklärung zu sehen
Optionsglossar
Correlation between a regressor and the regression disturbance, causing OLS to mix a target effect with omitted pathways, simultaneity, or measurement error.
Detaillierten Leitfaden lesenHeteroskedasticityVariation in the conditional error variance across regressor values or states, invalidating an equal-variance covariance formula.
Detaillierten Leitfaden lesenam GeldEine Lage, in der der Ausübungspreis einer Option nahe am Marktpreis ihres Basiswerts liegt. Der innere Wert kann gering oder null sein, während wegen verbleibender Zeit und Unsicherheit noch eine Prämie bestehen kann.
Detaillierten Leitfaden lesen