Diagnostik schwacher Instrumente: First-Stage-F und robuste Inferenz
Erfahre, wie First-Stage-F-Statistiken, partielles R-Quadrat, Stock–Yogo-Kriterien, robuste Diagnostik und Anderson–Rubin-Inferenz unterschiedliche Fragen zu schwachen Instrumenten beantworten.
In diesem LeitfadenWarum die Instrumentenstärke wichtig ist
Kurze Zusammenfassung
Eine First-Stage-Statistik fasst zusammen, wie stark ausgeschlossene Instrumente einen endogenen Regressor erklären, nachdem die aufgenommenen Kontrollen berücksichtigt wurden. Sie belegt nicht die Gültigkeit des Instruments, und „F über 10“ ist keine allgemeine Garantie. Die passende Diagnose hängt von der Zahl endogener Regressoren und den Fehlerannahmen ab; Weak-IV-robuste Inferenz kann weiterhin weit oder unbeschränkt sein. Die Stärke ist nur ein Teil der Identifikation. Eine starke erste Stufe zeigt weder, dass (Z) unabhängig vom Strukturfehler ist, noch dass (Z) das Ergebnis ausschließlich über (X) beeinflusst.
Warum die Instrumentenstärke wichtig ist
Instrumentvariablen nutzen die Variation eines endogenen Regressors (X), die durch ausgeschlossene Instrumente (Z) vorhergesagt wird, bedingt auf die aufgenommenen Kontrollen (W). Sagt (Z) nur wenig von der verbleibenden Variation in (X) voraus, enthalten die Daten aus dieser Quelle nur wenige Informationen über den strukturellen Effekt.
Bei schwacher Relevanz kann 2SLS in endlichen Stichproben in Richtung OLS verzerrt sein; außerdem kann seine Stichprobenverteilung deutlich von der Normalapproximation abweichen. Ein konventionelles Wald-Konfidenzintervall kann daher eine schlechte Abdeckung haben, obwohl der Standardfehler präzise wirkt. Staiger und Stock entwickeln eine Asymptotik für schwache Instrumente, die diese Probleme erklärt und nichtstandardmäßige Konfidenzbereiche motiviert (Arbeit von 1997).
Stärke ist nur ein Teil der Identifikation. Eine starke erste Stufe kann nicht zeigen, dass (Z) unabhängig vom Strukturfehler ist oder das Ergebnis nur über (X) beeinflusst. Der Leitfaden zu Instrumentvariablen behandelt diese getrennten Annahmen und den identifizierten Effekt.
Die erste Stufe isoliert die bedingte Instrumentenvariation
Bei einem endogenen Regressor und (q) ausgeschlossenen Instrumenten lautet die erste Stufe:
\[ X_t = W_t'\delta + Z_t'\pi + v_t. \]
(W_t) enthält die aufgenommenen exogenen Kontrollen, häufig einschließlich einer Konstanten; (Z_t) enthält die ausgeschlossenen Instrumente. Der übliche First-Stage-F-Test prüft (H_0:\pi=0), also gemeinsam die Beschränkung, dass die ausgeschlossenen Instrumente nach (W_t) keine zusätzliche Erklärungskraft liefern.
Das ist eine Frage nach bedingter Relevanz, kein Test der Ausschlussrestriktion oder Unabhängigkeit. Berichte, welche Kontrollen enthalten sind, wie viele ausgeschlossene Instrumente gemeinsam getestet werden, welche Stichprobe und Kovarianzannahmen gelten und welche Statistik verwendet wurde. Bei mehreren ausgeschlossenen Instrumenten ersetzt der individuelle t-Wert eines Koeffizienten den gemeinsamen Test nicht.
Partielles R-Quadrat und die konventionelle F-Statistik
Das partielle (R^2) misst den Anteil der nach Entfernung von (W) verbleibenden Variation in (X), der durch die residualisierten ausgeschlossenen Instrumente erklärt wird. Bezeichne ihn mit (R^2_p), die Stichprobengröße mit (n), die Zahl der aufgenommenen Regressoren einschließlich einer Konstanten mit (k) und die Zahl der ausgeschlossenen Instrumente mit (q).
Bei der konventionellen Berechnung einer homoskedastischen linearen Regression lautet die inkrementelle F-Statistik:
\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]
Der Zähler misst die Verbesserung der Anpassung je Beschränkung für ein ausgeschlossenes Instrument; der Nenner schätzt die Residualvarianz anhand aller Residualfreiheitsgrade der ersten Stufe. Diese Formel ist keine universelle Identität für robuste Statistiken.
Ein robuster Kovarianzschätzer verändert die Testberechnung und die Referenzverteilung.
Partielles (R^2) und F sind verwandt, beantworten aber unterschiedliche beschreibende Fragen: Das partielle (R^2) ist ein skalenfreies Anpassungsmaß, während F zusätzlich Stichprobengröße und Zahl der Beschränkungen berücksichtigt.
Bei einer sehr großen Stichprobe kann ein kleines partielles (R^2) ein großes F ergeben, ohne dass damit jede IV-Näherung in endlichen Stichproben zuverlässig wäre.
F über 10 ist kein universeller Schwellenwert
Der bekannte Wert 10 ist eine Faustregel, kein Bestehens- oder Versagenssatz. Staiger und Stock erörtern ihn als praktische Orientierung in einem bestimmten Rahmen für schwache Instrumente; er garantiert keine gültige Inferenz für jede Stichprobe, jeden Schätzer, jede Instrumentenzahl oder jeden Fehlerprozess.
Stock und Yogo definieren Instrumentenschwäche anhand von Grenzen für die relative 2SLS-Verzerrung oder die Größenverzerrung des Wald-Tests und tabellieren kritische Werte für diese Kriterien. Der kritische Wert hängt deshalb vom gewählten Kriterium und den Modelldimensionen ab. Ihre konventionellen Ergebnisse zur ersten Stufe und zu Cragg–Donald setzen homoskedastische, unabhängige Fehler voraus.
Die Tabellenwerte lassen sich nicht unverändert auf jede robuste Konfiguration übertragen (vom Autor bereitgestellte Kapitel-Seite).
Ein Wert über 10 beweist weder die Ausschlussrestriktion noch Unabhängigkeit oder eine kausale Interpretation. Ein Wert unter 10 beweist nicht, dass ein Instrument nutzlos oder eine bestimmte Schätzung ungültig ist. Behandle die Statistik unter den angegebenen Annahmen als Diagnose und wähle eine zur Untersuchungsanlage passende Inferenz. Der Leitfaden zum Hansen-J-Test erklärt, warum ein Überidentifikationstest die Beurteilung der Instrumentenstärke nicht ersetzt.
<!-- learn:illustration -->

Bei mehreren endogenen Regressoren muss die gemeinsame Stärke geprüft werden
Gibt es mehrere endogene Regressoren, können getrennte First-Stage-F-Statistiken eine schwach identifizierte Linearkombination übersehen.
Jeder Regressor kann für sich gut vorhergesagt erscheinen, obwohl die durch die Instrumente erzeugte Variation die Kombinationen, die für eine präzise Schätzung aller Strukturkoeffizienten benötigt werden, nicht aufspannt.
Im homoskedastischen linearen IV-Modell fasst die Cragg–Donald-Minimal-Eigenwertstatistik diese gemeinsame Identifikationsinformation zusammen. Die Stock–Yogo-kritischen Werte dafür beziehen sich auf angegebene Verzerrungs- oder Größenverzerrungskriterien.
Die Annahmen sind entscheidend: Die bekannten kritischen Werte bleiben nicht automatisch bei beliebiger Heteroskedastizität, serieller Abhängigkeit oder Clusterung gültig.
Relevant sind die Zahl der ausgeschlossenen Instrumente, die Zahl endogener Regressoren und der Rang der Koeffizientenmatrix der ersten Stufe. Lege die gesamte Konfiguration offen und verwende einen dafür entwickelten Test; leite die gemeinsame Stärke nicht aus dem Mittelwert einzelner First-Stage-F-Werte ab.
Robuste Fehler erfordern eine designgerechte Diagnostik
Finanzdaten können heteroskedastisch, seriell abhängig oder nach Unternehmen, Handelsplatz oder Politikeinheit geclustert sein. Der klassische First-Stage-F-Test und die Cragg–Donald-Kalibrierung werden nicht dadurch robust, dass die Standardfehler der zweiten Stufe geclustert werden.
Für einen endogenen Regressor entwickeln Montiel Olea und Pflueger einen Effective-F-Test auf schwache Instrumente, der unter den angegebenen Bedingungen Heteroskedastizität, Autokorrelation und Clusterung zulässt.
Er skaliert ein konventionelles First-Stage-F anhand von Kovarianzinformationen und vergleicht das Ergebnis anschließend mit kriterienspezifischen kritischen Werten (Arbeit von 2013).
Effective F ist nicht dieselbe Größe wie jede von Software ausgegebene robuste Wald-F-Statistik.
Die Kleibergen–Paap-rk-Wald-F-Statistik wird häufig mit robusten Kovarianzschätzern berichtet, aber die Stock–Yogo-kritischen Werte wurden für andere konventionelle Statistiken und Annahmen hergeleitet. Vergleiche die Zahlen nicht so, als lägen sie auf derselben kalibrierten Skala.
Berichte Schätzer, Statistik, Kovarianzschätzer, Clusterebene oder Behandlung der Abhängigkeit sowie den Rahmen für kritische Werte.
Newey–West- oder clusterrobuste Kovarianzschätzung behandelt Stichprobenunsicherheit unter ihren Annahmen; sie behebt nicht für sich genommen schwache Identifikation.
Anderson–Rubin-Inferenz kann bei schwacher Relevanz gültig bleiben
Für einen Kandidatenwert (eta_0) in einem Modell mit nur einem endogenen Regressor bilde das um diesen Kandidaten bereinigte Ergebnis (Y-Xeta_0). Prüfe dann, ob die ausgeschlossenen Instrumente dieses Ergebnis gemeinsam erklären, nachdem die aufgenommenen Kontrollen berücksichtigt wurden.
Unter der Nullhypothese und Instrumentenexogenität ist dies ein Anderson–Rubin-Test von (eta=eta_0).
Da der Test nicht durch einen geschätzten First-Stage-Koeffizienten dividiert, muss seine Gültigkeit nicht davon abhängen, dass dieser Koeffizient groß ist.
Die ursprüngliche Anderson–Rubin-Konstruktion verwendet die Verteilungsannahmen des Modells. In Anwendungen müssen Kovarianzschätzer und Referenzverteilung ebenfalls zur Stichprobenanlage passen. Die Bezeichnung „robust“ rechtfertigt nicht, wenige Cluster oder serielle Abhängigkeit zu ignorieren.
Durch Invertieren des Tests über Kandidatenwerte erhält man eine Konfidenzmenge. Bei schwacher Information kann sie weit, disjunkt oder unbeschränkt sein; das zeigt begrenzte identifizierende Information und keinen Softwarefehler. Anderson–Rubin-Tests können außerdem eine geringe Teststärke haben.
Der GMM-Leitfaden zur Überidentifikation beantwortet eine andere Frage und sollte nicht als weak-IV-robuste Koeffizienteninferenz behandelt werden.
Der Originalbeitrag ist Anderson and Rubin (1949).
Beispielrechnung für das partielle F
Betrachte eine hypothetische erste Stufe mit (n=200) Beobachtungen, (k=3) aufgenommenen Regressoren einschließlich Konstante, (q=2) ausgeschlossenen Instrumenten und partiellem (R^2_p=0.04).
Nach der konventionellen homoskedastischen Formel betragen die Residualfreiheitsgrade (200-3-2=195).
\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]
Die Rechnung sagt, dass die konventionelle gemeinsame Statistik bei diesen Eingaben und Annahmen 4.0625 beträgt. Für sich genommen beweist sie weder Ungültigkeit noch legt sie das kriterienspezifische Stock–Yogo-Ergebnis fest oder zeigt, dass das Resultat bei Heteroskedastizität oder Clusterung gilt.
Eine robuste Analyse benötigt eine eigene, zum Design passende Statistik und Kalibrierung.
Werden dieselben zwei Instrumente in einem unscharfen Regressionsdiskontinuitätsdesign verwendet, gehört die First-Stage-Diskontinuität zur designspezifischen Relevanzanalyse.
Die F-Rechnung ersetzt weder die RDD-Annahmen noch Bandbreitenentscheidungen oder die für dieses Design geeignete Inferenz.
Diagnose und Identifikationsargument getrennt berichten
Nenne endogene Regressoren, ausgeschlossene Instrumente, aufgenommene Kontrollen, Stichprobe, First-Stage-Koeffizienten, partielles (R^2) und die genaue Stärkestatistik.
Bei mehreren endogenen Regressoren sind gemeinsame Statistik und Annahmen anzugeben. In robusten Konfigurationen nenne Kovarianz und Verfahren für kritische Werte, statt nur „F = …“ zu schreiben.
Deutet die Statistik auf schwache Identifikation hin, berichte einen weak-IV-robusten Test oder eine Konfidenzmenge für den Zielkoeffizienten. Erkläre, ob die Menge beschränkt ist und wie ihre Form die inhaltliche Schlussfolgerung verändert.
Ersetze ein wenig informatives Intervall nicht durch ein konventionelles Wald-Intervall, nur weil es einfacher zusammenzufassen ist.
Begründe schließlich die Unabhängigkeit des Instruments und seine Ausschlusspfade mit institutionellen und ökonomischen Belegen. Relevanzdiagnostik, Balanceprüfungen, Placebo-Ergebnisse und ein Überidentifikationstest können Probleme aufdecken, aber nicht jede Annahme beweisen.
Ein Difference-in-Differences-Design beruht auf anderen Identifikationsannahmen; eine stärkere erste Stufe macht es nicht mit diesem Design austauschbar.
Häufige Fragen
Q1Beweist ein First-Stage-F über 10 die Gültigkeit des Instruments?
Nein. Er ist höchstens eine Relevanzdiagnose unter einer bestimmten Kalibrierung. Unabhängigkeit und Ausschluss werden dadurch nicht belegt.
Q2Ist das partielle R-Quadrat dasselbe wie die First-Stage-F-Statistik?
Nein. Das partielle R-Quadrat beschreibt den zusätzlichen Erklärungsbeitrag. Das konventionelle F hängt auch von Stichprobengröße, Zahl der Beschränkungen und Residualfreiheitsgraden ab.
Q3Kann ich ein robustes F direkt mit Stock–Yogo-kritischen Werten vergleichen?
Nur wenn Statistik und Annahmen zur Kalibrierung passen. Robuste Statistiken benötigen häufig andere kritische Werte und eine andere Interpretation.
Q4Was sollte ich berichten, wenn das Instrument schwach erscheint?
Berichte die designgerechte Diagnose und einen weak-IV-robusten Test oder eine Konfidenzmenge, einschließlich der Angabe, ob sie weit, getrennt oder unbeschränkt ist.
Quellen und weiterführende Lektüre
Problem melden
Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden
Schnelltest
Fertig gelesen? Prüfe dich mit 3 Fragen
Frage 01
Was prüft der konventionelle First-Stage-F-Test?
Wähle eine Antwort, um die Erklärung zu sehen
Optionsglossar
Correlation between a regressor and the regression disturbance, causing OLS to mix a target effect with omitted pathways, simultaneity, or measurement error.
Detaillierten Leitfaden lesenRegression discontinuity designA design using a treatment-probability jump at a known running-variable cutoff plus potential-outcome continuity to identify a local effect.
Detaillierten Leitfaden lesenDifference-in-differencesA quasi-experimental method subtracting the comparison group's contemporaneous change from the treated group's change to construct an untreated counterfactual.
Detaillierten Leitfaden lesen