Skip to content
Alle optiegidsen
Bewijs uit de eerste fase en inferentie bij zwakke identificatie14 minuten leestijd

Diagnostiek voor zwakke instrumenten: F in de eerste fase en robuuste inferentie

Lees hoe de F-statistiek van de eerste fase, partiële R-kwadraat, Stock–Yogo-criteria, robuuste diagnostiek en Anderson–Rubin-inferentie verschillende vragen over zwakke instrumenten beantwoorden.

In deze gidsWaarom instrumentsterkte belangrijk is

Korte samenvatting

De statistiek van de eerste fase beschrijft in hoeverre uitgesloten instrumenten een endogene regressor verklaren nadat opgenomen controles zijn meegenomen. Ze bewijst niet dat het instrument geldig is; “F boven 10” is geen universele garantie. De relevante diagnostiek hangt af van het aantal endogene regressoren en de aannames over fouten. Inferentie die robuust is voor zwakke IV kan nog steeds breed of onbegrensd zijn.

Waarom instrumentsterkte belangrijk is

Instrumentele variabelen gebruiken het deel van de variatie in een endogene regressor \(X\) dat wordt voorspeld door uitgesloten instrumenten \(Z\), conditioneel op opgenomen controles \(W\).

Als \(Z\) maar weinig van de resterende variatie in \(X\) voorspelt, bevatten de gegevens weinig informatie over het structurele effect dat uit deze bron wordt geïdentificeerd.

Bij zwakke relevantie kan 2SLS in een eindige steekproef naar OLS worden vertekend en kan de steekproefverdeling sterk afwijken van een normale benadering. Een conventioneel Wald-interval kan dan een slechte dekking hebben, ook als de standaardfout nauwkeurig lijkt.

Staiger en Stock ontwikkelen asymptotiek voor zwakke instrumenten om deze problemen te verklaren en niet-standaard betrouwbaarheidsverzamelingen te motiveren (artikel uit 1997).

Sterkte is slechts één onderdeel van identificatie. Een sterke eerste fase bewijst niet dat \(Z\) onafhankelijk is van de structurele fout of de uitkomst alleen via \(X\) beïnvloedt.

De gids voor instrumentele variabelen behandelt die afzonderlijke aannames en het effect dat wordt geïdentificeerd.

De eerste fase isoleert conditionele instrumentvariatie

Voor één endogene regressor en \(q\) uitgesloten instrumenten schrijven we de eerste fase als

\[ X_t = W_t'\delta + Z_t'\pi + v_t. \]

\(W_t\) bevat opgenomen exogene controles, vaak inclusief een intercept; \(Z_t\) bevat de uitgesloten instrumenten. De standaard-F-toets voor de eerste fase toetst de gezamenlijke restrictie \(H_0:\pi=0\): de uitgesloten instrumenten voegen na \(W_t\) geen verklarende kracht toe.

Dit is een vraag over conditionele relevantie, geen toets van de uitsluitingsrestrictie of onafhankelijkheid. Vermeld welke controles zijn opgenomen, hoeveel uitgesloten instrumenten gezamenlijk zijn getoetst, de steekproef en covariantieaannames en de gebruikte statistiek.

De t-statistiek van één coëfficiënt vervangt de gezamenlijke toets niet als er meerdere uitgesloten instrumenten zijn.

Partiële R-kwadraat en de conventionele F-statistiek

Partiële \(R^2\) meet welk aandeel van de resterende variatie in \(X\), nadat \(W\) is verwijderd, wordt verklaard door de geresidualiseerde uitgesloten instrumenten.

Noem het partiële \(R^2\) \(R^2_p\), de steekproefomvang \(n\), het aantal opgenomen regressoren \(k\), inclusief een intercept als dat is gebruikt, en het aantal uitgesloten instrumenten \(q\).

Bij de conventionele homoskedastische lineaire-regressieberekening is de incrementele F-statistiek

\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]

De teller meet de verbetering van de fit per restrictie op een uitgesloten instrument; de noemer schat de residuele variantie met alle residuele vrijheidsgraden van de eerste fase. Deze formule is geen universele identiteit voor robuuste statistieken.

Een robuuste covariantie-estimator verandert de berekening van de toets en de referentieverdeling.

Partiële \(R^2\) en F beantwoorden verwante maar verschillende beschrijvende vragen: partiële \(R^2\) is een schaalvrije maat voor fit, terwijl F ook de steekproefomvang en het aantal restricties weerspiegelt.

Een kleine partiële \(R^2\) kan in een zeer grote steekproef een hoge F opleveren zonder dat alle IV-benaderingen in eindige steekproeven betrouwbaar zijn.

Waarom F boven 10 geen universele drempel is

De bekende waarde 10 is een vuistregel, geen slaag-of-zaktheorema. Staiger en Stock bespreken haar als praktisch richtsnoer binnen een specifiek kader voor zwakke instrumenten; zij garandeert geen geldige inferentie voor elke steekproef, estimator, instrumenttelling of foutenstructuur.

Stock en Yogo definiëren instrumentzwakte aan de hand van grenzen voor relatieve 2SLS-bias of vertekening van de omvang van een Wald-toets en tabelleren kritieke waarden voor de gekozen criteria. De kritieke waarde hangt dus af van het criterium en de modeldimensies.

Conventionele resultaten voor de eerste fase en Cragg–Donald steunen op homoskedastische en onafhankelijke fouten.

Een waarde uit die tabellen kan niet zonder aanpassing naar iedere robuuste situatie worden overgenomen (hoofdstukpagina van de auteur).

Een waarde boven 10 bewijst geen uitsluiting, onafhankelijkheid of causale interpretatie. Een waarde onder 10 bewijst niet dat een instrument nutteloos is of een specifieke schatting ongeldig.

Behandel de statistiek als diagnostiek onder expliciete aannames en kies vervolgens inferentie die bij het ontwerp past.

De Hansen-J-gids legt uit waarom een toets op overidentificatie de beoordeling van instrumentsterkte niet vervangt.

<!-- learn:illustration -->

Een fijne gouden draad verbindt een kleine amberkleurige kristal met een grote blauwe glazen bol in een brede nevel
Conceptuele illustratie van een zwakke first-stage-relatie en de bijbehorende onzekerheid; geen data of diagnostische uitkomst.

Meerdere endogene regressoren vragen om een gezamenlijke sterktebeoordeling

Als er meer dan één endogene regressor is, kunnen afzonderlijke F-statistieken van de eerste fase een zwak geïdentificeerde lineaire combinatie missen.

Elke regressor kan afzonderlijk voorspelbaar lijken, terwijl de door instrumenten veroorzaakte variatie niet de combinaties omvat die nodig zijn om alle structurele coëfficiënten nauwkeurig te schatten.

In de homoskedastische lineaire IV-opzet vat de minimale-eigenwaardestatistiek van Cragg–Donald deze gezamenlijke identificatie-informatie samen. Stock–Yogo-kritieke waarden richten zich daarbij op bepaalde bias- of omvangsvervormingscriteria.

De aannames zijn belangrijk: bekende kritieke waarden zijn niet automatisch geldig bij willekeurige heteroskedasticiteit, seriële afhankelijkheid of clustering.

Het aantal uitgesloten instrumenten, het aantal endogene regressoren en de rang van de coëfficiëntenmatrix van de eerste fase zijn allemaal van belang. Beschrijf de volledige opzet en gebruik een daarvoor ontworpen toets; leid gezamenlijke sterkte niet af uit het gemiddelde van afzonderlijke F-statistieken.

Robuuste fouten vragen om diagnostiek die bij het ontwerp past

Financiële waarnemingen kunnen heteroskedastisch, serieel afhankelijk of geclusterd zijn per bedrijf, handelsplaats of beleidseenheid. De klassieke kalibraties van F in de eerste fase en Cragg–Donald worden niet robuust doordat alleen de standaardfouten van de tweede fase zijn geclusterd.

Voor één endogene regressor ontwikkelen Montiel Olea en Pflueger een effective-F-toets voor zwakte die onder hun voorwaarden heteroskedasticiteit, autocorrelatie en clustering toestaat.

De toets schaalt een conventionele F-statistiek van de eerste fase met covariantie-informatie en vergelijkt het resultaat met criteriumspecifieke kritieke waarden (artikel uit 2013).

Effective F is niet dezelfde grootheid als iedere robuuste Wald F die software rapporteert.

Kleibergen–Paap rk Wald F wordt vaak samen met robuuste covariantie-estimators gerapporteerd, maar Stock–Yogo-kritieke waarden zijn afgeleid voor andere conventionele statistieken en aannames. Vergelijk die waarden niet alsof ze op dezelfde gekalibreerde schaal liggen.

Vermeld de estimator, de statistiek, de covariantie-estimator, het clusterniveau of de behandeling van afhankelijkheid en het kader voor kritieke waarden.

Newey–West- of clusterrobuuste covariantie behandelt steekproefonzekerheid onder de eigen aannames, maar verhelpt zwakke identificatie niet op zichzelf.

Anderson–Rubin-inferentie kan geldig blijven bij zwakke relevantie

Neem voor een kandidaatwaarde van de coëfficiënt \(\beta_0\) in een model met één endogene regressor de uitkomst \(Y-X\beta_0\) en toets of de uitgesloten instrumenten deze gezamenlijk verklaren na de opgenomen controles.

Onder de nulhypothese en exogeniteit van de instrumenten is dit een Anderson–Rubin-toets van \(\beta=\beta_0\).

Omdat de toets niet deelt door een geschatte coëfficiënt van de eerste fase, hoeft de geldigheid niet te steunen op een grote waarde van die coëfficiënt.

De oorspronkelijke constructie van Anderson–Rubin gebruikt de verdelingsaannames van het model; in toepassingen moeten de covariantie-estimator en referentieverdeling ook bij het steekproefontwerp passen. Het label “robuust” is geen reden om weinig clusters of seriële afhankelijkheid te negeren.

Het inverteren van de toets over kandidaatwaarden levert een betrouwbaarheidsverzameling op. Bij weinig informatie kan die breed, onsamenhangend of onbegrensd zijn; dat wijst op beperkte identificerende informatie en is geen softwarefout. Anderson–Rubin-toetsen kunnen ook weinig power hebben.

De GMM-gids voor overidentificatie behandelt een andere vraag en mag niet worden gezien als weak-IV-robuuste coëfficiëntinferentie.

Het oorspronkelijke artikel is Anderson en Rubin (1949).

Een rekenvoorbeeld voor partiële F

Neem een hypothetische eerste fase met \(n=200\) waarnemingen, \(k=3\) opgenomen regressoren inclusief intercept, \(q=2\) uitgesloten instrumenten en partiële \(R^2_p=0.04\).

Volgens de conventionele homoskedastische formule zijn de residuele vrijheidsgraden \(200-3-2=195\).

\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]

De berekening laat zien dat de conventionele gezamenlijke statistiek bij deze invoer en aannames 4.0625 is. Ze bewijst op zichzelf geen ongeldigheid, bepaalt niet de criteriumspecifieke conclusie van Stock–Yogo en stelt de uitkomst niet vast onder heteroskedasticiteit of clustering.

Een robuuste analyse heeft een eigen statistiek en kalibratie nodig die bij het ontwerp passen.

Als dezelfde twee instrumenten in een fuzzy regressiediscontinuïteitsontwerp worden gebruikt, maakt de discontinuïteit in de eerste fase deel uit van de relevantieanalyse voor dat ontwerp.

De F-berekening hierboven vervangt de RDD-aannames, bandbreedtekeuzes of inferentie die bij dat ontwerp past niet.

Rapporteer de diagnostiek en het identificatieargument afzonderlijk

Vermeld de endogene regressoren, uitgesloten instrumenten, opgenomen controles, steekproef, coëfficiënten van de eerste fase, partiële \(R^2\) en de exacte sterktestatistiek.

Geef bij meerdere endogene regressoren de gezamenlijke statistiek en de aannames; noem in robuuste situaties de covariantie en methode voor kritieke waarden in plaats van alleen “F = …” te schrijven.

Als de statistiek op zwakke identificatie wijst, rapporteer dan een weak-IV-robuuste toets of betrouwbaarheidsverzameling voor de doelcoëfficiënt. Leg uit of de verzameling begrensd is en hoe de vorm de inhoudelijke conclusie verandert.

Vervang een niet-informatief interval niet door een conventioneel Wald-interval alleen omdat dat makkelijker samen te vatten is.

Onderbouw tot slot met institutioneel en economisch bewijs dat het instrument onafhankelijk is en aan de uitsluitingspaden voldoet. Relevantie-, balans- en placeboanalyses en een toets op overidentificatie kunnen problemen blootleggen, maar bewijzen niet alle aannames.

Een difference-in-differences-ontwerp gebruikt andere identificatieaannames; een sterkere eerste fase maakt de ontwerpen niet onderling uitwisselbaar.

Veelgestelde vragen

Q1Bewijst een F in de eerste fase boven 10 dat het instrument geldig is?

Nee. Het is hooguit een relevantiediagnostiek onder een specifieke kalibratie. Ze stelt onafhankelijkheid of uitsluiting niet vast.

Q2Is partiële R-kwadraat hetzelfde als de F-statistiek van de eerste fase?

Nee. Partiële R-kwadraat beschrijft de extra fit. De conventionele F hangt ook af van steekproefomvang, aantal restricties en residuele vrijheidsgraden.

Q3Kan ik een robuuste F rechtstreeks vergelijken met kritieke waarden van Stock–Yogo?

Alleen wanneer statistiek en aannames bij de kalibratie passen. Robuuste statistieken vereisen vaak andere kritieke waarden en interpretaties.

Q4Wat moet ik rapporteren als het instrument zwak lijkt?

Rapporteer diagnostiek die bij het ontwerp past en een weak-IV-robuuste toets of betrouwbaarheidsverzameling; vermeld of de verzameling breed, onsamenhangend of onbegrensd is.

Bronnen en verder lezen

Probleem melden

We bereiden een e-mail met de link naar dit artikel voor. Mark ontvangt je melding pas nadat je die verstuurt

Snelle check

De gids gelezen? Test jezelf met 3 vragen

Vraag 1 / 3

Vraag 01

Wat toetst de conventionele F-toets van de eerste fase?

Kies een antwoord om de uitleg te zien

Optiewoordenlijst