Diagnostica degli strumenti deboli: F del primo stadio e inferenza robusta
Scopri come F del primo stadio, R-quadro parziale, criteri Stock–Yogo, diagnostica robusta e inferenza Anderson–Rubin rispondono a domande diverse sugli strumenti deboli.
In questa guidaPerché conta la forza dello strumento
Breve sintesi
Una statistica del primo stadio misura quanto gli strumenti esclusi spiegano una regressore endogena, condizionatamente ai controlli inclusi. Non dimostra la validità dello strumento e “F maggiore di 10” non è una garanzia universale. La diagnostica appropriata dipende dal numero di regressori endogeni e dalle ipotesi sugli errori; l’inferenza robusta a strumenti deboli può restare ampia o illimitata. La forza riguarda solo una parte dell’identificazione. Un primo stadio forte non dimostra che lo strumento sia indipendente dall’errore strutturale né che influenzi il risultato soltanto attraverso (X).
Perché conta la forza dello strumento
Le variabili strumentali usano la variazione di un regressore endogeno (X) prevista dagli strumenti esclusi (Z), condizionatamente ai controlli inclusi (W). Se (Z) spiega poco della variazione residua di (X), questa fonte offre poche informazioni sull’effetto strutturale.
Con una rilevanza debole, in campioni finiti il 2SLS può essere distorto verso OLS e la sua distribuzione campionaria può discostarsi molto dall’approssimazione normale. Un intervallo di Wald convenzionale può quindi avere copertura scadente anche se l’errore standard appare preciso. Staiger e Stock sviluppano l’asintotica degli strumenti deboli, spiegando questi problemi e la necessità di regioni di confidenza non standard (articolo del 1997).
La forza è solo una componente dell’identificazione. Un primo stadio forte non stabilisce che (Z) sia indipendente dall’errore strutturale o che influisca sull’esito solo tramite (X). La guida alle variabili strumentali tratta separatamente queste ipotesi e l’effetto identificato.
Il primo stadio isola la variazione condizionale dello strumento
Con un regressore endogeno e (q) strumenti esclusi, il primo stadio è
\[ X_t = W_t'\delta + Z_t'\pi + v_t. \]
Qui (W_t) comprende i controlli esogeni inclusi, spesso con un’intercetta, mentre (Z_t) contiene gli strumenti esclusi. Il test F standard del primo stadio verifica (H_0:\pi=0): congiuntamente, gli strumenti esclusi non aggiungono potere esplicativo oltre (W_t).
È una domanda di rilevanza condizionale, non un test della restrizione di esclusione o dell’indipendenza. Riporta i controlli inclusi, il numero di strumenti esclusi testati, il campione, le ipotesi sulla covarianza e la statistica usata. Se gli strumenti esclusi sono più d’uno, il t-statistic individuale di un coefficiente non sostituisce il test congiunto.
R-quadro parziale e statistica F convenzionale
Il (R^2) parziale misura la quota della variazione residua di (X), dopo aver rimosso (W), spiegata dagli strumenti esclusi residualizzati. Sia (R^2_p) questo valore, (n) la dimensione del campione, (k) il numero di regressori inclusi (compresa l’intercetta, se presente) e (q) il numero di strumenti esclusi.
Nel calcolo convenzionale della regressione lineare omoschedastica, la statistica F incrementale è
\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]
Il numeratore misura il miglioramento dell’adattamento per ciascun vincolo sugli strumenti esclusi; il denominatore stima la varianza residua usando tutti i gradi di libertà residui del primo stadio. Questa formula non è un’identità valida per ogni statistica robusta.
Uno stimatore di covarianza robusto cambia il calcolo del test e la distribuzione di riferimento.
(R^2) parziale e F sono collegati, ma rispondono a domande descrittive diverse: il primo è una misura di adattamento senza unità, mentre F riflette anche dimensione del campione e numero di vincoli.
In un campione molto grande un (R^2) parziale piccolo può produrre un F elevato, senza rendere affidabile ogni approssimazione IV a campione finito.
F sopra 10 non è una soglia universale
Il valore noto di 10 è una regola pratica, non un teorema di promozione o bocciatura. Staiger e Stock lo discutono come guida pratica in uno specifico quadro di strumenti deboli; non garantisce inferenza valida per ogni campione, stimatore, numero di strumenti o processo degli errori.
Stock e Yogo definiscono la debolezza in base a limiti del bias relativo del 2SLS o della distorsione della dimensione del test Wald, e tabulano valori critici per questi criteri. Il valore critico dipende quindi dal criterio scelto e dalle dimensioni del modello. I risultati convenzionali del primo stadio e di Cragg–Donald assumono errori omoschedastici e indipendenti.
I valori di quelle tabelle non si trasferiscono senza modifiche a qualsiasi impostazione robusta (pagina del capitolo ospitata dall’autore).
F sopra 10 non dimostra l’esclusione, l’indipendenza o un’interpretazione causale. F sotto 10 non dimostra che uno strumento sia inutile o che una stima specifica non sia valida. Interpreta la statistica come diagnostica sotto ipotesi dichiarate e scegli l’inferenza adatta al disegno. La guida al test J di Hansen spiega perché un test di sovraidentificazione non sostituisce la valutazione della forza.
<!-- learn:illustration -->

Con più regressori endogeni serve una valutazione congiunta della forza
Con più regressori endogeni, i test F dei singoli primi stadi possono non rilevare combinazioni linearmente deboli nell’identificazione.
Ogni regressore può sembrare previsto singolarmente, anche se la variazione indotta dagli strumenti non copre le combinazioni necessarie a stimare con precisione tutti i coefficienti strutturali.
Nel caso IV lineare omoschedastico, la statistica dell’autovalore minimo di Cragg–Donald riassume queste informazioni congiunte sull’identificazione. I valori critici Stock–Yogo si riferiscono a criteri dichiarati di bias o distorsione della dimensione del test.
Le ipotesi contano: i valori critici noti non sono automaticamente validi dopo eteroschedasticità arbitraria, dipendenza seriale o clustering.
Contano il numero di strumenti esclusi, il numero di regressori endogeni e il rango della matrice dei coefficienti del primo stadio. Dichiara la configurazione completa e usa un test progettato per essa; non dedurre la forza congiunta facendo la media dei singoli F del primo stadio.
Errori robusti richiedono diagnostica adatta al disegno
I dati finanziari possono essere eteroschedastici, serialmente dipendenti o raggruppati per impresa, sede di negoziazione o unità di policy. Il test F classico del primo stadio e la calibrazione Cragg–Donald non diventano robusti solo perché gli errori standard del secondo stadio sono clusterizzati.
Con un solo regressore endogeno, Montiel Olea e Pflueger sviluppano un test effective-F per strumenti deboli che ammette eteroschedasticità, autocorrelazione e clustering alle condizioni specificate.
Il test scala un F convenzionale del primo stadio usando informazioni sulla covarianza e poi confronta il risultato con valori critici specifici per il criterio (articolo del 2013).
L’effective F non coincide con ogni F di Wald robusto riportato dai software.
Il Kleibergen–Paap rk Wald F è spesso riportato con stimatori robusti della covarianza, ma i valori critici Stock–Yogo sono stati derivati per statistiche convenzionali e ipotesi diverse. Non confrontarli come se condividessero una scala calibrata.
Riporta stimatore, statistica, stimatore di covarianza, livello di clustering o trattamento della dipendenza e quadro dei valori critici.
La covarianza Newey–West o cluster-robust tratta l’incertezza campionaria sotto le sue ipotesi; da sola non corregge l’identificazione debole.
L’inferenza Anderson–Rubin può restare valida con rilevanza debole
Per un valore candidato del coefficiente \(\beta_0\) in un modello con un solo regressore endogeno, costruisci il risultato corretto per quel valore, (Y-X\beta_0), e verifica se gli strumenti esclusi lo spiegano congiuntamente, al netto dei controlli inclusi.
Sotto il nullo e l’esogeneità degli strumenti, è un test Anderson–Rubin di \(\beta=\beta_0\).
Poiché il test non divide per un coefficiente del primo stadio stimato, la sua validità non deve dipendere dal fatto che quel coefficiente sia grande.
La costruzione originale Anderson–Rubin usa le ipotesi distributive del modello; nelle applicazioni, anche lo stimatore di covarianza e la distribuzione di riferimento devono corrispondere al disegno campionario. L’etichetta “robusto” non consente di ignorare pochi cluster o dipendenza seriale.
Invertire il test sui valori candidati produce un insieme di confidenza. Con poca informazione, l’insieme può essere ampio, disgiunto o illimitato: segnala scarse informazioni identificanti, non un errore del software. Anche i test Anderson–Rubin possono avere bassa potenza.
La guida alla sovraidentificazione GMM tratta una domanda diversa e non va interpretata come inferenza sui coefficienti robusta a weak-IV.
L’articolo originale è Anderson and Rubin (1949).
Esempio di calcolo dell’F parziale
Considera un primo stadio ipotetico con (n=200) osservazioni, (k=3) regressori inclusi compresa l’intercetta, (q=2) strumenti esclusi e (R^2_p=0.04).
Con la formula omoschedastica convenzionale, i gradi di libertà residui sono (200-3-2=195).
\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]
Il calcolo dice che, con questi input e ipotesi, la statistica congiunta convenzionale è 4.0625. Da sola non dimostra l’invalidità, non determina il risultato specifico per i criteri Stock–Yogo e non stabilisce che valga con eteroschedasticità o clustering.
Un’analisi robusta necessita di statistica e calibrazione adatte al disegno.
Se gli stessi due strumenti vengono usati in un disegno di discontinuità di regressione fuzzy, la discontinuità del primo stadio fa parte della valutazione di rilevanza specifica del disegno.
Il calcolo F sopra non sostituisce le ipotesi RDD, la scelta della bandwidth o l’inferenza appropriata al disegno.
Riportare separatamente la diagnostica e l’argomento identificante
Indica regressori endogeni, strumenti esclusi, controlli inclusi, campione, coefficienti del primo stadio, (R^2) parziale e statistica esatta di forza.
Con più regressori endogeni, identifica la statistica congiunta e le sue ipotesi; in un’impostazione robusta, nomina covarianza e metodo dei valori critici invece di scrivere soltanto “F = …”.
Se la statistica suggerisce identificazione debole, riporta un test o un insieme di confidenza per il coefficiente obiettivo robusto a weak-IV. Spiega se l’insieme è limitato e come la sua forma modifica la conclusione sostanziale.
Non sostituire un intervallo poco informativo con un intervallo Wald convenzionale solo perché è più facile da riassumere.
Infine, argomenta indipendenza ed esclusione dello strumento con evidenze istituzionali ed economiche. Diagnostica di rilevanza, controlli di bilanciamento, esiti placebo e test di sovraidentificazione possono rivelare problemi ma non provano tutte le ipotesi.
Un disegno difference-in-differences usa ipotesi identificanti diverse; un primo stadio più forte non lo rende intercambiabile.
Domande frequenti
Q1Un F del primo stadio superiore a 10 dimostra che lo strumento è valido?
No. È al massimo una diagnostica della rilevanza sotto una specifica calibrazione. Non dimostra indipendenza o esclusione.
Q2Il R-quadro parziale coincide con la statistica F del primo stadio?
No. Il R-quadro parziale descrive il miglioramento dell’adattamento. L’F convenzionale dipende anche da numerosità campionaria, numero di vincoli e gradi di libertà residui.
Q3Posso confrontare direttamente un F robusto con i valori critici Stock–Yogo?
Solo quando statistica e ipotesi corrispondono alla calibrazione. Le statistiche robuste spesso richiedono valori critici e interpretazioni diversi.
Q4Che cosa riportare quando lo strumento sembra debole?
Riporta la diagnostica adatta al disegno e un test o un insieme di confidenza robusto a weak-IV, indicando se l’insieme è ampio, disconnesso o illimitato.
Fonti e approfondimenti
Segnala un problema
Prepareremo un’e-mail con il link a questo articolo. Mark riceverà la segnalazione solo dopo l’invio
Controllo rapido
Hai finito la guida? Verifica ciò che hai capito con 3 domande
Domanda 01
Che cosa valuta il test F convenzionale del primo stadio?
Scegli una risposta per vedere la spiegazione
Glossario delle opzioni
Correlation between a regressor and the regression disturbance, causing OLS to mix a target effect with omitted pathways, simultaneity, or measurement error.
Leggi la guida completaRegression discontinuity designA design using a treatment-probability jump at a known running-variable cutoff plus potential-outcome continuity to identify a local effect.
Leggi la guida completaDifference-in-differencesA quasi-experimental method subtracting the comparison group's contemporaneous change from the treated group's change to construct an untreated counterfactual.
Leggi la guida completa