Skip to content
Wszystkie przewodniki po opcjach
Diagnostyka pierwszego etapu i wnioskowanie przy słabej identyfikacji14 min czytania

Diagnostyka słabych instrumentów: F pierwszego etapu i odporne wnioskowanie

Poznaj różne pytania, na które odpowiadają statystyka F pierwszego etapu, cząstkowe R-kwadrat, kryteria Stocka–Yogo, odporna diagnostyka i wnioskowanie Andersona–Rubina.

W tym przewodnikuDlaczego siła instrumentu ma znaczenie

Krótkie podsumowanie

Statystyka pierwszego etapu pokazuje, w jakim stopniu wyłączone instrumenty wyjaśniają zmienną endogeniczną po uwzględnieniu włączonych zmiennych kontrolnych. Nie dowodzi ona poprawności instrumentu, a „F powyżej 10” nie jest uniwersalną gwarancją. Właściwa diagnostyka zależy od liczby zmiennych endogenicznych i założeń dotyczących błędów; odporne na słabe IV wnioskowanie może nadal dawać szeroki lub nieograniczony zbiór.

Dlaczego siła instrumentu ma znaczenie

Metoda zmiennych instrumentalnych wykorzystuje tę część zmienności endogenicznego regresora \(X\), którą przewidują wyłączone instrumenty \(Z\), warunkowo względem uwzględnionych zmiennych kontrolnych \(W\).

Jeśli \(Z\) wyjaśnia niewiele pozostałej zmienności \(X\), dane zawierają mało informacji o efekcie strukturalnym identyfikowanym z tego źródła.

Przy słabej trafności estymator 2SLS w próbie skończonej może być obciążony w kierunku OLS, a jego rozkład może znacznie odbiegać od przybliżenia normalnego. Zwykły przedział Walda może mieć słabe pokrycie, nawet gdy błąd standardowy wygląda na precyzyjny.

Staiger i Stock rozwijają asymptotykę słabych instrumentów, aby wyjaśnić te problemy i uzasadnić niestandardowe zbiory ufności (artykuł z 1997 r.).

Siła to tylko jeden element identyfikacji. Silny pierwszy etap nie pokazuje, że \(Z\) jest niezależne od błędu strukturalnego ani że wpływa na wynik wyłącznie przez \(X\).

Przewodnik po zmiennych instrumentalnych omawia te odrębne założenia i identyfikowany efekt.

Pierwszy etap wyodrębnia warunkową zmienność instrumentu

Dla jednej zmiennej endogenicznej i \(q\) wyłączonych instrumentów zapiszmy pierwszy etap jako

\[ X_t = W_t'\delta + Z_t'\pi + v_t. \]

\(W_t\) obejmuje uwzględnione zmienne kontrolne egzogeniczne, często także wyraz wolny; \(Z_t\) zawiera wyłączone instrumenty. Standardowy test F pierwszego etapu sprawdza wspólne ograniczenie \(H_0:\pi=0\): wyłączone instrumenty nie dodają mocy wyjaśniającej po uwzględnieniu \(W_t\).

To pytanie o warunkową trafność, a nie test ograniczenia wykluczenia czy niezależności. Podaj uwzględnione zmienne kontrolne, liczbę wspólnie testowanych wyłączonych instrumentów, próbę, założenia dotyczące kowariancji i zastosowaną statystykę.

Statystyka t pojedynczego współczynnika nie zastępuje testu łącznego, gdy jest kilka wyłączonych instrumentów.

Cząstkowe R-kwadrat i konwencjonalna statystyka F

Cząstkowe \(R^2\) mierzy, jaka część pozostałej zmienności \(X\), po usunięciu wpływu \(W\), jest wyjaśniana przez wyłączone instrumenty po ich wyresztowaniu.

Niech \(R^2_p\) oznacza cząstkowe \(R^2\), \(n\) liczebność próby, \(k\) liczbę uwzględnionych regresorów, w tym wyraz wolny, jeśli został użyty, a \(q\) liczbę wyłączonych instrumentów.

W standardowym obliczeniu dla homoskedastycznej regresji liniowej przyrostowa statystyka F wynosi

\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]

Licznik mierzy przyrost dopasowania przypadający na jedno ograniczenie dotyczące wyłączonego instrumentu; mianownik szacuje wariancję reszt przy użyciu pełnej liczby stopni swobody reszt pierwszego etapu. Wzór ten nie jest uniwersalną tożsamością dla statystyk odpornych.

Odporny estymator kowariancji zmienia sposób obliczania testu i rozkład odniesienia.

Cząstkowe \(R^2\) i F odpowiadają na powiązane, ale różne pytania opisowe: cząstkowe \(R^2\) jest bezwymiarową miarą dopasowania, a F uwzględnia także liczebność próby i liczbę ograniczeń.

W bardzo dużej próbie małe cząstkowe \(R^2\) może dać wysokie F, nie czyniąc wszystkich przybliżeń IV w próbie skończonej wiarygodnymi.

Dlaczego F powyżej 10 nie jest uniwersalnym progiem

Często przywoływana wartość 10 to praktyczna reguła, a nie twierdzenie rozstrzygające o poprawności. Staiger i Stock omawiają ją jako wskazówkę w określonym ujęciu słabych instrumentów; nie gwarantuje ona poprawnego wnioskowania dla każdej próby, estymatora, liczby instrumentów ani procesu błędów.

Stock i Yogo definiują słabość instrumentu przez granice względnego obciążenia 2SLS lub zniekształcenia rozmiaru testu Walda i podają wartości krytyczne dla wybranych kryteriów. Wartość krytyczna zależy więc od kryterium i wymiarów modelu.

Konwencjonalne wyniki pierwszego etapu i Cragg–Donald opierają się na założeniach o homoskedastycznych, niezależnych błędach.

Wartości z tych tabel nie można bez zmian przenosić do każdego odpornego ustawienia (strona rozdziału udostępniona przez autora).

Wartość powyżej 10 nie dowodzi spełnienia warunku wykluczenia, niezależności ani interpretacji przyczynowej. Wartość poniżej 10 nie dowodzi, że instrument jest bezużyteczny albo konkretne oszacowanie jest nieważne.

Traktuj statystykę jako diagnostykę przy podanych założeniach, a następnie wybierz wnioskowanie dopasowane do projektu.

Przewodnik po teście J Hansena wyjaśnia, dlaczego test nadidentyfikacji nie zastępuje oceny siły instrumentu.

<!-- learn:illustration -->

Cienkie złote włókno łączy mały bursztynowy kryształ z dużą niebieską szklaną kulą pośród szerokiej mgły
Ilustracja koncepcyjna słabej zależności w pierwszym etapie i towarzyszącej jej niepewności; nie przedstawia danych ani wyniku testu.

Wiele zmiennych endogenicznych wymaga wspólnej oceny siły

Jeśli jest więcej niż jedna zmienna endogeniczna, osobne statystyki F pierwszego etapu mogą nie wykryć słabo zidentyfikowanej kombinacji liniowej.

Każdy regresor może wyglądać na przewidywalny oddzielnie, choć zmienność wywołana przez instrumenty nie obejmuje kombinacji potrzebnych do precyzyjnego oszacowania wszystkich współczynników strukturalnych.

W homoskedastycznym liniowym układzie IV statystyka minimalnej wartości własnej Cragg–Donald podsumowuje tę wspólną informację o identyfikacji. Wartości krytyczne Stocka–Yogo dla tej statystyki odnoszą się do określonych kryteriów obciążenia lub zniekształcenia rozmiaru.

Założenia mają znaczenie: znane wartości krytyczne nie stają się automatycznie poprawne przy dowolnej heteroskedastyczności, zależności szeregowej lub klastrowaniu.

Znaczenie mają liczba wyłączonych instrumentów, liczba zmiennych endogenicznych i rząd macierzy współczynników pierwszego etapu. Opisz cały układ i użyj testu zaprojektowanego dla niego; nie wyciągaj wniosków o wspólnej sile ze średniej indywidualnych statystyk F.

Odporne błędy wymagają diagnostyki dopasowanej do projektu

Obserwacje finansowe mogą być heteroskedastyczne, zależne szeregowo lub klastrowane według firmy, miejsca obrotu albo jednostki polityki. Klasyczne kalibracje F pierwszego etapu i Cragg–Donald nie stają się odporne tylko dlatego, że błędy standardowe drugiego etapu są klastrowane.

Dla jednej zmiennej endogenicznej Montiel Olea i Pflueger opracowują test effective-F słabych instrumentów, który w określonych warunkach dopuszcza heteroskedastyczność, autokorelację i klastrowanie.

Skaluje on konwencjonalną F pierwszego etapu za pomocą informacji o kowariancji, a następnie porównuje wynik z wartościami krytycznymi właściwymi dla danego kryterium (artykuł z 2013 r.).

Effective F nie jest tym samym co każda odporna statystyka Wald F raportowana przez oprogramowanie.

Kleibergen–Paap rk Wald F jest często raportowana z odpornymi estymatorami kowariancji, ale wartości krytyczne Stocka–Yogo wyprowadzono dla innych konwencjonalnych statystyk i założeń. Nie porównuj ich tak, jakby leżały na tej samej skalibrowanej skali.

Podaj estymator, statystykę, estymator kowariancji, poziom klastrowania lub sposób uwzględnienia zależności oraz system wartości krytycznych.

Kowariancja Neweya–Westa lub odporna na klastrowanie uwzględnia niepewność próbkowania przy swoich założeniach; sama nie rozwiązuje problemu słabej identyfikacji.

Wnioskowanie Andersona–Rubina może pozostać poprawne przy słabej trafności

Dla kandydującej wartości współczynnika \(\beta_0\) w modelu z jedną zmienną endogeniczną skoryguj wynik o \(Y-X\beta_0\) i sprawdź, czy wyłączone instrumenty wspólnie go wyjaśniają po uwzględnieniu zmiennych kontrolnych.

Przy hipotezie zerowej i egzogeniczności instrumentów jest to test Andersona–Rubina hipotezy \(\beta=\beta_0\).

Test nie dzieli przez oszacowany współczynnik pierwszego etapu, więc jego poprawność nie musi zależeć od tego, czy współczynnik jest duży.

Oryginalna konstrukcja Andersona–Rubina wykorzystuje założenia rozkładowe modelu; w zastosowaniu estymator kowariancji i rozkład odniesienia również muszą odpowiadać projektowi próbkowania. Etykieta „odporny” nie pozwala ignorować małej liczby klastrów ani zależności szeregowej.

Odwrócenie testu dla kolejnych wartości kandydujących daje zbiór ufności. Przy słabej informacji może on być szeroki, rozłączny lub nieograniczony; to wynik ograniczonej informacji identyfikującej, a nie błąd oprogramowania. Testy Andersona–Rubina mogą też mieć niską moc.

Przewodnik po nadidentyfikacji w GMM dotyczy innego pytania i nie należy traktować go jako wnioskowania o współczynniku odpornego na słabe IV.

Oryginalna praca to Anderson i Rubin (1949).

Przykład obliczenia cząstkowej F

Rozważmy hipotetyczny pierwszy etap z \(n=200\) obserwacjami, \(k=3\) uwzględnionymi regresorami wraz z wyrazem wolnym, \(q=2\) wyłączonymi instrumentami i cząstkowym \(R^2_p=0.04\).

Według konwencjonalnego wzoru homoskedastycznego resztowe stopnie swobody wynoszą \(200-3-2=195\).

\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]

Obliczenie pokazuje, że przy tych danych i założeniach konwencjonalna statystyka łączna wynosi 4.0625. Samo w sobie nie dowodzi nieważności instrumentu, nie rozstrzyga wniosku dla konkretnego kryterium Stocka–Yogo ani nie potwierdza wyniku przy heteroskedastyczności lub klastrowaniu.

Odporna analiza potrzebuje własnej statystyki i kalibracji dopasowanych do projektu.

Jeśli te same dwa instrumenty są używane w rozmytym projekcie regresji nieciągłej, nieciągłość pierwszego etapu jest częścią analizy trafności właściwej dla tego projektu.

Powyższe obliczenie F nie zastępuje założeń RDD, wyboru szerokości pasma ani wnioskowania właściwego dla tego projektu.

Raportuj oddzielnie diagnostykę i argument identyfikacyjny

Podaj zmienne endogeniczne, wyłączone instrumenty, uwzględnione zmienne kontrolne, próbę, współczynniki pierwszego etapu, cząstkowe \(R^2\) i dokładną statystykę siły.

Przy kilku zmiennych endogenicznych wskaż wspólną statystykę i jej założenia; w odpornych ustawieniach nazwij kowariancję i metodę wyznaczania wartości krytycznych zamiast pisać tylko „F = …”.

Jeśli statystyka wskazuje na słabą identyfikację, podaj test lub zbiór ufności dla docelowego współczynnika odporny na słabe IV. Wyjaśnij, czy zbiór jest ograniczony i jak jego kształt zmienia wniosek merytoryczny.

Nie zastępuj nieinformacyjnego przedziału zwykłym przedziałem Walda tylko dlatego, że łatwiej go streścić.

Na koniec uzasadnij niezależność instrumentu i ścieżki wykluczenia dowodami instytucjonalnymi i ekonomicznymi. Diagnostyka trafności, testy równowagi, wyniki placebo i test nadidentyfikacji mogą ujawnić problemy, ale nie dowodzą wszystkich założeń.

Projekt różnicy w różnicach opiera się na innych założeniach identyfikacyjnych; silniejszy pierwszy etap nie czyni tych projektów zamiennymi.

Częste pytania

Q1Czy F pierwszego etapu powyżej 10 dowodzi, że instrument jest poprawny?

Nie. To co najwyżej diagnostyka trafności przy określonej kalibracji. Nie potwierdza niezależności ani wykluczenia.

Q2Czy cząstkowe R-kwadrat jest tym samym co statystyka F pierwszego etapu?

Nie. Cząstkowe R-kwadrat opisuje dodatkowe dopasowanie. Konwencjonalna F zależy również od liczebności próby, liczby ograniczeń i resztowych stopni swobody.

Q3Czy mogę bezpośrednio porównać odporną F z wartościami krytycznymi Stocka–Yogo?

Tylko jeśli statystyka i założenia pasują do kalibracji. Odporne statystyki często wymagają innych wartości krytycznych i interpretacji.

Q4Co raportować, gdy instrument wydaje się słaby?

Podaj diagnostykę dopasowaną do projektu oraz test lub zbiór ufności odporny na słabe IV, wskazując, czy zbiór jest szeroki, rozłączny lub nieograniczony.

Źródła i dalsza lektura

Zgłoś problem

Przygotujemy e-mail z linkiem do tego artykułu. Mark otrzyma zgłoszenie dopiero po jego wysłaniu

Szybki test

Przeczytano? Sprawdź się w 3 pytaniach

Pytanie 1 / 3

Pytanie 01

Co ocenia konwencjonalny test F pierwszego etapu?

Wybierz odpowiedź, aby zobaczyć wyjaśnienie

Słownik opcji