Diagnostik Instrumen Lemah: F Peringkat Pertama dan Inferens Teguh
Ketahui cara statistik F peringkat pertama, R-kuasa dua separa, kriteria Stock–Yogo, diagnostik teguh dan inferens Anderson–Rubin menjawab soalan yang berbeza tentang instrumen lemah.
Dalam panduan iniMengapa kekuatan instrumen penting
Ringkasan ringkas
Statistik peringkat pertama menerangkan sejauh mana instrumen yang dikecualikan menjelaskan regressor endogen selepas kawalan yang dimasukkan diambil kira. Statistik ini tidak membuktikan kesahan instrumen, dan “F melebihi 10” bukan jaminan sejagat. Diagnostik yang sesuai bergantung pada bilangan regressor endogen dan andaian ralat; inferens teguh terhadap weak-IV masih boleh menghasilkan julat yang lebar atau tidak terbatas.
Mengapa kekuatan instrumen penting
Kaedah pemboleh ubah instrumental menggunakan bahagian variasi regressor endogen \(X\) yang diramalkan oleh instrumen yang dikecualikan \(Z\), bersyarat pada kawalan yang dimasukkan \(W\).
Jika \(Z\) hanya menerangkan sedikit variasi \(X\) yang masih berbaki, data mengandungi sedikit maklumat tentang kesan struktur daripada sumber ini.
Apabila kerelevanan lemah, anggaran 2SLS dalam sampel terhingga boleh berat ke arah OLS dan taburan pensampelannya mungkin jauh menyimpang daripada penghampiran normal. Selang Wald biasa boleh mempunyai liputan yang lemah walaupun ralat piawai kelihatan tepat.
Staiger dan Stock membangunkan asimptotik instrumen lemah untuk menjelaskan kegagalan ini dan mendorong penggunaan set keyakinan bukan piawai (makalah 1997).
Kekuatan hanyalah satu bahagian pengenalpastian. Peringkat pertama yang kuat tidak membuktikan bahawa \(Z\) bebas daripada ralat struktur atau hanya mempengaruhi hasil melalui \(X\).
Panduan pemboleh ubah instrumental membincangkan andaian berasingan ini dan kesan yang dikenal pasti.
Peringkat pertama mengasingkan variasi instrumen bersyarat
Bagi satu regressor endogen dan \(q\) instrumen yang dikecualikan, tulis peringkat pertama seperti berikut:
\[ X_t = W_t'\delta + Z_t'\pi + v_t. \]
\(W_t\) mengandungi kawalan eksogen yang dimasukkan, lazimnya termasuk pintasan; \(Z_t\) mengandungi instrumen yang dikecualikan. Ujian F peringkat pertama standard menguji sekatan bersama \(H_0:\pi=0\): instrumen yang dikecualikan tidak menambah kuasa penerangan selepas \(W_t\).
Ini ialah persoalan kerelevanan bersyarat, bukannya ujian sekatan pengecualian atau kebebasan. Laporkan kawalan yang dimasukkan, bilangan instrumen yang diuji bersama, sampel dan andaian kovarians, serta statistik yang digunakan.
Statistik t bagi satu pekali bukan pengganti ujian bersama apabila terdapat beberapa instrumen yang dikecualikan.
R-kuasa dua separa dan statistik F konvensional
R-kuasa dua separa \(R^2\) mengukur bahagian variasi baki dalam \(X\), selepas kesan \(W\) dibuang, yang diterangkan oleh instrumen dikecualikan yang telah diresidualkan.
Ambil \(R^2_p\) sebagai R-kuasa dua separa, \(n\) sebagai saiz sampel, \(k\) sebagai bilangan regressor yang dimasukkan termasuk pintasan jika digunakan, dan \(q\) sebagai bilangan instrumen yang dikecualikan.
Dalam pengiraan regresi linear homoskedastik konvensional, statistik F tambahan ialah
\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]
Pengangka mengukur peningkatan padanan bagi setiap sekatan instrumen yang dikecualikan; penyebut menganggar varians baki menggunakan semua darjah kebebasan baki peringkat pertama. Formula ini bukan identiti umum bagi setiap statistik teguh.
Penganggar kovarians teguh mengubah pengiraan ujian dan taburan rujukannya.
R-kuasa dua separa dan F menjawab soalan deskriptif yang berkaitan tetapi berbeza: R-kuasa dua separa ialah ukuran padanan tanpa skala, manakala F turut mencerminkan saiz sampel dan bilangan sekatan.
Dalam sampel yang sangat besar, R-kuasa dua separa kecil masih boleh menghasilkan F besar tanpa menjadikan semua penghampiran IV sampel terhingga boleh dipercayai.
Mengapa F melebihi 10 bukan ambang sejagat
Nilai 10 yang biasa disebut ialah peraturan praktikal, bukannya teorem lulus atau gagal. Staiger dan Stock membincangkannya sebagai panduan praktikal dalam kerangka instrumen lemah tertentu; ia tidak menjamin inferens sah bagi setiap sampel, penganggar, bilangan instrumen atau proses ralat.
Stock dan Yogo mentakrifkan kelemahan instrumen melalui had bias relatif 2SLS atau herotan saiz ujian Wald, kemudian memberikan nilai kritikal bagi kriteria yang dipilih. Maka nilai kritikal bergantung pada kriteria dan dimensi model.
Keputusan peringkat pertama dan Cragg–Donald konvensional bergantung pada andaian ralat homoskedastik dan bebas.
Nilai daripada jadual itu tidak boleh dipindahkan tanpa perubahan kepada semua tetapan teguh (halaman bab yang disediakan pengarang).
Nilai melebihi 10 tidak membuktikan pengecualian, kebebasan atau tafsiran sebab-akibat. Nilai di bawah 10 juga tidak membuktikan instrumen itu tidak berguna atau sesuatu anggaran tidak sah.
Anggap statistik sebagai diagnostik di bawah andaian yang dinyatakan, kemudian pilih inferens yang sesuai dengan reka bentuk.
Panduan Hansen J menerangkan mengapa ujian pengenalpastian berlebihan tidak menggantikan penilaian kekuatan instrumen.
<!-- learn:illustration -->

Beberapa regressor endogen memerlukan penilaian kekuatan bersama
Jika terdapat lebih daripada satu regressor endogen, statistik F peringkat pertama yang berasingan boleh terlepas gabungan linear yang dikenal pasti secara lemah.
Setiap regressor mungkin kelihatan boleh diramal secara individu walaupun variasi yang dijana instrumen tidak merangkumi gabungan yang diperlukan untuk menganggar semua pekali struktur dengan tepat.
Dalam tetapan IV linear homoskedastik, statistik nilai eigen minimum Cragg–Donald merumuskan maklumat pengenalpastian bersama ini. Nilai kritikal Stock–Yogo menyasarkan kriteria bias atau herotan saiz yang dinyatakan.
Andaian penting: nilai kritikal yang biasa digunakan tidak secara automatik sah selepas heteroskedastisiti, kebergantungan bersiri atau pengelompokan sewenang-wenangnya.
Bilangan instrumen yang dikecualikan, bilangan regressor endogen dan pangkat matriks pekali peringkat pertama semuanya penting. Nyatakan keseluruhan tetapan dan gunakan ujian yang direka untuknya; jangan simpulkan kekuatan bersama dengan memuratakan F peringkat pertama individu.
Ralat teguh memerlukan diagnostik yang sepadan dengan reka bentuk
Pemerhatian kewangan mungkin heteroskedastik, bergantung secara bersiri atau dikelompokkan mengikut firma, venue atau unit dasar. Kalibrasi F peringkat pertama dan Cragg–Donald klasik tidak menjadi teguh hanya kerana ralat piawai peringkat kedua dikelompokkan.
Bagi satu regressor endogen, Montiel Olea dan Pflueger membangunkan ujian kelemahan effective-F yang membenarkan heteroskedastisiti, autokorelasi dan pengelompokan di bawah syarat yang dinyatakan.
Ujian itu menskalakan F peringkat pertama konvensional menggunakan maklumat kovarians, kemudian membandingkan hasil dengan nilai kritikal khusus kriteria (makalah 2013).
Effective F bukan kuantiti yang sama dengan setiap robust Wald F yang dilaporkan perisian.
Kleibergen–Paap rk Wald F sering dilaporkan dengan penganggar kovarians teguh, tetapi nilai kritikal Stock–Yogo diterbitkan untuk statistik dan andaian konvensional yang berlainan. Jangan bandingkan nilai tersebut seolah-olah berada pada skala terkalibrasi yang sama.
Laporkan penganggar, statistik, penganggar kovarians, tahap pengelompokan atau cara kebergantungan ditangani, serta rangka nilai kritikal.
Anggaran kovarians Newey–West atau teguh kelompok menangani ketidakpastian pensampelan di bawah andaian masing-masing; ia tidak membaiki pengenalpastian lemah dengan sendirinya.
Inferens Anderson–Rubin boleh kekal sah apabila kerelevanan lemah
Bagi nilai pekali calon \(\beta_0\) dalam model dengan satu regressor endogen, laraskan hasil menggunakan \(Y-X\beta_0\), kemudian uji sama ada instrumen yang dikecualikan secara bersama menjelaskannya selepas kawalan yang dimasukkan.
Di bawah hipotesis nol dan eksogeniti instrumen, ini ialah ujian Anderson–Rubin bagi \(\beta=\beta_0\).
Oleh sebab ujian tidak membahagikan dengan pekali peringkat pertama yang dianggarkan, kesahihannya tidak perlu bergantung pada pekali itu besar.
Pembinaan asal Anderson–Rubin menggunakan andaian taburan model; dalam aplikasi, penganggar kovarians dan taburan rujukan juga mesti sepadan dengan reka bentuk pensampelan. Label “teguh” pada ujian bukan alasan untuk mengabaikan bilangan kelompok yang sedikit atau kebergantungan bersiri.
Songsangan ujian merentas nilai calon memberikan set keyakinan. Dengan maklumat lemah, set itu mungkin lebar, terpisah atau tidak terbatas; ini dapatan tentang maklumat pengenalpastian yang terhad, bukannya kegagalan perisian. Ujian Anderson–Rubin juga boleh mempunyai kuasa rendah.
Panduan pengenalpastian berlebihan GMM menjawab persoalan berbeza dan tidak patut dianggap sebagai inferens pekali teguh weak-IV.
Makalah asal ialah Anderson dan Rubin (1949).
Contoh pengiraan F separa
Pertimbangkan peringkat pertama hipotetikal dengan \(n=200\) pemerhatian, \(k=3\) regressor yang dimasukkan termasuk pintasan, \(q=2\) instrumen dikecualikan dan \(R^2_p=0.04\).
Di bawah formula homoskedastik konvensional, darjah kebebasan baki ialah \(200-3-2=195\).
\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]
Pengiraan ini bermaksud statistik bersama konvensional bernilai 4.0625 bagi input dan andaian tersebut. Nilai itu sendiri tidak membuktikan ketidaksahan, tidak menentukan kesimpulan khusus kriteria Stock–Yogo, dan tidak menetapkan hasil di bawah heteroskedastisiti atau pengelompokan.
Analisis teguh memerlukan statistik dan kalibrasi tersendiri yang sepadan dengan reka bentuk.
Jika dua instrumen yang sama digunakan dalam reka bentuk ketakselanjaran regresi kabur, ketakselanjaran peringkat pertama ialah sebahagian analisis kerelevanan khusus reka bentuk itu.
Pengiraan F di atas bukan pengganti andaian RDD, pilihan lebar jalur atau inferens yang sesuai untuk reka bentuk tersebut.
Laporkan diagnostik dan hujah pengenalpastian secara berasingan
Nyatakan regressor endogen, instrumen dikecualikan, kawalan yang dimasukkan, sampel, pekali peringkat pertama, R-kuasa dua separa dan statistik kekuatan yang tepat.
Bagi beberapa regressor endogen, kenal pasti statistik bersama dan andaian yang digunakan; bagi tetapan teguh, nyatakan kovarians dan kaedah nilai kritikal dan bukannya hanya menulis “F = …”.
Jika statistik menunjukkan pengenalpastian lemah, laporkan ujian atau set keyakinan teguh weak-IV bagi pekali sasaran. Terangkan sama ada set itu terbatas dan bagaimana bentuknya mengubah kesimpulan substantif.
Jangan gantikan selang yang tidak bermaklumat dengan selang Wald konvensional hanya kerana lebih mudah diringkaskan.
Akhir sekali, pertahankan kebebasan instrumen dan laluan pengecualian dengan bukti institusi dan ekonomi. Diagnostik kerelevanan, semakan keseimbangan, hasil plasebo dan ujian pengenalpastian berlebihan boleh mendedahkan masalah tetapi tidak membuktikan setiap andaian.
Reka bentuk perbezaan-dalam-perbezaan menggunakan andaian pengenalpastian yang berbeza; peringkat pertama yang lebih kuat tidak menjadikannya boleh saling menggantikan dengan reka bentuk ini.
Soalan lazim
Q1Adakah F peringkat pertama melebihi 10 membuktikan instrumen sah?
Tidak. Paling tinggi, ia diagnostik kerelevanan di bawah kalibrasi tertentu. Ia tidak menetapkan kebebasan atau pengecualian.
Q2Adakah R-kuasa dua separa sama dengan statistik F peringkat pertama?
Tidak. R-kuasa dua separa menerangkan peningkatan padanan. F konvensional turut bergantung pada saiz sampel, bilangan sekatan dan darjah kebebasan baki.
Q3Bolehkah saya membandingkan F teguh secara langsung dengan nilai kritikal Stock–Yogo?
Hanya jika statistik dan andaian sepadan dengan kalibrasi tersebut. Statistik teguh sering memerlukan nilai kritikal dan tafsiran yang berlainan.
Q4Apakah yang perlu dilaporkan apabila instrumen kelihatan lemah?
Laporkan diagnostik yang sepadan dengan reka bentuk serta ujian atau set keyakinan teguh weak-IV, termasuk sama ada set itu lebar, terpisah atau tidak terbatas.
Sumber dan bacaan lanjut
Laporkan masalah
Kami akan menyediakan e-mel dengan pautan artikel ini. Mark menerima laporan hanya selepas anda menghantarnya
Semakan pantas
Sudah membaca panduan? Uji diri dengan 3 soalan
Soalan 01
Apakah yang dinilai oleh ujian F peringkat pertama konvensional?
Pilih jawapan untuk melihat penjelasan
Glosari opsyen
Correlation between a regressor and the regression disturbance, causing OLS to mix a target effect with omitted pathways, simultaneity, or measurement error.
Baca panduan terperinciRegression discontinuity designA design using a treatment-probability jump at a known running-variable cutoff plus potential-outcome continuity to identify a local effect.
Baca panduan terperinciDifference-in-differencesA quasi-experimental method subtracting the comparison group's contemporaneous change from the treated group's change to construct an untreated counterfactual.
Baca panduan terperinci