Diagnostik Instrumen Lemah: F Tahap Pertama dan Inferensi Robust
Pelajari bagaimana statistik F tahap pertama, R-kuadrat parsial, kriteria Stock–Yogo, diagnostik robust, dan inferensi Anderson–Rubin menjawab pertanyaan berbeda tentang instrumen lemah.
Dalam panduan iniMengapa kekuatan instrumen penting
Ringkasan singkat
Statistik tahap pertama menjelaskan seberapa jauh instrumen yang dikecualikan menerangkan regressor endogen setelah kontrol yang disertakan diperhitungkan. Statistik ini tidak membuktikan validitas instrumen, dan “F di atas 10” bukan jaminan universal. Diagnostik yang relevan bergantung pada jumlah regressor endogen dan asumsi error; inferensi yang robust terhadap weak-IV tetap dapat menghasilkan rentang lebar atau tak terbatas.
Mengapa kekuatan instrumen penting
Variabel instrumental menggunakan bagian variasi regressor endogen \(X\) yang diprediksi oleh instrumen yang dikecualikan \(Z\), dengan mengondisikan pada kontrol yang disertakan \(W\).
Jika \(Z\) hanya menjelaskan sedikit variasi \(X\) yang tersisa, data memuat sedikit informasi tentang efek struktural dari sumber tersebut.
Ketika relevansi lemah, estimasi 2SLS sampel terbatas dapat bias ke arah OLS dan distribusi sampling-nya bisa jauh menyimpang dari pendekatan normal. Interval Wald konvensional dapat memiliki coverage buruk walaupun standard error tampak presisi.
Staiger dan Stock mengembangkan asimtotik instrumen lemah untuk menjelaskan kegagalan ini dan memotivasi confidence set nonstandar (makalah 1997).
Kekuatan hanyalah salah satu bagian identifikasi. First stage yang kuat tidak membuktikan bahwa \(Z\) independen dari error struktural atau hanya memengaruhi outcome melalui \(X\).
Panduan variabel instrumental membahas asumsi terpisah tersebut dan efek yang diidentifikasi.
Tahap pertama mengisolasi variasi instrumen bersyarat
Untuk satu regressor endogen dan \(q\) instrumen yang dikecualikan, tulis first stage sebagai berikut:
\[ X_t = W_t'\delta + Z_t'\pi + v_t. \]
\(W_t\) memuat kontrol eksogen yang disertakan, sering termasuk intersep; \(Z_t\) memuat instrumen yang dikecualikan. Uji F first-stage standar menguji restriksi bersama \(H_0:\pi=0\): instrumen yang dikecualikan tidak menambah daya jelas setelah \(W_t\).
Ini pertanyaan tentang relevansi bersyarat, bukan pengujian pembatasan eksklusi atau independensi. Laporkan kontrol yang dimasukkan, jumlah instrumen eksklusi yang diuji bersama, sampel dan asumsi kovarians, serta statistik yang digunakan.
Statistik t koefisien individual bukan pengganti uji bersama ketika ada beberapa instrumen yang dikecualikan.
R-kuadrat parsial dan statistik F konvensional
R-kuadrat parsial \(R^2\) mengukur bagian variasi residual \(X\), setelah pengaruh \(W\) dihilangkan, yang dijelaskan oleh instrumen eksklusi yang telah diresidualisasi.
Misalkan \(R^2_p\) adalah R-kuadrat parsial, \(n\) ukuran sampel, \(k\) jumlah regressor yang disertakan termasuk intersep bila digunakan, dan \(q\) jumlah instrumen yang dikecualikan.
Dalam perhitungan regresi linear homoskedastik konvensional, statistik F inkremental adalah
\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]
Pembilang mengukur peningkatan kecocokan per restriksi instrumen eksklusi; penyebut mengestimasi varians residual dengan seluruh derajat kebebasan residual first stage. Rumus ini bukan identitas universal untuk statistik robust.
Estimator kovarians robust mengubah perhitungan uji dan distribusi acuannya.
R-kuadrat parsial dan F menjawab pertanyaan deskriptif yang berkaitan tetapi berbeda: R-kuadrat parsial adalah ukuran kecocokan tanpa skala, sedangkan F juga mencerminkan ukuran sampel dan jumlah restriksi.
R-kuadrat parsial yang kecil dapat menghasilkan F besar dalam sampel sangat besar tanpa membuat semua pendekatan IV sampel terbatas dapat diandalkan.
Mengapa F di atas 10 bukan ambang universal
Angka 10 yang sering dikutip adalah aturan praktis, bukan teorema lulus atau gagal. Staiger dan Stock membahasnya sebagai panduan praktis dalam kerangka weak-instrument tertentu; angka tersebut tidak menjamin inferensi valid pada setiap sampel, estimator, jumlah instrumen, atau proses error.
Stock dan Yogo mendefinisikan kelemahan instrumen melalui batas bias relatif 2SLS atau distorsi ukuran uji Wald, lalu menyajikan nilai kritis untuk kriteria tersebut. Karena itu nilai kritis bergantung pada kriteria dan dimensi model.
Hasil first-stage dan Cragg–Donald konvensional bergantung pada asumsi error homoskedastik dan independen.
Angka dari tabel tersebut tidak dapat dipindahkan tanpa perubahan ke semua setting robust (halaman bab yang disediakan penulis).
Nilai di atas 10 tidak membuktikan eksklusi, independensi, atau interpretasi kausal. Nilai di bawah 10 juga tidak membuktikan bahwa instrumen tidak berguna atau estimasi tertentu tidak valid.
Perlakukan statistik sebagai diagnostik berdasarkan asumsi yang dinyatakan, lalu pilih inferensi yang sesuai dengan desain.
Panduan Hansen J menjelaskan mengapa uji overidentifikasi tidak menggantikan penilaian kekuatan instrumen.
<!-- learn:illustration -->

Beberapa regressor endogen memerlukan penilaian kekuatan bersama
Jika ada lebih dari satu regressor endogen, F tahap pertama yang dihitung terpisah dapat melewatkan kombinasi linear yang lemah identifikasinya.
Setiap regressor mungkin tampak dapat diprediksi sendiri-sendiri, meski variasi yang didorong instrumen tidak mencakup kombinasi yang dibutuhkan untuk mengestimasi seluruh koefisien struktural secara presisi.
Untuk pengaturan IV linear homoskedastik, statistik nilai eigen minimum Cragg–Donald merangkum informasi identifikasi bersama ini. Nilai kritis Stock–Yogo untuk statistik tersebut menargetkan kriteria bias atau distorsi ukuran tertentu.
Asumsinya penting: nilai kritis yang umum dikenal tidak otomatis valid setelah heteroskedastisitas, dependensi serial, atau clustering sembarang.
Jumlah instrumen yang dikecualikan, jumlah regressor endogen, dan rank matriks koefisien first-stage sama-sama penting. Nyatakan pengaturan lengkap dan gunakan uji yang dirancang untuk itu; jangan menyimpulkan kekuatan bersama dengan merata-ratakan F tahap pertama individual.
Error robust memerlukan diagnostik yang sesuai dengan desain
Data keuangan dapat heteroskedastik, bergantung secara serial, atau terkelompok menurut perusahaan, venue, maupun unit kebijakan. Kalibrasi F first-stage dan Cragg–Donald klasik tidak menjadi robust hanya karena standard error tahap kedua dikelompokkan.
Untuk satu regressor endogen, Montiel Olea dan Pflueger mengembangkan uji effective-F untuk kelemahan instrumen yang memungkinkan heteroskedastisitas, autokorelasi, dan clustering dalam kondisi yang mereka nyatakan.
Uji itu menskalakan F first-stage konvensional dengan informasi kovarians, lalu membandingkannya dengan nilai kritis khusus kriteria (makalah 2013).
Effective F bukan besaran yang sama dengan setiap robust Wald F yang dilaporkan perangkat lunak.
Kleibergen–Paap rk Wald F sering dilaporkan bersama estimator kovarians robust, tetapi nilai kritis Stock–Yogo diturunkan untuk statistik dan asumsi konvensional yang berbeda. Jangan membandingkannya seolah-olah berada pada skala kalibrasi yang sama.
Laporkan estimator, statistik, estimator kovarians, tingkat clustering atau penanganan dependensi, serta kerangka nilai kritis.
Estimasi kovarians Newey–West atau cluster-robust menangani ketidakpastian sampling sesuai asumsinya; keduanya tidak dengan sendirinya memperbaiki identifikasi lemah.
Inferensi Anderson–Rubin dapat tetap valid ketika relevansi lemah
Untuk nilai kandidat koefisien \(\beta_0\) dalam model dengan satu regressor endogen, bentuk outcome yang disesuaikan \(Y-X\beta_0\), lalu uji apakah instrumen yang dikecualikan secara bersama menjelaskannya setelah kontrol yang disertakan.
Di bawah hipotesis nol dan eksogenitas instrumen, ini adalah uji Anderson–Rubin untuk \(\beta=\beta_0\).
Karena uji ini tidak membagi dengan koefisien first-stage estimasian, validitasnya tidak harus bergantung pada koefisien tersebut bernilai besar.
Konstruksi Anderson–Rubin asli menggunakan asumsi distribusi model; dalam penerapan, estimator kovarians dan distribusi acuan juga harus sesuai dengan desain sampling. Label robust pada uji bukan alasan untuk mengabaikan sedikitnya jumlah cluster atau dependensi serial.
Membalik uji pada rentang nilai kandidat menghasilkan confidence set. Saat informasi lemah, himpunan itu dapat lebar, terpisah-pisah, atau tak terbatas; ini temuan tentang terbatasnya informasi identifikasi, bukan kegagalan perangkat lunak. Uji Anderson–Rubin juga bisa berdaya rendah.
Panduan overidentifikasi GMM membahas pertanyaan berbeda dan bukan inferensi koefisien yang robust terhadap weak-IV.
Makalah aslinya adalah Anderson dan Rubin (1949).
Contoh perhitungan F parsial
Pertimbangkan first stage hipotetis dengan \(n=200\) observasi, \(k=3\) regressor yang disertakan termasuk intersep, \(q=2\) instrumen eksklusi, dan \(R^2_p=0.04\).
Dengan rumus homoskedastik konvensional, derajat kebebasan residual adalah \(200-3-2=195\).
\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]
Perhitungan ini menunjukkan bahwa statistik bersama konvensional bernilai 4.0625 dengan masukan dan asumsi tersebut. Angka itu sendiri tidak membuktikan ketidakvalidan, tidak menentukan kesimpulan Stock–Yogo untuk kriteria tertentu, dan tidak menetapkan hasil di bawah heteroskedastisitas atau clustering.
Analisis robust memerlukan statistik dan kalibrasi tersendiri yang sesuai dengan desain.
Jika dua instrumen yang sama digunakan dalam desain regresi diskontinuitas fuzzy, diskontinuitas first-stage adalah bagian analisis relevansi khusus desain tersebut.
Perhitungan F di atas bukan pengganti asumsi RDD, pilihan bandwidth, atau inferensi yang sesuai untuk desain itu.
Laporkan diagnostik dan argumen identifikasi secara terpisah
Nyatakan regressor endogen, instrumen yang dikecualikan, kontrol yang disertakan, sampel, koefisien first-stage, R-kuadrat parsial, dan statistik kekuatan yang tepat.
Untuk beberapa regressor endogen, identifikasi statistik bersama dan asumsinya; untuk setting robust, sebutkan kovarians dan metode nilai kritis alih-alih hanya menulis “F = …”.
Jika statistik menunjukkan identifikasi lemah, laporkan uji atau confidence set yang robust terhadap weak-IV untuk koefisien target. Jelaskan apakah himpunan itu berbatas dan bagaimana bentuknya mengubah kesimpulan substantif.
Jangan mengganti interval yang tidak informatif dengan interval Wald konvensional hanya karena lebih mudah diringkas.
Terakhir, pertahankan argumen independensi instrumen dan jalur eksklusi dengan bukti kelembagaan dan ekonomi. Diagnostik relevansi, pemeriksaan keseimbangan, outcome placebo, dan uji overidentifikasi dapat mengungkap masalah tetapi tidak membuktikan semua asumsi.
Desain difference-in-differences menggunakan asumsi identifikasi berbeda; first stage yang lebih kuat tidak membuat kedua desain dapat saling menggantikan.
Pertanyaan umum
Q1Apakah F first-stage di atas 10 membuktikan instrumen valid?
Tidak. Paling jauh, itu diagnostik relevansi dalam kalibrasi tertentu. Statistik tersebut tidak menetapkan independensi atau eksklusi.
Q2Apakah R-kuadrat parsial sama dengan statistik F tahap pertama?
Tidak. R-kuadrat parsial menjelaskan peningkatan kecocokan. F konvensional juga bergantung pada ukuran sampel, jumlah restriksi, dan derajat kebebasan residual.
Q3Bisakah saya membandingkan F robust langsung dengan nilai kritis Stock–Yogo?
Hanya jika statistik dan asumsinya sesuai dengan kalibrasi. Statistik robust sering memerlukan nilai kritis dan interpretasi yang berbeda.
Q4Apa yang harus dilaporkan ketika instrumen tampak lemah?
Laporkan diagnostik yang sesuai dengan desain dan uji atau confidence set robust terhadap weak-IV, termasuk apakah himpunan itu lebar, terputus, atau tak terbatas.
Sumber dan bacaan lanjutan
Laporkan masalah
Kami akan menyiapkan email berisi tautan artikel ini. Mark menerima laporan setelah Anda mengirimkannya
Cek cepat
Sudah membaca panduannya? Uji diri dengan 3 pertanyaan
Pertanyaan 01
Apa yang dinilai oleh uji F tahap pertama konvensional?
Pilih jawaban untuk melihat penjelasannya
Glosarium opsi
Correlation between a regressor and the regression disturbance, causing OLS to mix a target effect with omitted pathways, simultaneity, or measurement error.
Baca panduan lengkapRegression discontinuity designA design using a treatment-probability jump at a known running-variable cutoff plus potential-outcome continuity to identify a local effect.
Baca panduan lengkapDifference-in-differencesA quasi-experimental method subtracting the comparison group's contemporaneous change from the treated group's change to construct an untreated counterfactual.
Baca panduan lengkap