Skip to content
คู่มือออปชันทั้งหมด
หลักฐานจากสมการขั้นแรกและการอนุมานเมื่อการระบุผลอ่อน14 min read

การวินิจฉัยเครื่องมือที่อ่อน: First-stage F และการอนุมานแบบ robust

เรียนรู้ว่า first-stage F, partial R-squared, เกณฑ์ Stock–Yogo, การวินิจฉัยแบบ robust และการอนุมาน Anderson–Rubin ตอบคำถามเรื่องเครื่องมืออ่อนที่แตกต่างกันอย่างไร

ในคู่มือนี้เหตุใดความแข็งแรงของเครื่องมือจึงสำคัญ

สรุปสั้น

สถิติ first-stage สรุปว่าเครื่องมือที่ถูกตัดออกอธิบายตัวแปรอธิบายที่เป็น endogenous ได้มากเพียงใด เมื่อกำหนดให้ตัวแปรควบคุมที่ใส่ไว้คงที่ สถิตินี้ไม่ได้ยืนยันว่าเครื่องมือ valid และ “F มากกว่า 10” ไม่ใช่หลักประกันที่ใช้ได้ทั่วไป การวินิจฉัยที่เหมาะสมขึ้นกับจำนวนตัวแปร endogenous และสมมติฐานเกี่ยวกับ error; การอนุมานที่ robust ต่อ weak IV อาจยังมีช่วงกว้างหรือไม่จำกัด ความแข็งแรงของเครื่องมือเป็นเพียงส่วนหนึ่งของการระบุผล First stage ที่แข็งแรงไม่ได้พิสูจน์ว่า (Z) เป็นอิสระจาก structural error หรือส่งผลต่อ outcome ผ่าน (X) เท่านั้น

เหตุใดความแข็งแรงของเครื่องมือจึงสำคัญ

Instrumental variables ใช้ความแปรผันของตัวแปร endogenous (X) ที่เครื่องมือ excluded (Z) ทำนายได้ โดยกำหนดตัวแปรควบคุม (W) ที่ใส่ในแบบจำลองไว้คงที่ หาก (Z) ทำนายความแปรผันส่วนที่เหลือของ (X) ได้น้อย ข้อมูลจากแหล่งนี้ก็ให้สารสนเทศเกี่ยวกับ structural effect น้อยด้วย

เมื่อ relevance อ่อน ค่า 2SLS ในตัวอย่างจำกัดอาจมี bias เข้าหา OLS และ sampling distribution อาจแตกต่างจาก normal approximation มาก ช่วง Wald แบบทั่วไปจึงอาจมี coverage ไม่ดี แม้ standard error จะดูแม่นยำ Staiger และ Stock พัฒนา weak-instrument asymptotics เพื่ออธิบายปัญหาเหล่านี้และเหตุผลที่ต้องใช้ confidence region แบบไม่มาตรฐาน (บทความปี 1997)

ความแข็งแรงเป็นเพียงส่วนหนึ่งของ identification First stage ที่แข็งแรงไม่ยืนยันว่า (Z) เป็นอิสระจาก structural error หรือส่งผลต่อ outcome ผ่าน (X) เท่านั้น คู่มือตัวแปรเครื่องมือ อธิบายสมมติฐานอีกส่วนและ effect ที่ระบุได้

First stage แยกความแปรผันของเครื่องมือแบบมีเงื่อนไข

เมื่อมี endogenous regressor หนึ่งตัวและ excluded instrument (q) ตัว เขียน first stage ได้ดังนี้

\[ X_t = W_t'\delta + Z_t'\pi + v_t. \]

ในสมการนี้ (W_t) คือ exogenous control ที่รวมอยู่ ซึ่งมักมี intercept ด้วย ส่วน (Z_t) คือ excluded instrument การทดสอบ F ของ first stage แบบมาตรฐานทดสอบ (H_0:\pi=0) หรือข้อจำกัดร่วมที่ว่า excluded instrument ไม่เพิ่ม explanatory power หลังจากคำนึงถึง (W_t)

นี่คือคำถามเรื่อง conditional relevance ไม่ใช่การทดสอบ exclusion restriction หรือ independence ให้รายงาน control ที่ใส่ จำนวน excluded instrument ที่ทดสอบ sample สมมติฐาน covariance และ statistic ที่ใช้ หากมี excluded instrument หลายตัว t-statistic ของ coefficient รายตัวใช้แทน joint test ไม่ได้

Partial R-squared และ F statistic แบบทั่วไป

Partial (R^2) วัดสัดส่วนของความแปรผันคงเหลือใน (X) หลังหักผลของ (W) ซึ่งอธิบายได้ด้วย excluded instrument ที่ residualize แล้ว ให้ (R^2_p) แทน partial (R^2), (n) แทนขนาดตัวอย่าง, (k) แทนจำนวน regressor ที่ใส่ (รวม intercept หากใช้) และ (q) แทนจำนวน excluded instrument

ภายใต้การคำนวณ linear regression แบบ homoskedastic ตามปกติ incremental F statistic คือ

\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]

ตัวเศษวัดการเพิ่มขึ้นของ fit ต่อหนึ่งข้อจำกัดของ excluded instrument; ตัวส่วนประมาณ residual variance โดยใช้ residual degrees of freedom ทั้งหมดใน first stage สูตรนี้ไม่ได้เป็นเอกลักษณ์ของ robust statistic ทุกชนิด

เมื่อใช้ robust covariance estimator วิธีคำนวณ test และ reference distribution จะเปลี่ยนไป

Partial (R^2) และ F เกี่ยวข้องกันแต่ตอบคำถามเชิงพรรณนาต่างกัน: partial (R^2) เป็นค่าความพอดีที่ไม่ขึ้นกับ scale ส่วน F ยังสะท้อนขนาดตัวอย่างและจำนวน restriction

ในตัวอย่างขนาดใหญ่มาก partial (R^2) ที่น้อยอาจยังให้ F สูง แต่ไม่ได้ทำให้ finite-sample IV approximation ทุกแบบเชื่อถือได้

F มากกว่า 10 ไม่ใช่เกณฑ์สากล

ค่า 10 ที่คุ้นเคยเป็นเพียง rule of thumb ไม่ใช่ทฤษฎีผ่าน/ตก Staiger และ Stock เสนอเป็นแนวทางเชิงปฏิบัติภายใต้กรอบ weak instrument แบบหนึ่ง ไม่ใช่หลักประกันว่า inference ถูกต้องสำหรับทุก sample, estimator, จำนวน instrument หรือกระบวนการของ error

Stock และ Yogo นิยามความอ่อนของ instrument ผ่านขอบเขต relative 2SLS bias หรือความคลาดเคลื่อนของ Wald test size และให้ตาราง critical value สำหรับเกณฑ์เหล่านั้น ดังนั้น critical value ขึ้นกับเกณฑ์ที่เลือกและมิติของแบบจำลอง ผล conventional first-stage และ Cragg–Donald ตั้งอยู่บนสมมติฐาน error ที่ homoskedastic และ independent

ไม่ควรนำตัวเลขจากตารางเหล่านั้นไปใช้กับ robust setting ทุกแบบโดยไม่ปรับ (หน้า chapter ที่ผู้เขียนเผยแพร่)

ค่าเกิน 10 ไม่ได้พิสูจน์ exclusion, independence หรือความหมายเชิงสาเหตุ ค่าไม่ถึง 10 ก็ไม่ได้พิสูจน์ว่า instrument ใช้ไม่ได้หรือค่าประมาณใดไม่ถูกต้อง ให้ตีความ statistic เป็น diagnostic ภายใต้สมมติฐานที่ระบุ แล้วเลือก inference ให้ตรงกับ design คู่มือ Hansen J อธิบายว่า overidentification test ไม่สามารถใช้แทนการประเมินความแข็งแรงได้อย่างไร

<!-- learn:illustration -->

เส้นใยสีทองบางเชื่อมผลึกสีอำพันขนาดเล็กกับทรงกลมแก้วสีน้ำเงินขนาดใหญ่ท่ามกลางหมอกกว้าง
ภาพแนวคิดของความสัมพันธ์ขั้นแรกที่อ่อนและความไม่แน่นอนโดยรอบ ไม่ใช่ข้อมูลหรือผลการวินิจฉัย

Endogenous regressor หลายตัวต้องประเมินความแข็งแรงร่วมกัน

หากมี endogenous regressor มากกว่าหนึ่งตัว first-stage F แยกแต่ละสมการอาจพลาด linear combination ที่ระบุผลได้อย่างอ่อน

Regressor แต่ละตัวอาจดูเหมือนถูกทำนายได้เมื่อพิจารณาแยกกัน แต่ความแปรผันจาก instrument อาจไม่ครอบคลุม combination ที่จำเป็นต่อการประมาณ structural coefficient ทุกตัวอย่างแม่นยำ

สำหรับ linear IV แบบ homoskedastic Cragg–Donald minimum-eigenvalue statistic สรุปข้อมูล joint identification นี้ ส่วน Stock–Yogo critical value สำหรับสถิตินี้มุ่งไปที่เกณฑ์ bias หรือ size distortion ที่ระบุไว้

สมมติฐานมีความสำคัญ critical value ที่คุ้นเคยไม่ได้ใช้ได้โดยอัตโนมัติเมื่อมี heteroskedasticity, serial dependence หรือ clustering ในรูปแบบใดก็ได้

จำนวน excluded instrument จำนวน endogenous regressor และ rank ของ first-stage coefficient matrix ล้วนสำคัญ ระบุ setup ให้ครบและใช้ test ที่ออกแบบมาสำหรับ setup นั้น อย่าประเมิน joint strength โดยเฉลี่ย first-stage F รายตัว

Error แบบ robust ต้องใช้ diagnostic ที่ตรงกับ design

ข้อมูลการเงินอาจมี heteroskedasticity, serial dependence หรือ clustering ตามบริษัท venue หรือหน่วยนโยบาย Classical first-stage F และ Cragg–Donald calibration ไม่ได้ robust ขึ้นเพียงเพราะ cluster standard error ใน second stage

สำหรับ endogenous regressor หนึ่งตัว Montiel Olea และ Pflueger พัฒนา effective-F test สำหรับ weak instrument ที่รองรับ heteroskedasticity, autocorrelation และ clustering ภายใต้เงื่อนไขที่กำหนด

สถิตินี้ปรับ scale ของ first-stage F แบบทั่วไปโดยใช้ covariance information แล้วเปรียบเทียบกับ critical value เฉพาะเกณฑ์ (บทความปี 2013)

Effective F ไม่ใช่ค่าเดียวกับ robust Wald F ทุกแบบที่ซอฟต์แวร์รายงาน

Kleibergen–Paap rk Wald F มักรายงานพร้อม robust covariance estimator แต่ Stock–Yogo critical value ได้มาจาก conventional statistic และสมมติฐานอีกแบบ อย่าเปรียบเทียบเสมือนอยู่บน scale ที่ calibrate ร่วมกัน

ให้รายงาน estimator, statistic, covariance estimator, ระดับ cluster หรือวิธีจัดการ dependence และกรอบ critical value

Newey–West หรือ cluster-robust covariance จัดการ sampling uncertainty ภายใต้สมมติฐานของตน แต่ไม่ได้แก้ weak identification ด้วยตัวมันเอง

Anderson–Rubin inference อาจยังใช้ได้เมื่อ relevance อ่อน

สำหรับค่า coefficient ที่เป็น candidate (eta_0) ในแบบจำลองที่มี endogenous regressor หนึ่งตัว ให้สร้าง outcome ที่ปรับด้วยค่านั้น (Y-Xeta_0) แล้วทดสอบว่า excluded instrument อธิบาย outcome นี้ร่วมกันหรือไม่ หลังคำนึงถึง included control

ภายใต้ null และ instrument exogeneity นี่คือ Anderson–Rubin test ของ (eta=eta_0)

เพราะ test นี้ไม่ได้หารด้วย first-stage coefficient ที่ประมาณได้ ความถูกต้องจึงไม่จำเป็นต้องพึ่งสมมติฐานว่า coefficient ดังกล่าวมีค่ามาก

Anderson–Rubin แบบดั้งเดิมใช้สมมติฐานการแจกแจงของแบบจำลอง ในงานประยุกต์ covariance estimator และ reference distribution ก็ต้องตรงกับ sampling design ด้วย ป้าย “robust” ไม่ใช่เหตุผลให้ละเลยจำนวน cluster ที่น้อยหรือ serial dependence

เมื่อนำ test ไป invert บน candidate value จะได้ confidence set เมื่อข้อมูลอ่อน set นี้อาจกว้าง ไม่ต่อเนื่อง หรือไม่มีขอบเขต ซึ่งสะท้อนว่ามี identifying information จำกัด ไม่ใช่ software failure Anderson–Rubin test อาจมี power ต่ำได้เช่นกัน

คู่มือ GMM overidentification ตอบคำถามอีกแบบ จึงไม่ควรใช้แทน coefficient inference ที่ robust ต่อ weak IV

บทความต้นฉบับคือ Anderson and Rubin (1949)

ตัวอย่างคำนวณ partial-F

สมมติ first stage มีข้อมูล (n=200), included regressor (k=3) ตัวรวม intercept, excluded instrument (q=2) ตัว และ partial (R^2_p=0.04)

ภายใต้สูตร homoskedastic ทั่วไป residual degrees of freedom คือ (200-3-2=195)

\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]

การคำนวณนี้บอกว่า joint statistic แบบทั่วไปมีค่า 4.0625 ภายใต้ input และสมมติฐานเหล่านี้ เพียงเท่านี้ไม่ได้พิสูจน์ว่า instrument ใช้ไม่ได้ ไม่ได้กำหนดข้อสรุปตาม Stock–Yogo criterion และไม่ได้ยืนยันผลภายใต้ heteroskedasticity หรือ clustering

การวิเคราะห์ robust ต้องใช้ statistic และ calibration ที่ตรงกับ design ของตน

หากใช้ instrument สองตัวเดิมใน regression-discontinuity design แบบ fuzzy ความไม่ต่อเนื่องของ first stage เป็นส่วนหนึ่งของการวิเคราะห์ relevance เฉพาะ design

การคำนวณ F ข้างต้นใช้แทนสมมติฐาน RDD, การเลือก bandwidth หรือ inference ที่เหมาะกับ design นั้นไม่ได้

รายงาน diagnostic แยกจากเหตุผลสนับสนุน identification

ระบุ endogenous regressor, excluded instrument, included control, sample, first-stage coefficient, partial (R^2) และ strength statistic ที่ใช้จริง

หากมี endogenous regressor หลายตัว ให้ระบุ joint statistic และสมมติฐาน หากเป็น robust setting ให้ระบุ covariance และวิธีหา critical value แทนการเขียนเพียง “F = …”

หาก statistic ชี้ว่า identification อ่อน ให้รายงาน weak-IV-robust test หรือ confidence set สำหรับ coefficient เป้าหมาย อธิบายว่า set มีขอบเขตหรือไม่ และรูปร่างของมันเปลี่ยนข้อสรุปเชิงสาระอย่างไร

อย่าแทนช่วงที่ให้ข้อมูลไม่พอด้วย Wald interval ทั่วไปเพียงเพราะสรุปง่ายกว่า

สุดท้าย อธิบายความเป็นอิสระและช่องทาง exclusion ของ instrument ด้วยหลักฐานเชิงสถาบันและเศรษฐกิจ Diagnostic relevance, balance check, placebo outcome และ overidentification test อาจเผยปัญหาได้ แต่พิสูจน์สมมติฐานทุกข้อไม่ได้

Difference-in-differences design ใช้สมมติฐาน identification ต่างกัน first stage ที่แข็งแรงกว่าไม่ได้ทำให้สอง design ใช้แทนกันได้

คำถามที่พบบ่อย

Q1First-stage F มากกว่า 10 พิสูจน์ว่า instrument valid หรือไม่?

ไม่ใช่ อย่างมากที่สุดเป็น diagnostic ของ relevance ภายใต้ calibration แบบหนึ่ง ไม่ได้ยืนยัน independence หรือ exclusion

Q2Partial R-squared เป็นค่าเดียวกับ first-stage F หรือไม่?

ไม่ใช่ Partial R-squared อธิบายการเพิ่มขึ้นของ fit ส่วน F แบบ conventional ยังขึ้นกับ sample size จำนวน restriction และ residual degrees of freedom

Q3เปรียบเทียบ robust F กับ Stock–Yogo critical value โดยตรงได้ไหม?

ได้ก็ต่อเมื่อ statistic และสมมติฐานตรงกับ calibration นั้น Robust statistic มักต้องใช้ critical value และการตีความอีกแบบ

Q4ถ้า instrument ดูอ่อน ควรรายงานอะไร?

รายงาน diagnostic ที่ตรงกับ design และ weak-IV-robust test หรือ confidence set พร้อมระบุว่า set กว้าง แยกเป็นหลายช่วง หรือไม่มีขอบเขตหรือไม่

แหล่งข้อมูลและการอ่านเพิ่มเติม

รายงานปัญหา

เราจะเตรียมอีเมลพร้อมลิงก์บทความนี้ Mark จะได้รับรายงานเมื่อคุณส่งอีเมลแล้วเท่านั้น

ตรวจสอบอย่างรวดเร็ว

อ่านคู่มือจบแล้ว ลองตอบคำถาม 3 ข้อ

คำถาม 1 / 3

คำถาม 01

Conventional first-stage F test ประเมินอะไร?

เลือกคำตอบเพื่อดูคำอธิบาย

อภิธานศัพท์ออปชัน

การระบุผลเมื่อ regressor พัวพันกับ errorEndogeneity และ Instrumental Variablesทำความเข้าใจ endogeneity จาก omitted variables, simultaneity และ measurement error; IV relevance และ exclusion; 2SLS, LATE, weak instruments และการระบุเหตุเชิงการเงินการทดสอบข้อจำกัด overidentifying ของ GMM บอกอะไรได้และบอกอะไรไม่ได้Hansen J Test: อธิบายข้อจำกัด Overidentifying ใน GMMเรียนรู้ว่า Hansen J statistic ใช้ทดสอบ moment restrictions ที่เกินระบุของโมเดล GMM อย่างไร วิธีอ่าน degrees of freedom และ p-value และเหตุใดการไม่ปฏิเสธจึงไม่ได้พิสูจน์ว่าเครื่องมือถูกต้องการทดลองเฉพาะที่คนละด้านของจุดตัดการออกแบบรีเกรสชันไม่ต่อเนื่อง: ตรรกะและข้อจำกัดทำความเข้าใจการจัดสรรตามจุดตัด ความต่อเนื่อง RDD แบบ sharp และ fuzzy รีเกรสชันเชิงเส้นเฉพาะที่ การเลือกแบนด์วิดท์ การตรวจวินิจฉัยการบิดเบือน และการประยุกต์ใช้กับเกณฑ์ทางการเงินสร้าง counterfactual จากการเปลี่ยนแปลงรอบนโยบายDifference-in-Differences และ Parallel Trendsทำความเข้าใจ contrast แบบ 2×2 DiD ผลลัพธ์ที่ไม่มีการรักษาแต่มีแนวโน้มขนาน event study การทดสอบ pretrend การนำไปใช้แบบเหลื่อมเวลา ผลกระทบที่ต่างกัน และการประยุกต์กับนโยบายการเงินกลไกออปชันการถูกใช้สิทธิ์ออปชันคืออะไรทำความเข้าใจว่าการถูก assign เปลี่ยน short call หรือ put ให้เป็นภาระผูกพันต่อหุ้นได้อย่างไร เกิดขึ้นเมื่อใด และเตรียมเงินสดกับหุ้นอย่างไร