สัมประสิทธิ์และสมมติฐานของ OLS Regression
ทำความเข้าใจวัตถุประสงค์ least-squares การตีความสัมประสิทธิ์แบบมีเงื่อนไข residuals, exogeneity, multicollinearity, homoskedasticity และการวิเคราะห์ regression ทางการเงินอย่างรับผิดชอบ
คำตอบโดยตรง
Ordinary least squares เลือกสัมประสิทธิ์ที่ลดผลรวมกำลังสองของความแตกต่างระหว่างผลลัพธ์ที่สังเกตได้กับค่าที่ fit แบบเชิงเส้นให้ต่ำสุด สัมประสิทธิ์อธิบายความแตกต่างเชิงเส้นเฉลี่ยของผลลัพธ์ที่สัมพันธ์กับความแตกต่างหนึ่งหน่วยของ regressor โดยตรึง regressors อื่นที่รวมอยู่ไว้ การเปลี่ยน projection เชิงพรรณนานั้นให้เป็นผลเชิงเหตุจำเป็นต้องมีสมมติฐานเพิ่ม เช่น error มีค่าเฉลี่ยแบบมีเงื่อนไขเป็นศูนย์ ค่า R² สูงหรือ residual เล็กไม่สามารถยืนยันสมมติฐานเหล่านี้ได้
OLS ลด residual กำลังสองให้ต่ำสุด
ในโมเดล y=Xβ+u, OLS เลือก β เพื่อให้ผลรวมกำลังสองของความแตกต่างระหว่าง observations กับค่าที่ fit Xβ เล็กที่สุดเท่าที่ทำได้
เมื่อคอลัมน์ของ design matrix มี full rank คำตอบมักเขียนเป็น β̂=(X′X)⁻¹X′y
การยกกำลังสองสร้าง objective ที่จัดการได้ และลงโทษความคลาดเคลื่อนขนาดใหญ่อย่างหนัก ดังนั้นข้อผิดพลาดของข้อมูลและ outliers ที่มีอิทธิพลอาจมี leverage สูง
สัมประสิทธิ์คือการเปรียบเทียบเชิงเส้นแบบมีเงื่อนไข
สัมประสิทธิ์ βj คือความแตกต่างที่ fit แล้วใน y สำหรับความแตกต่างหนึ่งหน่วยใน xj เมื่อกำหนดตัวแปรอื่นที่รวมอยู่ให้มีค่าเท่าเดิม
ผลลัพธ์ Frisch–Waugh–Lovell ให้สัมประสิทธิ์เดียวกันหลังจากลบ contribution เชิงเส้นของ controls อื่นออกจาก y และ xj แยกกัน แล้วจึง regress ส่วนที่เหลือทั้งสองตัว
ดังนั้นความหมายของมันขึ้นอยู่กับ controls, functional form, หน่วย และตัวอย่าง ไม่ใช่เพียง correlation ระหว่างตัวแปรดิบสองตัว
Linearity เกี่ยวข้องกับพารามิเตอร์
Linear regression ต้องเป็นเชิงเส้นในสัมประสิทธิ์ แต่ regressors อาจรวม logarithms, squares, splines, indicators และ interactions
เมื่อมี interaction ความสัมพันธ์ส่วนเพิ่มของตัวแปรหนึ่งจะเปลี่ยนตามค่าของอีกตัว ดังนั้นไม่ควรอ่าน main coefficient แบบแยกเดี่ยว
Extrapolation ขยาย functional form ที่เลือกออกไปนอก support ที่สังเกตได้ และเป็นข้ออ้างที่แรงกว่าการ fit ตัวอย่างได้ดีมาก
สมมติฐานต่างกันให้การรับประกันต่างกัน
Zero conditional mean ระบุว่าส่วนประกอบของผลลัพธ์ที่ถูกละไว้ไม่สามารถคาดการณ์อย่างเป็นระบบจาก regressors ที่รวมอยู่ได้ และเป็นแกนกลางของ consistency หรือการตีความเชิงโครงสร้าง
Homoskedasticity ต้องการให้ conditional error variance เท่ากันเมื่อค่า regressor เปลี่ยน มันเกี่ยวข้องกับสูตร variance แบบคลาสสิกและ efficiency มากกว่าความไม่เอนเอียงของสัมประสิทธิ์
Normal errors ไม่จำเป็นต่อการคำนวณ OLS แม้ normality จะช่วยรองรับ exact small-sample t และ F inference ภายใต้โมเดลคลาสสิก
Residual ไม่ใช่ population error ที่มองไม่เห็น
Residual e=y−Xβ̂ คือช่องว่างที่สังเกตได้จากค่าที่ fit ซึ่งประมาณจากตัวอย่างเดียวกัน ขณะที่ population disturbance u ยังคงไม่สังเกตเห็น
เมื่อมี intercept, OLS สร้าง residual ที่ตั้งฉากกับ regressors ของตัวอย่าง ดังนั้น correlation ในตัวอย่างที่เป็นศูนย์ระหว่างทั้งสองจึงไม่ใช่หลักฐานอิสระของ exogeneity
กราฟ residual อาจเผยให้เห็น nonlinearity, variance ที่เปลี่ยนไป การจับกลุ่ม serial dependence และ outliers แต่ไม่สามารถรับรองว่าโมเดลถูกต้อง
ข้อมูลการเงินกดดันสมมติฐานในตำรา
ผลตอบแทนแสดง volatility clustering และเหตุการณ์ที่หางสุดขั้ว ขณะที่ผลตอบแทนของช่วงถือครองที่ทับซ้อนกันสร้าง serial correlation โดยโครงสร้าง
Panel ของบริษัทอาจมี persistence ภายในแต่ละบริษัทและ common shocks ข้ามบริษัทในวันเดียวกัน ซึ่งละเมิดความเป็นอิสระง่าย ๆ ของ observations
Trend ใน series ระดับ survivorship, simultaneous price discovery และ measurement error อาจทำให้สัมประสิทธิ์ที่มีนัยสำคัญดูเป็นโครงสร้างมากกว่าที่เป็นจริง
รายงานค่าประมาณและความไม่แน่นอนร่วมกัน
ระบุ estimand, sample, units, transformations, controls, fixed effects, กฎข้อมูลหาย และ covariance estimator ก่อนตีความตัวเลข
จับคู่สัมประสิทธิ์กับ standard errors หรือ intervals แปลงให้เป็นการเปลี่ยนแปลงที่สมจริง และทดสอบ sensitivity ต่อ observations ที่มีอิทธิพลและ specifications ที่ปกป้องได้
ประเมิน identification และ stability ตามเวลาหรือ out of sample แยกจาก R², sign และ statistical significance
คำถามที่พบบ่อย
สัมประสิทธิ์ของ OLS regression หมายถึงอะไร
คือความแตกต่างเชิงเส้นเฉลี่ยที่ fit แล้วในผลลัพธ์ ซึ่งสัมพันธ์กับ regressor หนึ่งหน่วย โดยตรึง regressors อื่นที่รวมอยู่ไว้
Linear regression แทนความสัมพันธ์แบบโค้งได้หรือไม่
ได้ อาจใช้ logarithms, powers, splines และ interactions ตราบใดที่โมเดลยังเป็นเชิงเส้นในสัมประสิทธิ์
Multicollinearity ทำให้สัมประสิทธิ์เอนเอียงหรือไม่
Multicollinearity ที่ไม่สมบูรณ์ไม่ได้สร้าง bias ด้วยตัวมันเอง แต่ทำให้ standard errors ใหญ่ขึ้นและทำให้สัมประสิทธิ์ไวต่อชุดตัวอย่างมาก
Robust standard errors แก้สมมติฐาน OLS ที่ละเมิดได้หรือไม่
ไม่ มันผ่อนคลายสมมติฐาน covariance บางส่วน แต่ไม่แก้ endogeneity, functional form ที่ไม่ถูกต้อง หรือ selection bias ในสัมประสิทธิ์