คู่มือออปชันทั้งหมด
ออกแบบการเปรียบเทียบที่เป็นธรรมขึ้นก่อนประมาณผลกระทบอ่าน 18 นาที

Propensity scores, matching และ overlap

เรียนรู้ว่า propensity score ช่วยทำให้สมดุลอะไร เหตุใด overlap และ unconfoundedness จึงสำคัญ matching และ weighting เปลี่ยน estimand อย่างไร และ diagnostics ใดทำให้การศึกษาเชิงการเงินน่าเชื่อถือ

จัดทำโดย Mark · แหล่งข้อมูลหลักอยู่ด้านล่าง

คำตอบโดยตรง

Propensity score คือความน่าจะเป็นที่จะได้รับ treatment เมื่อกำหนด covariates ก่อนการรักษาที่สังเกตได้ การ matching หรือ weighting ด้วย score นี้อาจทำให้ covariates ที่วัดได้เปรียบเทียบกันได้มากขึ้นระหว่างกลุ่มที่ได้รับและไม่ได้รับ treatment แต่ไม่สามารถทำให้ตัวแปรกวนที่ซ่อนอยู่สมดุล แก้ overlap ที่ขาดหาย หรือสร้างการสุ่มขึ้นมาได้ ดังนั้นการวิเคราะห์ที่น่าเชื่อถือจึงต้องกำหนด estimand ออกแบบการเปรียบเทียบโดยไม่ดูผลลัพธ์ ตรวจสอบ covariate balance และการกระจุกตัวของน้ำหนัก และรายงานว่า trimming หรือ matching เปลี่ยนประชากรที่ศึกษาอย่างไร

การรักษาเชิงสังเกตเริ่มจากการคัดเลือก

บริษัท นักลงทุน และตลาดแทบไม่รับนโยบายแบบสุ่ม ขนาด ความเสี่ยง ธรรมาภิบาล สภาพคล่อง และการเติบโตที่คาดหวังอาจมีอิทธิพลทั้งต่อการนำไปใช้และผลลัพธ์ในภายหลัง

ดังนั้นช่องว่างของผลลัพธ์ดิบจึงปะปนผลของ treatment กับความแตกต่างที่มีอยู่ก่อน การปรับด้วย regression ก็เผชิญปัญหาการระบุแบบเดียวกัน เว้นแต่สมมติฐานจะมีเหตุผลรองรับ

คำถามด้านการออกแบบต้องมาก่อน: ในบรรดาหน่วยใดบ้างที่ treatment อาจเปลี่ยนแปลงได้อย่างสมเหตุสมผล และข้อเท็จจริงก่อนการรักษาใดอธิบายการเลือกนั้น

Propensity score บีบอัด covariates ที่สังเกตได้

สำหรับ covariates X, propensity score e(X) คือความน่าจะเป็นของ treatment โดยมีเงื่อนไขบน X หน่วยที่มี score เท่ากันควรมีการแจกแจงของ X ที่วัดได้คล้ายกัน

คุณสมบัติด้านการทำให้สมดุลนี้ลดการเปรียบเทียบหลายมิติให้เหลือ score เดียว แต่ใช้ได้เฉพาะตัวแปรที่ป้อนและเกิดก่อน treatment เป้าหมายไม่ใช่ความแม่นยำในการทำนาย

แบบจำลองควรสะท้อนการมอบหมาย treatment และความรู้เชิงสาระ ตัวแปรหลังการรักษาและ collider อาจนำ bias เข้ามาแทนที่จะลบ bias ออก

Unconfoundedness เป็นสะพานเชิงเหตุผล

วิธี propensity ต้องอาศัย conditional exchangeability: หลังควบคุมด้วย covariates ที่สังเกตได้แล้ว การมอบหมาย treatment ต้องไม่สัมพันธ์กับ potential outcomes ที่กำลังเปรียบเทียบ

ข้อความนี้ตรวจสอบจากข้อมูลที่ match แล้วเพียงอย่างเดียวไม่ได้ ความคาดหวังที่ไม่ได้วัด สัญญาณส่วนตัว หรือความสามารถของผู้บริหารอาจยังผลักดันทั้ง treatment และผลการดำเนินงาน

ดังนั้น matching จึงเป็นเครื่องมือด้านการออกแบบ ไม่ใช่ใบรับรองเชิงเหตุผล Negative controls เหตุผลเชิงสถาบัน และ sensitivity analysis ควรใช้จัดการตัวแปรกวนที่วัดไม่ได้

Overlap เป็นตัวกำหนดว่าใครเปรียบเทียบกันได้

Positivity หมายความว่าโปรไฟล์ covariate ที่เกี่ยวข้องแต่ละแบบมีโอกาสที่มีความหมายในการปรากฏอยู่ในทั้งสองกลุ่ม Score ที่ใกล้ศูนย์หรือหนึ่งเปิดเผย common support ที่บาง

ไม่มีแบบจำลองใดสร้างตัวแทนที่ไม่ได้รับ treatment ให้หน่วยที่ได้รับ treatment นอกประชากร donor ได้ การ extrapolate ตรงนั้นทำให้ผลลัพธ์ขึ้นกับ functional form มากกว่าหลักฐาน

Caliper, trimming และ overlap weights อาจเพิ่มเสถียรภาพ แต่เปลี่ยนประชากรเป้าหมาย ต้องระบุ estimand ที่ปรับใหม่แทนการซ่อนไว้

Matching และ weighting ตอบคำถามต่างกัน

Nearest-neighbor หรือ caliper matching สร้างกลุ่มตัวอย่างเปรียบเทียบ Subclassification เปรียบเทียบช่วงของ score ส่วน inverse-probability weighting สร้าง pseudo-population แบบถ่วงน้ำหนัก

น้ำหนักสำหรับ average treatment effect ต่างจากน้ำหนักสำหรับ effect on treated units Overlap weights ให้น้ำหนักกับหน่วยที่สถานะ treatment ไม่แน่นอนที่สุด

ทางเลือกเหล่านี้ส่งผลต่อ bias, variance และการตีความ การนำ control กลับมาใช้ การทิ้งหน่วยที่ได้รับ treatment และการประมาณ score ล้วนส่งผลต่อความไม่แน่นอนและควรเข้าไปอยู่ในการอนุมาน

Balance เป็น diagnostics หลักของการออกแบบ

หลังการปรับ ให้เปรียบเทียบแต่ละ covariate ด้วย standardized mean differences และกราฟการแจกแจง AUC สูงของแบบจำลอง treatment ไม่ใช่หลักฐานว่ามี balance ที่ดี

ตรวจสอบการแจกแจง propensity จำนวนที่ไม่ match effective sample size และน้ำหนักที่ใหญ่ที่สุด การสังเกตสุดขั้วเพียงไม่กี่รายการอาจครอบงำค่าประมาณอย่างเงียบ ๆ

ควรซ่อนผลลัพธ์ไว้ขณะปรับการออกแบบ มิฉะนั้นการเลือก matching ซ้ำ ๆ อาจกลายเป็นการค้นหา specification ที่ขับเคลื่อนด้วยผลลัพธ์

การประยุกต์ใช้ด้านการเงินต้องมีเรื่องราวของ treatment

สมมติว่าบริษัทที่ใช้นโยบายเปิดเผยข้อมูลต่อมาซื้อขายด้วยต้นทุนที่ต่ำลง Matching อาจเปรียบเทียบผู้ใช้กับบริษัทที่คล้ายกันด้านขนาด ความผันผวน โครงสร้างผู้ถือหุ้น และสภาพคล่องก่อนหน้า

แต่ยังล้มเหลวหากการใช้นโยบายเกิดตามแผนการจัดหาเงินทุนที่ไม่ได้วัดและแผนนั้นยังปรับปรุงสภาพคล่องด้วย เวลาและบันทึกการตัดสินใจสำคัญกว่ารายการ covariate ที่ยาว

รายงานวันที่ treatment ช่วงเวลาก่อนการรักษา covariates กราฟ overlap ตาราง balance estimand น้ำหนัก การตัดออก ความไม่แน่นอนของผลกระทบ และ sensitivity ต่อ hidden bias

อ่านค่าประมาณว่าเป็นการเปรียบเทียบที่ออกแบบไว้

ผลลัพธ์ที่แข็งแรงที่สุดไม่ใช่ผลลัพธ์ที่ใช้ทุกการสังเกต แต่เป็นผลลัพธ์ที่ได้รับการสนับสนุนจากประชากรซึ่งมีคู่เทียบที่น่าเชื่อถืออยู่จริง

แยกความสำเร็จที่สังเกตได้ของการออกแบบ—covariate balance ที่ดีขึ้น—ออกจากข้ออ้างเชิงเหตุผลที่ทดสอบไม่ได้—ไม่มีตัวแปรกวนสำคัญที่ซ่อนอยู่เหลืออยู่

หากค่าประมาณเปลี่ยนอย่างมากตาม caliper กฎ trimming หรือสถานการณ์ hidden bias ที่เป็นไปได้ ความไม่แน่นอนด้านการออกแบบควรเป็นส่วนหนึ่งของข้อสรุป

คำถามที่พบบ่อย

Matching ทำให้การศึกษาเชิงสังเกตกลายเป็นการสุ่มหรือไม่?

ไม่ใช่ มันอาจเพิ่มความเปรียบเทียบกันได้ของ covariates ก่อนการรักษาที่วัดได้ แต่ตัวแปรกวนที่ซ่อนอยู่อาจยังคงอยู่

ควรให้แบบจำลอง propensity ทำนาย treatment ให้แม่นที่สุดหรือไม่?

ไม่ใช่ จุดประสงค์คือ covariate balance สำหรับ estimand เป้าหมาย ไม่ใช่ประสิทธิภาพด้านการจำแนก

Overlap ที่ไม่ดีหมายถึงอะไร?

หมายความว่าหน่วยที่ได้รับ treatment บางหน่วยไม่มีตัวแทนที่ไม่ได้รับ treatment ที่น่าเชื่อถือ ดังนั้นผลกระทบของหน่วยเหล่านั้นต้องอาศัย extrapolation หรือประชากรเป้าหมายที่แคบลง

Trimming score สุดขั้วไม่เป็นอันตรายใช่ไหม?

ไม่ใช่ มันอาจเพิ่มความแม่นยำและความทนทาน แต่จะเปลี่ยนว่าค่าประมาณนั้นอธิบายประชากรใด

แหล่งข้อมูลและการอ่านเพิ่มเติม

คู่มือที่เกี่ยวข้อง