คู่มือออปชันทั้งหมด
เหตุใด threshold เดียวจึงล้มเหลวเมื่อ researcher ทดสอบไอเดียจำนวนมากอ่าน 16 นาที

Multiple Testing และ False Discovery Rate ในการเงิน

ทำความเข้าใจ multiple comparisons, family-wise error, false discovery rate, Bonferroni, Holm, Benjamini–Hochberg, dependence, q-values, factor mining, backtest selection และ research governance

จัดทำโดย Mark · แหล่งข้อมูลหลักอยู่ด้านล่าง

คำตอบโดยตรง

Multiple testing เกิดขึ้นเมื่อค้นหา hypotheses, strategies, factors, assets, horizons หรือ specifications หลายรายการพร้อมกัน แม้ p-values ของ single test ที่ถูกต้องก็ยังสร้างผู้ชนะจากความบังเอิญได้ Family-wise error rate ควบคุมความน่าจะเป็นที่จะมี false rejection อย่างน้อยหนึ่งรายการ ส่วน false discovery rate ควบคุมสัดส่วน false ที่คาดหมายในบรรดา rejections ภายใต้สมมติฐานที่ระบุ ปัญหาอยู่ที่ research family ไม่ใช่แค่ตารางสุดท้าย

การทดสอบมากขึ้นสร้างผู้ชนะจากความบังเอิญมากขึ้น

ถ้า true nulls ที่เป็นอิสระกัน m รายการแต่ละรายการถูกทดสอบที่ระดับ α ความน่าจะเป็นที่จะเกิด false rejection อย่างน้อยหนึ่งรายการคือ 1−(1−α)^m

เมื่อ α=0.05 และ m=20 ความน่าจะเป็นนั้นประมาณ 64% แม้ว่าแต่ละ test จะมี nominal false-rejection rate 5% ก็ตาม

Dependence เปลี่ยนการคำนวณที่แน่นอน แต่ไม่ได้ให้เหตุผลที่จะทำเหมือนว่าทดสอบเฉพาะผู้ชนะที่รายงาน

Family กำหนดคำถามเรื่อง error

Test family อาจรวม factors, transformations, universes, lags, horizons, filters, model choices และ reruns ทั้งหมดที่นำมาพิจารณาสำหรับ research claim หนึ่ง

การกำหนด family หลังเห็นผลลัพธ์ทำให้ multiplicity ต่ำกว่าจริง และเปิดทางให้ researcher แยก trials ที่เกี่ยวข้องกันจน correction ดูไม่มีผล

Family ที่ปกป้องได้ควรตาม decision process และ selection opportunity ไม่ใช่เพียงแถวที่รอดมาอยู่ใน paper หรือ dashboard

FWER และ FDR ควบคุมความเสียหายคนละแบบ

Family-wise error rate คือความน่าจะเป็นที่จะทำ false rejection อย่างน้อยหนึ่งครั้งภายใน family

False discovery rate คือ E[V/max(R,1)] โดย V คือจำนวน false rejections และ R คือจำนวน rejections ทั้งหมด

FWER เข้มงวดกว่าเมื่อ false claim ใด ๆ มีต้นทุนสูง ส่วน FDR มักมีพลังมากกว่าเมื่อการ screen candidates จำนวนมากยอมรับ false share ที่ควบคุมได้

Procedures ต้องใช้สมมติฐานของตัวเอง

Bonferroni ทดสอบแต่ละ hypothesis ที่ α/m และควบคุม FWER โดยไม่ต้องใช้ independence แม้จะ conservative ได้

Holm’s step-down method ก็ควบคุม FWER และไม่เคยมีพลังน้อยกว่ากฎ rejection ของ Bonferroni พื้นฐาน

Benjamini–Hochberg เรียง p-values และควบคุม FDR ภายใต้ independence และ positive dependence บางประเภท ส่วน dependence structure อื่นต้องใช้วิธีที่มีเหตุผลรองรับ

Adjusted values ไม่ใช่ posterior truth probabilities

Adjusted p-value คือระดับ family error ต่ำสุดที่ hypothesis จะถูก reject ภายใต้ procedure ที่เลือก

Q-value มักตีความเป็นค่า FDR threshold ขั้นต่ำโดยประมาณสำหรับเรียกผลลัพธ์ว่า discovery โดยขึ้นกับ method และสมมติฐาน

ไม่มี quantity ใดเป็น probability โดยอัตโนมัติว่า strategy ที่เลือกหนึ่งรายการเป็น false เพราะสิ่งนั้นต้องใช้ model และ conditioning statement อื่น

การเงินซ่อน adaptive family ขนาดใหญ่

Factor mining, technical rules, option signals, alternative data, portfolio constraints และ cost assumptions สร้าง trials หลายพันรายการที่ correlated กัน

Published factors ถูกเลือกจากการค้นหาในอดีต ดังนั้นการประเมิน factor ใหม่ด้วย isolated t-statistic ใกล้สองจึงละเลยแรงกดดันจากการค้นพบที่สะสม

สินทรัพย์และช่วงเวลาที่ใช้ร่วมกันทำให้ tests dependent ขณะที่ regime change หมายความว่า correction สำหรับ selection ไม่สามารถรับประกันผลลัพธ์ทางเศรษฐกิจในอนาคต

Governance ต้องเก็บบันทึกการค้นหาไว้

บันทึกทุก hypothesis, code version, universe, outcome, transformation, delay, cost และ stopping choice ด้วย stable research identifier

แยก discovery, confirmation และ live monitoring; ตรึง confirmatory rules และใช้ข้อมูลที่ไม่เคยแตะต้องจริงหรือ prospective evaluation

รายงาน evidence ทั้งแบบ raw และ adjusted, family definition, dependence assumptions, effect sizes, costs, stability, ideas ที่ reject และ live degradation

คำถามที่พบบ่อย

Multiple testing problem คืออะไร

คือการเพิ่มขึ้นของ false discoveries ที่เกิดจากการทดสอบและเลือกจาก hypotheses จำนวนมาก ขณะที่ตัดสินผู้ชนะเหมือนแต่ละ test อยู่โดดเดี่ยว

FWER ต่างจาก FDR อย่างไร

FWER ควบคุมความน่าจะเป็นที่จะมี false rejection อย่างน้อยหนึ่งรายการ ส่วน FDR ควบคุมสัดส่วน false ที่คาดหมายใน rejections ทั้งหมด

Benjamini–Hochberg ทำงานอย่างไร

เรียง p-values เปรียบเทียบกับ thresholds ที่ขึ้นกับ rank และ reject ต่อเนื่องถึง rank ที่ใหญ่ที่สุดซึ่งเข้าเกณฑ์ภายใต้สมมติฐานที่ระบุ

FDR control ทำให้ trading strategy เชื่อถือได้หรือไม่

ไม่ มันจัดการ selection error ภายใต้ test family ที่กำหนด ไม่ใช่ regime change, costs, leakage, model risk หรือ profitability ในอนาคต

แหล่งข้อมูลและการอ่านเพิ่มเติม

คู่มือที่เกี่ยวข้อง