Deflated Sharpe Ratio: การทดสอบหลายครั้งและการเลือกผลแบ็กเทสต์
เรียนรู้ว่า Deflated Sharpe Ratio ปรับหลักฐานทางสถิติของ Sharpe หลังเลือกกลยุทธ์อย่างไร โดยคำนึงถึงการทดสอบหลายครั้งและผลตอบแทนที่ไม่เป็นการแจกแจงปกติ พร้อมตัวอย่างสมมติและข้อจำกัดที่ชัดเจน
ในคู่มือนี้DSR ยกเกณฑ์ Sharpe ให้สูงขึ้นหลังการค้นหา
สรุปสั้น
Deflated Sharpe Ratio (DSR) ถามว่า Sharpe ที่ประมาณได้ของกลยุทธ์ที่เลือกสูงกว่าเกณฑ์ซึ่งสะท้อนทั้งการค้นหาทางเลือกหลายแบบและรูปร่างของการกระจายผลตอบแทนหรือไม่ โดยใช้การคำนวณ Sharpe แบบความน่าจะเป็นเทียบกับค่าอ้างอิงที่ปรับตามการเลือกแล้ว DSR เป็นการวินิจฉัยทางสถิติแบบมีเงื่อนไข ไม่ได้ทำให้แบ็กเทสต์กลายเป็นหลักฐานของกำไรในอนาคต และไม่ได้แก้การทดลองที่ตกหล่น ต้นทุนที่ไม่สมจริง หรือข้อมูลรั่วไหลตามลำดับเวลา
DSR ยกเกณฑ์ Sharpe ให้สูงขึ้นหลังการค้นหา
นักวิจัยอาจทดลองนิยามสัญญาณ ช่วงเวลาย้อนหลัง เกณฑ์เข้าเทรด กลุ่มสินทรัพย์ ระยะเวลาถือครอง และสมมติฐานด้านต้นทุนหลายแบบ แล้วรายงานเวอร์ชันที่มีอัตราส่วน Sharpe สูงที่สุด แม้ไม่มีตัวเลือกใดมีความสามารถจริง ค่าประมาณก็ยังต่างกันจากความผันผวนของตัวอย่าง ยิ่งค้นหากว้าง ค่าสูงสุดก็ยิ่งมีแนวโน้มสูงขึ้น ผลที่เลือกจึงต่างจากการประเมินกลยุทธ์เดียวที่กำหนดไว้ก่อนดูข้อมูล
Deflated Sharpe Ratio ซึ่ง Bailey และ López de Prado เสนอขึ้นมาจัดการสาเหตุสองประการที่ทำให้ Sharpe ที่เลือกดูสูงเกินจริง ได้แก่ การทดสอบหลายครั้งและผลตอบแทนที่ไม่เป็นการแจกแจงปกติ การทดสอบหลายครั้งยกเกณฑ์ที่ผลลัพธ์ต้องผ่าน ส่วนความไม่เป็นปกติเปลี่ยนความไม่แน่นอนของ Sharpe ที่ประมาณได้ บทความต้นฉบับอธิบาย DSR ว่าเป็น Probabilistic Sharpe Ratio ที่คำนวณเทียบกับเกณฑ์ซึ่งปรับตามการเลือกแล้ว บทความต้นฉบับ อธิบายที่มาของสูตรและการประมาณจำนวนครั้งที่ทดลอง
คำอธิบายนี้ช่วยหลีกเลี่ยงความเข้าใจผิดที่พบบ่อย DSR ไม่ได้หักค่าปรับคงที่ออกจาก Sharpe ที่รายงานเพื่อสร้างอัตราส่วนผลการดำเนินงานใหม่โดยอัตโนมัติ แต่ประมาณว่า Sharpe ที่สังเกตได้สูงกว่าเกณฑ์ที่ขึ้นกับขอบเขตการค้นหา ขนาดตัวอย่าง และโมเมนต์ของผลตอบแทนเพียงใด ค่า Sharpe แบบจุดอาจไม่เปลี่ยน แต่ DSR ลดลงได้เมื่อหลักฐานอ่อนลง ดู คำอธิบายดั้งเดิมของ Sharpe เพื่อทำความเข้าใจ Sharpe เอง
ค่าที่ดีที่สุดจากค่าประมาณที่มีสัญญาณรบกวนจำนวนมากมักสูงผิดปกติ
สมมติว่ากฎทุกข้อที่ทดสอบมี Sharpe จริงเท่ากัน แต่ค่าประมาณแต่ละค่าผันแปรเพราะใช้ตัวอย่างจำกัด การเลือกค่าที่สูงที่สุดจึงเท่ากับเลือกความคลาดเคลื่อนในการวัดที่เป็นใจด้วย นี่คือคำสาปของผู้ชนะ: เมื่อนำข้อมูลใหม่มาประเมิน ค่าที่เลือกมักถอยกลับเข้าใกล้ค่าทั่วไปของกลุ่ม
จำนวนครั้งที่ทดลองสำคัญ แต่ความแตกต่างระหว่างค่าประมาณก็สำคัญเช่นกัน หากตัวเลือกสร้างผลตอบแทนเกือบเหมือนกัน ค่า Sharpe ที่ประมาณได้จะสัมพันธ์กันมาก และให้โอกาสอิสระในการพบค่าสูงโดยบังเอิญน้อยกว่าตัวเลือกที่ไม่เกี่ยวข้องกันจำนวนเท่ากัน ดังนั้นจำนวนแถวในกริดพารามิเตอร์จึงไม่ใช่จำนวนการทดลองอิสระโดยอัตโนมัติ
บันทึกการค้นหาอาจรวมการตัดสินใจนอกกริดที่เป็นทางการ เช่น การเปลี่ยนเกณฑ์ด้วยตนเอง การตัดตลาดออก หรือการปรับสมมติฐานด้านต้นทุนที่ส่งผลต่อผลลัพธ์ที่คงไว้ DSR ที่คำนวณจากตัวเลือกสุดท้ายเท่านั้นไม่สามารถนับรวมการทดลองที่ไม่ได้บันทึกหรือไม่ได้ส่งเป็นข้อมูลเข้าได้
Probabilistic Sharpe Ratio คำนวณความไม่แน่นอนจากตัวอย่าง
Probabilistic Sharpe Ratio (PSR) ประมาณว่า Sharpe จากตัวอย่างสูงกว่าค่าอ้างอิงที่เลือกไว้หรือไม่ โดยคำนึงถึงจำนวนการสังเกตผลตอบแทน ความเบ้ และความโด่งที่ประมาณได้ DSR ใช้การคำนวณพื้นฐานเดียวกัน แต่เลือกค่าอ้างอิงที่สะท้อน Sharpe สูงสุดที่คาดว่าจะได้จากการค้นหา
สำหรับการประมาณ PSR ที่ใช้กันแบบหนึ่ง การคำนวณที่ปรับตามการเลือกคือ:
$$ \mathrm{DSR}=\Phi\!\left( \frac{(\widehat{SR}-SR_0)\sqrt{T-1}} {\sqrt{1-\widehat{\gamma}_3\widehat{SR} +\frac{\widehat{\gamma}_4-1}{4}\widehat{SR}^{\,2}}} \right) $$
ในที่นี้ $\Phi$ คือฟังก์ชันการแจกแจงสะสมของการแจกแจงปกติมาตรฐาน $\widehat{SR}$ คือ Sharpe ที่สังเกตได้ต่อการสังเกตผลตอบแทน $SR_0$ คือเกณฑ์ที่ปรับตามการเลือกโดยใช้หน่วยเดียวกัน และ $T$ คือจำนวนการสังเกต $\widehat{\gamma}_3$ คือความเบ้ของตัวอย่าง ส่วน $\widehat{\gamma}_4$ คือความโด่งแบบ Pearson ซึ่งมีค่า 3 สำหรับการแจกแจงปกติ ตัวส่วนสะท้อนว่าความเบ้และความโด่งเปลี่ยนความไม่แน่นอนของการประมาณ Sharpe อย่างไร
นิพจน์นี้ขึ้นอยู่กับธรรมเนียมการคำนวณที่ใช้ ให้ใช้ผลตอบแทนส่วนเกินที่มีความถี่เดียวกัน คำนวณ Sharpe และเกณฑ์ด้วยความถี่เดียวกัน และนิยามความโด่งให้สอดคล้องกัน การแปลงค่าเป็นรายปีเพียงค่าเดียวทำให้การเปรียบเทียบเปลี่ยนไป สูตรที่ใช้กันทั่วไปยังตั้งสมมติฐานเกี่ยวกับความสัมพันธ์ระหว่างการสังเกตผลตอบแทนด้วย ต้องจัดการความสัมพันธ์ตามลำดับเวลาแยกต่างหาก ไม่ใช่ปรับ $T$ อย่างเงียบ ๆ
เกณฑ์ค่าสูงสุดที่คาดหวังขึ้นอยู่กับกลุ่มตัวเลือก
สำหรับค่าประมาณ Sharpe อิสระ $N$ ค่า ซึ่งมีการแจกแจงใกล้เคียงปกติ Bailey และ López de Prado ใช้การประมาณค่าแบบค่าสุดขั้วสำหรับค่าสูงสุดที่คาดหวัง:
$$ SR_0 \approx \mu_{SR}+\sigma_{SR} \left[(1-\gamma_E)\Phi^{-1}\!\left(1-\frac{1}{N}\right) +\gamma_E\Phi^{-1}\!\left(1-\frac{1}{Ne}\right)\right] $$
$\mu_{SR}$ และ $\sigma_{SR}$ คือค่าเฉลี่ยและส่วนเบี่ยงเบนมาตรฐานของค่าประมาณ Sharpe ของตัวเลือก $\Phi^{-1}$ คือฟังก์ชันควอนไทล์ของการแจกแจงปกติมาตรฐาน $e$ คือค่าคงที่ของออยเลอร์ และ $\gamma_E \approx 0.5772$ คือค่าคงที่ออยเลอร์–มาสเคโรนี นิพจน์นี้ประมาณว่าการเลือกเพียงอย่างเดียวทำให้ค่าประมาณที่ดีที่สุดสูงขึ้นได้แค่ไหนภายใต้แบบจำลองจำนวนครั้งทดลองที่กำหนด ไม่ใช่เกณฑ์สากลสำหรับการค้นหากลยุทธ์ทุกแบบ
หากผลของตัวเลือกมีความสัมพันธ์กัน การถือว่าทุกรูปแบบเป็นอิสระอาจประเมินจำนวนการทดลองที่มีผลจริงสูงเกินไป บทความกล่าวถึงการประมาณจำนวนการทดลองอิสระจากความพึ่งพาระหว่างตัวเลือก แต่การประมาณนั้นก็เป็นอีกทางเลือกหนึ่งของการสร้างแบบจำลอง ความสัมพันธ์เป็นเพียงรูปแบบหนึ่งของความพึ่งพา และการประมาณจากตัวเลือกจำนวนมากกับประวัติผลตอบแทนสั้นอาจไม่เสถียร ให้รายงานจำนวนตัวเลือกดิบ วิธีประมาณจำนวนที่มีผลจริง และความไวต่อทางเลือกที่สมเหตุสมผล
ตัวอย่างสมมติแยกเกณฑ์ออกจาก Sharpe ที่สังเกตได้
สมมติการค้นหาที่ตั้งใจทำให้ง่ายลง โดยมีกลยุทธ์ตัวเลือกอิสระ 20 แบบ ภายใต้สมมติฐานศูนย์ ให้ค่าเฉลี่ยของค่าประมาณ Sharpe เป็น 0 และส่วนเบี่ยงเบนมาตรฐานเป็น 0.20 ในหน่วยรายเดือน การประมาณค่าสูงสุดที่คาดหวังให้เกณฑ์การเลือกประมาณ $SR_0=0.380$ ต่อเดือน ตัวเลขเหล่านี้เป็นสมมติฐานเพื่อแสดงวิธีคำนวณ ไม่ใช่ข้อมูลจากตลาดหรือเกณฑ์แนะนำ
สมมติว่ากลยุทธ์ที่เลือกมีการสังเกตผลตอบแทนส่วนเกินรายเดือน 60 ค่า Sharpe รายเดือนที่ประมาณได้ 0.50 ความเบ้ของตัวอย่าง 0 และความโด่งแบบ Pearson 3 ส่วน PSR เปรียบเทียบ 0.50 กับ 0.380 ไม่ใช่ศูนย์:
$$ z=\frac{(0.50-0.380)\sqrt{59}}{\sqrt{1+((3-1)/4)(0.50)^2}} \approx 0.868,\qquad \mathrm{DSR}=\Phi(z)\approx 0.807 $$
ภายใต้สมมติฐานแบบง่ายนี้ DSR อยู่ที่ประมาณ 80.7% ตัวเลขนี้ไม่ได้หมายความว่ากลยุทธ์มีโอกาสทำกำไรเดือนหน้า 80.7% และไม่ใช่การคาดการณ์ผลตอบแทนเดือนหน้า แต่เป็นหลักฐานโดยประมาณว่า Sharpe พื้นฐานสูงกว่าเกณฑ์การเลือกที่กำหนด เมื่อมีเงื่อนไขตามแบบจำลองและข้อมูลเข้า จำนวนการทดลอง การประมาณความพึ่งพา ตัวอย่าง หรือรูปร่างการแจกแจงที่ต่างออกไปอาจเปลี่ยนผลได้
ความไวต่อการกระจายของค่าประมาณในการทดลองมีนัยสำคัญ หากเปลี่ยนเพียงส่วนเบี่ยงเบนมาตรฐานสมมติของค่าประมาณ Sharpe ของตัวเลือกจาก 0.20 เป็น 0.10 การค้นหาเดิมที่มี 20 ครั้งจะได้เกณฑ์ประมาณ 0.190 และ DSR ประมาณ 98.8% หากส่วนเบี่ยงเบนมาตรฐานเป็น 0.30 เกณฑ์จะประมาณ 0.570 และ DSR ประมาณ 30.6% Sharpe ที่สังเกตได้ 0.50 จำนวนการสังเกต 60 ความเบ้และความโด่งยังคงเดิม ความไวสมมตินี้แสดงว่าทำไมวิธีประมาณการกระจายของการทดลองและความพึ่งพาระหว่างตัวเลือกจึงสำคัญ ตัวเลขยังใช้หน่วยรายเดือนและแบบจำลองอย่างง่ายเดิม
ความเบ้และความโด่งเปลี่ยนความไม่แน่นอน ไม่ใช่แค่คำอธิบาย
กลยุทธ์สองแบบอาจมี Sharpe จากตัวอย่างและขนาดตัวอย่างเท่ากัน แต่การแจกแจงผลตอบแทนต่างกัน หางด้านซ้ายที่เด่นชัด ความไม่สมมาตร หรือการพบค่ารุนแรงบ่อยผิดปกติอาจเปลี่ยนความไม่แน่นอนจากตัวอย่างที่แสดงในตัวส่วนของ PSR การปรับนี้คำนวณจากโมเมนต์ที่วัดได้ ไม่ได้ตัดสินว่าการแจกแจงที่ไม่ปกติทุกแบบเป็นอันตรายเท่ากัน และไม่รับประกันว่าโมเมนต์จากตัวอย่างเพียงไม่กี่ค่าจะอธิบายพฤติกรรมส่วนหางได้ครบถ้วน
การคำนวณยังขึ้นอยู่กับว่าอะไรนับเป็นการสังเกตหนึ่งครั้ง ข้อมูลรายวัน รายสัปดาห์ และรายเดือนทำให้ค่า $T$, Sharpe, ความเบ้ และความโด่งต่างกัน ผลตอบแทนในช่วงถือครองที่ทับซ้อนกันอาจทำให้แถวติดกันมีความพึ่งพากัน การตีราคาที่ราบเรียบหรือเก่าอาจดูผันผวนน้อยกว่าความเสี่ยงทางเศรษฐกิจที่แท้จริง ให้อธิบายความถี่และวิธีสร้างตัวอย่าง แทนที่จะถือว่า Sharpe รายปีเป็นข้อมูลเพียงพอ
DSR และวิธีตรวจสอบอื่นตอบคำถามคนละข้อ
PBO ใช้ Combinatorially Symmetric Cross-Validation เพื่อถามว่าผู้ชนะในตัวอย่างอยู่ในอันดับมัธยฐานของตัวเลือกหรือต่ำกว่า บนบล็อกส่วนเติมเต็มบ่อยเพียงใด DSR ประมาณว่า Sharpe ที่เลือกสูงกว่าเกณฑ์ซึ่งปรับตามการค้นหาและความไม่เป็นปกติหรือไม่ ผลลัพธ์และสมมติฐานการสุ่มตัวอย่างซ้ำต่างกัน จึงใช้แทนกันไม่ได้ ดูแนวทางเรื่อง PBO และ CSCV และการทดสอบหลายครั้งในตลาดการเงิน เพิ่มเติม Bailey และผู้ร่วมเขียนอธิบายการวินิจฉัยผลจากการเลือกนี้อย่างเป็นทางการในบทความ PBO ต้นฉบับ
White’s Reality Check ใช้ bootstrap ทดสอบว่ากฎที่ดีที่สุดในกลุ่มตัวเลือกชนะเกณฑ์เปรียบเทียบที่ระบุไว้หรือไม่ หลังคำนึงถึงการค้นหาข้อมูลซ้ำ คำถามของวิธีนี้เน้นการเปรียบเทียบกับเกณฑ์ ส่วน DSR ใช้เกณฑ์ที่อิง Sharpe การประเมินแบบ walk-forward ตามลำดับเวลาหรือชุดทดสอบสุดท้ายถามว่ากระบวนการที่ตรึงไว้ทำงานอย่างไรในช่วงเวลาถัดไป วิธีเหล่านี้เสริมกันได้เพราะตรวจคนละส่วนของข้ออ้างในการวิจัย White อธิบายวิธีนี้ไว้ในบทความ Reality Check ต้นฉบับ
รายงานการค้นหาและสมมติฐานประกอบกับ DSR
รายงานที่ทำซ้ำได้ควรระบุกลุ่มตัวเลือก ทุกการตัดสินใจที่มีบันทึกและส่งผลต่อการเลือก จำนวนการทดลองดิบ วิธีหาจำนวนที่มีผลจริง (ถ้ามี) อนุกรมผลตอบแทน ความยาวและความถี่ของตัวอย่าง นิยาม Sharpe ความเบ้ ธรรมเนียมความโด่ง และเกณฑ์ที่ปรับตามการเลือก ระบุว่าผลตอบแทนเป็นค่าก่อนหรือหลังหักส่วนต่างซื้อขาย ค่าคอมมิชชัน ผลกระทบตลาด funding ค่ายืม และต้นทุนอื่น แสดง Sharpe ที่สังเกตได้และ DSR คู่กัน เพื่อให้เห็นสิ่งที่เปลี่ยนไป
สูตรทั่วไปตั้งสมมติฐานเกี่ยวกับตัวอย่าง ซึ่งอาจไม่เหมาะกับข้อมูลที่มีความสัมพันธ์ตามลำดับ งานของ Lo เกี่ยวกับสถิติ Sharpe ratio อธิบายว่าเหตุใดการรวมข้อมูลตามเวลาและความพึ่งพาจึงมีผลต่อการอนุมาน Sharpe หากผลตอบแทนทับซ้อนหรือมีความสัมพันธ์ตามลำดับ ให้ใช้กระบวนการอนุมานที่รองรับโครงสร้างนั้นและอธิบายสมมติฐาน การคูณ Sharpe รายเดือนด้วย $\sqrt{12}$ ไม่ได้แก้สหสัมพันธ์ในตัวเอง สำหรับการประเมินที่คำนึงถึงเวลา ดูแนวทางเรื่องหน้าต่าง walk-forward แบบขยายและเลื่อน เพิ่มเติม
DSR ไม่สามารถค้นพบการค้นหาที่ไม่มีการบันทึก กำจัดข้อมูลอนาคตรั่วไหล ทำให้ข้อมูลที่มีอคติจากผู้รอดอยู่เป็นตัวแทน ตรวจสอบการส่งคำสั่ง ประมาณขีดความสามารถ หรือรับประกันความเสถียรในระบอบตลาดใหม่ได้ และไม่ใช่สิ่งทดแทนเหตุผลทางเศรษฐศาสตร์หรือหลักฐานตามลำดับเวลาภายหลัง ให้มอง DSR เป็นการวินิจฉัยหนึ่งรายการที่บันทึกไว้ในกระบวนการวิจัย พร้อมเก็บประวัติตัวเลือกและกระบวนการข้อมูลให้ทำซ้ำได้
คำถามที่พบบ่อย
Q1Deflated Sharpe Ratio คือ Sharpe ที่หักค่าปรับแล้วหรือไม่?
ไม่ใช่ DSR เป็นสถิติแบบความน่าจะเป็นที่สร้างจาก Sharpe ที่เลือก เกณฑ์ที่ปรับตามการเลือก ความยาวตัวอย่าง ความเบ้ และความโด่ง ไม่ได้แทนค่าประมาณจุดของ Sharpe ที่รายงานด้วยอัตราส่วนที่ถูกลดลงโดยกลไก
Q2ควรนับทุกชุดพารามิเตอร์เป็นการทดลองอิสระหรือไม่?
ไม่ ตัวเลือกที่คล้ายกันอาจมีผลตอบแทนที่สัมพันธ์กัน ดังนั้นขนาดกริดดิบอาจไม่เท่ากับจำนวนโอกาสอิสระที่มีผลจริงในการเลือกค่าประมาณสูง เก็บบันทึกการค้นหาให้ครบและเปิดเผยวิธีจัดการความพึ่งพากับความไม่แน่นอนของวิธีนั้น
Q3DSR สูงพิสูจน์หรือไม่ว่ากลยุทธ์ซื้อขายจะได้ผล?
ไม่ DSR มีเงื่อนไขตามกลุ่มตัวเลือก ข้อมูล การสร้างผลตอบแทน สมมติฐานจำนวนการทดลอง และแบบจำลองตัวอย่าง ไม่ได้แก้การทดลองที่ตกหล่น ความผิดพลาดในการส่งคำสั่ง ข้อมูลรั่วไหล การเปลี่ยนระบอบตลาด หรือความไม่แน่นอนในอนาคต
แหล่งข้อมูลและการอ่านเพิ่มเติม
รายงานปัญหา
เราจะเตรียมอีเมลพร้อมลิงก์บทความนี้ Mark จะได้รับรายงานเมื่อคุณส่งอีเมลแล้วเท่านั้น
ตรวจสอบอย่างรวดเร็ว
อ่านคู่มือจบแล้ว ลองตอบคำถาม 3 ข้อ
คำถาม 01
อะไรเปลี่ยนไปเมื่อใช้การคำนวณ Probabilistic Sharpe เป็นพื้นฐานของ DSR?
เลือกคำตอบเพื่อดูคำอธิบาย
อภิธานศัพท์ออปชัน
The probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
อ่านคู่มือฉบับละเอียดAssignmentThe process that requires an option writer to fulfill the contract after an exercise notice is allocated; it can create or remove an underlying position.
อ่านคู่มือฉบับละเอียด