การให้คะแนน VaR–ES ร่วมกัน: การประเมินพยากรณ์แบบ Fissler–Ziegel
เรียนรู้ว่าเหตุใด Value at Risk และ Expected Shortfall ต้องใช้กฎการให้คะแนนร่วม วิธีเปรียบเทียบพยากรณ์ด้วยคะแนน Fissler–Ziegel และความแตกต่างจากการทดสอบข้อยกเว้น VaR
ในคู่มือนี้เริ่มจากคู่พยากรณ์และนิยามส่วนหาง
สรุปสั้น
VaR คือควอนไทล์และให้คะแนนแยกเดี่ยวได้ด้วย quantile loss ส่วน Expected Shortfall (ES) แตกต่างออกไป: ในกลุ่มการแจกแจงที่กว้าง ES ไม่สามารถ elicitable ในฐานะพยากรณ์จุดเดี่ยวได้ Fissler และ Ziegel แสดงว่า ภายใต้เงื่อนไขที่เหมาะสม สามารถประเมิน VaR และ ES ร่วมกันด้วยคะแนนร่วมที่ strictly consistent ได้ วิธีนี้ช่วยให้เปรียบเทียบคู่พยากรณ์ แต่คะแนนต่ำไม่ได้พิสูจน์ว่าแบบจำลองความเสี่ยงถูกต้อง
เริ่มจากคู่พยากรณ์และนิยามส่วนหาง
ให้ L_t เป็นผลขาดทุน ดังนั้นค่ายิ่งมากยิ่งแย่ และให้ c เป็นระดับความเชื่อมั่น เช่น 97.5% ควอนไทล์ผลขาดทุนแบบมีเงื่อนไข v(c,t) คือค่า x ต่ำสุดที่ทำให้ F(L_t ≤ x | ข้อมูลที่มีถึง t−1) ถึง c ภายใต้นิยามผลขาดทุนเป็นบวกที่ส่วนหางด้านบน ES = [1/(1−c)] คูณอินทิกรัลของ v(u,t) จาก c ถึง 1 เมื่อค่าเฉลี่ยส่วนหางมีค่าจำกัด สำหรับการแจกแจงต่อเนื่อง ค่านี้เท่ากับผลขาดทุนเฉลี่ยที่เกินเกณฑ์ VaR หากมีมวลความน่าจะเป็นที่เกณฑ์ นิยามแบบอินทิกรัลควอนไทล์จะนับเฉพาะส่วนที่จำเป็น
คะแนนต้องใช้ convention เดียวกับพยากรณ์ บางบทความนิยาม VaR และ ES ที่ส่วนหางล่างของผลตอบแทน ซึ่งมักเป็นค่าลบ และเขียนความน่าจะเป็นส่วนหางเป็น α = 1−c หากนิยามผลขาดทุนเป็นบวก ความเสี่ยงเดียวกันอยู่ที่ส่วนหางบนและ ES ไม่น้อยกว่า VaR การผสม convention อาจทำให้อสมการและตัวบ่งชี้ข้อยกเว้นกลับด้าน ให้ระบุเครื่องหมาย ระดับความเชื่อมั่น horizon และข้อมูลที่ทราบก่อนเกิดผลลัพธ์
เหตุใด VaR และ ES จึงไม่มีคะแนนเดี่ยวแบบเดียวกัน
ควอนไทล์มี pinball score ที่ strictly consistent สำหรับผลขาดทุน L และควอนไทล์ระดับ c คือ v ตัวอย่างคะแนน VaR คือ S_VaR(v,L) = (I{L ≤ v}−c)(v−L) ภายใต้เงื่อนไขควอนไทล์ทั่วไป ค่าคาดหมายต่ำสุดที่ควอนไทล์เป้าหมาย จึงประเมิน VaR แยกเดี่ยวได้
ไม่มีคะแนน strictly consistent ที่เทียบเท่ากันเพื่อ elicit ES เพียงตัวเดียวในกลุ่มการแจกแจงผลขาดทุนกว้างที่ใช้จัดการความเสี่ยง ข้อความนี้จำกัดอยู่ที่พยากรณ์จุดเดี่ยวและคะแนนคาดหมายที่เลือก ES ได้อย่างเป็นเอกลักษณ์ ไม่ได้หมายความว่า ES ไร้ความหมาย ทดสอบไม่ได้ หรือเปรียบเทียบไม่ได้เมื่อเป็นส่วนหนึ่งของพยากรณ์ที่ใหญ่ขึ้น
Fissler และ Ziegel วางความแตกต่างหลักไว้ว่า ES ไม่ elicitable เพียงตัวเดียวในความหมายนี้ แต่คู่ (VaR, ES) jointly elicitable ได้ภายใต้เงื่อนไข regularity และ moments ที่เหมาะสม บทความปี 2016 ของพวกเขาให้เงื่อนไขจำเป็นและเพียงพอสำหรับกลุ่มคะแนน strictly consistent (Fissler and Ziegel, 2016) การ jointly elicitable หมายถึงฟังก์ชันคะแนนเดียวรับพยากรณ์ทั้งสองส่วนและผลลัพธ์จริงเป็นอินพุต การบวก loss สองตัวใด ๆ ไม่ได้สร้างคะแนน ES ที่ถูกต้องโดยอัตโนมัติ
คะแนน Fissler–Ziegel ประเมินอะไร
เขียน S_c(v,e;L) สำหรับคะแนนร่วมที่ admissible ที่ระดับ c ความ strictly consistent หมายถึงคะแนนคาดหมายภายใต้การแจกแจงเป้าหมายต่ำสุดที่คู่ถูกต้อง: (VaR_c, ES_c) = arg min เหนือ (v,e) ของ E[S_c(v,e;L)] ภายใต้เงื่อนไขที่เกี่ยวข้อง ค่าต่ำสุดมีเพียงจุดเดียว คะแนนเชื่อมข้อมูลว่าผลลัพธ์ข้ามเส้น VaR หรือไม่ เข้ากับผลขาดทุนส่วนหางจริงและพยากรณ์ ES หากนิยามผลขาดทุนเป็นบวก ES ไม่ควรต่ำกว่า VaR
Fissler–Ziegel นำเสนอกลุ่มคะแนน ไม่ใช่สูตรบังคับเพียงสูตรเดียว Patton, Ziegel และ Chen ใช้ผลนี้เพื่อสร้างแบบจำลองและเปรียบเทียบพยากรณ์ VaR–ES แบบพลวัต (Patton, Ziegel, and Chen, 2019) สมาชิกที่ใช้บ่อยตัวหนึ่งคือ FZ0 ซึ่งเขียนด้วย convention ผลตอบแทนส่วนหางล่าง Y = −L, α = 1−c และพยากรณ์ค่าลบ e ≤ v < 0: S_FZ0(Y,v,e;α) = −I{Y ≤ v}(v−Y)/(αe) + v/e + ln(−e) − 1. นิพจน์นี้ขึ้นอยู่กับเครื่องหมายผลตอบแทนและสมมติฐานค่าลบดังกล่าว ห้ามนำไปใช้โดยตรงกับข้อมูลผลขาดทุนบวกทุกชุดหรือคะแนนร่วมทุกชนิด ระบุคะแนนที่เลือกและตรวจสอบว่าสมมติฐานสอดคล้องกับข้อมูลและ convention ของพยากรณ์
อ่านระดับคะแนนและผลต่างอย่างระมัดระวัง
สำหรับแบบจำลอง m คำนวณคะแนนร่วมสำหรับแต่ละคู่พยากรณ์–ผลลัพธ์แล้วหาค่าเฉลี่ย: mean_S_m = (1/T) Σ_t S_c(v_hat(m,t), e_hat(m,t); L_t) เมื่อใช้คะแนน admissible วัน เป้าหมาย และ convention เดียวกัน ค่าเฉลี่ยที่ต่ำกว่าหมายถึงผลสัมพัทธ์ดีกว่าภายใต้กฎนั้น คะแนนไม่ใช่ความน่าจะเป็น จำนวน VaR หรือประมาณการมูลค่าเงินที่สูญเสีย ขนาดตัวเลขขึ้นกับคะแนนที่เลือก
สำหรับการเปรียบเทียบแบบจับคู่ A กับ B ให้สร้าง d_t = S_A,t − S_B,t ค่าเฉลี่ยติดลบสนับสนุน A ภายใต้คะแนนที่เลือก เพราะพยากรณ์ทั้งคู่เผชิญผลลัพธ์เดียวกัน ผลต่างแบบจับคู่จึงให้ข้อมูลมากกว่าการเทียบค่าเฉลี่ยที่ปัดเศษแยกกัน แต่ยังมีความไม่แน่นอน โดยเฉพาะเมื่อมีข้อมูลส่วนหางน้อย
<!-- learn:illustration -->
เปรียบเทียบ forecast origins, พอร์ตโฟลิโอหรือเป้าหมาย, horizon, ระดับความเชื่อมั่น และชุดข้อมูลรุ่นเดียวกัน ต้องบันทึกพยากรณ์ก่อนทราบผล หาก horizon ซ้อนทับหรือผลต่างคะแนนมี serial dependence การคำนวณความไม่แน่นอนต้องสะท้อนความสัมพันธ์นั้น รายงาน standard error หรือช่วงที่เหมาะสม ช่องว่างดิบเล็กน้อยไม่ได้มีความหมายโดยอัตโนมัติ

เหตุใด standalone loss สองตัวจึงใช้แทนไม่ได้
อาจดูเหมือนนำ pinball loss ของ VaR มาบวกกับ absolute difference ระหว่าง ES ที่พยากรณ์กับค่า proxy ได้ แต่พจน์ที่สองอาจไม่ใช่ ES score ที่ถูกต้อง และ weighted sum ตามใจไม่ได้รับประกัน joint consistency คะแนน FZ ถูกออกแบบให้คู่พยากรณ์มุ่งที่ functional VaR–ES พร้อมกัน การเปลี่ยนน้ำหนักหรือ transformation โดยไม่มีคุณสมบัตินี้เปลี่ยนคำถามที่กำลังประเมิน
ในกลุ่ม Fissler–Ziegel มีหลายคะแนนซึ่งไวต่อข้อมูลและมี scale ต่างกัน จึงเทียบผลต่างจากคนละคะแนนโดยตรงไม่ได้ Patton, Ziegel และ Chen กล่าวถึงการออกแบบคะแนนและคุณสมบัติด้าน scale ของ FZ0 ภายใต้สมมติฐานเครื่องหมายเพิ่มเติม แต่ไม่ได้แปลว่า FZ0 ดีที่สุดเสมอ เลือกและเปิดเผยคะแนนก่อนดูอันดับ
คู่พยากรณ์ก็สำคัญ พยากรณ์ ES ที่ดูดีทางตัวเลขอาจไม่เข้ากับ VaR ที่จับคู่กัน ในทางกลับกัน คะแนนร่วมที่ดีไม่ได้พิสูจน์ว่าการแจกแจงแบบมีเงื่อนไขทั้งหมดถูกต้อง คะแนนประเมิน functional ที่ระบุ ภายใต้คะแนนและการออกแบบที่เลือก
จำนวน VaR exception เท่ากันอาจซ่อนผลขาดทุนส่วนหางต่างกัน
ตัวบ่งชี้ VaR exception เป็นแบบทวิภาค: I_t = 1 เมื่อ L_t เกินพยากรณ์ VaR และเป็น 0 เมื่อไม่เกิน สองแบบจำลองอาจมีจำนวนและช่วงเวลา exception เท่ากัน แต่ขนาดผลขาดทุนหลังเกณฑ์ต่างกันมาก การนับ breach สี่ครั้งไม่ได้บอกว่าเกินเพียงเล็กน้อยหรือรุนแรงมาก การนับ hit อย่างเดียวทิ้งข้อมูลความรุนแรงที่ ES ตั้งใจอธิบาย
คะแนนร่วมใช้ threshold และพยากรณ์ ES ร่วมกับผลขาดทุนจริง ขนาดผลขาดทุนส่วนหางจึงอาจส่งผลต่อคะแนนนอกเหนือจากจำนวน hit คะแนนที่เลือกกำหนด contribution ของแต่ละ observation อย่าตัดสินผู้ชนะจากเหตุการณ์สุดขั้วครั้งเดียว ให้คำนวณคะแนนใน common sample ทั้งหมดและตรวจ sensitivity
การใช้คะแนนเพื่อเปรียบเทียบพยากรณ์ไม่ใช่เรื่องเดียวกับการตรวจความถี่ VaR exception คะแนนถามว่าคู่พยากรณ์ใดทำได้ดีกว่าภายใต้กฎเดียวกัน ไม่ใช่ใบรับรอง calibration ครบถ้วน
Exception tests และ ES backtests ถามคนละเรื่อง
การทดสอบ VaR แบบ Kupiec เปรียบเทียบจำนวน exception กับอัตราเป้าหมาย ส่วนส่วนขยายแบบ Christoffersen ยังตรวจ dependence หรือ clustering ด้วย เพราะย่อผลลัพธ์แต่ละรายการเป็น hit หรือ non-hit การทดสอบเหล่านี้จึงไม่วัดขนาดผลขาดทุนเกิน VaR และไม่ตรวจ ES forecast โดยตรง คู่มือ VaR และ Expected Shortfall อธิบายว่าเหตุใดการนับ exception จึงละความรุนแรงของส่วนหาง
Joint scoring ใช้เปรียบเทียบพยากรณ์เชิงสัมพัทธ์ ส่วน backtesting ถามว่าพยากรณ์ calibrated เพียงพอตามขั้นตอนที่ระบุหรือไม่ Acerbi และ Szekely เสนอ nonparametric ES backtests และชี้ว่า elicitability เกี่ยวข้องกับการเลือกแบบจำลอง ไม่ใช่เงื่อนไขก่อนทดสอบมาตรวัดความเสี่ยง (Acerbi and Szekely, 2014) Bayer และ Dimitriadis พัฒนา regression-based ES backtests โดยใช้โครงสร้าง VaR–ES ร่วมกัน แต่แต่ละ variant มีสมมติฐานและข้อกำหนด covariance ของตน (Bayer and Dimitriadis, 2022) อันดับคะแนนไม่ใช่สิ่งทดแทน backtest เฉพาะทาง และการไม่ปฏิเสธสมมติฐานไม่ได้พิสูจน์ว่าพยากรณ์แม่นยำ
วางแผน paired inference และป้องกัน selection leakage
ปฏิบัติต่ออนุกรมเวลาของผลต่างคะแนนเสมือนข้อมูล หากเป็น one-step forecast ที่ไม่ซ้อนทับและสมมติฐาน dependence เหมาะสม อาจใช้ paired test ของค่าเฉลี่ยผลต่าง หากมี serial dependence หรือ horizon ซ้อนทับ ให้ใช้ inference ที่ออกแบบมารองรับ เช่น long-run variance estimate หรือ block resampling ระบุวิธี bandwidth หรือกฎ block แทนการรายงานเพียง p-value
กำหนดคะแนน tail level horizon วันประเมิน และชุดแบบจำลองก่อนดูอันดับ การลองหลายคะแนน หน้าต่าง สินทรัพย์ หรือ forecast variants แล้วรายงานเฉพาะตัวที่ดีที่สุดทำให้เกิด selection effects หากทำได้ให้กันช่วงประเมินภายหลังไว้ และเปิดเผยวิธีคัดตัวเลือก uncertainty ที่รายงานไม่ได้ปรับผลจากการค้นหานี้ให้อัตโนมัติ
รายงานคะแนนเฉลี่ยและผลต่างแบบจับคู่พร้อม uncertainty นิยามคะแนน convention ของ VaR/ES วัน out-of-sample ร่วมกัน และจำนวน observation ส่วนหาง หากอันดับเปลี่ยนภายใต้คะแนนหรือช่วงเวลาที่สมเหตุสมผล ให้แสดง sensitivity
ข้อจำกัดและรายการตรวจสอบสำหรับรายงาน
ระดับความเชื่อมั่นสูงทำให้มี observation ส่วนหางน้อย อันดับแบบจำลองจึงอาจไม่เสถียรแม้มีอนุกรมยาว Conditional heteroskedasticity การเปลี่ยน regime ผลตอบแทนที่ซ้อนทับ estimation error ปัญหาข้อมูล และการเปลี่ยนพอร์ต ล้วนกระทบผลต่างคะแนนได้ Joint elicitability ไม่ได้ลบปัญหาเหล่านี้ แต่ให้คลาสคะแนนที่มีหลักการภายใต้เงื่อนไขทางคณิตศาสตร์
ตรวจว่าผลขาดทุนจริงตรงกับพอร์ต horizon วิธีประเมินมูลค่า และเครื่องหมายของ forecast; VaR และ ES ใช้ tail probability เดียวกัน; forecasts ถูกสร้างก่อนเห็นผล; และคะแนนตรงตามสมมติฐาน รายงานความยาวตัวอย่าง จำนวน tail observations สูตรคะแนน วิธี paired uncertainty และการค้นหา score/model ข้อสรุปมีเงื่อนไขตามการออกแบบนี้
คะแนนร่วมที่ต่ำกว่าเป็นหลักฐานของ predictive performance เชิงสัมพัทธ์ภายใต้ proper scoring rule ที่เลือก ไม่ได้พิสูจน์ว่าแบบจำลองจับเหตุการณ์ส่วนหางทุกครั้ง ประมาณความเสี่ยงได้อย่างปลอดภัย หรือผลอนาคตเหมือนตัวอย่าง นี่คือข้อมูลทางสถิติ ไม่ใช่คำแนะนำการลงทุน
คำถามที่พบบ่อย
Q1เปรียบเทียบพยากรณ์ Expected Shortfall ด้วย absolute error ได้ไหม?
ใช้แทนคะแนน strictly consistent โดยทั่วไปไม่ได้ ES เดี่ยวไม่ elicitable ในคลาสการแจกแจงกว้าง; การเปรียบเทียบ point forecast อย่างมีหลักการมักให้คะแนน ES ร่วมกับ VaR หรือใช้ ES backtest เฉพาะเมื่อต้องการตรวจ calibration
Q2คะแนน VaR–ES ร่วมบอกว่าแบบจำลองความเสี่ยง calibrated หรือไม่?
คะแนนเปรียบเทียบผลเชิงสัมพัทธ์ภายใต้ joint score ที่เลือก Calibration และ misspecification เป็นคนละคำถาม จึงควรใช้ backtests และ diagnostics ที่เหมาะสมด้วย
Q3สองแบบจำลองมี VaR exceptions เท่ากันแต่ได้คะแนนต่างกันได้ไหม?
ได้ hit indicators อาจตรงกันแต่ขนาดผลขาดทุนเกิน VaR หรือพยากรณ์ ES แตกต่างกัน ผลที่แน่นอนขึ้นกับคะแนน
Q4คะแนนต่ำหมายความว่าแบบจำลองปลอดภัยต่อการใช้งานหรือไม่?
ไม่ใช่ เป็นการเปรียบเทียบจากตัวอย่างภายใต้สมมติฐานและคะแนนที่เลือก ข้อมูลส่วนหางมีน้อย การเปลี่ยน regime การเลือกแบบจำลอง หรือปัญหาข้อมูลอาจเปลี่ยนผลได้ ไม่ใช่คำแนะนำการลงทุน
แหล่งข้อมูลและการอ่านเพิ่มเติม
รายงานปัญหา
เราจะเตรียมอีเมลพร้อมลิงก์บทความนี้ Mark จะได้รับรายงานเมื่อคุณส่งอีเมลแล้วเท่านั้น
ตรวจสอบอย่างรวดเร็ว
อ่านคู่มือจบแล้ว ลองตอบคำถาม 3 ข้อ
คำถาม 01
เหตุใดจึงมักให้คะแนน Expected Shortfall ร่วมกับ VaR?
เลือกคำตอบเพื่อดูคำอธิบาย
อภิธานศัพท์ออปชัน
The average loss from a chosen VaR quantile through the worst tail under a precise convention; it measures severity beyond the threshold rather than only its location.
อ่านคู่มือฉบับละเอียดAssignmentThe process that requires an option writer to fulfill the contract after an exercise notice is allocated; it can create or remove an underlying position.
อ่านคู่มือฉบับละเอียดBid-ask spreadThe gap between the best displayed bid and ask, which is a practical trading cost and a signal of how uncertain an immediate fill may be.
อ่านคู่มือฉบับละเอียด