Skip to content
คู่มือออปชันทั้งหมด
การประเมินพยากรณ์ความน่าจะเป็นอ่าน 12 นาที

เปรียบเทียบ Brier score กับ log loss สำหรับการพยากรณ์ความน่าจะเป็น

เปรียบเทียบ Brier score และ log loss สำหรับความน่าจะเป็นแบบทวิภาค เรียนรู้วิธีคำนวณ และทำความเข้าใจ proper scoring การปรับเทียบ และทักษะการพยากรณ์

ในคู่มือนี้อัตราการทายถูกละทิ้งค่าความน่าจะเป็นที่พยากรณ์ไว้

สรุปสั้น

การพยากรณ์ความน่าจะเป็นบอกว่าเหตุการณ์หนึ่งมีโอกาสเกิดขึ้นเพียงใด ไม่ได้บอกเพียงว่าผลลัพธ์ใดมีโอกาสมากที่สุด Brier score และ log loss ใช้เปรียบเทียบความน่าจะเป็นเหล่านั้นกับผลลัพธ์ที่เกิดขึ้นจริง ทั้งคู่เป็น proper scoring rules แต่ลงโทษความผิดพลาดต่างกัน ดังนั้น score ที่ต่ำกว่าจะมีความหมายก็ต่อเมื่อกำหนดเหตุการณ์ กลุ่มตัวอย่าง วิธีคำนวณ และค่ามาตรฐานอ้างอิงไว้แล้ว

อัตราการทายถูกละทิ้งค่าความน่าจะเป็นที่พยากรณ์ไว้

ลองนึกภาพว่าคุณบันทึกว่าโมเดลทาย “ขึ้น” หรือ “ลง” ถูกหรือไม่ อัตราการทายถูกถือว่าการพยากรณ์ที่ถูกต้องด้วยความน่าจะเป็น 51% และ 99% ไม่ต่างกัน และยังถือว่าการพยากรณ์ผิดที่ 49% กับ 1% เหมือนกันด้วย วิธีนี้ทิ้งข้อมูลเรื่องระดับความมั่นใจ ทั้งที่ความมั่นใจอาจสำคัญเมื่อการตัดสินใจมีผลตอบแทนหรือความเสี่ยงต่างกัน

การพยากรณ์ความน่าจะเป็นแบบทวิภาคกำหนดค่า \(p_t\) ระหว่างศูนย์กับหนึ่งให้กับเหตุการณ์ที่นิยามชัดเจน ณ เวลาเริ่มพยากรณ์ \(t\) ต่อมาให้บันทึก \(y_t=1\) เมื่อเหตุการณ์เกิดขึ้น และ \(y_t=0\) เมื่อไม่เกิด scoring rule ประเมินทั้งค่าพยากรณ์และผลลัพธ์ร่วมกัน Brier score ใช้กำลังสองของความคลาดเคลื่อนด้านความน่าจะเป็น ส่วน log loss ใช้ลอการิทึมลบของความน่าจะเป็นที่กำหนดให้ผลลัพธ์ซึ่งเกิดขึ้นจริง

คะแนนเหล่านี้ช่วยเปรียบเทียบการพยากรณ์ความน่าจะเป็น รวมถึงความน่าจะเป็นของเหตุการณ์จากโมเดล trading แต่ไม่ได้แสดงด้วยตัวเองว่าการพยากรณ์ได้รับการปรับเทียบ ดีกว่าค่ามาตรฐานที่สมเหตุสมผล หรือจะทำกำไรเมื่อนำไปซื้อขาย คู่มือ Mincer–Zarnowitz อธิบายการถดถอยเชิงเส้นสำหรับตรวจสอบการปรับเทียบของ point forecast ที่เป็นตัวเลข ซึ่งเป็นอีกแนวทางหนึ่ง

กำหนดเหตุการณ์หนึ่งรายการและจับคู่ทุกค่าพยากรณ์กับผลลัพธ์

ก่อนคำนวณ score ให้กำหนดเหตุการณ์เพื่อให้ตัดสินผลได้อย่างสม่ำเสมอ คำถามว่า “สินทรัพย์จะขึ้นหรือไม่” ยังไม่ครบถ้วนจนกว่าจะระบุสินทรัพย์ แหล่งราคาที่ใช้ เวลาเริ่มและสิ้นสุด สกุลเงิน นิยามผลตอบแทน และวิธีจัดการข้อมูลที่หายไปหรือถูกแก้ไข สำหรับเหตุการณ์เศรษฐกิจ ให้บันทึกประกาศและรุ่นข้อมูลที่ใช้ตัดสินผล อย่าเปรียบเทียบค่าพยากรณ์ที่ประเมินจากนิยามเหตุการณ์หรือชุดวันที่ต่างกัน

เก็บค่าพยากรณ์แต่ละรายการตามที่มีอยู่ ณ เวลาเริ่มต้น การพยากรณ์ความน่าจะเป็นที่เผยแพร่ ณ เวลา \(t\) ต้องใช้เฉพาะข้อมูลที่มีถึง cutoff ที่กำหนด และจับคู่กับผลลัพธ์ใน horizon เดียวกัน ชุดข้อมูลที่แก้ย้อนหลัง ราคาปิดตลาดที่เกิดขึ้นภายหลัง หรือกฎจำแนกที่เลือกหลังจากเห็นผล อาจเปลี่ยน target โดยไม่รู้ตัวหรือนำข้อมูลจากอนาคตเข้ามา

สำหรับ rolling forecast ให้เก็บเวอร์ชันของโมเดล รุ่นของข้อมูลนำเข้า timestamp ความน่าจะเป็น และกฎตัดสินผล ใช้ origin เดียวกันเมื่อเปรียบเทียบโมเดล หากไม่มีค่าความน่าจะเป็น ให้บันทึกเหตุผลที่ตัดออกและใช้กฎตัวอย่างเดียวกันกับทุกตัวเลือก ข้อมูลเหล่านี้ทำให้ score ทำซ้ำได้ แทนที่จะเป็นเพียงสรุปจาก spreadsheet ที่เปลี่ยนแปลงอยู่เสมอ

คำนวณ Brier score จากกำลังสองของความคลาดเคลื่อนด้านความน่าจะเป็น

สำหรับเหตุการณ์ทวิภาคหนึ่งรายการ Brier loss ของกรณี \(t\) คือ

BSₜ = (pₜ − yₜ)²

ค่าเฉลี่ย Brier score จากการพยากรณ์ \(n\) รายการคือ

BS = (1/n) Σₜ (pₜ − yₜ)²

ค่ายิ่งต่ำยิ่งดี ศูนย์คือสมบูรณ์แบบ และนิยามแบบเหตุการณ์เดียวนี้มีค่าตั้งแต่ศูนย์ถึงหนึ่ง ตัวอย่างเช่น หากพยากรณ์ \(p=0.70\) และเหตุการณ์เกิดขึ้น loss คือ \((0.70-1)^2=0.09\) หากเหตุการณ์ไม่เกิดหลังการพยากรณ์เดียวกัน loss คือ \((0.70-0)^2=0.49\) ความผิดพลาดที่เกิดจากความมั่นใจสูงมีต้นทุนมากกว่าความผิดพลาดเล็กน้อย แต่โทษยังมีขอบเขต

ตรวจสอบสูตรเมื่อเปรียบเทียบตัวเลขที่เผยแพร่ บางนิยามรวมกำลังสองของความผิดพลาดทุกหมวดหมู่ในค่าพยากรณ์แบบหลายผลลัพธ์ สำหรับกรณีทวิภาค ผลรวมแบบเวกเตอร์อาจเป็นสองเท่าของ loss แบบเหตุการณ์เดียวข้างต้น การคูณทุก score ด้วยสองไม่เปลี่ยนลำดับในเหตุการณ์เดียวกัน แต่ค่าตัวเลขของแต่ละนิยามเทียบกันไม่ได้หากไม่ระบุมาตราส่วน

คำนวณ log loss และดูว่าเหตุใดความผิดพลาดรุนแรงจึงมีน้ำหนักมาก

สำหรับเหตุการณ์ทวิภาค log loss คือ

LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]

หากเหตุการณ์เกิดขึ้น loss คือ \(-\log(p_t)\) หากไม่เกิด loss คือ \(-\log(1-p_t)\) ดังนั้นการพยากรณ์ 70% ที่ถูกต้องจะได้ \(-\log(0.70)\approx0.357\) ส่วนการพยากรณ์ 70% เดียวกันที่ผิดจะได้ \(-\log(0.30)\approx1.204\) ค่าเฉลี่ย log loss คือค่าเฉลี่ยของโทษในแต่ละกรณี และไม่มีขอบเขตบนตายตัวเมื่อค่าพยากรณ์กำหนดความน่าจะเป็นเกือบศูนย์ให้กับเหตุการณ์ที่เกิดขึ้นจริง

เมื่อ \(p=0\) หรือ \(p=1\) ค่าพยากรณ์ที่มั่นใจเต็มที่แต่ผิดจะมี log loss เป็นอนันต์ หาก software จำกัดความน่าจะเป็นไม่ให้ต่ำกว่าค่าขั้นต่ำเล็ก ๆ เช่น \(\varepsilon\) เพื่อหลีกเลี่ยงค่าอนันต์ ให้รายงานค่าขั้นต่ำนี้และใช้สม่ำเสมอก่อนเห็นผล clipping เปลี่ยนกฎประเมินเชิงตัวเลข จึงไม่ควรซ่อนเป็นรายละเอียดการทำความสะอาดข้อมูล

Brier score และ log loss อาจจัดลำดับค่าพยากรณ์ชุดเดียวกันต่างกัน เพราะเส้นโค้งการลงโทษต่างกัน log loss ลงโทษหนักเป็นพิเศษเมื่อให้ความน่าจะเป็นเกือบศูนย์กับเหตุการณ์ที่เกิดขึ้น ส่วน Brier loss แบบทวิภาคมีค่าสูงสุดหนึ่ง กำหนดล่วงหน้าว่าจะใช้ score ใด หากการตัดสินใจขึ้นกับความน่าจะเป็นสุดขั้ว อาจแสดงทั้งสองค่าแทนการเลือกผลที่ดูดีกว่าภายหลัง

<!-- learn:illustration -->

หยดแก้วสีน้ำเงินอยู่ตรงข้ามหินสีอำพันที่แทนผลลัพธ์ โดยมีคำพยากรณ์ที่มั่นใจมากหนึ่งรายการอยู่ห่างจากเหตุการณ์ที่เกิดขึ้น
ภาพแนวคิดของความน่าจะเป็นและผลลัพธ์จริง ซึ่งแสดงโทษที่ต่างกันสำหรับการพลาดอย่างมั่นใจ ไม่ใช่ข้อมูลตลาด ผลทดสอบ หรือสัญญาณซื้อขาย

Proper scoring ให้รางวัลแก่ความน่าจะเป็นที่ซื่อตรงในเชิงค่าคาดหมาย

score เป็น proper เมื่อผู้พยากรณ์ได้รางวัลคาดหมายสูงสุดหรือ loss คาดหมายต่ำสุดจากการรายงานความน่าจะเป็นที่ตนเชื่อจริง หากค่าที่ซื่อตรงนั้นเป็นค่าที่เหมาะสมที่สุดเพียงค่าเดียว score จะเป็น strictly proper ตามนิยามทั่วไป Brier และ logarithmic score เป็น strictly proper สำหรับการพยากรณ์ความน่าจะเป็นแบบทวิภาค (Gneiting และ Raftery, 2007) นี่เป็นเหตุผลเชิงหลักการให้ประเมินความน่าจะเป็น แทนการเปลี่ยนเป็นป้ายกำกับแบบตายตัวก่อน

คำว่า “proper” เป็นคุณสมบัติในเชิงค่าคาดหมาย ไม่ใช่คำรับประกันสำหรับทุกตัวอย่างที่สังเกตได้ ผู้พยากรณ์ที่รายงานความน่าจะเป็น 70% อย่างซื่อตรงยังอาจผิดในกรณีหนึ่ง และได้ score ในตัวอย่างจำกัดแย่กว่าคนที่เดา การเรียนรู้ประสิทธิภาพเฉลี่ยต้องอาศัยค่าพยากรณ์ที่เกิดซ้ำและเปรียบเทียบกันได้ แรงจูงใจก็สำคัญ หากมี payoff rule แยกต่างหาก score เพียงอย่างเดียวไม่รับประกันว่าความน่าจะเป็นที่รายงานสะท้อนความเชื่อของบุคคล

ไม่มี score ใดวัดการปรับเทียบเพียงอย่างเดียว ค่ารวมอาจผสมทั้งความใกล้เคียงของความน่าจะเป็นกับความถี่ที่สังเกตได้ และความสามารถในการแยกกรณีที่มีผลลัพธ์ต่างกัน โมเดลอาจให้ค่าพยากรณ์ที่คมชัดแต่ยังปรับเทียบผิดอย่างเป็นระบบ ส่วนโมเดลที่รายงาน base rate ตลอดเวลาอาจปรับเทียบได้ในภาพรวม แต่ให้ข้อมูลเฉพาะกรณีน้อย

อ่าน Brier decomposition ผ่าน reliability, resolution และ uncertainty

Murphy decomposition แบ่ง Brier score เฉลี่ยออกเป็นสามพจน์ (Murphy, 1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)):

BS = reliability − resolution + uncertainty

สำหรับกลุ่ม \(k\) ของค่าพยากรณ์ที่มีความน่าจะเป็นใกล้เคียงกัน ให้ \(w_k\) เป็นสัดส่วนตัวอย่างของแต่ละกลุ่ม, \(\bar p_k\) เป็นความน่าจะเป็นพยากรณ์เฉลี่ย, \(\bar y_k\) เป็นความถี่เหตุการณ์ที่สังเกตได้ และ \(\bar y\) เป็นความถี่เหตุการณ์รวม องค์ประกอบแบบแบ่ง bin คือ

reliability = Σₖ wₖ(̅pₖ − ̅yₖ)² resolution = Σₖ wₖ(̅yₖ − ̅y)² uncertainty = ̅y(1 − ̅y)

reliability error ยิ่งต่ำยิ่งดี ค่าพยากรณ์ในกลุ่มควรสอดคล้องกับความถี่ที่สังเกตได้ในกลุ่มนั้น resolution ยิ่งสูงยิ่งดี ความถี่เหตุการณ์แต่ละกลุ่มควรต่างจาก base rate โดยรวม uncertainty แสดงความถี่ที่เหตุการณ์เกิดในตัวอย่าง และไม่ใช่ผลงานของโมเดลพยากรณ์ decomposition นี้อธิบายได้ว่าทำไมสองโมเดลมี Brier score เท่ากันแต่มีจุดแข็งต่างกัน

decomposition เชิงประจักษ์มีความ exact เมื่อจัดกลุ่มกรณีที่มีความน่าจะเป็นซึ่งประกาศไว้เหมือนกัน หากแบ่งความน่าจะเป็นต่อเนื่องเป็น bin decomposition จะ exact สำหรับค่าพยากรณ์ที่ถูกรวมกลุ่มแล้ว ไม่ใช่สำหรับความแตกต่างของค่าความน่าจะเป็นเดิมที่หายไปภายใน bin การจัดกลุ่มต้องเลือกขอบเขต bin reliability diagram ที่มีสิบ bin กว้างเท่ากันอาจให้ภาพต่างจาก bin แบบ quantile โดยเฉพาะในตัวอย่างเล็กหรือบริเวณปลายสุดของช่วงความน่าจะเป็น แสดงจำนวนกรณีและ uncertainty ของแต่ละ bin และใช้ decomposition เป็นเครื่องมือวินิจฉัย ไม่ใช่วิธีลบ sampling error กราฟ calibration ไม่ใช่หลักฐานอิสระว่าการพยากรณ์ในอนาคตจะน่าเชื่อถือ

เลือกค่ามาตรฐานอ้างอิงก่อนเรียก score ว่าเป็น skill

raw score ที่ต่ำกว่าโมเดลอื่นเป็นการเปรียบเทียบ แต่ยังไม่ใช่การปรับปรุงเมื่อเทียบกับ baseline ที่มีประโยชน์ Brier skill score เปรียบเทียบระบบพยากรณ์กับค่าพยากรณ์อ้างอิงที่ระบุชื่อไว้:

BSS = 1 − BS_model / BS_reference

ตามนิยามนี้ ค่า 0 เท่ากับ reference ค่าบวกแสดงว่าดีขึ้น และค่าลบแสดงว่าผลแย่ลง ค่า 1 หมายถึง Brier loss ของโมเดลเป็นศูนย์เมื่อ reference loss เป็นบวก เลือก reference ให้เหมาะกับการตัดสินใจและชุดข้อมูลที่มี อาจใช้ base rate ในอดีตแบบคงที่ ความถี่เหตุการณ์ในช่วงฝึก หรือกระบวนการพยากรณ์ที่ใช้อยู่แล้วตามลักษณะงาน

อย่าคำนวณ reference จากผลประเมินในอนาคต หากผลนั้นยังไม่พร้อมใช้ตอนสร้างค่าพยากรณ์ สำหรับอนุกรมเวลา ความถี่ในอดีตแบบ expanding หรือ rolling อาจเป็น baseline สำหรับใช้งานจริงที่เหมาะกว่าความถี่จากทั้งตัวอย่าง หาก reference score เป็นศูนย์ อัตราส่วนจะไม่มีนิยาม ให้ระบุวิธีสร้าง benchmark และรายงาน raw score ของโมเดลกับ reference ควบคู่กัน

Brier skill score ขึ้นกับ reference และความถี่ของเหตุการณ์ score ที่เทียบกับค่าพยากรณ์ base rate แบบไม่มีเงื่อนไขตอบคำถามคนละข้อกับ score ที่เทียบกับ production model ปัจจุบัน อย่าเปรียบเทียบค่า BSS ข้ามงานวิจัยโดยไม่ตรวจสอบนิยามเหตุการณ์ reference forecast ช่วงตัวอย่าง และวิธีคำนวณแบบทวิภาคหรือหลายหมวดหมู่

เปรียบเทียบโมเดลจากผล out-of-sample ที่จับคู่กัน

สร้างค่าความน่าจะเป็นตามลำดับเวลาและกันช่วงประเมินผลที่ไม่ได้ใช้ปรับโมเดล เลือก feature หรือเลือก threshold ประเมินทุกโมเดลจากผลลัพธ์และ origin ชุดเดียวกัน สำหรับ loss ที่เลือก ให้กำหนด paired difference ดังนี้

dₜ = Lₐ,ₜ − Lᵦ,ₜ

ภายใต้เครื่องหมายนี้ ค่าเฉลี่ยเป็นบวกหมายถึงโมเดล B มีค่าเฉลี่ย loss ต่ำกว่า กรอบ Diebold–Mariano ใช้ทดสอบความแตกต่างของค่าเฉลี่ย loss ได้เมื่อสมมติฐานเรื่องการเปรียบเทียบพยากรณ์และการประมาณ variance เหมาะกับการออกแบบ หากต้องการทราบว่า relative score เปลี่ยนตามเงื่อนไขที่รู้ ณ เวลาพยากรณ์หรือไม่ คู่มือ Giacomini–White อธิบายการเปรียบเทียบแบบมีเงื่อนไข origin ที่ซ้ำกัน ช่วงเหตุการณ์ที่ทับซ้อน และการค้นหาโมเดลอาจทำให้ความแตกต่างพึ่งพากันหรือถูกคัดเลือก standard error แบบง่ายหรือ p-value เดียวที่ไม่ปรับแก้อาจทำให้หลักฐานดูหนักแน่นเกินจริง

กำหนดเหตุการณ์ horizon ตัวอย่าง primary score benchmark และทิศทางการเปรียบเทียบก่อนดูผล รายงานค่าเฉลี่ย Brier และ log loss ขนาดตัวอย่าง นิยามโมเดลกับ reference กฎ clipping ความน่าจะเป็น และการปรับแก้สำหรับ dependence หรือ model search กราฟ reliability และ paired score difference ที่แสดงควบคู่กับค่ารวมช่วยอธิบายสิ่งที่เปลี่ยน วิธี forecast combination รวมค่าพยากรณ์ได้ แต่ต้องประเมิน combination สุดท้ายบนข้อมูลที่ไม่ได้ใช้เลือก combination นั้นด้วย

score เหล่านี้ไม่มีหน่วยร่วมกัน ความต่างของ Brier ที่ 0.01 ไม่เท่ากับความต่างของ log loss ที่ 0.01 โดยตรง score ที่ต่ำกว่าก็ไม่ได้พิสูจน์ว่าโมเดลความน่าจะเป็นพื้นฐานถูกต้อง แต่เป็นหลักฐานเกี่ยวกับค่าพยากรณ์ที่ประเมินกับผลลัพธ์ตามที่ระบุไว้

แยกคุณภาพการพยากรณ์ออกจากกำไรจากการซื้อขาย

ความน่าจะเป็นช่วยการตัดสินใจซื้อขายได้ผ่านกฎที่แปลงค่าเป็นการกระทำเท่านั้น การตัดสินใจยังขึ้นกับขนาด payoff ความเสียหายเมื่อผิด ราคาที่ส่งคำสั่งได้จริง spread ค่าคอมมิชชัน slippage funding ค่า borrow ข้อจำกัดเงินทุน และเวลาที่นำค่าพยากรณ์ไปซื้อขายได้ proper score ประเมินการพยากรณ์ความน่าจะเป็น ไม่ได้รวมต้นทุนเหล่านี้หรือเลือกขนาด position

โมเดลอาจทำให้ค่าเฉลี่ย log loss ดีขึ้นแต่ไม่ทำให้กฎซื้อขายเฉพาะดีขึ้น เพราะกฎนั้นอาจซื้อขายเฉพาะช่วงความน่าจะเป็นหนึ่งหรือใช้ horizon ต่างกัน ในทางกลับกัน สัญญาณตัดสินใจที่มีประโยชน์อาจกระจุกอยู่ในกรณีจำนวนน้อยและมีผลต่อ score โดยรวมน้อย หลังประเมินค่าพยากรณ์แล้ว ให้ประเมินกฎตัดสินใจที่กำหนดไว้ล่วงหน้าแยกต่างหากบนวันที่ไม่ได้ใช้เลือกกฎนั้น โดยใช้ net return ที่สมจริงและค่าประมาณ uncertainty

รายงานที่เพียงพอช่วยให้นักวิจัยคนอื่นทำซ้ำการกำหนดเหตุการณ์ ความน่าจะเป็น ผลลัพธ์ สูตรและ convention ของ score ค่าอ้างอิง ตัวอย่าง และเวลาประเมินได้ ระบุว่าความน่าจะเป็นเป็น out-of-sample หรือไม่ ผลลัพธ์ทับซ้อนกันหรือไม่ จัดการกรณีที่หายไปอย่างไร และทดลองโมเดลหรือ scoring choice อื่นกี่แบบ วินัยนี้ทำให้ forecast score มีประโยชน์โดยไม่กลายเป็นคำกล่าวอ้างเรื่องกำไรในอนาคต

คำถามที่พบบ่อย

Q1Brier score ที่ต่ำกว่าดีกว่าเสมอหรือไม่?

ดีกว่าเมื่อใช้นิยามเหตุการณ์ ตัวอย่าง scoring convention และการเข้ารหัสผลลัพธ์แบบเดียวกัน score จากเหตุการณ์หรือ convention แบบหลายหมวดหมู่ต่างกันอาจเปรียบเทียบโดยตรงไม่ได้

Q2Brier score ที่ดีพิสูจน์ว่าความน่าจะเป็นปรับเทียบแล้วหรือไม่?

ไม่ Brier score โดยรวมรวม reliability, resolution และ uncertainty ของเหตุการณ์ไว้ด้วย ควรดูการวินิจฉัย calibration และ uncertainty ของตัวอย่างด้วย

Q3ควรใช้ Brier score หรือ log loss?

เลือกก่อนประเมินผล Brier loss มีขอบเขตและใช้กำลังสองของความคลาดเคลื่อนด้านความน่าจะเป็น ส่วน log loss ลงโทษความน่าจะเป็นที่ผิดและระบุด้วยความมั่นใจสูงมากกว่า การเลือกขึ้นกับผลเสียของงานและความไวที่ต้องการ

Q4probability score ที่ดีขึ้นหมายถึงกลยุทธ์ซื้อขายมีกำไรหรือไม่?

ไม่ score ประเมินค่าพยากรณ์ ไม่ใช่การตัดสินใจหลังพิจารณา payoff ต้นทุนซื้อขาย เงินทุน ขนาด position และการเลือกโมเดล งานวิจัยต้นฉบับ - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)

แหล่งข้อมูลและการอ่านเพิ่มเติม

รายงานปัญหา

เราจะเตรียมอีเมลพร้อมลิงก์บทความนี้ Mark จะได้รับรายงานเมื่อคุณส่งอีเมลแล้วเท่านั้น

ตรวจสอบอย่างรวดเร็ว

อ่านคู่มือจบแล้ว ลองตอบคำถาม 3 ข้อ

คำถาม 1 / 3

คำถาม 01

เหตุการณ์ทวิภาคเกิดขึ้นหลังจากพยากรณ์ไว้ 70% Brier loss ตามนิยามเหตุการณ์เดียวเป็นเท่าใด?

เลือกคำตอบเพื่อดูคำอธิบาย

อภิธานศัพท์ออปชัน

การประเมินการพยากรณ์การถดถอย Mincer–Zarnowitz: ทดสอบอคติและการปรับเทียบของการพยากรณ์เรียนรู้ว่าการถดถอย Mincer–Zarnowitz ทดสอบจุดตัดแกนและสเกลของการพยากรณ์อย่างไร เหตุใดค่าคลาดเคลื่อนเฉลี่ยเป็นศูนย์จึงไม่ได้แปลว่าปรับเทียบแล้ว และการทดสอบนี้พิสูจน์อะไรไม่ได้บ้างการประเมินพยากรณ์การทดสอบ Diebold–Mariano: วิธีเปรียบเทียบความแม่นยำของพยากรณ์เรียนรู้ว่าการทดสอบ Diebold–Mariano เปรียบเทียบค่าความสูญเสียของพยากรณ์แบบจับคู่และจัดการกับช่วงพยากรณ์ที่ซ้อนทับกันอย่างไร รวมถึงเหตุใดค่า p ที่ต่ำจึงไม่ได้พิสูจน์ทักษะการเทรดการทดสอบการพยากรณ์การทดสอบ Giacomini–White: ความแม่นยำของการพยากรณ์แบบมีเงื่อนไขเรียนรู้ว่าการทดสอบ Giacomini–White ตรวจสอบความแม่นยำของการพยากรณ์เมื่อทราบเงื่อนไขได้อย่างไร วิธีเลือกตัวแปรเครื่องมือ และผลทดสอบบอกอะไรได้บ้างการเปรียบเทียบโมเดลพยากรณ์Model Confidence Set (MCS): เปรียบเทียบโมเดลพยากรณ์โดยไม่บังคับเลือกผู้ชนะเรียนรู้ว่า Model Confidence Set ใช้การทดสอบแบบลำดับและ bootstrap สำหรับข้อมูลที่มีการพึ่งพากัน เพื่อคงโมเดลพยากรณ์ที่หลักฐานยังแยกความแตกต่างไม่ได้อย่างไรพื้นฐานของออปชันin the money, at the money และ out of the money หมายถึงอะไรเรียนรู้ว่าป้ายกำกับ in-the-money, at-the-money และ out-of-the-money ใช้กับคอลและพุตอย่างไร พร้อมตัวอย่างมูลค่าในตัวและจุดคุ้มทุน