การแปลงอินทิกรัลความน่าจะเป็น: การปรับเทียบการพยากรณ์ความหนาแน่น
เรียนรู้ว่า PIT ใช้ประเมินการพยากรณ์ความหนาแน่นแบบต่อเนื่องและไม่ต่อเนื่องอย่างไร ฮิสโตแกรมบอกอะไรได้บ้าง และเหตุใดความสม่ำเสมอเพียงอย่างเดียวจึงไม่พอ
ในคู่มือนี้เหตุใดการพยากรณ์ความหนาแน่นจึงต้องดูมากกว่าความคลาดเคลื่อนจุดเดียว
สรุปสั้น
การพยากรณ์ความหนาแน่นกำหนดความน่าจะเป็นให้ช่วงผลลัพธ์ที่เป็นไปได้ การแปลงอินทิกรัลความน่าจะเป็น (PIT) แปลงผลลัพธ์ที่สังเกตได้แต่ละครั้งเป็นความน่าจะเป็นสะสมตามการพยากรณ์ ค่า PIT ที่มีการแจกแจงสม่ำเสมอเป็นเครื่องมือวินิจฉัยที่มีประโยชน์ภายใต้สมมติฐานที่ระบุ แต่ฮิสโตแกรมที่ดูแบนไม่ได้พิสูจน์การปรับเทียบแบบมีเงื่อนไขหรือความเป็นอิสระตามเวลา
เหตุใดการพยากรณ์ความหนาแน่นจึงต้องดูมากกว่าความคลาดเคลื่อนจุดเดียว
การพยากรณ์แบบจุดอาจคาดการณ์ผลตอบแทนวันพรุ่งนี้ที่ 0.2% ส่วนการพยากรณ์ความหนาแน่นกำหนดความน่าจะเป็นตลอดช่วงผลตอบแทน ตั้งแต่การเคลื่อนไหวปกติไปจนถึงเหตุการณ์สุดโต่ง การประเมินจึงถามว่าการแจกแจงที่ออกก่อนเห็นผลสอดคล้องกับสิ่งที่เกิดขึ้นภายหลังหรือไม่ คู่มือ Mincer–Zarnowitz กล่าวถึงการปรับเทียบเชิงเส้นของการพยากรณ์จุดเชิงตัวเลข ซึ่งเป็นคนละคำถาม
PIT วัดความน่าจะเป็นสะสมที่การพยากรณ์กำหนดให้ค่าที่ไม่เกินผลจริง นี่คืออันดับเชิงความน่าจะเป็น ไม่ใช่ผลตอบแทน สัญญาณซื้อขาย หรือมาตรวัดกำไร คู่มือ Diebold–Mariano เปรียบเทียบค่าความสูญเสียเฉลี่ยของการพยากรณ์ภายใต้คะแนนที่เลือก ซึ่งต่างจากการตรวจสอบการปรับเทียบความหนาแน่น
แปลงการพยากรณ์ต่อเนื่องด้วยฟังก์ชันการแจกแจงสะสม
ให้ (Y_{t+1}) เป็นผลลัพธ์หลังจุดเริ่มพยากรณ์ (t) และ (F_{t+1}(y\mid\mathcal I_t)) เป็นฟังก์ชันการแจกแจงสะสม (CDF) ที่พยากรณ์จากข้อมูล (\mathcal I_t) ซึ่งมี ณ เวลานั้น สำหรับการแจกแจงต่อเนื่อง คำนวณ
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ)
CDF คือความน่าจะเป็นของค่าที่ไม่เกิน (y) หาก CDF ที่พยากรณ์คือการแจกแจงแบบมีเงื่อนไขที่แท้จริง ทฤษฎีบท PIT ให้ผลว่า
Pr(Uₜ₊₁ ≤ u | 𝓘ₜ) = u, for 0 ≤ u ≤ 1
ดังนั้นการพยากรณ์ต่อเนื่องหนึ่งขั้นที่เหมาะสมให้ PIT ซึ่งสม่ำเสมอเมื่อมีเงื่อนไขบนข้อมูลการพยากรณ์ ในลำดับเวลาที่ชุดข้อมูลรวมอดีตไว้ PIT ในอุดมคติยังเป็นอิสระระหว่างจุดเริ่มภายใต้สมมติฐานที่เหมาะสม Rosenblatt ศึกษาการแปลงนี้ ส่วน Diebold, Gunther และ Tay ประยุกต์ลำดับ PIT เพื่อประเมินการพยากรณ์ความหนาแน่น (1952; 1998)
ตัวอย่างตรวจด้วยมือ: หากการพยากรณ์คือ (N(0,1)) และสังเกต (y=1) จะได้ PIT เท่ากับ (Phi(1)\approx0.8413) หรือการพยากรณ์กำหนดความน่าจะเป็นราว 84.13% ให้ค่าถึง 1 ค่าหนึ่งครั้งไม่บอกว่ามีการปรับเทียบหรือไม่ ต้องมีลำดับข้อมูล
สุ่มการแปลงเมื่อผลลัพธ์ไม่ต่อเนื่อง
CDF แบบไม่ต่อเนื่องมีจุดกระโดดที่ผลลัพธ์ที่เป็นไปได้ ดังนั้นค่า (F(Y)) ปกติจึงมีได้เพียงบางระดับและโดยทั่วไปไม่สม่ำเสมอ แม้การพยากรณ์จะถูกต้อง PIT แบบสุ่มเติมแต่ละช่วงกระโดด:
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ) + Vₜ₊₁ [Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ) − Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ)]
(F(y^-)) คือขีดจำกัดทางซ้าย หรือความน่าจะเป็นของค่าที่น้อยกว่า (y) อย่างเคร่งครัด ส่วน (V) เป็นตัวแปร Uniform(0,1) อิสระที่ใช้สำหรับการประเมินเท่านั้น หากการแจกแจงต่อเนื่อง ช่วงกระโดดเป็นศูนย์และสมการลดรูปเป็น (F(Y)) Brockwell พิสูจน์การแปลงสุ่มสำหรับการแจกแจงทั่วไป รวมถึงแบบไม่ต่อเนื่องและแบบผสม (2007) สำหรับข้อมูลนับที่มีลำดับ Czado, Gneiting และ Held ยังอภิปราย PIT ที่ไม่สุ่มและแผนภาพการปรับเทียบเชิงชายขอบ อย่าประเมินค่า (F(Y)) แบบไม่ต่อเนื่องราวกับเป็นแบบต่อเนื่องสม่ำเสมอ (2009)
ตัวอย่าง Bernoulli สมมติ: (P(Y=1)=0.20) และ (P(Y=0)=0.80) PIT ปกติเป็น 0.80 เมื่อ (Y=0) และ 1.00 เมื่อ (Y=1) จึงไม่สม่ำเสมอ เมื่อสุ่ม ค่า (Y=0) ให้ (0.80V) ในช่วง ([0,0.80]) ส่วน (Y=1) ให้ (0.80+0.20V) ในช่วง ([0.80,1]) เมื่อถ่วงด้วยความน่าจะเป็นของแต่ละเหตุการณ์ ความหนาแน่นรวมจะสม่ำเสมอบน ([0,1]) การสุ่มเป็นเครื่องมือประเมิน ไม่ใช่ส่วนหนึ่งของการพยากรณ์
แยกความสม่ำเสมอเชิงขอบ ความเป็นอิสระ และการปรับเทียบแบบมีเงื่อนไข
การแจกแจง PIT เชิงขอบที่สม่ำเสมอเป็นเงื่อนไขจำเป็นสำหรับการพยากรณ์ต่อเนื่องในอุดมคติ แต่ไม่เพียงพอ ข้อผิดพลาดทิศตรงข้ามในแต่ละระบอบอาจหักล้างกันเมื่อรวมข้อมูลจนฮิสโตแกรมดูแบน Gneiting, Balabdaoui และ Raftery แสดงว่าค่า PIT ที่เกือบสม่ำเสมออาจอยู่ร่วมกับการพยากรณ์รายรายการที่มีอคติ (2007)
ลำดับเวลาก็สำคัญ อนุกรมอาจมีฮิสโตแกรมสม่ำเสมอแต่ยังมีการพึ่งพาตามเวลา เช่น การกระจุกตัวหรือช่วงยาวของค่าคล้ายกัน การพยากรณ์แบบมีเงื่อนไขในอุดมคติมีนัยมากกว่าความสม่ำเสมอเมื่อรวมข้อมูล หากขอบฟ้าซ้อนทับกัน การแจกแจงอ้างอิงต้องสะท้อนการซ้อนนั้น การทดสอบ iid จึงไม่ได้เหมาะโดยอัตโนมัติ
ตรวจสอบการแจกแจง PIT และความเกี่ยวข้องกับเวลา ค่า lag ตัวแปร ณ จุดเริ่ม และระบอบที่กำหนดล่วงหน้า กราฟแยกกลุ่มหรือการทดสอบแบบมีเงื่อนไขอาจเผยรูปแบบที่ซ่อนอยู่ แต่การเลือกกลุ่มและข้อจำกัดของตัวอย่างยังสำคัญ ไม่มีชุดการทดสอบจำกัดใดพิสูจน์การปรับเทียบต่อทุกตัวแปรเงื่อนไขที่เป็นไปได้
อ่านฮิสโตแกรม PIT เป็นเบาะแส ไม่ใช่คำตัดสิน
รูปตัว U มักสอดคล้องกับการพยากรณ์ที่กระจุกเกินไปหรือมีการกระจายต่ำ ส่วนยอดกลางมักสอดคล้องกับการพยากรณ์ที่กระจายกว้างเกินไป ความไม่สมมาตรซ้ายขวาอาจบ่งชี้อคติตำแหน่ง นี่เป็นเพียงแนวทาง ไม่ใช่การวินิจฉัยเฉพาะหนึ่งเดียว การพึ่งพา การผสมระบอบ ผลลัพธ์ไม่ต่อเนื่อง การแบ่ง bin และตัวอย่างเล็กอาจทำให้เข้าใจผิด
ฮิสโตแกรมทิ้งลำดับเวลา จึงไม่บอกว่าปัญหาเริ่มเมื่อใด ค่ามากกระจุกตัวหรือไม่ หรือมีกลุ่มย่อยใดปรับเทียบผิด bin กว้างอาจทำให้ข้อมูลน้อยดูแบน ขณะที่ bin แคบอาจดูไม่สม่ำเสมอจาก noise รายงานจำนวนการพยากรณ์ ขอบเขต bin และความไม่แน่นอนเมื่อทำได้ แนวทาง Diebold–Gunther–Tay และ Berkowitz เป็นตัวอย่างการทดสอบที่ต้องจับคู่สมมติฐานกับการออกแบบ Berkowitz แปลง PIT ภายในเป็น (Z_t=\Phi^{-1}(U_t)) แล้วทดสอบสมมติฐานศูนย์ร่วมของค่าปกติมาตรฐานอิสระเทียบกับทางเลือกเชิงพลวัตที่ระบุ เช่น AR(1) นี่ไม่ใช่ใบรับรองสากล (2001)
<!-- learn:illustration -->

คำนึงถึงการประมาณค่าและประเมินนอกตัวอย่าง
ผลเรื่องความสม่ำเสมอสมมติว่า CDF เป็นกฎแบบมีเงื่อนไขที่แท้จริง ในทางปฏิบัติ เราประมาณพารามิเตอร์ เลือกตระกูลการแจกแจง และอาจปรับ threshold หรือตัวแปร ดังนั้น (F_{t+1}(\cdot;\hat\theta_t)) เป็นส่วนหนึ่งของกระบวนการพยากรณ์ การใช้ผลในช่วงประเมินเพื่อปรับแบบจำลอง แล้วเรียก PIT ว่าหลักฐานนอกตัวอย่างที่ไม่เคยแตะต้อง เป็นการรั่วไหลของข้อมูล
ในการประเมินแบบ rolling ให้ใช้เฉพาะข้อมูลที่มี ณ จุดเริ่มแต่ละครั้ง บันทึกหน้าต่างประมาณค่า ความถี่ในการประมาณใหม่ รุ่นข้อมูล รุ่นโมเดล และขั้นตอนคัดเลือก หน้าต่างที่ติดกันมักใช้ข้อมูลร่วมกัน ส่วนผลลัพธ์ที่ซ้อนทับเพิ่มการพึ่งพา
ขนาดและกำลังการทดสอบขึ้นกับตัวประมาณ ขนาดตัวอย่าง และขั้นตอน ฮิสโตแกรม PIT ไม่รองรับความไม่แน่นอนของพารามิเตอร์ และค่าอ้างอิง iid ในตำราไม่ได้ใช้ได้กับทุกแบบจำลองที่ประมาณหรือซ้อนทับ หากต้องการอนุมานที่สำคัญ ให้ใช้การทดสอบที่เหมาะหรือจำลอง/bootstrap ภายใต้สมมติฐานศูนย์โดยทำซ้ำขั้นตอนประมาณค่าและพยากรณ์ทั้งหมด หากคำถามวิจัยต้องการ ให้กันตัวอย่างประเมินสุดท้ายออกจากการเลือกแบบจำลอง
แยกการปรับเทียบออกจากความคมชัด
การปรับเทียบพิจารณาความสัมพันธ์ระหว่างการพยากรณ์กับผลจริง: เหตุการณ์ที่กำหนดความน่าจะเป็นไว้เกิดขึ้นในอัตรานั้นหรือไม่ ความคมชัดอธิบายการกระจุกตัวของการแจกแจงพยากรณ์โดยไม่ดูผล Gneiting, Balabdaoui และ Raftery มองว่าความคมชัดเป็นสิ่งพึงประสงค์ภายใต้เงื่อนไขว่ามีการปรับเทียบ ไม่ใช่สิ่งทดแทน
การพยากรณ์กว้างอาจปรับเทียบได้แต่ให้ข้อมูลน้อย ส่วนการพยากรณ์แคบอาจดูแม่นยำแต่ปรับเทียบผิดหากผลจริงหลุดจากมวลความน่าจะเป็นบ่อยครั้ง PIT ตรวจความสอดคล้องของการแจกแจง ส่วนตัวชี้วัดความคมชัดสรุปการกระจายหรือความกว้าง การรายงานเพียงอย่างเดียวทำให้การประเมินขาดส่วนหนึ่ง
PIT รวมที่แบนอาจซ่อนข้อผิดพลาดตามระบอบความผันผวนหรือขอบฟ้า กำหนดเงื่อนไขสำคัญไว้ล่วงหน้า ประเด็นนี้เกี่ยวข้องแต่ต่างจากการถดถอยพยากรณ์แบบจุดและ การทดสอบความสามารถพยากรณ์แบบมีเงื่อนไขของ Giacomini–White ซึ่งเปรียบเทียบการสูญเสียโดยมีเงื่อนไขตามข้อมูลที่เลือก
เปรียบเทียบการพยากรณ์เต็มรูปด้วย proper score บนผลลัพธ์เดียวกัน
PIT เป็นเครื่องมือวินิจฉัยเป็นหลัก ไม่ใช่ตัวจัดอันดับการพยากรณ์ความหนาแน่นเพียงลำพัง log score และ continuous ranked probability score (CRPS) ให้ค่าความสูญเสียสเกลาร์แก่คู่การพยากรณ์-ผลลัพธ์แต่ละรายการ ตามนิยาม ความสูญเสียคาดหมายต่ำสุดเมื่อรายงานการแจกแจงพยากรณ์ที่แท้จริง ค่าเฉลี่ยจากตัวอย่างหนึ่งไม่พิสูจน์ว่าโมเดลถูกต้อง คู่มือ Model Confidence Set กล่าวถึงการเปรียบเทียบแบบเซต ใช้คะแนนที่นิยามสำหรับการแจกแจงเต็มบนผลลัพธ์ชุดเดียวกัน
ระบุเป้าหมาย ขอบฟ้า วันที่ร่วมกัน นิยามความสูญเสีย และ benchmark log score ไวต่อการให้ความหนาแน่นต่ำมาก ณ จุดสังเกตเป็นพิเศษ ส่วน CRPS เปรียบเทียบ CDF ด้วยรูปแบบความไวต่างกัน ความไม่แน่นอนของคะแนนต่างต้องคำนึงถึงการพึ่งพาอนุกรม การประมาณค่า และการค้นหาโมเดล ใช้กราฟ PIT ร่วมกับคะแนนเพราะทำหน้าที่ต่างกัน
การปรับเทียบหรือคะแนนที่ดีกว่าไม่ได้พิสูจน์กำไรจากการซื้อขาย ข้อกล่าวอ้างด้านการซื้อขายต้องระบุกฎตัดสินใจ เวลาใช้ข้อมูล ขนาดสถานะ ต้นทุนธุรกรรมและเงินทุน ตลอดจนการประเมินผลตอบแทนนอกตัวอย่างแยกต่างหาก สถิติประเมินการพยากรณ์ไม่ใช่ผลตอบแทน backtest
ใช้ขั้นตอน PIT ที่ทำซ้ำได้
กำหนดเป้าหมาย ขอบฟ้า เวลาเริ่มพยากรณ์ รุ่นของผลลัพธ์ และประเภทการแจกแจงว่าเป็นต่อเนื่อง ไม่ต่อเนื่อง หรือผสม เก็บ CDF ทุกชุดหรือข้อมูลที่สร้างกลับได้ พร้อมผลจริงและชุดข้อมูลสารสนเทศ คำนวณ (F_t(Y_t)) สำหรับกรณีต่อเนื่อง; เมื่อมีจุดกระโดด ให้บันทึก PIT แบบสุ่มหรือใช้การวินิจฉัยสำหรับข้อมูลไม่ต่อเนื่อง
ตรวจทั้งการแจกแจงเชิงขอบและลำดับเวลา ระบุ bin ขนาดตัวอย่าง วิธีจัดการค่าซ้ำ และ seed หรือขั้นตอนสุ่มซ้ำ เพิ่มการตรวจความเป็นอิสระหรือแบบมีเงื่อนไขเพื่อตอบคำถามที่กำหนดไว้ล่วงหน้า พร้อมอนุมานให้เหมาะกับ rolling, overlap หรือการประมาณค่า เปรียบเทียบโมเดลแยกต่างหากด้วย proper score บนผลลัพธ์ holdout ชุดเดียวกัน ข้อสรุปใช้กับการพยากรณ์และเงื่อนไขที่กำหนด ไม่รับประกันการปรับเทียบในอนาคตหรือกำไรจากการซื้อขาย
คำถามที่พบบ่อย
Q1PIT ที่สม่ำเสมอพิสูจน์ว่าการพยากรณ์ความหนาแน่นถูกต้องหรือไม่?
ไม่ใช่ เป็นเงื่อนไขวินิจฉัยที่จำเป็นสำหรับการพยากรณ์ต่อเนื่องที่ถูกต้อง แต่ความสม่ำเสมอเมื่อรวมข้อมูลไม่พิสูจน์ความเป็นอิสระหรือการปรับเทียบแบบมีเงื่อนไข ควรตรวจการพึ่งพาตามเวลาและตัวแปรเงื่อนไขที่เกี่ยวข้องด้วย
Q2ควรใช้ PIT แบบสุ่มกับการพยากรณ์ไม่ต่อเนื่องหรือไม่?
ใช้เมื่ออยากได้ค่าอ้างอิง continuous-uniform ภายใต้การแจกแจงไม่ต่อเนื่องที่ถูกต้อง การสุ่มเพิ่มจะกระจายผลลัพธ์ในช่วงกระโดดของ CDF บันทึกวิธีและ seed และพิจารณาการวินิจฉัยเฉพาะสำหรับข้อมูลไม่ต่อเนื่องหากต้องการหลีกเลี่ยงการสุ่ม
Q3ฮิสโตแกรม PIT รูปตัว U หมายถึงอะไร?
มักสอดคล้องกับการพยากรณ์ที่กระจุกเกินไป ส่วนยอดกลางมักสอดคล้องกับการพยากรณ์ที่กระจายกว้างเกินไป ถือเป็นเบาะแสแล้วตรวจความพึ่งพา ระบอบ ขนาดตัวอย่าง และ bin ต่อ
Q4ฮิสโตแกรม PIT ที่ดีกว่าหมายถึงคะแนนการพยากรณ์ดีกว่าหรือไม่?
ไม่ PIT วินิจฉัยพฤติกรรมการแจกแจง ส่วน proper score เปรียบเทียบการพยากรณ์ภายใต้ความสูญเสียและเป้าหมายที่กำหนด รายงานทั้งคู่บนผลนอกตัวอย่างเดียวกันและอย่าตีความเป็นกำไรจากการซื้อขาย งานวิจัยปฐมภูมิ - Rosenblatt, “Remarks on a Multivariate Transformation” (1952) - Diebold, Gunther, and Tay, “Evaluating Density Forecasts with Applications to Financial Risk Management” (1998) - Berkowitz, “Testing Density Forecasts, with Applications to Risk Management” (2001) - Gneiting, Balabdaoui, and Raftery, “Probabilistic Forecasts, Calibration and Sharpness” (2007) - Brockwell, “Universal Residuals: A Multivariate Transformation” (2007) - Czado, Gneiting, and Held, “Predictive Model Assessment for Count Data” (2009)
แหล่งข้อมูลและการอ่านเพิ่มเติม
รายงานปัญหา
เราจะเตรียมอีเมลพร้อมลิงก์บทความนี้ Mark จะได้รับรายงานเมื่อคุณส่งอีเมลแล้วเท่านั้น
ตรวจสอบอย่างรวดเร็ว
อ่านคู่มือจบแล้ว ลองตอบคำถาม 3 ข้อ
คำถาม 01
ทฤษฎีบท PIT บอกอะไรสำหรับการพยากรณ์ต่อเนื่องแบบมีเงื่อนไขที่ถูกต้องหนึ่งขั้น?
เลือกคำตอบเพื่อดูคำอธิบาย