Skip to content
คู่มือออปชันทั้งหมด
เปรียบเทียบการสูญเสียของการพยากรณ์สองแบบจากผลจริงชุดเดียวกันอ่าน 13 นาที

การทดสอบ Diebold–Mariano: เปรียบเทียบความแม่นยำของการพยากรณ์

เรียนรู้ว่า Diebold–Mariano เปรียบเทียบอะไร ผลต่างของการสูญเสียและสหสัมพันธ์ตามเวลามีผลต่อสถิติอย่างไร และเหตุใดความแม่นยำของการพยากรณ์จึงไม่เท่ากับกำไรจากการเทรด

ในคู่มือนี้การทดสอบเปรียบเทียบความสูญเสียคาดหมายของการพยากรณ์

สรุปสั้น

การทดสอบ Diebold–Mariano (DM) ใช้ตรวจว่ากระบวนการพยากรณ์สองแบบมีค่าความสูญเสียคาดหมายเท่ากันหรือไม่ เมื่อประเมินจากผลลัพธ์จริงชุดเดียวกัน การทดสอบใช้อนุกรมของผลต่างความสูญเสีย ดังนั้นฟังก์ชันความสูญเสีย ระยะพยากรณ์ และการพึ่งพากันระหว่างวันจึงมีผลต่อผลลัพธ์ การปฏิเสธสมมติฐานศูนย์สนับสนุนว่ามีความแตกต่างภายใต้แบบประเมินที่ระบุไว้ แต่ไม่ได้พิสูจน์ว่าแบบจำลองหนึ่งจะเหนือกว่าเสมอ หรือกลยุทธ์เทรดจะทำกำไรหลังหักต้นทุน

การทดสอบเปรียบเทียบความสูญเสียคาดหมายของการพยากรณ์

การทดสอบ Diebold–Mariano เปรียบเทียบการพยากรณ์สองแบบของเป้าหมายเดียวกันในวันประเมินเดียวกัน ณ จุดเริ่มพยากรณ์แต่ละครั้ง ทั้งสองวิธีต้องใช้ผลลัพธ์จริง ระยะพยากรณ์ และเวลาตัดข้อมูลชุดเดียวกัน จากนั้นจึงประเมินว่าความสูญเสียเฉลี่ยของวิธีหนึ่งต่างจากอีกวิธีอย่างเป็นระบบหรือไม่ โดยยอมให้ผลต่างเปลี่ยนไปตามเวลา

Diebold และ Mariano เสนอกรอบทดสอบสำหรับฟังก์ชันความสูญเสียทั่วไป ไม่ได้จำกัดเฉพาะค่าคลาดเคลื่อนกำลังสองเฉลี่ย บทความต้นฉบับทดสอบสมมติฐานศูนย์ว่าการพยากรณ์ที่แข่งขันกันมีความแม่นยำพยากรณ์เท่ากัน (Diebold และ Mariano, 1995) ในที่นี้ “ความแม่นยำ” หมายถึงความสูญเสียคาดหมายต่ำกว่าตามฟังก์ชันที่เลือก ไม่ได้หมายความว่าการพยากรณ์เป็นความจริง อธิบายเหตุและผล ปรับเทียบได้ดีตลอดทั้งการแจกแจง หรือใช้ได้กับทุกการตัดสินใจ

สมมติว่าแบบจำลอง A และ B พยากรณ์ผลตอบแทนอนาคตตัวเดียวกัน ณ เวลาเดียวกัน การทดสอบ DM ไม่ได้ตรวจว่าค่าสัมประสิทธิ์ใดมีค่าเป็นศูนย์หรือไม่ และไม่ได้ตรวจว่าค่าที่แบบจำลองประมาณได้ในชุดฝึกเหมือนกันหรือไม่ แต่เปรียบเทียบว่าเมื่อใช้กับชุดประเมินแล้ว ข้อผิดพลาดของแต่ละแบบแปลงเป็นความสูญเสียตามฟังก์ชันที่เลือกอย่างไร

ต้องกำหนดแบบประเมินก่อนตีความสถิติ ทั้งเป้าหมาย จุดเริ่มพยากรณ์ ระยะพยากรณ์ ฟังก์ชันความสูญเสีย การจัดการผลที่ขาดหาย ตารางประมาณแบบจำลองใหม่ และสมมติฐานทางเลือกแบบทางเดียวหรือสองทาง ล้วนกำหนดคำถามที่จะทดสอบ หากทางเลือกเหล่านี้ไม่เหมือนกันระหว่างแบบจำลอง ผลต่างความสูญเสียก็ไม่ใช่การเปรียบเทียบภายใต้เงื่อนไขเดียวกัน

กำหนดการพยากรณ์แบบจับคู่และผลต่างความสูญเสีย

ให้ $y_t$ เป็นค่าเป้าหมายจริง ณ จุดเริ่มพยากรณ์ $t$ และ $\hat y_{A,t}$ กับ $\hat y_{B,t}$ เป็นค่าพยากรณ์ของแบบจำลอง A และ B ข้อผิดพลาดคือ $e_{A,t}=y_t-\hat y_{A,t}$ และ $e_{B,t}=y_t-\hat y_{B,t}$ สำหรับฟังก์ชันความสูญเสีย $L$ ผลต่างในแต่ละวันคือ:

$$ d_t=L(e_{A,t})-L(e_{B,t}) $$

ตามข้อตกลงเครื่องหมายนี้ ค่าเฉลี่ย $d_t$ ที่ติดลบหมายถึง A มีความสูญเสียที่สังเกตได้ต่ำกว่า ส่วนค่าเฉลี่ยเป็นบวกหมายถึง B ต่ำกว่า สมมติฐานศูนย์ของประชากรคือ $E[d_t]=0$ สมมติฐานทางเลือกสองทางถามว่าความสูญเสียคาดหมายต่างกันในทิศทางใดก็ได้ ส่วนแบบทางเดียวทดสอบทิศทางที่กำหนดไว้ก่อน อย่าเลือกทิศทางหลังจากเห็นว่าแบบจำลองใดชนะ

ความสูญเสียกำลังสอง $L(e)=e^2$ ให้น้ำหนักกับความผิดพลาดใหญ่เกินสัดส่วน ส่วนความสูญเสียค่าสัมบูรณ์ $L(e)=|e|$ ถูกครอบงำโดยความผิดพลาดใหญ่เพียงครั้งเดียวได้น้อยกว่า ความสูญเสียควอนไทล์อาจเหมาะกับเป้าหมายที่ไม่สมมาตร และฟังก์ชันอื่นอาจวัดมิติอื่นของการพยากรณ์ เมื่อเปลี่ยนฟังก์ชัน อันดับแบบจำลองก็อาจกลับกันได้ ดังนั้น “การพยากรณ์ที่ดีที่สุด” ไม่มีความหมายเดียวก่อนระบุฟังก์ชัน บททบทวนของ Tashman เกี่ยวกับการทดสอบพยากรณ์นอกตัวอย่างก็เน้นว่าการประเมินต้องสอดคล้องกับโจทย์พยากรณ์ (Tashman, 200000065-0))

ใช้จุดเริ่มพยากรณ์และผลจริงชุดเดียวกันสำหรับทั้งสองแบบจำลอง หากแบบหนึ่งขาดการพยากรณ์ในวันที่ยาก การตัดวันนั้นออกเฉพาะแบบจำลองนั้นจะทำให้ชุดเปรียบเทียบเปลี่ยนไป หากใช้งานจริงจะประมาณแบบจำลองใหม่ทุกเดือนด้วยข้อมูลใหม่ ก็ควรสร้างการพยากรณ์ประเมินตามกฎเดียวกัน การพยากรณ์ด้วยพารามิเตอร์คงที่ตอบคำถามอีกแบบหนึ่ง การตรวจสอบแบบ walk-forward อธิบายการสร้างการพยากรณ์ตามลำดับโดยไม่ใช้ข้อมูลอนาคต

ตัวอย่างสี่จุดพยากรณ์แสดงความหมายของผลต่างเฉลี่ย

พิจารณาจุดพยากรณ์สมมติสี่จุด โดยวัดเป้าหมายและข้อผิดพลาดเป็นหน่วยเปอร์เซ็นต์พอยต์ ข้อผิดพลาดของ A คือ $[1,2,0,1]$ และของ B คือ $[2,1,1,1]$ แต่ละคู่หมายถึงผลตอบแทนจริงและช่วงพยากรณ์เดียวกัน ตัวเลขสร้างขึ้นเพื่อสาธิตการคำนวณเท่านั้น

เมื่อใช้ความสูญเสียกำลังสอง ความสูญเสียของ A คือ $[1,4,0,1]$ และค่าคลาดเคลื่อนกำลังสองเฉลี่ยเท่ากับ $(1+4+0+1)/4=1.50$ หน่วยเปอร์เซ็นต์พอยต์กำลังสอง ความสูญเสียของ B คือ $[4,1,1,1]$ และค่าเฉลี่ยเท่ากับ $(4+1+1+1)/4=1.75$ สำหรับผลทั้งสี่นี้ MSE ของ A ต่ำกว่า 0.25 หน่วยเปอร์เซ็นต์พอยต์กำลังสอง

ผลต่างรายวัน $d_t=L(e_{A,t})-L(e_{B,t})$ คือ $[-3,3,-1,0]$ ค่าเฉลี่ย $(-3+3-1+0)/4=-0.25$ เท่ากับ MSE เฉลี่ยของ A ลบด้วย MSE ของ B เครื่องหมายลบสนับสนุน A ตามข้อตกลงนี้ แต่ยังไม่ได้บอกว่าความต่างมากกว่าสัญญาณรบกวนจากการสุ่มตัวอย่างหรือไม่ การพยากรณ์เพียงสี่คู่ไม่ใช่หลักฐานเชิงสถิติที่หนักแน่น

นิยามความสูญเสียยังเปลี่ยนความหมายของคำว่า “ดีกว่า” ในอีกตัวอย่างสมมติหนึ่ง C มีข้อผิดพลาดสัมบูรณ์ $[0,0,0,3]$ และ D มี $[1,1,1,1]$ เมื่อใช้ความสูญเสียสัมบูรณ์ ค่าเฉลี่ยของ C คือ 0.75 และของ D คือ 1 จึงเลือก C แต่เมื่อใช้กำลังสอง ค่าเฉลี่ย C คือ 2.25 และ D คือ 1 จึงเลือก D การทดสอบแก้ความขัดแย้งนี้ไม่ได้ หากยังไม่ตัดสินว่าความผิดพลาดแบบใดสำคัญกว่า

<!-- Illustration placement: after this section; text-free conceptual scene showing two forecast paths against one realized path, with visibly different miss distances and no labels or numerical claims. -->

สถิติ DM ปรับผลต่างเฉลี่ยด้วยความไม่แน่นอน

ผลต่างความสูญเสียเฉลี่ยในตัวอย่างคือ $\bar d=T^{-1}\sum_{t=1}^{T}d_t$ โดย $T$ คือจำนวนผลการพยากรณ์แบบจับคู่ ค่าคลาดเคลื่อนมาตรฐานขึ้นกับความแปรปรวนระยะยาวของ $d_t$ ไม่ใช่แค่ความแปรปรวนในวันเดียว รูปทั่วไปของสถิติทดสอบคือ:

$$ DM=\frac{\bar d}{\sqrt{\widehat{\Omega}/T}} $$

$\widehat{\Omega}$ ประมาณความแปรปรวนระยะยาวของอนุกรมผลต่างความสูญเสีย หากแต่ละวันเป็นอิสระ ค่านี้จะใกล้กับความแปรปรวนของ $d_t$ ตามตัวประมาณที่เลือก แต่ความสูญเสียของการพยากรณ์มักกระจุกตัว: ช่วงผันผวนสูงอาจทำให้ความผิดพลาดของทั้งสองแบบจำลองเพิ่มพร้อมกัน และเป้าหมายล่วงหน้า $h$ ขั้นอาจทำให้ช่วงข้อผิดพลาดที่ติดกันใช้ผลตอบแทนจริงซ้ำกัน การละเลยความสัมพันธ์เชิงบวกอาจทำให้ค่าคลาดเคลื่อนมาตรฐานต่ำไปและทำให้หลักฐานดูแข็งแรงเกินจริง

วิธี HAC ที่ใช้กันทั่วไปจะประมาณออโตโควาเรียนซ์ $\hat\gamma_k$ ของผลต่างความสูญเสียที่หักค่าเฉลี่ยแล้ว แล้วรวมเป็น $\widehat{\Omega}=\hat\gamma_0+2\sum_{k=1}^{q}w_k\hat\gamma_k$ หากใช้ค่าน้ำหนัก Bartlett จนถึงแบนด์วิดท์ $q$ จะได้ $w_k=1-k/(q+1)$ Newey และ West เสนอตัวประมาณโควาเรียนซ์กึ่งบวกแน่นอนที่สอดคล้องเมื่อมีความแปรปรวนไม่คงที่และออโตคอรีเลชัน (Newey and West) เคอร์เนลและแบนด์วิดท์เป็นตัวเลือกในการนำไปใช้ ควรเปิดเผยและเลือกตามแบบพยากรณ์ ไม่ใช่เพื่อให้ได้ p-value ที่ต้องการ คู่มือค่าคลาดเคลื่อนมาตรฐาน HAC อธิบายปัญหาการประมาณโควาเรียนซ์ที่กว้างกว่า

ภายใต้เงื่อนไขความเป็นปกติที่เหมาะสม จะเทียบสถิติ DM มาตรฐานกับการแจกแจงปกติมาตรฐานแบบลู่เข้า ค่าสัมบูรณ์ที่มากแสดงว่าผลต่างเฉลี่ยที่สังเกตได้มีขนาดใหญ่เมื่อเทียบกับความไม่แน่นอนที่ประมาณไว้ เครื่องหมายระบุแบบจำลองที่มีความสูญเสียต่ำกว่าตามลำดับที่กำหนด ส่วน p-value ไม่ได้วัดขนาดหรือมูลค่าทางเศรษฐกิจของความต่าง และไม่ใช่ความน่าจะเป็นที่สมมติฐานศูนย์เป็นจริงหรือการพยากรณ์จะได้ผลในอนาคต

การพยากรณ์หลายขั้นซ้อนทับกัน จึงต้องคำนึงถึงตัวอย่างขนาดจำกัด

เมื่อออกการพยากรณ์ทุกช่วงเวลาเพื่อเป้าหมายในอีกหลายช่วงเวลา หน้าต่างประเมินจะซ้อนทับกัน ตัวอย่างเช่น การพยากรณ์รายเดือนของผลตอบแทนสะสมสามเดือนข้างหน้าจะแชร์ผลตอบแทนรายเดือนสองในสามรายการกับการพยากรณ์ที่ออกในเดือนถัดไป แม้ผลตอบแทนรายเดือนจะเป็นอิสระ การซ้อนทับก็อาจทำให้ข้อผิดพลาดและผลต่างความสูญเสียมีสหสัมพันธ์ตามเวลา

ในการตั้งค่าพื้นฐานแบบ $h$ ขั้น ควรรวมความสัมพันธ์อย่างน้อยถึง lag $h-1$ ในการคำนวณความแปรปรวน แต่ไม่ใช่กฎแบนด์วิดท์ที่ใช้ได้ทุกกรณี การประมาณพารามิเตอร์แบบเลื่อนหน้าต่าง เป้าหมายที่คงอยู่ การกระจุกตัวของความผันผวน และฟังก์ชันความสูญเสีย อาจสร้างความสัมพันธ์ที่ยาวกว่า บันทึกระยะพยากรณ์ ระยะห่างระหว่างจุดเริ่ม และเหตุผลที่เลือกจุดตัด HAC หรือตัวประมาณอื่น จำนวนแถวพยากรณ์ไม่ได้เท่ากับจำนวนหลักฐานอิสระโดยอัตโนมัติ

การทดสอบเชิงลู่เข้าแบบเดิมอาจมีระดับนัยสำคัญจริงคลาดเคลื่อนในตัวอย่างขนาดปานกลาง Harvey, Leybourne และ Newbold เสนอการปรับสำหรับตัวอย่างจำกัดเพื่อเปรียบเทียบค่าคลาดเคลื่อนกำลังสองเฉลี่ยของการพยากรณ์ (HLN, 199700719-4)) รูปแบบที่ใช้กันสำหรับระยะ $h$ และการพยากรณ์ $T$ ครั้งคูณสถิติ DM ด้วย:

$$ DM_{HLN}=DM\sqrt{\frac{T+1-2h+h(h-1)/T}{T}} $$

โดยทั่วไปจะเทียบสถิติที่ปรับแล้วกับการแจกแจง $t$ ที่มีองศาอิสระ $T-1$ เมื่อ $T=60$ และ $h=5$ ตัวคูณประมาณ $0.925$ ตัวอย่างนี้แสดงเพียงการคำนวณตัวปรับ ไม่ได้แปลว่าข้อมูล 60 จุดเพียงพอสำหรับแบบจำลองใด หรือสมมติฐานเป็นจริง การปรับแก้ปัญหาตัวอย่างขนาดเล็กเฉพาะเรื่อง แต่ไม่ได้แก้ข้อมูลรั่วไหล เป้าหมายไม่ถูกต้อง ความสัมพันธ์ที่ไม่ได้จำลอง การเลือกแบบจำลองซ้ำ หรือฟังก์ชันความสูญเสียที่กำหนดผิด

แบบจำลองซ้อนกันต้องใช้เหตุผลเปรียบเทียบการพยากรณ์อีกแบบ

แบบจำลอง A อาจเป็นแบบจำลอง B ในรูปแบบที่มีข้อจำกัด เช่น B เพิ่มตัวแปรพยากรณ์จาก A แม้ภายใต้สมมติฐานศูนย์ที่ตัวแปรเพิ่มไม่มีคุณค่าพยากรณ์ในประชากร ค่าสัมประสิทธิ์ที่ประมาณได้ก็อาจเพิ่มสัญญาณรบกวนให้การพยากรณ์ของ B ดังนั้นแบบจำลองที่ใหญ่กว่าอาจมี MSE ที่สังเกตได้สูงกว่า แม้ตัวแปรเพิ่มไม่ได้ปรับปรุงกระบวนการพยากรณ์พื้นฐาน ตรรกะความแม่นยำเท่ากันสำหรับแบบจำลองที่ไม่ซ้อนกันจึงใช้ตรง ๆ ไม่ได้เสมอไป

Clark และ West พัฒนาการทดสอบแบบใกล้เคียงปกติเพื่อเปรียบเทียบความแม่นยำในแบบจำลองซ้อนกัน และปรับการเปรียบเทียบข้อผิดพลาดกำลังสองให้คำนึงถึงสัญญาณรบกวนจากการประมาณของแบบจำลองที่ใหญ่กว่า (Clark and West, 2007) การปรับนี้ไม่ใช่ตัวแทนสากลของ DM ทุกแบบ แต่สร้างมาสำหรับคำถามเรื่องแบบจำลองซ้อนกัน ฟังก์ชันความสูญเสีย และกรอบเชิงลู่เข้าเฉพาะ ตรวจว่ามีความสัมพันธ์แบบซ้อนกันหรือไม่ แล้วเลือกการทดสอบที่การแจกแจงภายใต้สมมติฐานศูนย์เหมาะกับแบบประเมิน อย่าคิดว่า p-value DM มาตรฐานจากซอฟต์แวร์ครอบคลุมทุกความสัมพันธ์ของแบบจำลอง

ความแตกต่างด้านอื่นก็สำคัญ การพยากรณ์ที่ MSE ต่ำกว่าอาจไม่ช่วยเรื่องความครอบคลุมของช่วง การปรับเทียบความน่าจะเป็น ความแม่นยำด้านทิศทาง หรือการตัดสินใจขั้นถัดไป การเปรียบเทียบนอกตัวอย่างก็ยังอาจใช้ชุดกันไว้ที่ไม่เหมาะสม หากมีการตรวจดูซ้ำระหว่างพัฒนาแบบจำลอง ให้ระบุความสัมพันธ์ของแบบจำลอง วิธีประมาณ ระยะพยากรณ์ และข้อมูลที่ใช้สร้างการพยากรณ์แต่ละครั้ง

ความแม่นยำของการพยากรณ์ไม่ใช่ความได้เปรียบในการเทรด

ผล DM ประเมินความสูญเสียจากการพยากรณ์ ส่วนการตัดสินใจเทรดประเมินผลตอบแทนและความเสี่ยง MSE ของผลตอบแทนช่วงถัดไปที่ต่ำกว่าไม่ได้รับประกันว่าสัญญาณจะเลือกทางเทรดถูกบ่อยพอ กำหนดขนาดสถานะเหมาะสม หรือรับมือกับการหมุนสถานะ สเปรด ผลกระทบต่อตลาด ค่าธรรมเนียม ต้นทุนยืม เงินทุน และการล่าช้าในการส่งคำสั่งได้ ในทางกลับกัน การพยากรณ์ที่มีความผิดพลาดกำลังสองเฉลี่ยสูงกว่าเล็กน้อยอาจช่วยการตัดสินใจ หากแม่นกว่าในช่วงที่กลยุทธ์มีความเสี่ยงเปิดรับสูง ฟังก์ชันความสูญเสียสำหรับข้อกล่าวอ้างนี้อาจต้องสะท้อนการตัดสินใจจริงแทนที่จะใช้ตัววัดทั่วไปที่สะดวก

ความแตกต่างที่มีนัยสำคัญทางสถิติอาจเล็กมากในเชิงเศรษฐกิจ รายงานขนาดของผลต่างความสูญเสียเฉลี่ยในหน่วยที่ตีความได้พร้อมความไม่แน่นอน ไม่ใช่เพียง p-value หรือป้ายผู้ชนะ หากอ้างผลระดับพอร์ต ให้ทดสอบกฎตัดสินใจทั้งหมดที่ตรึงไว้กับข้อมูลภายหลังที่เหมาะสม โดยใช้สมมติฐานการเทรดที่สมจริง และรายงานผลสุทธิแยกต่างหาก DM ไม่ได้คำนวณผลดังกล่าวหรือหักต้นทุน เว้นแต่ฟังก์ชันความสูญเสียออกแบบให้รวมไว้โดยชัดแจ้ง

การทดสอบนี้ไม่แก้ปัญหาการค้นหาแบบจำลอง เป้าหมาย ระยะพยากรณ์ ฟังก์ชันความสูญเสีย ช่วงวันที่ หรือกฎเทรดจำนวนมาก แล้วรายงานเฉพาะคู่เปรียบเทียบที่เอื้อที่สุด การทดสอบเป็นคู่ซ้ำ ๆ ทำให้เกิดปัญหาการเลือกอีกแบบหนึ่ง เก็บบันทึกการค้นหาและใช้วิธีทดสอบหลายสมมติฐานที่เหมาะกับกลุ่มข้อกล่าวอ้าง คู่มือการทดสอบหลายรายการและอัตราการค้นพบเท็จ อธิบายว่าทำไมเกณฑ์ทั่วไปอาจทำให้เข้าใจผิดหลังค้นหากว้างขวาง DM เป็นเครื่องมือประเมิน ไม่ใช่การปรับแก้ data snooping

รายงานรายละเอียดให้เพียงพอเพื่อทำซ้ำการเปรียบเทียบ

รายงานที่ชัดเจนระบุเป้าหมายและหน่วย จุดตัดข้อมูล จุดเริ่มพยากรณ์ ระยะพยากรณ์ ตารางประมาณใหม่ และชุดประเมินร่วมกัน รวมถึงฟังก์ชันความสูญเสียและเครื่องหมายของ $d_t$ ความสูญเสียเฉลี่ยของแต่ละแบบจำลองและผลต่างเฉลี่ย สมมติฐานหนึ่งหรือสองทางที่เลือกไว้ก่อน ตัวประมาณความแปรปรวน เคอร์เนล แบนด์วิดท์ สถิติทดสอบ การแจกแจงอ้างอิง p-value และช่วงความเชื่อมั่นหรือค่าความไม่แน่นอนเมื่อเหมาะสม

เปิดเผยด้วยว่าแบบจำลองซ้อนกันหรือไม่ จัดการผลลัพธ์ที่หายและค่าสุดขั้วอย่างไร ตรวจสอบข้อกำหนดทางเลือกกี่แบบ และช่วงประเมินมีผลต่อการเลือกแบบจำลองหรือไม่ แสดงขนาดความต่าง ไม่ใช่แค่ว่าผ่านเกณฑ์หรือเปล่า กราฟอนุกรม $d_t$ หรือผลต่างความสูญเสียสะสมอาจเผยการเปลี่ยนระบอบที่ค่าเฉลี่ยรวมซ่อนอยู่ แต่ภาพไม่แทนการอนุมานที่คำนึงถึงความสัมพันธ์

ในการเทรดเชิงปริมาณ ให้ระบุวิธีแปลงการพยากรณ์เป็นการกระทำด้วย ได้แก่ เกณฑ์สัญญาณ ขนาดสถานะ เวลารีบาลานซ์ การควบคุมความเสี่ยง ราคาดำเนินการ และสมมติฐานต้นทุน DM เปรียบเทียบเฉพาะอนุกรมความสูญเสียของการพยากรณ์ที่ป้อนให้ ไม่รับรองกระบวนการข้อมูล ไม่ทำให้ตัวอย่างประเมินต่างกันเปรียบเทียบกันได้ ไม่พิสูจน์เหตุและผล หรือรับประกันอันดับในอดีต ใช้เป็นส่วนหนึ่งของการประเมินแบบจำลองอย่างโปร่งใส ควบคู่กับการออกแบบพยากรณ์ตามลำดับเวลาและการประเมินระดับการตัดสินใจอย่างชัดเจน

คำถามที่พบบ่อย

Q1การทดสอบ Diebold–Mariano เปรียบเทียบค่าสัมประสิทธิ์แบบจำลองหรือไม่?

ไม่ใช่ การทดสอบเปรียบเทียบความสูญเสียคาดหมายของข้อผิดพลาดจากกระบวนการพยากรณ์สองแบบบนผลลัพธ์ที่จับคู่กัน การทดสอบค่าสัมประสิทธิ์ตอบคำถามอีกเรื่องเกี่ยวกับพารามิเตอร์ของแบบจำลอง

Q2ใช้การทดสอบกับการพยากรณ์ล่วงหน้าหลายช่วงได้หรือไม่?

ได้ แต่ช่วงเป้าหมายที่ซ้อนทับกันอาจทำให้ผลต่างความสูญเสียต่อเนื่องมีความสัมพันธ์ตามเวลา ใช้ค่าประมาณความแปรปรวนและเมื่อเหมาะสมให้ปรับตัวอย่างจำกัดให้เข้ากับระยะและแบบจำลอง พร้อมบันทึกทางเลือกไว้

Q3ผลที่มีนัยสำคัญแปลว่าการพยากรณ์ที่ดีกว่าจะทำเงินได้หรือไม่?

ไม่ ผลสนับสนุนว่าความสูญเสียจากการพยากรณ์ที่เลือกต่างกันภายใต้แบบประเมินนั้น ความสามารถในการทำกำไรยังขึ้นกับวิธีแปลงการพยากรณ์เป็นสถานะ ความเสี่ยงที่รับ และต้นทุนกับการดำเนินการจริง

แหล่งข้อมูลและการอ่านเพิ่มเติม

รายงานปัญหา

เราจะเตรียมอีเมลพร้อมลิงก์บทความนี้ Mark จะได้รับรายงานเมื่อคุณส่งอีเมลแล้วเท่านั้น

ตรวจสอบอย่างรวดเร็ว

อ่านคู่มือจบแล้ว ลองตอบคำถาม 3 ข้อ

คำถาม 1 / 3

คำถาม 01

สมมติฐานศูนย์ในการเปรียบเทียบ Diebold–Mariano พื้นฐานคืออะไร?

เลือกคำตอบเพื่อดูคำอธิบาย

อภิธานศัพท์ออปชัน

เลือกข้อมูลย้อนหลังที่โมเดลการเงินจะใช้เรียนรู้หน้าต่างแบบขยายและแบบเลื่อนสำหรับการตรวจสอบโมเดล Walk-Forwardเปรียบเทียบหน้าต่างฝึกแบบขยายกับแบบเลื่อนที่มีความยาวคงที่ แยกช่วงตรวจสอบออกจากชุดทดสอบสุดท้าย และเลือกกติกาโดยไม่ใช้ผลลัพธ์อนาคตค่าสัมประสิทธิ์เดียวกันอาจมีความไม่แน่นอนต่างกันความแปรปรวนไม่คงที่ สหสัมพันธ์อัตโนมัติ และ standard error แบบ robustเรียนรู้ว่าเหตุใด standard error แบบคลาสสิกจึงล้มเหลว ตัวประมาณ White, clustered และ Newey–West HAC อนุญาตอะไร วิธีเลือกใช้ และการอนุมานแบบ robust หยุดตรงไหนในข้อมูลการเงินเหตุใด threshold เดียวจึงล้มเหลวเมื่อ researcher ทดสอบไอเดียจำนวนมากMultiple Testing และ False Discovery Rate ในการเงินทำความเข้าใจ multiple comparisons, family-wise error, false discovery rate, Bonferroni, Holm, Benjamini–Hochberg, dependence, q-values, factor mining, backtest selection และ research governanceการประเมินการพยากรณ์ทิศทางการทดสอบ Pesaran–Timmermann: การพยากรณ์เพิ่มข้อมูลเกี่ยวกับทิศทางหรือไม่?เรียนรู้ว่าการทดสอบ Pesaran–Timmermann เปรียบเทียบการทายทิศทางถูกกับเกณฑ์พื้นฐานที่คำนวณจากสัดส่วนการปรับขึ้นจริงและที่พยากรณ์อย่างไร และเหตุใดการพึ่งพากันตามเวลาจึงเปลี่ยนการอนุมานผู้ชนะจากแบ็กเทสต์ตกต่ำกว่าค่ามัธยฐานของกลุ่มบ่อยเพียงใดอธิบายความน่าจะเป็นของการโอเวอร์ฟิตแบ็กเทสต์ (PBO) และ CSCVเรียนรู้ว่า combinatorially symmetric cross-validation ประมาณค่า PBO อย่างไร แปลงอันดับ OOS เป็น logit อย่างไร และเหตุใดจึงไม่ใช่การพยากรณ์การขาดทุนในอนาคต