การทดสอบ Diebold–Mariano: เปรียบเทียบความแม่นยำของการพยากรณ์
เรียนรู้ว่า Diebold–Mariano เปรียบเทียบอะไร ผลต่างของการสูญเสียและสหสัมพันธ์ตามเวลามีผลต่อสถิติอย่างไร และเหตุใดความแม่นยำของการพยากรณ์จึงไม่เท่ากับกำไรจากการเทรด
ในคู่มือนี้การทดสอบเปรียบเทียบความสูญเสียคาดหมายของการพยากรณ์
สรุปสั้น
การทดสอบ Diebold–Mariano (DM) ใช้ตรวจว่ากระบวนการพยากรณ์สองแบบมีค่าความสูญเสียคาดหมายเท่ากันหรือไม่ เมื่อประเมินจากผลลัพธ์จริงชุดเดียวกัน การทดสอบใช้อนุกรมของผลต่างความสูญเสีย ดังนั้นฟังก์ชันความสูญเสีย ระยะพยากรณ์ และการพึ่งพากันระหว่างวันจึงมีผลต่อผลลัพธ์ การปฏิเสธสมมติฐานศูนย์สนับสนุนว่ามีความแตกต่างภายใต้แบบประเมินที่ระบุไว้ แต่ไม่ได้พิสูจน์ว่าแบบจำลองหนึ่งจะเหนือกว่าเสมอ หรือกลยุทธ์เทรดจะทำกำไรหลังหักต้นทุน
การทดสอบเปรียบเทียบความสูญเสียคาดหมายของการพยากรณ์
การทดสอบ Diebold–Mariano เปรียบเทียบการพยากรณ์สองแบบของเป้าหมายเดียวกันในวันประเมินเดียวกัน ณ จุดเริ่มพยากรณ์แต่ละครั้ง ทั้งสองวิธีต้องใช้ผลลัพธ์จริง ระยะพยากรณ์ และเวลาตัดข้อมูลชุดเดียวกัน จากนั้นจึงประเมินว่าความสูญเสียเฉลี่ยของวิธีหนึ่งต่างจากอีกวิธีอย่างเป็นระบบหรือไม่ โดยยอมให้ผลต่างเปลี่ยนไปตามเวลา
Diebold และ Mariano เสนอกรอบทดสอบสำหรับฟังก์ชันความสูญเสียทั่วไป ไม่ได้จำกัดเฉพาะค่าคลาดเคลื่อนกำลังสองเฉลี่ย บทความต้นฉบับทดสอบสมมติฐานศูนย์ว่าการพยากรณ์ที่แข่งขันกันมีความแม่นยำพยากรณ์เท่ากัน (Diebold และ Mariano, 1995) ในที่นี้ “ความแม่นยำ” หมายถึงความสูญเสียคาดหมายต่ำกว่าตามฟังก์ชันที่เลือก ไม่ได้หมายความว่าการพยากรณ์เป็นความจริง อธิบายเหตุและผล ปรับเทียบได้ดีตลอดทั้งการแจกแจง หรือใช้ได้กับทุกการตัดสินใจ
สมมติว่าแบบจำลอง A และ B พยากรณ์ผลตอบแทนอนาคตตัวเดียวกัน ณ เวลาเดียวกัน การทดสอบ DM ไม่ได้ตรวจว่าค่าสัมประสิทธิ์ใดมีค่าเป็นศูนย์หรือไม่ และไม่ได้ตรวจว่าค่าที่แบบจำลองประมาณได้ในชุดฝึกเหมือนกันหรือไม่ แต่เปรียบเทียบว่าเมื่อใช้กับชุดประเมินแล้ว ข้อผิดพลาดของแต่ละแบบแปลงเป็นความสูญเสียตามฟังก์ชันที่เลือกอย่างไร
ต้องกำหนดแบบประเมินก่อนตีความสถิติ ทั้งเป้าหมาย จุดเริ่มพยากรณ์ ระยะพยากรณ์ ฟังก์ชันความสูญเสีย การจัดการผลที่ขาดหาย ตารางประมาณแบบจำลองใหม่ และสมมติฐานทางเลือกแบบทางเดียวหรือสองทาง ล้วนกำหนดคำถามที่จะทดสอบ หากทางเลือกเหล่านี้ไม่เหมือนกันระหว่างแบบจำลอง ผลต่างความสูญเสียก็ไม่ใช่การเปรียบเทียบภายใต้เงื่อนไขเดียวกัน
กำหนดการพยากรณ์แบบจับคู่และผลต่างความสูญเสีย
ให้ $y_t$ เป็นค่าเป้าหมายจริง ณ จุดเริ่มพยากรณ์ $t$ และ $\hat y_{A,t}$ กับ $\hat y_{B,t}$ เป็นค่าพยากรณ์ของแบบจำลอง A และ B ข้อผิดพลาดคือ $e_{A,t}=y_t-\hat y_{A,t}$ และ $e_{B,t}=y_t-\hat y_{B,t}$ สำหรับฟังก์ชันความสูญเสีย $L$ ผลต่างในแต่ละวันคือ:
$$ d_t=L(e_{A,t})-L(e_{B,t}) $$
ตามข้อตกลงเครื่องหมายนี้ ค่าเฉลี่ย $d_t$ ที่ติดลบหมายถึง A มีความสูญเสียที่สังเกตได้ต่ำกว่า ส่วนค่าเฉลี่ยเป็นบวกหมายถึง B ต่ำกว่า สมมติฐานศูนย์ของประชากรคือ $E[d_t]=0$ สมมติฐานทางเลือกสองทางถามว่าความสูญเสียคาดหมายต่างกันในทิศทางใดก็ได้ ส่วนแบบทางเดียวทดสอบทิศทางที่กำหนดไว้ก่อน อย่าเลือกทิศทางหลังจากเห็นว่าแบบจำลองใดชนะ
ความสูญเสียกำลังสอง $L(e)=e^2$ ให้น้ำหนักกับความผิดพลาดใหญ่เกินสัดส่วน ส่วนความสูญเสียค่าสัมบูรณ์ $L(e)=|e|$ ถูกครอบงำโดยความผิดพลาดใหญ่เพียงครั้งเดียวได้น้อยกว่า ความสูญเสียควอนไทล์อาจเหมาะกับเป้าหมายที่ไม่สมมาตร และฟังก์ชันอื่นอาจวัดมิติอื่นของการพยากรณ์ เมื่อเปลี่ยนฟังก์ชัน อันดับแบบจำลองก็อาจกลับกันได้ ดังนั้น “การพยากรณ์ที่ดีที่สุด” ไม่มีความหมายเดียวก่อนระบุฟังก์ชัน บททบทวนของ Tashman เกี่ยวกับการทดสอบพยากรณ์นอกตัวอย่างก็เน้นว่าการประเมินต้องสอดคล้องกับโจทย์พยากรณ์ (Tashman, 200000065-0))
ใช้จุดเริ่มพยากรณ์และผลจริงชุดเดียวกันสำหรับทั้งสองแบบจำลอง หากแบบหนึ่งขาดการพยากรณ์ในวันที่ยาก การตัดวันนั้นออกเฉพาะแบบจำลองนั้นจะทำให้ชุดเปรียบเทียบเปลี่ยนไป หากใช้งานจริงจะประมาณแบบจำลองใหม่ทุกเดือนด้วยข้อมูลใหม่ ก็ควรสร้างการพยากรณ์ประเมินตามกฎเดียวกัน การพยากรณ์ด้วยพารามิเตอร์คงที่ตอบคำถามอีกแบบหนึ่ง การตรวจสอบแบบ walk-forward อธิบายการสร้างการพยากรณ์ตามลำดับโดยไม่ใช้ข้อมูลอนาคต
ตัวอย่างสี่จุดพยากรณ์แสดงความหมายของผลต่างเฉลี่ย
พิจารณาจุดพยากรณ์สมมติสี่จุด โดยวัดเป้าหมายและข้อผิดพลาดเป็นหน่วยเปอร์เซ็นต์พอยต์ ข้อผิดพลาดของ A คือ $[1,2,0,1]$ และของ B คือ $[2,1,1,1]$ แต่ละคู่หมายถึงผลตอบแทนจริงและช่วงพยากรณ์เดียวกัน ตัวเลขสร้างขึ้นเพื่อสาธิตการคำนวณเท่านั้น
เมื่อใช้ความสูญเสียกำลังสอง ความสูญเสียของ A คือ $[1,4,0,1]$ และค่าคลาดเคลื่อนกำลังสองเฉลี่ยเท่ากับ $(1+4+0+1)/4=1.50$ หน่วยเปอร์เซ็นต์พอยต์กำลังสอง ความสูญเสียของ B คือ $[4,1,1,1]$ และค่าเฉลี่ยเท่ากับ $(4+1+1+1)/4=1.75$ สำหรับผลทั้งสี่นี้ MSE ของ A ต่ำกว่า 0.25 หน่วยเปอร์เซ็นต์พอยต์กำลังสอง
ผลต่างรายวัน $d_t=L(e_{A,t})-L(e_{B,t})$ คือ $[-3,3,-1,0]$ ค่าเฉลี่ย $(-3+3-1+0)/4=-0.25$ เท่ากับ MSE เฉลี่ยของ A ลบด้วย MSE ของ B เครื่องหมายลบสนับสนุน A ตามข้อตกลงนี้ แต่ยังไม่ได้บอกว่าความต่างมากกว่าสัญญาณรบกวนจากการสุ่มตัวอย่างหรือไม่ การพยากรณ์เพียงสี่คู่ไม่ใช่หลักฐานเชิงสถิติที่หนักแน่น
นิยามความสูญเสียยังเปลี่ยนความหมายของคำว่า “ดีกว่า” ในอีกตัวอย่างสมมติหนึ่ง C มีข้อผิดพลาดสัมบูรณ์ $[0,0,0,3]$ และ D มี $[1,1,1,1]$ เมื่อใช้ความสูญเสียสัมบูรณ์ ค่าเฉลี่ยของ C คือ 0.75 และของ D คือ 1 จึงเลือก C แต่เมื่อใช้กำลังสอง ค่าเฉลี่ย C คือ 2.25 และ D คือ 1 จึงเลือก D การทดสอบแก้ความขัดแย้งนี้ไม่ได้ หากยังไม่ตัดสินว่าความผิดพลาดแบบใดสำคัญกว่า
<!-- Illustration placement: after this section; text-free conceptual scene showing two forecast paths against one realized path, with visibly different miss distances and no labels or numerical claims. -->
สถิติ DM ปรับผลต่างเฉลี่ยด้วยความไม่แน่นอน
ผลต่างความสูญเสียเฉลี่ยในตัวอย่างคือ $\bar d=T^{-1}\sum_{t=1}^{T}d_t$ โดย $T$ คือจำนวนผลการพยากรณ์แบบจับคู่ ค่าคลาดเคลื่อนมาตรฐานขึ้นกับความแปรปรวนระยะยาวของ $d_t$ ไม่ใช่แค่ความแปรปรวนในวันเดียว รูปทั่วไปของสถิติทดสอบคือ:
$$ DM=\frac{\bar d}{\sqrt{\widehat{\Omega}/T}} $$
$\widehat{\Omega}$ ประมาณความแปรปรวนระยะยาวของอนุกรมผลต่างความสูญเสีย หากแต่ละวันเป็นอิสระ ค่านี้จะใกล้กับความแปรปรวนของ $d_t$ ตามตัวประมาณที่เลือก แต่ความสูญเสียของการพยากรณ์มักกระจุกตัว: ช่วงผันผวนสูงอาจทำให้ความผิดพลาดของทั้งสองแบบจำลองเพิ่มพร้อมกัน และเป้าหมายล่วงหน้า $h$ ขั้นอาจทำให้ช่วงข้อผิดพลาดที่ติดกันใช้ผลตอบแทนจริงซ้ำกัน การละเลยความสัมพันธ์เชิงบวกอาจทำให้ค่าคลาดเคลื่อนมาตรฐานต่ำไปและทำให้หลักฐานดูแข็งแรงเกินจริง
วิธี HAC ที่ใช้กันทั่วไปจะประมาณออโตโควาเรียนซ์ $\hat\gamma_k$ ของผลต่างความสูญเสียที่หักค่าเฉลี่ยแล้ว แล้วรวมเป็น $\widehat{\Omega}=\hat\gamma_0+2\sum_{k=1}^{q}w_k\hat\gamma_k$ หากใช้ค่าน้ำหนัก Bartlett จนถึงแบนด์วิดท์ $q$ จะได้ $w_k=1-k/(q+1)$ Newey และ West เสนอตัวประมาณโควาเรียนซ์กึ่งบวกแน่นอนที่สอดคล้องเมื่อมีความแปรปรวนไม่คงที่และออโตคอรีเลชัน (Newey and West) เคอร์เนลและแบนด์วิดท์เป็นตัวเลือกในการนำไปใช้ ควรเปิดเผยและเลือกตามแบบพยากรณ์ ไม่ใช่เพื่อให้ได้ p-value ที่ต้องการ คู่มือค่าคลาดเคลื่อนมาตรฐาน HAC อธิบายปัญหาการประมาณโควาเรียนซ์ที่กว้างกว่า
ภายใต้เงื่อนไขความเป็นปกติที่เหมาะสม จะเทียบสถิติ DM มาตรฐานกับการแจกแจงปกติมาตรฐานแบบลู่เข้า ค่าสัมบูรณ์ที่มากแสดงว่าผลต่างเฉลี่ยที่สังเกตได้มีขนาดใหญ่เมื่อเทียบกับความไม่แน่นอนที่ประมาณไว้ เครื่องหมายระบุแบบจำลองที่มีความสูญเสียต่ำกว่าตามลำดับที่กำหนด ส่วน p-value ไม่ได้วัดขนาดหรือมูลค่าทางเศรษฐกิจของความต่าง และไม่ใช่ความน่าจะเป็นที่สมมติฐานศูนย์เป็นจริงหรือการพยากรณ์จะได้ผลในอนาคต
การพยากรณ์หลายขั้นซ้อนทับกัน จึงต้องคำนึงถึงตัวอย่างขนาดจำกัด
เมื่อออกการพยากรณ์ทุกช่วงเวลาเพื่อเป้าหมายในอีกหลายช่วงเวลา หน้าต่างประเมินจะซ้อนทับกัน ตัวอย่างเช่น การพยากรณ์รายเดือนของผลตอบแทนสะสมสามเดือนข้างหน้าจะแชร์ผลตอบแทนรายเดือนสองในสามรายการกับการพยากรณ์ที่ออกในเดือนถัดไป แม้ผลตอบแทนรายเดือนจะเป็นอิสระ การซ้อนทับก็อาจทำให้ข้อผิดพลาดและผลต่างความสูญเสียมีสหสัมพันธ์ตามเวลา
ในการตั้งค่าพื้นฐานแบบ $h$ ขั้น ควรรวมความสัมพันธ์อย่างน้อยถึง lag $h-1$ ในการคำนวณความแปรปรวน แต่ไม่ใช่กฎแบนด์วิดท์ที่ใช้ได้ทุกกรณี การประมาณพารามิเตอร์แบบเลื่อนหน้าต่าง เป้าหมายที่คงอยู่ การกระจุกตัวของความผันผวน และฟังก์ชันความสูญเสีย อาจสร้างความสัมพันธ์ที่ยาวกว่า บันทึกระยะพยากรณ์ ระยะห่างระหว่างจุดเริ่ม และเหตุผลที่เลือกจุดตัด HAC หรือตัวประมาณอื่น จำนวนแถวพยากรณ์ไม่ได้เท่ากับจำนวนหลักฐานอิสระโดยอัตโนมัติ
การทดสอบเชิงลู่เข้าแบบเดิมอาจมีระดับนัยสำคัญจริงคลาดเคลื่อนในตัวอย่างขนาดปานกลาง Harvey, Leybourne และ Newbold เสนอการปรับสำหรับตัวอย่างจำกัดเพื่อเปรียบเทียบค่าคลาดเคลื่อนกำลังสองเฉลี่ยของการพยากรณ์ (HLN, 199700719-4)) รูปแบบที่ใช้กันสำหรับระยะ $h$ และการพยากรณ์ $T$ ครั้งคูณสถิติ DM ด้วย:
$$ DM_{HLN}=DM\sqrt{\frac{T+1-2h+h(h-1)/T}{T}} $$
โดยทั่วไปจะเทียบสถิติที่ปรับแล้วกับการแจกแจง $t$ ที่มีองศาอิสระ $T-1$ เมื่อ $T=60$ และ $h=5$ ตัวคูณประมาณ $0.925$ ตัวอย่างนี้แสดงเพียงการคำนวณตัวปรับ ไม่ได้แปลว่าข้อมูล 60 จุดเพียงพอสำหรับแบบจำลองใด หรือสมมติฐานเป็นจริง การปรับแก้ปัญหาตัวอย่างขนาดเล็กเฉพาะเรื่อง แต่ไม่ได้แก้ข้อมูลรั่วไหล เป้าหมายไม่ถูกต้อง ความสัมพันธ์ที่ไม่ได้จำลอง การเลือกแบบจำลองซ้ำ หรือฟังก์ชันความสูญเสียที่กำหนดผิด
แบบจำลองซ้อนกันต้องใช้เหตุผลเปรียบเทียบการพยากรณ์อีกแบบ
แบบจำลอง A อาจเป็นแบบจำลอง B ในรูปแบบที่มีข้อจำกัด เช่น B เพิ่มตัวแปรพยากรณ์จาก A แม้ภายใต้สมมติฐานศูนย์ที่ตัวแปรเพิ่มไม่มีคุณค่าพยากรณ์ในประชากร ค่าสัมประสิทธิ์ที่ประมาณได้ก็อาจเพิ่มสัญญาณรบกวนให้การพยากรณ์ของ B ดังนั้นแบบจำลองที่ใหญ่กว่าอาจมี MSE ที่สังเกตได้สูงกว่า แม้ตัวแปรเพิ่มไม่ได้ปรับปรุงกระบวนการพยากรณ์พื้นฐาน ตรรกะความแม่นยำเท่ากันสำหรับแบบจำลองที่ไม่ซ้อนกันจึงใช้ตรง ๆ ไม่ได้เสมอไป
Clark และ West พัฒนาการทดสอบแบบใกล้เคียงปกติเพื่อเปรียบเทียบความแม่นยำในแบบจำลองซ้อนกัน และปรับการเปรียบเทียบข้อผิดพลาดกำลังสองให้คำนึงถึงสัญญาณรบกวนจากการประมาณของแบบจำลองที่ใหญ่กว่า (Clark and West, 2007) การปรับนี้ไม่ใช่ตัวแทนสากลของ DM ทุกแบบ แต่สร้างมาสำหรับคำถามเรื่องแบบจำลองซ้อนกัน ฟังก์ชันความสูญเสีย และกรอบเชิงลู่เข้าเฉพาะ ตรวจว่ามีความสัมพันธ์แบบซ้อนกันหรือไม่ แล้วเลือกการทดสอบที่การแจกแจงภายใต้สมมติฐานศูนย์เหมาะกับแบบประเมิน อย่าคิดว่า p-value DM มาตรฐานจากซอฟต์แวร์ครอบคลุมทุกความสัมพันธ์ของแบบจำลอง
ความแตกต่างด้านอื่นก็สำคัญ การพยากรณ์ที่ MSE ต่ำกว่าอาจไม่ช่วยเรื่องความครอบคลุมของช่วง การปรับเทียบความน่าจะเป็น ความแม่นยำด้านทิศทาง หรือการตัดสินใจขั้นถัดไป การเปรียบเทียบนอกตัวอย่างก็ยังอาจใช้ชุดกันไว้ที่ไม่เหมาะสม หากมีการตรวจดูซ้ำระหว่างพัฒนาแบบจำลอง ให้ระบุความสัมพันธ์ของแบบจำลอง วิธีประมาณ ระยะพยากรณ์ และข้อมูลที่ใช้สร้างการพยากรณ์แต่ละครั้ง
ความแม่นยำของการพยากรณ์ไม่ใช่ความได้เปรียบในการเทรด
ผล DM ประเมินความสูญเสียจากการพยากรณ์ ส่วนการตัดสินใจเทรดประเมินผลตอบแทนและความเสี่ยง MSE ของผลตอบแทนช่วงถัดไปที่ต่ำกว่าไม่ได้รับประกันว่าสัญญาณจะเลือกทางเทรดถูกบ่อยพอ กำหนดขนาดสถานะเหมาะสม หรือรับมือกับการหมุนสถานะ สเปรด ผลกระทบต่อตลาด ค่าธรรมเนียม ต้นทุนยืม เงินทุน และการล่าช้าในการส่งคำสั่งได้ ในทางกลับกัน การพยากรณ์ที่มีความผิดพลาดกำลังสองเฉลี่ยสูงกว่าเล็กน้อยอาจช่วยการตัดสินใจ หากแม่นกว่าในช่วงที่กลยุทธ์มีความเสี่ยงเปิดรับสูง ฟังก์ชันความสูญเสียสำหรับข้อกล่าวอ้างนี้อาจต้องสะท้อนการตัดสินใจจริงแทนที่จะใช้ตัววัดทั่วไปที่สะดวก
ความแตกต่างที่มีนัยสำคัญทางสถิติอาจเล็กมากในเชิงเศรษฐกิจ รายงานขนาดของผลต่างความสูญเสียเฉลี่ยในหน่วยที่ตีความได้พร้อมความไม่แน่นอน ไม่ใช่เพียง p-value หรือป้ายผู้ชนะ หากอ้างผลระดับพอร์ต ให้ทดสอบกฎตัดสินใจทั้งหมดที่ตรึงไว้กับข้อมูลภายหลังที่เหมาะสม โดยใช้สมมติฐานการเทรดที่สมจริง และรายงานผลสุทธิแยกต่างหาก DM ไม่ได้คำนวณผลดังกล่าวหรือหักต้นทุน เว้นแต่ฟังก์ชันความสูญเสียออกแบบให้รวมไว้โดยชัดแจ้ง
การทดสอบนี้ไม่แก้ปัญหาการค้นหาแบบจำลอง เป้าหมาย ระยะพยากรณ์ ฟังก์ชันความสูญเสีย ช่วงวันที่ หรือกฎเทรดจำนวนมาก แล้วรายงานเฉพาะคู่เปรียบเทียบที่เอื้อที่สุด การทดสอบเป็นคู่ซ้ำ ๆ ทำให้เกิดปัญหาการเลือกอีกแบบหนึ่ง เก็บบันทึกการค้นหาและใช้วิธีทดสอบหลายสมมติฐานที่เหมาะกับกลุ่มข้อกล่าวอ้าง คู่มือการทดสอบหลายรายการและอัตราการค้นพบเท็จ อธิบายว่าทำไมเกณฑ์ทั่วไปอาจทำให้เข้าใจผิดหลังค้นหากว้างขวาง DM เป็นเครื่องมือประเมิน ไม่ใช่การปรับแก้ data snooping
รายงานรายละเอียดให้เพียงพอเพื่อทำซ้ำการเปรียบเทียบ
รายงานที่ชัดเจนระบุเป้าหมายและหน่วย จุดตัดข้อมูล จุดเริ่มพยากรณ์ ระยะพยากรณ์ ตารางประมาณใหม่ และชุดประเมินร่วมกัน รวมถึงฟังก์ชันความสูญเสียและเครื่องหมายของ $d_t$ ความสูญเสียเฉลี่ยของแต่ละแบบจำลองและผลต่างเฉลี่ย สมมติฐานหนึ่งหรือสองทางที่เลือกไว้ก่อน ตัวประมาณความแปรปรวน เคอร์เนล แบนด์วิดท์ สถิติทดสอบ การแจกแจงอ้างอิง p-value และช่วงความเชื่อมั่นหรือค่าความไม่แน่นอนเมื่อเหมาะสม
เปิดเผยด้วยว่าแบบจำลองซ้อนกันหรือไม่ จัดการผลลัพธ์ที่หายและค่าสุดขั้วอย่างไร ตรวจสอบข้อกำหนดทางเลือกกี่แบบ และช่วงประเมินมีผลต่อการเลือกแบบจำลองหรือไม่ แสดงขนาดความต่าง ไม่ใช่แค่ว่าผ่านเกณฑ์หรือเปล่า กราฟอนุกรม $d_t$ หรือผลต่างความสูญเสียสะสมอาจเผยการเปลี่ยนระบอบที่ค่าเฉลี่ยรวมซ่อนอยู่ แต่ภาพไม่แทนการอนุมานที่คำนึงถึงความสัมพันธ์
ในการเทรดเชิงปริมาณ ให้ระบุวิธีแปลงการพยากรณ์เป็นการกระทำด้วย ได้แก่ เกณฑ์สัญญาณ ขนาดสถานะ เวลารีบาลานซ์ การควบคุมความเสี่ยง ราคาดำเนินการ และสมมติฐานต้นทุน DM เปรียบเทียบเฉพาะอนุกรมความสูญเสียของการพยากรณ์ที่ป้อนให้ ไม่รับรองกระบวนการข้อมูล ไม่ทำให้ตัวอย่างประเมินต่างกันเปรียบเทียบกันได้ ไม่พิสูจน์เหตุและผล หรือรับประกันอันดับในอดีต ใช้เป็นส่วนหนึ่งของการประเมินแบบจำลองอย่างโปร่งใส ควบคู่กับการออกแบบพยากรณ์ตามลำดับเวลาและการประเมินระดับการตัดสินใจอย่างชัดเจน
คำถามที่พบบ่อย
Q1การทดสอบ Diebold–Mariano เปรียบเทียบค่าสัมประสิทธิ์แบบจำลองหรือไม่?
ไม่ใช่ การทดสอบเปรียบเทียบความสูญเสียคาดหมายของข้อผิดพลาดจากกระบวนการพยากรณ์สองแบบบนผลลัพธ์ที่จับคู่กัน การทดสอบค่าสัมประสิทธิ์ตอบคำถามอีกเรื่องเกี่ยวกับพารามิเตอร์ของแบบจำลอง
Q2ใช้การทดสอบกับการพยากรณ์ล่วงหน้าหลายช่วงได้หรือไม่?
ได้ แต่ช่วงเป้าหมายที่ซ้อนทับกันอาจทำให้ผลต่างความสูญเสียต่อเนื่องมีความสัมพันธ์ตามเวลา ใช้ค่าประมาณความแปรปรวนและเมื่อเหมาะสมให้ปรับตัวอย่างจำกัดให้เข้ากับระยะและแบบจำลอง พร้อมบันทึกทางเลือกไว้
Q3ผลที่มีนัยสำคัญแปลว่าการพยากรณ์ที่ดีกว่าจะทำเงินได้หรือไม่?
ไม่ ผลสนับสนุนว่าความสูญเสียจากการพยากรณ์ที่เลือกต่างกันภายใต้แบบประเมินนั้น ความสามารถในการทำกำไรยังขึ้นกับวิธีแปลงการพยากรณ์เป็นสถานะ ความเสี่ยงที่รับ และต้นทุนกับการดำเนินการจริง
แหล่งข้อมูลและการอ่านเพิ่มเติม
รายงานปัญหา
เราจะเตรียมอีเมลพร้อมลิงก์บทความนี้ Mark จะได้รับรายงานเมื่อคุณส่งอีเมลแล้วเท่านั้น
ตรวจสอบอย่างรวดเร็ว
อ่านคู่มือจบแล้ว ลองตอบคำถาม 3 ข้อ
คำถาม 01
สมมติฐานศูนย์ในการเปรียบเทียบ Diebold–Mariano พื้นฐานคืออะไร?
เลือกคำตอบเพื่อดูคำอธิบาย
อภิธานศัพท์ออปชัน
Variation in the conditional error variance across regressor values or states, invalidating an equal-variance covariance formula.
อ่านคู่มือฉบับละเอียดFamily-wise error rateThe probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
อ่านคู่มือฉบับละเอียด