اختبار ديبولد–ماريانو: مقارنة دقة التوقعات
تعرّف على ما يقارنه اختبار ديبولد–ماريانو، وكيف تؤثر فروق الخسارة والارتباط التسلسلي في الإحصائية، ولماذا لا تعني دقة التوقع تحقيق أرباح تداول.
في هذا الدليليقارن الاختبار الخسارة المتوقعة للتوقعات
ملخص موجز
يسأل اختبار ديبولد–ماريانو (DM) عمّا إذا كان لأسلوبي التوقع الخسارة المتوقعة نفسها على نتائج فعلية متطابقة. ويستخدم سلسلة من فروق الخسارة، لذلك تؤثر دالة الخسارة وأفق التوقع والاعتماد بين التواريخ في النتيجة. ورفض الفرضية الصفرية يدعم وجود فرق ضمن تصميم التقييم المحدد؛ لكنه لا يثبت استمرار تفوق أحد النموذجين أو ربحية استراتيجية تداول بعد التكاليف.
يقارن الاختبار الخسارة المتوقعة للتوقعات
يقارن اختبار ديبولد–ماريانو توقعين للمتغير المستهدف نفسه في تواريخ التقييم نفسها. عند كل نقطة إصدار، يجب أن يعتمد الأسلوبان على النتيجة الفعلية والأفق ووقت قطع المعلومات نفسها. ثم يقيّم الاختبار ما إذا كان متوسط خسارة أحد الأسلوبين يختلف بصورة منهجية عن الآخر، مع السماح بتغير فروق الخسارة عبر الزمن.
صاغ ديبولد وماريانو المسألة لدالة خسارة عامة، لا لمتوسط مربع الخطأ وحده. وتعرض دراستهما الأصلية اختبارات للفرضية الصفرية القائلة إن دقة التوقعات المتنافسة متساوية (Diebold and Mariano, 1995). والمقصود بـ«الدقة» هنا انخفاض الخسارة المتوقعة وفق الدالة المختارة للمقارنة. ولا يعني ذلك أن التوقع حقيقة، أو يفسر السببية، أو يحسن المعايرة في كل أجزاء التوزيع، أو يفيد في كل قرار.
لنفترض أن النموذجين A وB يتوقعان العائد المستقبلي نفسه في الوقت نفسه. لا يختبر DM ما إذا كان أحد معاملات النموذج يساوي صفرًا، ولا ما إذا كانت القيم الملائمة للنموذجين متطابقة في عينة التقدير. بل يقارن كيف تتحول أخطاء التوقع إلى الخسارة المختارة في عينة التقييم.
حدّد التصميم قبل تفسير الإحصائية: المتغير المستهدف، ونقاط إصدار التوقع، والأفق، ودالة الخسارة، ومعالجة النتائج المفقودة، وجدول إعادة التقدير، والفرضية البديلة أحادية الطرف أو ثنائية الطرف. فهذه الاختيارات تحدد السؤال. وإذا اختلفت بين النموذجين، لم يعد فرق الخسارة مقارنة على شروط متماثلة.
عرّف التوقعات المزدوجة وفرق الخسارة
لتكن $y_t$ القيمة الفعلية للهدف عند نقطة التوقع $t$، ولتكن $\hat y_{A,t}$ و$\hat y_{B,t}$ توقعَي النموذجين A وB. أخطاء التوقع هي $e_{A,t}=y_t-\hat y_{A,t}$ و$e_{B,t}=y_t-\hat y_{B,t}$. وباستخدام دالة خسارة $L$، يكون فرق الخسارة في التاريخ الواحد:
$$ d_t=L(e_{A,t})-L(e_{B,t}) $$
وفق اصطلاح الإشارة هذا، يعني متوسط $d_t$ السالب أن خسارة A المرصودة أقل، بينما يعني المتوسط الموجب أن خسارة B أقل. الفرضية الصفرية للمجتمع هي $E[d_t]=0$. تبحث الفرضية البديلة ثنائية الطرف عن فرق في أي من الاتجاهين؛ أما أحادية الطرف فتختبر اتجاهًا محددًا مسبقًا. لا تختَر الاتجاه بعد معرفة النموذج الفائز.
تعطي الخسارة التربيعية $L(e)=e^2$ الأخطاء الكبيرة وزنًا يفوق تناسبها، بينما تقل هيمنة خطأ كبير منفرد مع الخسارة المطلقة $L(e)=|e|$. وقد تناسب خسارة الكميات هدفًا غير متماثل. يمكن لتغيير دالة الخسارة أن يعكس ترتيب النماذج، لذلك لا معنى وحيدًا لعبارة «التوقع الأفضل» قبل تحديد الخسارة. وتؤكد مراجعة تاشمان لاختبارات التوقع خارج العينة أيضًا ضرورة ملاءمة التقييم لمشكلة التوقع (Tashman, 200000065-0)).
استخدم نقاط التوقع والنتائج الفعلية نفسها للنموذجين. فإذا غاب عن أحدهما توقع تاريخ صعب، فإن حذف هذا التاريخ سرًا لذلك النموذج وحده يغير عينة المقارنة. وإذا كان النموذج سيُعاد تقديره شهريًا في التشغيل الفعلي، فأنشئ توقعات التقييم وفق القاعدة ذاتها؛ فالتوقع بمعاملات ثابتة يجيب عن سؤال مختلف. يشرح دليل التحقق المتتابع walk-forward كيفية إنتاج توقعات مرتبة زمنيًا دون استخدام بيانات المستقبل.
مثال بأربع نقاط توقع يوضح معنى الفرق المتوسط
لنفترض أربع نقاط توقع افتراضية، مع قياس الهدف والأخطاء بالنقاط المئوية. أخطاء A هي $[1,2,0,1]$ وأخطاء B هي $[2,1,1,1]$. تشير كل ثنائية إلى العائد الفعلي وفترة التوقع نفسيهما. الأرقام افتراضية للتوضيح الحسابي فقط.
في ظل الخسارة التربيعية، تكون خسائر A هي $[1,4,0,1]$ ومتوسط مربع الخطأ $(1+4+0+1)/4=1.50$ نقطة مئوية مربعة. وخسائر B هي $[4,1,1,1]$، ومتوسط مربع الخطأ $(4+1+1+1)/4=1.75$. في هذه النتائج الأربع، ينخفض MSE لدى A بمقدار 0.25 نقطة مئوية مربعة.
فروق الخسارة بحسب التاريخ، $d_t=L(e_{A,t})-L(e_{B,t})$، هي $[-3,3,-1,0]$. ومتوسطها $(-3+3-1+0)/4=-0.25$، وهو يساوي متوسط خسارة A ناقص متوسط خسارة B. تدعم الإشارة السالبة A وفق هذا الاصطلاح، لكنها لا تبين بعد ما إذا كان الفرق يتجاوز ضوضاء العينة. فأربع ثنائيات من التوقعات لا تكفي كدليل إحصائي مقنع.
كما يغير تعريف الخسارة معنى «الأفضل». في مثال افتراضي آخر، الأخطاء المطلقة لـC هي $[0,0,0,3]$ ولـD هي $[1,1,1,1]$. مع الخسارة المطلقة، متوسط C هو 0.75 ومتوسط D هو 1، لذا يُفضّل C. أما مع الخسارة التربيعية، فمتوسط C هو 2.25 ومتوسط D هو 1، لذا يُفضّل D. لا يحسم الاختبار هذا الخلاف قبل تقرير الأخطاء الأهم.
<!-- Illustration placement: after this section; text-free conceptual scene showing two forecast paths against one realized path, with visibly different miss distances and no labels or numerical claims. -->
يقيّس إحصاء DM فرق الخسارة بقدر عدم اليقين
متوسط فرق الخسارة في العينة هو $\bar d=T^{-1}\sum_{t=1}^{T}d_t$، حيث $T$ عدد نتائج التوقع المزدوجة. ويتوقف الخطأ المعياري على التباين طويل الأجل لـ$d_t$، لا على تباينه في تاريخ منفرد فقط. والصيغة العامة لإحصاء الاختبار هي:
$$ DM=\frac{\bar d}{\sqrt{\widehat{\Omega}/T}} $$
يقدّر $\widehat{\Omega}$ التباين طويل الأجل لسلسلة فروق الخسارة. وإذا كانت التواريخ مستقلة، فسيقترب وفق المقدر المختار من تباين $d_t$. لكن خسائر التوقعات كثيرًا ما تتكتل: فقد ترفع فترة التقلب العالي أخطاء النموذجين، وقد يجعل الهدف على $h$ خطوات نوافذ الأخطاء المتجاورة تشترك في عوائد فعلية. وقد يؤدي تجاهل الاعتماد الموجب إلى تقدير الخطأ المعياري بأقل من قيمته وإظهار دليل أقوى مما هو عليه.
يقدّر بناء HAC شائع التغايرات الذاتية $\\hat\\gamma_k$ لفرق الخسارة بعد تمركزه، ثم يجمعها على النحو $\\widehat{\\Omega}=\\hat\\gamma_0+2\\sum_{k=1}^{q}w_k\\hat\\gamma_k$. وبأوزان بارتليت حتى عرض النطاق $q$، يكون $w_k=1-k/(q+1)$. وقد طوّر نيوي وويست مقدر تغاير موجبًا شبه محدد ومتسقًا مع عدم تجانس التباين والارتباط الذاتي (Newey and West). النواة وعرض النطاق خياران تنفيذيان؛ اذكرهما واخترهما بما يناسب تصميم التوقع لا للحصول على قيمة p مرغوبة. ويتناول دليل الأخطاء المعيارية HAC مسألة تقدير التغاير الأوسع.
تُقارن إحصائية DM القياسية، وفق شروط الانتظام، بتوزيع طبيعي معياري تقاربي. وتشير القيمة المطلقة الكبيرة إلى أن متوسط فرق الخسارة المرصود كبير نسبةً إلى عدم اليقين المقدّر. وتوضح الإشارة أي النموذجين سجل خسارة أقل وفق الترتيب المحدد؛ أما قيمة p فلا تقيس حجم الفرق أو قيمته الاقتصادية، وليست احتمال صحة الفرضية الصفرية أو نجاح توقع مستقبلي.
تتداخل التوقعات متعددة الخطوات، لذا تهم معالجة العينة المحدودة
عند إصدار توقع كل فترة لهدف يقع بعد عدة فترات، تتداخل نوافذ التقييم. فالتوقع الشهري للعائد التراكمي للأشهر الثلاثة المقبلة يشترك في شهرين من الأشهر الثلاثة مع التوقع الصادر بعد شهر. وحتى إذا كانت العوائد الشهرية مستقلة، قد ينشئ التداخل ارتباطًا تسلسليًا في أخطاء التوقع وفروق الخسارة.
في إعداد أساسي لأفق $h$ خطوات، من الطبيعي أن يعكس حساب التباين الاعتماد حتى الإبطاء $h-1$ على الأقل. لكن هذه ليست قاعدة عامة لعرض النطاق؛ فقد تضيف إعادة التقدير المتحركة، والأهداف المستمرة، وتكتل التقلب، ودالة الخسارة اعتمادًا أطول. سجّل الأفق والفاصل بين نقاط التوقع وسبب اختيار قطع HAC أو مقدر تباين آخر. عدد صفوف التوقع لا يساوي تلقائيًا عدد الأدلة المستقلة.
قد لا يحافظ الاختبار التقاربي الأصلي على مستوى الدلالة الفعلي في العينات المتوسطة. واقترح هارفي وليبورن ونوبولد تصحيحًا للعينة المحدودة لمقارنة متوسط مربعات أخطاء التوقع (HLN, 199700719-4)). ومن الصيغ الشائعة لأفق $h$ وعدد توقعات $T$ ضرب إحصاء DM في:
$$ DM_{HLN}=DM\sqrt{\frac{T+1-2h+h(h-1)/T}{T}} $$
تقارن الإحصائية المعدلة عادة بتوزيع $t$ بدرجات حرية $T-1$. وعند $T=60$ و$h=5$ يبلغ المضاعف نحو $0.925$. يوضح المثال حساب التصحيح فقط؛ ولا يعني أن 60 مشاهدة تكفي لنموذج بعينه أو أن الافتراضات متحققة. يعالج التصحيح مشكلة محددة للعينة الصغيرة، لكنه لا يصلح تسرب المعلومات، أو هدفًا غير صالح، أو اعتمادًا غير ممثل، أو اختيار النماذج المتكرر، أو دالة خسارة سيئة التحديد.
تحتاج النماذج المتداخلة إلى منطق مختلف لمقارنة التوقعات
قد يكون النموذج A نسخة مقيدة من B؛ كأن يضيف B متغيرات تنبؤية إلى A. وحتى إذا لم تحمل المتغيرات الإضافية قيمة تنبؤية سكانية وفق الفرضية الصفرية، فقد تضيف معاملاتها المقدرة ضوضاءً إلى توقعات B. لذلك قد يسجل النموذج الأكبر MSE مرصودًا أعلى حتى إن لم تحسن المتغيرات الإضافية عملية التوقع الأساسية. ولا ينطبق منطق تساوي الدقة المصمم للمنافسين غير المتداخلين تلقائيًا دون تعديل.
طوّر كلارك وويست اختبارات طبيعية تقريبية لتساوي الدقة التنبؤية في النماذج المتداخلة، وعدّلا مقارنة الأخطاء التربيعية لمراعاة ضوضاء التقدير التي يضيفها النموذج الأكبر (Clark and West, 2007). وهذا ليس بديلًا عامًا عن كل اختبارات DM؛ بل صُمم لسؤال محدد عن النماذج المتداخلة ودالة خسارة وإعداد تقاربي معين. حدّد ما إذا كان أحد النموذجين متداخلًا في الآخر، واختر اختبارًا يتوافق توزيعه الصفري مع التصميم. لا تفترض أن قيمة DM القياسية التي يعرضها البرنامج تناسب كل علاقة بين النماذج.
وتهم فروق أخرى أيضًا. فالتوقع ذو MSE الأقل لا يحسن بالضرورة تغطية الفواصل أو معايرة الاحتمالات أو دقة الاتجاه أو القرار اللاحق. وقد تستخدم المقارنة خارج العينة مجموعة اختبار غير صالحة إذا جرى الاطلاع عليها مرارًا أثناء تطوير النموذج. اذكر علاقة النماذج وطريقة تقديرها وأفق التوقع والبيانات المستخدمة لإصدار كل توقع.
دقة التوقع ليست ميزة تداول
تقيّم نتيجة DM خسارة التوقع؛ أما قرار التداول فيقيّم مسار العائد والمخاطر. لا يضمن انخفاض MSE لعائد الفترة التالية أن تحدد الإشارة جانب الصفقة الصحيح بما يكفي، أو تضبط حجم المركز، أو تتحمل دوران التداول والفارق السعري وأثر السوق والرسوم وتكلفة الاقتراض والتمويل وتأخر التنفيذ. وبالعكس، قد يحسن توقع ذو متوسط مربع خطأ أعلى قليلًا قرارًا ما إذا كان أدق حين تكون الاستراتيجية شديدة التعرض. وقد تحتاج خسارة هذا الادعاء إلى تمثيل القرار الفعلي بدلًا من مقياس توقع عام ملائم.
وقد يكون الفرق الدال إحصائيًا صغيرًا اقتصاديًا. اعرض حجم متوسط فرق الخسارة بوحدات قابلة للتفسير مع عدم اليقين، لا قيمة p أو تسمية الفائز وحدهما. وإذا كان الادعاء يتعلق بنتيجة محفظة، فأعد تشغيل قاعدة القرار الكاملة والمثبتة على بيانات لاحقة مناسبة بافتراضات تداول واقعية، واعرض النتائج الصافية منفصلة. لا يحسب DM هذه النتائج ولا يخصم التكاليف ما لم تُصمم الخسارة صراحةً لذلك.
ولا يصحح الاختبار البحث بين نماذج وأهداف وآفاق ودوال خسارة وفترات زمنية وقواعد تداول عديدة، ثم نشر المقارنة الأكثر ملاءمة فقط. تخلق الاختبارات الثنائية المتكررة مشكلة انتقاء أخرى. احتفظ بسجل البحث وطبّق أسلوبًا للاختبارات المتعددة يناسب مجموعة الادعاءات. يشرح دليل الاختبارات المتعددة ومعدل الاكتشافات الكاذبة سبب تضليل العتبات المعتادة بعد بحث واسع. DM أداة تقييم، لا تصحيح للتنقيب في البيانات.
أبلغ عن تفاصيل تكفي لإعادة المقارنة
يحدد التقرير الواضح الهدف ووحداته، ووقت قطع المعلومات، ونقاط التوقع، والأفق، وجدول إعادة التقدير، وعينة التقييم المشتركة. ويذكر دالة الخسارة وإشارة $d_t$، ومتوسط خسارة كل نموذج ومتوسط الفرق، والفرضية أحادية الطرف أو ثنائية الطرف التي اختيرت مسبقًا، ومقدر التباين والنواة وعرض النطاق وإحصائية الاختبار والتوزيع المرجعي وقيمة p، وفاصل الثقة أو مقياس عدم اليقين عند الاقتضاء.
اكشف كذلك ما إذا كانت النماذج متداخلة، وكيف عولجت النتائج المفقودة والقيم المتطرفة، وعدد المواصفات البديلة التي فُحصت، وما إذا أثرت فترة التقييم في اختيار النموذج. اعرض مقدار الفرق بدلًا من الاكتفاء بتجاوز عتبة. وقد تكشف سلسلة $d_t$ أو رسم الفروق التراكمية تغيرات أنظمة تخفيها المتوسطات، لكن الرسم لا يعوّض الاستدلال الذي يراعي الاعتماد.
وفي التداول الكمي، اشرح التحويل من التوقع إلى الإجراء: عتبة الإشارة، وحجم المركز، وموعد إعادة الموازنة، وضوابط المخاطر، وسعر التنفيذ، وافتراضات التكلفة. لا يقارن DM إلا سلسلة خسائر التوقع التي تدخلها إليه. ولا يصدّق على خط البيانات، ولا يجعل عينات تقييم مختلفة قابلة للمقارنة، ولا يثبت السببية، ولا يضمن استمرار الترتيب التاريخي. استخدمه جزءًا شفافًا من تقييم النموذج إلى جانب تصميم توقع يحترم الترتيب الزمني وتقييم صريح على مستوى القرار.
أسئلة شائعة
Q1هل يقارن اختبار ديبولد–ماريانو معاملات النماذج؟
لا. يقارن الخسارة المتوقعة لأخطاء التوقع التي تنتجها طريقتان على نتائج مزدوجة. أما اختبار المعامل فيطرح سؤالًا مختلفًا عن معلمة في النموذج.
Q2هل يمكن استخدام الاختبار لتوقعات عدة فترات مقبلة؟
نعم، لكن تداخل نوافذ الأهداف قد يجعل فروق الخسارة المتتابعة مترابطة تسلسليًا. استخدم مقدر تباين، وتصحيحًا للعينة المحدودة عند الحاجة، يتوافقان مع الأفق وتصميم النموذج؛ وسجّل اختياراتك.
Q3هل تعني النتيجة الدالة إحصائيًا أن التوقع الأفضل سيحقق المال؟
لا. إنها تدعم وجود فرق في خسارة التوقع المختارة ضمن تصميم التقييم. وتعتمد الربحية أيضًا على كيفية تحويل التوقعات إلى مراكز، والمخاطر المتخذة، والتنفيذ الفعلي وتكاليف التداول.
المصادر والقراءة الإضافية
الإبلاغ عن مشكلة
سنُعدّ رسالة تتضمن رابط هذا المقال. لن يصل البلاغ إلى Mark إلا بعد إرسالها
تحقق سريع
بعد قراءة الدليل، اختبر نفسك في 3 أسئلة
السؤال 01
ما الفرضية الصفرية في مقارنة ديبولد–ماريانو الأساسية؟
اختر إجابة لرؤية الشرح
معجم الخيارات
Variation in the conditional error variance across regressor values or states, invalidating an equal-variance covariance formula.
اقرأ الدليل المتعمقFamily-wise error rateThe probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
اقرأ الدليل المتعمق