مقارنة درجة براير والخسارة اللوغاريتمية للتنبؤات الاحتمالية
قارن درجة براير والخسارة اللوغاريتمية للتنبؤات الثنائية، واحسبهما يدويًا، وافهم قواعد التسجيل السليمة والمعايرة ومهارة التنبؤ
في هذا الدليلمعدل الإصابة يهدر الاحتمال الذي تنبأت به
ملخص موجز
يعبّر التنبؤ الاحتمالي عن احتمال وقوع حدث، لا عن النتيجة الأرجح فحسب. تقارن درجة براير والخسارة اللوغاريتمية هذه الاحتمالات بالنتائج التي تحققت. كلتاهما قاعدة تسجيل سليمة، لكنهما تعاقبان الأخطاء بطرق مختلفة. لذلك لا يعني انخفاض الدرجة شيئًا ما لم يُثبّت الحدث والعينة واتفاقية الحساب والمرجع.
معدل الإصابة يهدر الاحتمال الذي تنبأت به
لنفترض أنك تسجل ما إذا كان نموذج قد توقّع «صعودًا» أو «هبوطًا» على نحو صحيح. يعامل معدل الإصابة توقعًا باحتمال 51% وتوقعًا باحتمال 99% بالطريقة نفسها إذا كان كلاهما صحيحًا. كما يعامل توقعًا بنسبة 49% وآخر بنسبة 1% بالطريقة نفسها إذا أخفقا. وهكذا تضيع درجة الثقة، مع أنها قد تهم عندما تختلف العوائد أو المخاطر باختلاف القرار.
يُسنِد التنبؤ الاحتمالي الثنائي القيمة \(p_t\) بين صفر وواحد إلى حدث محدد بوضوح عند وقت إصدار التنبؤ \(t\). وتُسجّل النتيجة لاحقًا على أنها \(y_t=1\) إذا وقع الحدث و\(y_t=0\) إذا لم يقع. تقيّم قاعدة التسجيل التنبؤ مع النتيجة معًا. تستخدم درجة براير مربع خطأ الاحتمال، بينما تستخدم الخسارة اللوغاريتمية سالب لوغاريتم احتمال النتيجة التي وقعت فعلًا.
تساعد الدرجتان في مقارنة التنبؤات الاحتمالية، بما فيها احتمالات الأحداث الصادرة عن نموذج تداول. لكنهما لا تثبتان وحدهما أن التنبؤ معاير، أو أنه يتفوق على مرجع معقول، أو أن التداول بناءً عليه سيحقق ربحًا. يشرح دليل مينسر–زارنوفيتز انحدار معايرة خطيًا مختلفًا للتنبؤات العددية النقطية.
عرّف حدثًا واحدًا وطابق كل تنبؤ مع نتيجته
قبل الحساب، عرّف الحدث بطريقة تسمح بحسم وقوعه باستمرار. فالسؤال «هل سيرتفع الأصل؟» غير مكتمل ما لم تحدد الأصل ومصدر السعر ووقتي البداية والنهاية والعملة وطريقة حساب العائد وكيفية معالجة السجلات الناقصة أو المصححة. وفي الحدث الاقتصادي، سجّل الإصدار ونسخة البيانات المستخدمة لتحديد النتيجة. لا تقارن تنبؤين إذا استُخدمت لهما تعريفات مختلفة أو تواريخ مختلفة.
احتفظ بكل تنبؤ كما كان متاحًا عند صدوره. يجب أن يستخدم الاحتمال الصادر عند \(t\) المعلومات المتاحة حتى الموعد المحدد، وأن يُقرن بنتيجة الأفق نفسه. وقد تغيّر سلسلة بيانات منقحة أو إغلاق بورصة لاحق أو قاعدة تصنيف اختيرت بعد معرفة النتيجة الهدف بهدوء أو تُدخل معلومات مستقبلية.
في التنبؤات المتجددة، احتفظ بإصدار النموذج ونسخة بيانات الإدخال والطابع الزمني والاحتمال وقاعدة حسم النتيجة. استخدم مجموعة واحدة من أوقات إصدار التنبؤ عند مقارنة النماذج. وإذا غاب احتمال، فسجّل الاستبعاد وطبّق قاعدة العينة نفسها على جميع البدائل. تجعل هذه السجلات الدرجة قابلة لإعادة الإنتاج بدلًا من كونها ملخصًا لجدول متغير.
احسب درجة براير من مربعات أخطاء الاحتمال
لحدث ثنائي واحد، تكون خسارة براير في الحالة \(t\):
BSₜ = (pₜ − yₜ)²
ومتوسط درجة براير على \(n\) من التنبؤات هو:
BS = (1/n) Σₜ (pₜ − yₜ)²
الأقل أفضل، والصفر مثالي، ويتراوح هذا التعريف للحدث الواحد من صفر إلى واحد. مثلًا، إذا كان التنبؤ \(p=0.70\) ووقع الحدث، فالخسارة \((0.70-1)^2=0.09\). وإذا تبع التنبؤ نفسه عدم وقوع الحدث، تصبح \((0.70-0)^2=0.49\). يكلف الإخفاق الواثق أكثر من الإخفاق المتحفظ، لكن العقوبة تبقى محدودة.
تحقق من الصيغة عند مقارنة أرقام منشورة. فبعض الاتفاقيات تجمع مربعات الأخطاء عبر كل فئات التنبؤ متعدد النتائج؛ وقد يكون مجموع متجه الفئتين في الحالة الثنائية ضعف خسارة الحدث الواحد أعلاه. لا يتغير ترتيب النماذج في حدث ثابت عند ضرب كل الدرجات في اثنين، لكن المستوى العددي لا يقارن باتفاقية أخرى ما لم يُذكر المقياس.
احسب الخسارة اللوغاريتمية ولاحظ بروز الإخفاقات القصوى
للحدث الثنائي، تكون الخسارة اللوغاريتمية:
LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]
إذا وقع الحدث فالخسارة هي \(-\log(p_t)\)، وإذا لم يقع فهي \(-\log(1-p_t)\). لذلك يحصل تنبؤ صحيح باحتمال 70% على خسارة \(-\log(0.70)\approx0.357\)، بينما يحصل التنبؤ نفسه إذا أخطأ على \(-\log(0.30)\approx1.204\). يوسّط متوسط الخسارة اللوغاريتمية عقوبات الحالات، ولا يملك حدًا أعلى ثابتًا عندما يُسنِد التنبؤ احتمالًا ضئيلًا جدًا إلى الحدث الذي يقع.
عند \(p=0\) أو \(p=1\)، تكون الخسارة لتنبؤ واثق وخاطئ لا نهائية. إذا قصّت البرمجية الاحتمالات عند حد أدنى صغير مثل \(\varepsilon\) لتجنب اللانهاية، فأفصح عن هذا الحد وطبّقه باستمرار قبل الاطلاع على النتائج. فالقصّ يغيّر قاعدة التقييم العددية، ولا ينبغي إخفاؤه بوصفه تفصيلًا لتنظيف البيانات.
قد ترتب درجة براير والخسارة اللوغاريتمية التنبؤات نفسها بطرق مختلفة لأن منحنى العقوبة يختلف. تفرض الخسارة اللوغاريتمية تكلفة عالية جدًا على إسناد احتمال شبه معدوم إلى حدث وقع، بينما لا تتجاوز خسارة براير الثنائية واحدًا. حدّد مسبقًا الدرجة المختارة، وإذا اعتمد القرار على احتمالات قصوى فاعرض الدرجتين بدلًا من اختيار النتيجة الأفضل بعد رؤية البيانات.
<!-- learn:illustration -->

تكافئ قواعد التسجيل السليمة الاحتمالات الصادقة في التوقع
تكون قاعدة التسجيل سليمة إذا عظم المتنبئ مكافأته المتوقعة، أو خفّض خسارته المتوقعة، عند الإبلاغ عن الاحتمال الذي يعتقده فعلًا. وتكون سليمة تمامًا إذا كانت القيمة الصادقة هي الخيار الأمثل الوحيد. درجتا براير واللوغاريتمية سليمتان تمامًا للتنبؤات الاحتمالية الثنائية وفق تعريفاتهما المعتادة (Gneiting وRaftery، 2007). وهذا سبب منهجي لتقييم الاحتمالات بدل تحويلها أولًا إلى تسميات صحيحة أو خاطئة.
«السلامة» خاصية متوقعة، لا وعد بنتيجة كل عينة محققة. فقد يبلغ المتنبئ عن احتمال صادق قدره 70% ثم يخطئ في حالة واحدة، وقد تكون درجته في عينة صغيرة أسوأ من درجة من خمّن. نحتاج إلى تنبؤات متكررة وقابلة للمقارنة لتقدير الأداء المتوسط. كما تهم الحوافز: إذا واجه الشخص قاعدة مكافأة منفصلة، فلا تضمن الدرجة وحدها أن الاحتمال المبلّغ يعكس اعتقاده.
ولا تقيس أي من الدرجتين المعايرة وحدها. فقد يمزج المجموع بين مدى قرب الاحتمالات من التكرارات المرصودة وبين قدرتها على التمييز بين الحالات ذات النتائج المختلفة. وقد يصدر النموذج احتمالات متباعدة لكنه غير معاير منهجيًا؛ وقد يكون نموذج المعدل الأساسي معايرًا إجمالًا لكنه لا يقدم معلومات خاصة بكل حالة.
اقرأ تفكيك براير إلى الموثوقية والتمييز وعدم اليقين
يقسم تفكيك مورفي متوسط درجة براير إلى ثلاثة حدود (Murphy، 1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)):
BS = الموثوقية − التمييز + عدم اليقين
للمجموعات \(k\) من التنبؤات ذات الاحتمالات المتشابهة، لنرمز إلى حصة كل مجموعة من العينة بـ \(w_k\)، ومتوسط احتمالها بـ ̅pₖ، وتكرار الحدث المرصود فيها بـ ̅yₖ، والتكرار الإجمالي للحدث بـ ̅y. وتكون المكونات المجمعة:
الموثوقية = Σₖ wₖ(̅pₖ − ̅yₖ)² التمييز = Σₖ wₖ(̅yₖ − ̅y)² عدم اليقين = ̅y(1 − ̅y)
يكون خطأ الموثوقية أقل أفضل: ينبغي أن يطابق تكرار الحدث في المجموعة الاحتمال المعلن لها. ويكون التمييز الأعلى أفضل: ينبغي أن تختلف تكرارات الحدث بين المجموعات عن المعدل الأساسي الكلي. أما عدم اليقين فيعكس مدى تكرار الحدث في العينة ولا يُنسب إلى نموذج التنبؤ. يوضح التفكيك كيف يمكن لنموذجين لهما درجة براير واحدة أن يختلفا في نقاط القوة.
يكون التفكيك التجريبي دقيقًا عندما تجمع الحالات ذات الاحتمال المتوقع نفسه. أما إذا جُمعت الاحتمالات المستمرة في فئات، فيكون التفكيك دقيقًا للتنبؤ بعد تجميعه، لا للفروق التي أخفاها التجميع بين الاحتمالات الأصلية. ويتطلب تجميع الاحتمالات اختيار حدود للفئات. قد يعطي مخطط الموثوقية بعشر فئات متساوية العرض صورة مختلفة عن فئات الكميات، ولا سيما في العينات الصغيرة أو قرب أطراف الاحتمال. اعرض أعداد الحالات وعدم اليقين في كل فئة، وتعامل مع التفكيك المجمّع بوصفه تشخيصًا لا طريقة لإزالة خطأ المعاينة. ولا تعدّ مخططات المعايرة دليلًا مستقلًا على الموثوقية مستقبلًا.
استخدم مرجعًا قبل وصف الدرجة بأنها مهارة
انخفاض الدرجة الخام مقارنة بنموذج آخر هو مقارنة، لكنه لا يعني بعدُ تحسنًا عن خط أساس مفيد. تقارن درجة مهارة براير نظام التنبؤ بمرجع محدد بالاسم:
BSS = 1 − BS_model / BS_reference
تساوي القيمة صفرًا المرجع، وتشير القيمة الموجبة إلى تحسن، والسالبة إلى أداء أسوأ وفق هذا التعريف. وتعني القيمة واحدًا أن خسارة براير للنموذج صفر عندما تكون خسارة المرجع موجبة. اختر المرجع بما يناسب القرار ومجموعة المعلومات. فقد يكون المعدل الأساسي التاريخي الثابت أو تكرار الحدث في نافذة التدريب أو إجراء تنبؤ تشغيلي قائم مناسبًا بحسب المهمة.
لا تحسب المرجع من نتائج التقييم المستقبلية إذا لم تكن متاحة وقت إصدار التنبؤ. وفي السلاسل الزمنية، قد يكون التكرار التاريخي المتراكم أو المتجدد خط أساس تشغيليًا أنسب من معدل العينة كاملة. وإذا كانت درجة المرجع صفرًا، فالنسبة غير معرّفة؛ اشرح كيفية تكوين خط الأساس واعرض درجتي النموذج والمرجع الخام إلى جانب BSS.
تعتمد درجة مهارة براير على المرجع ومعدل الحدث. فالدرجة نسبةً إلى تنبؤ بالمعدل الأساسي غير المشروط تجيب عن سؤال مختلف عن الدرجة مقارنة بنموذج تشغيلي حالي. لا تقارن قيم BSS بين الدراسات قبل التحقق من تعريف الحدث والتنبؤ المرجعي وفترات العينة واتفاقية الفئة الثنائية أو متعددة الفئات.
قارن النماذج على نتائج مزدوجة وخارج العينة
أنشئ الاحتمالات بترتيب زمني واحجز فترة تقييم لم تُستخدم لضبط النموذج أو اختيار الخصائص أو تحديد العتبة. وقيّم كل نموذج على النتائج المحسومة وأوقات الإصدار نفسها. ولخسارة مختارة، عرّف فرق الخسارة المزدوج كما يلي:
dₜ = Lₐ,ₜ − Lᵦ,ₜ
وفق هذه الإشارة، يعني المتوسط الموجب أن متوسط خسارة النموذج B أقل. يمكن لإطار اختبار Diebold–Mariano اختبار متوسط فرق الخسارة إذا ناسبت افتراضاته وتقدير تباينه تصميم الدراسة. وإذا كان السؤال هو تغيّر الجودة النسبية للدرجات مع الظروف المعروفة وقت التنبؤ، فيشرح دليل Giacomini–White تلك المقارنة الشرطية. وقد تجعل أوقات الإصدار المتكررة أو نوافذ الحدث المتداخلة أو البحث بين النماذج الفروق معتمدة أو منتقاة، فيبالغ الخطأ المعياري الساذج أو قيمة احتمالية واحدة غير مصححة في قوة الدليل.
حدّد الحدث والأفق والعينة والدرجة الأساسية والمرجع واتجاه المقارنة قبل الاطلاع على النتائج. أبلغ عن متوسط درجتي براير والخسارة اللوغاريتمية وعدد الحالات وتعريف النموذج والمرجع وقاعدة قص الاحتمالات وأي تصحيح للاعتماد أو البحث. يساعد عرض مخطط الموثوقية وفروق الخسارة المزدوجة مع المجموع في تفسير ما تغيّر. يمكن لطرق دمج التنبؤات جمع تنبؤات متعددة، لكن يجب تقييم التوليفة النهائية في فترة لم تُستخدم لاختيارها.
الدرجات ليست بوحدات مشتركة. ففرق براير قدره 0.01 لا يساوي مباشرة فرقًا بالمقدار نفسه في الخسارة اللوغاريتمية. وانخفاض الدرجة لا يثبت أيضًا صحة نموذج الاحتمال؛ إنه دليل على أداء التنبؤات المقيمة في النتائج المحددة.
افصل جودة التنبؤ عن ربحية التداول
لا يدعم الاحتمال قرارًا تداوليًا إلا من خلال قاعدة تحوله إلى إجراء. ويتوقف القرار أيضًا على حجم العائد والخسائر عند الخطأ وأسعار التنفيذ والفروق والعمولات والانزلاق والتمويل والاقتراض وحدود رأس المال والوقت الذي يصبح فيه التنبؤ قابلًا للتداول. تقيّم قاعدة التسجيل احتمالًا متوقعًا ولا تتضمن هذه التكاليف ولا تختار حجم المركز.
قد يحسن النموذج متوسط الخسارة اللوغاريتمية دون أن يحسن قاعدة تداول معينة؛ فقد تتداول القاعدة في نطاق احتمالات واحد فقط أو تستجيب لأفق مختلف. وعلى العكس، قد تتركز إشارة قرار مفيدة في مجموعة صغيرة لا تؤثر كثيرًا في الدرجة الإجمالية. بعد تقييم التنبؤ، قيّم قاعدة القرار المحددة مسبقًا على تواريخ لم تُستخدم لاختيارها، باستخدام عوائد صافية واقعية وتقديرات لعدم اليقين.
يسمح التقرير الكافي لباحث آخر بإعادة إنتاج الحدث والاحتمال والنتيجة وصيغة الدرجة واتفاقيتها والمرجع والعينة ووقت التقييم. وينبغي أن يوضح ما إذا كانت الاحتمالات خارج العينة، وما إذا كانت النتائج متداخلة، وكيف عولجت الحالات الناقصة، وعدد النماذج أو اختيارات الدرجات التي جُربت. تجعل هذه الممارسات درجة التنبؤ مفيدة من دون تحويلها إلى ادعاء بربح مستقبلي.
أسئلة شائعة
Q1هل تكون درجة براير الأقل أفضل دائمًا؟
تكون الأقل أفضل عندما يتطابق تعريف الحدث والعينة واتفاقية التسجيل وترميز النتيجة. وقد لا تقارن مباشرة درجة حدث أو اتفاقية متعددة الفئات بأخرى.
Q2هل تثبت درجة براير الجيدة معايرة الاحتمالات؟
لا. تجمع درجة براير الإجمالية بين الموثوقية والتمييز وعدم يقين الحدث. افحص تشخيصات المعايرة وعدم يقين العينة أيضًا.
Q3هل أستخدم درجة براير أم الخسارة اللوغاريتمية؟
اختر قبل تقييم النتائج. خسارة براير محدودة وتعتمد مربع خطأ الاحتمال، بينما تعاقب الخسارة اللوغاريتمية الاحتمالات الخاطئة الواثقة أكثر. ينبغي أن توجه عواقب المهمة وحساسيتها المقصودة الاختيار.
Q4هل تعني درجة الاحتمال الأفضل أن استراتيجية التداول مربحة؟
لا. تقيم الدرجة التنبؤ لا القرار بعد العوائد وتكاليف التنفيذ والتمويل وحجم المركز واختيار النموذج. الأبحاث الأصلية - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)
المصادر والقراءة الإضافية
الإبلاغ عن مشكلة
سنُعدّ رسالة تتضمن رابط هذا المقال. لن يصل البلاغ إلى Mark إلا بعد إرسالها
تحقق سريع
بعد قراءة الدليل، اختبر نفسك في 3 أسئلة
السؤال 01
وقع حدث ثنائي بعد تنبؤ باحتمال 70%. ما خسارة براير وفق اتفاقية الحدث الواحد؟
اختر إجابة لرؤية الشرح
معجم الخيارات
تعريفات دقيقة للمصطلحات الأساسية، من خيارات الشراء والبيع وسلسلة الخيارات إلى التقلب الضمني والحساسيات وفارق العرض والطلب
تصفح معجم الخيارات