Skip to content
جميع أدلة الخيارات والعقود المستقبلية
لماذا يحتاج الفائز في البحث عن استراتيجية إلى اختبار على مستوى المجموعة13 دقيقة قراءة

اختبار White’s Reality Check والتنقيب في بيانات الاختبارات التاريخية للاستراتيجيات

تعرّف إلى كيفية مقارنة White’s Reality Check لأفضل استراتيجية في البحث بمعيار مرجعي، مع احتساب أقصى إحصاء في bootstrap يحافظ على الاعتماد

في هذا الدليليسأل الاختبار ما إذا كان فائز البحث يتفوق على معيار مختار

ملخص موجز

يسأل White’s Reality Check ما إذا كان أفضل مرشح في مجموعة بحث محددة يتفوق على معيار مرجعي معلوم، بعد احتساب أنه اختير لأنه حقق القيمة القصوى. يعيد الاختبار أخذ عينات فروق الأداء المشتركة والمعتمدة زمنيًا، ثم يقارن القيمة القصوى المرصودة بتوزيع صفري للقيم القصوى الناتجة عن bootstrap. تمثل قيمة p المعدّلة الصغيرة دليلًا ضد فرضية العدم المشتركة التي تنفي التفوق داخل تلك المجموعة وبالنسبة إلى ذلك المعيار؛ ولا تتنبأ بالربحية عند التداول الفعلي.

يسأل الاختبار ما إذا كان فائز البحث يتفوق على معيار مختار

قد يجرّب الباحث عشرات الفترات للمتوسطات المتحركة، وقواعد الاختراق، ومدد الاحتفاظ، والأسواق والمرشحات، ثم يعلن الاستراتيجية صاحبة أعلى نتيجة اختبار تاريخي. هذا الفائز ليس مرشحًا منفردًا عاديًا: فقد منحه البحث فرصًا كثيرة ليبدو ناجحًا على نحو استثنائي. واختباره وحده كما لو اختير قبل الاطلاع على البيانات يتجاهل خطوة الانتقاء.

يُدخل White’s Reality Check عملية الانتقاء في الاختبار. فهو يسأل ما إذا كان أي مرشح من المجموعة المدروسة يحقق أداءً متوقعًا أعلى من معيار مرجعي محدد. ويصوغ White فرضية العدم كتقاطع لمقارنات أحادية الطرف: الأداء المتوقع لكل مرشح نسبة إلى المعيار لا يتجاوز الصفر. أما الفرضية البديلة فتقول إن مرشحًا واحدًا على الأقل يحقق أفضلية متوقعة موجبة. قد يكون المعيار الشراء والاحتفاظ، أو قاعدة تنبؤ بسيطة، أو قاعدة مقارنة أخرى؛ لكن يجب أن يلائم سؤال البحث وأن يُحدد قبل الاطلاع على نتيجة الاختبار. يشرح بحث White الأصلي الصياغة الرسمية.

هذا سؤال عن المجموعة بأكملها، وليس ضمانًا للاستراتيجية التي تصدرت بالمصادفة. رفض فرضية العدم يعني وجود دليل على التفوق ضمن المجموعة المسجلة وبحسب الإحصاء والافتراضات المختارة. ولا يثبت أن كل المرشحين مفيدون، أو أن الفائز سيظل الأفضل، أو أن أفضليته ستصمد أمام نظام سوق جديد.

عبّر عن كل مرشح بفارق أداء قابل للمقارنة

لتكن d[k,t] نتيجة المرشح k ناقص نتيجة المعيار في الفترة نفسها t؛ ويجب أن تعني القيمة الأعلى دائمًا أداءً أفضل للمرشح. عند مقارنة العوائد، يمكن تعريف الفرق بأنه صافي عائد المرشح ناقص صافي عائد المعيار. وعند مقارنة خسارة التنبؤ، يُعكس الاتجاه: خسارة المعيار ناقص خسارة المرشح. يجب أن تجعل قاعدة الإشارة القيمة الموجبة في مصلحة المرشح في جميع الحالات.

ينبغي أن يشير كل صف إلى الفترة الزمنية نفسها لجميع المرشحين. استخدم عملة واحدة، وقاعدة موحدة للعائد، ومعالجة متسقة للتمويل والتكاليف. إذا كان الادعاء يتعلق بعوائد استراتيجية قابلة للتنفيذ، فاطرح العمولات وفروق أسعار العرض والطلب والانزلاق والتمويل وتكاليف الاقتراض ذات الصلة قبل حساب d[k,t]. اختبار العوائد الإجمالية مع ذكر التكاليف في هامش فقط يجيب عن سؤال مختلف.

المتوسط العيني للمرشح k هو d̄[k] = (1/T) Σ_t d[k,t]. فرضية العدم المشتركة هي H0: max_k E[d[k,t]] ≤ 0، والبديلة H1: max_k E[d[k,t]] > 0. يستخدم جميع المرشحين معيارًا مشتركًا ويُقيّمون وفق المقياس نفسه. وإذا اختلفت التواريخ المفقودة أو تواتر الرصد، فحدّد عينة مشتركة يمكن الدفاع عنها قبل حساب الفروق، ولا تمنح مرشحًا نافذة أفضل دون تصريح.

أدرج مجموعة المرشحين كاملة ضمن الادعاء البحثي

تشمل المجموعة قواعد المرشحين التي ربما أثرت في اختيار الفائز المنشور، مثل فترات النظر للخلف التي جُرّبت، وحدود الدخول، ومجموعات الإشارات، ونطاق الأصول، ومدد الاحتفاظ، وقيود المحفظة وافتراضات التنفيذ. وتشمل أيضًا التعديلات اليدوية التي جُرّبت ثم استُبعدت بعد رؤية نتائجها. استخدم White مصطلح «specification search» في بحثه لعام 2000 بمعنى واسع: عملية الاختيار، لا الجدول النهائي وحده، هي التي تنشئ مشكلة الانتقاء.

هناك خطآن متعاكسان. استبعاد التجارب التي ساعدت في اختيار الاستراتيجية المعلنة يجعل الاختبار المعدّل متفائلًا أكثر من اللازم، لأن bootstrap يرى بحثًا أصغر من البحث الفعلي. أما إضافة قواعد كثيرة اعتباطية وغير مرتبطة بعد ظهور النتائج، فقد تجعل الاختبار محافظًا بلا داعٍ وتضعف قدرته على كشف مرشح مفيد. عرّف المجموعة بحسب عملية الانتقاء الفعلية واحتفظ بسجل بحث يتيح تدقيق حدودها.

لا يستطيع الاختبار استنتاج تجارب لم تُسجل. فدفتر يحتوي على مجموعة المعلمات الفائزة فقط لا يكفي لإعادة بناء البحث. احتفظ معًا بسجل المرشحين، وإصدار البيانات، وتواريخ التقييم، والهدف، وافتراضات التكاليف، وقرارات الاختيار. وإذا تغيرت المجموعة بعد فحص النتائج، فاذكر ما الذي تغير ولماذا؛ ولا تعرض مجموعة جُمعت لاحقًا كما لو كانت محددة مسبقًا.

تحمل إحصائية القيمة القصوى أثر الاختيار إلى التوزيع الصفري

احسب متوسط الأداء النسبي لكل مرشح ثم خذ أكبر قيمة. من الإحصاءات الشائعة غير المقيسة إحصائيًا Vobs = √T × max_k d̄[k]. تمثل القيمة القصوى خطوة «اختيار الأفضل» نفسها التي أنتجت الفائز الظاهري. ولو اختُبر العمود الفائز وحده، لاختفت خطوة الاختيار من التوزيع المرجعي.

يقدّر bootstrap مدى كبر قيمة قصوى قد تنتج من تباين العينة إذا صحت فرضية العدم المشتركة بعدم التفوق. في تكرار bootstrap رقم b، أعد أخذ عينات من متجه الفروق الزمني لجميع المرشحين، واحسب إحصاءً مُمركزًا مثل V*b = √T × max_k(d̄*[k,b] − d̄[k]). يضع التمركز متوسطات المرشحين عند الحد الأقل ملاءمة لفرضية العدم، حيث تساوي الأفضلية المتوقعة صفرًا، بينما يحافظ أخذ الحد الأقصى على الانتقاء بين المرشحين. يطوّر بحث White توزيع bootstrap للقيمة القصوى ويقارنه بالإحصاء المرصود.

كرّر العملية مرات كثيرة. قيمة p المعدّلة هي نسبة القيم القصوى الناتجة عن bootstrap التي تساوي Vobs أو تتجاوزها. وعند استخدام B تكرارات، من التقديرات الشائعة بطريقة Monte Carlo (1 + count{V*b ≥ Vobs})/(B + 1). قد تختلف التطبيقات في القياس الإحصائي أو تفاصيل النماذج المقدرة؛ لذا وثّق الإحصاء وطريقة التمركز تحت فرضية العدم. المهم أن يعيد كل تكرار حساب القيمة القصوى للمجموعة كاملة بدلًا من تقييم الفائز المرصود وحده.

حافظ على الاعتماد عند إعادة أخذ عينات من تاريخ المرشحين

ترتيب المشاهدات المالية زمني. وقد يمحو الخلط المستقل الاعتماد التسلسلي، وتكتلات التقلب، وفترات الأرباح أو الخسائر المترابطة. كما قد يشوه العلاقة بين استراتيجيتين تستجيبان غالبًا لأيام السوق نفسها. تؤثر هذه الخصائص في ذيل إحصاء القيمة القصوى؛ لذلك فإن إعادة أخذ العينات لكل مرشح منفردًا أو سحب أيام منفردة مع الإرجاع قد ينتج توزيعًا مرجعيًا خاطئًا.

يصف White طرقًا للبيانات المعتمدة، مثل bootstrap الكتل المتحركة، ويحلل bootstrap الساكن لـ Politis وRomano. في هذا الأسلوب يستمر البلوك المسحوب عادةً إلى المشاهدة الزمنية التالية، ثم يبدأ من تاريخ مسحوب آخر عند نقطة إعادة بدء عشوائية. لذلك تتبع أطوال البلوكات توزيعًا هندسيًا بمتوسط مختار. ومع افتراضات الطريقة وضبطها، يحافظ ذلك على التتابعات القصيرة أفضل من عينة مستقلة متماثلة التوزيع. راجع بحث Politis وRomano عن bootstrap الساكن.

في مجموعة الاستراتيجيات، اسحب سلسلة واحدة مشتركة من فهارس الوقت وطبّقها على متجه الصف بأكمله (d[1,t], …, d[K,t]). يحافظ ذلك على ترتيب الزمن داخل البلوكات المسحوبة وعلى الاعتماد المتزامن بين المرشحين. اختر طول البلوك استنادًا إلى أفق الاستراتيجية وتشخيصات الاعتماد، واذكر حساسية النتائج لبدائل معقولة. وإذا كانت إعادة تقدير المعلمات جزءًا من الإجراء البحثي، فحدد ما إذا كان الاستدلال يشمل هذه الخطوة وأعد تنفيذها داخل كل عينة عند الحاجة. إعادة أخذ عينات لعوائد مقدرة وثابتة فقط قد تستبعد جزءًا من الإجراء بعد اشتراطه.

يغيّر مثال bootstrap افتراضي طريقة تفسير النتيجة

افترض أن باحثًا يقارن ثلاث استراتيجيات بمعيار على مدى T = 252 يوم تداول. فروق الأداء اليومية المتوسطة بعد التكاليف هي +2.0 و+1.0 و−0.5 نقطة أساس. لذلك يبلغ متوسط الفائز 2.0 نقطة أساس، ويكون الإحصاء المرصود √252 × 2.0 bp ≈ 31.75 bp·√يوم تداول. هذا التحجيم جزء من إحصاء الاختبار؛ وليس إحصاء t لأنه لم يُقسم على خطأ معياري مقدّر.

لنفترض الآن تنفيذ 9,999 تكرارًا من bootstrap الساكن باستخدام التواريخ المسحوبة نفسها للمرشحين الثلاثة. في هذه النتيجة الافتراضية، تساوي 1,199 قيمة قصوى في التكرارات 31.75 أو تتجاوزها. التقدير بطريقة Monte Carlo مع تصحيح الواحد يساوي (1 + 1,199)/(9,999 + 1) = 0.12. قد يعطي اختبار افتراضي منفصل للفائز وحده 0.03، لكنه سيتجاهل البحث بين المرشحين الثلاثة. تقارن قيمة p في Reality Check المجموعة كاملة، ولذلك لا ترفض فرضية العدم المشتركة عند مستوى 5% في هذا المثال.

الأرقام مختلقة لتوضيح الحساب، وليست أداءً سوقيًا مقاسًا أو نتيجة من بحث White. قيمة p البالغة 0.12 لا تعني احتمالًا قدره 12% أن تخسر الاستراتيجية. بل تعني أن قيمة قصوى بهذا الحجم أو أكبر ليست نادرة بما يكفي للرفض عند المستوى المختار، وفق bootstrap وبناء فرضية العدم المحددين. كما أن متوسطات العينة لا توضح وحدها ما إذا كان العائد مجديًا اقتصاديًا بعد احتساب المخاطر والقدرة الاستيعابية والتنفيذ.

فسّر قيمة p المعدّلة كدليل على مجموعة محددة

قيمة p الصغيرة لاختبار Reality Check دليل ضد الادعاء بأن أي مرشح في المجموعة المدرجة لا يتفوق على المعيار المختار في الأداء المتوقع، وفق افتراضات الاختبار. وبما أن فرضية العدم مشتركة، فالرفض لا يحدد تلقائيًا المرشح صاحب الأفضلية المستدامة. قد يتغير اسم الفائز بين العينات، وقد يكون الدليل على استراتيجية بعينها ضعيفًا حتى عند رفض فرضية المجموعة.

القيمة الكبيرة تعني عدم رفض فرضية العدم، لا إثبات تكافؤ الاستراتيجيات مع المعيار. وقد يفسرها قصر العينة أو ضجيج الأداء أو اتساع المجموعة أو ضعف القياس أو انخفاض قوة الاختبار. كذلك ليست قيمة p احتمال صحة فرضية العدم؛ إنها احتمال ذيلي محسوب وفق توزيع مرجعي يعتمد على مجموعة المرشحين ومقياس الأداء والمعيار وتصميم bootstrap والبيانات المرصودة.

سؤال White نسبي. قد تتفوق قاعدة على معيار ضعيف مع استمرارها في خسارة المال، أو لا تتفوق على معيار قوي رغم تحقيقها عوائد إيجابية. اعرض النتائج المطلقة والنسبية معًا، إلى جانب عدم اليقين ومعدل الدوران والتراجع والقدرة الاستيعابية والتكاليف الواقعية. فالدليل الإحصائي على التفوق التنبؤي النسبي والجدوى الاقتصادية للاستثمار قراران منفصلان.

تحقّق من الافتراضات والحدود قبل الاعتماد على النتيجة

تتطلب النظرية الأصلية شروط انتظام لعملية فروق الأداء وتوزيعها الحدّي. تشمل صياغة White سلاسل زمنية ساكنة ذات خلط قوي، كما يحتاج bootstrap المعتمد إلى تسلسل مناسب لأطوال البلوكات. في العينات المحدودة قد تجعل التحولات بين الأنظمة السوقية والانقطاعات الهيكلية والاعتماد طويل الأجل والقفزات النادرة والتقلب غير المستقر تقريب bootstrap الساكن موضع شك. يحافظ bootstrap الكتل على بعض الاعتماد المحلي، لكنه لا يعيد إنشاء نظام مستقبلي مجهول.

يرث الاختبار أيضًا الأخطاء الموجودة في البيانات وتقييم الاستراتيجية. فتسرّب معلومات مستقبلية، وانحياز البقاء، والبيانات المعدلة، والتنفيذ غير الواقعي، والتكاليف المحذوفة، والمعالجة الخاطئة لإجراءات الشركات، واختيار المعيار بعد رؤية النتائج قد تبطل فروق الأداء. وإذا تداخلت مدد الاحتفاظ، فقد تكون العوائد معتمدة بحكم بنائها؛ لذلك يجب أن تمثل وحدة إعادة المعاينة وطول البلوك هذا الاعتماد. وإذا كان المقياس النهائي غير خطي مثل Sharpe ratio، فأعد حسابه في كل تكرار بدل افتراض أن bootstrap لمتوسط العائد يختبره تلقائيًا.

قد تكون تطبيقات Reality Check محافظة، ولا سيما عندما تضم المجموعة الكبيرة بدائل كثيرة ضعيفة بوضوح. وقد يجعل التوزيع الواسع للقيمة القصوى الرفض صعبًا رغم وجود مرشح جيد. إن اختبار Superior Predictive Ability لـ Hansen طريقة bootstrap مرتبطة تعالج البدائل الضعيفة بصورة مختلفة؛ لكنها ليست بديلًا شاملًا، ولا تزال افتراضاتها بحاجة إلى مراجعة. قارن الطرق بحسب سؤال البحث وأبلغ عن حساسية النتائج بدل اختيار الطريقة التي تنتج الإجابة المرغوبة.

استخدمه مع التحقق الزمني وأدوات الانتقاء الأخرى

يعالج White’s Reality Check مسألة وجود مرشح يتفوق على المعيار ضمن مجموعة بحث مسجلة بعد احتساب أثر الانتقاء. ولا يحل محل اختبار زمني على بيانات محجوبة أو تقييم walk-forward لاستراتيجية مجمدة، ولا يعالج وحده تداخل الملصقات أو تسرب المعلومات. ويختلف عن PBO، الذي يلخص عدد المرات التي يأتي فيها ترتيب فائز العينة داخلها دون وسيط المرشحين في تقسيمات تركيبية؛ ويعرّف بحث PBO الأصلي تشخيص مخاطر الانتقاء هذا. أما إجراءات الاكتشافات الزائفة فتستهدف الحصة المتوقعة للنتائج الزائفة ضمن مجموعة من حالات الرفض. ويعدّل Deflated Sharpe Ratio تقييمًا للدلالة قائمًا على Sharpe لاحتساب الانتقاء والعوائد غير الطبيعية. تابع القراءة في أدلتنا حول الاختبارات المتعددة ومعدل الاكتشافات الزائفة في التمويل، وPBO وCSCV، والتحقق walk-forward، والتحقق المتقاطع المنقّى وفترة الحظر.

في المراجعة العملية، ثبّت المعيار وتعريف الأداء، وأعد بناء مجموعة المرشحين الفعلية، واحسب فروقًا مقترنة لكل فترة، واختر تصميم إعادة معاينة يحافظ على الاعتماد وبرّر اختياره، ثم أبلغ عن إحصاء القيمة القصوى واحتمال الذيل في bootstrap. بعد ذلك اختبر عملية الاختيار المجمدة على بيانات زمنية لاحقة وافحص التكاليف وإمكان التنفيذ على حدة. يوضح تطبيق Sullivan وTimmermann وWhite على قواعد التداول الفني أهمية مجموعة القواعد كاملة: قد يتغير الاستنتاج عندما يدخل البحث كله في الاستدلال بدل الفائز المنشور وحده. يصحح Reality Check مشكلة انتقاء محددة؛ ولا يشهد بأن الاختبار التاريخي سيصمد عند التداول الفعلي.

أسئلة شائعة

Q1ما الذي يختبره White’s Reality Check؟

يختبر ما إذا كان أفضل مرشح في مجموعة بحث محددة يحقق أداءً متوقعًا أعلى من معيار مختار، مع احتساب الاختيار بين المرشحين.

Q2هل تثبت قيمة p الصغيرة أن الاستراتيجية ستكون مربحة؟

لا. إنها دليل ضد فرضية العدم التي تنفي التفوق على مستوى المجموعة، وفق المعيار والمقياس والبيانات وافتراضات bootstrap المختارة. ولا تضمن عوائد مستقبلية أو ربحًا صافيًا.

Q3لماذا نستخدم bootstrap الكتل بدل إعادة أخذ الأيام كلٌ على حدة؟

يمكن للكتل الحفاظ على جزء من الاعتماد التسلسلي المحلي، كما تحافظ التواريخ المشتركة لجميع المرشحين على علاقاتهم المتزامنة. ويظل تصميم الكتل بحاجة إلى التوافق مع البيانات وسؤال البحث.

المصادر والقراءة الإضافية

الإبلاغ عن مشكلة

سنُعدّ رسالة تتضمن رابط هذا المقال. لن يصل البلاغ إلى Mark إلا بعد إرسالها

تحقق سريع

بعد قراءة الدليل، اختبر نفسك في 3 أسئلة

السؤال 1 / 3

السؤال 01

ما معنى فرضية White العدم المشتركة؟

اختر إجابة لرؤية الشرح

معجم الخيارات

تعريفات دقيقة للمصطلحات الأساسية، من خيارات الشراء والبيع وسلسلة الخيارات إلى التقلب الضمني والحساسيات وفارق العرض والطلب

تصفح معجم الخيارات
كم مرة يهبط فائز الاختبار التاريخي دون وسيط المجموعةشرح احتمال فرط مواءمة الاختبار التاريخي (PBO) وCSCVتعرّف على كيفية تقدير التحقق المتقاطع التوافقي المتماثل لـ PBO، وتحويل رتب العينة الخارجية إلى logits، ولماذا لا تمثل النتيجة توقعاً للخسائر المستقبليةالبحث الكميشرح Deflated Sharpe Ratio: الاختبارات المتعددة واختيار نتائج الاختبار التاريخيتعرّف على كيفية تعديل Deflated Sharpe Ratio للدلالة الإحصائية لـ Sharpe بعد اختيار استراتيجية، مع احتساب الاختبارات المتعددة والعوائد غير الطبيعية، عبر مثال افتراضي وحدود واضحة.اختر السجل التاريخي الذي يتعلم منه النموذج الماليالنوافذ المتوسعة والمتدحرجة للتحقق المتتابع من النماذجقارن بين نوافذ التدريب المتوسعة والثابتة الطول للنماذج المالية، وافصل التحقق عن الاختبار النهائي، واختر قواعد النوافذ دون استخدام نتائج مستقبلية.التحقق من نماذج التداولPurged cross-validation والحاجز الزمني: منع تسرّب الوسوم في نماذج التداولتعرّف إلى إزالة تداخل فترات الوسوم وحاجز embargo، والفرق بينهما وبين walk-forward وTimeSeriesSplit وCPCV عند التحقق من نماذج السلاسل المالية.تقييم التنبؤ بالاتجاهاختبار بيساران–تيمرمان: هل يضيف التنبؤ بالاتجاه معلومات؟تعرّف على كيفية مقارنة اختبار بيساران–تيمرمان بين دقة الاتجاه وخط أساس يُحسب من نسبتي الارتفاع الفعلي والمتنبأ به، ولماذا يغيّر الاعتماد التسلسلي الاستدلال الإحصائي.