Skip to content
جميع أدلة الخيارات والعقود المستقبلية
اختبار أثر البحث عن قواعد التداولقراءة 12 دقيقة

اختبار White Reality Check واختبار Hansen SPA لقواعد التداول

قارن بين Reality Check وSPA عند اختيار أفضل قاعدة من مجموعة كبيرة، وافهم الفرضية المشتركة والـbootstrap والقيود العملية.

في هذا الدليللماذا يحتاج فائز الاختبار الرجعي إلى اختبار مختلف؟

ملخص موجز

يسأل White Reality Check واختبار Hansen SPA عما إذا كانت قاعدة واحدة على الأقل في مجموعة جرى البحث فيها تتفوق على معيار معلن وفق مقياس أداء محدد سلفا. يأخذ الاختباران في الحسبان اختيار الأفضل بعد مشاهدة النتائج، لكنهما لا يثبتان صلاحية قاعدة بعينها ولا يضمنان ربحا مستقبليا.

لماذا يحتاج فائز الاختبار الرجعي إلى اختبار مختلف؟

إذا حددت استراتيجية واحدة قبل الاطلاع على العينة، فقد يكون اختبار مقارنة واحدة مناسبا لسؤال محدود. لكن إذا بدلت الإعدادات وجربت قواعد كثيرة، ثم عرضت دلالة القاعدة الفائزة كما لو أنها كانت الاختيار الوحيد منذ البداية، فإن التحليل يتجاهل طريقة الاختيار. حتى لو لم تكن لأي قاعدة أفضلية حقيقية، فإن أعلى نتيجة بين تقديرات كثيرة متقلبة تميل إلى أن تكون موجبة بالمصادفة.

يعالج Reality Check، ويشار إليه اختصارا RC، واختبار القدرة التنبؤية المتفوقة SPA سؤالا يخص المجموعة كلها: بعد احتساب البحث في مجموعة معلنة، هل توجد أدلة على أن استراتيجية واحدة على الأقل تحقق أداء متوقعا أفضل من معيار المقارنة؟ قد تضم المجموعة قواعد فنية أو نماذج تنبؤ أو استراتيجيات أخرى. وضع White إطار اختبار أثر التنقيب في البيانات في ورقته المنشورة عام 2000، ثم طبّق Sullivan وTimmermann وWhite الفكرة على مجموعة واسعة من قواعد التداول عام 1999. ورقة White ودراسة قواعد التداول هما مصدران أوليان لهذا الشرح. ينبغي أن تشمل المجموعة البدائل التي أسهمت في اختيار النتيجة المعروضة، لا الفائز وحده.

عرّف المعيار ومجموعة القواعد واتجاه الفرق

لنفترض أن k يحدد قاعدة مرشحة داخل المجموعة K، وأن t يحدد كل تاريخ تقييم مشترك بين القاعدة والمعيار. في مقارنة مبنية على العائد، يمكن تعريف فرق الأداء لكل فترة كما يلي:

d(k,t) = صافي عائد القاعدة k في الفترة t − صافي عائد المعيار في الفترة t

إذا كان الفرق موجبا فذلك يصب في مصلحة القاعدة. أما عند مقارنة دقة التنبؤ، فعرّف الفرق بترتيب الخسارة المعاكس: خسارة المعيار ناقص خسارة القاعدة، كي تعني القيمة الموجبة أن القاعدة خفّضت الخسارة. لا تغيّر اتجاه الطرح بين القواعد أو التواريخ.

ليكن μ(k) = E[d(k,t)] متوسط الفرق المتوقع للقاعدة k. عندها تكون الفرضية المشتركة:

H0: أكبر μ(k) عبر القواعد في K لا يتجاوز صفرا H1: توجد قاعدة واحدة على الأقل في K يكون μ(k) لها أكبر من صفر

أي إن فرضية العدم لا تقول إن متوسط كل قاعدة يساوي صفرا بالضبط؛ بل تسمح بأن تكون بعض القواعد أسوأ من المعيار. والاختبار ليس مجموعة من اختبارات منفصلة يمكن قراءة كل نتيجة فيها وحدها، بل اختبار عائلي واحد يعتمد على أكبر أداء نسبي. لذلك يجب تحديد المعيار والتواريخ وتعريف العائد ومقياس الأداء قبل تفسير النتائج. إذا كان السؤال عن الأداء المعدل للمخاطر، فإن متوسط العائد وحده لا يمثل ذلك السؤال.

يأخذ Reality Check أكبر نتيجة من المجموعة

لنرمز إلى متوسط الفروق خلال n فترة تقييم بالرمز d̄(k). في إعداد بسيط يعتمد متوسط الفرق، يكون إحصاء RC:

T_RC = أكبر قيمة لـ sqrt(n) × d̄(k) بين كل k في K

أي إنه يلتقط أقوى نتيجة ظهرت في المجموعة، ثم يقارنها بتوزيع bootstrap مبني تحت فرضية العدم. يستخدم إجراء White الحالة الحدية الأقل ملاءمة للفرضية البديلة في هذه الفرضية المركبة: يفترض التوزيع أن متوسط الفرق المتوقع لكل قاعدة يساوي صفرا. لكن فرضية العدم تشمل أيضا القواعد التي متوسط فرقها سالب. لذلك قد يكون الحد الحرج أعلى مما يلزم عندما تضم المجموعة كثيرا من القواعد الضعيفة.

سبب استخدام الأكبر أن السؤال ليس: «هل يجتاز الفائز المرصود اختبار قاعدة واحدة؟» بل: «لو كررنا البحث نفسه بين القواعد المحددة، فهل يكون ظهور أكبر نتيجة بهذا الحجم نادرا؟» إن اختبار الفائز وحده بتوزيع مرجعي لقاعدة محددة مسبقا يحذف خطوة الاختيار. وبهذا لا يعالج سبب تضخم النتيجة، حتى إن كانت صيغة الاختبار المنفرد صحيحة لقاعدة لم تُختر بناء على العينة.

مثال 240 قاعدة افتراضية يوضح حجم عائلة البحث

لنفترض، للتوضيح الحسابي فقط، أن باحثا جرب 12 فترة رجوع، و4 مرشحات للدخول، و5 إعدادات للخروج. إذا اختبر كل تركيبة، فهذا يعني 12 × 4 × 5 = 240 نسخة افتراضية من قواعد التداول. هذا الضرب يحصي التركيبات ولا يصف دراسة منشورة أو عوائد فعلية، ولا يبرر اختلاق قيمة احتمالية أو ادعاء أن إحدى النسخ مربحة.

إذا اختيرت أفضل تركيبة بعد مراجعة نتائج النسخ الـ240، فالمقارنة المناسبة يجب أن تعيد إنتاج عملية أخذ الأكبر على العائلة التي جرى البحث فيها. في كل عينة bootstrap، احسب مقياس الأداء لجميع النسخ، ثم خذ أكبر قيمة بينها. بعد ذلك قارن أكبر قيمة في العينة الفعلية بتوزيع هذه القيم القصوى. أما أن نعيد حساب إحصاء الفائز وحده في كل مرة، فهذا يجيب عن سؤال مختلف ويتجاهل أن الباحث اختاره من بين 240 نتيجة.

تعتمد فائدة التصحيح على وصف العائلة بصورة أمينة. إذا لم تكن بعض الإعدادات أو الأسواق أو فترات الاحتفاظ ضمن مجموعة المرشحين رغم أنها أثرت في اختيار الفائز، فلن يحسبها الإحصاء. وعلى الجهة الأخرى، لا ينبغي إضافة تركيبات غير ذات صلة لمجرد جعل الاختبار يبدو أوسع. المهم هو توثيق مجموعة البحث التي أنتجت الاختيار، بما فيها البدائل التي لم تفز.

أعد أخذ عينات المتجه الزمني معا

في التاريخ نفسه، تشترك القواعد عادة في حركة السوق، ولذلك قد تتحرك فروق أدائها معا. وقد تحمل السلسلة الزمنية اعتمادا بين الفترات المتجاورة أيضا. ينبغي للـbootstrap أن يعيد أخذ عينة من متجه فروق القواعد في كل تاريخ كوحدة واحدة، مع إبقاء ترتيب المقاطع الزمنية. أخذ عينة مستقلة لكل قاعدة يمحو جزءا من التغاير المتزامن بين القواعد ويغيّر توزيع أكبر قيمة، كما أن خلط الأيام منفردة قد يمحو اعتماد الزمن.

يمكن استخدام طرق الكتل، ومنها stationary bootstrap. يبني هذا الإجراء سلسلة اصطناعية من مقاطع متجاورة ذات أطوال متغيرة؛ وفي بناء Politis وRomano القياسي يتبع طول المقطع توزيعا هندسيا، ويُختار متوسطه المتوقع مسبقا. توضح ورقتهما عن stationary bootstrap كيفية إنشاء هذا النوع من العينات. واستخدام الفهارس الزمنية نفسها لكل قواعد التداول يحافظ على اعتمادها المشترك في العينة المعاد بناؤها.

لا تجعل إعادة المعاينة أي سلسلة مناسبة تلقائيا. تعتمد النتائج النظرية على شروط انتظام، منها استقرار العملية ووجود اعتماد ضعيف بما يكفي. لا يصلح هذا الأسلوب وحده تغير النظام السوقي أو عدم الاستقرارية القوية. وقد تقطع كتلة قصيرة الاستمرار المهم، بينما تترك كتلة طويلة عددا قليلا فقط من المقاطع المختلفة فعليا. لذلك اذكر طريقة الـbootstrap ومتوسط طول الكتلة، وافحص حساسية النتيجة لاختيارات معقولة. كما أن إعادة المعاينة يجب أن تمثل فرضية العدم، ثم تعيد حساب الحد الأقصى في كل تكرار؛ فـbootstrap لفاصل ثقة لمقياس ثابت لقاعدة مختارة مسبقا ليس تصحيحا عائليا تلقائيا. يشرح دليل block bootstrap لعوائد الاستراتيجيات تقدير عدم يقين مقياس ثابت مع الحفاظ على الاعتماد الزمني.

مسارات عديدة تتلاقى عند قمة، وبجوارها ميزان ومنحنيان تجريديان وصفوف من الكتل الزمنية، في رسم بلا كلمات.
رسم مفاهيمي فقط لبحث الاستراتيجيات ومقارنة توزيعات عدم اليقين؛ لا يعرض نتائج اختبار أو عوائد سوقية فعلية.

يقيّس SPA المقارنة ويستخدم فرضية عدم تعتمد على العينة

يحافظ اختبار SPA على الفرضية العائلية نفسها وعلى فروق الأداء عن المعيار، لكنه يعدّل الإحصاء وتوزيع العدم. أولا، يقيّس متوسط كل قاعدة بتقدير الانحراف المعياري لذلك المتوسط:

T_SPA = max(0, max_k [sqrt(n) × d̄(k) / ω̂(k)])

يمثل ω̂(k) تقديرا مناسبا للتقلب طويل الأمد لمتوسط الفرق، لا الانحراف اللحظي فقط. يسمح التقييس بمقارنة قاعدة ذات متوسط صغير لكنه أكثر دقة مع قاعدة ذات متوسط خام أكبر وتقلب عال. وبهذا يقل أثر النتائج شديدة التقلب على أقصى الإحصاء، مع بقاء الاعتماد بين القواعد مهما عند حساب توزيع الحد الأقصى.

ثانيا، يستخدم SPA توزيعا صفريا يعتمد على ما تشير إليه العينة عن متوسط كل بديل. في النسخة المتسقة من الإجراء، يُحتفظ بالمتوسط السلبي المقدر للقواعد التي تبدو أسوأ من المعيار بوضوح، بينما تُعاد القواعد التي ما زالت معقولة عند الحد الفاصل إلى مركز صفري. وهكذا تقل مساهمة المرشحين الضعفاء بقدر ما تسمح به البيانات، من دون حذفهم ببساطة. لا يُسمح بانتقاء من سيبقى في الاختبار بعد معرفة النتيجة، لأن حذف البدائل التي تبدو سيئة قليلا قد يفسد توزيع العدم في عينات محدودة.

تصف ورقة Hansen لعام 2005 هذين التعديلين: إحصاء معياري وتوزيع صفري معتمد على العينة. قد يحسّنان قوة الاختبار ويقللان حساسيته للقواعد الرديئة أو غير المهمة، لكن SPA لا يتفوق على RC في كل حالة. يذكر Hansen صراحة أن الاختبارين لا يهيمن أحدهما على الآخر بصورة موحدة. وقد تعرض بعض التطبيقات حدودا دنيا وعليا ونسخة متسقة لقيمة p الخاصة بـSPA؛ لذلك يجب التصريح بالنسخة والتنفيذ المستخدمين. ورقة Hansen هي المرجع الأولي لصيغة الإحصاء والتوسيط وإجراءات الـbootstrap.

لا يحدد رفض الفرضية أي قاعدة ينبغي تداولها

إذا رُفضت الفرضية العائلية، فهذا يدعم استنتاجا محدودا: توجد أدلة على أن قاعدة واحدة على الأقل في المجموعة المحددة تتفوق على معيارها المتوقع وفق مقياس الأداء المفحوص، وبموجب الفرضيات المستخدمة. لا يثبت الرفض أن كل القواعد مربحة، ولا أن أعلى قاعدة في العينة ذات دلالة فردية معدلة، ولا أن هذه القاعدة ستبقى الأفضل في السوق الحي.

وإذا لم تُرفض الفرضية، فهذا لا يثبت أن كل القواعد عديمة الفائدة أو متساوية. معناه أن العينة وإجراء الاختبار لم يقدما أدلة كافية على تفوق أي مرشح في المجموعة عند المستوى المستخدم. قد تكون العينة قصيرة أو متقلبة، أو أن القواعد متقاربة، أو أن الفرضية الحقيقية ضعيفة. افصل بين «لم نجد دليلا كافيا على التفوق» و«أثبتنا عدم وجود التفوق»؛ فهما عبارتان مختلفتان إحصائيا.

كما أن الإحصاء العائلي لا يمنح ترتيبًا مصححا لكل المرشحين ولا يحدد الفائز الذي يجب اختياره. إذا أردت استنتاجات معدلة لكل قاعدة أو قائمة اكتشافات محددة، فهذه مسألة تحتاج إجراء متعدد المقارنات مصمما لهذا الهدف، ثم تقييما منفصلا للقاعدة على بيانات لم تسهم في اختيارها. لا تحول الرفض العائلي إلى توصية استثمارية أو إلى ادعاء بأن نتيجة اختبار رجعي ستتكرر.

ثبّت معيار الأداء والعائلة قبل مراجعة النتائج

يعتمد التصحيح على المرشحين الذين أدخلتهم فعليا. وثّق فترات الرجوع، والمرشحات، والأسواق، ومدد الاحتفاظ، وإعدادات المخارج التي أثرت في اختيارك، بما فيها المحاولات الفاشلة. إذا جربت تعريفات مختلفة للعائد أو معايير مقارنة أو نوافذ زمنية ثم اخترت المفضل بعد مشاهدة الأداء، فينبغي أن يعكس سجل البحث ذلك. ترك التجارب السابقة خارج السجل لا يمحو أثرها.

احسب القواعد والمعيار على التواريخ نفسها. عرّف هل العائد إجمالي أم صاف بعد العمولة وفارق السعر والانزلاق، وأدخل التمويل أو تكلفة الاقتراض أو تجديد العقود متى كانت جزءا من التنفيذ الذي تريد تقييمه. حدد المقياس قبل اختيار الفائز: متوسط العائد الصافي، أو نسبة شارب، أو مقياس منفعة، أسئلة مختلفة. ولا يجوز لنتيجة مبنية على متوسط العائد أن تثبت تفوقا وفق نسبة شارب.

يختلف هذا الاختبار عن تصحيح معدل الاكتشاف الكاذب FDR: فـFDR ينظم حصة الاكتشافات الكاذبة المتوقعة ضمن مجموعة من القرارات الفردية، بينما RC وSPA يختبران الحد الأقصى لعائلة واحدة مقابل معيار. كما يختلف عن دليل block bootstrap ذي الإحصاء الثابت، الذي يقدّر عدم يقين مقياس محدد سلفا ولا يعيد وحده تمثيل البحث بين بدائل متعددة. أما الدليل على الاختبارات المتعددة وFDR فيشرح عائلة تصحيحات مختلفة.

اعرض النتيجة مع الافتراضات والحدود

ينبغي أن يذكر التقرير معيار المقارنة، ومجموعة القواعد، ومقياس الأداء، ونطاق التواريخ، وتواتر الملاحظات، والتكاليف المدرجة، وطريقة الـbootstrap، ومتوسط طول الكتلة، وعدد التكرارات، وصيغة الإحصاء ونوع قيمة p. احتفظ بملفات المرشحين حتى يستطيع المراجع التأكد من أن العائلة التي أدت إلى الاختيار ممثلة في الاختبار. وإذا استخدمت عينة اختبار زمنية غير مستخدمة بعد الاختبار، فلا تعدّل القاعدة عليها ثم تصفها بأنها عينة غير مستخدمة.

تتعلق قيمة p بفرضية عائلية محددة، وبيانات ومقياس وعائلة وافتراضات معينة. لا تعني احتمال ربح استراتيجية بعينها، ولا تتنبأ بالعوائد المقبلة، ولا تضمن بقاء نتائج الاختبار الرجعي بعد تغير الأنظمة أو تكاليف التداول. لا يصحح RC أو SPA تلقائيا التسرب المستقبلي أو تحيز البقاء أو أخطاء البيانات أو أثر السوق أو سجل البحث الناقص. يعالج التحقق المتقاطع الزمني مع الحذف وفترة الحظر مسألة مختلفة هي تسرب المعلومات بين التدريب والاختبار.

أسئلة شائعة

Q1هل يكون SPA أقوى من Reality Check في كل الحالات؟

لا. قد يحسن تعديل Hansen قوة الاختبار ويقلل أثر البدائل الضعيفة في بعض التصاميم، لكنه لا يهيمن على RC في كل حالة.

Q2هل تخبرني نتيجة SPA الدالة أي قاعدة أتداول؟

لا. هي تدعم استنتاجا عن المجموعة كلها، مفاده أن مرشحا ما قد يتفوق على المعيار وفق المقياس المعلن. ولا تختار قاعدة بعينها؛ يلزم لذلك تحليل على مستوى المرشح وتحقق منفصل.

Q3هل أستطيع حذف نسخ الاختبار الرجعي التي خسرت؟

إذا أثرت هذه النسخ في اختيار القاعدة النهائية، فإن حذفها يغير السؤال وقد يقلل تقدير أثر الاختيار. عرّف العائلة ذات الصلة وسجلها قبل تفسير النتيجة المصححة.

المصادر والقراءة الإضافية

الإبلاغ عن مشكلة

سنُعدّ رسالة تتضمن رابط هذا المقال. لن يصل البلاغ إلى Mark إلا بعد إرسالها

تحقق سريع

بعد قراءة الدليل، اختبر نفسك في 3 أسئلة

السؤال 1 / 3

السؤال 01

بعد تجربة نسخ متعددة من الاستراتيجية، ما الذي ينبغي أن يشمله اختبار العائلة؟

اختر إجابة لرؤية الشرح

معجم الخيارات

لماذا يفشل حد واحد عندما يختبر الباحثون أفكارا كثيرةالاختبارات المتعددة ومعدل الاكتشاف الكاذب في التمويلافهم المقارنات المتعددة وخطأ العائلة ومعدل الاكتشاف الكاذب وبونفيروني وهولم وبنياميني–هوخبرغ والاعتماد وقيم q وتنقيب العوامل واختيار الاختبار الرجعي وحوكمة البحثقياس عدم اليقين في أداء الاستراتيجيةإعادة المعاينة بالكتل لعوائد التداول: فترات الثقة مع الاعتماد الزمنيتعرّف إلى استخدام إعادة المعاينة بالكتل لتقدير عدم اليقين في متوسط عائد استراتيجية تداول أو نسبة شارب، مع الحفاظ على الاعتماد الزمني وبيان حدود الطريقة.التحقق من نماذج التداولPurged cross-validation والحاجز الزمني: منع تسرّب الوسوم في نماذج التداولتعرّف إلى إزالة تداخل فترات الوسوم وحاجز embargo، والفرق بينهما وبين walk-forward وTimeSeriesSplit وCPCV عند التحقق من نماذج السلاسل المالية.آلية الخياراتما هو تخصيص الخيار؟تعرف إلى كيفية تحوّل الخيار المباع إلى التزام بتسليم الأسهم أو شرائها قبل تاريخ الانتهاء أو عندهالعدد المسموح للعقود ليس ميزانية مخاطرشرح حدود مراكز الخيارات مقابل حدود ممارستهاتعرّف إلى اختلاف حدود مراكز الخيارات المدرجة عن حدود ممارستها، ولماذا يهم تجميع الجانب نفسه والإبلاغ، ولماذا لا يبين الهامش أو القوة الشرائية ما إذا كانت الكمية مسموحة