White’s Reality Check לזיהוי data snooping בבדיקות עבר של אסטרטגיות
למדו כיצד White’s Reality Check משווה את האסטרטגיה הטובה ביותר בחיפוש למדד ייחוס, תוך שימוש במקסימום של bootstrap המתחשב בתלות
במדריך הזההבדיקה שואלת אם מנצח החיפוש גובר על מדד ייחוס שנבחר
תקציר קצר
White’s Reality Check בודק אם המועמד בעל הביצועים הטובים ביותר מתוך חיפוש מוגדר גובר על מדד ייחוס שנקבע מראש, תוך התחשבות בכך שנבחר כמקסימום. הבדיקה מבצעת bootstrap להפרשי הביצועים המשותפים והתלויים בזמן, ומשווה את המקסימום שנצפה להתפלגות אפס של מקסימות bootstrap. ערך p מתוקנן קטן מעיד נגד השערת האפס המשותפת שלפיה אין מועמד עדיף במשפחה הזאת ביחס למדד הזה; הוא אינו תחזית לרווחיות במסחר חי.
הבדיקה שואלת אם מנצח החיפוש גובר על מדד ייחוס שנבחר
חוקר עשוי לבדוק עשרות חלונות לממוצעים נעים, כללי פריצה, תקופות החזקה, שווקים ומסננים, ואז לדווח על האסטרטגיה שקיבלה את ציון בדיקת העבר הגבוה ביותר. המנצחת אינה מועמדת יחידה רגילה: החיפוש נתן לה הזדמנויות רבות להיראות מוצלחת במיוחד. בדיקה שלה כאילו נבחרה לפני צפייה בנתונים מתעלמת משלב הבחירה.
White’s Reality Check מכניס את הבחירה לתוך הבדיקה. הוא שואל אם למועמד כלשהו במשפחה שנבדקה יש ביצועים צפויים טובים יותר ממדד ייחוס מוגדר. White מנסח את השערת האפס כחיתוך של השוואות חד־צדדיות: הביצועים הצפויים של כל מועמד ביחס למדד אינם חיוביים. ההשערה החלופית היא שלפחות למועמד אחד יתרון צפוי חיובי. מדד הייחוס יכול להיות קנייה והחזקה, כלל חיזוי פשוט או כלל השוואה אחר, אך עליו להתאים לשאלת המחקר ולהיקבע לפני צפייה בתוצאת הבדיקה. ראו את המסגרת הפורמלית במאמר המקורי של White.
זוהי שאלה על המשפחה כולה, לא הבטחה לגבי האסטרטגיה שניצחה במקרה. דחיית השערת האפס מצביעה על ראיות ליתרון במשפחה שתועדה, תחת הסטטיסטי וההנחות שנבחרו. היא אינה מוכיחה שכל המועמדים מועילים, שהמנצחת תישאר הטובה ביותר או שהיתרון ישרוד משטר שוק חדש.
נסחו לכל מועמד הפרש ביצועים בר־השוואה
נסמן ב־d[k,t] את ביצועי מועמד k פחות ביצועי מדד הייחוס באותה תקופה t; ערך גבוה יותר צריך תמיד להיטיב עם המועמד. בהשוואת תשואות אפשר להגדיר זאת כתשואת המועמד נטו פחות תשואת מדד הייחוס נטו. בהשוואת הפסדי חיזוי, יש להפוך את הכיוון: הפסד מדד הייחוס פחות הפסד המועמד. מוסכמת הסימנים חייבת לגרום לערך חיובי לציין יתרון למועמד.
כל שורה צריכה להתייחס לאותו פרק זמן אצל כל המועמדים. השתמשו באותה מטבע, מוסכמת תשואה, טיפול במימון ומדיניות עלויות. אם הטענה עוסקת בתשואות אסטרטגיה שניתנות לביצוע, הפחיתו עמלות, מרווחים, החלקה, עלויות מימון והשאלה רלוונטיות לפני חישוב d[k,t]. בדיקת תשואות ברוטו והזכרת העלויות רק בהערת שוליים עונות על שאלה אחרת.
ממוצע המדגם למועמד k הוא d̄[k] = (1/T) Σ_t d[k,t]. השערת האפס המשותפת היא H0: max_k E[d[k,t]] ≤ 0; החלופית היא H1: max_k E[d[k,t]] > 0. מדד הייחוס משותף למשפחה וכל המועמדים נבדקים באותו קריטריון. אם יש תאריכים חסרים או תדירויות תצפית שונות, הגדירו מדגם משותף שניתן להצדיק לפני חישוב ההפרשים, במקום להעניק למועמד אחד חלון נוח יותר בלי לציין זאת.
כללו את משפחת המועמדים המלאה בטענה המחקרית
המשפחה כוללת את כללי המועמדים שתוצאותיהם יכלו להשפיע על בחירת המנצחת המדווחת: חלונות מבט לאחור שנבדקו, ספי כניסה, צירופי אותות, יקומי נכסים, תקופות החזקה, מגבלות תיק והנחות ביצוע. היא כוללת גם גרסאות ידניות שנוסו ונפסלו אחרי צפייה בתוצאות. במאמר משנת 2000 White משתמש ב־“specification search” במובן רחב: תהליך הבחירה, ולא רק הטבלה הסופית, יוצר את בעיית הבחירה.
יש שתי טעויות הפוכות. השמטת ניסויים שסייעו לבחור את האסטרטגיה המדווחת הופכת את הבדיקה המתוקננת לאופטימית מדי, כי ה־bootstrap רואה חיפוש קטן מזה שבוצע בפועל. הוספת כללים רבים ולא קשורים בדיעבד עלולה להפוך את הבדיקה לשמרנית ללא צורך ולהפחית את יכולתה לזהות מועמד מועיל. הגדירו את המשפחה לפי תהליך הבחירה בפועל ושמרו יומן מחקר שיאפשר לבדוק את גבולותיה.
הבדיקה אינה יכולה להסיק על ניסויים שלא תועדו. מחברת שמכילה רק את הפרמטרים המנצחים אינה מספיקה לשחזור החיפוש. שמרו יחד רישום מועמדים, גרסת הנתונים, מועדי ההערכה, יעד האופטימיזציה, הנחות העלות והחלטות הבחירה. אם המשפחה השתנתה אחרי צפייה בתוצאות, ציינו מה השתנה ולמה; אל תציגו משפחה שנבנתה בדיעבד כאילו נקבעה מראש.
סטטיסטי המקסימום מעביר את הבחירה להתפלגות האפס
חשבו את הביצועים היחסיים הממוצעים של כל מועמד וקחו את הגבוה ביותר. סטטיסטי נפוץ שאינו מתוקנן הוא Vobs = √T × max_k d̄[k]. המקסימום חיוני: הוא מייצג את אותה פעולה של “בחירת הטוב ביותר” שיצרה את המנצח לכאורה. בדיקה של העמודה המנצחת בלבד הייתה מסירה את פעולת הבחירה מהתפלגות הייחוס.
ה־bootstrap מקרב את גודל המקסימום שעלול להיווצר משונות מדגמית, בהנחה שהשערת האפס המשותפת של היעדר יתרון נכונה. בכל דגימת bootstrap b, דגמו מחדש את וקטור ההפרשים בזמן של כל המועמדים וחשבו סטטיסטי ממורכז כגון V*b = √T × max_k(d̄*[k,b] − d̄[k]). המרכוז מציב את ממוצעי המועמדים על גבול האפס הפחות נוח, שבו היתרונות הצפויים הם אפס, והמקסימום משמר את הבחירה בין המועמדים. מאמר White מפתח את התפלגות ה־bootstrap של המקסימום ומשווה אותה לסטטיסטי שנצפה.
חזרו על התהליך פעמים רבות. ערך ה־p המתוקנן הוא החלק היחסי של מקסימות ה־bootstrap ששוות ל־Vobs או גדולות ממנו. עבור B דגימות, אומדן Monte Carlo נפוץ הוא (1 + count{V*b ≥ Vobs})/(B + 1). מימושים עשויים להבדיל בתקנון או בפרטי מודלים שאמדו; תעדו את הסטטיסטי ואת כלל המרכוז תחת השערת האפס. העיקר הוא לחשב מחדש בכל חזרה את המקסימום של המשפחה כולה, ולא להעריך רק את המנצחת שנצפתה.
שמרו על התלות בעת דגימה מחדש של היסטוריית המועמדים
תצפיות פיננסיות מסודרות בזמן. ערבוב בלתי תלוי עלול למחוק תלות סדרתית, התקבצויות תנודתיות ורצפים של רווחים או הפסדים מתואמים. הוא גם עלול לעוות את הקשר בין אסטרטגיות שמגיבות לאותם ימי שוק. מאפיינים אלה משפיעים על הזנב של סטטיסטי המקסימום; לכן דגימה נפרדת לכל מועמד או בחירה של ימים בודדים עם החזרה עלולות ליצור התפלגות ייחוס שגויה.
White מתאר שיטות לנתונים תלויים, ובהן moving-block bootstrap, ומנתח את ה־stationary bootstrap של Politis ו־Romano. בשיטה זו בלוק שנדגם ממשיך בדרך כלל לתצפית הבאה בזמן; בהפעלה מחדש אקראית הוא מתחיל בתאריך אחר שנדגם. אורכי הבלוקים מתפלגים גאומטרית עם אורך ממוצע שנבחר. תחת הנחות וכיול מתאימים, השיטה משמרת רצפים קצרי טווח טוב יותר מדגימת i.i.d. ראו את מאמר Politis ו־Romano על stationary bootstrap.
למשפחת אסטרטגיות, דגמו רצף משותף אחד של מדדי זמן והחילו אותו על וקטור השורה כולו (d[1,t], …, d[K,t]). כך נשמרים סדר הזמנים בתוך הבלוקים שנדגמו וגם התלות בו־זמנית בין המועמדים. בחרו אורך בלוק לפי אופק האסטרטגיה ואבחון התלות, ודווחו על רגישות לתחליפים סבירים. אם תהליך המחקר אומד מחדש פרמטרים, החליטו אם שלב זה כלול במטרת ההסקה ושחזרו אותו בכל דגימה לפי הצורך. דגימה מחדש של תשואות מותאמות וקבועות בלבד עלולה להתנות על חלק מהתהליך ולהשמיטו.
דוגמת bootstrap היפותטית משנה את הפרשנות
נניח שחוקר משווה שלוש אסטרטגיות למדד ייחוס לאורך T = 252 ימי מסחר. ההפרשים היומיים הממוצעים אחרי עלויות הם +2.0, +1.0 ו־−0.5 נקודות בסיס. לכן ממוצע המנצחת הוא 2.0 נקודות בסיס והסטטיסטי שנצפה הוא √252 × 2.0 bp ≈ 31.75 bp·√יום מסחר. קנה המידה הוא חלק מהסטטיסטי; אין כאן סטטיסטי t, כי לא מחלקים בשגיאת תקן משוערת.
נניח כעת 9,999 חזרות של stationary bootstrap המשתמשות באותם תאריכים שנדגמו לשלושת המועמדים. בתוצאה היפותטית זו, 1,199 מקסימות של חזרות שוות ל־31.75 או עולות עליו. אומדן Monte Carlo עם תיקון של אחד הוא (1 + 1,199)/(9,999 + 1) = 0.12. בדיקה נפרדת של המנצח בלבד עשויה להניב באופן היפותטי 0.03, אך היא תשמיט את החיפוש בין שלושה מועמדים. ערך ה־p של Reality Check מתייחס למשפחה כולה; בדוגמה הזו הוא אינו דוחה את השערת האפס המשותפת ברמת 5%.
המספרים מומצאים כדי להמחיש את החישוב; הם אינם ביצועי שוק שנמדדו או תוצאה ממאמר White. ערך p של 0.12 אינו אומר שלאסטרטגיה יש סיכוי של 12% להפסיד. פירושו שבהינתן ה־bootstrap ובניית האפס שצוינו, מקסימום בגודל כזה או גדול ממנו אינו נדיר דיו כדי לדחות ברמה שנבחרה. ממוצעי המדגם גם אינם מראים אם התשואה משמעותית מבחינה כלכלית לאחר סיכון, קיבולת והשפעות ביצוע.
פרשו את ערך ה־p המתוקנן כראיה לגבי משפחה מוגדרת
ערך p קטן של Reality Check הוא ראיה נגד הטענה שאף חבר במשפחה הכלולה אינו עולה על מדד הייחוס שנבחר בביצועים הצפויים, בכפוף להנחות הבדיקה. מאחר שהאפס משותף, דחייתו אינה מזהה אוטומטית את המועמד בעל היתרון העמיד. זהות המנצח עשויה להשתנות בין מדגמים, והראיות לאסטרטגיה אחת עשויות להיות חלשות גם אם השערת האפס ברמת המשפחה נדחתה.
ערך p גדול פירושו שלא דוחים את השערת האפס, לא שכל האסטרטגיות שקולות למדד הייחוס. מדגם קצר, ביצועים רועשים, משפחה רחבה מאוד, מדידה חלשה או עוצמה נמוכה עשויים להסביר זאת. ערך ה־p אינו גם ההסתברות שהאפס נכון. זו הסתברות זנב תחת התפלגות ייחוס התלויה בקבוצת המועמדים, במדד הביצועים, במדד הייחוס, בתכנון ה־bootstrap ובנתונים שנצפו.
השאלה של White יחסית. כלל יכול לנצח מדד ייחוס חלש ועדיין להפסיד כסף, או לא לנצח מדד חזק ובכל זאת לייצר תשואות חיוביות. הציגו יחד ביצועים מוחלטים ויחסיים, לצד אי־ודאות, מחזור, ירידה מרבית, קיבולת ועלויות מציאותיות. ראיה סטטיסטית לעליונות חיזוי יחסית וכדאיות כלכלית של השקעה הן החלטות נפרדות.
בדקו הנחות ומגבלות לפני שמסתמכים על התוצאה
התיאוריה המקורית מניחה תנאי סדירות לתהליך הפרשי הביצועים ולהתפלגות הגבולית שלו. המסגרת של White כוללת סדרות זמן סטציונריות עם ערבוב חזק; גם bootstrap תלוי דורש רצף מתאים של אורכי בלוקים. במדגמים סופיים, שינויי משטר, שברים מבניים, זיכרון ארוך, קפיצות נדירות ותנודתיות לא יציבה עלולים לפגוע בקירוב של דגימה סטציונרית. Bootstrap של בלוקים משמר חלק מהתלות המקומית, אך אינו משחזר משטר עתידי לא ידוע.
הבדיקה יורשת גם שגיאות בנתונים ובהערכת האסטרטגיה. דליפת מידע עתידי, הטיית הישרדות, נתונים מתוקנים, ביצועים לא מציאותיים, עלויות חסרות, טיפול שגוי בפעולות תאגידיות ומדד ייחוס שנבחר אחרי צפייה בתוצאות עלולים לפסול את ההפרשים. כשיש חפיפה בין תקופות החזקה, התשואות עשויות להיות תלויות מעצם המבנה; יחידת הדגימה מחדש ואורך הבלוק צריכים לייצג תלות זו. אם המדד הסופי לא ליניארי, כגון יחס שארפ, חשבו אותו מחדש בכל חזרה במקום להניח ש־bootstrap של ממוצע התשואה בודק אותו אוטומטית.
מימושי Reality Check עשויים להיות שמרניים, במיוחד במשפחה גדולה הכוללת חלופות רבות שחלשות בבירור. התפלגות מקסימום רחבה עלולה להקשות על דחייה גם כשיש מועמד טוב. מבחן Superior Predictive Ability של Hansen הוא שיטת bootstrap קשורה המטפלת אחרת בחלופות חלשות; הוא אינו תחליף אוניברסלי וגם את הנחותיו צריך לבדוק. השוו בין שיטות לפי שאלת המחקר ודווחו על רגישות במקום לבחור את השיטה שמפיקה את התוצאה הרצויה.
השתמשו בו לצד תיקוף כרונולוגי וכלי בחירה אחרים
White’s Reality Check בוחן אם משפחת חיפוש מתועדת מכילה מועמד עם יתרון יחסי מול מדד הייחוס לאחר התחשבות בבחירה. הוא אינו מחליף holdout כרונולוגי או הערכת walk-forward לאסטרטגיה קבועה. הוא גם אינו פותר לבדו חפיפת תוויות או דליפה. הוא שונה מ־PBO, המסכם באיזו תדירות מנצח in-sample מדורג מתחת לחציון המועמדים בחלוקה קומבינטורית; מאמר PBO המקורי מגדיר את אבחון סיכון הבחירה הזה. הליכי גילוי שווא מכוונים לשיעור הצפוי של תוצאות שגויות מתוך כמה דחיות. Deflated Sharpe Ratio מתאים הערכת מובהקות שמבוססת על שארפ לבחירה ולתשואות לא נורמליות. להמשך, ראו מדריכים על בדיקות מרובות ושיעור גילוי שווא במימון, PBO ו־CSCV, תיקוף walk-forward ותיקוף צולב מטוהר ו־embargo.
בבדיקה מעשית, קבעו מראש את מדד הייחוס והגדרת הביצועים, שחזרו את משפחת המועמדים ששימשה בפועל, חשבו הפרשים מזווגים לכל תקופה, בחרו והצדיקו תכנון דגימה מחדש ששומר על תלות, ודווחו על סטטיסטי המקסימום ועל הסתברות הזנב של ה־bootstrap. לאחר מכן בדקו את תהליך הבחירה הקבוע על נתונים כרונולוגיים מאוחרים יותר והעריכו בנפרד עלויות וישימות. היישום של Sullivan, Timmermann ו־White לכללי מסחר טכניים מראה מדוע יקום הכללים חשוב: המסקנה יכולה להשתנות כאשר ההסקה כוללת את החיפוש המלא ולא רק את המנצח המדווח. Reality Check מתקן בעיית בחירה מסוימת; הוא אינו תעודה לכך שבדיקת העבר תשרוד מסחר חי.
שאלות נפוצות
Q1מה בודק White’s Reality Check?
הוא בודק אם למועמד הטוב ביותר במשפחת חיפוש מוגדרת יש ביצועים צפויים עדיפים על מדד ייחוס שנבחר, תוך התחשבות בבחירה בין המועמדים.
Q2האם ערך p קטן של Reality Check מוכיח שאסטרטגיה תהיה רווחית?
לא. הוא ראיה נגד השערת האפס של היעדר יתרון ברמת המשפחה, תחת מדד הייחוס, המדד, הנתונים והנחות ה־bootstrap שנבחרו. הוא אינו מבטיח תשואות עתידיות או רווח נקי.
Q3למה להשתמש ב־bootstrap של בלוקים במקום לדגום ימים בנפרד?
בלוקים יכולים לשמר חלק מהתלות הסדרתית המקומית, ושימוש בתאריכים משותפים לכל המועמדים משמר את הקשרים ביניהם באותו זמן. תכנון הבלוקים עדיין צריך להתאים לנתונים ולשאלה המחקרית.
מקורות וקריאה נוספת
דיווח על בעיה
נכין אימייל עם קישור למאמר הזה. Mark יקבל את הדיווח רק לאחר שתשלחו אותו
בדיקה מהירה
סיימת לקרוא? בדוק את עצמך ב־3 שאלות
שאלה 01
מה אומרת השערת האפס המשותפת של White?
בחר תשובה כדי לראות את ההסבר
מילון מונחי אופציות
הגדרות ברורות למונחי אופציות חשובים, מקריאות ופוטים ועד IV, יוונים, עניין פתוח ו-max pain
עיינו במילון המונחים של האופציות