White Reality Check מול מבחן Hansen SPA לכללי מסחר
השוו בין Reality Check ל־SPA כשבוחרים כלל מסחר מתוך משפחה שנבדקה, והבינו את ה־bootstrap, ההנחות והמגבלות.
במדריך הזהלמה צריך מבחן אחר לכלל שזכה בבדיקה לאחור
תקציר קצר
White Reality Check ומבחן SPA של Hansen שואלים אם לפחות כלל אחד מתוך משפחת מועמדים שנבדקה עולה על אמת מידה שנקבעה מראש, לפי מדד ביצועים אחד. שניהם מביאים בחשבון שבוחרים את המועמד הטוב ביותר לאחר שרואים את התוצאות, אבל אינם מאשרים כלל מסוים ואינם מבטיחים רווח בעתיד.
למה צריך מבחן אחר לכלל שזכה בבדיקה לאחור
אם קובעים אסטרטגיה אחת לפני שמסתכלים על המדגם, מבחן השוואה יחיד עשוי להתאים לשאלה המצומצמת. אבל אם מנסים כללים רבים והגדרות שונות, בוחנים את התוצאות ואז מדווחים על מובהקות המנצח כאילו נבחר מראש, החיפוש עצמו נשמט. גם אם לאף כלל אין יתרון אמיתי, התוצאה הגדולה ביותר מתוך אומדנים רועשים רבים נוטה להיות חיובית במקרה.
Reality Check, או RC בקיצור, ומבחן Superior Predictive Ability של Hansen, או SPA, בוחנים שאלה על כל המשפחה: לאחר שמביאים בחשבון את החיפוש בתוך קבוצת חלופות מוגדרת, האם יש ראיה שלפחות אסטרטגיה אחת משיגה ביצועים צפויים טובים יותר מאמת המידה? המשפחה יכולה לכלול כללים טכניים, מודלי תחזית או אסטרטגיות אחרות. White הציג מסגרת לבדיקת data snooping במאמרו מ־2000, ו־Sullivan, Timmermann ו־White יישמו אותה ב־1999 על יקום רחב של כללי מסחר טכניים. מאמר White ויישום כללי המסחר הם מקורות ראשוניים. חשוב לכלול את החלופות שהובילו לבחירת התוצאה, ולא רק את הזוכה.
הגדירו את אמת המידה, משפחת המועמדים ואת כיוון ההפרש
נסמן ב־k כלל מועמד במשפחה שנבדקת K, וב־t את תאריכי ההערכה המשותפים לכלל ולאמת המידה. בדוגמה המבוססת על תשואה אפשר להגדיר את ההפרש בכל תקופה כך:
d(k,t) = התשואה נטו של כלל k בתקופה t − התשואה נטו של אמת המידה
ערך חיובי מעדיף את הכלל. בהשוואת דיוק תחזיות יש להגדיר את הכיוון לפי ההפסד ההפוך: הפסד אמת המידה פחות הפסד הכלל, כך שערך חיובי פירושו שהכלל הפחית את ההפסד. אל תשנו את סימן החיסור בין כללים או תאריכים.
נסמן ב־μ(k) = E[d(k,t)] את ההפרש הצפוי של כלל k. השערות המשפחה הן:
H0: הערך המרבי של μ(k) עבור הכללים ב־K אינו עולה על אפס H1: קיים לפחות כלל אחד ב־K שעבורו μ(k) > 0
H0 אינה דורשת שההפרש הצפוי של כל כלל יהיה בדיוק אפס; גם כלל שצפוי להיות גרוע מאמת המידה נמצא תחת השערת האפס. זהו מבחן משותף אחד על המקסימום של המשפחה, ולא אוסף בדיקות נפרדות שאפשר לפרש כל אחת בפני עצמה. לכן צריך להגדיר בבירור את אמת המידה, התקופה, התשואות, קבוצת המועמדים ומדד הביצועים. אם השאלה היא על ביצועים מתוקני סיכון, הפרש תשואה ממוצעת לבדו אינו מייצג אותה.
Reality Check לוקח את התוצאה המרבית במשפחה כולה
נסמן ב־d̄(k) את ממוצע ההפרשים של כלל k לאורך n תקופות הערכה. במסגרת הפשוטה של ממוצע ההפרשים, סטטיסטי RC הוא:
T_RC = הערך המרבי של sqrt(n) × d̄(k) על פני כל k ב־K
הוא לוקח את תוצאת המדגם הטובה ביותר מבין המועמדים ומשווה אותה להתפלגות bootstrap תחת השערת האפס. בהשערה מורכבת זו, White משתמש בתצורה הכי פחות נוחה להשערה החלופית: התפלגות האפס מניחה שלכל המועמדים הפרש צפוי אפס, אף שגם הפרשים צפויים שליליים עומדים ב־H0. לכן ערך הסף עלול לעלות כשמשפחת המועמדים כוללת חלופות חלשות רבות.
המקסימום הוא לב העניין. השאלה אינה ״האם הזוכה במדגם עובר מבחן של כלל יחיד?״ אלא ״אם נחפש באותה משפחה שהוגדרה, עד כמה נדיר לקבל מקסימום גדול לפחות כמו זה שראינו?״ בדיקת הזוכה לבדו מול התפלגות ייחוס של כלל שנבחר מראש עונה על השאלה הראשונה, אך מתעלמת מהשלב שבו בחרו אותו. גם מבחן יחיד שמחושב כהלכה אינו מתקן את השפעת הבחירה בדיעבד.
דוגמה היפותטית של 240 גרסאות ממחישה את גודל החיפוש
לצורך חשבון בלבד, נניח שחוקר ניסה 12 תקופות lookback, ארבעה מסנני כניסה וחמש הגדרות יציאה. אם נבדקה כל קומבינציה, מדובר ב־12 × 4 × 5 = 240 גרסאות היפותטיות של כלל מסחר. זו ספירת שילובים בלבד; היא אינה תוצאה של מחקר שפורסם או נתון תשואה אמיתי. אין להסיק ממנה ערך p או לטעון שגרסה כלשהי רווחית.
אם בוחרים את הקומבינציה הטובה ביותר לאחר עיון בתוצאות של 240 הגרסאות, המבחן המתוקן צריך לשחזר את חיפוש המקסימום הזה בכל מדגם bootstrap. בכל שכפול מחשבים מחדש את מדד הביצועים לכל הגרסאות ולוקחים את הגדול ביותר. לאחר מכן משווים את המקסימום במדגם המקורי להתפלגות המקסימום בשכפולים. אם מחשבים מחדש רק את סטטיסטי הזוכה בכל שכפול, משתנה השאלה: שלב הבחירה בין 240 תוצאות כבר אינו מיוצג.
התיקון מועיל רק אם תיאור המשפחה נאמן לתהליך המחקר. אם הגדרות, שווקים, אופקי החזקה או כללי יציאה מסוימים השפיעו על הבחירה אך הושמטו, השפעתם לא תיספר. מצד שני, אין להוסיף לאחר מעשה חלופות שאינן קשורות רק כדי להרחיב את המשפחה. יש לתעד את קבוצת החיפוש שיצרה את הבחירה, כולל חלופות שלא ניצחו.
דגמו יחד את וקטור הכללים בזמן
באותו תאריך, הכללים חולקים מידע שוק ולכן הפרשי הביצועים שלהם עשויים להיות מתואמים. גם בין תקופות סמוכות יכולה להיות תלות סדרתית. ה־bootstrap צריך לדגום יחד את וקטור ההפרשים של כל המועמדים בכל תאריך, ולשמר מקטעי זמן רצופים. כך נשמרים הקשרים הסינכרוניים בין כללים וחלק מהתלות לאורך זמן. דגימה עצמאית של כל כלל בנפרד שוברת את הקו־וריאציה ביניהם ומשנה את התפלגות המקסימום; ערבוב של ימים בודדים עלול למחוק תלות בזמן.
אפשר להשתמש בשיטות בלוקים, למשל stationary bootstrap. השיטה מחברת סדרה מלאכותית ממקטעים עוקבים שאורכם משתנה; בבנייה הסטנדרטית של Politis ו־Romano האורכים מתפלגים גאומטרית, ומגדירים מראש את אורך הבלוק הצפוי. מאמרם על stationary bootstrap הוא המקור הראשוני לתהליך. שימוש באותם אינדקסים של זמן לכל סדרות הכללים משמר את התנועה המשותפת שלהם במדגם המשוחזר.
עצם הדגימה מחדש אינה הופכת כל סדרה למתאימה. התקפות התאורטית נשענת על תנאי סדירות, כמו תהליך יציב עם תלות חלשה מספיק. שינוי מבני או אי־יציבות חזקה אינם נעלמים בגלל bootstrap. בלוק קצר מדי עלול למחוק התמדה חשובה; בלוק ארוך מאוד משאיר מעט מקטעים שונים למעשה. ציינו את שיטת הדגימה ואת אורך הבלוק, ובדקו אם המסקנה משתנה תחת הגדרות סבירות. התפלגות ה־bootstrap צריכה גם לייצג את השערת האפס, והסטטיסטי המרבי מחושב מחדש בכל שכפול. bootstrap לרווח סמך של סטטיסטי קבוע עבור אסטרטגיה שנבחרה מראש אינו מבצע אוטומטית תיקון לחיפוש במשפחה. מדריך ה־block bootstrap לתשואות אסטרטגיה עוסק באי־ודאות של סטטיסטי קבוע תוך שמירה על תלות בזמן.

SPA מתקנן את הסטטיסטי ומתאים את התפלגות האפס למדגם
SPA משאיר את השערת האפס המשפחתית ואת הפרשי הביצועים ביחס לאמת המידה, אך משנה שני חלקים בהליך. ראשית הוא מחלק את ההפרש הממוצע של כל מועמד באומדן סטיית התקן של הממוצע:
T_SPA = max(0, max_k [sqrt(n) × d̄(k) / ω̂(k)])
ω̂(k) הוא אומדן מתאים לתנודתיות ארוכת הטווח של ממוצע ההפרש. כך משווים בין מועמדים ביחידות של שגיאות תקן ולא ביחידות של תשואה גולמית. הדבר יכול לצמצם את השפעתם של כללים תנודתיים מאוד על המקסימום. עם זאת, קו־וריאציה בין הכללים עדיין חשובה כאשר בונים את התפלגות המקסימום.
שנית, SPA משתמש בהתפלגות אפס שתלויה במה שהמדגם מלמד על ממוצע כל חלופה. בגרסה העקבית, אומדני ממוצע של מועמדים שנראים גרועים מאמת המידה במידה מספקת נשמרים כשליליים במרכז התפלגות האפס. מועמדים שעדיין יכולים להיות סמוך לגבול האפס ממורכזים באפס. כך מפחיתים את השפעתן של חלופות חלשות לפי המידע במדגם, בלי למחוק אותן פשוט מהחישוב. אסור לבחור בדיעבד מי יישאר במבחן לפי התוצאה, כי הדבר עלול לפגוע בתוקף התפלגות האפס.
מאמר Hansen מ־2005 מציג את שני השינויים: סטטיסטי מתוקנן והתפלגות אפס תלוית־מדגם. הם יכולים לשפר עוצמה ולהפחית רגישות לחלופות חלשות או לא רלוונטיות בתכנונים מסוימים, אך אין פירוש הדבר ש־SPA עדיף תמיד על RC. Hansen מציין שהמבחנים אינם שולטים זה בזה באופן אחיד. חלק מהמימושים מדווחים גבול תחתון, גרסה עקבית וגבול עליון של ערך p ל־SPA; לכן ציינו איזו גרסה ומימוש שימשו. מאמר Hansen הוא המקור הראשוני לסטטיסטי, למרכוז ולפרטי ה־bootstrap.
דחיית השערת המשפחה אינה מזהה כלל מנצח
דחייה של H0 המשפחתית תומכת במסקנה מוגבלת: במדד שנבחר ובהנחות שנקבעו יש ראיה לכך שלפחות מועמד אחד במשפחה המוגדרת השיג ביצועים צפויים טובים יותר מאמת המידה. היא אינה מוכיחה שכל הכללים רווחיים, שלכלל שהוביל במדגם יש מובהקות אישית מתוקנת, או שהוא ימשיך להוביל במסחר חי.
אי־דחייה אינה מוכיחה שכל הכללים חסרי תועלת או שווים. משמעותה היא שהמדגם וההליך לא סיפקו ראיה מספקת לעליונות של מועמד כלשהו במשפחה ברמת המובהקות שנבחרה. המדגם עשוי להיות קצר או תנודתי, ההבדלים בין מועמדים עשויים להיות קטנים, או שהיתרון האמיתי חלש. ״לא מצאנו ראיה מספקת ליתרון״ ו״הוכחנו שאין יתרון״ הן מסקנות שונות.
מבחן המקסימום הגלובלי אינו מעניק דירוג מתוקן לכל מועמד ואינו אומר באיזה כלל לבחור. אם רוצים טענות מתוקנות לגבי כללים מסוימים, דרוש הליך שמיועד להסקה על מועמדים בודדים או לבדיקה סדרתית, ולאחר מכן אימות נפרד על נתונים שלא שימשו לבחירה. אין להפוך דחייה משפחתית להמלצת השקעה או לטענה שתוצאות היסטוריות יחזרו.
קבעו את המדד ואת משפחת המועמדים לפני עיון בתוצאות
התיקון חל רק על קבוצת המועמדים שהוזנה למבחן. תעדו תקופות lookback, מסננים, שווקים, אופקי החזקה והגדרות יציאה שהשפיעו על הבחירה, כולל ניסיונות כושלים. אם ניסיתם כמה אמות מידה, הגדרות תשואה או חלונות מדגם ובחרתם לאחר מכן לפי התוצאות, תעדו גם את החיפוש הזה. מסלול מחקר שלא נשמר אינו נכלל בתיקון הרשמי.
יישרו את כל סדרות התשואה לאותם תאריכים. לפני חישוב הפרשי הביצועים, הגדירו אם העלויות כוללות עמלות, מרווח, החלקה, מימון, השאלת ניירות וגלגול חוזים. בחרו גם את מדד הביצועים לפני בחירת המנצח. תשואה נטו ממוצעת, מדד תועלת ומדד מתוקן סיכון הם שאלות שונות; מבחן שנבנה לאחד אינו עונה מעצמו על האחרים. בהשוואות תחזית מקוננות או בתכנונים מיוחדים אחרים, הנחות אמידת הפרמטרים והתפלגות האפס עשויות להשתנות, ולכן אין להחיל מתכון כללי ל־RC או SPA באופן אוטומטי.
ההבדל מ־FDR חשוב: שיעור הגילויים השגויים מווסת את החלק הצפוי של גילויים שגויים מתוך סדרת החלטות פרטניות, ואילו RC ו־SPA בודקים מקסימום יחיד של משפחת מועמדים מול אמת מידה. הם גם שונים ממדריך ה־block bootstrap לסטטיסטי קבוע, שאומד אי־ודאות של מדד שהוגדר מראש ואינו משחזר בעצמו חיפוש בין מועמדים. מדריך לבדיקות מרובות ול־FDR בפיננסים מסביר את משפחת התיקונים האחרת.
דווחו על התוצאה לצד ההנחות והמגבלות
דוח שימושי מציין את אמת המידה, משפחת המועמדים, מדד הביצועים, טווח התאריכים, תדירות התצפיות, העלויות, שיטת ה־bootstrap, אורך הבלוק, מספר השכפולים, הסטטיסטי וסוג ערך ה־p המדויק. שמרו את קובצי המועמדים כדי שאפשר יהיה לבדוק אם המשפחה שהובילה לבחירה מיוצגת. אם משתמשים לאחר המבחן במדגם כרונולוגי שלא נגעו בו, אל תכוונו את הכלל לפי אותו מדגם ואז תקראו לו עדיין holdout.
ערך p של RC או SPA הוא ראיה לגבי השערת אפס משפחתית, בהינתן הנתונים, משפחת החיפוש, המדד וההנחות. הוא אינו ההסתברות שאסטרטגיה מסוימת תרוויח, תחזית תשואה לעתיד, או הבטחה שביצועי backtest ישרדו עלויות ושינויי משטר. המבחן אינו מתקן כשלעצמו דליפת מידע עתידי, הטיית הישרדות, שגיאות נתונים, השפעת שוק או יומן חיפוש חסר. מדריך cross-validation טורי עם purge ו־embargo עוסק בבעיה אחרת: דליפת מידע בין אימון לבדיקה.
שאלות נפוצות
Q1האם SPA חזק יותר מ־Reality Check בכל מצב?
לא. התיקונים של Hansen עשויים לשפר עוצמה ולהפחית השפעה של חלופות חלשות בחלק מהתכנונים, אך אף אחד מהמבחנים אינו עדיף באופן אחיד בכל מצב.
Q2האם תוצאת SPA מובהקת אומרת לי באיזה כלל מסחר להשתמש?
לא. היא תומכת במסקנה על המשפחה שלפיה מועמד כלשהו עשוי לעלות על אמת המידה לפי המדד שנקבע. היא אינה מזהה כלל מסוים; לכך דרושים הליך ברמת המועמד ואימות נפרד.
Q3אפשר להשמיט גרסאות backtest שהפסידו מהמשפחה?
אם הגרסאות השתתפו בחיפוש שהוביל לבחירה הסופית, השמטתן משנה את השאלה ועלולה להמעיט בהשפעת הבחירה. הגדירו ותעדו את כל המשפחה הרלוונטית לפני פירוש התוצאה המתוקנת.
מקורות וקריאה נוספת
דיווח על בעיה
נכין אימייל עם קישור למאמר הזה. Mark יקבל את הדיווח רק לאחר שתשלחו אותו
בדיקה מהירה
סיימת לקרוא? בדוק את עצמך ב־3 שאלות
שאלה 01
אילו מועמדים צריכה לכלול בדיקת משפחה לאחר שנוסו גרסאות רבות של אסטרטגיה?
בחר תשובה כדי לראות את ההסבר
מילון מונחי אופציות
The probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
קראו את המדריך המעמיקAssignmentThe process that requires an option writer to fulfill the contract after an exercise notice is allocated; it can create or remove an underlying position.
קראו את המדריך המעמיק