Skip to content
כל מדריכי האופציות
באיזו תדירות מוביל הבדיקה ההיסטורית יורד מתחת לחציון הקבוצה14 דקות קריאה

הסבר על הסתברות התאמת היתר של בדיקות היסטוריות (PBO) ו-CSCV

כך אימות צולב סימטרי קומבינטורי מעריך PBO, ממיר דירוגים מחוץ למדגם ל-logit, ומדוע המדד אינו תחזית להפסדים עתידיים

במדריך הזהPBO מודד את תהליך הבחירה, לא אסטרטגיה יחידה

תקציר קצר

הסתברות התאמת היתר של בדיקה היסטורית (PBO) שואלת באיזו תדירות האסטרטגיה שנבחרה כמובילה בתוך המדגם (IS) מדורגת מתחת לחציון קבוצת המועמדות מחוץ למדגם (OOS). אימות צולב סימטרי קומבינטורי (CSCV) מעריך את התדירות באמצעות שיוך חוזר של מחצית מבלוקים שווים בזמן לבחירה ושל המחצית האחרת להערכה. PBO הוא אבחון המותנה בחיפוש, במדד ובמטריצת ביצועים היסטורית מוגדרים; הוא אינו ההסתברות שאסטרטגיה חיה תפסיד כסף.

PBO מודד את תהליך הבחירה, לא אסטרטגיה יחידה

צוות מחקר עשוי לנסות חלונות מבט לאחור, ספי כניסה, תקופות החזקה, יקומי נכסים, הנחות עלויות ואילוצי תיק שונים, ואז לשמור את הגרסה עם ציון הבדיקה ההיסטורית הגבוה ביותר. לגרסה שנבחרה היו כך הזדמנויות רבות להתאים למאפייני המדגם. PBO מסכם תוצאה אחת של החיפוש: בחלוקות IS/OOS מוגדרות, באיזו תדירות מנצח IS מדורג מתחת לחציון OOS של אותן מועמדות?

Bailey, Borwein, López de Prado ו-Zhu הציגו את PBO כמסגרת לבחינת סיכון בחירת אסטרטגיה והציעו CSCV כדרך לאמוד אותה. ההגדרה עוסקת בתהליך הבחירה בין תצורות שנבדקו, ולא רק במספר הפרמטרים במשוואת חיזוי יחידה. בכל חלוקה, IS הוא תת-המדגם המשמש לבחירה; הוא לא חייב להיות התקופה שבה נאמדו כל המודלים הבסיסיים. הניסוח הפורמלי מופיע במאמר המקורי על PBO.

לאסטרטגיה יחידה יכול להיות יחס Sharpe גבוה במדגם המלא, ובכל זאת להיות המועמדת בעלת המזל הרב ביותר במשפחת מחקר חלשה. מנגד, תהליך בחירה עשוי לבחור לרוב מועמדת שמדורגת מעל חציון OOS, גם כאשר התשואות של כל הקבוצה שליליות. PBO משווה דירוגים יחסיים בתוך קבוצת המועמדות שסופקה; הוא אינו בודק לבדו אם התשואה הצפויה חיובית.

PBO עונה על שאלה אחרת מכלי אימות אחרים

בדיקה כרונולוגית מופרדת או walk-forward בוחנת כיצד תהליך מחקר מוגדר פעל על תצפיות מאוחרות שלא שימשו החלטות קודמות. Purged cross-validation מטפל בחפיפה בין טווחי תוויות האימון לתוצאות הבדיקה; embargo יכול להוסיף מרווח נפרד עם הצדקה. אף אחד מהצעדים האלה לבדו אינו מודד באיזו תדירות מנצחת של חיפוש אסטרטגיות רחב יורדת מתחת לחציון המועמדות ב-OOS. ראו את המדריך ל-purged cross-validation ו-embargo.

PBO שונה גם מתיקון לריבוי בדיקות. Reality Check של White משתמש ב-bootstrap כדי לבדוק אם הכלל המוביל במשפחה גובר על מדד ייחוס לאחר התחשבות ב-data snooping. Deflated Sharpe Ratio מתאים חישוב מובהקות המבוסס על Sharpe להשפעות בחירה ולתשואות שאינן נורמליות. PBO מסכם במקום זאת את דירוג ה-OOS של המועמדת שנבחרה ב-IS לאורך החלוקות. לכל השיטות סטטיסטיקות והנחות שונות, ולכן אין תחליף אוטומטי ביניהן. ראו את המאמר המקורי של White על Reality Check ואת עבודתם של Bailey ו-López de Prado על Deflated Sharpe Ratio.

התחילו במטריצת ביצועים מלאה ומסונכרנת

נניח ש-M היא מטריצה בגודל T על N. כל אחת מ-N העמודות היא אסטרטגיה או תצורה מועמדת, וכל אחת מ-T השורות היא אותו מרווח תצפית לכל המועמדות. שורה יכולה להכיל תשואה יומית לאחר העלויות הרלוונטיות. אם תדירות המסחר משתנה, הגדירו תחילה אינדקס זמן משותף ואגדו ביצועים בעקביות. הצבת תשואות יומיות של אסטרטגיה אחת לצד סיכומים חודשיים של אחרת אינה יוצרת מטריצה משמעותית.

קבוצת המועמדות צריכה לשקף את הזדמנויות הבחירה בפועל: גרסאות שנדחו בחיפוש רשת, שינויים ידניים לאחר צפייה בתוצאות, יקומים חלופיים וכללים שהשפיעו על הבחירה הסופית. PBO יכול לבחון רק את המועמדות ואת היסטוריית הביצועים שסופקו לו. אם נשמרו רק המועמדות הסופיות לאחר חיפוש רחב בהרבה, האומדן מקטין את היקף החיפוש האמיתי.

השתמשו באותה הגדרת תשואה, מטבע, טיפול במינוף ומדד ביצועים עבור כולן. אם הבחירה מתבססת על Sharpe נטו, כללו בכל עמודה עמלות, מרווחים, מימון, funding, עלות השאלה והנחות ביצוע רלוונטיות לפני החישוב. יש לאפשר לחשב את המדד גם בתתי-המדגמים הבאים. המאמר המקורי דורש שורות מסונכרנות ומדד שאפשר לאמוד בכל תת-מדגם; כאשר תדירויות המסחר שונות, הוא ממליץ ליישר את הסדרות לאינדקס משותף.

CSCV מצמיד כל מחצית מדגם למשלים שלה

בחרו מספר זוגי S של בלוקים נפרדים ושווי גודל בזמן, ושמרו על הסדר הפנימי בכל בלוק. בכל בחירה אפשרית של S/2 בלוקים, חברו אותם לקבוצת in-sample (IS), והשתמשו ב-S/2 הנותרים כ-out-of-sample (OOS). במדד שתלוי במסלול, שמרו על הסדר המקורי של הבלוקים שנבחרו ותעדו מה משמעות החיבור עבור המדד.

מספר שיוכי IS הוא C(S,S/2). בארבעה בלוקים A, B, C ו-D יש שישה שיוכים: AB, AC, AD, BC, BD ו-CD; גם כל משלים נספר כשיוך נפרד. כאשר S = 16, מתקבל C(16,8) = 12,870. אלה שילובים דטרמיניסטיים של אותה היסטוריה, לא 12,870 ניסויי שוק עצמאיים.

"סימטרי" פירושו שמשלים של חלוקה אחת משמש כקבוצת הבחירה בחלוקה אחרת: פעם AB הוא IS ו-CD הוא OOS, ובחלוקה אחרת ההפך. "קומבינטורי" פירושו למנות את כל בחירות מחצית הבלוקים במקום לדגום חלוקה אקראית אחת. התהליך אינו שחזור כרונולוגי. בחירה עשויה לכלול בלוקים מוקדמים ומאוחרים, בעוד שהמשלים כולל בלוקים אמצעיים; לכן OOS אינו בהכרח "העתיד שאחרי תקופת האימון".

מקטעי זמן עוקבים נחלקים שוב ושוב לחצאי אימון ובדיקה; חלק מהמנצחים במדגם יורדים מתחת לאמצע בדירוג מחוץ למדגם
תרשים מושגי של חלוקות CSCV סימטריות ודירוגים; לא מוצגים נתונים אמיתיים או סימולציית מסחר כרונולוגית

המירו את דירוג ה-OOS של המועמדת שנבחרה ל-logit

בחלוקה c, החילו את כלל הבחירה המחקרי על IS ובחרו את המועמדת הטובה ביותר n*(c). לאחר מכן חשבו את אותו מדד ביצועים לכל N המועמדות על קבוצת ה-OOS המשלימה. הגדירו r(c) כדירוג ה-OOS של המועמדת שנבחרה: 1 היא הגרועה ו-N הטובה ביותר. קבעו מראש כיצד מטפלים בשוויון ושמרו על אותה מוסכמה בכל החלוקות.

המירו את הדירוג לדירוג יחסי: ω(c) = r(c)/(N+1). המכנה N+1 משאיר את הערך בין אפס לאחד גם בדירוג הנמוך והגבוה ביותר. ה-logit הוא λ(c) = ln(ω(c)/(1−ω(c))). הוא שלילי מתחת לחציון OOS, אפס בחציון וחיובי מעליו. אומדן PBO הוא החלק מכל שיוכי CSCV שעבורם λ(c) ≤ 0.

ערך PBO יחיד מסכם באיזו תדירות מנצחת IS מגיעה לכל היותר לחציון OOS. התפלגות ה-logit המלאה מראה גם אם מועמדות שנבחרו בדרך כלל נשארות סמוך לאמצע, נופלות הרבה מתחתיו או מדורגות מעליו. Logit הוא המרה של דירוג יחסי, לא הסתברות לעסקה חיה מסוימת ולא תחזית מכוילת לתשואה עתידית.

דוגמה היפותטית עם ארבעה בלוקים נותנת PBO של 66.7%

נניח שיש ארבעה בלוקים היסטוריים שווים וארבעה כללים מועמדים R1 עד R4. הטבלה מציגה את ששת שיוכי IS. עמודת דירוג OOS מציגה את דירוג הכלל שנבחר ב-IS מבין ארבעת הכללים על בלוקי המשלים. כל הערכים היפותטיים ומשמשים להדגמת החישוב בלבד.

בלוקי ISמנצחת ISדירוג OOS rדירוג יחסי ω = r/5Logit ln(ω/(1−ω))בחציון או מתחתיו?
ABR110.20−1.386כן
ACR340.80+1.386לא
ADR220.40−0.405כן
BCR110.20−1.386כן
BDR430.60+0.405לא
CDR320.40−0.405כן

ארבע מתוך שש מועמדות שנבחרו קיבלו דירוג יחסי OOS שאינו גדול מחצי. לכן PBO אמפירי הוא 4/6 ≈ 0.667, כלומר כ-66.7%. לדוגמה, דירוג 2 נותן ω = 2/(4+1) = 0.4 ו-λ = ln(0.4/0.6) ≈ −0.405. דירוג 3 נותן ω = 0.6 ו-logit הפוך, כ-+0.405.

אין פירוש הדבר שהסיכוי להפסיד כסף בחודש הבא הוא 66.7%. במטריצה ההיפותטית הזו ובמוסכמת הדירוג הזו, מנצחת IS הייתה בחציון מועמדות OOS או מתחתיו בארבע מתוך שש חלוקות. גם לשתי המנצחות האחרות ייתכן שהיו תשואות OOS מוחלטות שליליות, אף שגברו על המתחרות.

התייחסו ל-PBO כאבחון מותנה שיש לו מגבלות

PBO תלוי במשפחת המועמדות, במטריצת הביצועים שנצפתה, במדד הבחירה, בבלוקים ובכלל השוויון. ניסויים שלא תועדו אינם נכללים. "בלתי תלוי במודל" פירושו שאפשר לחשבו מהיסטוריית הביצועים בלי להכיר את משוואות התחזית; אין פירוש הדבר שהוא חופשי מהחלטות תכנון, מאיכות נתונים או מהנחות.

CSCV משלב בלוקים לתת-מדגמים סימטריים ושווי גודל, אך קבוצת OOS אינה בדרך כלל תקופה כרונולוגית מאוחרת אחת. חיבור מחדש של בלוקים עלול לשבש תלות ארוכת טווח, עונתיות או רצף של משטרים כלכליים. S קובע הן את מספר השילובים והן את משך הזמן שכל בלוק מייצג; בחרו ותעדו אותו לפי האופקים והמבנה הרלוונטיים. מספר רב של שילובים אינו יוצר מספר זהה של תצפיות עצמאיות, משום שאותם בלוקים חוזרים.

המדד יורש הטיות בתשואות המקור: הטיית הישרדות, נתונים מתוקנים, מאפיינים שלא היו זמינים בזמן אמת, ביצועים לא מציאותיים, עלויות חסרות או יקום שנבחר בדיעבד עלולים להטעות בכל היסטוריית המועמדות. CSCV אינו מסיר אוטומטית מרווחי תוויות חופפים, אינו בהכרח מתאים מחדש כל צינור מודלים בכל חלוקה ואינו מונע דליפת מידע בעיבוד מקדים. יש לממש צעדים אלה במפורש בהתאם לשאלת המחקר. להגנות כרונולוגיות, ראו את התיעוד הרשמי של TimeSeriesSplit ואת מדריך האימות המטוהר.

מדדים תלויי-מסלול כמו ירידה מרבית דורשים זהירות נוספת: חיבור בלוקים שאינם רציפים משנה את המסלול ועשוי לשנות את המדד. מאמר PBO מציין שסדר התצפיות חשוב בחלק מהמדדים, בניגוד ל-Sharpe. הסבירו כיצד מטופלים סדר, פערים, תצפיות חסרות וריבית דריבית לפני פירוש הדירוג.

דווחו על PBO לצד ראיות כרונולוגיות ותיעוד החיפוש המלא

לפני החישוב שמרו את רישום המועמדות, כל שינוי שנעשה לאחר צפייה בתוצאות, מטריצת הביצועים, מדד הבחירה וכלל השוויון. דווחו T, N, S, בניית הבלוקים, C(S,S/2), מוסכמת דירוג OOS, אומדן PBO והתפלגות ה-logit. הציגו גם ביצועי OOS מוחלטים, עלויות, מחזור, ירידות ומספר מועמדות מפסידות: דירוג לבדו אינו מגלה אם כולן חלשות.

השתמשו ב-walk-forward או ב-holdout כרונולוגי אמיתי כדי לבחון את תהליך המחקר הקפוא על נתונים מאוחרים יותר. שמרו את התקופה האחרונה סגורה בזמן בחירת המודל והספים; בדיקה חוזרת הופכת אותה לקבוצת בחירה נוספת. כלים מסודרי-זמן כמו TimeSeriesSplit יוצרים חלוקות כרונולוגיות לפי ההנחות המתועדות שלהם, ואילו PBO מודד תכונת דירוג אחרת של קבוצת המועמדות שנבדקה.

לכן PBO משלים, אך אינו מחליף, בקרות חפיפת תוויות, ניתוח בדיקות מרובות, מודל ביצוע מציאותי, הערכה פרוספקטיבית וניטור חי. קראו גם על בדיקות מרובות ושיעור גילויים שגויים בפיננסים ועל התאמות Sharpe למתאם סדרתי. שום מדד יחיד אינו הופך דירוג היסטורי להוכחה ליתרון מסחר מתמשך.

שאלות נפוצות

Q1האם PBO אומר שזו ההסתברות שהאסטרטגיה תפסיד כסף?

לא. הוא אומד באיזו תדירות מועמדת שנבחרה ב-IS מדורגת בחציון OOS או מתחתיו בחלוקות המוגדרות. זו אינה הסתברות להפסד עתידי או תחזית מכוילת לתשואה חיה.

Q2האם CSCV זהה לבדיקת walk-forward?

לא. CSCV מצמיד כל מחצית של בלוקים למשלים שלה, ולכן OOS עשוי לכלול בלוקים מוקדמים ומאוחרים. Walk-forward שומר את האימון לפני כל תקופת בדיקה מאוחרת כדי לבדוק מסלול כרונולוגי דמוי פריסה.

Q3האם PBO נמוך מוכיח שלאסטרטגיה שנבחרה יש יתרון?

לא. המנצחת יכולה לעלות על קבוצה חלשה ועדיין להפסיד באופן מוחלט. העריכו בנפרד תשואה נטו, אי-ודאות, עלויות, דליפה וביצועים על נתונים מאוחרים באמת.

מקורות וקריאה נוספת

דיווח על בעיה

נכין אימייל עם קישור למאמר הזה. Mark יקבל את הדיווח רק לאחר שתשלחו אותו

בדיקה מהירה

סיימת לקרוא? בדוק את עצמך ב־3 שאלות

שאלה 1 / 3

שאלה 01

איזה אירוע נכלל באומדן PBO?

בחר תשובה כדי לראות את ההסבר

מילון מונחי אופציות

אימות מודלים למסחרPurged cross-validation ו־embargo: מניעת זליגת תוויות במודלי מסחרלמדו כיצד מסירים חפיפה בין תוויות עתידיות בסדרות פיננסיות, ובמה purging ו־embargo שונים מ־walk-forward, מ־TimeSeriesSplit ומ־CPCV.למה סף אחד נכשל כשחוקרים בודקים רעיונות רביםבדיקות מרובות ושיעור גילוי שגוי במימוןהבינו השוואות מרובות, שיעור שגיאה משפחתי, שיעור גילוי שגוי, Bonferroni, Holm, Benjamini–Hochberg, תלות, ערכי q, כריית גורמים, בחירת בק־טסטים וממשל מחקרסטטיסטיקה של ביצועי אסטרטגיותהאם להכפיל שארפ חודשי ב־√12? השפעת המתאם הסדרתילמדו באילו תנאים אפשר לחשב יחס שארפ שנתי מנתון חודשי, כיצד תלות סדרתית בתשואות משנה את החישוב, וקבלו דוגמה מספרית היפותטית ותיקון זמן־צבירה.הערכת תחזיות כיווניותמבחן Pesaran–Timmermann: האם תחזית כיוונית מוסיפה מידע?למדו כיצד מבחן Pesaran–Timmermann משווה בין שיעור הצלחה כיווני לבין קו בסיס המבוסס על שיעורי עלייה בפועל ובתחזית, ומדוע תלות סדרתית משנה את ההסקה.מחקר כמותיDeflated Sharpe Ratio: ריבוי בדיקות ובחירת תוצאות בק־טסטלמדו כיצד Deflated Sharpe Ratio מתאים את הראיות של מדד Sharpe לאחר בחירת אסטרטגיה, תוך התחשבות בבדיקות מרובות ובתשואות שאינן נורמליות, בעזרת דוגמה היפותטית והגבלות ברורות.