Skip to content
כל מדריכי האופציות
מחקר כמותי12 דקות קריאה

Deflated Sharpe Ratio: ריבוי בדיקות ובחירת תוצאות בק־טסט

למדו כיצד Deflated Sharpe Ratio מתאים את הראיות של מדד Sharpe לאחר בחירת אסטרטגיה, תוך התחשבות בבדיקות מרובות ובתשואות שאינן נורמליות, בעזרת דוגמה היפותטית והגבלות ברורות.

במדריך הזהDSR מעלה את סף ה־Sharpe לאחר חיפוש

תקציר קצר

Deflated Sharpe Ratio (DSR) בוחן אם אומדן ה־Sharpe של אסטרטגיה שנבחרה עובר סף שמשקף גם את החיפוש בין חלופות וגם את צורת התפלגות התשואות. הוא מפעיל חישוב הסתברותי של Sharpe מול אמת מידה המותאמת לבחירה. DSR הוא אבחון סטטיסטי מותנה: הוא אינו הופך בק־טסט להוכחה לרווחים בעתיד ואינו מתקן ניסויים שהושמטו, עלויות לא מציאותיות או דליפת מידע לאורך זמן.

DSR מעלה את סף ה־Sharpe לאחר חיפוש

חוקרים עשויים לבדוק הגדרות אות שונות, חלונות מבט לאחור, ספי כניסה, יקומי נכסים, תקופות החזקה והנחות על עלויות, ואז לדווח על הגרסה עם יחס ה־Sharpe הגבוה ביותר. גם אם לאף מועמד אין מיומנות אמיתית, האומדנים משתנים בגלל רעש המדגם. ככל שהחיפוש רחב יותר, כך אומדן המקסימום נוטה לעלות. לכן התוצאה שנבחרה שונה מהערכה של אסטרטגיה יחידה שהוגדרה לפני צפייה בנתונים.

Deflated Sharpe Ratio, שהוצע על ידי Bailey ו־López de Prado, מטפל בשני מקורות לניפוח ה־Sharpe שנבחר: בדיקות מרובות ותשואות שאינן נורמליות. בדיקות מרובות מעלות את אמת המידה שעל התוצאה לעבור; אי־נורמליות משנה את אי־הוודאות המוערכת של Sharpe. המאמר המקורי מתאר את DSR כ־Probabilistic Sharpe Ratio שמחושב מול סף המותאם לבחירה. המאמר המקורי מציג את הגזירה ואת אומדן מספר הניסיונות.

הניסוח הזה מונע טעות פרשנית נפוצה. DSR אינו מפחית באופן מכני קנס קבוע מה־Sharpe המדווח כדי ליצור יחס ביצועים חדש. הוא אומד עד כמה ה־Sharpe שנצפה עולה על סף הקשור לחיפוש, לאורך המדגם ולמומנטי התשואה. אומדן הנקודה של Sharpe יכול להישאר ללא שינוי בעוד DSR יורד כי הראיות חלשות יותר. להבנת Sharpe עצמו, ראו גם את ההסבר המקורי של Sharpe.

הטובה מבין אומדנים רועשים רבים גבוהה לעיתים קרובות באופן חריג

נניח שלכל הכללים שנבדקו יש Sharpe אמיתי זהה, אך כל אומדן משתנה משום שהוא מבוסס על מדגם סופי. בחירה באומדן הגבוה ביותר בוחרת גם שגיאת מדידה חיובית. זו קללת המנצח: בנתונים חדשים מצפים שהאומדן שנבחר יתקרב חזרה לערך הטיפוסי של הקבוצה.

מספר הניסיונות חשוב, אך גם המידה שבה האומדנים שלהם שונים. אם המועמדים מפיקים תשואות כמעט זהות, אומדני Sharpe שלהם קשורים זה לזה ואינם מספקים הזדמנויות עצמאיות רבות למציאת מקסימום מקרי, לעומת אותו מספר של מועמדים בלתי קשורים. לכן מספר השורות ברשת פרמטרים אינו בהכרח מספר הניסיונות העצמאיים.

יומן החיפוש יכול לכלול גם החלטות מחוץ לרשת פורמלית: שינוי ידני של סף, השמטת שוק או שינוי הנחת עלויות שהשפיעו על התוצאה שנותרה. DSR שמחושב רק למועמדים הסופיים אינו יכול להביא בחשבון ניסויים שלא תועדו או לא סופקו כקלט לחישוב.

Probabilistic Sharpe Ratio מחשב אי־ודאות במדגם

Probabilistic Sharpe Ratio (PSR) אומד אם Sharpe של המדגם עובר אמת מידה שנבחרה, תוך התחשבות במספר תצפיות התשואה ובאומדני הא־סימטריה והקורטוזיס. DSR משתמש באותו חישוב בסיסי, אך בוחר אמת מידה שמשקפת את Sharpe המרבי הצפוי בחיפוש.

בקירוב PSR נפוץ אחד, החישוב המותאם לבחירה הוא:

$$ \mathrm{DSR}=\Phi\!\left( \frac{(\widehat{SR}-SR_0)\sqrt{T-1}} {\sqrt{1-\widehat{\gamma}_3\widehat{SR} +\frac{\widehat{\gamma}_4-1}{4}\widehat{SR}^{\,2}}} \right) $$

כאן $\Phi$ היא פונקציית ההתפלגות המצטברת של ההתפלגות הנורמלית הסטנדרטית, $\widehat{SR}$ הוא Sharpe שנצפה לכל תצפית תשואה, $SR_0$ הוא הסף המותאם לבחירה באותן יחידות ו־$T$ הוא מספר התצפיות. $\widehat{\gamma}_3$ היא הא־סימטריה במדגם. $\widehat{\gamma}_4$ היא קורטוזיס פירסון, שערכה 3 בהתפלגות נורמלית. המכנה משקף כיצד א־סימטריה וקורטוזיס משנות את אי־הוודאות באומדן Sharpe.

הביטוי רגיש למוסכמות. יש להשתמש בתשואות עודפות בתדירות אחת, לחשב את Sharpe ואת הסף באותה תדירות ולהגדיר קורטוזיס בעקביות. שנתון של אחד הגדלים בלבד משנה את ההשוואה. הנוסחה המקובלת גם נשענת על הנחות לגבי התלות בין תצפיות התשואה; יש לטפל בתלות סדרתית בנפרד ולא להטמיע אותה בשקט בתוך $T$.

סף המקסימום הצפוי תלוי במשפחת המועמדים

עבור $N$ אומדני Sharpe בלתי תלויים בעלי התפלגות נורמלית בקירוב, Bailey ו־López de Prado משתמשים בקירוב ערכי קיצון למקסימום הצפוי:

$$ SR_0 \approx \mu_{SR}+\sigma_{SR} \left[(1-\gamma_E)\Phi^{-1}\!\left(1-\frac{1}{N}\right) +\gamma_E\Phi^{-1}\!\left(1-\frac{1}{Ne}\right)\right] $$

$\mu_{SR}$ ו־$\sigma_{SR}$ מתארים את הממוצע ואת סטיית התקן של אומדני Sharpe של המועמדים; $\Phi^{-1}$ היא פונקציית האחוזונים הנורמלית הסטנדרטית, $e$ הוא מספר אוילר ו־$\gamma_E \approx 0.5772$ הוא קבוע אוילר–מסקרוני. הביטוי אומד עד כמה הבחירה לבדה יכולה להעלות את האומדן הטוב ביותר לפי מודל הניסיונות שנבחר. זה אינו סף אוניברסלי לכל חיפוש אסטרטגיה.

כאשר תוצאות המועמדים מתואמות, התייחסות לכל שינוי כבלתי תלוי עלולה להפריז במספר הניסיונות האפקטיבי. המאמר דן באמידת מספר הניסיונות הבלתי תלויים מתוך התלות בין המועמדים, אך גם אומדן זה הוא בחירת מודל נוספת. מתאם הוא רק צורה אחת של תלות, ואומדן המבוסס על מועמדים רבים והיסטוריית תשואות קצרה עלול להיות לא יציב. יש לדווח על מספר המועמדים הגולמי, על השיטה לאמידת מספר אפקטיבי כלשהו ועל הרגישות לחלופות סבירות.

חישוב היפותטי מפריד בין הסף ל־Sharpe שנצפה

נניח חיפוש מפושט במכוון של 20 אסטרטגיות מועמדות בלתי תלויות. תחת השערת האפס, נניח שממוצע אומדני Sharpe שלהן הוא 0 וסטיית התקן שלהם 0.20 ביחידות חודשיות. קירוב המקסימום הצפוי נותן סף בחירה של כ־$SR_0=0.380$ לחודש. אלה הנחות להמחשת החשבון, לא תצפיות שוק או אמת מידה מומלצת.

כעת נניח שלאסטרטגיה שנבחרה יש 60 תצפיות חודשיות של תשואות עודפות, Sharpe חודשי משוער של 0.50, א־סימטריה במדגם 0 וקורטוזיס פירסון 3. רכיב PSR משווה 0.50 ל־0.380 ולא לאפס:

$$ z=\frac{(0.50-0.380)\sqrt{59}}{\sqrt{1+((3-1)/4)(0.50)^2}} \approx 0.868,\qquad \mathrm{DSR}=\Phi(z)\approx 0.807 $$

לפי ההנחות המפושטות, DSR הוא כ־80.7%. אין פירוש הדבר שיש הסתברות של 80.7% שהאסטרטגיה תרוויח בחודש הבא, וזה גם אינו תחזית לתשואה בחודש הבא. זהו אומדן לראיות לכך ש־Sharpe הבסיסי עובר את סף הבחירה שנבחר, בהתניה במודל ובקלטים. מספר ניסיונות אחר, אומדן תלות אחר, מדגם אחר או צורת תשואות אחרת עשויים לשנות את התוצאה.

הרגישות לפיזור אומדני הניסיונות מהותית. אם רק סטיית התקן המונחת של אומדני Sharpe של המועמדים משתנה מ־0.20 ל־0.10, אותו חיפוש של 20 ניסיונות נותן סף של כ־0.190 ו־DSR של כ־98.8%. אם סטיית התקן היא 0.30, הסף הוא כ־0.570 וה־DSR כ־30.6%. ה־Sharpe שנצפה, 0.50, מספר התצפיות 60, הא־סימטריה והקורטוזיס נשארים קבועים. הרגישות ההיפותטית הזו מראה מדוע חשובות שיטת אומדן פיזור הניסיונות והתלות בין המועמדים; הערכים עדיין משתמשים באותן יחידות חודשיות ובאותו מודל מפושט.

א־סימטריה וקורטוזיס משנות את אי־הוודאות, לא רק את התיאור

לשתי אסטרטגיות יכול להיות אותו Sharpe מדגמי ואותו אורך מדגם, אך התפלגויות תשואה שונות. זנב שמאלי בולט, א־סימטריה או תצפיות קיצון תכופות באופן חריג עשויים לשנות את אי־הוודאות במדגם שמיוצגת במכנה PSR. התיקון מחושב מהמומנטים שנמדדו; הוא אינו מתייחס לכל התפלגות שאינה נורמלית כמזיקה באותה מידה ואינו מבטיח שמספר קטן של מומנטים מדגמיים מתאר את התנהגות הזנב במלואה.

החישוב תלוי גם בהגדרה של תצפית אחת. נתונים יומיים, שבועיים וחודשיים מניבים ערכים שונים של $T$, Sharpe, א־סימטריה וקורטוזיס. תשואות מתקופות החזקה חופפות עלולות להפוך שורות סמוכות לתלויות. סימונים מוחלקים או מיושנים עשויים להיראות פחות תנודתיים מהסיכון הכלכלי הבסיסי. יש לתאר את תדירות המדגם ואת אופן בנייתו במקום להתייחס ל־Sharpe שנתי כאל קלט מספיק.

DSR ושיטות אימות אחרות עונים על שאלות שונות

PBO משתמש ב־Combinatorially Symmetric Cross-Validation כדי לשאול באיזו תדירות המנצח בתוך המדגם מדורג בחציון המועמדים או מתחתיו בבלוקים משלימים. DSR אומד אם Sharpe שנבחר עולה על סף המותאם לחיפוש ולאי־נורמליות. הפלטים והנחות הדגימה מחדש שונים, ולכן שיטה אחת אינה מחליפה את האחרת. ראו גם את המדריכים על PBO ו־CSCV ועל בדיקות מרובות בפיננסים. Bailey ושותפיו מנסחים את אבחון הבחירה הזה באופן פורמלי במאמר המקורי על PBO.

White’s Reality Check משתמש ב־bootstrap כדי לבדוק אם הכלל הטוב ביותר במשפחת מועמדים גובר על אמת מידה מוגדרת לאחר התחשבות ב־data snooping. השאלה בו יחסית לאמת מידה, בעוד DSR משתמש בסף מבוסס Sharpe. הערכת walk-forward כרונולוגית או מדגם בדיקה סופי שואלת כיצד תהליך קפוא מתנהג בתקופות מאוחרות יותר. השיטות משלימות זו את זו כי הן בוחנות חלקים שונים של הטענה המחקרית. White מתאר את השיטה במאמר המקורי על Reality Check.

דווחו על החיפוש וההנחות לצד DSR

דוח שניתן לשחזר מציין את יקום המועמדים, כל החלטה מתועדת שהשפיעה על הבחירה, מספר הניסיונות הגולמי, שיטה לכל אומדן של מספר אפקטיבי, סדרת התשואות, אורך ותדירות המדגם, הגדרת Sharpe, א־סימטריה, מוסכמת הקורטוזיס וסף הבחירה המותאם. יש לציין אם התשואות הן לפני או אחרי מרווח קנייה־מכירה, עמלות, השפעת שוק, מימון, עלות השאלה ועלויות אחרות. הציגו יחד את Sharpe שנצפה ואת DSR כדי להראות מה השתנה.

הנוסחה המקובלת מניחה מודל דגימה שאולי אינו מתאים לתצפיות עם מתאם סדרתי. עבודתו של Lo על סטטיסטיקת Sharpe מסבירה מדוע צבירה לאורך זמן ותלות משפיעות על ההסקה. אם התשואות חופפות או מציגות מתאם סדרתי, השתמשו בהליך הסקה שמטפל במבנה הזה והסבירו את הנחותיו. הכפלת Sharpe חודשי ב־$\sqrt{12}$ אינה מתקנת מתאם אוטומטי. להערכה שמודעת לסדר הזמן ראו גם את המדריך על חלונות walk-forward מתרחבים ומתגלגלים.

DSR אינו יכול לגלות חיפוש שלא תועד, להסיר דליפת מידע עתידי, להפוך נתונים מוטי הישרדות למייצגים, לאמת ביצועים בפועל, לאמוד קיבולת או להבטיח יציבות במשטר חדש. הוא גם אינו מחליף היגיון כלכלי או ראיות כרונולוגיות מאוחרות יותר. התייחסו אליו כאבחון מתועד אחד בתהליך מחקר, ושמרו על רישום מועמדים וצינור נתונים שניתנים לשחזור.

שאלות נפוצות

Q1האם Deflated Sharpe Ratio הוא יחס Sharpe לאחר ניכוי קנס?

לא. DSR הוא מדד הסתברותי הבנוי מ־Sharpe שנבחר, סף המותאם לבחירה, אורך המדגם, א־סימטריה וקורטוזיס. אומדן הנקודה המדווח של Sharpe אינו מוחלף ביחס שהופחת באופן מכני.

Q2האם לספור כל צירוף פרמטרים כניסיון בלתי תלוי?

לא. למועמדים דומים עשויות להיות תשואות מתואמות, ולכן גודל הרשת הגולמי לא בהכרח שווה למספר ההזדמנויות הבלתי תלויות לבחור אומדן גבוה. שמרו את יומן החיפוש המלא ופרטו את שיטת ההתלות ואת אי־הוודאות שלה.

Q3האם DSR גבוה מוכיח שאסטרטגיית מסחר תעבוד?

לא. DSR מותנה במשפחת המועמדים, בנתונים, בבניית התשואות, בהנחות הניסויים ובמודל המדגם. הוא אינו מתקן ניסויים שהושמטו, שגיאות ביצוע, דליפה, שינוי משטר או אי־ודאות לגבי העתיד.

מקורות וקריאה נוספת

דיווח על בעיה

נכין אימייל עם קישור למאמר הזה. Mark יקבל את הדיווח רק לאחר שתשלחו אותו

בדיקה מהירה

סיימת לקרוא? בדוק את עצמך ב־3 שאלות

שאלה 1 / 3

שאלה 01

מה משתנה כאשר חישוב Probabilistic Sharpe משמש בסיס ל־DSR?

בחר תשובה כדי לראות את ההסבר

מילון מונחי אופציות

באיזו תדירות מוביל הבדיקה ההיסטורית יורד מתחת לחציון הקבוצההסבר על הסתברות התאמת היתר של בדיקות היסטוריות (PBO) ו-CSCVכך אימות צולב סימטרי קומבינטורי מעריך PBO, ממיר דירוגים מחוץ למדגם ל-logit, ומדוע המדד אינו תחזית להפסדים עתידייםלמה סף אחד נכשל כשחוקרים בודקים רעיונות רביםבדיקות מרובות ושיעור גילוי שגוי במימוןהבינו השוואות מרובות, שיעור שגיאה משפחתי, שיעור גילוי שגוי, Bonferroni, Holm, Benjamini–Hochberg, תלות, ערכי q, כריית גורמים, בחירת בק־טסטים וממשל מחקרסטטיסטיקה של ביצועי אסטרטגיותהאם להכפיל שארפ חודשי ב־√12? השפעת המתאם הסדרתילמדו באילו תנאים אפשר לחשב יחס שארפ שנתי מנתון חודשי, כיצד תלות סדרתית בתשואות משנה את החישוב, וקבלו דוגמה מספרית היפותטית ותיקון זמן־צבירה.בחרו את ההיסטוריה שממנה המודל הפיננסי לומדחלונות מתרחבים ומתגלגלים לאימות מודל Walk-Forwardהשוו חלונות אימון מתרחבים וקבועים באורכם למודלים פיננסיים, הפרידו בין אימות למבחן סופי ובחרו כללי חלון בלי להשתמש בתוצאות עתידיות.הערכת תחזיות כיווניותמבחן Pesaran–Timmermann: האם תחזית כיוונית מוסיפה מידע?למדו כיצד מבחן Pesaran–Timmermann משווה בין שיעור הצלחה כיווני לבין קו בסיס המבוסס על שיעורי עלייה בפועל ובתחזית, ומדוע תלות סדרתית משנה את ההסקה.