מבחן Diebold–Mariano: השוואת דיוק תחזיות
למדו מה משווה מבחן Diebold–Mariano, כיצד הפרשי הפסד ומתאם סדרתי משפיעים על הסטטיסטי, ומדוע דיוק תחזית אינו רווח ממסחר.
במדריך הזההמבחן משווה את תוחלת ההפסד של תחזיות
תקציר קצר
מבחן Diebold–Mariano (DM) בודק אם לשתי שיטות חיזוי יש תוחלת הפסד זהה עבור תוצאות בפועל שנמדדו זו מול זו. המבחן משתמש בסדרת הפרשי הפסד, ולכן פונקציית ההפסד, אופק החיזוי והתלות בין תאריכים משפיעים על התוצאה. דחיית השערת האפס תומכת בקיומו של הבדל תחת מערך ההערכה שצוין; היא אינה מוכיחה שמודל אחד ימשיך להיות עדיף או שאסטרטגיית מסחר תניב רווח לאחר עלויות.
המבחן משווה את תוחלת ההפסד של תחזיות
מבחן Diebold–Mariano משווה שתי תחזיות לאותו משתנה יעד ובאותם מועדי הערכה. בכל נקודת תחזית, שתי השיטות צריכות להשתמש באותה תוצאה שהתממשה, באותו אופק ובאותו מועד חיתוך של המידע. לאחר מכן המבחן בודק אם ההפסד הממוצע של שיטה אחת שונה באופן שיטתי מזה של האחרת, תוך אפשרות שהפרשי ההפסד משתנים לאורך זמן.
Diebold ו-Mariano ניסחו את השאלה עבור פונקציית הפסד כללית, ולא רק עבור טעות ריבועית ממוצעת. המאמר המקורי שלהם מציג מבחנים להשערת האפס שלפיה לתחזיות מתחרות יש דיוק חיזוי שווה (Diebold and Mariano, 1995). כאן, "דיוק" פירושו תוחלת הפסד נמוכה יותר לפי הפונקציה שנבחרה להשוואה. אין פירוש הדבר שהתחזית נכונה, מסבירה סיבתיות, מכוילת היטב בכל חלקי ההתפלגות או מועילה לכל החלטה.
נניח שמודלים A ו-B חוזים את אותה תשואה עתידית באותו זמן. מבחן DM אינו בודק אם מקדם במודל כלשהו שווה לאפס, וגם לא אם הערכים המותאמים של המודלים זהים במדגם האמידה. הוא משווה כיצד שגיאות התחזית שלהם מתורגמות להפסד שנבחר במדגם ההערכה.
יש לקבוע את מערך ההערכה לפני פירוש הסטטיסטי: יעד, מועדי תחזית, אופק, פונקציית הפסד, טיפול בתוצאות חסרות, תזמון חישוב מחדש של המודל והשערה חלופית חד-צדדית או דו-צדדית. הבחירות האלה מגדירות את שאלת המבחן. אם הן שונות בין המודלים, הפרש ההפסד כבר אינו השוואה בתנאים זהים.
הגדירו תחזיות מותאמות והפרש הפסד
נסמן את ערך היעד שהתממש בנקודת התחזית $t$ ב-$y_t$, ואת תחזיות מודלים A ו-B ב-$\hat y_{A,t}$ וב-$\hat y_{B,t}$. שגיאות התחזית הן $e_{A,t}=y_t-\hat y_{A,t}$ ו-$e_{B,t}=y_t-\hat y_{B,t}$. עבור פונקציית הפסד $L$, הפרש ההפסד בתאריך נתון הוא:
$$ d_t=L(e_{A,t})-L(e_{B,t}) $$
לפי סימן זה, ממוצע שלילי של $d_t$ פירושו של-A היה הפסד נצפה נמוך יותר; ממוצע חיובי פירושו של-B היה הפסד נמוך יותר. השערת האפס באוכלוסייה היא $E[d_t]=0$. השערה חלופית דו-צדדית בודקת אם יש הבדל בכל כיוון; חלופה חד-צדדית בודקת כיוון שנקבע מראש. אין לבחור את הכיוון לאחר שראיתם איזה מודל ניצח.
בהפסד ריבועי $L(e)=e^2$, טעויות גדולות מקבלות משקל גבוה באופן לא פרופורציונלי. בהפסד מוחלט $L(e)=|e|$, טעות גדולה יחידה משפיעה פחות על הדירוג. הפסד קוונטילי עשוי להתאים ליעד א-סימטרי. פונקציית הפסד שונה יכולה להפוך את דירוג המודלים, ולכן ל"תחזית הטובה ביותר" אין משמעות יחידה לפני שמגדירים את ההפסד. גם הסקירה של Tashman על מבחני חיזוי מחוץ למדגם מדגישה שעל שיטת ההערכה להתאים לבעיית החיזוי (Tashman, 200000065-0)).
השתמשו באותם מועדי תחזית ובאותן תוצאות שהתממשו עבור שני המודלים. אם חסרה למודל אחד תחזית לתאריך קשה, השמטת התאריך בשקט רק עבור אותו מודל משנה את מדגם ההשוואה. אם בשימוש בפועל המודל יחושב מחדש מדי חודש עם נתונים חדשים, צרו תחזיות הערכה לפי אותו כלל; תחזית עם פרמטרים קבועים עונה על שאלה אחרת. אימות walk-forward מסביר כיצד לייצר תחזיות סדרתיות בלי להשתמש בנתונים עתידיים.
דוגמה של ארבע נקודות תחזית מסבירה את ההפרש הממוצע
נניח ארבע נקודות תחזית היפותטיות ונמדוד את היעד ואת השגיאות בנקודות אחוז. השגיאות של A הן $[1,2,0,1]$ ושל B הן $[2,1,1,1]$. כל זוג מתייחס לאותה תשואה שהתממשה ולאותו חלון תחזית. הערכים מומצאים לצורך המחשת החשבון בלבד.
בהפסד ריבועי, ההפסדים של A הם $[1,4,0,1]$ ושגיאת הריבוע הממוצעת היא $(1+4+0+1)/4=1.50$ נקודות אחוז בריבוע. ההפסדים של B הם $[4,1,1,1]$, ושגיאת הריבוע הממוצעת היא $(4+1+1+1)/4=1.75$. בארבע התוצאות האלה, ה-MSE של A נמוך ב-0.25 נקודות אחוז בריבוע.
הפרשי ההפסד לפי תאריך, $d_t=L(e_{A,t})-L(e_{B,t})$, הם $[-3,3,-1,0]$. הממוצע שלהם הוא $(-3+3-1+0)/4=-0.25$, בדיוק MSE הממוצע של A פחות זה של B. הסימן השלילי מעדיף את A לפי מוסכמה זו, אך עדיין אינו אומר אם ההבדל גדול מרעש הדגימה. ארבעה זוגות תחזיות אינם ראיה סטטיסטית משכנעת.
גם הגדרת ההפסד משנה מה פירוש "טוב יותר". בדוגמה היפותטית נפרדת, השגיאות המוחלטות של C הן $[0,0,0,3]$ ושל D הן $[1,1,1,1]$. בהפסד מוחלט, הממוצעים הם 0.75 עבור C ו-1 עבור D, ולכן C עדיף. בהפסד ריבועי, הממוצעים הם 2.25 ו-1, ולכן D עדיף. המבחן אינו יכול לפתור את אי-ההסכמה בלי לקבוע אילו טעויות חשובות יותר.
<!-- Illustration placement: after this section; text-free conceptual scene showing two forecast paths against one realized path, with visibly different miss distances and no labels or numerical claims. -->
סטטיסטי DM מנרמל את הפרש ההפסד לפי אי-הוודאות שלו
ממוצע המדגם של הפרש ההפסד הוא $\bar d=T^{-1}\sum_{t=1}^{T}d_t$, כאשר $T$ הוא מספר תוצאות התחזית המותאמות. שגיאת התקן תלויה בשונות ארוכת הטווח של $d_t$, ולא רק בשונות בתאריך יחיד. הצורה הכללית של סטטיסטי המבחן היא:
$$ DM=\frac{\bar d}{\sqrt{\widehat{\Omega}/T}} $$
הסימון $\widehat{\Omega}$ אומד את השונות ארוכת הטווח של סדרת הפרשי ההפסד. אם התאריכים היו בלתי תלויים, היא הייתה מתקרבת לשונות של $d_t$ לפי האומד שנבחר. אולם הפסדי תחזית נוטים להתקבץ: בתקופה תנודתית שגיאות שני המודלים עשויות לגדול יחד, ויעד של $h$ צעדים קדימה עשוי ליצור חלונות שגיאה סמוכים שחולקים תשואות שהתממשו. התעלמות מתלות חיובית עלולה להקטין את שגיאת התקן ולגרום לראיות להיראות חזקות מדי.
בנייה נפוצה של HAC אומדת אוטוקווריאנסים $\hat\gamma_k$ של הפרש ההפסד לאחר מרכוז, ומחברת אותם כך: $\widehat{\Omega}=\hat\gamma_0+2\sum_{k=1}^{q}w_k\hat\gamma_k$. עם משקולות Bartlett עד רוחב פס $q$, מתקיים $w_k=1-k/(q+1)$. Newey ו-West פיתחו אומד קווריאנס חיובי למחצה שמותאם להטרוסקדסטיות ולאוטוקורלציה (Newey and West). הגרעין ורוחב הפס הם בחירות יישום: ציינו אותם והתאימו אותם לעיצוב התחזית, לא לערך p רצוי. מדריך שגיאות תקן HAC מתאר את בעיית אומדן הקווריאנס הרחבה יותר.
בתנאי הסדירות של המבחן, משווים את סטטיסטי DM הסטנדרטי בקירוב להתפלגות נורמלית סטנדרטית. ערך מוחלט גדול מעיד שהפרש ההפסד הממוצע שנצפה גדול ביחס לאי-הוודאות המשוערת. הסימן מראה איזה מודל השיג הפסד נמוך יותר לפי הסדר שהוגדר; ערך p אינו מודד את גודל ההבדל או את ערכו הכלכלי. הוא גם אינו ההסתברות שהשערת האפס נכונה או שהתחזית תצליח בעתיד.
תחזיות רב-שלביות חופפות, ולכן גם טיפול במדגם סופי חשוב
כשמפיקים בכל תקופה תחזית ליעד שמתרחש כמה תקופות קדימה, חלונות ההערכה חופפים. לדוגמה, תחזית חודשית לתשואה המצטברת בשלושת החודשים הבאים חולקת שתיים משלוש התשואות עם התחזית שתופק חודש לאחר מכן. אפילו אם התשואות החודשיות בלתי תלויות, החפיפה יכולה ליצור אוטוקורלציה בשגיאות התחזית ובהפרשי ההפסד.
בהגדרת בסיס של $h$ צעדים, טבעי לכלול בחישוב השונות תלות לפחות עד פיגור $h-1$. זו אינה נוסחת רוחב פס אוניברסלית: אמידה מתגלגלת, יעדים מתמידים, התקבצות תנודתיות ופונקציית ההפסד עשויים ליצור תלות נוספת. תעדו את אופק התחזית, המרווח בין נקודות התחזית ואת הסיבה לבחירת חיתוך HAC או אומד שונות אחר. מספר שורות התחזית אינו בהכרח מספר הראיות הבלתי תלויות.
המבחן האסימפטוטי המקורי עלול שלא לשמור על רמת המובהקות בפועל במדגם בינוני. Harvey, Leybourne ו-Newbold הציעו תיקון מדגם סופי להשוואת שגיאות ריבועיות ממוצעות של תחזיות (HLN, 199700719-4)). צורה נפוצה לאופק $h$ ול-$T$ תחזיות מכפילה את סטטיסטי DM ב:
$$ DM_{HLN}=DM\sqrt{\frac{T+1-2h+h(h-1)/T}{T}} $$
את הסטטיסטי המתוקן משווים בדרך כלל להתפלגות $t$ עם $T-1$ דרגות חופש. עבור $T=60$ ו-$h=5$, המכפיל הוא בערך $0.925$. דוגמה זו רק ממחישה את חשבון התיקון; היא אינה אומרת ש-60 תצפיות מספיקות למודל מסוים או שההנחות מתקיימות. התיקון מטפל בבעיה מוגדרת של מדגם קטן, אך אינו מתקן דליפת מידע, יעד לא תקף, תלות שלא נמדלה, בחירת מודלים חוזרת או פונקציית הפסד שגויה.
מודלים מקוננים דורשים היגיון אחר להשוואת תחזיות
מודל A עשוי להיות גרסה מוגבלת של B, למשל כאשר B מוסיף מנבאים ל-A. גם תחת השערת אפס שלפיה למנבאים הנוספים אין ערך חיזוי באוכלוסייה, המקדמים המאומדים שלהם עלולים להוסיף רעש לתחזיות B. לכן ייתכן שלמודל הגדול יותר יהיה MSE נצפה גבוה יותר, אף שהמנבאים הנוספים אינם משפרים את תהליך החיזוי הבסיסי. ההיגיון של דיוק שווה עבור מודלים מתחרים שאינם מקוננים אינו חל אוטומטית ללא שינוי.
Clark ו-West פיתחו מבחנים בקירוב נורמליים לשוויון דיוק חיזוי במודלים מקוננים, והתאימו את השוואת השגיאות הריבועיות לרעש האמידה שמוסיף המודל הגדול (Clark and West, 2007). אין זה תחליף אוניברסלי לכל מבחן DM; הוא מיועד לשאלה מסוימת על מודלים מקוננים, פונקציית הפסד ומסגרת אסימפטוטית. קבעו אם מודל אחד מקונן באחר ובחרו מבחן שהתפלגות האפס שלו מתאימה לעיצוב. אל תניחו שערך p סטנדרטי של DM בתוכנה מכסה כל יחס בין מודלים.
גם הבחנות אחרות חשובות. תחזית עם MSE נמוך יותר לא בהכרח משפרת כיסוי רווחי סמך, כיול הסתברויות, דיוק כיווני או החלטה בהמשך. השוואה מחוץ למדגם עדיין עשויה להשתמש בסט בדיקה לא מתאים אם בדקו אותו שוב ושוב בזמן פיתוח המודל. ציינו את היחס בין המודלים, שיטת האמידה, אופק התחזית והנתונים ששימשו ליצירת כל תחזית.
דיוק תחזית אינו יתרון במסחר
תוצאת DM מעריכה הפסד חיזוי; החלטת מסחר מעריכה תהליך של תשואה וסיכון. MSE נמוך יותר לתשואת התקופה הבאה אינו מבטיח שאות יבחר את כיוון העסקה הנכון בתדירות מספקת, יקבע גודל פוזיציה מתאים או ישרוד תחלופה, מרווח, השפעת שוק, עמלות, עלות השאלה, מימון ועיכוב בביצוע. מנגד, תחזית עם שגיאה ריבועית ממוצעת מעט גבוהה יותר עדיין עשויה לשפר החלטה אם היא מדויקת יותר בזמן שהאסטרטגיה חשופה במידה רבה. לטענה כזאת ייתכן שפונקציית ההפסד צריכה לשקף את ההחלטה בפועל ולא מדד תחזית כללי ונוח.
גם הבדל מובהק סטטיסטית עשוי להיות זניח כלכלית. דווחו על גודל הפרש ההפסד הממוצע ביחידות שניתן לפרש, יחד עם אי-הוודאות, ולא רק על ערך p או תווית של מנצח. אם הטענה עוסקת בתוצאות תיק, הריצו מחדש את כלל ההחלטה המלא והמקובע על נתונים מאוחרים מתאימים ובהנחות מסחר מציאותיות, ודווחו בנפרד על תוצאות נטו. DM אינו מחשב תוצאות אלה ואינו מביא עלויות בחשבון, אלא אם פונקציית ההפסד תוכננה במפורש לכך.
המבחן גם אינו מתקן חיפוש בין מודלים, יעדים, אופקים, פונקציות הפסד, טווחי תאריכים או כללי מסחר רבים, ולאחר מכן דיווח רק על ההשוואה הנוחה ביותר. מבחנים זוגיים חוזרים יוצרים בעיית בחירה משלהם. שמרו תיעוד של החיפוש והשתמשו בשיטה לבדיקות מרובות שמתאימה למשפחת הטענות. מדריך בדיקות מרובות ושיעור גילויים שגויים מסביר מדוע ספים רגילים עלולים להטעות אחרי חיפוש רחב. DM הוא כלי הערכה, לא תיקון לכריית נתונים.
דווחו מספיק פרטים כדי שאפשר יהיה לשחזר את ההשוואה
דוח ברור מציין את היעד והיחידות, מועד חיתוך המידע, נקודות התחזית, האופק, לוח הזמנים לחישוב מחדש ואת מדגם ההערכה המשותף. הוא מפרט את פונקציית ההפסד ואת הסימן של $d_t$, את ההפסד הממוצע של כל מודל ואת ההפרש הממוצע, את ההשערה החד-צדדית או הדו-צדדית שנבחרה מראש, אומד השונות, הגרעין, רוחב הפס, סטטיסטי המבחן, התפלגות הייחוס, ערך p ורווח סמך או אומדן אי-ודאות מתאים.
חשפו גם אם המודלים מקוננים, כיצד טופלו תוצאות חסרות וערכים קיצוניים, כמה מפרטים חלופיים נבדקו והאם תקופת ההערכה השפיעה על בחירת המודל. הציגו את גודל ההבדל, ולא רק אם עבר סף. סדרת זמן של $d_t$ או גרף הפרשי הפסד מצטברים עשויים לחשוף שינויי משטר שהממוצע הכללי מסתיר, אך גרף אינו מחליף הסקה שמביאה תלות בחשבון.
במסחר כמותי, תארו גם כיצד התחזית הופכת לפעולה: סף אות, גודל פוזיציה, מועד איזון מחדש, בקרות סיכון, מחיר ביצוע והנחות עלויות. DM משווה רק את סדרת הפסדי החיזוי שהוזנה אליו. הוא אינו מאשר את צינור הנתונים, אינו הופך מדגמי הערכה שונים לבני השוואה, אינו מוכיח סיבתיות ואינו מבטיח שהדירוג ההיסטורי יישמר. השתמשו בו כחלק שקוף מהערכת המודל, לצד תכנון תחזית ששומר על סדר הזמן והערכה מפורשת ברמת ההחלטה.
שאלות נפוצות
Q1האם מבחן Diebold–Mariano משווה מקדמים של מודלים?
לא. הוא משווה את תוחלת ההפסד של שגיאות שמפיקות שתי שיטות חיזוי עבור תוצאות מותאמות. מבחן מקדם עונה על שאלה אחרת לגבי פרמטר במודל.
Q2האם אפשר להשתמש במבחן לתחזיות של כמה תקופות קדימה?
כן, אך חלונות יעד חופפים עלולים ליצור תלות סדרתית בין הפרשי הפסד עוקבים. השתמשו באומד שונות, ובמידת הצורך בתיקון מדגם סופי, שמתאימים לאופק ולתכנון המודל; תעדו את הבחירות.
Q3האם תוצאה מובהקת אומרת שהתחזית הטובה יותר תרוויח כסף?
לא. היא תומכת בהבדל בהפסד התחזית שנבחר תחת מערך ההערכה. רווחיות תלויה גם באופן שבו התחזיות הופכות לפוזיציות, בסיכון שנלקח, בביצוע בפועל ובעלויות המסחר.
מקורות וקריאה נוספת
דיווח על בעיה
נכין אימייל עם קישור למאמר הזה. Mark יקבל את הדיווח רק לאחר שתשלחו אותו
בדיקה מהירה
סיימת לקרוא? בדוק את עצמך ב־3 שאלות
שאלה 01
מהי השערת האפס בהשוואת Diebold–Mariano בסיסית?
בחר תשובה כדי לראות את ההסבר
מילון מונחי אופציות
Variation in the conditional error variance across regressor values or states, invalidating an equal-variance covariance formula.
קראו את המדריך המעמיקFamily-wise error rateThe probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
קראו את המדריך המעמיק