Skip to content
כל מדריכי האופציות
השוואת דיוק תחזיות14 דקות קריאה

מבחן Diebold–Mariano: איך להשוות בין דיוק תחזיות

למדו כיצד מבחן Diebold–Mariano משווה הפסדי תחזית מזווגים, מטפל באופקי תחזית חופפים, ומדוע ערך p נמוך אינו הוכחה למיומנות מסחר.

במדריך הזהשגיאת בק-טסט נמוכה יותר עדיין אינה מוכיחה שתחזית טובה יותר

תקציר קצר

מבחן Diebold–Mariano משווה בין שתי תחזיות באמצעות ההפסדים שלהן ביחס לאותן תוצאות שהתממשו. התוצאה תלויה בפונקציית ההפסד, במדגם ההערכה, באופק התחזית ובאופן אמידת אי-הוודאות. שגיאה מדגמית נמוכה יותר אינה מוכיחה כשלעצמה דיוק צפוי טוב יותר, ודיוק תחזית גבוה יותר אינו זהה לאסטרטגיית מסחר רווחית.

שגיאת בק-טסט נמוכה יותר עדיין אינה מוכיחה שתחזית טובה יותר

נניח ששני מודלים חוזים את אותה תשואה, תנודתיות או כמות כלכלית באותם מועדים. ייתכן שבמדגם ההערכה למודל A יש שגיאה ממוצעת נמוכה מזו של מודל B. זה מתאר את הפער שנצפה במדגם, אך אינו מלמד אם הוא חוזר באופן אמין או נובע מהמועדים שנכללו במקרה בבדיקה.

מבחן Diebold–Mariano (DM) הופך את ההשוואה לסדרת זמן מזווגת. בכל מועד תחזית הוא משווה את שתי התחזיות לאותה תוצאה שהתממשה, מדרג אותן לפי פונקציית הפסד שנבחרה מראש, ובוחן את רצף הפרשי ההפסד. הזיווג חשוב: יום שוק תנודתי יכול להגדיל את ההפסד של שני המודלים, ואילו ההשוואה בודקת אם אחד מהם נוטה להפסיד פחות באותם ימים ממש.

המסגרת המקורית אינה מוגבלת לשגיאה ריבועית או לטעויות תחזית בעלות התפלגות נורמלית. היא יכולה להשוות פונקציות הפסד שונות, לרבות א-סימטריות, כאשר הן מתאימות לשאלת התחזית. עם זאת, נדרשים מערך הערכה שאפשר להצדיק ואומדן של אי-הוודאות בממוצע הפרשי ההפסד. Diebold ו-Mariano (1995) הציגו את מבחן שוויון דיוק התחזיות; Harvey, Leybourne ו-Newbold (1997)00719-4) בחנו שינוי למדגם קטן.

השוו תחזיות בתנאים דומים לפני חישוב הסטטיסטי

כל שורה צריכה לייצג מועד תחזית שאפשר להשוות לאחרים. שני המודלים צריכים לחזות את אותו יעד ולאותו אופק, תוך שימוש במידע שהיה זמין במועד התחזית. יישרו בין התוצאות שהתממשו, חותמות הזמן, המטבע או יחידת המידה, גרסת הנתונים וכללי הטיפול בתצפיות חסרות. אם מודל אחד חוזה את שער הסגירה של מחר והאחר את הממוצע לחמישה ימים, השגיאות עונות על שאלות שונות.

השתמשו בתחזיות שנוצרו בלי מידע מהעתיד. תקופת בדיקה כרונולוגית או הערכה מתגלגלת דמוית מחוץ למדגם יכולות לעזור, אך חלוקה בלבד אינה מספיקה אם השתמשו שוב ושוב באותה תקופת בדיקה כדי לכוונן מאפיינים, ספים או גרסאות מודל. שמרו את התחזית שנוצרה בכל מועד היסטורי, יחד עם גרסאות הנתונים והמודל שיצרו אותה. אחרת, תיקונים לנתונים מקרו-כלכליים, מסננים להטיית הישרדות או התאמות מאוחרות לפעולות תאגידיות עלולים לשנות את ההערכה בדיעבד.

העריכו את שני המודלים על אותם מועדי תחזית. השמטת מועדים קשים ממודל אחד בלבד שוברת את ההשוואה המזווגת. אם חסרות תחזיות, הגדירו מדגם משותף או נמקו את דרך הטיפול בהן; אל תאפשרו למודלים להתמודד עם תקופות שוק שונות בלי לציין זאת. בחרו את תאריכי ההתחלה והסיום לפני שבוחנים איזה מדגם מניב את התוצאה הרצויה.

פונקציית ההפסד מגדירה מה פירוש «מדויק יותר»

נסמן את הערך שהתממש במועד t ב-yₜ ואת תחזיות המודלים A ו-B ב-ŷA,ₜ וב-ŷB,ₜ. השגיאות הן eA,ₜ = yₜ − ŷA,ₜ ו-eB,ₜ = yₜ − ŷB,ₜ. פונקציית הפסד L ממירה כל שגיאה לציון שבו נמוך יותר הוא טוב יותר. הפסד ריבועי L(e) = e² מעניש טעויות גדולות יותר. הפסד מוחלט L(e) = |e| גדל באופן ליניארי עם גודל הטעות. תחזית קוונטיל עשויה להשתמש בהפסד Pinball א-סימטרי, משום שלתחזית יתר ולתחזית חסר עשויות להיות עלויות שונות.

הציון שנבחר עשוי לשנות איזה מודל נראה טוב יותר. נניח שני זוגות שגיאה היפותטיים באותן יחידות: למודל A שגיאות 0 ו-2, ולמודל B שגיאות 1 ו-1. ההפסד הריבועי הממוצע הוא 2 ל-A ו-1 ל-B, ולכן B מקבל ציון טוב יותר. בהפסד מוחלט, הממוצע של שניהם הוא 1. אף חישוב אינו נכון תמיד; כל אחד עונה על שאלה אחרת לגבי הטעויות שחשובות.

הפסד ריבועי עשוי להתאים לתחזית של התוחלת המותנית של תשואה. תחזית תנודתיות דורשת ציון שמתאים ליעד שלה, ותחזית ערך בסיכון (VaR) עשויה לדרוש הפסד קוונטילים או בדיקת סיכון ייעודית. בחירת פונקציית ההפסד לאחר שראיתם איזה מודל ניצח הופכת את המבחן לחיפוש נוסף. קבעו את הציון ואת הכיוון של «טוב יותר» לפני עיון בהשוואה.

תחזית VaR מכוונת לקוונטיל בזנב ההתפלגות ולא לתחזית נקודתית רגילה. המדריך לבק-טסט של VaR מסביר כיצד מבחני תדירות החריגות ותזמונן בוחנים תחזית סיכון זו בנפרד.

חשבו הפרשי הפסד מזווגים והגדירו את השערת האפס

כאשר הפסד נמוך יותר הוא טוב יותר, הגדירו את ההפרש בתקופה t כך:

dₜ = L(eA,ₜ) − L(eB,ₜ)

לפי מוסכמת הסימן הזו, dₜ חיובי פירושו שלמודל B היה הפסד נמוך יותר באותו מועד; ערך שלילי תומך ב-A. ממוצע המדגם הוא d̄ = (1/n) Σ dₜ. השערת האפס של שוויון בדיוק הבלתי מותנה היא E[dₜ] = 0. חלופה דו-צדדית שואלת אם ההפסדים הצפויים שונים באחד הכיוונים. חלופה חד-צדדית שנקבעה מראש יכולה לבדוק אם למודל מסוים שנקבע בשמו יש הפסד צפוי נמוך יותר.

סטטיסטי הבדיקה הבסיסי הוא:

DM = d̄ / √(Ŝd / n)

Ŝd אומד את השונות ארוכת הטווח של סדרת הפרשי ההפסד, ולא רק את השונות של שגיאות התחזית בכל אחד מהמודלים. תחת השערת האפס ותנאי סדירות מתאימים, הסטטיסטי מתפלג אסימפטוטית כנורמלי סטנדרטי. ערכים חיוביים גדולים תומכים ב-B לפי מוסכמת הסימן לעיל; ערכים שליליים גדולים תומכים ב-A. ערך p מודד עד כמה הנתונים מתיישבים עם השערת האפס והנחות הדגימה שצוינו, ולא את ההסתברות שאחד המודלים נכון.

הזיווג מסלק הבדלים לא רלוונטיים בסולם השגיאה הכולל של שני המודלים רק במידה שהפרשי השגיאה בכל מועד לוכדים אותם. הוא אינו הופך את סדרת ההפסדים לעצמאית, אינו מסיר אוטומטית את אי-הוודאות באמידת פרמטרים ואינו מתקן חיפוש בין יעדים ומפרטים רבים. יש להביא בחשבון את ההחלטות האלה בתכנון ובאמידת אי-הוודאות.

דוגמה לתחזית צעד אחד מפרידה בין פער מדגמי לראיות

נניח 100 תחזיות היפותטיות מזווגות לצעד אחד. ההפסד הריבועי הממוצע של מודל A הוא 0.26 ושל מודל B הוא 0.23, ביחידות של נקודות אחוז בריבוע. לכן הפרש הממוצע הוא d̄ = 0.26 − 0.23 = 0.03, לטובת B במדגם. כדי לפשט את הדוגמה, נניח שהשונות ארוכת הטווח המשוערת של dₜ היא 0.04 ושאין שונות משותפת סדרתית בין מועדי התחזית.

שגיאת התקן של ההפרש הממוצע היא √(0.04 / 100) = 0.02. הסטטיסטי הלא-מתוקן הוא 0.03 / 0.02 = 1.50. עבור אופק h = 1 ו-T = 100, גורם המדגם הקטן של Harvey–Leybourne–Newbold הוא √[(T + 1 − 2h + h(h − 1)/T) / T] = √0.99 ≈ 0.995. הכפלה בו נותנת סטטיסטי מתוקן של כ-1.49; בהתפלגות t₉₉ משוערת כייחוס, ערך ה-p הדו-צדדי הוא בערך 0.14.

ל-B יש שגיאת ריבוע ממוצעת נצפית נמוכה יותר, אך דוגמה זו אינה מספקת ראיות חזקות נגד שוויון בדיוק הצפוי ברמות מובהקות מקובלות. אי-דחייה אינה מוכיחה שלמודלים דיוק זהה; דחייה עדיין מותנית בציון, במועדי התחזית ובהנחות שנבחרו. ערכי ההפסד והשונות כאן הם נתונים היפותטיים להמחשת החישוב, לא תוצאות אמפיריות.

שורשי השגיאות הריבועיות הממוצעות (RMSE) המקבילים הם בערך 0.510 ו-0.480 נקודות אחוז, פער תיאורי של 0.030 נקודות. עם זאת, סטטיסטי DM משתמש בהפרשי הפסד ריבועי מזווגים; הוא אינו מבחן t להפרש בין שני השורשים.

תרשים מושגי בשלושה חלקים: שני קווי תחזית מול אותו מסלול שהתממש, סימוני הפסד מזווגים בכל מועד תחזית, ואז עמודות של הפרשי הפסד חתומים סביב הממוצע עם רצועת אי-ודאות; ללא תוויות או ערכים מספריים.
המחשה מושגית של הפסדים מזווגים והפרשיהם במבחן Diebold–Mariano; אין כאן נתוני שוק אמיתיים או תוצאת בדיקה אמפירית.

אופקי תחזית חופפים יוצרים תלות בין הפרשי ההפסד

אם מוציאים מדי יום תחזית לחמישה ימים קדימה, תחזיות עוקבות חולקות ארבעה מחמשת ימי היעד. לכן השגיאות, ההפסדים והפרשי ההפסד עשויים לנוע יחד. התייחסות ל-100 מועדי תחזית יומיים כאל 100 השוואות בלתי תלויות עלולה להמעיט באי-הוודאות ולגרום לסטטיסטי להיראות גדול מדי.

השונות ארוכת הטווח מביאה בחשבון את השונות המשותפת הסדרתית ב-dₜ. אומד נפוץ העמיד לשונות משתנה ולאוטוקורלציה (HAC) הוא:

Ŝd = γ̂₀ + 2 Σₖ₌₁ᵐ wₖ γ̂ₖ

כאן γ̂ₖ היא האוטוקווריאנס המדגמי בהשהיה k, wₖ הוא משקל גרעין, ו-m הוא רוחב הפס שנבחר. Newey ו-West (1987) הציגו אומד HAC חצי-מוגדר חיובי. עבור שגיאות אידיאליות של תחזית h-צעדים, ובהנחות הרלוונטיות, החפיפה יוצרת לעיתים קרובות תלות עד לפחות h − 1 השהיות; מסגרת DM המקורית דנה באומד קטוע למקרה זה. בנתונים אמיתיים עשויה להיות תלות ארוכה יותר עקב יעדים מתמידים, אמידה מתגלגלת או בניית אסטרטגיה, ולכן h − 1 אינו כלל אוניברסלי לבחירת רוחב הפס.

דווחו על האופק, הגרעין, רוחב הפס וכל תיקון למדגם קטן. הראו אם המסקנות משתנות בהגדרות סבירות של התלות, במקום לבחור רוחב פס שמפיק את ערך ה-p הרצוי. אם מועדי התחזית מרווחים דיים כדי למנוע חפיפה, ציינו זאת והסבירו איזה מידע או גודל מדגם אובדים בשל כך. אמידת אי-ודאות שמתחשבת בתלות היא חלק מהמבחן, לא אפשרות תצוגה.

מודלים מקוננים ושינוי במיומנות התחזית מחייבים שאלות אחרות

קל יותר לפרש את השוואת DM הרגילה כאשר התחזיות אינן מקוננות תחת השערת האפס של דיוק שווה. אם מודל גדול מכיל מודל ייחוס קטן, המקדמים הנוספים שאומדים עלולים להוסיף רעש לתחזית גם כשהערכים האמיתיים שלהם אפס. תחת השערת האפס, להפרש הרגיל בין שגיאות הריבוע הממוצעות עשויה להיות התפלגות לא סטנדרטית. להשוואות MSPE מחוץ למדגם של מודלים מקוננים, שיטה כגון התאמת Clark–West מביאה בחשבון את השפעת רעש האמידה; היא אינה תחליף כללי ל-DM בכל תכנון מודל. ראו Clark ו-West (2007).

השערת האפס הרגילה של DM עוסקת בהפסד הממוצע הבלתי מותנה לאורך כל מדגם ההערכה. היא עלולה להסתיר שינויים בזמן: A עשוי להצליח יותר בתקופות רגועות ו-B בתקופות תנודתיות, אף שהממוצעים הכוללים דומים. אם השאלה היא האם הדיוק היחסי תלוי במידע שהיה ידוע במועד התחזית, מבחני יכולת חיזוי מותנית משתמשים בהפרשי הפסד יחד עם משתני עזר שנקבעו מראש. Giacomini ו-White (2006) פיתחו מסגרת כזו. ההנחות ותכנון חלון ההערכה חשובים, ולכן הוספת משתני דמה שרירותיים לאחר בדיקת התוצאות אינה קיצור דרך תקף.

בחירת המבחן צריכה להתאים למבנה ההשוואה: תחזיות בלתי מקוננות, מודלים מקוננים, יכולת מותנית שמשתנה, או משפחה שנבחרה מתוך מועמדים רבים אינם מקרים חלופיים זה לזה. במקרה האחרון, המדריך ל-White Reality Check ול-Hansen SPA מסביר תיקון ברמת המשפחה לאחר חיפוש בין כללי מסחר רבים.

הפסד תחזית נמוך יותר אינו מוכיח אסטרטגיה רווחית

תחזית עשויה להיות מדויקת יותר מבחינה סטטיסטית בלי לשפר את תוצאות המסחר נטו. אסטרטגיה צריכה להמיר את התחזית לפוזיציה, לבחור מתי לסחור ולשאת מרווחי קנייה-מכירה, עמלות, החלקה, השפעת שוק, מימון, עלויות השאלה ומגבלות סיכון. שיפור קטן בשגיאת הריבוע הממוצעת של תשואה עשוי לא להשפיע על החלטה שימושית; מנגד, מודל עם שגיאה ממוצעת מעט גבוהה יותר עשוי לזהות טוב יותר אירוע זנב שחשוב לכלל מסוים.

התייחסו להערכת תחזית ולהערכת תיק השקעות כשני שלבים נפרדים. תחילה בדקו את התחזית מול יעד ופונקציית הפסד שמתאימים למשימת החיזוי המוצהרת. לאחר מכן העריכו כלל מסחר שמוגדר במלואו על נתונים שלא שימשו לבחירת התחזית, ובהנחות מציאותיות על ביצוע ומימון. ערך p של מבחן תחזית אינו תשואת בק-טסט, יחס שארפ או הסתברות לרווח עתידי.

ניסיונות חוזרים של מודלים, יעדים, אופקים, פונקציות הפסד וחלונות מדגם יוצרים הטיית בחירה גם אם כל חישוב DM בפני עצמו נכון. תעדו את כל החיפוש והשתמשו בשיטה לתיקון משפחתי כאשר השאלה היא אם מועמד כלשהו שרד את החיפוש. המדריך לבלוק-בוטסטרפ עוסק באמידת אי-ודאות המשמרת תלות עבור סטטיסטי שנבחר מראש; הוא אינו מתקן כשלעצמו חיפוש מודלים שלא תועד.

דווחו מספיק פרטים כדי שחוקר אחר יוכל לשחזר את ההשוואה

ציינו את שמות שני מודלי התחזית, את הקשר שלהם למודל הייחוס, את היעד, האופק, לוח מועדי התחזית, תאריכי ההערכה, קבוצת המידע, גרסת הנתונים וכלל המדגם המשותף. הגדירו את פונקציית ההפסד מתמטית וציינו אם dₜ חיובי תומך ב-A או ב-B. דווחו על n, ההפסד הממוצע של כל מודל, d̄, אומד השונות ארוכת הטווח, גרעין ורוחב פס HAC, תיקון למדגם קטן, התפלגות ייחוס, כיוון המבחן וערך p.

ציינו גם אם המודלים מקוננים, כיצד נאמדו הפרמטרים, אם ההשוואה נבחרה לפני או אחרי בדיקת התוצאות, ואילו גרסאות נוספות נוסו. אם המדגם שימש לבחירת המודל, סמנו את המבחן כחלק מאותו תהליך במקום לתארו כראיות מחוץ למדגם שלא נגעו בהן. דיווח ברור מאפשר לקוראים לראות בדיוק מה המבחן משווה ואילו בעיות של אי-ודאות או בחירה נותרות מחוץ לו.

שאלות נפוצות

Q1האם מבחן Diebold–Mariano מניח ששגיאות התחזית מתפלגות נורמלית?

לא. המסגרת יכולה לטפל בשגיאות שאינן מתפלגות נורמלית. עדיין נדרשים אומדן מתאים של שונות הפרשי ההפסד ותנאי סדירות התומכים בהתפלגות הייחוס.

Q2האם אפשר להשוות שני מודלים שחוזים אופקים שונים?

לא כהשוואה שקולה של דיוק התחזית. יש ליישר תחילה את היעד ואת האופק; אחרת כל מודל עונה על שאלת תחזית אחרת.

Q3האם תוצאת DM מובהקת מספיקה לבחירת מודל מסחר?

לא. היא מספקת ראיות לגבי הפסד התחזית הצפוי בהשוואה מוגדרת. עדיין צריך להביא בחשבון חיפוש מודלים, כללי החלטה, עלויות ביצוע ומימון וביצועי אסטרטגיה מחוץ למדגם. מחקרי יסוד - Diebold ו-Mariano, “Comparing Predictive Accuracy” (1995) - Harvey, Leybourne ו-Newbold, “Testing the Equality of Prediction Mean Squared Errors” (1997)00719-4) - Giacomini ו-White, “Tests of Conditional Predictive Ability” (2006) - Clark ו-West, “Approximately Normal Tests for Equal Predictive Accuracy in Nested Models” (2007) - Newey ו-West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)

מקורות וקריאה נוספת

דיווח על בעיה

נכין אימייל עם קישור למאמר הזה. Mark יקבל את הדיווח רק לאחר שתשלחו אותו

בדיקה מהירה

סיימת לקרוא? בדוק את עצמך ב־3 שאלות

שאלה 1 / 3

שאלה 01

אם dₜ = L(eA,ₜ) − L(eB,ₜ), באיזה מודל תומך ממוצע מדגמי חיובי?

בחר תשובה כדי לראות את ההסבר

מילון מונחי אופציות

בדיקת ההטיה שנובעת מחיפוש אחר כללי מסחרWhite Reality Check מול מבחן Hansen SPA לכללי מסחרהשוו בין Reality Check ל־SPA כשבוחרים כלל מסחר מתוך משפחה שנבדקה, והבינו את ה־bootstrap, ההנחות והמגבלות.מדידת אי־הוודאות בביצועי אסטרטגיהBootstrap בבלוקים לתשואות אסטרטגיית מסחר: רווחי סמך תחת תלות בזמןלמדו כיצד להשתמש ב-bootstrap בבלוקים כדי לאמוד אי־ודאות בממוצע התשואה או ביחס שארפ של אסטרטגיית מסחר שנקבעה מראש, תוך שמירת התלות בזמן והבנת מגבלות השיטה.בדיקת תדירות החריגות והתזמון שלהןבדיקת VaR לאחור: הסבר על מבחני Kupiec ו-Christoffersenלמדו כיצד מבחן POF של Kupiec ומבחני הכיסוי המותנה של Christoffersen בודקים חריגות VaR, כיצד לקרוא דוגמה של 250 ימים, ולמה אי-דחייה אינה הוכחת דיוק.השוו בין שתי תחזיות לפי ההפסד שלהן על אותן תוצאות בפועלמבחן Diebold–Mariano: השוואת דיוק תחזיותלמדו מה משווה מבחן Diebold–Mariano, כיצד הפרשי הפסד ומתאם סדרתי משפיעים על הסטטיסטי, ומדוע דיוק תחזית אינו רווח ממסחר.מכניקת האופציותמהי הקצאת אופציה?הבינו כיצד הקצאת אופציה הופכת קול או פוט בשורט להתחייבות על מניות, מתי היא יכולה להתרחש וכיצד להתכונן עם מזומן ומניות