מבחן הכלת תחזיות: האם תחזית אחת כוללת את המידע של האחרת?
למדו כיצד בודקים מידע חיזויי נוסף ומדוע הכלה אינה שקולה להשוואת הפסדים, לכיול תחזית או להוכחת רווחיות.
במדריך הזהאיזו שאלה מבחן ההכלה עונה עליה?
תקציר קצר
מבחן הכלת תחזיות שואל אם תחזית מתחרה מוסיפה מידע ליניארי שעשוי לשפר תחזית ייחוס. התשובה תלויה בהשערה, באופן שבו נבנה המבחן ובאופן שבו נאמדו הפרמטרים. משקל שילוב חיובי או לא מובהק אינו פסק דין כללי על איכות המודל או על רווחיות.
איזו שאלה מבחן ההכלה עונה עליה?
נניח ש־A ו־B חוזים את אותו יעד y, מאותה נקודת מוצא ובאותו אופק. מבחן ההכלה אינו מסתפק בשאלה לאיזה מודל הייתה בעבר שגיאה קטנה יותר. הוא שואל: לאחר שמביאים בחשבון את תחזית A, האם בתחזית B נשאר אות נוסף שיכול לשפר את A במסגרת ליניארית מוגדרת? אם בתכנון הזה B אינו מוסיף מידע חיזויי, אומרים ש־A מכיל את B, או ש־B אינו משפר עוד את A.
הרעיון של הערכת הכלת תחזיות התפתח, בין השאר, בהשוואת מודלים מאקרו־כלכליים ליניאריים. Chong ו־Hendry (1986) דנים בו במאמר Econometric Evaluation of Linear Macro-Economic Models {source:chongHendry1986ForecastEncompassing}. המונח «מכיל» מתאר יחס מותנה בין תחזיות מסוימות להשערה מסוימת; הוא אינו אומר ש־A תמיד נכון או ש־B חסר תועלת בכל בעיה אחרת.
RMSE נמוך יותר מדרג את השגיאות שנצפו לפי מדד ומדגם מוגדרים. הכלה עוסקת במידע הנוסף שתחזית מתחרה מביאה ביחס לתחזית ייחוס. התשובות לשתי השאלות עשויות להיות שונות, ולכן דירוג RMSE לבדו אינו מוכיח הכלה.
RMSE הוא השורש הריבועי של ממוצע ריבועי שגיאות התחזית: RMSE = √[(1/n) Σₜ₌₁ⁿ eₜ²], ולא ממוצע ריבועי השגיאות עצמו.
התאימו את שתי התחזיות לפני ההשוואה
על f_A,t ועל f_B,t לחזות את אותו y, להשתמש באותו מידע שהיה זמין בכל נקודת תחזית, ולכסות אותו אופק. אחידו את הגדרת היעד, היחידות, חותמות הזמן, המדגם וכללי הטיפול בתצפיות חסרות. תחזית לשער הסגירה מחר אינה בת־השוואה ישירה לתחזית לממוצע של חמשת הימים הבאים, גם אם שתיהן מכונות תחזיות תשואה.
השתמשו בתחזיות שהיו זמינות בפועל בכל נקודת זמן היסטורית, ולא בגרסאות שאומדו מחדש מאוחר יותר בעזרת מידע עתידי. שמרו את גרסאות הנתונים והמודלים ותעדו כיצד טיפלתם בנתונים כלכליים מתוקנים ובמחירים מותאמים. אם התקופה או המפרט נבחרו לאחר עיון בתוצאות, תארו זאת כחלק מתהליך החיפוש ולא כאימות עצמאי מחוץ למדגם.
הגדירו במפורש את סימני השגיאה: e_A,t = y_t − f_A,t ואת הפרש התחזיות d_t = f_B,t − f_A,t. קבעו את המוסכמה לפני חישוב מקדם. החלפת הסדר בין A ל־B הופכת את הסימן של d ושל משקל השילוב. המידע עצמו אינו משתנה, אך פירוש הסימן משתנה.
השיפוע מתאר אות ליניארי אפשרי שמוסיף B
אפשר להגדיר שילוב ליניארי להמחשה כך: f_C,t = f_A,t + w d_t, כלומר f_C,t = (1−w)f_A,t + w f_B,t. רגרסיה של השגיאה e_A,t על קבוע ועל d_t עוזרת לפרש את w: אם ההפרש בין התחזיות קשור לשגיאות של A, ייתכן שהוא נושא מידע ליניארי נוסף. בייצוג הזה השיפוע אומד את המשקל הנוסף ל־B, ואילו הקבוע קולט את ההטיה הממוצעת של A.
אבל זו אינה הגדרה אחידה לכל מבחני ההכלה. יש מפרטים שמגבילים את הקבוע או את הטיית התחזית; אחרים משתמשים בתחזית ייחוס או במידע מותנה אחר. המבחן עשוי לבדוק חלופה חד־צדדית או כמה הגבלות יחד. פרמטרים שנאמדו ומבנה של מודלים מקוננים עשויים גם לשנות את ההסקה המתאימה. לכן ציינו את המבחן, ההשערה והנחותיו; אל תציגו רגרסיה אחת או ערך קריטי אחד כנוסחה אוניברסלית.
משקלים נאמדים יכולים להיות מחוץ לטווח [0,1]. במקרה כזה, השילוב הליניארי הטוב ביותר במדגם מבצע אקסטרפולציה אל מעבר לשתי התחזיות במקום להישאר ביניהן. יישום מסוים עשוי להגביל משקלים להיות לא־שליליים או שסכומם יהיה אחד, אך ההגבלות תלויות בשיטה. פרטו אותן ואל תקצצו אומד לא־מוגבל בלי לאמוד מחדש תחת ההגבלה.
ברגרסיה להמחשה e_A,t = α + β d_t + u_t עם קבוע, השיפוע באוכלוסייה הוא β = Cov(e_A,d)/Var(d), בתנאי ש־Var(d)>0. לכן β=0 פירושו שאין קשר ליניארי בין השגיאה של A להפרש התחזיות לאחר שמתירים הטיה קבועה. אין בכך שלילה של קשר לא־ליניארי או של מידע מסוג אחר.
ברגרסיה ללא קבוע, השיפוע באוכלוסייה הוא E[e_A d]/E[d²], אם E[d²]>0; הגבלת שיפוע לאפס היא אפוא מומנט צולב E[e_A d]=0. המומנט הזה שווה לאפס־קווריאנס רק כאשר E[e_A]=0 או E[d]=0. ברגרסיה עם קבוע, α=0 היא הגבלת הטיה נפרדת; יחד עם β=0 היא מחייבת ממוצע שגיאה אפס של A. לכן בדיקת α=0 מוסיפה הגבלת אי־הטיה ואינה בודקת רק מידע נוסף.
ניסוחי המבחן משתנים ואין סף אחד שמתאים לכולם
מבחן מסוים מתרגם את שאלת המידע הנוסף להגבלות על מקדמים או על הפרשי תחזיות. הוא עשוי לכלול קבוע כדי ללכוד הטיה, לבדוק שיפוע נוסף או להשתמש במידע מותנה שהיה ידוע בנקודת התחזית. החלופה יכולה להיות חד־צדדית אם השאלה שנקבעה מראש היא האם A משתפר, או דו־צדדית אם כל קשר נוסף חשוב. כל בחירה משנה מה הסטטיסטי בודק ואיך יש לאמוד את אי־הוודאות.
לכן השיפוע של רגרסיה להמחשה אינו אוטומטית סטטיסטיקת ההכלה שבה משתמש כל מחקר. לפני בדיקת ערך ה־p התאימו את המבחן ליחס בין המודלים, למועד אמידת הפרמטרים, לתכנון מחוץ למדגם ולהנחות על השגיאות. אם התוצאה רגישה לבחירות האלה, דווחו על כך במקום לבחור בדיעבד את הניסוח שמפיק את התוצאה הרצויה.
<!-- learn:illustration -->

דוגמה היפותטית מחשבת שילוב, לא מובהקות
נניח שהערכים של d, בנקודות בסיס, הם [−4, −2, −1, 1, 2, 4], ששגיאות A הן [−1.6, −1.2, 1.5, 0.5, 1.3, 1.5], וש־n = 6. הממוצע של d הוא אפס והממוצע של e_A הוא שליש נקודת בסיס. סכום הריבועים של d הוא 42; סכום המכפלות של d בשגיאות A לאחר חיסור הממוצע שלהן הוא 16.4.
לכן, ברגרסיית OLS רגילה עם קבוע, השיפוע הוא w = 16.4/42 ≈ 0.3905 והקבוע הוא שליש נקודת בסיס. השילוב המותאם במדגם הוא f_C = f_A + 0.3905(f_B−f_A). החישוב מדגים משקל ליניארי שנאמד במדגם. הוא אינו בודק אם השיפוע שונה מאפס מבחינה סטטיסטית או אם השילוב ישפר תחזיות עתידיות.
אין להסיק משש תצפיות ערך p או מסקנה על הכלה או עליונות. לשם כך נחוצים תכנון מדגם מתאים ואומדן אי־ודאות התואם לתלות בין השגיאות ולאופן שבו נוצרו התחזיות. נוסף על כך, אם אומדים את המשקל ובוחנים אותו באותן שש תצפיות, ההערכה היא מטבעה בתוך המדגם.
ההשערה וההסקה תלויות בניסוח המבחן
במובן הפשוט שבו אנו משתמשים כאן, השערת האפס «A מכיל את B» אומרת ש־B אינו מוסיף אות רלוונטי לאחר שמביאים בחשבון את A, או שמקדם שיפור מוגדר שווה לאפס. אין נוסחת מבחן אוניברסלית אחת. בדקו אם מותרת הטיה, איזה מידע מותנה נכלל, אם החלופה החד־צדדית מכוונת לשיפור A, וכיצד מטפלים בפרמטרים שנאמדו.
Harvey, Leybourne ו־Newbold (1998) בחנו מבחני הכלת תחזיות והצביעו על כך שמבחן הריבועים הפחותים אינו עמיד לשגיאות שאינן נורמליות; הם דנים גם בחלופות: Tests for Forecast Encompassing {source:harveyLeybourneNewbold1998ForecastEncompassing}. לכן אין די בקריאת מקדם OLS וערך p ברירת־המחדל של תוכנה בלי לבדוק את ההשערות ואת התפלגות הייחוס.
ערך p גדול מ־0.05 אינו מוכיח שקילות או ש־B חסר ערך. הוא עשוי לשקף מדגם קצר, שגיאת תקן גדולה או עוצמה סטטיסטית נמוכה. המסקנה המתאימה היא שבתכנון הזה ובהנחותיו, הנתונים לא סיפקו ראיות מספיקות נגד ההשערה שנקבעה ברמת הסף שנבחרה. לא יותר מכך.
הכלה אינה עונה על ארבע שאלות קרובות
מבחן Diebold–Mariano משווה את ההפסד הממוצע של שתי תחזיות באותן נקודות תחזית. מבחן הכלה שואל אם תחזית מתחרה מכילה מידע נוסף ביחס לתחזית ייחוס. לכן לתחזית אחת יכול להיות RMSE נמוך יותר בלי ש־B יוסיף ל־A מידע ליניארי מועיל, וגם ההפך אפשרי. ראו את מבחן Diebold–Mariano לדיוק תחזיות.
Clark–West מתקן את ההשוואה של דיוק תחזיות מחוץ למדגם בין מודלים ליניאריים מקוננים, שבהם רעש האמידה של מקדמים נוספים מסבך את התפלגות המבחן. Clark ו־McCracken (2001) דנים בסוגיות התפלגות של מבחני דיוק שווה והכלה לתחזיות צעד אחד מתוך מודלים ליניאריים מקוננים במאמר Tests of Equal Forecast Accuracy and Encompassing for Nested Models00071-9) {source:clarkMcCrackenNestedForecasts2001}. המסגרת הזו אינה תחליף אוטומטי לכל מבחן הכלה. הסבר על מבחן Clark–West לתיקון דיוק תחזיות במודלים מקוננים מציג את תיקון הדיוק הזה.
שילוב תחזיות אומד או בוחר משקלים עבור מטרה מסוימת, לעיתים קרובות צמצום הפסד במדגם אימון או מחוץ למדגם. זו דרך לבנות תחזית, ולא כשלעצמה מבחן של השערת הכלה. ראו משקלים שווים לעומת משקלים נאמדים בשילוב תחזיות. מבחן Mincer–Zarnowitz בוחן בדרך כלל כיול של רמה ושיפוע ביחס לערכים שהתממשו, ולא את אותה שאלה על מידע נוסף של תחזית מתחרה. ראו מבחן כיול התחזיות של Mincer–Zarnowitz.
אמידת פרמטרים משנה את אי־הוודאות מחוץ למדגם
כאשר התחזיות נוצרות מרגרסיות שנאמדו, אמידת הפרמטרים עשויה להשפיע על התפלגות המבחן. West (2001) עוסק במבחני הכלת תחזיות כשהתחזיות תלויות בפרמטרים נאמדים של רגרסיה, ומסביר מדוע יש להביא את תהליך יצירת התחזית בחשבון בהסקה: Tests for Forecast Encompassing When Forecasts Depend on Estimated Regression Parameters {source:west2001EstimatedForecastsEncompassing}. הכינוי «מחוץ למדגם» אינו מספיק אם המבחן מתעלם מאמידה מחדש של פרמטרים או משינוי חלון האימון.
לפני הניתוח קבעו אם המודלים מקוננים, אם האמידה קבועה או מתגלגלת, אם אופקי המבחן חופפים בזמן ואיך השגיאות תלויות זו בזו. בחרו שיטת הסקה שמתאימה לתכנון ודווחו על רגישות לאפשרויות סבירות. אם ניסיתם מודלים, יעדים או חלונות מדגם רבים ופרסמתם רק את התוצאה המועדפת, ערך p יחיד אינו משקף את החיפוש שקדם לו.
אם מומנטי הרגרסיה מציגים הטרוסקדסטיות או תלות סדרתית, אומד HAC בסגנון Newey–West הוא אפשרות לאמידת מטריצת שונות־קווריאנס העמידה לשתי התופעות. Newey ו־West (1987) מתארים אומד זה {source:neweyWest1987}. יש להתאים את הגרעין ואת רוחב הפס לתכנון התחזית; HAC הוא רכיב אפשרי באמידת אי־הוודאות, לא מבחן הכלה בפני עצמו.
אות נוסף אינו איתות מסחר
גם אם B מוסיף מידע חיזויי אמין, אין בכך הוכחה לתשואה נטו חיובית. יש להגדיר כלל שממיר תחזית לפוזיציה, את עיתוי המסחר, עמלות, מימון, החלקה, נזילות ומגבלות סיכון. אות קטן עשוי להיעלם תחת עלויות ביצוע; הוא עדיין עשוי להועיל לגידור או לניהול סיכונים בלי להגדיל את התשואה הממוצעת.
בדיווח על התוצאה ציינו את היעד, האופק, נקודות התחזית, המדגם המשותף, סימני e ו־d, ניסוח המבחן, השערת האפס והחלופה, הטיפול בקבוע או בהטיה, שיטת האמידה, מגבלות המשקלים ושיטת ההסקה. הציגו את מקדם השילוב עם שגיאת תקן או רווח סמך כשהתכנון מאפשר זאת, והפרידו במפורש בין התאמה בתוך המדגם לבין ביצועים מחוץ למדגם. מבחן הכלה אינו ערובה לתחזית או למסחר רווחי.
מקורות
- Chong ו־Hendry, “Econometric Evaluation of Linear Macro-Economic Models” (1986), DOI
- Harvey, Leybourne ו־Newbold, “Tests for Forecast Encompassing” (1998), DOI
- Clark ו־McCracken, “Tests of Equal Forecast Accuracy and Encompassing for Nested Models” (2001), DOI00071-9)
- West, “Tests for Forecast Encompassing When Forecasts Depend on Estimated Regression Parameters” (2001), DOI
- Newey ו־West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987) DOI
שאלות נפוצות
Q1האם העובדה ש־A מכיל את B אומרת ש־B הוא מודל גרוע?
לא. פירוש הדבר שהמבחן שהוגדר לא מצא ב־B מידע נוסף רלוונטי ביחס ל־A עבור היעד, האופק, המדגם וההשערה שנבחרו. B עדיין עשוי להיות שימושי ליעד אחר או לשימוש מותנה אחר.
Q2האם מבחן הכלה הוא אותו דבר כמו מבחן דיוק תחזיות?
לא. מבחן דיוק משווה הפסדים; הכלה שואלת אם תחזית מתחרה מוסיפה אות ביחס לתחזית ייחוס. התוצאות עשויות להתאים זו לזו או להיות שונות.
Q3האם כדאי להגביל את המשקל לטווח שבין אפס לאחד?
לא בהכרח. אומד לא־מוגבל עשוי להיות מחוץ ל־[0,1], ואילו שיטות שילוב מסוימות מטילות הגבלות. ציינו את השיטה והאילוץ ואמדו מחדש תחת האילוץ, במקום לקצץ את התוצאה בדיעבד.
מקורות וקריאה נוספת
דיווח על בעיה
נכין אימייל עם קישור למאמר הזה. Mark יקבל את הדיווח רק לאחר שתשלחו אותו
בדיקה מהירה
סיימת לקרוא? בדוק את עצמך ב־3 שאלות
שאלה 01
מה w מתאר ישירות בביטוי f_C = f_A + w(f_B−f_A)?
בחר תשובה כדי לראות את ההסבר