מבחן ג'יאקומיני–וייט: דיוק תחזית מותנה
למדו כיצד מבחן ג'יאקומיני–וייט בודק אם דיוק התחזית משתנה לפי תנאים ידועים, כיצד לבחור מכשירים ומה אפשר להסיק מהתוצאה
במדריך הזהדיוק ממוצע ודיוק מותנה עונים על שאלות שונות
תקציר קצר
מסגרת ג'יאקומיני–וייט (GW) בוחנת אם ההפסד היחסי של שתי תחזיות קשור למידע שהיה זמין בעת הפקתן. היא יכולה לחשוף הבדלים שציון ממוצע מסתיר, אך התוצאה תלויה בתחזיות, בחלון ההערכה, בפונקציית ההפסד ובמשתני ההתניה שנבחרו מראש.
דיוק ממוצע ודיוק מותנה עונים על שאלות שונות
נניח שבמדגם בדיקה לתחזית A יש הפסד ממוצע נמוך יותר מאשר לתחזית B. הממוצע עשוי להסתיר דפוס שימושי: A יכולה להיות טובה יותר בשווקים שקטים ואילו B עדיפה כשהתנודתיות גבוהה. אם רוצים לדעת איזו תחזית הייתה טובה יותר בממוצע, מתאימה השוואה בלתי מותנית. אם השאלה היא האם מידע שהיה ידוע במועד התחזית עוזר לנבא איזו מהן תצליח יותר, בודקים יכולת חיזוי מותנית.
ג'יאקומיני וּוייט מנסחים זאת כהשוואה בין שיטות חיזוי תחת פונקציית הפסד וקבוצת מידע מוגדרות. המסגרת מתאימה לתחזיות נקודתיות, תחזיות רווח, הסתברויות או צפיפויות, כל עוד פונקציית ההפסד תואמת למשימה. גם שיטת האמידה שמפיקה כל תחזית היא חלק מהשיטה הנבדקת. לכן חלון מתגלגל, מדגם אימון קבוע או כלל משקולות הם חלק מהשיטה המוערכת, ולא פרטים שאפשר לשנות ללא חשש לאחר צפייה בתוצאות (Giacomini and White, 2006).
השאלה קשורה למבחני שבר מבני, אך אינה זהה להם. מבחן מותנה שואל אם ההפסד היחסי של התחזיות קשור באופן שיטתי למידע שנבחר. מבחן שבר שואל אם פרמטרים או קשר השתנו במועד לא ידוע או מוגדר. המדריך למבחן Diebold–Mariano עוסק בהשוואה בלתי מותנית של הפסדים ממוצעים; שאלה מותנית מחייבת לציין במפורש את המידע שלפיו מתנים.
תחילה יישרו בין התחזיות, התוצאות והמידע
נסמן ב־(Y_{t+1}) את היעד שנצפה אחרי נקודת המוצא לתחזית (t). התחזיות ŷA,t+1 ו־ŷB,t צריכות להתייחס לאותו יעד, אופק, יחידות ונקודת חיתוך של המידע. עבור פונקציית הפסד (L) שבה ערך נמוך יותר עדיף, הפרש ההפסד מוגדר כך:
dₜ₊₁ = L(Yₜ₊₁, ŷA,ₜ₊₁) − L(Yₜ₊₁, ŷB,ₜ₊₁)
לפי סימון זה, ערך חיובי פירושו שההפסד של A היה גדול יותר ולכן B עדיפה באותה נקודת מוצא; ערך שלילי מעדיף את A. השתמשו בשורה אחת לכל נקודת מוצא והעריכו את שתי התחזיות מול אותה תוצאה בפועל. שמרו את התחזיות כפי שהיו זמינות בזמן אמת, יחד עם גרסת הנתונים וגרסת המודל. אל תבנו מחדש תחזיות היסטוריות באמצעות קלט מתוקן או מידע שהגיע מאוחר יותר.
גם משתני ההתניה חייבים להיות ידועים בנקודת המוצא לתחזית. דוגמאות כוללות אומדן תנודתיות בפיגור, סימון לאירוע שהוכרז מראש, הפרש הפסדים בפיגור או משתנה מצב שוק שחושב רק מתצפיות קודמות. משתנה שנמדד אחרי (t) אינו יכול להסביר איזו תחזית הייתה טובה יותר ב־(t+1) בלי הטיית מידע עתידי.
המדד צריך להתאים ליעד. שגיאה ריבועית היא אפשרות לתחזית של ממוצע מותנה, אך אינה מתאימה אוטומטית לתחזית תנודתיות, קוונטיל או צפיפות. אם מודל אחד חוזה שונות ומודל אחר סטיית תקן, תחילה הביאו את שניהם לתחזית של אותה כמות. מבחן אינו יכול לתקן ניסוח שגוי של השאלה שנבדקת.
בתחזיות תנודתיות, העריכו את שתיהן לפי אותה הגדרה של שונות ממומשת ולאורך אותו מרווח דגימה. אם תחזית אחת מכסה מחירים תוך־יומיים והשנייה כוללת גם תשואות ליליות, הפרש הפסדים עשוי לנבוע מיעדים שונים ולא מכישורי חיזוי. החליטו כיצד לטפל בתנועות בזמן סגירת השוק, בתדירות הדגימה, בתצפיות חסרות ובמדד הממומש, והחילו את אותן החלטות על שתיהן. אם המשתנה הממומש רועש, שגיאת המדידה משפיעה על שני ציוני ההפסד ויש להביא אותה בחשבון בפרשנות.
נסחו את השערת האפס המותנית ובחרו פונקציות מבחן
נסמן ב־(mathcal{G}_t) את קבוצת המידע שלפיה מתנים את ההשוואה. השערת האפס האידיאלית היא:
H₀: E[dₜ₊₁ | 𝒢ₜ] = 0
היא אומרת שהפרש ההפסד הצפוי הוא אפס בהינתן המידע שצוין. מבחן GW לצעד אחד ממיר את הטענה המותנית לאוסף מומנטים באמצעות וקטור פונקציות מבחן (h_t) שנבחר מראש. כל פונקציה צריכה להיות ניתנת לחישוב מהמידע שזמין בזמן (t):
H₀,ₕ: E[hₜ dₜ₊₁] = 0
קבוע בתוך (h_t) כולל את הפרש ההפסד הממוצע. רכיבים אחרים יכולים לייצג מצב שוק, הפסד יחסי בפיגור או טרנספורמציה לא־ליניארית שנבחרה לפני בחינת התוצאות. למשל, (h_t=(1,S_t)'), כאשר (S_t) הוא משתנה בינארי לתנודתיות גבוהה שידוע בזמן (t), בודק גם מומנט קבוע וגם אם הפרש ההפסד קשור למצב הזה.
קבוצה סופית של פונקציות מבחן בודקת רק את המומנטים שהיא מגדירה. דחיית השערת האפס מראה שלפחות אחד מהמומנטים שנבחרו אינו תואם לאפס תחת הנחות המבחן; היא אינה מזהה מודל שתמיד טוב יותר ואינה מוכיחה שכל משתנה מצב אפשרי רלוונטי. אי־דחייה אינה מוכיחה שהביצועים המותנים שווים. אם משתמשים רק בקבוע, בודקים מומנט בלתי מותנה ולא סורקים את כל התנאים האפשריים.
בחרו את ההפסד, המכשירים, הטרנספורמציות, המדגם ואופק התחזית לפני שתבדקו איזה מודל מנצח. הוספת סמני מצב, ספים ופיגורים רבים לאחר הצפייה בתוצאות יוצרת בעיית חיפוש נוספת. המבחן המותנה אינו מתקן את הבחירה הזאת מעצמו.
קבעו גם מתי מחשבים כל משתנה מצב. אם ״תנודתיות גבוהה״ מוגדרת כחמישית העליונה של התנודתיות במדגם המלא, תצפיות עתידיות מסייעות לקבוע את הסף לנקודות מוצא בעבר. אמדו כל סף רק על סמך מידע שהיה זמין באותה נקודת מוצא או השתמשו בכלל שפורסם לפניה. למשתנה מצב רציף, הגדירו מראש את היחידות וכל מרכוז או תקנון. סמנים דומים מאוד עלולים ליצור מומנטים עודפים ולהקשות על הפיכת מטריצת השונות; השתמשו בקבוצה הקטנה ביותר שאפשר לפרש בבירור.
חשבו את סטטיסטי וולד ופרשו את התפלגות הייחוס
עבור (q) פונקציות מבחן, בנו את וקטור המומנטים (g_{t+1}=h_t d_{t+1}). ממוצע המדגם הוא:
ḡ = (1/n) Σₜ gₜ₊₁
סטטיסטי GW לצעד אחד הוא בצורת וולד:
GW = n ḡ′ Ω̂⁻¹ ḡ
כאן (hatOmega) אומדת את מטריצת השונות של וקטור המומנטים. תחת השערת האפס ותנאי הרגולריות במאמר, לסטטיסטי יש אסימפטוטית התפלגות ייחוס כי־בריבוע עם (q) דרגות חופש. לכן מספר פונקציות המבחן משפיע על התפלגות הייחוס ועלול להשפיע גם על עוצמת המבחן. מכשירים חלשים או כפולים רבים עלולים לערער את אומדן השונות בלי להוסיף מידע מועיל.
בהגדרת הצעד היחיד, השערת האפס יוצרת למומנטים מבנה של הפרש מרטינגל, ולכן המבחן המקורי יכול להשתמש באומדן המבוסס על מומנט שני מדגמי. באופקים אחרים, בתוצאות חופפות או בסטייה מההגדרה הזאת, אומדן השונות צריך להתאים להנחות המבחן ולמבנה התלות. פעלו לפי הניסוח של המימוש שבו משתמשים, במקום להעתיק אוטומטית רוחב פס HAC ממבחן אחר. שיטות HAC כלליות, ובהן האומד של Newey and West (1987), הן כלים למצבים שדורשים אותן ולא מרשם אוניברסלי לרוחב פס במבחן GW. אמינות התוצאה תלויה גם באומדן השונות ובתכנון התחזיות.
בדקו גם אם אפשר לאמוד את (Ω̂) עבור המומנטים שנבחרו. פונקציות מבחן כמעט זהות, סימון עם מעט מאוד תצפיות באחד המצבים או יותר מדי אינטראקציות עלולים להפוך את המטריצה לסינגולרית או לא יציבה. ההופכית שלה עלולה להשתנות בחדות בעקבות תיקון נתונים קטן ולעוות את הסטטיסטי. לכל פונקציה צריכה להיות הצדקה הקשורה לתנאי או להבדל בביצועים; דווחו את מספר הפונקציות ואת שונות המומנטים. הסרת פונקציה שנראתה לא מועילה אחרי שראיתם את התוצאה היא שלב בחירה נוסף ויש לציין זאת.
ערך ה־p הוא ראיה נגד מגבלות המומנטים שנקבעו, תחת התפלגות הייחוס. הוא אינו ההסתברות שמודל A או B הוא המודל האמיתי, וגם אינו הסיכוי שאסטרטגיית מסחר תהיה רווחית. דווחו את הסטטיסטי, דרגות החופש, ערך ה־p והמומנטים המדויקים שנבדקו כדי להבהיר מה משמעות הדחייה.
<!-- learn:illustration -->

דוגמה של שני מצבים מראה מה הממוצע יכול להסתיר
נבחן שמונה נקודות מוצא היפותטיות לצעד אחד. נסמן ב־(S_t=0) מצב שקט וב־(S_t=1) מצב של תנודתיות גבוהה. נניח שהפרשי ההפסד (d_{t+1}=L_A-L_B) הם −2, −2, −2 ו־−2 בארבע נקודות המוצא השקטות, ו־+2, +2, +2 ו־+2 בארבע נקודות המוצא התנודתיות. הפרשים שליליים מעדיפים את A וחיוביים את B.
הממוצע על פני כל שמונה נקודות המוצא הוא אפס, ולכן בדוגמה הקטנה הזאת אין הפרש הפסד בלתי מותנה. הממוצע במצב השקט הוא −2 ובמצב התנודתיות הגבוהה הוא +2. הדירוג היחסי מתהפך לפי המצב. מבחן עם (h_t=(1,S_t)') כולל מומנט קבוע ומומנט לתנודתיות גבוהה שיכולים ללכוד את הדפוס.
שמונת הערכים האלה ממחישים את החישוב, אך אינם מספיקים להסקה אמינה. בנתונים אמיתיים יש להביא בחשבון כיצד נאמדו התחזיות, האם משתנה המצב נקבע מראש, כמה נקודות מוצא זמינות וכיצד מומנטי הפרש ההפסד משתנים לאורך זמן. חלוקה חזותית לפי מצב אינה מוכיחה שהדפוס יימשך.
התייחסו לחלון האמידה כחלק מהשיטה
האסימפטוטיקה המקורית של GW משמרת את אי־הוודאות באמידת התחזיות: גודל החלון המרבי נשאר סופי בזמן שמספר התחזיות מחוץ למדגם גדל. חלונות מתגלגלים ומדגם אמידה קבוע מתאימים למסגרת הבסיסית. גודל החלון וכל כלל לבחירת חלון לפי הנתונים הם חלק מכל שיטת תחזית ויש לקבוע ולדווח אותם בהתאם.
הדבר חשוב כאשר אומדים מחדש את מודלי התחזית. השוואה שמתעלמת מאמידת פרמטרים עלולה להחמיץ אי־ודאות שנוצרה מהדרך שבה כל שיטה לומדת מנתוני עבר. GW יכולה להשוות תחזיות ממודלים מקוננים או לא מקוננים בתנאים שהוגדרו, אך הדבר אינו מבטיח תוצאה זהה בכל מימוש של חלון מתרחב או בכל אומד. במסגרת המקורית לצעד אחד, חלון מתרחב רגיל אינו מקיים את הנחת החלון הסופי. אם התכנון שונה, השתמשו בתוצאה שנגזרה עבור אופן הפקת התחזיות בפועל.
המבחן גם אינו בוחר עבורכם חלון מתאים. חלון קצר עשוי להסתגל לתנאים האחרונים אך משתמש בפחות תצפיות; חלון ארוך או מתרחב עשוי לייצב אומדנים אך גם לשמר קשרים מיושנים. השוו בין האפשרויות באמצעות הערכה שתוכננה מראש ותעדו גם את בחירת החלון. Giacomini and Rossi (2010) פיתחו מבחנים נפרדים לבחינת התפתחות הביצועים היחסיים בסביבות לא יציבות. שאלת מסלול הזמן קשורה, אך הסטטיסטי שלה אינו זהה למבחן GW המותנה הבסיסי.
דחייה מותנית כשלעצמה גם אינה יוצרת כלל מסחר שבוחר בזמן אמת את התחזית המתאימה. מכשיר עשוי להיות קשור להפרש ההפסד בנתוני ההערכה בלי ליצור כלל מעבר יציב או ישים. כדי לבחור תחזית בעזרת מידע עדכני, הגדירו כלל על סמך תצפיות עבר ובחנו אותו ברצף מאוחר יותר של נקודות מוצא שלא שימשו קודם; כללו גם את אי־הוודאות באמידה ובהחלטה.
הבחינו בין GW, DM, מבחני מודלים מקוננים ומבחני אי־יציבות
מבחן Diebold–Mariano שואל אם לשתי תחזיות יש אותו הפסד ממוצע במדגם ההערכה. GW שואל אם מידע שנבחר קשור להפסד היחסי שלהן, ומאפשר השוואה בלתי מותנית כמגבלת מומנטים מיוחדת. כפי שמראה הדוגמה של שני המצבים, לשני מודלים יכול להיות אותו ציון ממוצע אך ביצועים יחסיים שתלויים בתנאים.
אם התחזיות נוצרו ממודלים מקוננים והשאלה היא ספציפית אם שגיאת הריבוע הממוצעת של התחזית שווה, שיטה למודלים מקוננים כמו התיקון של Clark–West מטפלת בהשערת אפס אחרת ובבעיית רעש האמידה. אם נבחנו כללי מסחר או תחזיות רבים והשאלה היא אם למועמד כלשהו יש יכולת חיזוי עדיפה, נדרשת שיטה ברמת משפחת המועמדים, כמו בדיקת המציאות של White או מבחן SPA של Hansen. מבחן מותנה לזוג אחד שנבחר אינו מבטל חיפוש רחב יותר.
לבסוף, ראיה לכך שהדיוק היחסי משתנה לאורך זמן אינה קובעת תאריך שבר מסוים. מבחן אי־יציבות מקומית או היפוך עשוי להתאים יותר כשהשאלה עוסקת במסלול הביצועים היחסיים ולא בקשר שלהם למכשירים שנבחרו. Giacomini and Rossi (2010) חוקרים השוואות כאלה. בחרו בשיטה לפי השאלה ואל תפרשו כל דחייה כראיה לאסטרטגיית מסחר המחליפה משטר.
הביאו בחשבון עוצמה נמוכה ובדיקות חוזרות
מבחנים מותנים עשויים לדרוש נתונים רבים. חלוקת המדגם למצבים שקטים ותנודתיים מקטינה את מספר התצפיות התומכות בכל השוואה. הוספת פונקציות מגדילה את מספר המומנטים ואת דרגות החופש. אם כמה תנאים קשורים רק באופן חלש להפסד היחסי, עוצמת המבחן עלולה להיות נמוכה גם כשקיימים הבדלים מותנים.
מסמך העבודה של McCracken בבנק הפדרלי של סנט לואיס בוחן את קיומו, גודלו ועוצמתו של מבחן GW בדוגמה פשוטה של הפסד ריבועי. הסימולציות מצאו שהמבחן יכול לשמור על גודל תקין, בעוד העוצמה הייתה בדרך כלל נמוכה בתנאים שנבדקו (McCracken, 2020). זו אזהרה לפרשנות, לא תחזית מספרית אוניברסלית לכל יישום. אי־דחייה יכולה לשקף מידע מוגבל או עוצמה נמוכה; אין לתאר אותה כהוכחה שאפשר להחליף בין התחזיות.
ניסיון חוזר של הגדרות מצב, ספים, אופקים, פונקציות הפסד ותאריכי הערכה חלופיים מגדיל את הסיכוי לממצא מקרי. תעדו את כל המבחנים האפשריים והפרידו בין ניתוח חקרני לבין מדגם אישור שנקבע מראש. כדי לטעון שאסטרטגיה אחת ממשפחה היא בעלת יכולת חיזוי, החילו על המשפחה כולה שיטה מתאימה לריבוי בדיקות או לכריית נתונים. הוספת מכשירי התניה אינה מחזקת אוטומטית את הראיות.
כשמשווים כמה מודלי תחזית, הליך למשפחה שלמה עונה על שאלה אחרת מהמבחן המותנה הזוגי. המדריך ל־Model Confidence Set מסביר כיצד השוואה איטרטיבית יכולה להשאיר קבוצה של מודלים שלא ניתן להבחין ביניהם ברמת המובהקות שנבחרה; היא אינה מחליפה קביעה מראש של התנאים בניתוח GW.
דווחו על התכנון כך שאחרים יוכלו לשחזר אותו
ציינו את שתי שיטות התחזית, כיצד כל אחת נאמדת, האם המודלים מקוננים, מה היעד והאופק ומהם תאריכי ההערכה. פרטו את פונקציית ההפסד ואת מוסכמת הסימן של (d_{t+1}). תארו כל רכיב של (h_t), כיצד הוא נבנה, מתי הוא נעשה זמין והאם נבחר לפני צפייה בתוצאות.
דווחו על לוח הזמנים של נקודות המוצא, כלל חלון האמידה, גרסת הנתונים, כלל המדגם המשותף, מספר נקודות המוצא מחוץ למדגם, מספר פונקציות המבחן, אומד השונות, התפלגות הייחוס, סטטיסטי המבחן, דרגות החופש וערך ה־p. ציינו אם האופקים חופפים וכיצד טיפלתם בתלות. כללו הפסדים ממוצעים וסיכומים של הפרשי ההפסד, לא רק את תוצאת המבחן.
רשמו את המכשירים, הספים, החלונות, ההפסדים וזוגות התחזיות הנוספים שניסיתם. אם השתמשתם באותן תצפיות כדי לבחור מודל או משתני התניה וגם כדי לבדוק אותם, ציינו זאת. תוצאה יכולה להיות אינפורמטיבית בלי להיות מאששת; דיווח שקוף מאפשר לקוראים להבין את תחולתה ולתכנן אימות נפרד.
שאלות נפוצות
Q1האם מבחן ג'יאקומיני–וייט זהה למבחן Diebold–Mariano?
לא. Diebold–Mariano מתמקד בשוויון ההפסד הממוצע. מסגרת GW לצעד אחד בודקת מומנטים מותנים שנבחרו וכוללת מומנט בלתי מותנה כאפשרות אחת.
Q2האם דחייה מראה באיזו תחזית להשתמש בכל משטר שוק?
לא. היא מראה שלפחות מומנט נבחר אחד אינו תואם לאפס תחת הנחות המבחן. התוצאה תלויה במכשירים, במדגם ובהפסד ואינה מבטיחה ביצועים בכל מצב.
Q3האם אפשר להוסיף ספי תנודתיות עד שהמבחן ידחה?
כך נוצרת חיפוש בין משתני התניה. קבעו את המשתנים מראש ככל האפשר, דווחו על כל המפרטים שנוסו והשתמשו במדגם אישור נפרד או בתיקון מתאים לכל משפחת המועמדים כשטוענים טענה רחבה על יכולת חיזוי.
Q4האם יכולת חיזוי מותנית פירושה שאסטרטגיית מסחר רווחית?
לא. המבחן משווה הפסדי תחזית. טענה על מסחר דורשת כלל החלטה מוגדר והערכה נפרדת של ביצוע, עמלות, מימון, השפעת שוק וסיכון. מחקר מקורי - Giacomini and White, “Tests of Conditional Predictive Ability” (2006) - Giacomini and Rossi, “Forecast Comparisons in Unstable Environments” (2010) - McCracken, “Tests of Conditional Predictive Ability: Existence, Size, and Power” (מסמך עבודה של הבנק הפדרלי של סנט לואיס, 2020) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995) - Newey and West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)
מקורות וקריאה נוספת
דיווח על בעיה
נכין אימייל עם קישור למאמר הזה. Mark יקבל את הדיווח רק לאחר שתשלחו אותו
בדיקה מהירה
סיימת לקרוא? בדוק את עצמך ב־3 שאלות
שאלה 01
כאשר dₜ₊₁ = L(A) − L(B), מה פירושו של הפרש הפסד חיובי?
בחר תשובה כדי לראות את ההסבר