Model Confidence Set (MCS): השוואת תחזיות בלי לכפות מודל מנצח
למדו כיצד Model Confidence Set משתמש במבחנים סדרתיים וב-bootstrap ששומר על תלות בזמן כדי להשאיר מודלי תחזית שהנתונים אינם מאפשרים להבחין ביניהם.
במדריך הזהעל איזו שאלה עונה Model Confidence Set?
תקציר קצר
Model Confidence Set (MCS) משווה משפחה מוגדרת של הליכי חיזוי ומשאיר את המועמדים שאי אפשר להוכיח שהם נחותים לפי פונקציית הפסד שנבחרה. כאשר המדגם אינו מאפשר להבחין ביניהם, עשויים להישאר כמה מודלים. התוצאה תלויה במשפחת המועמדים, בתכנון החיזוי, בהפסד ובשיטת ההסקה.
על איזו שאלה עונה Model Confidence Set?
נניח שיש כמה הליכים לחיזוי התנודתיות של יום המסחר הבא. השגיאות שלהם שונות, אך המדגם עשוי להיות קצר או רועש מכדי לדעת לאיזה הליך יש את ההפסד הצפוי הנמוך ביותר. בחירה אוטומטית בהליך עם ההפסד הממוצע הנמוך ביותר כופה מנצח גם כשהפער עשוי לנבוע מתנודתיות מדגמית. MCS נותן תשובה קבוצתית: אילו מועמדים אי אפשר לסווג כנחותים על סמך הנתונים והקריטריון שנקבע?
MCS מתחיל בקבוצת מועמדים \(\mathcal M_0\), בפונקציית הפסד או בקריטריון אחר, וברמת ביטחון. הוא בוחן ברצף אם למועמדים שעדיין נבדקים יש יכולת חיזוי שווה. אם ההשערה נדחית, כלל הוצאה מסיר מועמד שנחשב חלש יחסית; אחר כך הבדיקה חוזרת על הקבוצה המצומצמת. המועמדים שנותרו יוצרים את MCS. Hansen, Lunde ו-Nason הציגו את ההליך כקבוצת ביטחון למודל או למודלים הטובים ביותר מתוך האוסף שהוגדר, בדומה לרווח סמך שעשוי לכלול כמה ערכים כשהנתונים אינם מדויקים (המאמר משנת 2011).
המונח “הטוב ביותר” תקף רק בתוך ההשוואה הזו. הוא תלוי במועמדים שנכללו, ביעד, באופק התחזית, במידע שהיה זמין בכל מועד חיזוי ובקריטריון שנבחר. MCS אינו מניח שאחד המועמדים הוא תהליך יצירת הנתונים האמיתי, והוא יכול להשאיר כמה מועמדים בעלי אותו הפסד צפוי מינימלי. הוא אינו נותן הסתברות בייסיאנית לכך שמודל שנשאר נכון.
קבעו מראש את משפחת המועמדים ואת שאלת החיזוי
הגדירו את \(\mathcal M_0\) לפני חישוב ההפסדים. מועמד יכול להיות מודל שנאמד יחד עם כללי האמידה ועדכון התחזית שלו, או הליך חיזוי שאינו מוגדר כמודל סטטיסטי. למשל, הכיתוב “GARCH” לבדו אינו מגדיר מועמד מלא אם התפלגות השגיאות, אורך החלון המתגלגל, עדכון הפרמטרים או אופק התחזית משתנים. כל שילוב כזה הוא הליך אחר.
כל מועמד צריך לחזות את אותו יעד באותם מועדי חיזוי, באמצעות מידע שהיה זמין אז. אין להשוות ישירות הפסד של תחזית שונות מותנית ליום אחד להפסד של תחזית תנודתיות לחמישה ימים אם היעד או היחידות שונים. השתמשו במדגם הערכה משותף, פרטו כיצד יישרתם תצפיות חסרות, ותעדו את גרסת הנתונים, חלון האמידה הראשוני, לוח העדכון הרקורסיבי או המתגלגל וטיפול בנתונים מתוקנים. בתחזיות רב-שלביות עם חלונות חופפים, הפסדים ממועדי חיזוי שונים עשויים לחלוק תקופות יעד שמומשו.
בחרו את הקריטריון לפני בדיקת התוצאות. עבור תחזית נקודתית, שגיאה ריבועית, שגיאה מוחלטת או פונקציית הפסד המותאמת להחלטה יכולות לייצר דירוגים שונים. תחזית שונות עשויה לדרוש הפסד שמותאם למדד תנודתיות רועש, ותחזית קוונטיל דורשת ציון קוונטילי מתאים. MCS טוב לפי פונקציית הפסד אחת אינו בהכרח טוב לפי אחרת. אם צמצמתם את רשימת המועמדים לאחר שבחנתם את אותן תוצאות הערכה, הקבוצה הפורמלית מותנית בסינון הלא מדווח ואינה משקפת עוד את החיפוש המלא.
הפכו תחזיות משותפות להפרשי הפסד מזווגים
נסמן את התוצאה שהתממשה עבור תחזית שיצאה במועד \(t\) ב-\(y_{t+h}\), ואת תחזית מועמד \(i\) ב-\(\hat y_{i,t+h|t}\). בעזרת פונקציית הפסד \(L\) שנבחרה מראש, חשבו את ההפסד של כל מועמד בכל מועד חיזוי משותף:
\[ L_{i,t}=L(y_{t+h},\hat y_{i,t+h|t}) \]
נניח שהפסד נמוך יותר נחשב טוב יותר. ההפרש המזווג בין המועמדים \(i\) ו-\(j\) הוא:
\[ d_{ij,t}=L_{i,t}-L_{j,t}, \qquad \bar d_{ij}=\frac{1}{P}\sum_{t=1}^{P}d_{ij,t} \]
כאן \(P\) הוא מספר מועדי החיזוי המשותפים. לפי מוסכמת הסימן הזו, \(\bar d_{ij}>0\) פירושו שלהפסד הממוצע של מועמד \(i\) היה ערך גבוה יותר מזה של \(j\) במדגם; ערך \(\bar d_{ij}<0\) מעדיף את \(i\). הזיווג חשוב כי שני המועמדים נבדקו מול אותן תוצאות שהתממשו. זעזוע שוק משותף יכול להעלות את ההפסדים של שניהם, ואילו ההפרש מבודד את הביצועים היחסיים באותם תאריכים.
אפשר לכתוב את השערת האפס של יכולת חיזוי שווה עבור הקבוצה הנוכחית \(\mathcal M\) כך:
\[ H_{0,\mathcal M}:\quad \mu_{ij}=E[d_{ij,t}]=0 \quad \text{for every } i,j\in\mathcal M \]
זו השערה משותפת לגבי הקבוצה הנוכחית, לא אוסף של בדיקות זוגיות עצמאיות שמתוכן בוחרים בדיעבד תוצאות מתאימות. מסגרת MCS משלבת מבחן שקילות לקבוצה עם כלל הוצאה להתמודדות עם השוואות בין מועמדים רבים. השערת האפס אינה אומרת שהתחזיות זהות בכל תאריך.
בדקו את הקבוצה הנוכחית והגדירו כלל הוצאה
MCS מתחלף בין מבחן לקבוצה לבין שלב הוצאה. התחילו עם \(\mathcal M=\mathcal M_0\) ובדקו יכולת חיזוי שווה ברמת \(\alpha\) שנבחרה. אם המבחן אינו דוחה, עוצרים ומדווחים על הקבוצה הנוכחית. אם הוא דוחה, כלל הוצאה שנקבע מראש מסיר מועמד אחד, ואז המבחן חוזר על הקבוצה המצומצמת. תחת הנחות ההליך, המועמדים שנותרו הם MCS ברמה \((1-\alpha)\).
המאמר מציג שני סטטיסטים מוכרים. סטטיסטי הטווח מחפש את הפרש ההפסד הזוגי המתוקנן הגדול ביותר:
\[ T_{R,\mathcal M}=\max_{i,j\in\mathcal M}|t_{ij}|, \qquad t_{ij}=\frac{\bar d_{ij}}{\widehat{\mathrm{se}}(\bar d_{ij})} \]
כלל ההוצאה המתאים מסיר את המועמד בעל החיסרון המתוקנן הגדול ביותר ביחס למועמד אחר. סטטיסטי שני משווה כל מועמד לביצועים הממוצעים של הקבוצה הנוכחית:
\[ T_{\max,\mathcal M}=\max_{i\in\mathcal M}t_{i\cdot}, \qquad d_{i\cdot,t}=\frac{1}{|\mathcal M|}\sum_{j\in\mathcal M}d_{ij,t} \]
כאן \(t_{i\cdot}\) מתקן את הממוצע של \(d_{i\cdot,t}\) לפי שגיאת התקן שלו. הכלל התואם מסיר את המועמד בעל ההפסד העודף המתוקנן הגדול ביותר ביחס לממוצע הקבוצה. הסטטיסטי וכלל ההוצאה הם זוג אחד. בחרו ודווחו עליהם יחד; אל תערבבו אותם לאחר שראיתם איזה זוג יוצר קבוצה קטנה יותר. מאמר MCS מסביר מדוע נדרש קשר עקבי בין מבחן הדחייה לבין הכלל שקובע איזה מועמד מוסר (Hansen, Lunde ו-Nason).
שמרו על תלות בזמן ב-bootstrap
התפלגות סטטיסטי המקסימום תלויה בשונות המשותפת של הפרשי ההפסד בין המועמדים. התייחסות לכל מודל או תאריך כאל תצפית בלתי תלויה עלולה לשבור שני סוגי תלות: הפסדים בתאריכים סמוכים עשויים להיות קשורים, והפסדי מועמדים שונים באותו תאריך מזווגים. לכן bootstrap של MCS צריך לשמר את מבנה סדרת הזמן המשותפת כשהוא מקרב את התפלגות האפס של הסטטיסטי הקבוצתי.
אפשרות אחת היא לדגום מחדש יחד בלוקים זמניים מיושרים של וקטור ההפסדים או ההפרשים של כל המועמדים. ב-stationary bootstrap אורך הבלוק אקראי, והבלוק הבא יכול להתחיל בתאריך שנבחר באקראי. Politis ו-Romano הציגו שיטה זו לתצפיות סטציונריות עם תלות חלשה (המאמר מ-1994). נספח היישום של MCS מתאר bootstrap של בלוקים ומזכיר את ה-stationary bootstrap כחלופה. דגימה מחדש של סדרת ההפסדים של כל מודל בנפרד הורסת את הזיווג באותו תאריך ועלולה לשנות את ההשוואה.
אורך הבלוק הממוצע, גרסת ה-bootstrap, המרכז תחת השערת האפס, מספר החזרות ואופק התחזית משפיעים על הערכת אי-הוודאות. תחזיות רב-שלביות עם חלונות חופפים עשויות להאריך את התלות בהפרשי ההפסד, אך אין אורך בלוק אחיד לכל יעד ומדגם. הסבירו את העיצוב ובדקו אם המסקנה משתנה תחת הגדרות תלות סבירות. תוצאת bootstrap היא קירוב תחת הנחות; היא אינה מתקנת שימוש במידע עתידי, בדיקה חוזרת של מדגם המבחן, שינוי לא-סטציונרי בציונים או משפחת מועמדים חסרה.
עקבו אחר השוואה היפותטית בין ארבעה מודלים
נניח שהליכים A, B, C ו-D חוזים את אותו יעד תנודתיות ב-120 מועדי חיזוי יומיים משותפים. הפסדי השגיאה הריבועית הממוצעים הם 1.20, 1.23, 1.45 ו-1.90 ביחידות להמחשה של נקודות אחוז בריבוע. הממוצעים מדרגים את A ראשון ואת D אחרון, אך דירוג לבדו אינו אומר אם ההבדלים גדולים מאי-הוודאות במדגם.
הפרש ההפסד המזווג הממוצע בין A ל-B הוא \(1.20-1.23=-0.03\). אם שגיאת התקן שמביאה בחשבון תלות בזמן היא \(0.04\), הסטטיסטי הזוגי הוא \(-0.03/0.04=-0.75\). הפרש יחיד זה אינו מוכיח הבדל סטטיסטי ברור בין A ל-B. MCS אינה עוצרת כאן: הסטטיסטי הקבוצתי מחשיב את ההפרשים המשותפים בין ארבעת המועמדים.
לשם המחשה, נניח שהרצת MCS היפותטית על סדרת ההפסדים המלאה של 120 מועדים משתמשת ב-\(T_R\), ב-\(\alpha=0.05\) ובכלל עקבי להסרת המועמד הגרוע ביותר. נניח שערך ה-p למשפחה המלאה הוא 0.018 ולכן D מוסר, ואחר כך ערך ה-p עבור \(\{A,B,C\}\) הוא 0.11. מכיוון ש-0.11 גדול מ-0.05, ההליך עוצר וה-MCS ההיפותטית ברמת 95% היא \(\{A,B,C\}\). C נשארת אף שההפסד הממוצע שלה גבוה מזה של A, משום שהמבחן המשותף בדוגמה ההיפותטית לא הוכיח שהיא נחותה.
ערכי ה-p כאן מומצאים כדי להדגים את השלבים; אי אפשר לשחזר אותם מארבעת ממוצעי ההפסד או מההשוואה בין A ל-B בלבד. תוצאה אמיתית מחייבת את סדרת ההפסדים המלאה לפי מועד, תחזיות המועמדים, עיצוב ה-bootstrap וסדר ההוצאה. שמרו את הקלטים ודווחו איזה מועמד הוסר בכל שלב. <!-- learn:illustration -->

פרשו את הקבוצה שנותרה בלי לטעון יותר מדי
תחת תנאי הסדירות והנחות הבדיקה, MCS ברמת 95% נבנית כדי לכלול את המועמד הטוב ביותר בקבוצה שצוינה בכיסוי אסימפטוטי של לפחות הרמה הנקובה. אין פירוש הדבר שלכל מודל שנשאר יש הסתברות של 95% להיות הטוב ביותר. טענת הביטחון עוסקת בכיסוי במדגמים חוזרים; היא אינה התפלגות בייסיאנית על שמות המודלים.
אי-דחיית השערת יכולת חיזוי שווה אינה מוכיחה שההפסדים הצפויים זהים בדיוק. עוצמת המבחן עשויה להיות נמוכה אם תקופת ההערכה קצרה, הפרשי ההפסד תנודתיים מאוד או כמה מועמדים קרובים. קבוצה גדולה שנותרה עשויה להעיד שהנתונים אינם מפרידים בין החלופות. היא גם עשויה לכלול מודלים שכולם גרועים במונחים מוחלטים, כי MCS משווה את המועמדים בינם לבין עצמם ואינה דורשת רף חיצוני.
הקבוצה מוגבלת גם למועמדים שנכללו בתחילה ב-\(\mathcal M_0\). אם הושמט הליך חיזוי טוב יותר באמת, MCS אינו יכול לגלות אותו. אם מודל הוסר לאחר שבחנו את אותה תקופת הערכה, הכיסוי הנומינלי אינו מביא בחשבון את הסינון שלא דווח. תעדו כיצד נוצרה המשפחה ואם בוצע סינון. כאשר כמה מועמדים חולקים את ההפסד הצפוי הנמוך ביותר, השארת כמה מהם תואמת לשיטה ואינה כישלון לבחור.
הבחינו בין MCS למבחנים זוגיים ולמבחני benchmark
מבחן Diebold–Mariano מתמקד בהפרש הפסד מזווג בין שני הליכי חיזוי מול אותן תוצאות. MCS בודקת קבוצה ברצף ומדווחת אילו מועמדים שרדו את הליך ההוצאה המשותף. הרצה של כמה מבחני DM והשארת הזוגות הלא מובהקים אינה שקולה אוטומטית ל-MCS; bootstrap משותף וכלל הוצאה עקבי חשובים.
מבחן Clark–West מטפל בהשוואה ממוקדת יותר של שגיאות ריבועיות כאשר מודל תחזית אחד כולל benchmark מוגבל ורעש אמידה משפיע על ההפרש הגולמי. MCS אינה דורשת שהמועמדים יהיו מקוננים ויכולה להשתמש בפונקציית הפסד שהמשתמש בוחר, אך עדיין דורשת עיצוב חיזוי משותף.
Reality Check של White ומבחן SPA של Hansen שואלים אם לפחות מועמד אחד במשפחה שנחקרה גובר על benchmark מוגדר. MCS אינה דורשת benchmark ומתארת קבוצה של מועמדים עדיפים יחסית במקום לבחון benchmark יחיד. כל השיטות דורשות לתעד את החיפוש ולטפל בתלות, אך הן בוחנות השערות אפס שונות. ראו את המדריך ל-Reality Check ול-SPA ואת המאמרים המקוריים של White (2000) ו-Hansen (2005).
דווחו על התכנון והפרידו בין דירוג תחזית לערך מסחרי
דוח MCS שניתן לשחזר מציין כל הליך מועמד, יעד ואופק משותפים, כללי מידע, לוח אמידה, תאריכי הערכה, טיפול בערכים חסרים, נוסחת הפסד והכיוון שנחשב טוב יותר. ציינו גם את רמת המובהקות, הסטטיסטי וכלל ההוצאה, סוג ה-bootstrap, אורך הבלוק, המרכז, מספר החזרות, ערכי ה-p בכל שלב והחברות בקבוצה הסופית. הציגו הפסדים ממוצעים והפרשים כהקשר, אך אל תחליפו בהם את ההסקה המשותפת באמצעות טבלת דירוג.
בהערכת תנודתיות, פרטו כיצד נבנה ה-proxy הנצפה והאם יש בו רעש או תיקונים. בתחזיות רב-שלביות, ציינו אם חלונות היעד חופפים וכיצד טיפלתם בתלות. הראו רגישות לשינוי סביר בפונקציית ההפסד, בתקופת המדגם ובהגדרות ה-bootstrap כאשר הבחירות משפיעות מהותית על הקבוצה. ערך p קטן בלי המועמדים שהוסרו וסדר ההליך אינו מספיק לשחזור.
MCS מדרגת הליכי חיזוי לפי קריטריון אחד. היא אינה מוכיחה סיבתיות, אינה מזהה את המודל האמיתי ליצירת הנתונים ואינה מוכיחה שתחזית שנותרה תניב עסקה רווחית. המרת תחזית לפוזיציה מחייבת ספים, גודל פוזיציה, מחזור, תזמון ביצוע, spread, עמלות, slippage, מימון, השאלת נכסים ומגבלות סיכון. בדקו את הליך ההחלטה הקפוא בנפרד על נתונים מאוחרים מתאימים ודווחו את תוצאות המסחר נטו בנפרד. לציוני תנודתיות עם proxy רועש, ראו את המדריך QLIKE לעומת שגיאה ריבועית.
שאלות נפוצות
Q1האם MCS בוחרת מודל מנצח אחד?
לא בהכרח. מועמד אחד יכול להישאר אם הנתונים מבדילים אותו, או כמה מועמדים אם לא הוכח שאחד נחות. בחירת מועמד יחיד לפריסה דורשת כלל החלטה נפרד.
Q2האם למודל שנכלל ב-MCS יש הסתברות של 95% להיות נכון?
לא. רמת הביטחון מתארת כיסוי במדגמים חוזרים של המועמד הטוב ביותר במשפחה שהוגדרה, תחת הנחות השיטה. זו אינה הסתברות posterior שהמודל אמיתי.
Q3האם אפשר להשתמש ב-MCS מעבר לתחזיות תנודתיות?
כן. ניתן להשוות תחזיות, מודלים אקונומטריים או הליכים אחרים אם מגדירים קריטריון משותף מתאים ותכנון דגימה הולם. התוצאה תלויה במשפחת המועמדים ובהפסד.
Q4האם MCS מתחשבת אוטומטית בכל המודלים שניסיתי?
רק אם החיפוש בפועל מיוצג במשפחת המועמדים ובהליך ההערכה. סינון שלא תועד או שימוש חוזר בנתוני הערכה אינם מתוקנים רק משום שהרצתם MCS לאחר מכן.
מקורות וקריאה נוספת
דיווח על בעיה
נכין אימייל עם קישור למאמר הזה. Mark יקבל את הדיווח רק לאחר שתשלחו אותו
בדיקה מהירה
סיימת לקרוא? בדוק את עצמך ב־3 שאלות
שאלה 01
מה Model Confidence Set מדווחת?
בחר תשובה כדי לראות את ההסבר
מילון מונחי אופציות
הגדרות ברורות למונחי אופציות חשובים, מקריאות ופוטים ועד IV, יוונים, עניין פתוח ו-max pain
עיינו במילון המונחים של האופציות