בדיקת VaR לאחור: הסבר על מבחני Kupiec ו-Christoffersen
למדו כיצד מבחן POF של Kupiec ומבחני הכיסוי המותנה של Christoffersen בודקים חריגות VaR, כיצד לקרוא דוגמה של 250 ימים, ולמה אי-דחייה אינה הוכחת דיוק.
במדריך הזהמה בודקת בדיקת VaR לאחור?
תקציר קצר
בדיקת VaR לאחור משווה בין סף ההפסד שנחזה בכל יום לבין ההפסד שהתממש לאחר מכן. מבחן Kupiec שואל אם מספר החריגות מתאים לשיעור היעד. מבחני Christoffersen בודקים גם אם החריגות מופיעות באופן בלתי תלוי או מתקבצות בזמן. כל מבחן בוחן היבט אחר של התחזית, ואף אחד מהם אינו מוכיח שמודל הסיכון נכון.
מה בודקת בדיקת VaR לאחור?
ערך בסיכון (VaR) הוא סף הפסד הקשור לרמת ביטחון ולאופק זמן מוגדרים. אם תחזית VaR יומית ברמת 99% היא 10,000 דולר, המודל מייחס הסתברות של 1% להפסד יומי העולה על סכום זה, בהתאם למידע ולהנחות שהוגדרו. VaR אינו מגביל את ההפסד ל-10,000 דולר ואינו אומר מה יהיה גודל ההפסד לאחר חציית הסף.
בדיקה לאחור ממירה רצף של תחזיות ותוצאות לרצף של חריגות. אם מודל VaR יומי ברמת 99% מכויל היטב, חריגות אמורות להתרחש בכ-1% מהתצפיות בנות-השוואה לאורך זמן. יש כאן שני היבטים: התדירות הכוללת צריכה להיות קרובה ליעד, ותזמון החריגות לא אמור להציג דפוס שסותר את תחזיות הסיכון המותנות של המודל. מבחן proportion-of-failures (POF) של Kupiec מתמקד בעיקר בהיבט הראשון. מבחני העצמאות והכיסוי המותנה של Christoffersen מביאים בחשבון גם את סדר החריגות.
ההבחנה מעשית. מודל אחד עשוי להציג ארבע חריגות בשנה, כולן בשבוע סוער; מודל אחר עשוי להציג אותן ארבע פעמים כשהן מפוזרות לאורך השנה. מבחן שסופר בלבד רואה ארבע חריגות בשני המקרים, ואילו מבחן של תזמון רואה רצפים שונים. המבחנים עוזרים לתאר את התכונות הללו, אך אינם מחליפים בדיקה של הפוזיציות, נתוני השוק, ההנחות או חומרת ההפסד. מדריך על מודלי GARCH והתקבצות תנודתיות מסביר כיצד לתאר התמדה בשונות; מודל שונות ובדיקה לאחור עונים על שאלות שונות.
מגדירים את החריגה לפני שסופרים אותה
יש להשתמש באותה מוסכמת סימן לאורך כל הניתוח. נסמן ב-Lₜ את ההפסד שהתממש ביום t, וב-VaRₜ|ₜ₋₁ את סף ההפסד החזוי ליום זה לפי המידע שהיה זמין לפניו. נגדיר את אינדיקטור החריגה Iₜ כ-1 כאשר Lₜ > VaRₜ|ₜ₋₁, וכ-0 אחרת. במודל VaR ברמת 99%, הסתברות החריגה היעד היא α = 1 − 0.99 = 0.01. מקורות מסוימים מגדירים את האינדיקטור באמצעות תשואות או באמצעות תחום כיסוי; אלה מוסכמות שקולות לאחר התאמת הסימן וההסתברות. חשוב לציין באיזו הגדרה משתמשים.
התחזית והתוצאה חייבות להתייחס לאותו תיק, אופק, מועד הערכה והגדרת הפסד. תחזית שנוצרת אחרי סגירת המסחר ליום הבא צריכה להיבדק מול הפסד אותו יום לפי כלל הערכה עקבי. החליטו מראש כיצד לטפל בשוויון מדויק לסף VaR, בחגים, בתצפיות חסרות, בסגירת שוק, בתיקונים תוך-יומיים ובשינויים בתיק. הבחירות הללו עשויות לשנות את רצף החריגות, בעיקר כשהחריגות נדירות.
יש להפריד בין התאמת המודל לבין הערכתו הסופית. אם הפרמטרים או ספי הסיכון נבחרו לאחר עיון באותה תקופה המשמשת לבדיקה, ערך ה-p אינו עוד מדד נקי של בחינה מחוץ למדגם. בתחזיות מתגלגלות יש לתעד מתי כל תחזית נוצרה ומה היה המידע הזמין אז. תחזיות למספר ימים חופפים עלולות ליצור תלות בין אינדיקטורי החריגה. המבחנים שלהלן אינם מתקנים מעצמם אופק שאינו תואם, דליפת מידע עתידי, נתונים שעודכנו בדיעבד או תהליך בחירת מודל.
איזו שאלה שואל מבחן POF של Kupiec?
נניח שיש T זוגות בני-השוואה של תחזית ותוצאה ו-x חריגות. שיעור החריגות הנצפה הוא p̂ = x/T. מבחן ה-proportion-of-failures של Kupiec משווה בין שתי פונקציות נראות בינומיות: באחת הסתברות החריגה מקובעת לערך היעד α, ובשנייה היא נאמדת בחופשיות לפי p̂. סטטיסטי יחס הנראות הוא:
LRᵤ꜀ = −2 ln [ (1−α)^(T−x) α^x / ((1−p̂)^(T−x) p̂^x) ]
הניסוח המקורי פורסם במאמרו של Kupiec משנת 1995, וקיים גם רישום בארכיון הפדרל ריזרב. תחת השערת האפס, החריגות הן אירועי ברנולי בלתי תלויים שהסתברותם α. במדגם גדול דיו, הסטטיסטי מתפלג בקירוב כי-בריבוע עם דרגת חופש אחת. ערך גבוה דוחה את תדירות החריגה שנקבעה. מאחר שהחלופה אומדת את השיעור הנצפה בחופשיות, אפשר לדחות גם כשיש יותר מדי חריגות וגם כשיש פחות מדי. מודל שכמעט לעולם אינו חוצה את סף ה-VaR אינו בהכרח מכויל היטב; ייתכן שהוא שמרני עד כדי כך שהתחזיות אינן מועילות למטרה.
מבחן POF משתמש במספר x, לא בתאריכים שבהם החריגות התרחשו. שינוי הסדר של אותם אינדיקטורים אינו משנה את הסטטיסטי. לכן תוצאת POF אינה מלמדת אם ארבע חריגות היו מפוזרות או רצופות. פונקציית הנראות הבינומית גם מניחה עצמאות בין האינדיקטורים לצורך התפלגות הייחוס. אם השאלה היא האם החריגות מתקבצות, הוסיפו מבחן תלות במקום להסיק זאת מתוצאת POF.
דוגמה של 250 ימים מראה למה צריך לפרש ערך p בהקשר
נבחן רצף היפותטי של 250 תחזיות VaR יומיות ברמת 99%. שיעור היעד הוא α = 0.01, ולכן מספר החריגות הצפוי תחת השערת האפס הוא Tα = 250 × 0.01 = 2.5. נניח שנצפו ארבע חריגות. השיעור הנצפה הוא p̂ = 4/250 = 0.016, או 1.6%. הוא גבוה מיעד של 1%, אך הפער לבדו אינו קובע אם מבחן יחס הנראות ידחה.
הצבת T = 250, x = 4 ו-α = 0.01 נותנת LRᵤ꜀ ≈ 0.769. לפי קירוב א-סימפטוטי של כי-בריבוע(1), מתקבל p ≈ 0.38, והערך הקריטי ברמת 5% הוא בערך 3.84. לפי קירוב זה, הדוגמה אינה דוחה את הכיסוי הלא-מותנה ברמת 5%. אלה חישובים היפותטיים להמחשת השיטה, לא תוצאה אמפירית ולא סף קבלה מומלץ.
שתי פונקציות הלוג-נראות מראות כיצד מתקבל הסטטיסטי. כאשר שיעור היעד מקובע, ℓ₀ = 246 ln(0.99) + 4 ln(0.01) ≈ −20.893. כאשר השיעור הנצפה אינו מוגבל, ℓ₁ = 246 ln(0.984) + 4 ln(0.016) ≈ −20.508. ההתאמה הלא-מוגבלת גבוהה בכ-0.385 יחידות לוג-נראות, ולכן LRᵤ꜀ = −2(ℓ₀ − ℓ₁) ≈ 0.769. המבחן מודד את אובדן ההתאמה ביחס למודל עם שיעור היעד; הוא אינו מודד מרחק בדולרים.
אי-דחייה אינה מוכיחה שהמודל מכויל היטב. ב-250 ימים ציפינו ל-2.5 חריגות בלבד, ולכן אירוע אחד או שניים נוספים משנים במידה ניכרת את השיעור הנצפה. קירוב כי-בריבוע הוא א-סימפטוטי, ולמבחנים של אירועים נדירים עשויה להיות עוצמה נמוכה במדגם כזה. יש לקרוא את הסטטיסטי לצד המספר הצפוי, האופק, תכנון המבחן וגודל המדגם. ערך p אינו ההסתברות שמודל ה-VaR נכון.
אותו מספר חריגות עשוי להסתיר תזמון שונה
נשווה שני רצפים היפותטיים בני 250 ימים, ובכל אחד מהם ארבע חריגות. ברצף A הן מופיעות בימים 20, 80, 140 ו-220. ברצף B הן מופיעות בימים 60 ו-61, ולאחר מכן 180 ו-181. בשניהם x = 4 ו-p̂ = 1.6%, ולכן סטטיסטי Kupiec זהה. אבל B מכיל שני זוגות של חריגות בימים סמוכים, ואילו A אינו מכיל זוג כזה.
התרשים המושגי המצורף ממחיש למה כדאי לשמור את סדר אינדיקטורי החריגה ולא רק את הסכום. הוא אינו סדרת נתונים אמיתית של 250 ימים ואינו תוצאת מבחן. חריגות רצופות עשויות להצדיק בדיקה אם המודל מגיב באיחור לשינוי בתנודתיות, אך מעט נקודות אינן מספיקות כדי לאבחן את הסיבה. הדפוס עשוי לנבוע גם ממפרט שגוי, מהלם בשוק, משינוי בתיק, מאופקים חופפים או מכללי נתונים ותזמון.
נסמן ב-nᵢⱼ את מספר המעברים שבהם האינדיקטור הקודם היה i והנוכחי j, כאשר 0 פירושו ללא חריגה ו-1 פירושו חריגה. הרחק מגבולות המדגם, ברצף A מתקבלים n₀₁ = 4 ו-n₁₁ = 0, וב-B מתקבלים n₀₁ = 2 ו-n₁₁ = 2. לשניהם ארבע חריגות, אך ב-B חלק מהן מופיעות לאחר חריגה קודמת. זהו המידע שבו משתמש מבחן עצמאות מסדר ראשון.
ספירות המעבר המלאות הן n₀₀=241, n₀₁=4, n₁₀=4, n₁₁=0 עבור A; ועבור B הן n₀₀=243, n₀₁=2, n₁₀=2, n₁₁=2. ההסתברות הנאמדת לחריגה אחרי יום ללא חריגה היא n₀₁/(n₀₀+n₀₁); אחרי יום עם חריגה היא n₁₁/(n₁₀+n₁₁). ב-A אלה 4/245 ≈ 1.63% ו-0/4 = 0%. ב-B אלה 2/245 ≈ 0.82% ו-2/4 = 50%. שיעור 50% מבוסס על ארבעה מעברים בלבד אחרי חריגה: הוא מאפיין של הרצף ההיפותטי הזעיר, ולא אומדן אמין לסיכון של מודל אמיתי למחרת.

מה מוסיף מבחן העצמאות של Christoffersen?
מבחן העצמאות משווה את ההסתברות לחריגה אחרי יום שקט עם ההסתברות לחריגה אחרי יום חריגה. נגדיר π₀ = Pr(Iₜ = 1 | Iₜ₋₁ = 0) ו-π₁ = Pr(Iₜ = 1 | Iₜ₋₁ = 1). תחת השערת העצמאות, π₀ = π₁: מצב החריגה של אתמול אינו משנה את ההסתברות לחריגה היום. תחת החלופה אומדים את שתי הסתברויות המעבר בנפרד על סמך n₀₀, n₀₁, n₁₀ ו-n₁₁.
המסגרת לבחינת תחזיות של רווחי סמך מותנים מופיעה במאמרו של Christoffersen משנת 1998. סטטיסטי יחס הנראות משווה בין שני המודלים, ולרוב מעריכים אותו לפי התפלגות כי-בריבוע עם דרגת חופש אחת. בניגוד למבחן POF, הוא תלוי בסדר האינדיקטורים. אם חריגה נוטה לבוא אחרי חריגה נוספת, ייתכן ש-π₁ גדול מ-π₀. המבחן עוסק בתלות מסדר ראשון ברצף הבינארי; הוא אינו בודק כל דרך שבה מידע עבר, תנודתיות או מצב תיק עשויים לנבא הפסדים עתידיים.
כאשר מספר החריגות קטן, אומדני המעבר אינם יציבים. רצף ללא חריגות סמוכות עשוי להוביל לאומדן גבולי של אפס ל-π₁, אך אין בכך הוכחה שחריגה שנייה אינה אפשרית; פשוט לא נצפתה כזו במדגם. בחנו את ספירות המעבר ואת גודל המדגם לצד הסטטיסטי. אין לפרש טבלה דלילה כאומדן מדויק של סיכון זנב ליום הבא.
הכיסוי המותנה משלב תדירות ועצמאות
מבחן הכיסוי המותנה מחבר את סטטיסטי התדירות של Kupiec עם סטטיסטי העצמאות של Christoffersen: LR꜀꜀ = LRᵤ꜀ + LRᵢₙd. השערת האפס המשותפת קובעת שהסתברות החריגה היא α ושהחריגות עצמאיות לאורך זמן. במסגרת הסטנדרטית למדגם גדול, משווים את הסכום להתפלגות כי-בריבוע עם שתי דרגות חופש.
יש לדווח גם על רכיבי המבחן. דחיית הכיסוי המותנה פירושה ששתי הדרישות יחד אינן תואמות את הרצף הנצפה תחת הנחות המבחן, אך היא אינה מצביעה על הסיבה. אם POF נדחה ומבחן העצמאות לא, מספר החריגות הכולל עשוי להיות האות הברור יותר. אם העצמאות נדחית, בדקו את תזמון החריגות גם אם הסכום קרוב ליעד. אם אף מבחן אינו נדחה, ייתכן שהמדגם עדיין קצר מכדי לחשוף מפרט שגוי.
למבחן תחום צר: כל יום מצטמצם למשתנה בינארי. הוא אינו מבחין בין הפסד שעבר את VaR בדולר אחד לבין הפסד של מיליון דולר. הוא גם אינו מאמת את יתר התפלגות ההפסד או מוכיח ש-Expected Shortfall נכון. להשוואה בין השאלות שעליהן עונים VaR ו-Expected Shortfall, ראו את המדריך על VaR לעומת Expected Shortfall.
חריגות נדירות מקשות על הסקה במדגם קצר
ב-VaR של 99%, מדגם בן 250 ימים כולל רק 2.5 חריגות צפויות. אם הסתברותן של חריגות עצמאיות היא 1%, מספר המעברים הצפוי מחריגה לחריגה בתוך 249 זוגות ימים סמוכים הוא בערך 249 × 0.01² = 0.025. ברוב המדגמים הללו לא תהיה אף חריגה סמוכה, גם אם המודל מכויל היטב. המחסור הזה מקשה לאמוד את הסתברויות המעבר בדיוק ועלול להחליש את עוצמת מבחן התלות.
Christoffersen ו-Pelletier דנים בעוצמה הנמוכה יחסית של מבחני VaR קיימים במדגמים קטנים מציאותיים, ובוחנים מבחני משך שמנתחים את הזמן בין חריגות במאמרם משנת 2004. הממצאים מצדיקים לשקול אבחון נוסף, אך אינם הופכים מבחן משך לעדיף בכל מצב ואינם מבטלים את הצורך להתאים אותו לתחזית הסיכון ולתכנון המדגם. כשיש מעט תצפיות, יש לציין זאת במקום להציג אי-דחייה כאישור תקינות.
גם שיעור הזנב היעד משנה. ב-VaR של 95%, השיעור הנומינלי הוא 5%, ולכן מצפים ל-12.5 חריגות ב-250 ימים; ב-99.9% מצפים רק ל-0.25. שימוש באותו שם מבחן אינו הופך את הראיות בין התכנונים לבנות-השוואה. ציינו את רמת הביטחון, האופק, מספר התצפיות, ספירות היעד והנתונים והמעברים, והאם נעשה שימוש בקירוב א-סימפטוטי או בשיטה למדגם סופי.
מתי כדאי להשתמש באבחון אחר?
בחרו אבחון נוסף לפי המידע ששני המבחנים השליכו. אם רוצים לבדוק האם חריגות ניתנות לחיזוי באמצעות אינדיקטורי עבר, תחזיות VaR או משתנים אחרים שהיו ידועים בעת התחזית, מבחן ה-Dynamic Quantile (DQ) של Engle ו-Manganelli בודק הגבלות על אינדיקטורי חריגה ממורכזים ועל קבוצת משתנים מסבירים שנבחרה. התוצאה תלויה במשתנים ובתזמון הזמינות שלהם; זה אינו מבחן לכל כשל מותנה אפשרי. מבחן משך בוחן במקום זאת את זמן ההמתנה בין חריגות.
Engle ו-Manganelli הציגו את מבחן DQ במאמר CAViaR שלהם. אם החשש הוא גודל ההפסד לאחר חציית סף VaR, מבחני תדירות ועצמאות אינם מספיקים; בחנו את גודל החריגות ובחרו שיטת הערכת Expected Shortfall שמתאימה לתחזית ולהנחות. אם החשש הוא בחירת התוצאה הטובה ביותר לאחר ניסיונות מודל רבים, בדיקת VaR לאחור אינה פותרת את בעיית בחירת האסטרטגיה; PBO ו-CSCV הם אבחון נפרד המבוסס על דירוגים.
דוח שימושי מציין את התיק ואת מוסכמת ההפסד, אופק התחזית, רמת הביטחון, תאריכי ההערכה, אופן יצירת התחזיות, הגדרת החריגה, הספירות הצפויה והנצפית, סטטיסטי POF, ספירות המעבר ותוצאות מבחני העצמאות והכיסוי המותנה. תארו גם מגבלות שמקורן בגודל המדגם או באופקים חופפים. הציגו יחד לאורך זמן את ספי התחזית וההפסדים שהתממשו, והשאירו נתוני הערכה מאוחרים מחוץ לבחירת המודל. כך ניתן לפרש את הראיות, אך הצלחה במבחן היסטורי אינה מבטיחה שליטה בסיכון בעתיד.
שאלות נפוצות
Q1האם אי-דחייה במבחן Kupiec פירושה שמודל ה-VaR שלי מדויק?
לא. פירושה שהמבחן לא מצא די ראיות נגד שיעור החריגה שנקבע, תחת הנחותיו. במדגם קצר, ובייחוד ברמת ביטחון של 99% ומעלה, עשויות להיות מעט מדי חריגות כדי לחשוף בעיה.
Q2האם שני מודלים יכולים לא להידחות באותו מבחן Kupiec ועדיין להציג דפוסי חריגות שונים?
כן. סטטיסטי Kupiec תלוי במספר החריגות, לא בסדר שלהן. מבחן העצמאות של Christoffersen מוסיף מידע על האפשרות שהחריגות מתקבצות בתצפיות סמוכות.
Q3האם המבחנים האלה מראים כמה גדול יהיה הפסד אחרי חציית VaR?
לא. הם משתמשים באינדיקטור חריגה ואינם מודדים את גודל ההפסד שמעל הסף. אם חומרת ההפסדים אחרי חציית VaR חשובה, בחנו את ההפסדים האלה והעריכו Expected Shortfall בנפרד.
מקורות וקריאה נוספת
דיווח על בעיה
נכין אימייל עם קישור למאמר הזה. Mark יקבל את הדיווח רק לאחר שתשלחו אותו
בדיקה מהירה
סיימת לקרוא? בדוק את עצמך ב־3 שאלות
שאלה 01
באיזה נתון משתמש מבחן POF של Kupiec?
בחר תשובה כדי לראות את ההסבר
מילון מונחי אופציות
The average loss from a chosen VaR quantile through the worst tail under a precise convention; it measures severity beyond the threshold rather than only its location.
קראו את המדריך המעמיקGARCHA time-series model that updates conditional variance from past squared shocks and prior variance; it models volatility persistence, not return direction.
קראו את המדריך המעמיקAssignmentThe process that requires an option writer to fulfill the contract after an exercise notice is allocated; it can create or remove an underlying position.
קראו את המדריך המעמיק