Skip to content
כל מדריכי האופציות
הערכת תחזיות הסתברותיות12 דקות קריאה

Brier score לעומת log loss בתחזיות הסתברותיות

השוו בין Brier score ל-log loss בתחזיות הסתברות בינאריות, למדו לחשב אותם והבינו scoring תקין, כיול ומיומנות חיזוי

במדריך הזהשיעור הצלחה מתעלם מההסתברות שחזיתם

תקציר קצר

תחזית הסתברותית אומרת עד כמה אירוע צפוי להתרחש, ולא רק איזו תוצאה היא הסבירה ביותר. Brier score ו-log loss משווים את ההסתברויות לתוצאות שכבר הוכרעו. שניהם proper scoring rules, אך הם מענישים טעויות בדרכים שונות. לכן score נמוך יותר משמעותי רק לאחר שהאירוע, המדגם, שיטת החישוב וההשוואה הוגדרו מראש.

שיעור הצלחה מתעלם מההסתברות שחזיתם

נניח שרושמים אם מודל חזה נכון “עלייה” או “ירידה”. שיעור הצלחה מתייחס לתחזית נכונה של 51% ושל 99% באותו אופן. הוא גם מתייחס באותו אופן לתחזיות שגויות של 49% ושל 1%. כך נעלמת מידת הביטחון של התחזית, אף שהיא עשויה להיות חשובה כשהחלטות כרוכות בתשלומים או בסיכונים שונים.

תחזית הסתברות בינארית מקצה ערך \(p_t\) בין אפס לאחד לאירוע שהוגדר בבירור במועד התחזית \(t\). בהמשך רושמים \(y_t=1\) אם האירוע התרחש ו-\(y_t=0\) אם לא. Scoring rule מעריך יחד את התחזית ואת התוצאה. Brier score משתמש בריבוע שגיאת ההסתברות; log loss משתמש בלוגריתם השלילי של ההסתברות שניתנה לתוצאה שהתרחשה בפועל.

Scores אלה מועילים להשוואת תחזיות הסתברותיות, לרבות הסתברויות לאירוע שמפיק מודל trading. הם אינם מוכיחים כשלעצמם שהתחזית מכוילת, שהיא טובה מהשוואה סבירה או שמסחר לפיה יהיה רווחי. המדריך ל-Mincer–Zarnowitz מסביר רגרסיית כיול ליניארית אחרת לתחזיות נקודתיות מספריות.

הגדירו אירוע אחד והתאימו כל תחזית לתוצאה שלו

לפני חישוב score, הגדירו את האירוע כך שאפשר יהיה להכריע בו באופן עקבי. השאלה “האם הנכס יעלה?” אינה שלמה עד שמגדירים את הנכס, מקור המחיר, זמני ההתחלה והסיום, המטבע, מוסכמת התשואה והטיפול ברשומות חסרות או מתוקנות. באירוע כלכלי יש לתעד את הפרסום ואת גרסת הנתונים ששימשו לקביעת התוצאה. אין להשוות תחזיות שנבדקו מול הגדרות או קבוצות תאריכים שונות.

שמרו כל תחזית כפי שהייתה זמינה במועד שבו ניתנה. הסתברות שפורסמה בזמן \(t\) צריכה להשתמש רק במידע שהיה זמין עד לנקודת החיתוך שנקבעה, ולהיות מותאמת לתוצאה באותו horizon. סדרת נתונים שעודכנה בדיעבד, שער סגירה מאוחר יותר או כלל סיווג שנבחר לאחר צפייה בתוצאה יכולים לשנות בשקט את ה-target או להכניס מידע עתידי.

בתחזיות rolling יש לשמור את גרסת המודל, גרסת נתוני הקלט, חותמת הזמן, ההסתברות וכלל ההכרעה. השוו מודלים על אותם forecast origins. אם חסרה הסתברות, תעדו את ההשמטה והחילו את אותו כלל מדגם על כל החלופות. כך אפשר לשחזר את ה-score והוא אינו רק סיכום של spreadsheet שמשתנה.

חשבו Brier score מריבועי שגיאות הסתברות

באירוע בינארי יחיד, Brier loss במקרה \(t\) הוא:

BSₜ = (pₜ − yₜ)²

Brier score הממוצע על פני \(n\) תחזיות הוא:

BS = (1/n) Σₜ (pₜ − yₜ)²

נמוך יותר עדיף, אפס הוא מושלם, ולפי מוסכמת האירוע היחיד הזו הטווח הוא אפס עד אחד. לדוגמה, אם התחזית היא \(p=0.70\) והאירוע מתרחש, ההפסד הוא \((0.70-1)^2=0.09\). אם אותו forecast מלווה באי-התרחשות, ההפסד הוא \((0.70-0)^2=0.49\). טעות שנעשתה בביטחון גבוה עולה יותר מטעות מתונה, אך הקנס מוגבל.

בדקו את הנוסחה כשמשווים מספרים שפורסמו. יש מוסכמות שמסכמות את ריבועי השגיאות בכל הקטגוריות של תחזית מרובת תוצאות; במקרה בינארי, סכום הווקטור עשוי להיות כפול מה-loss של אירוע יחיד שמוצג כאן. הכפלת כל ה-scores בשניים אינה משנה את הדירוג בתוך אותו אירוע, אבל הערכים המספריים אינם בני השוואה בין מוסכמות אם הסקאלה אינה מצוינת.

חשבו log loss והבינו מדוע טעויות קיצוניות בולטות

באירוע בינארי, log loss הוא:

LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]

אם האירוע מתרחש, ההפסד הוא \(-\log(p_t)\); אם לא, הוא \(-\log(1-p_t)\). לכן תחזית נכונה של 70% מקבלת \(-\log(0.70)\approx0.357\), ואותה תחזית כשהיא שגויה מקבלת \(-\log(0.30)\approx1.204\). ממוצע log loss הוא ממוצע הקנסות לכל מקרה ואין לו גבול עליון קבוע כאשר התחזית מקצה הסתברות כמעט אפס לאירוע שהתרחש.

ב-\(p=0\) או \(p=1\), תחזית שגויה ובטוחה בעצמה גוררת log loss אינסופי. אם תוכנה מבצעת clipping להסתברויות לרצפה קטנה, כגון \(\varepsilon\), כדי למנוע אינסוף, דווחו על הרצפה והחילו אותה בעקביות לפני צפייה בתוצאות. Clipping משנה את כלל ההערכה המספרי ואין להסתירו כפרט של ניקוי נתונים.

Brier score ו-log loss יכולים לדרג את אותן תחזיות באופן שונה כי עקומות הקנס שלהם שונות. log loss מעניש במיוחד הקצאת הסתברות כמעט אפס לאירוע שהתרחש; Brier loss בינארי מוגבל לאחד. בחרו מראש איזה score ישמש. אם החלטות תלויות בהסתברויות קיצוניות, שקלו להציג את שניהם במקום לבחור בדיעבד את התוצאה שנראית טוב יותר.

<!-- learn:illustration -->

טיפות זכוכית כחולות ניצבות מול אבני תוצאה ענבריות; תחזית בטוחה מאוד רחוקה מהאירוע שהתרחש
המחשה מושגית של הסתברויות ותוצאות בפועל ושל ענישה שונה לטעות בטוחה; אין בה נתוני שוק, תוצאת בדיקה או אות מסחר

Proper scoring מעודד הסתברויות כנות בממוצע

Score הוא proper אם החזאי ממקסם את התגמול הצפוי או ממזער את ההפסד הצפוי כשהוא מדווח על ההסתברות שבה הוא באמת מאמין. הוא strictly proper אם ההסתברות הכנה היא האפשרות האופטימלית היחידה. לפי ההגדרות המקובלות, Brier וה-logarithmic scores הם strictly proper לתחזיות הסתברות בינאריות (Gneiting and Raftery, 2007). לכן יש הצדקה עקרונית להעריך הסתברויות במקום להמיר אותן תחילה לתוויות חדות.

“Proper” היא טענה על תוחלת, לא הבטחה לגבי כל מדגם שנצפה. חזאי שמדווח בכנות על הסתברות של 70% עדיין יכול לטעות במקרה יחיד ולקבל finite-sample score גרוע יותר ממי שניחש. כדי ללמוד על ביצועים ממוצעים דרושות תחזיות חוזרות ובנות השוואה. גם לתמריצים יש חשיבות: אם לאדם יש כלל תגמול נפרד, score לבדו אינו מבטיח שההסתברות המדווחת משקפת את אמונתו.

אף אחד משני ה-scores אינו מודד כיול בלבד. נתון מצרפי עשוי לשלב את מידת הקרבה של ההסתברויות לתדירויות שנצפו ואת היכולת להפריד בין מקרים שהתוצאות שלהם שונות. מודל יכול להפיק תחזיות חדות ובכל זאת להיות בלתי מכויל באופן שיטתי; מודל שמדווח תמיד על שיעור הבסיס יכול להיות מכויל במצטבר אך למסור מעט מידע על כל מקרה.

קראו את פירוק Brier דרך reliability, resolution ו-uncertainty

הפירוק של Murphy מחלק את ממוצע Brier score לשלושה איברים (Murphy, 1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)):

BS = reliability − resolution + uncertainty

לגבי קבוצות \(k\) של תחזיות עם הסתברויות דומות, \(w_k\) הוא חלקה של כל קבוצה במדגם, \(\bar p_k\) היא הסתברות התחזית הממוצעת שלה, \(\bar y_k\) היא תדירות האירוע שנצפתה בקבוצה ו-\(\bar y\) היא התדירות הכוללת. רכיבי ה-binned הם:

reliability = Σₖ wₖ(̅pₖ − ̅yₖ)² resolution = Σₖ wₖ(̅yₖ − ̅y)² uncertainty = ̅y(1 − ̅y)

שגיאת reliability נמוכה יותר עדיפה: התחזיות בתוך קבוצה צריכות להתאים לתדירות שנצפתה בה. resolution גבוה יותר עדיף: תדירויות האירוע בקבוצות צריכות להיות שונות משיעור הבסיס הכולל. uncertainty משקפת את תדירות האירוע במדגם ואינה הישג של מודל התחזית. הפירוק מסביר כיצד לשני מודלים יכול להיות אותו Brier score אך חוזקות שונות.

הפירוק האמפירי exact כאשר מקבצים מקרים בעלי הסתברות חזויה זהה. אם מחלקים הסתברויות רציפות ל-bins, הפירוק exact לתחזית שעברה coarsening, ולא להבדלים בין ההסתברויות המקוריות שאבדו בתוך ה-bins. קיבוץ מחייב לבחור גבולות. reliability diagram עם עשרה bins ברוחב שווה עשוי להראות תמונה שונה מ-bins לפי quantiles, במיוחד במדגם קטן או ליד קצוות ההסתברות. הציגו את מספר המקרים ואת ה-uncertainty בכל bin, והתייחסו לפירוק כאל כלי אבחון ולא כדרך למחוק sampling error. גרפי calibration אינם הוכחה עצמאית ל-reliability עתידי.

קבעו reference לפני שאתם מכנים score בשם skill

Raw score נמוך משל מודל אחר הוא השוואה, אך עדיין אינו אומר שהייתה התקדמות ביחס ל-baseline מועיל. Brier skill score משווה forecast system ל-reference forecast מוגדר:

BSS = 1 − BS_model / BS_reference

לפי הגדרה זו, אפס שווה ל-reference, ערך חיובי מצביע על שיפור וערך שלילי על תוצאה גרועה יותר. ערך אחד משמעו Brier loss אפס למודל כאשר ל-reference יש loss חיובי. בחרו reference שמתאים להחלטה ול-information set. שיעור בסיס היסטורי קבוע, תדירות האירוע בחלון האימון או הליך תחזית קיים יכולים להתאים למשימות שונות.

אל תחשבו reference מתוך תוצאות הערכה עתידיות אם הן לא היו זמינות בזמן התחזית. בסדרת זמן, תדירות היסטורית מתרחבת או rolling עשויה להיות baseline תפעולי נקי יותר מתדירות בכל המדגם. אם ה-reference score הוא אפס, היחס אינו מוגדר; תעדו כיצד נבנה ה-benchmark והציגו גם את ה-raw scores של המודל ושל ה-reference.

Brier skill score תלוי ב-reference ובתדירות האירוע. Score מול תחזית base-rate בלתי מותנית עונה על שאלה אחרת מ-score מול מודל production נוכחי. אל תשוו BSS בין מחקרים בלי לבדוק את הגדרות האירוע, תחזיות ה-reference, תקופות המדגם ומוסכמות בינאריות או מרובות קטגוריות.

השוו מודלים על תוצאות out-of-sample מזווגות

הפיקו הסתברויות לפי סדר כרונולוגי ושמרו evaluation period שלא שימש לכוונון המודל, לבחירת features או לבחירת threshold. חשבו score לכל מודל על אותן תוצאות שהוכרעו ועל אותם origins. עבור loss שנבחר, הגדירו את ההפרש המזווג כך:

dₜ = Lₐ,ₜ − Lᵦ,ₜ

לפי מוסכמת הסימן הזו, ממוצע חיובי משמעו שלמודל B היה loss ממוצע נמוך יותר. מסגרת Diebold–Mariano יכולה לבחון הפרש ממוצע ב-loss כאשר הנחות ההשוואה ואומדן השונות מתאימים לתכנון. אם השאלה היא האם ה-score היחסי משתנה עם תנאים שהיו ידועים בזמן התחזית, המדריך ל-Giacomini–White עוסק בהשוואה מותנית. origins חוזרים, חלונות אירוע חופפים וחיפוש מודלים עלולים ליצור תלות או בחירה בין ההפרשים; standard error נאיבי או p-value יחיד ללא תיקון עשויים להציג את הראיות כחזקות מדי.

קבעו את האירוע, horizon, sample, score ראשי, benchmark וכיוון ההשוואה לפני עיון בתוצאות. דווחו את ממוצעי Brier ו-log loss, גדלי המדגם, הגדרות המודל וה-reference, כלל ה-clipping וכל התאמה לתלות או לחיפוש. reliability plot והפרשי scores מזווגים לצד הנתון המצטבר עוזרים להסביר מה השתנה. שיטות forecast combination יכולות לשלב תחזיות, אך גם את השילוב הסופי צריך להעריך על תקופה שלא שימשה לבחירתו.

ל-scores אין יחידות משותפות. הפרש Brier של 0.01 אינו שקול ישירות להפרש log loss של 0.01. score נמוך יותר גם אינו מוכיח שמודל ההסתברות הבסיסי נכון; הוא מהווה ראיה לגבי התחזיות שנבדקו מול התוצאות שהוגדרו.

הפרידו בין איכות התחזית לרווחיות של trading

הסתברות יכולה לתמוך בהחלטת trading רק דרך כלל שממיר אותה לפעולה. ההחלטה תלויה גם בגודל ה-payoff, בהפסד במקרה של טעות, במחירי הביצוע, ב-spreads, בעמלות, ב-slippage, ב-funding, בעלויות borrow, במגבלות ההון ובזמן שבו אפשר לסחור על בסיס התחזית. Proper score מעריך תחזית הסתברותית; הוא אינו כולל עלויות אלה ואינו בוחר גודל פוזיציה.

מודל יכול לשפר את ממוצע log loss בלי לשפר כלל trading מסוים, כי הכלל עשוי לסחור רק בטווח הסתברויות אחד או להגיב ל-horizon אחר. מנגד, אות החלטה מועיל יכול להיות מרוכז בתת-קבוצה קטנה ולכן לתרום מעט ל-score הכולל. לאחר הערכת התחזית, בדקו בנפרד את כלל ההחלטה שנקבע מראש בתאריכים שלא שימשו לבחירתו, תוך שימוש ב-net returns מציאותיים ובאומדני uncertainty.

דוח מספק מאפשר לחוקר אחר לשחזר את האירוע, ההסתברות, התוצאה, נוסחת ה-score והמוסכמה, ה-reference, המדגם ועיתוי ההערכה. יש לציין אם ההסתברויות הן out-of-sample, אם התוצאות חופפות, כיצד טופלו מקרים חסרים וכמה מודלים חלופיים או בחירות score נוסו. כך נשמר הערך של score התחזית בלי להפוך אותו לטענה על רווחים עתידיים.

שאלות נפוצות

Q1האם Brier score נמוך יותר תמיד עדיף?

הוא עדיף כאשר הגדרת האירוע, המדגם, מוסכמת ה-scoring וקידוד התוצאה זהים. Scores מאירועים או ממוסכמות מרובות קטגוריות שונות עשויים שלא להיות בני השוואה ישירה.

Q2האם Brier score טוב מוכיח שההסתברויות מכוילות?

לא. Brier score מצרפי משלב reliability, resolution ו-uncertainty של האירוע. בדקו גם אבחוני כיול ואי-ודאות של המדגם.

Q3האם כדאי להשתמש ב-Brier score או ב-log loss?

בחרו לפני הערכת התוצאות. Brier loss חסום ומשתמש בריבוע שגיאת ההסתברות; log loss מעניש ביתר חומרה הסתברויות שגויות שנמסרו בביטחון. הבחירה תלויה בהשלכות המשימה וברגישות הרצויה.

Q4האם score הסתברותי טוב יותר אומר שאסטרטגיית trading רווחית?

לא. score מעריך תחזיות, לא החלטות לאחר הבאה בחשבון של payoffs, עלויות ביצוע, מימון, גודל פוזיציה ובחירת מודל. מחקרי מקור - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)

מקורות וקריאה נוספת

דיווח על בעיה

נכין אימייל עם קישור למאמר הזה. Mark יקבל את הדיווח רק לאחר שתשלחו אותו

בדיקה מהירה

סיימת לקרוא? בדוק את עצמך ב־3 שאלות

שאלה 1 / 3

שאלה 01

אירוע בינארי התרחש לאחר תחזית של 70%. מהו Brier loss לפי מוסכמת האירוע היחיד?

בחר תשובה כדי לראות את ההסבר

מילון מונחי אופציות

הערכת תחזיותרגרסיית Mincer–Zarnowitz: בדיקת הטיית תחזית וכיולכך רגרסיית Mincer–Zarnowitz בודקת את החותך ואת קנה המידה של תחזית, מדוע שגיאה ממוצעת אפס אינה מעידה על כיול, ומה הבדיקה אינה מוכיחההשוואת דיוק תחזיותמבחן Diebold–Mariano: איך להשוות בין דיוק תחזיותלמדו כיצד מבחן Diebold–Mariano משווה הפסדי תחזית מזווגים, מטפל באופקי תחזית חופפים, ומדוע ערך p נמוך אינו הוכחה למיומנות מסחר.הערכת תחזיותמבחן ג'יאקומיני–וייט: דיוק תחזית מותנהלמדו כיצד מבחן ג'יאקומיני–וייט בודק אם דיוק התחזית משתנה לפי תנאים ידועים, כיצד לבחור מכשירים ומה אפשר להסיק מהתוצאההשוואת מודלי תחזיתModel Confidence Set (MCS): השוואת תחזיות בלי לכפות מודל מנצחלמדו כיצד Model Confidence Set משתמש במבחנים סדרתיים וב-bootstrap ששומר על תלות בזמן כדי להשאיר מודלי תחזית שהנתונים אינם מאפשרים להבחין ביניהם.יסודות האופציותמה המשמעות של בתוך הכסף, בכסף ומחוץ לכסף?למדו כיצד התוויות בתוך הכסף, בכסף ומחוץ לכסף פועלות בקולים ובפוטים, בעזרת דוגמאות לשווי פנימי ולנקודת איזון