Skip to content
विकल्प और फ्यूचर्स की सभी गाइड
संभाव्यता पूर्वानुमान का मूल्यांकन12 मिनट

संभाव्यता पूर्वानुमानों में Brier score बनाम log loss

द्विआधारी संभावना पूर्वानुमानों के लिए Brier score और log loss की तुलना करें, दोनों की गणना समझें और proper scoring, calibration तथा forecast skill का अर्थ जानें

इस गाइड मेंहिट रेट आपके पूर्वानुमान की संभावना को मिटा देता है

संक्षिप्त सारांश

संभावना पूर्वानुमान बताता है कि कोई घटना कितनी संभावित है, केवल यह नहीं कि कौन-सा परिणाम अधिक संभावित है। Brier score और log loss इन संभावनाओं की तुलना तय हो चुके परिणामों से करते हैं। दोनों proper scoring rules हैं, लेकिन गलतियों पर इनका दंड अलग होता है। इसलिए कम score तभी अर्थपूर्ण है जब घटना, नमूना, score की परंपरा और संदर्भ पहले से तय हों।

हिट रेट आपके पूर्वानुमान की संभावना को मिटा देता है

मान लें कि आप दर्ज करते हैं कि मॉडल ने “ऊपर” या “नीचे” सही बताया या नहीं। हिट रेट 51% के सही पूर्वानुमान और 99% के सही पूर्वानुमान को समान मानता है। इसी तरह, 49% और 1% के गलत पूर्वानुमान को भी एक जैसा मानता है। इससे व्यक्त किया गया भरोसा खो जाता है, जबकि अलग-अलग भुगतान या जोखिम वाली स्थितियों में वही भरोसा महत्वपूर्ण हो सकता है।

द्विआधारी संभावना पूर्वानुमान, पूर्वानुमान समय \(t\) पर स्पष्ट रूप से परिभाषित घटना के लिए शून्य और एक के बीच मान \(p_t\) देता है। बाद में घटना होने पर \(y_t=1\), और न होने पर \(y_t=0\) दर्ज किया जाता है। Scoring rule पूर्वानुमान और परिणाम का साथ में मूल्यांकन करता है। Brier score संभावना की वर्गित त्रुटि का उपयोग करता है; log loss उस परिणाम को दी गई संभावना का ऋणात्मक लघुगणक लेता है जो वास्तव में हुआ।

ये scores संभावना पूर्वानुमानों की तुलना करने में उपयोगी हैं, जिनमें किसी trading model की घटना-संभावनाएं भी शामिल हैं। अपने आप में ये यह नहीं बताते कि पूर्वानुमान calibrated है, किसी उचित संदर्भ से बेहतर है, या उस पर trading करने से लाभ होगा। Mincer–Zarnowitz मार्गदर्शिका संख्यात्मक point forecasts के लिए एक अलग linear calibration regression समझाती है।

एक घटना परिभाषित करें और हर पूर्वानुमान को उसके परिणाम से जोड़ें

Score निकालने से पहले घटना को इस तरह परिभाषित करें कि उसका परिणाम लगातार एक ही नियम से तय हो सके। “क्या asset ऊपर जाएगा?” अधूरा है, जब तक asset, price source, आरंभ और समाप्ति समय, मुद्रा, return convention और गायब या संशोधित रिकॉर्ड के नियम तय न हों। आर्थिक घटना के लिए परिणाम तय करने वाली release और data vintage दर्ज करें। अलग परिभाषाओं या तारीखों के समूहों पर score किए गए पूर्वानुमानों की तुलना न करें।

हर पूर्वानुमान को उसी रूप में सुरक्षित रखें जिस रूप में वह अपने origin पर उपलब्ध था। समय \(t\) पर जारी संभावना को बताई गई cutoff तक उपलब्ध जानकारी ही उपयोग करनी चाहिए और उसी horizon के परिणाम से जोड़ा जाना चाहिए। संशोधित data series, बाद का exchange close या परिणाम देखने के बाद चुना गया वर्गीकरण नियम चुपचाप target बदल सकता है या look-ahead information ला सकता है।

Rolling forecasts के लिए model version, input data vintage, timestamp, probability और resolution rule सुरक्षित रखें। Models की तुलना में समान origins का उपयोग करें। यदि probability गायब हो, तो उसे हटाने का कारण दर्ज करें और हर candidate पर समान sample rule लागू करें। इन रिकॉर्ड से score बदलती spreadsheet का सारांश भर नहीं, बल्कि दोहराया जा सकने वाला परिणाम बनता है।

संभावना की वर्गित त्रुटियों से Brier score निकालें

एक द्विआधारी घटना के लिए, केस \(t\) का Brier loss है:

BSₜ = (pₜ − yₜ)²

\(n\) पूर्वानुमानों का औसत Brier score है:

BS = (1/n) Σₜ (pₜ − yₜ)²

कम बेहतर है, शून्य पूर्ण है, और एकल-घटना वाली यह परंपरा शून्य से एक तक रहती है। उदाहरण के लिए, अगर पूर्वानुमान \(p=0.70\) है और घटना होती है, तो loss \((0.70-1)^2=0.09\) है। उसी पूर्वानुमान के बाद घटना न हो, तो loss \((0.70-0)^2=0.49\) है। बहुत भरोसे के साथ की गई चूक की कीमत अधिक होती है, लेकिन दंड सीमित रहता है।

प्रकाशित संख्याओं की तुलना करते समय सूत्र जांचें। कुछ परंपराएं बहु-परिणाम वाले पूर्वानुमान की हर category की वर्गित त्रुटि जोड़ती हैं; द्विआधारी vector sum ऊपर दिए एकल-घटना loss से दोगुना हो सकता है। एक ही घटना के भीतर हर score को दो से गुणा करने पर ranking नहीं बदलती, लेकिन scale बताए बिना अलग परंपराओं के संख्यात्मक स्तर तुलनीय नहीं होते।

Log loss निकालें और देखें कि चरम गलतियों का दंड क्यों बड़ा है

द्विआधारी घटना के लिए log loss है:

LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]

घटना होने पर loss \(-\log(p_t)\) है; न होने पर \(-\log(1-p_t)\)। इसलिए सही 70% पूर्वानुमान का loss \(-\log(0.70)\approx0.357\) है, जबकि वही 70% पूर्वानुमान गलत होने पर \(-\log(0.30)\approx1.204\) देता है। औसत log loss इन प्रति-केस दंडों का औसत है और जब पूर्वानुमान हुई घटना को लगभग शून्य संभावना देता है, तो इसकी कोई तय ऊपरी सीमा नहीं होती।

\(p=0\) या \(p=1\) पर, पूरे भरोसे के साथ दिया गया गलत पूर्वानुमान अनंत log loss देता है। यदि software अनंत से बचने के लिए संभावनाओं को \(\varepsilon\) जैसे छोटे न्यूनतम मान पर clip करता है, तो उस सीमा को रिपोर्ट करें और परिणाम देखने से पहले उसे समान रूप से लागू करें। Clipping संख्यात्मक मूल्यांकन नियम को बदलता है; इसे data-cleaning का छिपा हुआ विवरण न मानें।

Brier score और log loss एक ही पूर्वानुमानों को अलग क्रम में रख सकते हैं क्योंकि इनके दंड-वक्र अलग हैं। Log loss हुई घटना को लगभग शून्य संभावना देने पर बहुत बड़ा दंड लगाता है; binary Brier loss अधिकतम एक है। पहले से तय करें कि कौन-सा score उपयोग करेंगे। यदि निर्णय चरम संभावनाओं पर निर्भर हैं, तो बाद में बेहतर दिखने वाला परिणाम चुनने के बजाय दोनों दिखाने पर विचार करें।

<!-- learn:illustration -->

नीली काँच की बूँदों के सामने अंबर पत्थर संभावित नतीजे दिखाते हैं; एक बहुत भरोसेमंद पूर्वानुमान हुए नतीजे से दूर है
संभावनाओं और वास्तविक नतीजों का वैचारिक चित्र, जहाँ पक्के भरोसे वाली गलती पर अधिक दंड दिखता है; बाजार आँकड़े, परीक्षण परिणाम या ट्रेडिंग संकेत नहीं

Proper scoring अपेक्षा में ईमानदार संभावनाओं को पुरस्कृत करता है

कोई score proper है यदि पूर्वानुमानकर्ता वही संभावना बताकर अपेक्षित reward अधिकतम या अपेक्षित loss न्यूनतम करता है जिस पर वह वास्तव में विश्वास करता है। यदि वही सच्ची संभावना एकमात्र optimum हो, तो score strictly proper है। सामान्य परिभाषाओं में Brier और logarithmic scores द्विआधारी संभावना पूर्वानुमानों के लिए strictly proper हैं (Gneiting और Raftery, 2007)। इसलिए probabilities को पहले कठोर labels में बदलने के बजाय उनका मूल्यांकन करने का एक सिद्धांतगत आधार मिलता है।

“Proper” होना अपेक्षा का गुण है, हर देखे गए sample का वादा नहीं। 70% की ईमानदार संभावना बताने वाला व्यक्ति एक मामले में गलत हो सकता है और उसका finite-sample score अनुमान लगाने वाले से खराब हो सकता है। औसत प्रदर्शन सीखने के लिए बार-बार किए गए तुलनीय पूर्वानुमान चाहिए। Incentives भी मायने रखते हैं: अलग payoff rule का सामना करने पर केवल score इस बात की गारंटी नहीं देता कि बताई गई संभावना व्यक्ति के विश्वास को दर्शाती है।

इनमें से कोई score केवल calibration नहीं मापता। Aggregate score में देखी गई frequencies से probabilities की निकटता और अलग-अलग परिणाम वाले मामलों को अलग करने की क्षमता, दोनों शामिल हो सकती हैं। Model स्पष्ट रूप से अलग-अलग forecasts दे सकता है और फिर भी व्यवस्थित रूप से miscalibrated हो सकता है; हमेशा base rate देने वाला model aggregate में calibrated हो सकता है, लेकिन हर मामले की बहुत कम जानकारी देता है।

Brier decomposition को reliability, resolution और uncertainty के रूप में पढ़ें

Murphy decomposition औसत Brier score को तीन terms में बांटती है (Murphy, 1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)):

BS = reliability − resolution + uncertainty

मिलती-जुलती probabilities वाले forecast groups \(k\) के लिए, \(w_k\) हर group का sample share, \(\bar p_k\) औसत forecast probability, \(\bar y_k\) देखी गई event frequency और \(\bar y\) कुल event frequency है। तब binned components हैं:

reliability = Σₖ wₖ(̅pₖ − ̅yₖ)² resolution = Σₖ wₖ(̅yₖ − ̅y)² uncertainty = ̅y(1 − ̅y)

कम reliability error बेहतर है: एक group के भीतर forecasts को उस group की observed frequency से मेल खाना चाहिए। अधिक resolution बेहतर है: groups की event frequencies समग्र base rate से अलग होनी चाहिए। Uncertainty sample में घटना कितनी बार होती है, यह दर्शाती है; यह forecasting model की उपलब्धि नहीं है। Decomposition बताती है कि दो models का Brier score समान होने पर भी उनकी खूबियां अलग क्यों हो सकती हैं।

समान जारी की गई probability वाले मामलों को group करने पर empirical decomposition exact होती है। Continuous probabilities को intervals में रखने पर decomposition grouped forecast के लिए exact है, उन मूल probabilities के अंतर के लिए नहीं जो interval के भीतर खो जाते हैं। Grouping में bin चुनना पड़ता है। दस समान-चौड़ाई वाले bins का reliability diagram quantile bins से अलग कहानी दिखा सकता है, खासकर छोटे sample या probability extremes के पास। हर bin के मामले और uncertainty दिखाएं और decomposition को diagnostic मानें, sampling error मिटाने का तरीका नहीं। Calibration plots को भविष्य की reliability का स्वतंत्र प्रमाण न मानें।

Score को skill कहने से पहले एक reference चुनें

दूसरे model से कम raw score एक तुलना है; यह उपयोगी baseline से सुधार का कथन अभी नहीं है। Brier skill score एक forecast system की तुलना नामित reference forecast से करता है:

BSS = 1 − BS_model / BS_reference

इस परिभाषा के तहत शून्य reference के बराबर है, धनात्मक मान सुधार और ऋणात्मक मान खराब नतीजा दिखाता है। Reference loss धनात्मक होने पर model का Brier loss शून्य हो तो score एक है। Decision और information set के अनुसार reference चुनें। अलग कार्यों में स्थिर ऐतिहासिक base rate, training window की event frequency या मौजूदा forecast procedure उपयुक्त हो सकते हैं।

यदि भविष्य के evaluation outcomes forecast बनाते समय उपलब्ध नहीं थे, तो उन्हें reference निकालने के लिए उपयोग न करें। Time series में पूरे sample की event rate के बजाय बढ़ती हुई या rolling historical frequency एक साफ operational baseline हो सकती है। Reference score शून्य होने पर ratio परिभाषित नहीं है; benchmark कैसे बना, यह बताएं और model तथा reference के raw scores भी दें।

Brier skill score reference और event frequency पर निर्भर करता है। Unconditional base-rate forecast के मुकाबले score, मौजूदा production model के मुकाबले score से अलग प्रश्न का उत्तर देता है। Studies के BSS की तुलना करने से पहले event definitions, reference forecasts, sample periods और binary या multicategory conventions जांचें।

समान, out-of-sample परिणामों पर models की तुलना करें

Probabilities को समयक्रम में बनाएं और ऐसा evaluation period अलग रखें जिसका उपयोग model tune करने, features चुनने या threshold तय करने में न हुआ हो। हर model को उन्हीं resolved outcomes और origins पर score करें। चुने हुए loss के लिए paired difference परिभाषित करें:

dₜ = Lₐ,ₜ − Lᵦ,ₜ

इस sign convention में औसत धनात्मक होने का मतलब है कि model B का औसत loss कम था। Diebold–Mariano framework औसत loss अंतर की जांच कर सकता है, यदि उसके forecast-comparison assumptions और variance estimate इस design के अनुकूल हों। यदि प्रश्न यह है कि forecast के समय ज्ञात परिस्थितियों के साथ relative score बदलता है या नहीं, तो Giacomini–White मार्गदर्शिका उस conditional comparison को समझाती है। दोहराए गए origins, overlapping event windows और model search से अंतर dependent या चयनित हो सकते हैं; naive standard error या बिना adjustment का एक p-value साक्ष्य को बढ़ा-चढ़ाकर दिखा सकता है।

परिणाम देखने से पहले event, horizon, sample, primary score, benchmark और comparison direction तय करें। औसत Brier और log losses, sample sizes, model व reference की परिभाषाएं, probability clipping rule और dependence या search के लिए कोई adjustment रिपोर्ट करें। Aggregate के साथ reliability plot और paired score differences दिखाने से बदलाव समझने में मदद मिलती है। Forecast combination के तरीके forecasts को जोड़ सकते हैं, लेकिन अंतिम combination को भी ऐसे untouched evaluation की जरूरत है जिसका उपयोग उसे चुनने में नहीं हुआ।

Scores की units समान नहीं हैं। 0.01 का Brier अंतर सीधे 0.01 के log-loss अंतर के बराबर नहीं है। कम score यह भी साबित नहीं करता कि underlying probability model सही है; यह बताए गए outcomes पर evaluated forecasts के बारे में साक्ष्य है।

Forecast quality को trading profitability से अलग रखें

Probability किसी trading decision में तभी मदद करती है जब कोई rule उसे action में बदलता है। निर्णय payoff के आकार, गलत होने पर नुकसान, execution prices, spreads, commissions, slippage, funding, borrow, capital limits और उस समय पर भी निर्भर है जब forecast पर trade किया जा सकता है। Proper score probability forecast का मूल्यांकन करता है; इसमें ये costs शामिल नहीं होते और यह position size नहीं चुनता।

औसत log loss बेहतर होने पर भी कोई model खास trading rule को बेहतर न करे, क्योंकि वह rule केवल कुछ probability range में trade कर सकता है या दूसरे horizon पर निर्भर हो सकता है। इसके उलट, उपयोगी decision signal कुछ ही मामलों में केंद्रित हो सकता है और overall score में उसका योगदान कम हो। Forecast का मूल्यांकन करने के बाद pre-specified decision rule को अलग से उन तारीखों पर परखें जिनका उपयोग उसे चुनने में नहीं हुआ, और realistic net returns तथा uncertainty estimates का उपयोग करें।

एक पर्याप्त report से दूसरा researcher event, probability, outcome, score formula व convention, reference, sample और evaluation timing को दोहरा सके। बताएं कि probabilities out-of-sample हैं या नहीं, outcomes overlap करते हैं या नहीं, missing cases कैसे संभाले गए और कितने वैकल्पिक models या scoring choices आजमाए गए। यह अनुशासन score को उपयोगी रखता है और उसे भविष्य के profit के दावे में नहीं बदलता।

आम सवाल

Q1क्या कम Brier score हमेशा बेहतर होता है?

जब event definition, sample, scoring convention और outcome coding समान हों, तब कम बेहतर है। अलग events या multicategory conventions के scores सीधे तुलनीय नहीं हो सकते।

Q2क्या अच्छा Brier score साबित करता है कि probabilities calibrated हैं?

नहीं। Aggregate Brier score reliability, resolution और event uncertainty को जोड़ता है। Calibration diagnostics और sample uncertainty भी देखें।

Q3Brier score इस्तेमाल करूं या log loss?

Results evaluate करने से पहले चुनें। Brier loss सीमित है और squared probability error उपयोग करता है; log loss भरोसे से गलत बताई गई probabilities को अधिक दंडित करता है। चुनाव task के consequences और इच्छित sensitivity पर निर्भर होना चाहिए।

Q4क्या बेहतर probability score का अर्थ है कि trading strategy लाभदायक है?

नहीं। Score forecasts का मूल्यांकन करता है, payoff, execution costs, financing, position sizing और model selection के बाद के decisions का नहीं। मूल शोध - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)

स्रोत और आगे पढ़ें

समस्या की रिपोर्ट करें

हम इस लेख का लिंक जोड़कर ईमेल तैयार करेंगे। भेजने के बाद ही Mark को आपकी रिपोर्ट मिलेगी

त्वरित जाँच

गाइड पढ़ने के बाद 3 सवालों से खुद को जाँचें

सवाल 1 / 3

सवाल 01

70% forecast के बाद एक द्विआधारी घटना होती है। एकल-घटना convention में उसका Brier loss क्या है?

व्याख्या देखने के लिए एक उत्तर चुनें

विकल्प शब्दावली

पूर्वानुमान मूल्यांकनMincer–Zarnowitz प्रतिगमन: पूर्वानुमान के पक्षपात और कैलिब्रेशन की जाँचजानें कि Mincer–Zarnowitz प्रतिगमन पूर्वानुमान के intercept और scale को कैसे जाँचता है, शून्य औसत त्रुटि कैलिब्रेशन क्यों नहीं है, और यह परीक्षण क्या साबित नहीं करतापूर्वानुमान की सटीकता की तुलनाDiebold–Mariano परीक्षण: दो पूर्वानुमानों की सटीकता कैसे तुलना करेंजानें कि Diebold–Mariano परीक्षण युग्मित पूर्वानुमान-हानियों की तुलना कैसे करता है, अतिव्यापी क्षितिजों को कैसे संभालता है, और कम p-value ट्रेडिंग कौशल का प्रमाण क्यों नहीं है।पूर्वानुमान का मूल्यांकनजियाकोमिनी–व्हाइट परीक्षण: सशर्त पूर्वानुमान सटीकताजानें कि जियाकोमिनी–व्हाइट परीक्षण ज्ञात परिस्थितियों के अनुसार पूर्वानुमान सटीकता में बदलाव कैसे जाँचता है, इंस्ट्रूमेंट कैसे चुनें और नतीजे से क्या निष्कर्ष निकलता हैपूर्वानुमान मॉडल की तुलनाModel Confidence Set (MCS): विजेता चुने बिना पूर्वानुमान मॉडलों की तुलनाजानें कि Model Confidence Set क्रमिक परीक्षणों और निर्भर डेटा के बूटस्ट्रैप से उन पूर्वानुमान मॉडलों को कैसे बनाए रखता है जिनके प्रदर्शन में उपलब्ध साक्ष्य अंतर नहीं कर पाते।ऑप्शन की बुनियादइन द मनी, एट द मनी और आउट द मनी का क्या मतलब है?जानें कि ऑप्शन की स्ट्राइक अंतर्निहित मूल्य से कैसे तुलना करती है और कॉल व पुट में इसका अर्थ क्यों बदलता है