সম্ভাব্যতা পূর্বাভাসে Brier Score বনাম Log Loss
দ্বিমাত্রিক সম্ভাব্যতা পূর্বাভাসে Brier score ও log loss তুলনা, হাতে হিসাব, proper scoring, calibration এবং forecast skill বুঝুন
এই গাইডেHit rate পূর্বাভাসের সম্ভাবনাকে উপেক্ষা করে
সংক্ষিপ্ত সারাংশ
সম্ভাব্যতা পূর্বাভাস শুধু কোন ফলটি বেশি সম্ভাব্য তা নয়, কোনো ঘটনা ঘটার সম্ভাবনাও জানায়। Brier score ও log loss সেই সম্ভাবনাকে পরে নির্ধারিত ফলের সঙ্গে তুলনা করে। দুটিই proper scoring rule, তবে ভুলকে ভিন্নভাবে শাস্তি দেয়। তাই কম score অর্থবহ হয় কেবল ঘটনা, sample, score convention এবং reference আগে স্থির থাকলে।
Hit rate পূর্বাভাসের সম্ভাবনাকে উপেক্ষা করে
ধরা যাক, কোনো মডেল “দাম বাড়বে” বা “কমবে” ঠিক বলেছে কি না আপনি গুনছেন। hit rate সঠিক 51% পূর্বাভাস আর সঠিক 99% পূর্বাভাসকে একই ধরে। একইভাবে 49% আর 1% পূর্বাভাস—দুটিই ভুল হলে—একই গণ্য হয়। এতে পূর্বাভাসের আত্মবিশ্বাসের তথ্য হারায়, যদিও সিদ্ধান্তের payoff বা ঝুঁকি ভেদে সেটি গুরুত্বপূর্ণ হতে পারে।
একটি binary probability forecast নির্দিষ্ট ঘটনা \(t\) সময়ে পূর্বাভাসের উৎসে \(p_t\) মান দেয়, যেখানে মান শূন্য থেকে একের মধ্যে। ঘটনা ঘটলে পরের ফল \(y_t=1\), না ঘটলে \(y_t=0\)। Scoring rule পূর্বাভাস ও ফল একসঙ্গে মূল্যায়ন করে। Brier score সম্ভাব্যতার squared error ব্যবহার করে; log loss ঘটে যাওয়া ফলটিকে দেওয়া সম্ভাব্যতার negative logarithm ব্যবহার করে।
Trading model-এর event probability-সহ সম্ভাব্যতা পূর্বাভাস তুলনায় এই score-গুলো কাজে লাগে। কিন্তু এগুলো নিজেরা প্রমাণ করে না যে পূর্বাভাস calibrated, যুক্তিসঙ্গত reference-এর চেয়ে ভালো, বা সেটি দিয়ে trade করলে লাভ হবে। Mincer–Zarnowitz নির্দেশিকা সংখ্যাগত point forecast-এর জন্য ভিন্ন একটি linear calibration regression ব্যাখ্যা করে।
একটি ঘটনা নির্ধারণ করে প্রতিটি পূর্বাভাসকে তার ফলের সঙ্গে মেলান
Score করার আগে ঘটনাটি এমনভাবে নির্দিষ্ট করুন যাতে ফল ধারাবাহিকভাবে নির্ধারণ করা যায়। “সম্পদের দাম বাড়বে কি?”—এ প্রশ্নে সম্পদ, price source, শুরুর ও শেষের সময়, currency, return convention এবং অনুপস্থিত বা সংশোধিত record-এর নিয়ম না থাকলে সংজ্ঞা অসম্পূর্ণ। অর্থনৈতিক ঘটনার ক্ষেত্রে ফল নির্ধারণে ব্যবহৃত release ও data vintage লিখে রাখুন। ভিন্ন event definition বা তারিখে score করা পূর্বাভাস তুলনা করবেন না।
প্রতিটি পূর্বাভাস তার প্রকাশের সময় যেমন ছিল তেমন সংরক্ষণ করুন। সময় \(t\)-তে প্রকাশিত probability-তে নির্দিষ্ট cutoff পর্যন্ত পাওয়া তথ্যই থাকতে হবে এবং সেটিকে একই horizon-এর outcome-এর সঙ্গে মেলাতে হবে। পরে সংশোধিত data series, পরের exchange close বা ফল দেখার পর বাছা classification rule লক্ষ্যবস্তুকে নিঃশব্দে বদলাতে পারে বা look-ahead তথ্য ঢোকাতে পারে।
Rolling forecast-এর ক্ষেত্রে model version, input data vintage, timestamp, probability এবং outcome resolution rule রাখুন। মডেল তুলনায় একই forecast origins ব্যবহার করুন। কোনো probability না থাকলে exclusion লিখে রাখুন এবং সব candidate-এ একই sample rule লাগান। এতে পরিবর্তনশীল spreadsheet-এর সারাংশের বদলে score পুনরুৎপাদন করা যায়।
Squared probability error থেকে Brier score হিসাব করুন
একটি binary event-এর জন্য \(t\) কেসে Brier loss:
BSₜ = (pₜ − yₜ)²
\(n\)টি forecast-এর গড় Brier score:
BS = (1/n) Σₜ (pₜ − yₜ)²
কম score ভালো; শূন্য নিখুঁত, এবং এই single-event convention-এ score শূন্য থেকে এক পর্যন্ত। যেমন, forecast \(p=0.70\) হলে এবং ঘটনা ঘটলে loss \((0.70-1)^2=0.09\)। একই forecast-এর পর ঘটনা না ঘটলে loss \((0.70-0)^2=0.49\)। অতিরিক্ত আত্মবিশ্বাসী ভুলের খরচ বেশি, তবে penalty সীমাবদ্ধ থাকে।
প্রকাশিত সংখ্যা তুলনার আগে formula পরীক্ষা করুন। কিছু convention multi-outcome forecast-এর প্রতিটি category-তে squared error যোগ করে; binary category-vector sum উপরের single-event loss-এর দ্বিগুণ হতে পারে। একই event-এ প্রতিটি score দুই দিয়ে গুণ করলে ranking বদলায় না, কিন্তু convention না জানলে সংখ্যাগত মান সরাসরি তুলনীয় নয়।
Log loss হিসাব করে চরম ভুলের প্রভাব দেখুন
একটি binary event-এর log loss:
LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]
ঘটনা ঘটলে loss \(-\log(p_t)\); না ঘটলে \(-\log(1-p_t)\)। তাই সঠিক 70% forecast-এর loss \(-\log(0.70)\approx0.357\), আর একই 70% forecast ভুল হলে loss \(-\log(0.30)\approx1.204\)। গড় log loss কেসভিত্তিক penalty গড় করে; ঘটে যাওয়া event-কে forecast যত ক্ষুদ্র probability দেয়, score-এর কোনো নির্দিষ্ট ঊর্ধ্বসীমা থাকে না।
\(p=0\) বা \(p=1\) হলে আত্মবিশ্বাসী ভুল forecast-এর log loss অসীম। অসীম এড়াতে software যদি probability-কে ε-এর মতো ছোট floor-এ clip করে, floor প্রকাশ করুন এবং outcome দেখার আগেই সব ক্ষেত্রে একইভাবে প্রয়োগ করুন। Clipping সংখ্যাগত evaluation rule বদলায়; একে data-cleaning-এর আড়ালে রাখা উচিত নয়।
ভিন্ন penalty curve হওয়ায় Brier score ও log loss একই forecast-কে ভিন্নভাবে rank করতে পারে। ঘটেছে এমন event-কে প্রায় শূন্য probability দিলে log loss বিশেষভাবে বড় penalty দেয়; binary Brier case-এর সর্বোচ্চ loss এক। আগে থেকেই কোন score ব্যবহার করবেন ঠিক করুন। সিদ্ধান্ত যদি extreme probability-র ওপর নির্ভর করে, পরে পছন্দমতো ফল বেছে না নিয়ে দুটোই দেখান।
<!-- learn:illustration -->

Proper scoring প্রত্যাশায় সৎ probability-কে পুরস্কৃত করে
কোনো score proper যখন forecaster তার বিশ্বাস করা probability জানিয়ে প্রত্যাশিত reward সর্বাধিক বা প্রত্যাশিত loss সর্বনিম্ন করেন। Strictly proper হলে সেই সত্যনিষ্ঠ probability-ই একমাত্র সেরা পছন্দ। প্রচলিত সংজ্ঞায় Brier ও logarithmic score binary probability forecast-এর জন্য strictly proper (Gneiting and Raftery, 2007)। তাই probability-কে আগে hard label-এ না বদলে সরাসরি মূল্যায়ন করার যুক্তি আছে।
“Proper” একটি expected-loss বৈশিষ্ট্য; প্রতিটি realized sample-এর নিশ্চয়তা নয়। সত্যিকার 70% probability জানিয়েও forecaster একটি কেসে ভুল হতে পারেন, এবং ছোট finite sample-এ তাঁর score অনুমাননির্ভর কারও চেয়ে খারাপ হতে পারে। গড় performance বোঝার জন্য পুনরাবৃত্ত ও তুলনাযোগ্য forecast দরকার। Incentive-ও গুরুত্বপূর্ণ: কারও আলাদা payoff rule থাকলে score একাই নিশ্চিত করে না যে জানানো probability তার বিশ্বাসকে প্রতিফলিত করছে।
কোনো score-ই একা calibration মাপে না। Aggregate score-এ probability observed frequency-এর কত কাছে তা এবং ভিন্ন outcome-এ শেষ হওয়া কেস আলাদা করার ক্ষমতা—দুটিই মিশতে পারে। মডেল ধারালো forecast দিলেও systematic miscalibration থাকতে পারে; সবসময় base rate জানানো মডেল aggregate-এ calibrated হলেও প্রতিটি কেস সম্পর্কে সামান্য তথ্য দিতে পারে।
Brier decomposition-এ reliability, resolution ও uncertainty পড়ুন
Murphy decomposition গড় Brier score-কে তিনটি অংশে ভাগ করে (Murphy, 1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)):
BS = reliability − resolution + uncertainty
একই রকম probability-র forecast-গুলোকে \(k\) group-এ ধরুন। প্রতিটি group-এর sample share \(w_k\), গড় forecast probability ̅pₖ, observed event frequency ̅yₖ এবং overall event frequency ̅y। তখন binned component-গুলো:
reliability = Σₖ wₖ(̅pₖ − ̅yₖ)² resolution = Σₖ wₖ(̅yₖ − ̅y)² uncertainty = ̅y(1 − ̅y)
Reliability error কম হলে ভালো: group-এর forecast probability যেন group-এর observed frequency-এর সঙ্গে মেলে। Resolution বেশি হলে ভালো: group-গুলোর event frequency যেন সামগ্রিক base rate থেকে আলাদা হয়। Uncertainty sample-এ event কতবার ঘটে তা ধরে; এটি forecast model-এর কৃতিত্ব নয়। দুই মডেলের Brier score সমান হলেও তাদের শক্তি ভিন্ন হতে পারে—decomposition তা দেখায়।
Empirical decomposition নির্ভুল হয় যখন একই issued probability-র কেসগুলো এক group-এ থাকে। Continuous probability-কে bin-এ ভাগ করলে decomposition bin-এ coarsen করা forecast-এর জন্য নির্ভুল, কিন্তু মূল probability-গুলোর মধ্যে হারিয়ে যাওয়া পার্থক্যের জন্য নয়। Continuous probability group করতে bin boundary বেছে নিতে হয়। দশটি সমান-প্রস্থের bin-এর reliability diagram quantile bin-এর চেয়ে ভিন্ন চিত্র দিতে পারে, বিশেষ করে ছোট sample বা extreme probability-তে। প্রতিটি bin-এর count ও অনিশ্চয়তা দেখান; binned decomposition-কে diagnostic হিসেবে নিন, sampling error মুছে ফেলার উপায় হিসেবে নয়। Calibration plot ভবিষ্যৎ reliability-র স্বাধীন প্রমাণ নয়।
Score-কে skill বলার আগে reference বেছে নিন
অন্য model-এর চেয়ে raw score কম হওয়া তুলনা; উপযোগী baseline-এর তুলনায় উন্নতি বলা এখনও নয়। Brier skill score forecast system-কে নামে নির্দিষ্ট reference forecast-এর সঙ্গে তুলনা করে:
BSS = 1 − BS_model / BS_reference
শূন্য মান reference-এর সমান, ধনাত্মক মান উন্নতি এবং ঋণাত্মক মান এই convention-এ খারাপ ফল। Reference score ধনাত্মক হলে model-এর Brier loss শূন্য হওয়ার অর্থ BSS এক। সিদ্ধান্ত ও information set-এর সঙ্গে মানানসই reference বেছে নিন। কাজভেদে স্থির historical base rate, training-window event frequency বা বিদ্যমান forecast procedure যুক্তিসঙ্গত হতে পারে।
Forecast দেওয়ার সময় যে evaluation outcome জানা যেত না, তা দিয়ে reference হিসাব করবেন না। Time series-এ expanding বা rolling historical frequency full-sample event rate-এর চেয়ে কার্যকর operational baseline হতে পারে। Reference score শূন্য হলে ratio অনির্ধারিত; benchmark কীভাবে তৈরি হয়েছে বলুন এবং BSS-এর সঙ্গে model ও reference-এর raw score-ও দিন।
Brier skill score reference ও event frequency-র ওপর নির্ভর করে। Unconditional base-rate forecast-এর সঙ্গে score বর্তমান production model-এর তুলনার চেয়ে ভিন্ন প্রশ্নের উত্তর দেয়। Event definition, reference forecast, sample period এবং binary বা multicategory convention না মিলিয়ে গবেষণার BSS তুলনা করবেন না।
Paired out-of-sample outcome-এ মডেল তুলনা করুন
সময়ের ক্রমে probability তৈরি করুন এবং model tune, feature বাছাই বা threshold নির্ধারণে ব্যবহার হয়নি—এমন evaluation period রাখুন। প্রতিটি model-কে একই resolved outcome ও forecast origin-এ score করুন। নির্বাচিত loss-এর জন্য paired difference:
dₜ = Lₐ,ₜ − Lᵦ,ₜ
এই sign convention-এ গড় positive হলে model B-এর average loss কম। Forecast comparison-এর assumptions ও variance estimate নকশার সঙ্গে মানালে Diebold–Mariano framework average loss difference পরীক্ষা করতে পারে। Forecast time-এ জানা condition অনুযায়ী relative score বদলায় কি না জানতে Giacomini–White নির্দেশিকা conditional comparison ব্যাখ্যা করে। Repeated origin, overlapping event window ও model search difference-কে dependent বা selected করতে পারে; naive standard error বা একটিমাত্র uncorrected p-value প্রমাণকে বাড়িয়ে দেখাতে পারে।
ফল দেখার আগে event, horizon, sample, primary score, benchmark ও comparison direction ঠিক করুন। গড় Brier ও log loss, sample size, model/reference definition, probability clipping rule, dependence বা search adjustment রিপোর্ট করুন। Aggregate-এর পাশে reliability plot ও paired score difference দেখালে পরিবর্তন ব্যাখ্যা করা সহজ হয়। Forecast combination পদ্ধতি forecast একত্র করতে পারে, তবে চূড়ান্ত combination-ও সেটি বাছতে ব্যবহার না করা সময়ে evaluate করতে হবে।
Score-গুলো একই unit-এ নেই। Brier difference 0.01 আর log-loss difference 0.01 সরাসরি সমান মাত্রার নয়। কম score underlying probability model সঠিক প্রমাণ করে না; নির্দিষ্ট outcome-এ evaluate করা forecast সম্পর্কে এটি evidence।
Forecast quality-কে trading profitability থেকে আলাদা রাখুন
কোনো probability trading decision-কে সাহায্য করে তখনই, যখন একটি rule সেটিকে action-এ রূপ দেয়। সিদ্ধান্ত নির্ভর করে payoff size, ভুল হলে loss, execution price, spread, commission, slippage, funding, borrow, capital limit এবং forecast tradeable হওয়ার সময়ের ওপরও। Proper score probability forecast মূল্যায়ন করে; এই খরচগুলো ধরে না বা position size বেছে দেয় না।
গড় log loss উন্নত হলেও নির্দিষ্ট trading rule উন্নত নাও হতে পারে; rule শুধু এক probability range-এ trade করতে পারে বা ভিন্ন horizon-এ সাড়া দিতে পারে। উল্টোভাবে, কার্যকর decision signal অল্প কিছু case-এ থাকতে পারে, যা overall score-এ সামান্য অবদান রাখে। Forecast evaluate করার পর আগে নির্ধারিত decision rule-কে সেটি বাছতে ব্যবহার না করা তারিখে আলাদাভাবে মূল্যায়ন করুন; realistic net return ও uncertainty estimate ব্যবহার করুন।
অন্য গবেষক যেন event, probability, outcome, score formula ও convention, reference, sample এবং evaluation timing পুনরুৎপাদন করতে পারেন—এমন রিপোর্ট দিন। Probability out-of-sample কি না, outcome overlap করে কি না, missing case কীভাবে সামলানো হয়েছে এবং কতগুলো alternative model বা score choice চেষ্টা হয়েছে তা লিখুন। এতে forecast score তথ্যবহুল থাকে, ভবিষ্যৎ profit-এর দাবি হয়ে ওঠে না।
সাধারণ প্রশ্ন
Q1Brier score কম হলেই কি সবসময় ভালো?
Event definition, sample, scoring convention এবং outcome coding একই হলে কম ভালো। ভিন্ন event বা multicategory convention-এর score সরাসরি তুলনীয় নাও হতে পারে।
Q2ভালো Brier score কি probability calibration প্রমাণ করে?
না। Aggregate Brier score reliability, resolution ও event uncertainty একসঙ্গে ধরে। Calibration diagnostic এবং sample uncertainty-ও দেখুন।
Q3Brier score নাকি log loss ব্যবহার করব?
ফল মূল্যায়নের আগেই বেছে নিন। Brier loss bounded ও squared probability error-ভিত্তিক; log loss আত্মবিশ্বাসী ভুল probability-কে বেশি শাস্তি দেয়। কাজের পরিণতি ও কাঙ্ক্ষিত sensitivity অনুযায়ী পছন্দ করুন।
Q4ভালো probability score কি trading strategy-কে লাভজনক প্রমাণ করে?
না। Score forecast মূল্যায়ন করে; payoff, execution cost, financing, position sizing ও model selection-পরবর্তী decision নয়। মূল গবেষণা - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)
উৎস ও আরও পড়ুন
সমস্যা জানান
এই নিবন্ধের লিংকসহ একটি ইমেল তৈরি হবে। পাঠানোর পরেই Mark প্রতিবেদনটি পাবে
দ্রুত যাচাই
গাইডটি পড়ার পর 3টি প্রশ্নে নিজেকে যাচাই করুন
প্রশ্ন 01
Binary event ঘটেছে এবং forecast ছিল 70%। Single-event convention-এ Brier loss কত?
ব্যাখ্যা দেখতে একটি উত্তর বেছে নিন