VaR ব্যাকটেস্ট: Kupiec ও Christoffersen পরীক্ষা ব্যাখ্যা
Kupiec POF ও Christoffersen-এর conditional-coverage পরীক্ষা কীভাবে VaR ব্যতিক্রম মূল্যায়ন করে, ২৫০ দিনের উদাহরণ কীভাবে পড়বেন এবং ফল না-প্রত্যাখ্যান কেন নির্ভুলতার প্রমাণ নয়—জানুন।
এই গাইডেVaR ব্যাকটেস্ট কী যাচাই করে?
সংক্ষিপ্ত সারাংশ
VaR ব্যাকটেস্ট প্রতিটি পূর্বাভাসিত ক্ষতির সীমার সঙ্গে পরে বাস্তবে হওয়া ক্ষতির তুলনা করে। Kupiec পরীক্ষা জিজ্ঞেস করে ব্যতিক্রমের সংখ্যা লক্ষ্য হারের সঙ্গে মেলে কি না। Christoffersen পরীক্ষা ব্যতিক্রমগুলো সময়ে স্বাধীনভাবে আসে, নাকি গুচ্ছ বাঁধে, সেটিও দেখে। দুটো পরীক্ষা পূর্বাভাসের আলাদা বৈশিষ্ট্য যাচাই করে; কোনোটিই ঝুঁকি মডেল সঠিক প্রমাণ করে না।
VaR ব্যাকটেস্ট কী যাচাই করে?
ভ্যালু অ্যাট রিস্ক (VaR) হলো নির্দিষ্ট আস্থার স্তর ও সময়সীমার সঙ্গে যুক্ত একটি ক্ষতি-সীমা। এক দিনের 99% VaR যদি $10,000 হয়, তবে মডেলটি তার ঘোষিত তথ্য ও অনুমানের অধীনে এক দিনের ক্ষতি $10,000 ছাড়ানোর সম্ভাবনা 1% ধরে। $10,000 ক্ষতির সর্বোচ্চ সীমা নয়; সীমা পেরিয়ে গেলে ক্ষতি কত বড় হতে পারে তাও VaR বলে না।
ব্যাকটেস্টে পূর্বাভাস ও ফলাফলের ধারাকে ব্যতিক্রমের ধারায় রূপান্তর করা হয়। 99% এক-দিনের VaR মডেল যথাযথভাবে ক্যালিব্রেটেড হলে, একই ধরনের পর্যবেক্ষণ বারবার ঘটলে দীর্ঘমেয়াদে প্রায় 1% সময় ব্যতিক্রম হওয়ার কথা। এই বক্তব্যের দুটি দিক আছে: মোট হারটি লক্ষ্যের কাছাকাছি থাকবে, আর ব্যতিক্রমের সময়গত ধরন মডেলের শর্তসাপেক্ষ ঝুঁকি-পূর্বাভাসের সঙ্গে সাংঘর্ষিক হবে না। Kupiec-এর proportion-of-failures (POF) পরীক্ষা প্রথম দিকটি দেখে। Christoffersen-এর independence ও conditional-coverage পরীক্ষা ব্যতিক্রমের ক্রমও বিশ্লেষণে আনে।
বাস্তব কাজে এই পার্থক্য জরুরি। এক মডেলে বছরে চারটি ব্যতিক্রম হতে পারে, কিন্তু চারটিই অস্থির এক সপ্তাহে পরপর ঘটতে পারে। অন্য মডেলে একই চারটি ব্যতিক্রম সারা বছরে ছড়িয়ে থাকতে পারে। শুধু সংখ্যা দেখা পরীক্ষা দুটিকেই চার বলে; সময়ের ধরন দেখা পরীক্ষা দুটি আলাদা hit sequence দেখে। নিচের পরীক্ষাগুলো এই বৈশিষ্ট্য বর্ণনা করতে সাহায্য করে; এগুলো পজিশন, বাজার-ডেটা, অনুমান বা ক্ষতির মাত্রা পর্যালোচনার বিকল্প নয়।
সময়ের সঙ্গে volatility clustering কীভাবে মডেল করা হয়, তা GARCH ও volatility clustering-এর নির্দেশিকায় দেখুন। variance model অস্থিরতা বর্ণনা করে; backtest পূর্বাভাস ও ফলের মিল যাচাই করে।
গোনার আগে ব্যতিক্রমের সংজ্ঞা ঠিক করুন
পুরো বিশ্লেষণে একই sign convention ব্যবহার করুন। t দিনে বাস্তবায়িত ক্ষতি Lₜ এবং t দিনের আগের তথ্য দিয়ে করা এক-দিনের VaR সীমা VaRₜ|ₜ₋₁ ধরা যাক। Lₜ যদি VaRₜ|ₜ₋₁-এর বেশি হয়, তবে exception indicator Iₜ = 1, অন্যথায় Iₜ = 0। মডেলটি 99% VaR হলে লক্ষ্য ব্যতিক্রম-সম্ভাবনা α = 1 − 0.99 = 0.01। কিছু সূত্রে ক্ষতির বদলে return দিয়ে indicator সংজ্ঞায়িত হয়, আবার কিছু সূত্রে covered interval নির্ধারণ করা হয়; sign ও probability অনুবাদ করলে এগুলো একই ধারণা। কোন সংজ্ঞা ব্যবহার করছেন তা বলুন।
পূর্বাভাস ও ফলাফলে একই portfolio, horizon, valuation time এবং ক্ষতির সংজ্ঞা থাকতে হবে। বাজার বন্ধের পর পরের trading day-এর পূর্বাভাস করলে, ধারাবাহিক valuation rule অনুযায়ী সেই দিনের ক্ষতির সঙ্গে তুলনা করুন। VaR সীমার সমান ফলকে কীভাবে ধরবেন, ছুটি, অনুপস্থিত পর্যবেক্ষণ, বাজার বন্ধ, দিনের ভেতরের সংশোধন ও portfolio পরিবর্তনের নিয়ম আগে ঠিক করুন। ব্যতিক্রম বিরল হলে এসব সিদ্ধান্ত hit sequence বদলে দিতে পারে।
মডেল নির্বাচন ও চূড়ান্ত মূল্যায়ন আলাদা রাখুন। পরীক্ষার একই সময়কাল দেখে parameter বা risk threshold বেছে নিলে, p-value আর পরিষ্কার out-of-sample পরীক্ষা বোঝায় না। rolling forecast-এর ক্ষেত্রে প্রতিটি পূর্বাভাস কখন তৈরি হয়েছিল ও তখন কোন তথ্য পাওয়া ছিল তা লিখে রাখুন। একাধিক দিনের overlapping forecast ব্যতিক্রমের ধারায় dependence তৈরি করতে পারে, যদিও একদিনের ব্যতিক্রম স্বাধীন হতো। নিচের প্রচলিত পরীক্ষাগুলো horizon mismatch, look-ahead, সংশোধিত input বা model-selection প্রক্রিয়া নিজে থেকে সারায় না।
Kupiec-এর POF পরীক্ষা কী জানতে চায়?
Tটি তুলনাযোগ্য forecast-outcome pair এবং xটি ব্যতিক্রম আছে ধরা যাক। পর্যবেক্ষিত ব্যতিক্রমের হার p̂ = x/T। Kupiec-এর proportion-of-failures পরীক্ষা দুটি binomial likelihood তুলনা করে: একটিতে ব্যতিক্রমের সম্ভাবনা লক্ষ্য α-তে স্থির, অন্যটিতে পর্যবেক্ষিত হার p̂ মুক্তভাবে অনুমান করা হয়। likelihood-ratio statistic হলো:
LRᵤ꜀ = −2 ln [ (1−α)^(T−x) α^x / ((1−p̂)^(T−x) p̂^x) ]
শূন্য অনুমানের অধীনে ব্যতিক্রমকে α সম্ভাবনার স্বাধীন Bernoulli ঘটনা ধরা হয়। যথেষ্ট বড় sample-এ statisticটি এক degree of freedom-সহ chi-square distribution-এর কাছাকাছি হয়। বড় statistic নির্দিষ্ট ব্যতিক্রম-হারকে প্রত্যাখ্যান করে। বিকল্প মডেলে পর্যবেক্ষিত হার মুক্তভাবে অনুমান করা হয় বলে ব্যতিক্রম খুব বেশি বা খুব কম—দুই ক্ষেত্রেই rejection হতে পারে। কোনো VaR সীমা প্রায় কখনো না পেরোলেই মডেলটি ভালোভাবে calibrated, এমন নয়; উদ্দেশ্যের তুলনায় ঝুঁকি-পূর্বাভাস অতিরিক্ত conservative হতে পারে।
POF পরীক্ষা ব্যতিক্রমের তারিখ নয়, শুধু সংখ্যা x ব্যবহার করে। একই hit indicator অন্য ক্রমে সাজালেও statistic বদলায় না। তাই চারটি ব্যতিক্রম আলাদা সময়ে ছড়িয়েছে নাকি পরপর এসেছে, POF একা তা বলে না। reference distribution-এর binomial likelihood-ও hit indicator স্বাধীন ধরে। ব্যতিক্রমের clustering প্রশ্ন হলে POF ফল থেকে clustering অনুমান না করে dependence-উপযোগী পরীক্ষা যোগ করুন।
Kupiec-এর মূল আলোচনা ১৯৯৫ সালের গবেষণাপত্রে প্রকাশিত; এর Federal Reserve archive record-ও পাওয়া যায়।
২৫০ দিনের উদাহরণে p-value-কে প্রেক্ষাপটে পড়ুন
99% VaR-এ ২৫০টি এক-দিনের পূর্বাভাসের একটি কাল্পনিক নমুনা ধরা যাক। লক্ষ্য α = 0.01; তাই শূন্য অনুমানে প্রত্যাশিত ব্যতিক্রম Tα = 250 × 0.01 = 2.5টি। যদি চারটি ব্যতিক্রম দেখা যায়, পর্যবেক্ষিত হার p̂ = 4/250 = 0.016 বা 1.6%। এটি 1% লক্ষ্যের ওপরে, কিন্তু এই ব্যবধান দেখেই likelihood-ratio পরীক্ষা প্রত্যাখ্যান করবে কি না বলা যায় না।
T = 250, x = 4, α = 0.01 বসালে LRᵤ꜀ ≈ 0.769। asymptotic chi-square(1) reference-এ p ≈ 0.38 এবং 5% critical value প্রায় 3.84। এই approximation অনুযায়ী উদাহরণটি 5% স্তরে unconditional coverage প্রত্যাখ্যান করে না। হিসাবটি কেবল কাল্পনিক পদ্ধতি-দর্শক উদাহরণ; এটি বাজার-ডেটার ফল বা সর্বজনীন acceptance threshold নয়।
দুটি log-likelihood দেখায় statisticটি কোথা থেকে আসে। লক্ষ্য হার স্থির রাখলে ℓ₀ = 246 ln(0.99) + 4 ln(0.01) ≈ −20.893। পর্যবেক্ষিত হার দিয়ে মুক্তভাবে fit করলে ℓ₁ = 246 ln(0.984) + 4 ln(0.016) ≈ −20.508। unrestricted fit প্রায় 0.385 log-likelihood unit বেশি, তাই LRᵤ꜀ = −2(ℓ₀ − ℓ₁) ≈ 0.769। এই পরীক্ষা লক্ষ্য-হার মডেলের তুলনায় fit-এর ঘাটতি মাপে; ডলারে দূরত্ব নয়।
প্রত্যাখ্যান না হওয়া মডেলটি calibrated প্রমাণ করে না। ২৫০ দিনে প্রত্যাশিত ব্যতিক্রম মাত্র 2.5টি, তাই আরও এক বা দুটি ঘটনা observed rate যথেষ্ট বদলে দেয়। chi-square reference asymptotic, আর rare-event test-এ এ ধরনের sample-এ power কম হতে পারে। statistic-এর সঙ্গে expected count, forecast horizon, test design এবং sample size দেখুন। p-value VaR মডেল সঠিক হওয়ার সম্ভাবনা নয়।
একই ব্যতিক্রম-সংখ্যায় সময়ের ধরন আলাদা হতে পারে
এবার একই দৈর্ঘ্যের দুটি কাল্পনিক ২৫০ দিনের sequence তুলনা করুন, দুটিতেই চারটি exception। A sequence-এ দিন 20, 80, 140 ও 220-তে exception। B sequence-এ দিন 60 ও 61, এবং 180 ও 181-তে। দুটোরই x = 4 ও p̂ = 1.6%, তাই Kupiec statistic একই। কিন্তু B-তে পাশাপাশি দিনের দুটি exception-pair আছে, A-তে নেই।
নীচের sketch দেখায় কেন শুধু মোট সংখ্যা নয়, hit sequence-ও সংরক্ষণ করা দরকার। এটি ধারণামূলক চিত্র; ২৫০ দিনের বাস্তব data series বা test result নয়। পরপর exception হলে volatility বদলানোর সঙ্গে মডেল তাল মেলাতে পারছে কি না দেখতে হবে, কিন্তু অল্প কয়েকটি ঘটনা দিয়ে কারণ নির্ণয় করা যায় না। Model misspecification, market shock, portfolio change, overlapping horizon, অথবা data ও timing convention থেকেও এমন pattern আসতে পারে।
Transition count-এর জন্য আগের indicator i ও বর্তমান indicator j হওয়ার সংখ্যা nᵢⱼ বলি; 0 মানে exception নেই, 1 মানে exception আছে। sample boundary বাদে A-তে n₀₁ = 4 এবং n₁₁ = 0; B-তে n₀₁ = 2 এবং n₁₁ = 2। দুটিতে চারটি exception, তবে B-র কিছু hit আরেকটি hit-এর পরে এসেছে বলে transition count ভিন্ন। প্রথম-ক্রমের independence পরীক্ষা এই ক্রম-তথ্য ব্যবহার করে।
সম্পূর্ণ transition count অনুযায়ী A-তে n₀₀=241, n₀₁=4, n₁₀=4, n₁₁=0; B-তে যথাক্রমে 243, 2, 2, 2। আগের দিন no-hit হলে fitted hit probability n₀₁/(n₀₀+n₀₁); hit হলে n₁₁/(n₁₀+n₁₁)। A-তে তা 4/245 ≈ 1.63% এবং 0/4। B-তে 2/245 ≈ 0.82% এবং 2/4 = 50%। 50% মানটি মাত্র চারটি hit-to-hit transition-এর ওপর দাঁড়ানো এই ছোট কাল্পনিক ধারার বৈশিষ্ট্য; বাস্তব মডেলের পরের দিনের ঝুঁকির বিশ্বাসযোগ্য estimate নয়।

Christoffersen-এর independence test কী যোগ করে?
Christoffersen independence test শান্ত দিনের পরে hit হওয়ার সম্ভাবনা এবং exception দিনের পরে hit হওয়ার সম্ভাবনা তুলনা করে। π₀ = Pr(Iₜ = 1 | Iₜ₋₁ = 0), π₁ = Pr(Iₜ = 1 | Iₜ₋₁ = 1)। Independence null হলো π₀ = π₁: আগের দিনের hit status আজকের hit probability বদলায় না। Alternative-এ n₀₀, n₀₁, n₁₀, n₁₁ থেকে transition probability দুটি আলাদা করে অনুমান করা হয়।
এই দুই model-এর likelihood-ratio independence statistic-ও সাধারণত এক degree of freedom-সহ chi-square reference-এ দেখা হয়। POF-এর বিপরীতে এটি indicator-এর ক্রমের ওপর নির্ভরশীল। একটি exception-এর পর প্রায়ই আরেকটি এলে π₁, π₀-এর চেয়ে বেশি হতে পারে। পরীক্ষা কেবল binary sequence-এর first-order dependence দেখে; অতীতের সব তথ্য, volatility বা portfolio state ভবিষ্যৎ loss predict করতে পারে কি না, তা পরীক্ষা করে না।
Exception খুব কম হলে transition estimate বিশেষভাবে অস্থির হয়। পরপর hit নেই এমন sequence-এ π₁-এর boundary estimate শূন্য হতে পারে; এতে দ্বিতীয় hit অসম্ভব প্রমাণ হয় না, শুধু এই sample-এ তা দেখা যায়নি। Statistic-এর সঙ্গে transition count ও sample size দেখুন। Sparse table-কে পরের দিনের tail risk-এর নির্ভুল estimate হিসেবে ব্যাখ্যা করবেন না।
এই পদ্ধতি conditional interval forecast মূল্যায়নের জন্য Christoffersen-এর ১৯৯৮ সালের গবেষণার সঙ্গে সম্পর্কিত।
Conditional coverage frequency ও independence একত্র করে
Conditional-coverage test-এ Kupiec frequency statistic ও Christoffersen independence statistic যোগ হয়: LR꜀꜀ = LRᵤ꜀ + LRᵢₙd। যৌথ null বলে exception probability α এবং exception-গুলো সময়ে স্বাধীন। প্রচলিত large-sample setup-এ এই যোগফল দুই degree of freedom-সহ chi-square distribution-এর সঙ্গে তুলনা করা হয়।
শুধু combined test নয়, প্রতিটি component result-ও জানান। Conditional coverage rejection মানে test assumptions-এর অধীনে যৌথ শর্ত দুটি observed sequence-এর সঙ্গে মেলে না; কারণটি নিজে থেকে বলে না। POF reject করে কিন্তু independence না করলে count-ই পরিষ্কার signal হতে পারে। Independence reject হলে মোট count target-এর কাছাকাছি হলেও timing cluster পরীক্ষা করুন। কোনোটিই reject না হলেও misspecification ধরার মতো sample information নাও থাকতে পারে।
এই পরীক্ষার ব্যাখ্যা সীমিত। প্রতিদিনের ফল binary করে, তাই VaR $1 ছাড়িয়েছে নাকি $1 million ছাড়িয়েছে তা আলাদা করতে পারে না। বাকি loss distribution validate করে না বা Expected Shortfall সঠিক বলে না। VaR ও Expected Shortfall tail-risk-এর আলাদা কোন প্রশ্নের উত্তর দেয়, তা জানতে VaR বনাম Expected Shortfall গাইড পড়ুন।
বিরল exception-এ ছোট sample-এর inference কঠিন
99% VaR-এ ২৫০ দিনের sample-এ expected exception মাত্র 2.5টি। Independent 1% hit হলে 249টি adjacent pair-এ hit-to-hit transition-এর expected count প্রায় 249 × 0.01² = 0.025। Model ঠিকমতো calibrated হলেও অধিকাংশ sample-এ পাশাপাশি exception থাকবে না। এই স্বল্পতায় transition probability নির্ভুলভাবে অনুমান কঠিন এবং independence test-এর power কম হতে পারে।
Christoffersen ও Pelletier দেখিয়েছেন, বাস্তবসম্মত ছোট sample-এ প্রচলিত VaR backtest-এর power তুলনামূলক কম হতে পারে; তাঁরা exception-গুলোর মধ্যবর্তী সময়ের duration model করে পরীক্ষা করেছেন। তাঁদের ফল অতিরিক্ত diagnostic বিবেচনার কারণ, duration test সর্বত্র শ্রেষ্ঠ—এমন দাবি নয়। Risk forecast ও sample design-এর সঙ্গে পরীক্ষা মিলিয়ে নিতে হয়। পর্যবেক্ষণ কম হলে non-rejection-কে model health certificate না ধরে sample limitation বলুন।
লক্ষ্য tail rate-ও গুরুত্বপূর্ণ। 95% VaR-এ ২৫০ দিনে nominal exception 5%, অর্থাৎ expected 12.5টি; 99.9%-এ expected মাত্র 0.25টি। Test-এর নাম একই হলেও এ দুই নকশায় evidence তুলনাযোগ্য হয় না। Confidence level, horizon, observation count, target ও observed count, transition count এবং asymptotic না finite-sample হিসাব—সব জানাতে হবে।
Christoffersen ও Pelletier exception-এর মধ্যবর্তী সময় নিয়ে ২০০৪ সালের গবেষণায় duration-based test বিশ্লেষণ করেছেন।
কখন আরেকটি diagnostic ব্যবহার করবেন?
দুটি পরীক্ষায় কোন তথ্য বাদ পড়েছে তা দেখে পরের diagnostic বেছে নিন। আগের hit, VaR forecast বা forecast সময়ে জানা অন্য variable দিয়ে exception predict হয় কি না জানতে চাইলে Engle–Manganelli dynamic-quantile (DQ) test centered hit indicator ও বাছাই করা instrument set-এর ওপর restriction পরীক্ষা করে। ফল instrument এবং forecast-time availability-র ওপর নির্ভর করে; সব সম্ভাব্য conditional failure পরীক্ষা করে না। Duration test exception-গুলোর মাঝের অপেক্ষার সময় দেখে, অর্থাৎ অন্য দিক যোগ করে।
VaR boundary ছাড়ানোর পর ক্ষতির আকার যদি প্রশ্ন হয়, frequency ও independence যথেষ্ট নয়। Exceedance size পর্যালোচনা করুন এবং forecast ও assumptions-এর উপযোগী Expected Shortfall evaluation বেছে নিন। অনেক model চেষ্টা করে সেরা ফল বেছে নেওয়ার ঝুঁকি থাকলে VaR backtesting strategy-selection problem মেটায় না; আলাদা rank-based diagnostic-এর জন্য PBO ও CSCV ব্যাখ্যা দেখুন।
উপযোগী report-এ portfolio ও loss convention, forecast horizon, confidence level, evaluation dates, forecast তৈরির পদ্ধতি, exception definition, expected ও observed count, POF statistic, transition count, independence ও conditional-coverage result উল্লেখ করুন। Sample size বা overlapping horizon-এর সীমাবদ্ধতাও লিখুন। Forecast threshold ও realized loss time-series plot-এ দেখান, আর model বাছাইয়ের সময় পরবর্তী evaluation data বন্ধ রাখুন। এতে evidence ব্যাখ্যা করা যায়; historical pass ভবিষ্যৎ risk control নিশ্চিত করে না।
Engle ও Manganelli তাঁদের CAViaR গবেষণায় Dynamic Quantile (DQ) test উপস্থাপন করেছেন.
সাধারণ প্রশ্ন
Q1Kupiec test reject না করলে কি VaR model সঠিক?
না। এর মানে test assumptions-এর অধীনে নির্দিষ্ট exception rate-এর বিরুদ্ধে যথেষ্ট evidence পাওয়া যায়নি। বিশেষত 99% বা তার বেশি confidence level-এ ছোট sample-এ সমস্যা ধরার মতো exception কম হতে পারে।
Q2দুই model একই Kupiec test result দিয়েও আলাদা exception pattern দেখাতে পারে?
হ্যাঁ। Kupiec statistic count-এর ওপর নির্ভর করে, order-এর ওপর নয়। Christoffersen independence test পাশের observation-গুলোতে exception জমাট বাঁধে কি না সে তথ্য যোগ করে।
Q3VaR breach-এর পরে loss কত বড় হতে পারে এসব test কি বলে?
না। এগুলো breach indicator ব্যবহার করে, exceedance-এর আকার নয়। VaR boundary-র পরে loss severity গুরুত্বপূর্ণ হলে tail loss দেখুন এবং Expected Shortfall আলাদাভাবে মূল্যায়ন করুন।
উৎস ও আরও পড়ুন
সমস্যা জানান
এই নিবন্ধের লিংকসহ একটি ইমেল তৈরি হবে। পাঠানোর পরেই Mark প্রতিবেদনটি পাবে
দ্রুত যাচাই
গাইডটি পড়ার পর 3টি প্রশ্নে নিজেকে যাচাই করুন
প্রশ্ন 01
Kupiec POF test কোন বৈশিষ্ট্য ব্যবহার করে?
ব্যাখ্যা দেখতে একটি উত্তর বেছে নিন
অপশন শব্দকোষ
The average loss from a chosen VaR quantile through the worst tail under a precise convention; it measures severity beyond the threshold rather than only its location.
বিস্তারিত গাইড পড়ুনGARCHA time-series model that updates conditional variance from past squared shocks and prior variance; it models volatility persistence, not return direction.
বিস্তারিত গাইড পড়ুনঅপশন অ্যাসাইনমেন্টএক্সারসাইজ নোটিশের পর চুক্তি পূরণের দায় অপশন বিক্রেতার ওপর বণ্টিত হওয়ার প্রক্রিয়া, যাতে শেয়ার দেওয়া বা কেনার বাধ্যবাধকতা তৈরি হতে পারে।
বিস্তারিত গাইড পড়ুন