VaR बैकटेस्टिंग: Kupiec और Christoffersen परीक्षण समझें
जानें कि Kupiec POF और Christoffersen conditional-coverage परीक्षण VaR अपवादों का आकलन कैसे करते हैं, 250-दिन के उदाहरण को कैसे पढ़ें और non-rejection सटीकता का प्रमाण क्यों नहीं है।
इस गाइड मेंVaR backtest क्या जाँचता है?
संक्षिप्त सारांश
VaR backtest हर पूर्वानुमानित loss threshold की तुलना बाद में हुए वास्तविक नुकसान से करता है। Kupiec test पूछता है कि exceptions की संख्या लक्ष्य दर से मेल खाती है या नहीं। Christoffersen tests यह भी देखते हैं कि exceptions स्वतंत्र रूप से आती हैं या समय के साथ समूह बनाती हैं। ये पूर्वानुमान के अलग-अलग गुण जाँचते हैं; इनमें से कोई भी risk model के सही होने का प्रमाण नहीं है।
VaR backtest क्या जाँचता है?
Value at Risk (VaR) एक तय confidence level और समयावधि से जुड़ी loss threshold है। अगर एक-दिन की 99% VaR 10,000 डॉलर है, तो घोषित जानकारी और मान्यताओं के आधार पर model एक दिन में 10,000 डॉलर से अधिक के नुकसान की संभावना 1% मानता है। इसका अर्थ यह नहीं कि नुकसान 10,000 डॉलर पर रुक जाएगा, और यह भी नहीं बताता कि threshold पार होने के बाद नुकसान कितना बड़ा हो सकता है।
Backtesting forecasts और outcomes की श्रृंखला को exceptions की श्रृंखला में बदलती है। अच्छी तरह calibrated 99% दैनिक VaR model में तुलनीय observations के लंबे क्रम में करीब 1% बार exception आनी चाहिए। इस विचार के दो हिस्से हैं: कुल frequency लक्ष्य के करीब हो और exceptions का समयगत pattern model की conditional risk forecasts से टकराता न हो। Kupiec का proportion-of-failures (POF) test पहले हिस्से पर केंद्रित है। Christoffersen के independence और conditional-coverage tests exceptions के क्रम को भी शामिल करते हैं।
यह फर्क व्यवहार में मायने रखता है। किसी model में एक वर्ष में चार exceptions हो सकती हैं और वे सभी किसी अशांत सप्ताह में आ सकती हैं; दूसरे model में वही चार exceptions पूरे वर्ष में बिखरी हो सकती हैं। केवल count करने वाला test दोनों में चार देखता है, जबकि timing test अलग sequences देखता है। ये tests कुछ गुणों का वर्णन करते हैं, पर positions, market data, assumptions या losses की गंभीरता की समीक्षा का स्थान नहीं लेते। GARCH और volatility clustering की मार्गदर्शिका बताती है कि variance की persistence को कैसे दर्शाया जाता है; variance model और backtest अलग सवालों के जवाब देते हैं।
गिनने से पहले exception तय करें
पूरे विश्लेषण में एक ही sign convention रखें। Lₜ को दिन t का realized loss और VaRₜ|ₜ₋₁ को दिन t से पहले उपलब्ध जानकारी के आधार पर अनुमानित दैनिक loss threshold मानें। Exception indicator Iₜ = 1 होगा जब Lₜ > VaRₜ|ₜ₋₁, और अन्यथा Iₜ = 0। 99% VaR model में लक्ष्य exception probability α = 1 − 0.99 = 0.01 है। कुछ स्रोत return के sign से indicator परिभाषित करते हैं या covered interval बताते हैं; sign और probability का अनुवाद करने पर ये परंपराएँ समकक्ष हैं। अपनी परिभाषा स्पष्ट लिखें।
Forecast और outcome एक ही portfolio, horizon, valuation time और loss definition से संबंधित होने चाहिए। बाजार बंद होने के बाद अगले trading day के लिए बनाई VaR की तुलना उसी अगले दिन के loss से एक सुसंगत valuation rule के तहत करें। VaR boundary के बराबर loss, छुट्टियाँ, missing observations, market closures, intraday corrections और portfolio changes का व्यवहार पहले तय करें। खासकर दुर्लभ breaches में ये विकल्प hit sequence बदल सकते हैं।
Model fitting को अंतिम evaluation से अलग रखें। अगर test period देखकर parameters या risk thresholds चुने गए, तो p-value अब साफ out-of-sample check का अर्थ नहीं रखता। Rolling forecasts में रिकॉर्ड करें कि हर forecast कब बना और उस समय कौन-सी जानकारी उपलब्ध थी। कई दिनों के overlapping forecasts exception indicators के बीच dependence पैदा कर सकते हैं। नीचे दिए standard tests अपने आप mismatched horizons, future information leakage, revised inputs या model-selection process को ठीक नहीं करते।
Kupiec का POF test क्या पूछता है?
मान लें T तुलनीय forecast-outcome pairs और x exceptions हैं। Observed exception rate p̂ = x/T है। Kupiec का proportion-of-failures test दो binomial likelihoods की तुलना करता है: एक में exception probability को लक्ष्य α पर तय किया जाता है, दूसरे में उसे p̂ के रूप में स्वतंत्र रूप से estimate किया जाता है। Likelihood-ratio statistic है:
LRᵤ꜀ = −2 ln [ (1−α)^(T−x) α^x / ((1−p̂)^(T−x) p̂^x) ]
मूल formulation Kupiec के 1995 के paper में है; Federal Reserve archive record भी उपलब्ध है। Null hypothesis के तहत exceptions स्वतंत्र Bernoulli घटनाएँ हैं और हर घटना की probability α है। पर्याप्त बड़े sample में statistic लगभग एक degree of freedom वाले chi-square distribution का अनुसरण करता है। बड़ा statistic निर्धारित exception frequency के विरुद्ध साक्ष्य देता है। Alternative observed rate को स्वतंत्र रूप से estimate करता है, इसलिए बहुत अधिक या बहुत कम exceptions दोनों पर rejection हो सकता है। जो model शायद ही कभी VaR पार करे, वह जरूरी नहीं कि अच्छी तरह calibrated हो; वह इतना conservative हो सकता है कि उसका risk forecast उद्देश्य के लिए उपयोगी न रहे।
POF test केवल संख्या x का उपयोग करता है, exception की तारीखों का नहीं। उन्हीं indicators को दूसरे क्रम में रखने पर statistic नहीं बदलता। इसलिए POF result यह नहीं बता सकता कि चार exceptions फैली हुई थीं या लगातार आईं। Reference distribution के लिए binomial likelihood indicators की independence भी मानता है। Exceptions के समूह बनने का प्रश्न हो तो POF result से clustering का निष्कर्ष निकालने के बजाय dependence पर केंद्रित test जोड़ें।
250-दिन का उदाहरण बताता है कि p-value को संदर्भ में क्यों पढ़ें
99% दैनिक VaR forecasts की 250 दिनों की एक काल्पनिक श्रृंखला लें। लक्ष्य दर α = 0.01 है, इसलिए null के तहत अपेक्षित exceptions Tα = 250 × 0.01 = 2.5 हैं। मान लें चार exceptions दिखती हैं। तब p̂ = 4/250 = 0.016, यानी 1.6% है। यह 1% लक्ष्य से अधिक है, लेकिन केवल यह अंतर likelihood-ratio test के rejection का फैसला नहीं करता।
T = 250, x = 4 और α = 0.01 रखने पर LRᵤ꜀ ≈ 0.769 मिलता है। Asymptotic chi-square(1) reference से p ≈ 0.38 है और 5% critical value करीब 3.84 है। इस approximation के तहत उदाहरण 5% स्तर पर unconditional coverage को reject नहीं करता। यह गणना केवल तरीका समझाने के लिए काल्पनिक है; यह empirical result या सुझाई गई acceptance threshold नहीं है।
दो log-likelihood values statistic की उत्पत्ति दिखाती हैं। लक्ष्य दर तय रखने पर ℓ₀ = 246 ln(0.99) + 4 ln(0.01) ≈ −20.893। Observed rate को unrestricted रखने पर ℓ₁ = 246 ln(0.984) + 4 ln(0.016) ≈ −20.508। Unrestricted fit करीब 0.385 log-likelihood units बेहतर है, इसलिए LRᵤ꜀ = −2(ℓ₀ − ℓ₁) ≈ 0.769। Test लक्ष्य-दर model के मुकाबले fit की हानि मापता है; यह डॉलर में दूरी नहीं मापता।
Non-rejection यह साबित नहीं करता कि model ठीक calibrated है। 250 दिनों में केवल 2.5 exceptions अपेक्षित थीं, इसलिए एक या दो अतिरिक्त घटनाएँ observed rate को साफ तौर पर बदल देती हैं। Chi-square reference asymptotic है और इतने छोटे sample में rare-event tests की power सीमित हो सकती है। Statistic को expected count, horizon, test design और sample size के साथ पढ़ें। p-value, VaR model के सही होने की probability नहीं है।
समान exception count के पीछे timing अलग हो सकती है
अब 250 दिनों की दो काल्पनिक sequences की तुलना करें; दोनों में चार exceptions हैं। Sequence A में वे दिन 20, 80, 140 और 220 पर हैं। Sequence B में दिन 60 और 61, फिर 180 और 181 पर। दोनों का x = 4 और p̂ = 1.6% है, इसलिए Kupiec statistic एक ही है। लेकिन B में लगातार दिनों के दो exception pairs हैं, जबकि A में कोई pair नहीं है।
साथ का conceptual diagram समझाता है कि केवल total report करने के बजाय hit sequence भी क्यों रखनी चाहिए। यह 250-दिन का वास्तविक data series या test result नहीं है। लगातार exceptions देखकर यह जाँचना उचित हो सकता है कि model volatility बदलने पर देर से प्रतिक्रिया तो नहीं देता, लेकिन कुछ points से कारण तय नहीं किया जा सकता। Pattern की वजह model misspecification, market shock, portfolio change, overlapping horizons या data और timing conventions भी हो सकती हैं।
Transition गिनने के लिए nᵢⱼ को उन मामलों की संख्या मानें जिनमें पिछला indicator i और वर्तमान indicator j है; 0 का अर्थ exception नहीं, 1 का अर्थ exception है। Sample boundaries से दूर A में n₀₁ = 4 और n₁₁ = 0 हैं; B में n₀₁ = 2 और n₁₁ = 2 हैं। दोनों में चार exceptions हैं, लेकिन B के कुछ hits पिछले hit के बाद आए। First-order independence test इसी जानकारी का उपयोग करता है।
पूरी transition counts A के लिए n₀₀=241, n₀₁=4, n₁₀=4, n₁₁=0 और B के लिए क्रमशः n₀₀=243, n₀₁=2, n₁₀=2, n₁₁=2 हैं। बिना exception वाले दिन के बाद अनुमानित hit probability n₀₁/(n₀₀+n₀₁) है; hit के बाद n₁₁/(n₁₀+n₁₁)। A में ये 4/245 ≈ 1.63% और 0/4 = 0% हैं। B में 2/245 ≈ 0.82% और 2/4 = 50% हैं। 50% केवल exception के बाद के चार transitions में से दो का अनुपात है; यह छोटे काल्पनिक sequence की विशेषता है, किसी वास्तविक model के अगले दिन के जोखिम का भरोसेमंद अनुमान नहीं।

Christoffersen का independence test क्या जोड़ता है?
Independence test शांत दिन के बाद exception की संभावना की तुलना exception वाले दिन के बाद की संभावना से करता है। π₀ = Pr(Iₜ = 1 | Iₜ₋₁ = 0) और π₁ = Pr(Iₜ = 1 | Iₜ₋₁ = 1) रखें। Independence null में π₀ = π₁: कल hit हुआ था या नहीं, इससे आज की hit probability नहीं बदलती। Alternative में n₀₀, n₀₁, n₁₀ और n₁₁ से दोनों transition probabilities अलग-अलग estimate की जाती हैं।
Conditional interval forecasts का मूल्यांकन Christoffersen के 1998 के paper में विकसित किया गया है। Independence likelihood-ratio statistic दोनों models की तुलना करता है और सामान्यतः एक degree of freedom वाले chi-square distribution से जाँचा जाता है। POF के विपरीत, यह indicators के क्रम पर निर्भर है। अगर exception के बाद अक्सर दूसरी exception आए, तो π₁, π₀ से बड़ा हो सकता है। यह test binary sequence में first-order dependence की जाँच करता है; यह उन सभी तरीकों की जाँच नहीं करता जिनसे past information, volatility या portfolio state future losses का संकेत दे सकती है।
कुछ ही exceptions हों तो transition estimates बहुत अस्थिर हो सकती हैं। लगातार hits न दिखने पर π₁ का boundary estimate zero हो सकता है, पर इससे यह सिद्ध नहीं होता कि दूसरी exception असंभव है; बस इस sample में ऐसी घटना नहीं आई। Statistic के साथ transition counts और sample size भी देखें। Sparse table को अगले दिन के tail risk का सटीक estimate न समझें।
Conditional coverage frequency और independence को जोड़ता है
Conditional-coverage test Kupiec frequency statistic और Christoffersen independence statistic को जोड़ता है: LR꜀꜀ = LRᵤ꜀ + LRᵢₙd। इसका joint null कहता है कि exception probability α है और exceptions समय के साथ independent हैं। Standard large-sample setup में योग की तुलना दो degrees of freedom वाले chi-square distribution से की जाती है।
संयुक्त test के साथ दोनों components भी report करें। Conditional coverage का rejection बताता है कि test assumptions के तहत दोनों संयुक्त शर्तें observed sequence से मेल नहीं खातीं, पर कारण नहीं बताता। POF reject करे और independence न करे तो count अधिक स्पष्ट signal हो सकता है। Independence reject होने पर total count लक्ष्य के करीब दिखने के बावजूद timing की जाँच करें। दोनों reject न हों, तब भी sample misspecification पहचानने के लिए बहुत छोटा हो सकता है।
इस test का दायरा सीमित है। यह हर दिन को binary outcome में घटा देता है, इसलिए VaR से 1 डॉलर ऊपर के loss और 1 million डॉलर ऊपर के loss में फर्क नहीं करता। यह पूरे loss distribution को validate नहीं करता और Expected Shortfall की सटीकता भी स्थापित नहीं करता। VaR और Expected Shortfall के अलग सवालों के लिए VaR बनाम Expected Shortfall की मार्गदर्शिका देखें।
दुर्लभ exceptions में छोटे sample से निष्कर्ष निकालना कठिन है
99% VaR पर 250-दिन के sample में केवल 2.5 exceptions अपेक्षित हैं। स्वतंत्र 1% hits के तहत 249 adjacent pairs में hit-to-hit transitions की अपेक्षित संख्या लगभग 249 × 0.01² = 0.025 है। Model सही calibrated हो तब भी ऐसे अधिकांश samples में कोई adjacent pair नहीं होगा। इतनी कम घटनाओं से transition probabilities का सटीक अनुमान कठिन है और dependence test की power कम रह सकती है।
Christoffersen और Pelletier ने वास्तविक परिस्थितियों वाले छोटे samples में मौजूदा VaR backtests की कम power पर चर्चा की और exceptions के बीच समय का model बनाने वाले duration tests का अध्ययन अपने 2004 के paper में किया। यह अतिरिक्त diagnostic देखने का कारण है, duration test को हर स्थिति में बेहतर मानने या risk forecast और sample design से उसका मेल छोड़ने का कारण नहीं। कम observations हों तो यह सीमा बताएँ; non-rejection को model health certificate की तरह पेश न करें।
Target tail rate भी महत्त्वपूर्ण है। 95% VaR में nominal rate 5% है, यानी 250 दिनों में 12.5 exceptions अपेक्षित हैं; 99.9% VaR में केवल 0.25। एक ही test name इन designs के evidence को तुलनीय नहीं बनाता। Confidence level, horizon, observations की संख्या, target और observed counts, transition counts, और यह कि asymptotic reference या finite-sample method इस्तेमाल किया गया, सब बताएं।
दूसरा diagnostic कब उपयोग करें?
अगला diagnostic चुनते समय पूछें कि दोनों tests ने कौन-सी जानकारी छोड़ दी। अगर जाँचना है कि exceptions को lagged hits, VaR forecasts या forecast के समय ज्ञात अन्य variables से predict किया जा सकता है या नहीं, तो Engle और Manganelli का Dynamic Quantile (DQ) test centered exception indicators और चुने हुए instruments पर restrictions जाँचता है। निष्कर्ष instruments और उनके timing पर निर्भर करता है; यह हर संभव conditional failure का test नहीं है। Duration test इसके बजाय exceptions के बीच waiting time देखता है।
Engle और Manganelli ने DQ test अपने CAViaR paper में प्रस्तुत किया। अगर चिंता VaR सीमा पार होने के बाद loss size की है, तो frequency और independence tests काफी नहीं; exceedance amounts देखें और forecast तथा assumptions के अनुरूप Expected Shortfall evaluation method चुनें। अगर चिंता कई models आजमाने के बाद सबसे अच्छा परिणाम चुनने की है, तो VaR backtesting selection problem हल नहीं करती; PBO और CSCV एक अलग rank-based diagnostic देते हैं।
उपयोगी report में portfolio और loss convention, forecast horizon, confidence level, evaluation dates, forecast बनाने की प्रक्रिया, exception definition, expected और observed counts, POF statistic, transition counts तथा independence और conditional-coverage results शामिल हों। Sample size और overlapping horizons की सीमाएँ भी बताएं। Forecast thresholds और realized losses को समय के साथ दिखाएं और model चुनते समय बाद के evaluation data को अलग रखें। इससे evidence समझने योग्य बनता है; ऐतिहासिक test पास करना भविष्य के risk control की गारंटी नहीं है।
आम सवाल
Q1क्या Kupiec test का reject न होना बताता है कि मेरा VaR model सटीक है?
नहीं। इसका अर्थ है कि assumptions के तहत test को निर्धारित exception rate के विरुद्ध पर्याप्त evidence नहीं मिला। छोटा sample, खासकर 99% या उससे ऊँची confidence level पर, समस्या दिखाने के लिए बहुत कम exceptions दे सकता है।
Q2क्या दो models एक ही Kupiec test पास कर सकते हैं लेकिन उनकी exception patterns अलग हों?
हाँ। Kupiec statistic count पर निर्भर है, order पर नहीं। Christoffersen independence test यह अतिरिक्त जानकारी देता है कि exceptions आसपास के observations में cluster होती हैं या नहीं।
Q3क्या ये tests बताते हैं कि VaR पार होने के बाद loss कितना बड़ा होगा?
नहीं। ये breach indicator का उपयोग करते हैं और exceedance size नहीं मापते। VaR सीमा पार होने के बाद loss severity महत्त्वपूर्ण हो तो tail losses देखें और Expected Shortfall का अलग मूल्यांकन करें।
स्रोत और आगे पढ़ें
समस्या की रिपोर्ट करें
हम इस लेख का लिंक जोड़कर ईमेल तैयार करेंगे। भेजने के बाद ही Mark को आपकी रिपोर्ट मिलेगी
त्वरित जाँच
गाइड पढ़ने के बाद 3 सवालों से खुद को जाँचें
सवाल 01
Kupiec का POF test किस feature का उपयोग करता है?
व्याख्या देखने के लिए एक उत्तर चुनें
विकल्प शब्दावली
The average loss from a chosen VaR quantile through the worst tail under a precise convention; it measures severity beyond the threshold rather than only its location.
विस्तृत गाइड पढ़ेंGARCHA time-series model that updates conditional variance from past squared shocks and prior variance; it models volatility persistence, not return direction.
विस्तृत गाइड पढ़ेंऑप्शन असाइनमेंटएक्सरसाइज नोटिस के बाद कॉन्ट्रैक्ट पूरा करने की जिम्मेदारी ऑप्शन विक्रेता को देने की प्रक्रिया, जिससे शेयर देने या खरीदने का दायित्व बन सकता है।
विस्तृत गाइड पढ़ें