Skip to content
विकल्प और फ्यूचर्स की सभी गाइड
पूर्वानुमान मॉडल की तुलना14 मिनट का पठन

Model Confidence Set (MCS): विजेता चुने बिना पूर्वानुमान मॉडलों की तुलना

जानें कि Model Confidence Set क्रमिक परीक्षणों और निर्भर डेटा के बूटस्ट्रैप से उन पूर्वानुमान मॉडलों को कैसे बनाए रखता है जिनके प्रदर्शन में उपलब्ध साक्ष्य अंतर नहीं कर पाते।

इस गाइड मेंModel Confidence Set किस प्रश्न का उत्तर देता है?

संक्षिप्त सारांश

Model Confidence Set (MCS) पूर्वानुमान प्रक्रियाओं के तय परिवार की तुलना करता है और चुने हुए loss के तहत उन उम्मीदवारों को लौटाता है जिन्हें घटिया साबित नहीं किया जा सका। यदि नमूना उनके बीच अंतर नहीं कर पाता, तो कई मॉडल बने रह सकते हैं; नतीजा उम्मीदवार परिवार, forecast design, loss और inference प्रक्रिया पर निर्भर करता है।

Model Confidence Set किस प्रश्न का उत्तर देता है?

मान लें कि आपके पास अगले दिन की volatility का पूर्वानुमान करने वाली कई प्रक्रियाएँ हैं। उनकी त्रुटियाँ समान नहीं हैं, लेकिन नमूना छोटा या शोरयुक्त हो सकता है और यह बताना कठिन हो कि किस प्रक्रिया का अपेक्षित loss सबसे कम है। सबसे कम औसत loss वाले मॉडल को चुनना तब भी एक विजेता थोप देगा जब अंतर केवल sampling variation हो सकता है। Model Confidence Set एक set-valued उत्तर देता है: तय प्रदर्शन मानदंड के तहत कौन-से उम्मीदवार सर्वश्रेष्ठ होने के साथ सांख्यिकीय रूप से संगत बने रहते हैं?

MCS उम्मीदवारों के समूह \(\mathcal M_0\), किसी loss या अन्य मानदंड, और confidence level से शुरू होता है। यह बार-बार जाँचता है कि विचाराधीन उम्मीदवारों की predictive ability समान है या नहीं। परीक्षण अस्वीकार होने पर elimination rule अपेक्षाकृत कमजोर माने गए उम्मीदवार को हटाता है; छोटे हुए समूह पर परीक्षण फिर चलता है। अंत में बचे उम्मीदवार MCS बनाते हैं। Hansen, Lunde और Nason ने इसे निर्दिष्ट समूह के सर्वोत्तम मॉडल या मॉडलों के confidence set के रूप में प्रस्तुत किया—जैसे अनिश्चित डेटा में किसी parameter का confidence interval एक से अधिक मान रख सकता है (2011 का शोधपत्र)।

“सर्वश्रेष्ठ” का अर्थ केवल इसी तुलना के भीतर है। कोई मॉडल शामिल उम्मीदवारों, लक्ष्य, forecast horizon, हर origin पर उपलब्ध जानकारी और चुने गए scoring criterion के सापेक्ष ही सर्वश्रेष्ठ है। MCS के लिए किसी उम्मीदवार का वास्तविक data-generating process होना ज़रूरी नहीं; समान सर्वोत्तम अपेक्षित प्रदर्शन वाले कई उम्मीदवार बने रह सकते हैं। यह इस बात की posterior probability नहीं है कि बचा हुआ मॉडल सही है।

उम्मीदवार परिवार और forecasting प्रश्न पहले तय करें

Loss की गणना से पहले \(\mathcal M_0\) तय करें। उम्मीदवार में fitted model के साथ उसकी estimation और forecast-update rule शामिल हो सकती है, या वह ऐसी forecasting प्रक्रिया हो सकती है जिसे statistical model के रूप में न लिखा गया हो। उदाहरण के लिए, volatility distribution, rolling window, parameter updates और forecast horizon बदल सकते हों तो केवल “GARCH” कहना उम्मीदवार को पूरी तरह निर्दिष्ट नहीं करता। इनमें से हर विकल्प एक अलग उम्मीदवार बना सकता है।

हर उम्मीदवार को समान origins और horizon पर, उसी लक्ष्य का पूर्वानुमान केवल उस समय उपलब्ध जानकारी से देना चाहिए। एक मॉडल एक-दिवसीय variance और दूसरा पाँच-दिवसीय volatility बताए तो उनके raw losses की सीधी तुलना निष्पक्ष नहीं होगी। साझा evaluation sample रखें, छूटे हुए observations को स्पष्ट रूप से align करें, और data vintage, शुरुआती estimation window, recursive या rolling schedule तथा संशोधित inputs का व्यवहार दर्ज करें। समय में overlap करने वाले forecasts के neighboring losses अलग origins पर जारी होने के बावजूद observations साझा कर सकते हैं।

नतीजे देखने से पहले criterion चुनें। Point forecast के लिए squared error, absolute error या decision-specific loss मॉडलों की रैंकिंग अलग कर सकते हैं। Variance forecast के लिए noisy proxy के अनुकूल volatility loss चाहिए; quantile forecast के लिए mean squared error के बजाय quantile score चाहिए। एक loss के तहत अच्छा MCS दूसरे loss के तहत अच्छे MCS की गारंटी नहीं देता। यदि उसी evaluation परिणाम को देखकर उम्मीदवार सूची छोटी की गई, तो औपचारिक set उस अप्रकाशित screening पर सशर्त होगा और पूरे search को नहीं दर्शाएगा।

साझा forecasts से paired loss contrasts बनाएँ

मान लें कि origin \(t\) पर बने forecast का realized target \(y_{t+h}\) है और उम्मीदवार \(i\) का forecast \(\hat y_{i,t+h|t}\) है। पहले से चुने गए loss function \(L\) के लिए हर उम्मीदवार और साझा origin पर एक loss निकालें:

\[ L_{i,t}=L(y_{t+h},\hat y_{i,t+h|t}) \]

मान लें कि कम loss बेहतर है। उम्मीदवारों \(i\) और \(j\) के लिए paired contrast इस तरह परिभाषित करें:

\[ d_{ij,t}=L_{i,t}-L_{j,t}, \qquad \bar d_{ij}=\frac{1}{P}\sum_{t=1}^{P}d_{ij,t} \]

यहाँ \(P\) साझा forecast origins की संख्या है। इस sign convention में सकारात्मक \(\bar d_{ij}\) का अर्थ है कि नमूने में उम्मीदवार \(i\) का औसत loss \(j\) से अधिक था; नकारात्मक मान \(i\) के पक्ष में है। Pairing इसलिए ज़रूरी है कि दोनों उम्मीदवारों ने उन्हीं realized outcomes का सामना किया। साझा market shocks दोनों losses बढ़ा सकते हैं, जबकि contrast उनके सापेक्ष प्रदर्शन को अलग करता है।

मौजूदा समूह \(\mathcal M\) के लिए equal-predictive-ability null को ऐसे लिख सकते हैं:

\[ H_{0,\mathcal M}:\quad \mu_{ij}=E[d_{ij,t}]=0 \quad \text{हर } i,j\in\mathcal M \text{ के लिए} \]

यह मौजूदा समूह के बारे में संयुक्त कथन है, अलग-अलग pairwise tests का ऐसा संग्रह नहीं जिसे एक-एक करके देखा जाए। मूल MCS framework मॉडलों में search को संभालने के लिए joint equivalence test और elimination rule का उपयोग करता है। यह नहीं पूछता कि हर तारीख पर forecasts बिल्कुल समान थे या नहीं।

मौजूदा समूह का परीक्षण करें और हटाने का नियम तय करें

MCS प्रक्रिया set-level test और elimination step को बारी-बारी से चलाती है। \(\mathcal M=\mathcal M_0\) से शुरू करें और चुने हुए स्तर \(\alpha\) पर equal predictive ability जाँचें। परीक्षण अस्वीकार न हो तो रुककर मौजूदा समूह रिपोर्ट करें। अस्वीकार हो तो पहले से तय elimination rule से एक उम्मीदवार हटाएँ और छोटे समूह पर परीक्षण दोहराएँ। प्रक्रिया की मान्यताओं के तहत बचे हुए उम्मीदवार \((1-\alpha)\) MCS बनाते हैं।

शोधपत्र में दो परिचित statistics दिए गए हैं। Range statistic सबसे बड़ा standardized pairwise loss contrast देखता है:

\[ T_{R,\mathcal M}=\max_{i,j\in\mathcal M}|t_{ij}|, \qquad t_{ij}=\frac{\bar d_{ij}}{\widehat{\mathrm{se}}(\bar d_{ij})} \]

इससे जुड़ा elimination rule उस उम्मीदवार को हटाता है जिसका दूसरे उम्मीदवार की तुलना में standardized disadvantage सबसे बड़ा हो। दूसरा statistic हर उम्मीदवार की तुलना मौजूदा समूह के औसत प्रदर्शन से करता है:

\[ T_{\max,\mathcal M}=\max_{i\in\mathcal M}t_{i\cdot}, \qquad d_{i\cdot,t}=\frac{1}{|\mathcal M|}\sum_{j\in\mathcal M}d_{ij,t} \]

यहाँ \(t_{i\cdot}\), \(d_{i\cdot,t}\) के औसत को standardize करता है; संबंधित rule उस उम्मीदवार को हटाता है जिसका समूह के औसत के सापेक्ष standardized excess loss सबसे बड़ा हो। Statistic और elimination rule एक जोड़ी हैं। उन्हें पहले से चुनकर पूरी प्रक्रिया के रूप में रिपोर्ट करें; यह देखकर आपस में न बदलें कि किससे छोटा set मिलता है। MCS शोधपत्र दिखाता है कि rejection test और उम्मीदवार हटाने वाला rule एक-दूसरे के अनुरूप क्यों होने चाहिए (Hansen, Lunde और Nason)।

Bootstrap में समय-निर्भरता बनाए रखें

Maximum statistic का distribution उम्मीदवारों के loss contrasts की संयुक्त परिवर्तनशीलता पर निर्भर करता है। हर मॉडल या तारीख को स्वतंत्र observation मानने से दोनों तरह की dependence टूट सकती है: लगातार losses serially related हो सकते हैं और उसी तारीख पर दो उम्मीदवारों के losses paired होते हैं। इसलिए MCS bootstrap को set-level statistic के null distribution का अनुमान लगाते समय प्रासंगिक संयुक्त time-series संरचना बनाए रखनी चाहिए।

एक उपाय उम्मीदवारों के losses या contrasts के vector के aligned time blocks को resample करना है। Stationary bootstrap में block की लंबाई random होती है और resampled series किसी चुनी हुई तारीख से फिर शुरू हो सकती है; Politis और Romano ने weakly dependent stationary observations के लिए यह विधि प्रस्तुत की (1994 का शोधपत्र)। MCS लेखक block-bootstrap implementations बताते हैं और implementation appendix में stationary bootstrap को विकल्प के रूप में दर्ज करते हैं। हर मॉडल की loss series को अलग-अलग resample करने से एक ही तारीख की pairing टूटेगी और तुलना बदल सकती है।

औसत block length, bootstrap variant, equal-ability null के तहत centering, replications की संख्या और forecast horizon—सभी uncertainty estimate को प्रभावित करते हैं। Overlapping लंबे forecast horizons अक्सर loss differences में लंबी dependence बनाते हैं, लेकिन हर target और sample के लिए कोई एक सार्वभौमिक block length नहीं है। Design समझाएँ और देखें कि उचित dependence settings बदलने पर निष्कर्ष कितना बदलता है। Bootstrap output अपनी मान्यताओं के तहत approximation है; यह look-ahead, दोबारा इस्तेमाल किए गए holdout, nonstationary score behavior या छूटे हुए candidate family को ठीक नहीं करता।

चार मॉडलों की काल्पनिक तुलना की गणना करें

मान लें कि चार प्रक्रियाएँ A, B, C और D, समान volatility target का 120 साझा दैनिक origins पर forecast करती हैं। Illustrative squared percentage-point units में उनके औसत squared-error losses क्रमशः 1.20, 1.23, 1.45 और 1.90 हैं। औसत A को पहले और D को आख़िरी स्थान पर रखते हैं, लेकिन केवल ranking sampling uncertainty के बारे में कुछ नहीं बताती।

A और B के बीच mean paired loss difference \(1.20-1.23=-0.03\) है। यदि dependence-aware standard error \(0.04\) हो, तो संबंधित pairwise statistic \(-0.03/0.04=-0.75\) होगा। यह अकेला contrast A और B के बीच स्पष्ट सांख्यिकीय अंतर नहीं दिखाता। MCS यहीं नहीं रुकता: उसका set-level statistic चारों उम्मीदवारों के संयुक्त contrasts देखता है।

उदाहरण के लिए, मान लें कि पूरी 120-origin loss series पर block-bootstrap MCS, \(T_R\), \(\alpha=0.05\) और coherent worst-candidate elimination rule का उपयोग करता है। मान लें कि set-level p-value 0.018 आता है, D हटता है, और फिर \(\{A,B,C\}\) के लिए 0.11 आता है। चूँकि 0.11, 0.05 से बड़ा है, प्रक्रिया रुककर \(\{A,B,C\}\) को illustrative 95% MCS रिपोर्ट करती है। C बना रहता है, जबकि उसका औसत loss A से ज़्यादा है: इस काल्पनिक परीक्षण ने joint test के तहत C को inferior स्थापित नहीं किया।

यहाँ p-values केवल चरण समझाने के लिए गढ़े गए हैं; चार औसत losses या A–B contrast से उनकी पुनर्गणना नहीं हो सकती। वास्तविक नतीजे के लिए हर origin की पूरी loss series, candidate forecasts, bootstrap design और elimination sequence चाहिए। व्यवहार में ये inputs सुरक्षित रखें और पूरी sequence रिपोर्ट करें, ताकि पाठक देख सकें कि हर rejection पर कौन-सा उम्मीदवार निकला। <!-- learn:illustration -->

एक हल्की पट्टी के भीतर कई पूर्वानुमान पथ पास रहते हैं, जबकि दूर के पथ धुंधले पड़ते हैं—एक विजेता के बजाय समूह बचता है
ऐसी पूर्वानुमान तुलना का अवधारणात्मक चित्र जो सांख्यिकीय रूप से अलग न दिखने वाले कई उम्मीदवारों को बनाए रखती है; यह देखे गए पूर्वानुमान, अनुभवजन्य परिणाम या ट्रेडिंग संकेत नहीं हैं।

बचे हुए समूह की व्याख्या सावधानी से करें

95% confidence level पर, अपनी नियमितता और परीक्षण शर्तों के तहत, MCS को निर्दिष्ट समूह के सर्वोत्तम उम्मीदवार को कम-से-कम बताई गई asymptotic coverage के साथ शामिल करने के लिए बनाया गया है। इसका अर्थ यह नहीं कि हर retained model के सर्वश्रेष्ठ होने की 95% संभावना है। Confidence statement repeated samples पर प्रक्रिया के व्यवहार से संबंधित है; यह model labels का posterior distribution नहीं है।

Equal predictive ability को अस्वीकार न कर पाना इस बात का प्रमाण नहीं कि उम्मीदवारों का expected loss बिल्कुल समान है। छोटे evaluation period, loss contrasts की अधिक volatility या लगभग बराबरी वाले कई उम्मीदवारों के कारण test की power कम हो सकती है। बड़ा surviving set ईमानदारी से दिखा सकता है कि डेटा विकल्पों में अंतर नहीं कर पा रहा। उसमें ऐसे मॉडल भी हो सकते हैं जो absolute terms में सभी खराब हों, क्योंकि MCS उम्मीदवारों की आपस में तुलना करता है, किसी आवश्यक बाहरी मानक से नहीं।

Set उतना ही व्यापक है जितने उम्मीदवार \(\mathcal M_0\) में रखे गए। यदि सचमुच बेहतर forecasting procedure छोड़ी गई, तो MCS उसे खोज नहीं सकता। यदि उसी evaluation period को पहले देखकर किसी मॉडल को कमजोर मानकर analysis से हटा दिया गया, तो nominal coverage उस दर्ज न किए गए search को नहीं गिनता। Candidate बनाने और screening का इतिहास बताएँ। यदि कई उम्मीदवारों का expected loss समान रूप से सर्वोत्तम है, तो एक से अधिक को बनाए रखना विधि के अनुरूप है, चुनाव करने में विफलता नहीं।

MCS को pairwise और benchmark tests से अलग पहचानें

Diebold–Mariano test दो forecasting procedures के paired loss difference पर केंद्रित है। MCS बार-बार पूरे समूह का परीक्षण करता है और बताता है कि संयुक्त elimination प्रक्रिया में कौन-से उम्मीदवार बचे। कई DM tests चलाकर nonsignificant जोड़ियों को रखना अपने-आप MCS के बराबर नहीं होता; joint bootstrap और coherent elimination rule मायने रखते हैं।

Clark–West test उस सीमित squared-error तुलना के लिए है जहाँ एक forecast model restricted benchmark को nest करता है और estimation noise raw difference को प्रभावित करती है। MCS में nested उम्मीदवार होना ज़रूरी नहीं और उपयोगकर्ता द्वारा चुना गया loss इस्तेमाल हो सकता है, लेकिन साझा forecast design फिर भी चाहिए।

White’s Reality Check और Hansen’s Superior Predictive Ability test पूछते हैं कि searched family का कम-से-कम एक सदस्य तय benchmark से बेहतर है या नहीं। MCS किसी benchmark पर निर्भर नहीं; यह benchmark जाँचने के बजाय अपेक्षाकृत बेहतर उम्मीदवारों का समूह बताता है। इन प्रक्रियाओं में search और dependence का सही विवरण चाहिए, लेकिन इनके null hypotheses अलग हैं। Reality Check और SPA मार्गदर्शिका तथा White (2000) और Hansen (2005) के मूल शोधपत्र देखें।

Design रिपोर्ट करें और forecast ranking को trading value से अलग रखें

दोहराए जा सकने वाले MCS विवरण में हर candidate procedure, साझा target और horizon, forecast-origin व information rules, estimation schedule, evaluation dates, missing-data व्यवहार, loss formula और बेहतर माने जाने वाली दिशा दें। Significance level, test statistic व elimination rule, bootstrap प्रकार, block-length चुनाव, centering method, replications की संख्या, हर चरण के p-values और अंतिम सदस्यता भी बताएँ। संदर्भ के लिए औसत losses और differences दें, लेकिन joint inference की जगह केवल ranking table न रखें।

Volatility evaluation में बताएँ कि observed proxy कैसे बनाया गया और वह noisy या revised है या नहीं। Multi-step predictions में overlapping target windows और dependence method खुलासा करें। जब membership पर असर पड़ता हो, तो loss, sample period और bootstrap settings में उचित बदलाव के प्रति sensitivity दिखाएँ। हटाए गए उम्मीदवारों और प्रक्रिया के विवरण के बिना अकेला छोटा p-value set को दोहराने के लिए पर्याप्त नहीं है।

MCS किसी एक criterion के लिए predictive procedures की ranking करता है। यह causal structure स्थापित नहीं करता, data-generating model की पहचान नहीं करता और न ही सिद्ध करता है कि बचे हुए forecasts लाभदायक trade बनाएँगे। Forecast को position में बदलने पर thresholds, sizing, turnover, execution timing, spread, fees, slippage, financing, borrow और risk constraints जुड़ते हैं। उस तय decision process को उपयुक्त बाद के डेटा पर जाँचें और net trading outcomes अलग से रिपोर्ट करें। Imperfect proxies में volatility scores के लिए QLIKE और squared-error loss की मार्गदर्शिका देखें।

आम सवाल

Q1क्या MCS एक ही सर्वोत्तम model चुनता है?

ज़रूरी नहीं। साक्ष्य किसी उम्मीदवार को अलग दिखाए तो एक ही बच सकता है; अन्यथा कई बच सकते हैं क्योंकि नमूना यह स्थापित नहीं कर पाता कि कौन inferior है। बचे उम्मीदवारों में से deployment के लिए एक चुनने को अलग decision rule चाहिए।

Q2क्या MCS में शामिल model के सही होने की 95% संभावना है?

नहीं। Confidence level, विधि की assumptions के तहत निर्दिष्ट family के सर्वोत्तम उम्मीदवार की repeated-sample coverage बताता है। यह model के सही होने की posterior probability नहीं है।

Q3क्या MCS को volatility forecasts के अलावा भी इस्तेमाल कर सकता हूँ?

हाँ। उपयुक्त साझा criterion और sampling design तय हों तो यह forecasts, econometric models या अन्य उम्मीदवारों की तुलना कर सकता है। नतीजा चुने गए candidate set और loss पर निर्भर रहता है।

Q4क्या MCS मेरे आज़माए हर model को अपने-आप शामिल करता है?

तभी, जब वास्तविक search candidate family और evaluation procedure में दर्शाया गया हो। दर्ज न की गई screening या evaluation data का बार-बार उपयोग केवल बाद में MCS चलाने से ठीक नहीं होता।

स्रोत और आगे पढ़ें

समस्या की रिपोर्ट करें

हम इस लेख का लिंक जोड़कर ईमेल तैयार करेंगे। भेजने के बाद ही Mark को आपकी रिपोर्ट मिलेगी

त्वरित जाँच

गाइड पढ़ने के बाद 3 सवालों से खुद को जाँचें

सवाल 1 / 3

सवाल 01

Model Confidence Set क्या रिपोर्ट करता है?

व्याख्या देखने के लिए एक उत्तर चुनें

विकल्प शब्दावली

एक ही वास्तविक परिणामों पर दो पूर्वानुमानों की हानि की तुलना करेंDiebold–Mariano परीक्षण: पूर्वानुमान सटीकता की तुलनाजानें कि Diebold–Mariano परीक्षण क्या तुलना करता है, हानि-अंतर और सीरियल सहसंबंध सांख्यिकी को कैसे प्रभावित करते हैं, और पूर्वानुमान सटीकता ट्रेडिंग लाभ क्यों नहीं है।Nested forecast की तुलनाNested forecast के लिए Clark–West test: फ़ॉर्मूला, उदाहरण और सीमाएँजानें कि nested forecast models में MSPE की समायोजित तुलना क्यों ज़रूरी है, Clark–West statistic कैसे काम करता है, और एकतरफ़ा नतीजा क्या साबित कर सकता है और क्या नहीं।ट्रेडिंग-रूल खोज के प्रभाव की जाँचTrading Rules के लिए White Reality Check और Hansen SPA Testकई trading rules में से winner चुनने पर Reality Check और SPA क्या जाँचते हैं, उनकी bootstrap प्रक्रिया, मान्यताएँ और सीमाएँ समझें।Volatility forecast का मूल्यांकनVolatility forecast में QLIKE बनाम squared error: noisy proxiesVolatility forecasts के लिए QLIKE और squared-error losses की तुलना करें, ranking पलटने वाला उदाहरण देखें, और जानें कि noisy realized-variance proxies कब expected forecast ranking बनाए रखते हैंऑप्शन की कार्यप्रणालीऑप्शन असाइनमेंट क्या है?समझें कि बेचा गया ऑप्शन एक्सपायरी से पहले या उस दिन शेयर देने या खरीदने की जिम्मेदारी कैसे बना सकता है