पूर्वानुमान संयोजन: समान बनाम अनुमानित भार
जानें कि पूर्वानुमान संयोजन मॉडल की भविष्यवाणियों को कैसे मिलाता है, समान भार अनुमानित भार से बेहतर क्यों हो सकते हैं, और look-ahead bias के बिना परिणाम कैसे जाँचें
इस गाइड मेंपूर्वानुमान संयोजन का अर्थ
संक्षिप्त सारांश
पूर्वानुमान संयोजन एक ही लक्ष्य और अवधि के लिए बनी भविष्यवाणियों को मिलाता है। समान भार एक पारदर्शी आधार देते हैं; पुराने पूर्वानुमान त्रुटियों से अनुमानित भार मॉडल-अंतर के अनुसार ढल सकते हैं, पर अनुमान का शोर उन्हें नमूने के बाहर अस्थिर बना सकता है
पूर्वानुमान संयोजन का अर्थ
पूर्वानुमान संयोजन एक ही मात्रा के लिए दो या अधिक भविष्यवाणियाँ लेकर एक पूर्वानुमान बनाता है। यदि A, B और C मॉडल कल के realized variance का पूर्वानुमान देते हैं, तो उनके परिणामों का औसत लिया जा सकता है या अलग-अलग भार दिए जा सकते हैं। संयुक्त संख्या एक नया पूर्वानुमान है, यह तय करने वाला वोट नहीं कि कौन-सा मॉडल सही है।
इनपुट का लक्ष्य, पूर्वानुमान आरंभ समय, अवधि, इकाइयाँ और सूचना कट-ऑफ एक जैसे होने चाहिए। एक दिन के variance पूर्वानुमान को एक महीने के volatility पूर्वानुमान से सीधे औसत नहीं किया जा सकता, केवल इसलिए कि दोनों को volatility कहा जाता है। पहले समान मात्रा और अवधि परिभाषित करें, फिर भविष्यवाणियों को संरेखित करें।
कई उचित मॉडल श्रृंखला की अलग-अलग विशेषताएँ पकड़ते हों या यह स्पष्ट न हो कि कौन-सा आगे भी बेहतर रहेगा, तब संयोजन उपयोगी हो सकता है। मॉडल पूरी तरह अलग algorithms से बने हों, यह आवश्यक नहीं। संयोजन के लिए उनके नामों में अंतर से अधिक महत्वपूर्ण यह है कि उनकी त्रुटियाँ साथ-साथ कैसे चलती हैं।
Bates और Granger के मूल अनुप्रयोग में हवाई यात्रियों के उदाहरण पर दो पूर्वानुमानों के संयोजन से दोनों अलग-अलग पूर्वानुमानों की तुलना में कम mean squared error मिल सकता था। यह संयोजन जाँचने का कारण देता है, पर दूसरे बाजार, लक्ष्य, अवधि या loss function में सुधार की गारंटी नहीं (Bates and Granger, 1969)।
समान-भार आधार से शुरुआत करें
K पूर्वानुमानों के लिए समान-भार संयोजन है
\[ \widehat{y}_{t+h\mid t}^{\,EW} = \frac{1}{K}\sum_{k=1}^{K}\widehat{y}_{k,t+h\mid t} \]
हर घटक समान हिस्सा देता है। इस नियम के भारों के लिए अलग training sample की जरूरत नहीं होती और इसे दोहराना आसान है। अंतिम विधि में भार अनुमानित या सीमित हों, तब भी यह उपयोगी benchmark है।
समान भार का अर्थ यह नहीं कि सभी पूर्वानुमान समान रूप से सटीक, स्वतंत्र या आर्थिक रूप से महत्वपूर्ण हैं। इसका अर्थ केवल यह है कि संयोजन प्रक्रिया पुराने प्रदर्शन से अलग-अलग भार का अनुमान नहीं लगाती। यदि सभी इनपुट एक ही विशेषता चूकते हैं, तो समान-भार पूर्वानुमान में भी वही साझा bias रह सकता है।
मॉडल नामों की संख्या सूचना-विविधता नहीं मापती। तीन volatility मॉडल एक ही return series, session boundary और sampling interval इस्तेमाल कर सकते हैं तथा सभी रात के बदलाव को चूक सकते हैं। उनका औसत उस कमी को अपने-आप ठीक नहीं करता। देखें कि संग्रहित out-of-sample त्रुटियाँ उपयोगी ढंग से अलग हैं या नहीं; अलग नामों को स्वतंत्र साक्ष्य न मानें।
मान लें तीन मॉडल अगले सत्र की volatility 12, 15 और 20 basis points बताते हैं। समान-भार पूर्वानुमान \((12+15+20)/3=15.67\) basis points है। यह गणना केवल संयोजन दिखाती है; एक forecast origin से सटीकता या लाभप्रदता सिद्ध नहीं होती।
Volatility पूर्वानुमान में जाँचें कि इनपुट variance है या standard deviation। तीन variance पूर्वानुमानों का औसत लेकर फिर वर्गमूल निकालना सामान्यतः standard-deviation पूर्वानुमानों के औसत के बराबर नहीं होता। मूल्यांकन में वही लक्ष्य-परिभाषा और इकाइयाँ रखें।
पुराने पूर्वानुमान त्रुटियों से भार का अनुमान लगाएँ
अनुमानित linear combination को इस तरह लिखा जा सकता है:
\[ \widehat{y}_{t+h\mid t}^{\,C} = \sum_{k=1}^{K} w_k \widehat{y}_{k,t+h\mid t} \]
एक सामान्य सैद्धांतिक परिणाम मानता है कि प्रत्येक forecast error का mean शून्य है, लक्ष्य समान है और भारों का योग एक है। घटक forecast errors के covariance matrix को \(\Sigma_e\) मानें। यदि यह ज्ञात और invertible हो, तो इन शर्तों के तहत minimum-variance भार होंगे
\[ w^{*} = \frac{\Sigma_e^{-1}\mathbf{1}}{\mathbf{1}'\Sigma_e^{-1}\mathbf{1}} \]
यह सूत्र संदर्भ है, noisy sample covariance matrix को सीधे invert करने का निर्देश नहीं। व्यवहार में \(\Sigma_e\) सीमित पुराने forecast errors से अनुमानित होता है। अत्यधिक correlated इनपुट अनुमान को लगभग singular बना सकते हैं, इसलिए डेटा में छोटे बदलाव भी भारों में बड़े परिवर्तन ला सकते हैं।
यदि दो पूर्वानुमानों के error variance \(\sigma^2\) समान हैं, तो उनके समान-भार औसत का variance \(\sigma^2(1+\rho)/2\) है, जहाँ \(\rho\) errors के बीच correlation है। हर error variance 4 और correlation शून्य हो तो औसत का variance 2 है। Correlation 0.90 होने पर variance 3.8 है। औसत से कितना variance घट सकता है, यह error dependence तय करती है, मॉडल के नाम नहीं। यह गणना error variance की है; घटक पूर्वानुमानों में bias हो तो mean squared error में bias का वर्ग भी जुड़ता है।
एक अन्य तरीका archived component forecasts पर realized target की regression करना है, अक्सर intercept के साथ। Granger और Ramanathan ऐसी linear regression विधियाँ बताते हैं जिनमें भारों का योग एक होना जरूरी नहीं। Intercept और unconstrained भार training sample के औसत bias को सुधार सकते हैं, लेकिन व्याख्या बदल जाती है: coefficients fitted forecast adjustments हैं, जरूरी नहीं कि portfolio-जैसे हिस्से हों (Granger and Ramanathan, 1984)।
मूल्यांकन से पहले constraints तय करें। गैर-ऋणात्मक भार जिनका योग एक है, एक convex average बनाते हैं जो सबसे छोटे और सबसे बड़े component forecast के बीच रहता है। Negative weights या intercept परिणाम को उस दायरे से बाहर ले जा सकते हैं। Calibrated forecast में यह उचित हो सकता है, लेकिन variance जैसे लक्ष्य के लिए अनुपयुक्त हो सकता है जिसे nonnegative रहना चाहिए।
एक संयोजन की गणना करें
मान लें तीन मॉडल अगले सत्र के एक ही लक्ष्य के लिए 12, 15 और 20 basis points का पूर्वानुमान देते हैं। पहले के ऐसे forecast origins जिनके परिणाम मालूम थे, उनसे अनुमानित नियम 0.50, 0.30 और 0.20 भार देता है। संयुक्त पूर्वानुमान है
\[ 0.50(12) + 0.30(15) + 0.20(20) = 14.5\ \text{basis points} \]
भार nonnegative हैं और उनका योग एक है, इसलिए यह convex combination है और component forecasts के बीच आता है। समान-भार के 15.67 basis points से अंतर चुने हुए भार दिखाता है; यह नहीं कि weighted forecast बेहतर है।
भार केवल उन्हीं forecast errors से अनुमानित होने चाहिए जिनके परिणाम अनुमान के समय ज्ञात थे। ऐतिहासिक backtest में origin t पर 14.5 basis-point forecast, t तक उपलब्ध जानकारी इस्तेमाल कर सकता है; t+1 या उसके बाद realized target नहीं।
लक्ष्य देखे जाने के बाद component forecasts, संयुक्त forecast, actual proxy और evaluation loss दर्ज करें। बाद के origins पर यही प्रक्रिया दोहराने से समान तारीखों पर नियमों की तुलना हो सकती है। फिर भी, गणना का एक उदाहरण लगातार लाभ का प्रमाण नहीं बनता।
अनुमानित भार निराश क्यों कर सकते हैं
Population error covariance ज्ञात होने पर सर्वोत्तम भार, छोटे sample से अनुमानित भारों के समान नहीं होते। अनुमानित भार अतिरिक्त अनिश्चितता लाते हैं। समान component forecasts के errors अत्यधिक correlated हो सकते हैं, और optimization छोटे ऐतिहासिक अंतर का फायदा उठाने की कोशिश कर सकती है जो आगे कायम न रहें।
Kang की simulations और macroeconomic forecasting application में combination weights अस्थिर पाए गए और उन परिस्थितियों में simple average व्यवहार में बेहतर हो सकता था (Kang, 1986)। Timmermann की समीक्षा बताती है कि estimation error, model instability और error dependence forecast combinations को कैसे प्रभावित करते हैं (Timmermann, 200601004-9))।
Forecast-combination puzzle के बाद के विश्लेषण में finite-sample की यही बात सामने आती है: स्थिर “optimal” भारों के नतीजे तब वैसे ही लागू नहीं हो सकते जब उन्हीं भारों का अनुमान भी लगाया जाए (Claeskens et al., 2016)। इससे यह सिद्ध नहीं होता कि समान भार हमेशा जीतते हैं। यह बताता है कि अधिक जटिल भार नियम को out-of-sample तुलना में अपना लाभ साबित करना होगा।
<!-- learn:illustration -->
संभावित उपायों में समान भार से शुरुआत, इनपुट की संख्या सीमित करना, अनुमानित भारों को समान हिस्सों की ओर shrink करना या सरल constraint लगाना शामिल है। हर विकल्प flexibility और estimation noise के बीच समझौता करता है। Training data से चुनाव करें और नियम बताएँ; अंतिम test period देखकर सबसे आकर्षक संस्करण न चुनें।

वास्तविक समय में बने पूर्वानुमानों का archive तैयार करें
Archive में हर component forecast ऐसा होना चाहिए जिसे बताए गए origin पर वास्तव में बनाया जा सकता था। हर मॉडल को केवल उस समय उपलब्ध डेटा से फिर बनाएं और forecast timestamp, model version तथा target definition सहेजें। In-sample fitted values वास्तविक पुराने forecasts का विकल्प नहीं, क्योंकि मॉडल ने ऐसी observations इस्तेमाल की होंगी जो तब ज्ञात नहीं थीं।
Archive को target और origin के अनुसार align करें। हर row में component forecasts उसी भविष्य के interval को target करें और उनकी training information एक ही decision time पर समाप्त हो। Combination estimate करने से पहले missing forecasts हटाएँ या उन्हें स्पष्ट रूप से संभालें; चुपचाप inputs का समूह बदलने से तारीखों के बीच भारों का अर्थ बदल सकता है।
Weight estimation को final evaluation से अलग रखें। Rolling-origin प्रक्रिया t से पहले देखे गए परिणामों वाले forecasts से भार estimate कर सकती है, t पर combination जारी कर सकती है और target दिखने पर score कर सकती है। Expanding window सभी योग्य पुराने origins रखती है; rolling window पहले से तय अवधि के अनुसार पुराने origins भूलती है। प्रदर्शन बदलने पर दोनों अलग तरह से ढल सकती हैं।
यदि holdout period देखने के बाद component models, transformations, forecast horizons, weight constraints या loss functions चुने गए, तो वह अवधि model development का हिस्सा बन चुकी है। नया test period अलग रखें या nested evaluation अपनाएँ, जिसमें हर selection step training data के अंदर रहे।
एक ही loss से संयोजनों की तुलना करें
समान-भार नियम, अनुमानित या shrinkage नियम और individual forecasts की तुलना समान origins तथा एक ही realized target पर करें। Evaluation loss और common sample बताएँ। अन्यथा कोई विधि केवल आसान तारीखों या अलग target definition पर जाँचे जाने के कारण बेहतर दिख सकती है।
Loss target और प्रश्न के अनुकूल हो। Squared error बड़ी चूक को quadratic penalty देता है; absolute error बड़ी चूक को अलग तरह से तौलता है। Noisy realized measures के विरुद्ध volatility forecasts का मूल्यांकन करते समय proxy की शर्तें और चुना loss महत्वपूर्ण होते हैं। QLIKE और squared-error मार्गदर्शिका अंतर समझाती है। कौन-सी विधि पसंद आती है, यह देखने के बाद loss न चुनें।
Forecast comparison test यह मापने में मदद कर सकता है कि देखे गए loss differences sampling variation से मेल खाते हैं या नहीं। Diebold–Mariano मार्गदर्शिका paired forecast-loss comparisons और overlapping या dependent forecast errors की मान्यताओं को समझाती है। Test का परिणाम look-ahead bias ठीक नहीं करता और आर्थिक मूल्य सिद्ध नहीं करता।
यदि आपने कई component sets, weight constraints या loss rules आजमाए और उसी evaluation period में सबसे अच्छे दिखे संस्करण को रखा, तो तुलना में उस खोज का असर भी शामिल है। White Reality Check मार्गदर्शिका और backtest overfitting की संभावना मार्गदर्शिका कई trading rules में चयन की समस्या बताती हैं; इनमें से कोई साफ forecast archive या पहले से नियोजित evaluation का विकल्प नहीं है।
ऐसा validation design चुनें जो वास्तविक horizon से मेल खाए। यदि daily origins कई दिनों के overlapping outcomes का पूर्वानुमान देते हैं, तो लगातार losses निर्भर हो सकते हैं। अनिश्चितता निकालते समय इस निर्भरता को शामिल करें; बहुत-सी overlapping rows को उतने ही स्वतंत्र प्रयोग न मानें।
निर्णय के अनुसार संयोजन चुनें
मिलाने से पहले जाँचें कि हर मॉडल क्या predict करता है। Conditional mean, variance, quantile और पूरी probability distribution अलग forecast objects हैं। Point forecasts का linear average अपने-आप calibrated density forecast या भरोसेमंद tail-risk estimate नहीं बनाता।
Variance जैसी सख्ती से nonnegative मात्रा के लिए उपयोग से पहले संयुक्त मान जाँचें। Nonnegative forecasts का convex average nonnegative रहता है; negative weights या intercept वाली regression ऐसा न भी कर सके। Negative values को शून्य पर काटना forecast rule बदलता है और इसे evaluation से पहले तय करना चाहिए।
Forecasts की संख्या भी मायने रखती है। कमजोर या लगभग duplicate inputs जोड़ने से नए data की तुलना में fitted weights की संख्या अधिक बढ़ सकती है। यदि archive, K के मुकाबले छोटा है, तो पारदर्शी कम-आयामी नियम चुनें और दिखाएँ कि नतीजा किसी एक component पर निर्भर नहीं।
Model forecasts मिलाना trading positions मिलाने से अलग है। कम statistical loss यह नहीं बताता कि forecast इस्तेमाल करने वाली strategy fees, spread, slippage, market impact और risk limits के बाद अधिक कमाएगी। Forecast construction और उसे इस्तेमाल करने वाले trading rule—दोनों को अलग out-of-sample evidence चाहिए।
नतीजा दोहराने लायक विवरण दें
उपयोगी रिपोर्ट में forecast target, horizon, units, component models, origin timestamps, archive period और missing-data rule दर्ज हों। बताएँ कि weights equal, estimated, constrained, shrunk या समय के साथ बदलते हैं, और हर tuning choice कैसे की गई।
समान evaluation dates पर equal-weight benchmark, चुना हुआ combination और सबसे मजबूत individual forecast दिखाएँ। Loss function, uncertainty method और overlapping outcomes का उपचार शामिल करें। यदि windows के बीच weights बहुत बदलते हैं, तो केवल अंतिम values नहीं, अस्थिरता भी दिखाएँ।
अंत में empirical claim और decision claim अलग रखें। “इस sample में इस loss function के तहत इस combination का औसत loss कम था” कहना “पूर्वानुमान संयोजन trading सुधारता है” से अधिक सीमित और दोहराने योग्य है। पहले दावे को सहेजे हुए archive से जाँचा जा सकता है; दूसरे के लिए strategy, execution assumptions और अलग evidence चाहिए।
आम सवाल
Q1क्या equal-weight combination हमेशा किसी एक model से बेहतर होता है?
नहीं। यह weights fit किए बिना उपयोगी benchmark है, लेकिन इसकी accuracy component forecasts और target पर निर्भर करती है। समान out-of-sample dates पर हर individual forecast से इसकी तुलना करें।
Q2क्या forecast weights का योग हमेशा एक होना चाहिए?
नहीं। यह शर्त अक्सर परिणाम को समझने योग्य convex average बनाती है। Intercept वाली regression अलग तरह का forecast adjustment estimate कर सकती है; specification और उसके निहितार्थ बताएँ।
Q3क्या मैं in-sample fitted values से combination weights estimate कर सकता हूँ?
इससे अवास्तविक archive बन सकता है, क्योंकि मूल मॉडल ने ऐसी जानकारी इस्तेमाल की हो जो हर ऐतिहासिक origin पर उपलब्ध नहीं थी। उस समय उपलब्ध data से बने genuine rolling-origin forecasts को प्राथमिकता दें।
Q4क्या अधिक सटीक combined forecast trading edge सिद्ध करता है?
नहीं। Forecast accuracy एक निर्दिष्ट target, proxy, sample और loss के तहत सांख्यिकीय परिणाम है। Trading claim के लिए तय strategy, execution costs, risk constraints और अलग out-of-sample evaluation चाहिए। प्राथमिक शोध - Bates and Granger (1969), “The Combination of Forecasts,” *Journal of the Operational Research Society*, 20(4), 451–468. - Granger and Ramanathan (1984), “Improved Methods of Combining Forecasts,” *Journal of Forecasting*, 3(2), 197–204. - Kang (1986), “Unstable Weights in the Combination of Forecasts,” *Management Science*, 32(6), 683–695. - Timmermann (2006), “Forecast Combinations,” *Handbook of Economic Forecasting*, 1, 135–196.01004-9) - Claeskens, Magnus, Vasnev, and Wang (2016), “The Forecast Combination Puzzle: A Simple Theoretical Explanation,” *International Journal of Forecasting*, 32(3), 754–762.
स्रोत और आगे पढ़ें
समस्या की रिपोर्ट करें
हम इस लेख का लिंक जोड़कर ईमेल तैयार करेंगे। भेजने के बाद ही Mark को आपकी रिपोर्ट मिलेगी
त्वरित जाँच
गाइड पढ़ने के बाद 3 सवालों से खुद को जाँचें
सवाल 01
दो model forecasts को मिलाने से पहले क्या समान होना चाहिए?
व्याख्या देखने के लिए एक उत्तर चुनें