Skip to content
विकल्प और फ्यूचर्स की सभी गाइड
तय करें कि वित्तीय मॉडल किस इतिहास से सीखेगा12 मिनट

वॉक-फॉरवर्ड मॉडल सत्यापन में एक्सपैंडिंग और रोलिंग विंडो

वित्तीय मॉडल के लिए एक्सपैंडिंग और निश्चित लंबाई वाली रोलिंग ट्रेनिंग विंडो की तुलना करें, सत्यापन को अंतिम परीक्षण से अलग रखें और भविष्य के परिणामों के बिना नियम चुनें।

इस गाइड मेंवॉक-फॉरवर्ड फोल्ड में ट्रेनिंग और मूल्यांकन की विंडो अलग होती हैं

संक्षिप्त सारांश

एक्सपैंडिंग ट्रेनिंग विंडो सबसे पुराना पात्र इतिहास बनाए रखती है और नया डेटा उपलब्ध होने पर जोड़ती है। रोलिंग विंडो हाल के पात्र अवलोकनों की एक तय संख्या रखती है और पुराने रिकॉर्ड हटाती जाती है। दोनों कालानुक्रमिक वॉक-फॉरवर्ड मूल्यांकन में काम आ सकती हैं; इनमें से कोई भी मॉडल चयन और अंतिम परीक्षण अवधि को अलग रखने की ज़रूरत खत्म नहीं करती।

वॉक-फॉरवर्ड फोल्ड में ट्रेनिंग और मूल्यांकन की विंडो अलग होती हैं

पूर्वानुमान के समय शोधकर्ता कुछ पुराने फीचर और परिणाम जानता है, मॉडल फिट या अपडेट करता है और बाद के ब्लॉक पर उसका मूल्यांकन करता है। समय-बिंदु आगे बढ़ाने पर क्रमिक आउट-ऑफ-सैंपल अवधि मिलती हैं। ट्रेनिंग-विंडो नियम तय करता है कि हर फिट में कौन-सी पात्र पिछली पंक्तियाँ आएँगी। सत्यापन और परीक्षण नियम तय करते हैं कि विकल्पों की तुलना और प्रदर्शन मापने के लिए कौन-से बाद के परिणाम उपयोग होंगे। ये फैसले जुड़े हैं, पर एक ही विंडो नहीं हैं।

एक्सपैंडिंग नियम स्थिर ऐतिहासिक सीमा से शुरू होता है और नए परिणाम उपलब्ध होने पर बड़ा होता है। रोलिंग नियम दोनों सिरों को आगे बढ़ाता है, लेकिन शुरुआती तैयारी के बाद नमूने की संख्या स्थिर रखता है। किसी भी स्थिति में ऐसा लक्ष्य उपयोग न करें जिसका परिणाम पूर्वानुमान-बिंदु तक पूरा न हुआ हो। यदि लेबल कई सत्रों तक फैले हैं, तो पंक्ति की तारीख से यह पता नहीं चलेगा कि परिणाम कब ज्ञात हुआ; लेबल का समाप्ति समय रखें और उसी के अनुसार छाँटें।

फीचर की पिछली अवधि और मॉडल की ट्रेनिंग विंडो को भी अलग रखें। कोई संकेत हर पंक्ति की अस्थिरता हाल की अवधि से निकाल सकता है, जबकि फिट किया गया मॉडल कई वर्षों की पंक्तियाँ उपयोग करता है। फीचर अवधि बदलने से इनपुट बदलते हैं; ट्रेनिंग विंडो बदलने से मॉडल के अनुमान में जाने वाले अवलोकन बदलते हैं।

एक्सपैंडिंग विंडो शुरुआती इतिहास बनाए रखती है

मानें कि \(s\) पहली पात्र पंक्ति का सूचकांक है और \(t\) रीफिट के समय सबसे हाल की पूरी हो चुकी लेबल वाली पंक्ति का सूचकांक। ट्रेनिंग सेट \(\{s,s+1,\ldots,t\}\) है। अगले पूर्वानुमान-बिंदु पर यह सेट बना रहता है और नई पात्र पंक्तियाँ जुड़ती हैं। अलग से डेटा छाँटने का नियम न हो तो नमूना समय के साथ बढ़ता है।

यदि पुराना डेटा अब भी संबंधित प्रक्रिया बताता है, तो अधिक अवलोकन पैरामीटर-अनुमानों की सैंपलिंग अनिश्चितता घटा सकते हैं। वे दुर्लभ बाजार-स्थितियाँ बचा सकते हैं और मनमानी ऐतिहासिक कट-ऑफ चुनने से बचाते हैं। लेकिन पुराने रिकॉर्ड उम्र के कारण अपने-आप कम प्रभावी नहीं होते। फीचर और रिटर्न का संबंध बदले तो शुरुआती डेटा अनुमान को पुरानी परिस्थितियों की ओर खींच सकता है; बड़ा सेट बार-बार फिट करना धीमा भी हो सकता है। इतिहास बचाना उसे अपने-आप अधिक प्रतिनिधिक नहीं बनाता।

रोलिंग विंडो चुनी हुई सीमा से बाहर के अवलोकन हटाती है

यदि तय लंबाई \(W\) है, तो समय \(t\) पर सेट \(\{t-W+1,\ldots,t\}\) होगा, लेकिन लेबल की देरी या सीमा-अंतर को भी ध्यान में रखें। अगले बिंदु पर अंतिम सिरा आगे जाता है और सबसे पुरानी पात्र पंक्ति निकलती है। लंबाई अवलोकनों या कैलेंडर समय में तय हो सकती है; अनियमित डेटा में ये माप समान नहीं हैं।

रोलिंग विंडो हालिया डेटा का स्पष्ट नियम देती है। बदलती परिस्थितियों में अनुकूलन का प्रश्न हो या संचालन में स्थिर ट्रेनिंग आकार चाहिए, तो यह उपयोगी हो सकती है। पर इससे मॉडल अपने-आप अनुकूलित नहीं होता। रीफिट कम हों या बदलाव धीरे हों तो प्रतिक्रिया देर से आ सकती है। छोटी अवधि अनुमान अस्थिर कर सकती है, दुर्लभ तनाव-अवधियाँ छोड़ सकती है या जटिल मॉडल के लिए नमूने कम कर सकती है। लंबी अवधि विविध इतिहास रखती है, पर नए पैटर्न को कमजोर कर सकती है।

माप की इकाई भी मायने रखती है: छुट्टियों, अनुपलब्ध डेटा या अलग आवृत्ति से उतनी ही पंक्तियाँ अलग कैलेंडर समय को दर्शा सकती हैं। पैनल डेटा में तय करें कि पंक्तियाँ हटेंगी या तारीख के अनुसार संपत्ति-समूह। अंतिम परीक्षण देखने के बाद \(W\) चुनना चयन को उसी परीक्षण में ले जाता है; फिर वह स्वतंत्र परीक्षण नहीं रहता।

दोनों नियम हर रीफिट को अलग इतिहास देते हैं

विकल्परीफिट पर ट्रेनिंग पंक्तियाँसंभावित लाभजाँचने योग्य लागत
एक्सपैंडिंगस्थिर शुरुआत से समय-बिंदु तक सभी पात्र पंक्तियाँअधिक अवलोकन और पुरानी अवधियों का संरक्षणपुराने शासन का असर बना रहता है; फिट धीमा हो सकता है
रोलिंगपात्र पंक्तियों की हाल की तय अवधिस्पष्ट हालियापन सीमा और सीमित नमूनाकम जानकारी; चुनी अवधि पर परिणाम अधिक निर्भर

सिर्फ विंडो नीति की तुलना के लिए सूचना कट-ऑफ, फीचर, मॉडल वर्ग, ट्रेनिंग उद्देश्य, रीफिट तारीखें, पूर्वानुमान क्षितिज, परीक्षण ब्लॉक और निष्पादन मान्यताएँ समान रखें। यदि रोलिंग मॉडल अधिक बार रीफिट हो या अन्य विकल्प भी बदलें, तो स्कोर का अंतर केवल विंडो का असर नहीं माना जा सकता।

ये नियम पूर्वानुमान-बिंदु चुनने के समान नहीं हैं। दोनों ट्रेनिंग विंडो को रोलिंग मूल-बिंदु मूल्यांकन से जाँचा जा सकता है: पात्र अतीत पर ट्रेन करें, अगला ब्लॉक पूर्वानुमान करें, आगे बढ़ें और दोहराएँ। Leonard Tashman की आउट-ऑफ-सैंपल पूर्वानुमान परीक्षणों की समीक्षा00065-0) रोलिंग मूल-बिंदु और रोलिंग अनुमान-विंडो पर चर्चा करती है। एक बताती है मूल्यांकन कब होता है; दूसरी बताती है कौन-सी ट्रेनिंग पंक्तियाँ बचती हैं।

काल्पनिक समयरेखा बताती है कि हर रीफिट में क्या आता है

उदाहरण के सभी आँकड़े और तारीखें काल्पनिक हैं। मानें कि मॉडल हर महीने रीफिट होता है, लक्ष्य अगले महीने का रिटर्न है और पहला फिट 120वें महीने पर समाप्त होने वाले 60 पात्र अवलोकनों से शुरू होता है। लेबल परिणाम पूरा होने के बाद ही उपयोगी है। पहले पूर्वानुमान-बिंदु पर, 60 पंक्तियों की रोलिंग विंडो हो तो दोनों नियम वही 60 पंक्तियाँ उपयोग करते हैं।

नए महीने का परिणाम ज्ञात होने पर एक्सपैंडिंग सेट में 61 पात्र पंक्तियाँ होती हैं। रोलिंग नई पंक्ति जोड़कर सबसे पुरानी हटा देती है और 60 रखती है। 12 अपडेट के बाद एक्सपैंडिंग में मूल शुरुआत से 72 पंक्तियाँ होंगी, जबकि रोलिंग सबसे नई 60 रखेगी। इतिहास अलग होने से अनुमान अलग हो सकते हैं, भले ही हर पंक्ति अपने फिट समय पर उपलब्ध थी।

इस उदाहरण में अंतिम 24 महीने बाहरी परीक्षण के लिए अलग रखें। विंडो नियम और लंबाई, फीचर और बाकी सेटिंग पहले के कालानुक्रमिक सत्यापन से चुनें। फिर पहले से तय रीफिट अनुसूची पर चुने मॉडल का मूल्यांकन करें। बाहरी परीक्षण के परिणाम देखने के बाद लंबाई बदलना उन्हीं परिणामों से चयन करना है और अंतिम अवधि का प्रमाण बढ़ा-चढ़ाकर दिखाता है।

कालानुक्रमिक सत्यापन के भीतर विंडो नियम चुनें

तुलना से पहले प्रश्न लिखें: क्या हर रीफिट में मॉडल को उपलब्ध पूरा इतिहास लेना चाहिए, या पुराने उदाहरण हटाने का शोध-आधारित कारण है? लक्ष्य संबंध स्थिर रहने की उम्मीद है या महत्वपूर्ण इनपुट बदल सकते हैं? ये प्रश्न विकल्प सुझाते हैं; किसी खास बाजार में कौन बेहतर होगा, यह पहले से सिद्ध नहीं करते।

पहले के विकास डेटा पर थोड़े, पहले से तय विकल्पों की तुलना करें—जैसे एक्सपैंडिंग और कुछ उचित रोलिंग अवधि—उसी कालानुक्रमिक सत्यापन ब्लॉक और रीफिट गति पर। स्कोर करने से पहले उद्देश्य चुनें: पूर्वानुमान हानि, कैलिब्रेशन, टर्नओवर-समायोजित पोर्टफोलियो उपयोगिता और अधिकतम गिरावट अलग सवालों के जवाब हैं। लागत और सीमाएँ समान रखें तथा विफल फिट और अनुपलब्ध पूर्वानुमान दर्ज करें। लक्ष्य या ब्लॉक ओवरलैप करें तो पास के स्कोर समान रिटर्न साझा कर सकते हैं; हर पंक्ति को स्वतंत्र प्रयोग न गिनें।

बाद की कालानुक्रमिक अवधि अंतिम जाँच के लिए अछूती रखें। नेस्टेड डिज़ाइन में आंतरिक सत्यापन हर बाहरी परीक्षण ब्लॉक से पहले उपलब्ध डेटा से विंडो और अन्य सेटिंग चुनता है; बाहरी नतीजे पूरी चयन प्रक्रिया का मूल्यांकन करते हैं। Purged CV मार्गदर्शिका लेबल-ओवरलैप की सीमाएँ बताती है; वित्तीय मॉडल ओवरफिटिंग और मल्टीपल टेस्टिंग संबंधित चयन जोखिम समझाते हैं।

लेबल, प्रीप्रोसेसिंग और रीफिट समय को उस समय उपलब्ध जानकारी से मिलाएँ

हर मूल-बिंदु पर केवल तब ज्ञात फीचर और लेबल लें। कई सत्रों के फ़ॉरवर्ड रिटर्न का परिणाम सत्यापन सीमा के पास अधूरा हो सकता है, भले निर्णय समय पहले हो। जरूरत पर असली लेबल-अंतराल के अनुसार गैप रखें या पंक्तियाँ हटाएँ; स्थिर पंक्ति-संख्या तभी उचित है जब आवृत्ति और लक्ष्य-अवधि इसकी वजह दें। भविष्य की जानकारी वाला फीचर कोई विंडो नियम ठीक नहीं कर सकता।

इम्प्यूटेशन, स्केलिंग, फीचर चयन और अन्य सीखे गए प्रीप्रोसेसिंग को हर फोल्ड के ट्रेनिंग भाग पर ही फिट करें। थ्रेशोल्ड या हाइपरपैरामीटर चुनना हो तो ट्रेनिंग के भीतर कालानुक्रमिक सत्यापन करें और बाद के ब्लॉक के स्कोर के लिए चुनाव स्थिर रखें। scikit-learn का आधिकारिक TimeSeriesSplit दस्तावेज़ डिफ़ॉल्ट रूप से बढ़ते ट्रेनिंग सेट और आकार सीमित करने वाले max_train_size का वर्णन करता है। gap नमूनों की संख्या है; समान फोल्ड-अवधि तुलना समान अंतर वाले अवलोकन मानती है। टाइमस्टैम्प, वित्तीय लेबल और इस्तेमाल किए गए संस्करण को अलग से जाँचें।

हर मूल-बिंदु का प्रदर्शन बताएँ और मूल्यांकन की सीमाएँ दिखाएँ

विंडो नियम और सटीक लंबाई, सबसे पुरानी बची तारीख, हर रीफिट में पात्र पंक्तियाँ, लेबल उपलब्धता नियम, सत्यापन और अंतिम परीक्षण तारीखें, पूर्वानुमान क्षितिज और रीफिट अनुसूची बताएँ। कुल परिणाम के साथ हर परीक्षण ब्लॉक का परिणाम दिखाएँ। औसत छिपा सकता है कि एक बाजार अवधि तुलना चला रही है; पास-पास के पूर्वानुमान समान परिणाम साझा कर सकते हैं, इसलिए स्वतंत्र प्रमाण नहीं हैं।

पूर्वानुमान की शुद्धता नेट ट्रेडिंग लाभ नहीं है। पोज़िशन बनाना, लीवरेज, टर्नओवर, लिक्विडिटी, शुल्क, स्प्रेड, बाजार प्रभाव, उधार, फंडिंग और निष्पादन समय वास्तविक परिणाम बदलते हैं। तुलना में इन्हें समान रखें और बताएं क्या शामिल नहीं है। Cerqueira, Torgo और Mozetič का समय-श्रृंखला प्रदर्शन-अनुमान अध्ययन स्थिर और गैर-स्थिर स्थितियों में अनुमानों के अलग हो सकने की रिपोर्ट करता है। यह वित्तीय विंडो नीतियों की सीधी तुलना नहीं करता और किसी एक को हमेशा बेहतर नहीं बताता।

हर बैकटेस्ट को खास इतिहास और प्रक्रिया का प्रमाण समझें। एक्सपैंडिंग पुराना शासन बनाए रख सकती है; रोलिंग उपयोगी जानकारी हटाकर अनुमान शोरयुक्त कर सकती है। अलग शासन, संपत्ति-समूह या लागत में चुना नियम विफल हो सकता है। सत्यापन जाँची प्रक्रिया की अनिश्चितता घटाता है, भविष्य का रिटर्न सुनिश्चित नहीं करता और किसी विंडो को सर्वोत्तम सिद्ध नहीं करता।

आम सवाल

Q1क्या अधिक डेटा लेने के कारण एक्सपैंडिंग विंडो हमेशा बेहतर होती है?

नहीं। पुराना डेटा प्रासंगिक हो तो अधिक पंक्तियाँ अनुमान स्थिर कर सकती हैं, लेकिन पुराने बाजार-शासन का असर बना रह सकता है। यह डेटा, लक्ष्य, फीचर, अनुमानक और मूल्यांकन अवधि पर निर्भर है।

Q2क्या रोलिंग विंडो बाजार-शासन के बदलाव के साथ अपने-आप अनुकूलित होती है?

नहीं। चुनी सीमा से बाहर पुरानी पंक्तियाँ हटती हैं, लेकिन बदलाव का पता नहीं चलता और नया नमूना अगले शासन का प्रतिनिधि होगा इसकी गारंटी नहीं। रीफिट गति, लंबाई और मॉडल का डिज़ाइन भी मायने रखता है।

Q3क्या विंडो ट्यून करने और अंतिम प्रदर्शन बताने के लिए वही अवधि रख सकते हैं?

तब वह अवधि मॉडल चयन का हिस्सा होगी। कालानुक्रमिक सत्यापन में नियम चुनें और बाद के अछूते परीक्षण पर स्थिर प्रक्रिया आँकें। वह परिणाम भी केवल जाँचे गए इतिहास और मान्यताओं का वर्णन करता है।

स्रोत और आगे पढ़ें

समस्या की रिपोर्ट करें

हम इस लेख का लिंक जोड़कर ईमेल तैयार करेंगे। भेजने के बाद ही Mark को आपकी रिपोर्ट मिलेगी

त्वरित जाँच

गाइड पढ़ने के बाद 3 सवालों से खुद को जाँचें

सवाल 1 / 3

सवाल 01

निश्चित लंबाई वाली रोलिंग ट्रेनिंग विंडो के अगले रीफिट में क्या बदलता है?

व्याख्या देखने के लिए एक उत्तर चुनें

विकल्प शब्दावली

ट्रेडिंग मॉडल सत्यापनPurged cross-validation और embargo: ट्रेडिंग मॉडल में label leakage रोकनासमझें कि overlapping forward labels वाले वित्तीय time series का validation कैसे करें, और purging व embargo, walk-forward, TimeSeriesSplit तथा CPCV से कैसे अलग हैं।Model history समझा सकता है और अगली अवधि में fail हो सकता हैBias–Variance Tradeoff और Financial Model OverfittingPrediction bias, estimation variance, irreducible noise, model complexity, time-series validation, data snooping, backtest overfitting और financial-model governance समझेंकई ideas test करने पर एक threshold क्यों fail होता हैFinance में Multiple Testing और False Discovery RateMultiple comparisons, family-wise error, false discovery rate, Bonferroni, Holm, Benjamini–Hochberg, dependence, q-values, factor mining, backtest selection और research governance समझेंवित्तीय मशीन लर्निंग में इवेंट लेबलिंगट्रिपल-बैरियर विधि: वित्तीय घटनाओं की लेबलिंग समझेंजानें कि उतार-चढ़ाव के अनुसार तय लाभ और हानि सीमाएँ तथा अधिकतम समय-सीमा वित्तीय घटनाओं को मशीन लर्निंग लेबल में कैसे बदलती हैं।ऑप्शन की कार्यप्रणालीऑप्शन असाइनमेंट क्या है?समझें कि बेचा गया ऑप्शन एक्सपायरी से पहले या उस दिन शेयर देने या खरीदने की जिम्मेदारी कैसे बना सकता है