Skip to content
विकल्प और फ्यूचर्स की सभी गाइड
रणनीति खोज के विजेता को पूरे समूह के स्तर पर जाँचना क्यों ज़रूरी है13 मिनट पढ़ें

रणनीति बैकटेस्ट में डेटा स्नूपिंग के लिए White’s Reality Check

जानें कि White’s Reality Check खोज में मिली सबसे अच्छी रणनीति की बेंचमार्क से तुलना कैसे करता है और निर्भरता-सचेत bootstrap के अधिकतम मान को कैसे शामिल करता है

इस गाइड मेंयह जाँचता है कि खोज का विजेता चुने हुए बेंचमार्क को पछाड़ता है या नहीं

संक्षिप्त सारांश

White’s Reality Check पूछता है कि तय खोज-समूह का सबसे अच्छा उम्मीदवार, अधिकतम परिणाम के रूप में चुने जाने की बात को ध्यान में रखते हुए, दिए गए बेंचमार्क से बेहतर है या नहीं। यह सभी उम्मीदवारों के समय-निर्भर संयुक्त प्रदर्शन-अंतर पर bootstrap करता है और देखे गए अधिकतम की तुलना bootstrap अधिकतमों के शून्य-वितरण से करता है। छोटा समायोजित p-value उस समूह और बेंचमार्क के लिए “कोई भी बेहतर नहीं” वाली संयुक्त शून्य परिकल्पना के विरुद्ध साक्ष्य है; यह वास्तविक ट्रेडिंग के मुनाफ़े का पूर्वानुमान नहीं है।

यह जाँचता है कि खोज का विजेता चुने हुए बेंचमार्क को पछाड़ता है या नहीं

कोई शोधकर्ता चलती औसत की दर्जनों अवधियाँ, ब्रेकआउट नियम, होल्डिंग अवधि, बाज़ार और फ़िल्टर आज़माकर फिर सबसे ऊँचा बैकटेस्ट स्कोर वाली रणनीति प्रकाशित कर सकता है। वह विजेता कोई सामान्य अकेला उम्मीदवार नहीं: खोज ने उसे असाधारण रूप से अच्छा दिखने के कई अवसर दिए। डेटा देखने से पहले चुना गया मानकर केवल उसी का परीक्षण करने पर चयन-चरण छूट जाता है।

White’s Reality Check चयन को परीक्षण में शामिल करता है। यह पूछता है कि जाँचे गए समूह में किसी उम्मीदवार का अपेक्षित प्रदर्शन तय बेंचमार्क से बेहतर है या नहीं। White शून्य परिकल्पना को एकतरफ़ा तुलनाओं के प्रतिच्छेद के रूप में लिखते हैं: बेंचमार्क के सापेक्ष हर उम्मीदवार का अपेक्षित प्रदर्शन शून्य से अधिक नहीं। वैकल्पिक परिकल्पना कहती है कि कम-से-कम एक उम्मीदवार का अपेक्षित लाभ सकारात्मक है। बेंचमार्क buy-and-hold, कोई सरल पूर्वानुमान नियम या दूसरा तुलना-नियम हो सकता है; उसे शोध-प्रश्न से मेल खाना चाहिए और परीक्षण परिणाम देखने से पहले तय करना चाहिए। औपचारिक रूप White के मूल लेख में है।

यह पूरे समूह का प्रश्न है, संयोग से जीतने वाली रणनीति की गारंटी नहीं। शून्य परिकल्पना खारिज होने का अर्थ है कि दर्ज समूह में चुने गए आँकड़े और मान्यताओं के तहत श्रेष्ठता का साक्ष्य है। इससे यह साबित नहीं होता कि हर उम्मीदवार उपयोगी है, विजेता आगे भी सबसे अच्छा रहेगा या उसका लाभ नए बाज़ार-चक्र में कायम रहेगा।

हर उम्मीदवार को तुलनीय प्रदर्शन-अंतर के रूप में व्यक्त करें

d[k,t] को समान अवधि t में उम्मीदवार k का प्रदर्शन घटा बेंचमार्क का प्रदर्शन मानें; बड़ा मान हमेशा उम्मीदवार के पक्ष में होना चाहिए। रिटर्न की तुलना में यह उम्मीदवार का शुद्ध रिटर्न घटा बेंचमार्क का शुद्ध रिटर्न हो सकता है। पूर्वानुमान-हानि के लिए दिशा उलटें: बेंचमार्क की हानि घटा उम्मीदवार की हानि। संकेत की परिभाषा हर जगह सकारात्मक मान को उम्मीदवार का लाभ बताए।

हर पंक्ति सभी उम्मीदवारों के लिए समान समय-अंतराल दर्शाए। एक ही मुद्रा, रिटर्न-पद्धति, वित्तपोषण-व्यवहार और लागत-नीति अपनाएँ। यदि दावा वास्तव में निष्पादित हो सकने वाले रणनीति-रिटर्न पर है, तो d[k,t] बनाने से पहले प्रासंगिक कमीशन, स्प्रेड, स्लिपेज, फंडिंग और उधार लागत घटाएँ। सकल रिटर्न जाँचकर लागतों को सिर्फ फुटनोट में रखना अलग सवाल का उत्तर है।

उम्मीदवार k का नमूना औसत है d̄[k] = (1/T) Σ_t d[k,t]। संयुक्त शून्य परिकल्पना H0: max_k E[d[k,t]] ≤ 0 और वैकल्पिक H1: max_k E[d[k,t]] > 0 है। पूरे समूह के लिए बेंचमार्क साझा है और हर उम्मीदवार एक ही कसौटी पर मापा जाता है। उम्मीदवारों के बीच गायब तारीखें या अवलोकन-आवृत्ति अलग हो तो अंतर निकालने से पहले तर्कसंगत साझा नमूना तय करें; किसी उम्मीदवार को चुपचाप बेहतर समय-खिड़की न दें।

शोध-दावे में उम्मीदवारों का पूरा समूह शामिल करें

समूह में वे सभी नियम आते हैं जिनके परिणाम प्रकाशित विजेता के चयन को प्रभावित कर सकते थे: जाँची गई पिछली-अवधियाँ, प्रवेश सीमाएँ, संकेतों के संयोजन, परिसंपत्ति-समूह, होल्डिंग अवधि, पोर्टफोलियो की पाबंदियाँ और निष्पादन संबंधी मान्यताएँ। परिणाम देखने के बाद छोड़े गए हाथ से बदले गए रूप भी शामिल हैं। 2000 के लेख में White “specification search” को व्यापक अर्थ में लेते हैं: चयन की प्रक्रिया, केवल अंतिम तालिका नहीं, चयन-समस्या बनाती है।

दो विपरीत गलतियाँ संभव हैं। प्रकाशित रणनीति चुनने में मदद करने वाले प्रयोग छोड़ देने से समायोजित परीक्षण ज़रूरत से ज़्यादा आशावादी होता है, क्योंकि bootstrap असल से छोटी खोज देखता है। परिणाम देखने के बाद अनेक मनमाने, असंबद्ध नियम जोड़ने से परीक्षण अनावश्यक रूप से रूढ़िवादी हो सकता है और उपयोगी उम्मीदवार खोजने की क्षमता घट सकती है। वास्तविक चयन-प्रक्रिया से समूह तय करें और उसकी सीमा जाँचने योग्य बनाने वाला शोध-लॉग रखें।

परीक्षण उन प्रयोगों का अनुमान नहीं लगा सकता जो दर्ज ही नहीं हुए। केवल विजेता पैरामीटर वाली नोटबुक खोज को दोबारा बनाने के लिए पर्याप्त नहीं है। उम्मीदवार रजिस्टर, डेटा संस्करण, मूल्यांकन तिथियाँ, उद्देश्य, लागत-मान्यताएँ और चयन के निर्णय साथ रखें। परिणाम देखने के बाद समूह बदला हो तो बताएँ कि क्या और क्यों बदला; बाद में तैयार किए गए समूह को पहले से तय बताकर पेश न करें।

अधिकतम आँकड़ा चयन-चरण को शून्य-वितरण में ले जाता है

हर उम्मीदवार का औसत सापेक्ष प्रदर्शन निकालें और उनमें से सबसे बड़ा लें। एक सामान्य बिना-studentize किया गया आँकड़ा है Vobs = √T × max_k d̄[k]। अधिकतम आवश्यक है: यह “सबसे अच्छा चुनो” वाली उसी प्रक्रिया को दर्शाता है जिससे दिखने वाला विजेता निकला। केवल विजेता वाले कॉलम की जाँच करने से चयन-चरण संदर्भ-वितरण से हट जाएगा।

Bootstrap अनुमान लगाता है कि नमूना-उतार-चढ़ाव से कितना बड़ा अधिकतम बन सकता है, यदि श्रेष्ठता न होने की संयुक्त शून्य परिकल्पना सही हो। हर bootstrap दोहराव b में सभी उम्मीदवारों के समय-चिह्नित अंतर-वेक्टर को फिर से नमूना लेकर केंद्रित आँकड़ा, जैसे V*b = √T × max_k(d̄*[k,b] − d̄[k]), निकालें। केंद्रित करने से उम्मीदवारों के औसत शून्य अपेक्षित लाभ वाली नल की कम-अनुकूल सीमा पर आते हैं; अधिकतम उम्मीदवारों में चयन को बनाए रखता है। White का लेख अधिकतम का bootstrap-वितरण विकसित कर उसे देखे गए आँकड़े से तुलना करता है।

यह प्रक्रिया कई बार दोहराएँ। समायोजित p-value उन bootstrap अधिकतमों का अनुपात है जो Vobs के बराबर या उससे बड़े हों। B दोहरावों में सामान्य Monte Carlo अनुमान है (1 + count{V*b ≥ Vobs})/(B + 1)। Studentization या अनुमानित मॉडल के विवरण के कारण कार्यान्वयन अलग हो सकता है; इसलिए आँकड़ा और शून्य परिकल्पना के तहत केंद्रित करने का तरीका दर्ज करें। मुख्य बात है कि हर दोहराव में पूरे समूह का अधिकतम फिर से निकले, केवल देखे गए विजेता का नहीं।

उम्मीदवार इतिहास का पुनः नमूना लेते समय निर्भरता बनाए रखें

वित्तीय अवलोकन समय के क्रम में होते हैं। स्वतंत्र रूप से फेरबदल करने पर serial dependence, volatility clustering और सहसंबद्ध लाभ-हानि के क्रम मिट सकते हैं। एक ही बाज़ार-दिनों पर प्रतिक्रिया देने वाली रणनीतियों का रिश्ता भी बिगड़ सकता है। ये बातें अधिकतम आँकड़े की tail को प्रभावित करती हैं; इसलिए हर उम्मीदवार का अलग-अलग पुनः नमूना या अलग दिनों को replacement के साथ चुनना गलत संदर्भ-वितरण दे सकता है।

White निर्भर डेटा के तरीके, जैसे moving-block bootstrap, बताते हैं और Politis व Romano के stationary bootstrap का विश्लेषण करते हैं। इसमें चुना गया ब्लॉक आम तौर पर अगली समय-श्रृंखला अवलोकन तक चलता है; यादृच्छिक पुनःआरंभ पर वह दूसरी चुनी हुई तारीख से शुरू होता है। ब्लॉक लंबाइयों का वितरण ज्यामितीय होता है और उसका औसत चुना जाता है। विधि की मान्यताओं और tuning के तहत यह i.i.d. नमूने से छोटी अवधि के क्रम बेहतर बचाता है। Politis और Romano का stationary-bootstrap लेख देखें।

रणनीति-समूह के लिए समय-सूचकों की एक साझा श्रृंखला चुनें और उसे पूरे पंक्ति-वेक्टर (d[1,t], …, d[K,t]) पर लागू करें। इससे चुने ब्लॉकों के भीतर समय-क्रम और उसी अवधि में उम्मीदवारों की परस्पर निर्भरता दोनों बचते हैं। रणनीति की अवधि और dependence diagnostics को देखकर ब्लॉक लंबाई चुनें और उचित विकल्पों के प्रति नतीजे की संवेदनशीलता बताएँ। यदि शोध प्रक्रिया में पैरामीटर फिर से fit होते हैं, तो तय करें कि अनुमान का लक्ष्य उस चरण को शामिल करता है या नहीं और जरूरत पर हर नमूने में इसे दोहराएँ। केवल पहले से fit किए स्थिर रिटर्न का पुनः नमूना प्रक्रिया के एक हिस्से पर शर्त लगाकर उसे बाहर कर सकता है।

काल्पनिक bootstrap उदाहरण व्याख्या बदल देता है

मान लें शोधकर्ता T = 252 कारोबारी दिनों में तीन रणनीतियों की बेंचमार्क से तुलना करता है। लागत के बाद उनके औसत दैनिक प्रदर्शन-अंतर +2.0, +1.0 और −0.5 basis point हैं। विजेता का औसत 2.0 basis point है, इसलिए देखा गया आँकड़ा √252 × 2.0 bp ≈ 31.75 bp·कारोबारी दिन का √ है। यह scale test statistic का हिस्सा है; अनुमानित standard error से भाग न देने के कारण यह t-statistic नहीं है।

अब मानें कि सभी तीन उम्मीदवारों पर समान चुनी हुई तारीखें इस्तेमाल करते हुए stationary bootstrap की 9,999 प्रतिकृतियाँ बनाई गईं। इस काल्पनिक नतीजे में 1,199 प्रतिकृति-अधिकतम 31.75 के बराबर या उससे अधिक हैं। +1 सुधार वाला Monte Carlo अनुमान (1 + 1,199)/(9,999 + 1) = 0.12 है। केवल विजेता का अलग परीक्षण काल्पनिक रूप से 0.03 दे सकता है, मगर तीन उम्मीदवारों की खोज छोड़ देगा। Reality Check का p-value पूरे समूह की तुलना करता है; इस उदाहरण में 5% सीमा पर संयुक्त नल खारिज नहीं होगा।

ये संख्याएँ गणना समझाने के लिए बनाई गई हैं; ये मापा गया बाज़ार-प्रदर्शन या White के लेख का नतीजा नहीं हैं। 0.12 p-value का अर्थ रणनीति के घाटे की 12% संभावना नहीं है। इसका अर्थ है कि निर्दिष्ट bootstrap और नल-निर्माण के तहत इतना बड़ा या बड़ा अधिकतम चुने गए स्तर पर खारिज करने के लिए पर्याप्त दुर्लभ नहीं है। नमूना औसत यह भी नहीं बताता कि जोखिम, क्षमता और निष्पादन के बाद रिटर्न आर्थिक रूप से उपयोगी है या नहीं।

समायोजित p-value को तय समूह के बारे में साक्ष्य समझें

छोटा Reality Check p-value इस दावे के विरुद्ध साक्ष्य है कि शामिल समूह का कोई भी सदस्य अपेक्षित प्रदर्शन में चुने गए बेंचमार्क से बेहतर नहीं है—परीक्षण की मान्यताओं के अधीन। नल परिकल्पना संयुक्त है, इसलिए उसका खारिज होना अपने आप स्थायी लाभ वाला उम्मीदवार नहीं बताता। अलग-अलग नमूनों में विजेता बदल सकता है और समूह-स्तर की नल खारिज होने पर भी किसी एक रणनीति का साक्ष्य कमज़ोर हो सकता है।

बड़ा p-value नल को खारिज न कर पाना है, सभी रणनीतियों का बेंचमार्क के बराबर होना साबित नहीं करता। छोटा नमूना, शोरपूर्ण प्रदर्शन, बहुत बड़ा समूह, कमजोर मापन या कम power परिणाम समझा सकते हैं। p-value नल के सही होने की संभावना भी नहीं है। यह उम्मीदवार-समूह, प्रदर्शन-माप, बेंचमार्क, bootstrap डिज़ाइन और देखे गए डेटा पर निर्भर संदर्भ-वितरण के तहत tail probability है।

White का सवाल सापेक्ष है। कोई नियम कमज़ोर बेंचमार्क को हराकर भी पैसा खो सकता है, या मज़बूत बेंचमार्क से पीछे रहकर भी सकारात्मक रिटर्न दे सकता है। अनिश्चितता, turnover, drawdown, capacity और वास्तविक लागतों के साथ निरपेक्ष और बेंचमार्क-सापेक्ष नतीजे दोनों दिखाएँ। सापेक्ष predictive superiority का सांख्यिकीय साक्ष्य और निवेश की आर्थिक व्यवहार्यता अलग निर्णय हैं।

परिणाम पर भरोसा करने से पहले मान्यताएँ और सीमाएँ जाँचें

मूल सिद्धांत प्रदर्शन-अंतर की प्रक्रिया और उसकी limiting distribution के लिए नियमितता की शर्तें मानता है। White की रूपरेखा में stationary, strongly mixing समय-श्रृंखला शामिल है; dependent bootstrap को भी उपयुक्त block-length sequence चाहिए। सीमित नमूनों में बाज़ार-चक्र का बदलना, structural breaks, लंबी निर्भरता, दुर्लभ छलाँगें और अस्थिर volatility stationary resampling approximation को संदिग्ध बना सकती हैं। Block bootstrap स्थानीय निर्भरता का कुछ हिस्सा बचाता है; अज्ञात भविष्य का बाज़ार-चक्र फिर से नहीं बनाता।

डेटा और रणनीति-मूल्यांकन की गलतियाँ भी परीक्षण में बनी रहती हैं। भविष्य की जानकारी का leakage, survivorship bias, संशोधित डेटा, अवास्तविक fills, छूटी लागतें, corporate actions का गलत समायोजन और परिणाम देखने के बाद चुना गया बेंचमार्क प्रदर्शन-अंतर को अमान्य कर सकते हैं। होल्डिंग अवधि overlap होने पर रिटर्न बनावट से ही निर्भर हो सकता है; resampling unit और block length को इसे दर्शाना होगा। अंतिम माप Sharpe ratio जैसा nonlinear हो तो हर प्रतिकृति में फिर से गणना करें; यह न मानें कि औसत रिटर्न का bootstrap उसे अपने आप जाँचता है।

Reality Check के कार्यान्वयन रूढ़िवादी हो सकते हैं, विशेषकर जब बड़े समूह में कई स्पष्ट रूप से कमज़ोर विकल्प हों। अधिकतम का चौड़ा वितरण अच्छे उम्मीदवार के रहते भी खारिज करना कठिन बना सकता है। Hansen का Superior Predictive Ability test संबंधित bootstrap तरीका है, जो कमजोर विकल्पों को अलग तरह से संभालता है; यह सार्वभौमिक विकल्प नहीं और इसकी मान्यताओं की समीक्षा भी ज़रूरी है। पसंदीदा नतीजा देने वाला तरीका चुनने के बजाय शोध-प्रश्न के अनुसार विधियाँ तुलना करें और sensitivity रिपोर्ट करें।

कालानुक्रमिक validation और अन्य चयन-उपकरणों के साथ इस्तेमाल करें

White’s Reality Check पूछता है कि चयन को समायोजित करने के बाद दर्ज खोज-समूह में बेंचमार्क-सापेक्ष रूप से बेहतर उम्मीदवार है या नहीं। यह स्थिर की गई रणनीति के chronological holdout या walk-forward मूल्यांकन की जगह नहीं लेता। यह अकेले label overlap या leakage भी हल नहीं करता। PBO अलग है: यह बताता है कि combinatorial splits में in-sample विजेता कितनी बार उम्मीदवारों के median से नीचे rank करता है; PBO का मूल लेख इस चयन-जोखिम निदान को परिभाषित करता है। False-discovery प्रक्रियाएँ कई अस्वीकृतियों के बीच झूठे निष्कर्षों के अपेक्षित अनुपात को देखती हैं। Deflated Sharpe Ratio चयन और non-normal returns के लिए Sharpe-आधारित significance assessment समायोजित करता है। आगे वित्त में multiple testing और false discovery rate, PBO और CSCV, walk-forward validation, और purged cross-validation व embargo पढ़ें।

व्यावहारिक समीक्षा में बेंचमार्क और प्रदर्शन-परिभाषा स्थिर करें, वास्तव में इस्तेमाल हुए उम्मीदवार-समूह को पुनर्निर्मित करें, हर अवधि के paired differences निकालें, निर्भरता-सचेत resampling डिज़ाइन चुनकर उसका कारण बताएँ, और maximum statistic व bootstrap tail probability रिपोर्ट करें। फिर स्थिर चयन-प्रक्रिया को बाद के कालानुक्रमिक डेटा पर जाँचें और लागत तथा निष्पादन-क्षमता का अलग मूल्यांकन करें। तकनीकी ट्रेडिंग नियमों पर Sullivan, Timmermann और White का अनुप्रयोग दिखाता है कि नियमों का पूरा universe क्यों मायने रखता है: अनुमान में पूरी खोज शामिल हो, केवल प्रकाशित विजेता नहीं, तो निष्कर्ष बदल सकता है। Reality Check एक खास चयन-समस्या का सुधार है; यह प्रमाणपत्र नहीं कि बैकटेस्ट लाइव ट्रेडिंग में सफल होगा।

आम सवाल

Q1White’s Reality Check क्या जाँचता है?

यह जाँचता है कि तय खोज-समूह का सबसे अच्छा उम्मीदवार, उम्मीदवारों में चयन को ध्यान में रखते हुए, चुने हुए बेंचमार्क से बेहतर अपेक्षित प्रदर्शन करता है या नहीं।

Q2क्या छोटा Reality Check p-value रणनीति के लाभदायक होने का प्रमाण है?

नहीं। यह चुने हुए बेंचमार्क, माप, डेटा और bootstrap मान्यताओं के तहत समूह-स्तरीय no-superiority नल के विरुद्ध साक्ष्य है। यह भविष्य के रिटर्न या शुद्ध लाभ की गारंटी नहीं है।

Q3दिनों को स्वतंत्र रूप से नमूना लेने के बजाय block bootstrap क्यों?

ब्लॉक स्थानीय serial dependence का कुछ हिस्सा बचाते हैं; सभी उम्मीदवारों के लिए साझा तिथियाँ उनकी एक ही समय की निर्भरता भी बचाती हैं। ब्लॉक का डिज़ाइन फिर भी डेटा और शोध-प्रश्न के अनुरूप होना चाहिए।

स्रोत और आगे पढ़ें

समस्या की रिपोर्ट करें

हम इस लेख का लिंक जोड़कर ईमेल तैयार करेंगे। भेजने के बाद ही Mark को आपकी रिपोर्ट मिलेगी

त्वरित जाँच

गाइड पढ़ने के बाद 3 सवालों से खुद को जाँचें

सवाल 1 / 3

सवाल 01

White की संयुक्त नल परिकल्पना क्या कहती है?

व्याख्या देखने के लिए एक उत्तर चुनें

विकल्प शब्दावली

बैकटेस्ट का विजेता कितनी बार समूह के मध्यक से नीचे जाता हैबैकटेस्ट ओवरफिटिंग की संभावना (PBO) और CSCV की व्याख्याजानें कि combinatorially symmetric cross-validation PBO का अनुमान कैसे लगाता है, OOS rank को logit में कैसे बदलता है और यह भविष्य के नुकसान का पूर्वानुमान क्यों नहीं हैमात्रात्मक शोधDeflated Sharpe Ratio: कई परीक्षण और बैकटेस्ट चयनजानें कि कई परीक्षणों और गैर-सामान्य रिटर्न को ध्यान में रखते हुए रणनीति चुनने के बाद Deflated Sharpe Ratio, Sharpe के सांख्यिकीय साक्ष्य को कैसे समायोजित करता है। इसमें एक काल्पनिक गणना और स्पष्ट सीमाएँ हैं।तय करें कि वित्तीय मॉडल किस इतिहास से सीखेगावॉक-फॉरवर्ड मॉडल सत्यापन में एक्सपैंडिंग और रोलिंग विंडोवित्तीय मॉडल के लिए एक्सपैंडिंग और निश्चित लंबाई वाली रोलिंग ट्रेनिंग विंडो की तुलना करें, सत्यापन को अंतिम परीक्षण से अलग रखें और भविष्य के परिणामों के बिना नियम चुनें।ट्रेडिंग मॉडल सत्यापनPurged cross-validation और embargo: ट्रेडिंग मॉडल में label leakage रोकनासमझें कि overlapping forward labels वाले वित्तीय time series का validation कैसे करें, और purging व embargo, walk-forward, TimeSeriesSplit तथा CPCV से कैसे अलग हैं।ऑप्शन की कार्यप्रणालीऑप्शन असाइनमेंट क्या है?समझें कि बेचा गया ऑप्शन एक्सपायरी से पहले या उस दिन शेयर देने या खरीदने की जिम्मेदारी कैसे बना सकता है