Skip to content
विकल्प और फ्यूचर्स की सभी गाइड
जब high-frequency observations में noise हो, तब price variation मापें15 मिनट पढ़ें

Realized Kernel Estimator: Microstructure Noise में Volatility मापना

जानें कि realized kernel return autocovariance को weight करके microstructure noise के बीच high-frequency price variation कैसे estimate करता है; साथ में Parzen उदाहरण, bandwidth चयन और सीमाएँ।

इस गाइड मेंअधिक बारीक sampling से noise क्यों बढ़ सकता है

संक्षिप्त सारांश

Realized kernel high-frequency returns से price variation estimate करता है और noisy price observations से बनने वाली serial dependence को भी ध्यान में रखता है। यह कई lags पर return autocovariances निकालकर उन्हें smooth kernel weights से जोड़ता है। Bandwidth तय करता है कि कितने lags शामिल हों। यह देखे गए interval के लिए model-based measurement है—volatility forecast नहीं और market-data की हर त्रुटि हटने की गारंटी भी नहीं।

अधिक बारीक sampling से noise क्यों बढ़ सकता है

Noise-free स्थिति में intraday returns के squares जोड़ना देखे गए interval की variation estimate करने का स्वाभाविक तरीका है। लेकिन transaction prices और quotes में bid–ask bounce, price discreteness, latency या recording errors हो सकते हैं। दो noisy prices का अंतर लेने पर उनकी errors return में आ जाती हैं। पास-पास के returns भी एक error को विपरीत चिन्हों के साथ साझा करते हैं। इसलिए serial return autocovariances में observation noise की जानकारी होती है।

सामान्य realized variance सिर्फ lag zero का product लेता है—यानी squared returns का sum। बहुत अधिक sampling frequency पर noise, latent price की नई movement पकड़ने से तेज़ी से जमा हो सकता है। Realized kernel lag-zero term के साथ positive और negative lags के weighted autocovariances जोड़ता है। उचित assumptions और bandwidth बढ़ने की शर्तों के अंतर्गत, nonzero-lag terms मुख्य noise effect को घटाने में मदद करते हैं और efficient price की variation बनाए रखते हैं।

Barndorff-Nielsen, Hansen, Lunde और Shephard ने market frictions के बीच ex post variation मापने के लिए अपने मूल Econometrica लेख में realized kernels विकसित किए। यह long-run variance जैसे autocovariance sum को सावधानी से weight करने का तरीका है, हर उपलब्ध tick को बिना जांचे लेने की सलाह नहीं। सरल high-frequency benchmark के लिए realized-volatility calculation guide देखें। यह लेख kernel correction और उसके चयन पर केंद्रित है।

Efficient price और recorded price को अलग रखें

मान लें \(X_t\) latent efficient log price है और समय \(t_i\) पर दर्ज log price है

\[ Y_{t_i}=X_{t_i}+\epsilon_{t_i}, \]

जहाँ \(\epsilon_{t_i}\) microstructure noise है। एक सामान्य baseline में latent price को local variance rate \(\sigma_t^2\) वाले continuous process के रूप में रखा जाता है। तय interval \([0,T]\) पर लक्ष्य integrated variance है:

\[ IV_T=\int_0^T \sigma_t^2\,dt. \]

सबसे सरल derivation मानती है कि noise का mean शून्य है, वह समय के साथ और efficient-price process से स्वतंत्र है, और उसका variance स्थिर है। इससे correction का कारण समझना आसान होता है। वास्तविक trades और quotes में ये मान्यताएँ टूट सकती हैं: noise serially dependent या time-varying हो सकता है, efficient price से जुड़ सकता है, या observation times चुनने के तरीके से प्रभावित हो सकता है।

यदि latent process में jumps हैं, तो quadratic variation में उनके squares भी शामिल होते हैं। यह लक्ष्य होना चाहिए या नहीं, यह model और शोध के सवाल पर निर्भर करता है। Continuous-price derivation integrated variance का लक्ष्य रखती है; jump-robust construction जोड़े बिना यह नहीं कहना चाहिए कि realized kernel continuous variance को jumps से अलग करता है। Quadratic-variation guide integrated variance और पूरे path variation का अंतर समझाती है।

यह setup एक पूरे हो चुके interval के estimate से संबंधित है। यह latent price को ठीक-ठीक वापस नहीं निकालता, अगला interval forecast नहीं करता और उस कीमत को नहीं बताता जिस पर trade execute हो सकता था। High-frequency input की परिभाषा भी दर्ज करें: trade price, quote midpoint या कोई अन्य proxy अलग return series और noise properties दे सकते हैं।

Return autocovariances में noise का pattern दिखता है

\(n\) observed returns \(r_i=Y_{t_i}-Y_{t_{i-1}}\) के लिए lag \(h\) पर unnormalized autocovariance sum इस प्रकार परिभाषित करें:

\[ \Gamma_h=\sum_{i=h+1}^{n} r_i r_{i-h}, \qquad \Gamma_{-h}=\Gamma_h. \]

Lag zero पर \(\Gamma_0=\sum_{i=1}^n r_i^2\), यानी सामान्य realized variance। Lag one पर पास के returns के products जोड़े जाते हैं। Additive independent price-noise model में पड़ोसी returns के noise components के चिन्ह विपरीत होते हैं: positive observation error एक return को बढ़ाता है और अगले को घटाता है। इसलिए lag-one autocovariance कई बार negative होता है। कई lags के serial patterns भी बता सकते हैं कि noise return sequence को कैसे प्रभावित करता है।

Lag sums को products की संख्या से divide नहीं किया जाता। यह जरूरी है ताकि realized kernel उन्हें realized-variance sum के उसी scale पर जोड़ सके। यह estimator heteroskedasticity-and-autocorrelation-consistent long-run variance estimator से संबंधित है, लेकिन मनमाने normalized sample autocorrelations का जोड़ नहीं। Endpoints और summation convention भी estimator की परिभाषा का हिस्सा हैं।

Autocovariances किसी अकेले tick को “noise” या “signal” का label नहीं देते; वे interval में cross-products जोड़ते हैं। Negative \(\Gamma_1\) bid–ask bounce के अनुरूप हो सकता है, लेकिन अपने आप किसी खास mechanism का प्रमाण नहीं है। यदि असली returns serially dependent हों या noise की संरचना अलग हो, तो वही autocovariance कई प्रभावों को दर्शा सकता है। इसलिए हर lag को सीधे market diagnosis मानने के बजाय घोषित model और kernel weighting के अनुसार estimate समझें।

Smooth kernel weights पास और दूर के lags को जोड़ते हैं

Maximum lag \(H\) के लिए finite sample में एक आम convention है:

\[ \widehat{IV}_{RK}(H)=\Gamma_0+2\sum_{h=1}^{H} k\!\left(\frac{h}{H}\right)\Gamma_h. \]

दो का factor symmetric negative-lag terms को शामिल करता है। \(k(x)\), \(0\le x\le1\) पर kernel weight है; \(k(0)=1\) से शुरू होकर bandwidth की सीमा के पास शून्य की ओर घटता है। Papers और software endpoint तथा indexing की थोड़ी अलग convention, जैसे denominator में \(H+1\), इस्तेमाल कर सकते हैं। परिणाम दोहराने के लिए convention बताएं और पूरे हिसाब में वही रखें।

Parzen kernel एक सामान्य nonnegative विकल्प है:

\[ k(x)= \begin{cases} 1-6x^2+6x^3, & 0\le x\le \tfrac12,\\ 2(1-x)^3, & \tfrac12 < x\le1,\\ 0, & x>1. \end{cases} \]

यह छोटे lags को अधिक weight देता है और दूर के lags को धीरे-धीरे कम करता है। यह taper उपयोगी है क्योंकि high-frequency noise returns के बीच dependence बना सकता है, जबकि दूर के lag estimates अधिक variable होते हैं। निर्धारित implementation में nonnegative Parzen construction univariate realized-kernel estimate को nonnegative बनाए रखने के लिए बनाया गया है। हर kernel में यह गुण नहीं होता। Flat-top kernel bias के मामले में लाभ दे सकता है, लेकिन finite sample में negative estimate भी दे सकता है।

नीचे का चित्र इस taper का रूपक है: पास के lag contributions उभरते हैं और दूर वाले धीरे फीके पड़ते हैं। यह मापे गए returns, किसी खास sample के empirical weights या volatility estimate का graph नहीं है।

<!-- learn:illustration --> <!-- Text-free concept: उज्ज्वल केंद्र से दूर जाते हुए सममित return echoes धीरे-धीरे फीके पड़ते हैं, जो सीमित bandwidth में घटते lag weights का संकेत हैं। वैचारिक चित्र; market data या estimator output नहीं। -->

उज्ज्वल केंद्र से दूर जाते हुए सममित return echoes धीरे-धीरे फीके पड़ते हैं और घटते lag weights दिखाते हैं
Return lags पर realized-kernel taper का वैचारिक चित्र। यह market data, empirical weights या estimator output नहीं है।

Bandwidth bias और variance के बीच संतुलन तय करता है

Bandwidth \(H\) sum में शामिल सबसे बड़ा lag है। बहुत छोटा हो तो observation noise की अहम serial dependence छूट सकती है। बहुत बड़ा हो तो अधिक variable lag products जुड़ते हैं और sampling variance बढ़ सकता है। इसलिए bandwidth एक statistical tuning choice है—यह हटाए जाने वाले observations की संख्या नहीं और हर asset के लिए सही समय-अंतराल भी नहीं।

Parzen realized kernel की asymptotic theory में optimal bandwidth \(n^{3/5}\) के क्रम से बढ़ता है। साहित्य में इस्तेमाल किया गया एक practical expression है

\[ H^*=c^*\,\xi^{4/5}n^{3/5}, \qquad c^*_{\text{Parzen}}=3.5134, \]

जहाँ \(n\) fine-grid returns की संख्या है और \(\xi\) relative noise level तथा latent-price quarticity को समेटता है। Scale का एक रूप है

\[ \xi^2=\frac{\omega^2}{\sqrt{T\int_0^T\sigma_u^4\,du}}, \]

जहाँ \(\omega^2\) observation-noise variance है। व्यवहार में ये मात्रा अज्ञात होती हैं और estimate करनी पड़ती हैं, अक्सर noise variance और integrated quarticity के pilot estimates से। Formula दिखाता है कि optimal lag count sample size और noise-to-signal स्थिति दोनों पर निर्भर करता है; यह कोई universal fixed setting नहीं।

Asymptotic design में bandwidth बढ़ता है लेकिन sample size की तुलना में छोटा रहता है; इसे आम तौर पर \(H\to\infty\) और \(H/n\to0\) लिखते हैं। \(n^{3/5}\) नियम लेख के model और kernel conditions के अंतर्गत leading bias और variance को संतुलित करता है। सीमित session में pilot noise या quarticity estimate खराब हो तो plug-in value अस्थिर हो सकती है। चुना हुआ \(H\), indexing convention, pilot inputs और उचित विकल्पों पर sensitivity report करें।

चार returns के साथ एक काल्पनिक गणना

केवल arithmetic समझने के लिए bp में एक जानबूझकर छोटी काल्पनिक return sequence लें:

\[ (r_1,r_2,r_3,r_4)=(1,-1,1,-1)\ \mathrm{bp}. \]

यह केवल हिसाब जांचने का उदाहरण है, market data नहीं। चार returns asymptotic bandwidth चुनने के लिए बहुत कम हैं। Lag-zero sum है

\[ \Gamma_0=1^2+(-1)^2+1^2+(-1)^2=4\ \mathrm{bp}^2. \]

Lag-one products \((-1),(-1),(-1)\) हैं, इसलिए \(\Gamma_1=-3\ \mathrm{bp}^2\)। Lag two पर \(r_3r_1=1\) और \(r_4r_2=1\), इसलिए \(\Gamma_2=2\ \mathrm{bp}^2\)।

Formula दिखाने के लिए ही \(H=2\) रखें। Parzen kernel में \(k(1/2)=1-6(1/4)+6(1/8)=1/4\), जबकि \(k(1)=0\)। इसलिए

\[ \widehat{IV}_{RK}=4+2\left(\tfrac14\right)(-3)+2(0)(2) =2.5\ \mathrm{bp}^2. \]

सामान्य realized variance \(4\ \mathrm{bp}^2\) है; इस उदाहरण में weighted negative lag-one term kernel estimate घटाता है। Lag-two sum का योगदान नहीं है, क्योंकि सीमा पर Parzen weight शून्य है। नतीजा nonnegative है, लेकिन केवल यह arithmetic latent efficient-price variation के बराबर होने को सिद्ध नहीं करता। Latent path देखा नहीं गया, uncertainty interval निकाला नहीं गया, और इससे कोई forecast या trading निष्कर्ष नहीं निकलता। इसका square root लगभग \(1.58\) bp है, जो केवल इस काल्पनिक interval का standard-deviation scale है।

यह उदाहरण दिखाता है कि bandwidth और indexing rule report करना क्यों जरूरी है। अलग \(H\), endpoint convention या returns से weights और शामिल products बदल जाते हैं। हर return, lag sum, weight और unit दिखाने से हिसाब दोहराया जा सकता है।

Endpoint treatment और data cleaning भी method का हिस्सा हैं

Unnormalized lag sums endpoints को असमान रूप से प्रभावशाली बना सकते हैं, खासकर जब पहला या आखिरी recorded price बड़ा noise error रखता हो। Realized-kernel practice papers end effect घटाने के लिए local averaging, जिसे कभी-कभी jittering कहते हैं, पर चर्चा करते हैं। एक आम implementation में returns निकालने से पहले endpoint को पास के observations के local average से बदला जाता है। Window कितना बड़ा हो और एक या दोनों ends average किए जाएँ—इन choices को बताना चाहिए।

Data cleaning formula जितनी ही महत्वपूर्ण हो सकती है। एक bad print, stale quote, crossed market, duplicate timestamp या price-scale error ऐसे returns और lag products बनाता है जो कई sums में आते हैं। Price field, timestamp alignment, session boundaries, duplicate handling, filters तथा auction या market-close treatment दर्ज करें। Cleaning rule इस आधार पर तय न करें कि उससे अंतिम estimate अधिक plausible दिखेगा या नहीं।

2009 का realized-kernel practice study trade और quote data, endpoint effects, local trends तथा nonnegative Parzen kernel पर चर्चा करता है। व्यवहारिक सीख है कि “noise robust” का अर्थ “data agnostic” नहीं। छोटे interval में धीरे-धीरे बदलता price component, बदलती market frictions या quote construction baseline interpretation को चुनौती दे सकते हैं। Jittering एक endpoint समस्या कम कर सकता है; misaligned series या sample के बीच की खराब observation ठीक नहीं करता।

Model assumptions और अहम सीमाएँ

Classical theory latent-price process, sampling, noise, kernel regularity और bandwidth के बारे में assumptions रखती है। कुछ realized-kernel constructions सरल independent-noise example से अधिक प्रकार के serially dependent noise और endogenous observation times के प्रति robust हैं। लेकिन यह robustness संबंधित theorem पर निर्भर है: लागू conditions पूरा करने वाला kernel और bandwidth चाहिए। Aït-Sahalia, Mykland और Zhang का dependent microstructure noise पर अध्ययन बताता है कि noise dependence को साफ़ तौर पर क्यों देखना चाहिए; यह नहीं मानना चाहिए कि baseline formula हर extension को अपने आप संभाल लेता है।

Kernel selection महत्वपूर्ण है। Nonnegative univariate estimate के लिए Parzen का अक्सर उपयोग होता है। Flat-top weights अलग bias properties दे सकते हैं और finite sample में negative estimates बना सकते हैं। केवल परिचित HAC kernel होने के कारण कोई भी kernel न लगाएँ: realized-kernel literature के अनुसार विश्लेषित construction में Bartlett समेत कुछ परिचित विकल्प वही consistency result नहीं देते। Estimate negative हो तो kernel और finite-sample rule बताएं; चुपचाप शून्य पर truncate न करें और इसे negative physical variance न कहें।

Estimate अपने price proxy और target की सीमाएँ भी विरासत में लेता है। Jumps quadratic variation में शामिल हो सकते हैं; outliers products पर हावी हो सकते हैं; irregular या asynchronous observations estimand बदल सकते हैं; और interval में volatility या noise बदल सकता है। Univariate realized kernel अपने आप multivariate nonsynchronous sampling हल नहीं करता, jumps नहीं हटाता और bid–ask bounce को return dependence के हर अन्य स्रोत से अलग नहीं करता। Robust estimator घोषित model के भीतर robust है, हर संभावित data defect के विरुद्ध नहीं।

Forecast या execution quote नहीं, interval measurement report करें

दोहराए जा सकने वाले report में price series और sampling design, observation window, return units, kernel function, maximum lag \(H\), endpoint convention, endpoint averaging rule और cleaning का विवरण होना चाहिए। Plug-in bandwidth हो तो estimated noise और quarticity inputs, या उन्हें दोहराने लायक विवरण दें। बताएं कि परिणाम integrated-variance estimate है, jumps सहित quadratic-variation estimate है या transformed volatility measure।

Estimate देखे गए interval की variation बताता है। अलग forecasting model historical measurements को future horizon तक map करके out-of-sample evaluate न करे, तो यह future volatility estimate नहीं। यह quoted spread या execution-cost estimate भी नहीं। Roll bid–ask spread guide return autocovariance का उपयोग करता है, लेकिन दूसरी मात्रा estimate करता है। Two-scale realized-volatility guide अलग correction structure वाला एक और noise-robust तरीका बताती है।

मुख्य सवाल केवल यह नहीं कि realized kernel इस्तेमाल करना है या नहीं। देखना यह है कि price data, sampling scheme, target, kernel और bandwidth शोध के सवाल के अनुकूल हैं और report की गई interpretation को support करते हैं या नहीं। Sensitivity table और model की स्पष्ट सीमाएँ इस फैसले की जांच आसान करती हैं। सावधानी से बनाया गया estimate भी sampling uncertainty वाला historical measurement है; यह profitable trading rule सिद्ध नहीं करता और microstructure effects पूरी तरह हटने की guarantee नहीं देता।

आम सवाल

Q1क्या realized kernel पूरा microstructure noise हटा देता है?

नहीं। निर्धारित assumptions और उचित kernel तथा bandwidth के अंतर्गत noise effect कम हो सकता है। Data errors, बदलता या dependent noise, sampling समस्याएँ और model misspecification estimate को प्रभावित कर सकते हैं।

Q2क्या Parzen kernel और bandwidth एक ही चीज़ हैं?

नहीं। Kernel वह function है जो lags को relative weights देता है। Bandwidth सबसे बड़ा शामिल lag है और तय करता है कि weight किस सीमा तक घटेंगे।

Q3दो implementations में realized-kernel estimates अलग क्यों हो सकते हैं?

उनमें bandwidth, endpoint indexing, jittering window, price field, cleaning rules या kernel convention अलग हो सकते हैं। ये विकल्प autocovariance sums बदलते हैं, इसलिए report होने चाहिए।

Q4क्या realized-kernel estimate volatility forecast है?

अपने आप में नहीं। यह देखे गए interval की variation मापता है। Future horizon forecast करने के लिए अलग model और out-of-sample evaluation चाहिए।

स्रोत और आगे पढ़ें

समस्या की रिपोर्ट करें

हम इस लेख का लिंक जोड़कर ईमेल तैयार करेंगे। भेजने के बाद ही Mark को आपकी रिपोर्ट मिलेगी

त्वरित जाँच

गाइड पढ़ने के बाद 3 सवालों से खुद को जाँचें

सवाल 1 / 3

सवाल 01

सामान्य realized-variance sum में realized kernel क्या जोड़ता है?

व्याख्या देखने के लिए एक उत्तर चुनें

विकल्प शब्दावली

अस्थिरता मापवास्तविक अस्थिरता की गणना कैसे करेंः रिटर्न, विंडोज और वार्षिककरणवास्तविक अस्थिरता सूत्र जानें, लॉग रिटर्न और वार्षिककरण सम्मेलन महत्वपूर्ण क्यों हैं, और नमूना लेने के विकल्पों की तुलना में अंतर्निहित अस्थिरता कैसे बदलती हैद्वितीय-क्रम path variationवित्त में Quadratic Variation: व्याख्याजानें कि सूक्ष्म scales पर squared path increments क्यों बने रहते हैं, Itô correction कैसे बनता है, और diffusion volatility realized variance से कैसे जुड़ती हैउच्च-आवृत्ति कीमतों में शोर के साथ समाकलित विचरण का अनुमानटू-स्केल रियलाइज़्ड वोलैटिलिटी: माइक्रोस्ट्रक्चर शोर के साथ विचरण का अनुमानजानें कि टू-स्केल रियलाइज़्ड वोलैटिलिटी, स्वतंत्र माइक्रोस्ट्रक्चर शोर के bias को घटाने के लिए सूक्ष्म और विरल price grids को कैसे जोड़ती है—काल्पनिक उदाहरण, मान्यताओं और सीमाओं सहितकारोबार के समय को एक घड़ी पर लाए बिना परिसंपत्तियों का सह-परिवर्तन मापेंHayashi–Yoshida सहप्रसरण अनुमानक: असमकालिक कीमतों की व्याख्याजानें कि अलग-अलग समय पर देखी गई परिसंपत्ति कीमतों के लिए Hayashi–Yoshida अनुमानक overlapping return intervals से समाकलित सहप्रसरण कैसे मापता है और इसकी सीमाएँ कहाँ हैं।High-frequency prices में microstructure noise को ध्यान में रखकर realized volatility estimate करेंPre-Averaging Realized Volatility: Microstructure Noise का Estimatorजानें कि pre-averaging छोटे high-frequency return windows को कैसे smooth करता है, noise के leading effect को correct करता है, window length चुनता है और TSRV तथा realized kernels से कैसे अलग है।