Gerealiseerde kernelestimators: volatiliteit meten met microstructuurruis
Lees hoe gerealiseerde kernels retourautocovarianties wegen om prijsvariatie bij hoge frequentie onder microstructuurruis te schatten, met een Parzen-voorbeeld, richtlijnen voor de bandbreedte en praktische beperkingen.
In deze gidsWaarom een kernel helpt wanneer fijnere bemonstering meer ruis toevoegt
Korte samenvatting
Een gerealiseerde kernel schat prijsvariatie uit hoogfrequente rendementen en houdt daarbij rekening met de seriële afhankelijkheid die ontstaat door ruis in prijswaarnemingen. De estimator berekent retourautocovarianties op meerdere vertragingen en combineert die met vloeiende kernelgewichten. De bandbreedte bepaalt hoeveel vertragingen meetellen. Dit is een modelgebaseerde meting van variatie over een bemonsterd interval, geen volatiliteitsprognose en geen garantie dat alle fouten in marktgegevens zijn verwijderd.
Waarom een kernel helpt wanneer fijnere bemonstering meer ruis toevoegt
Zonder ruis is het optellen van gekwadrateerde intradayrendementen een natuurlijke manier om variatie over het waargenomen interval te schatten. Transactieprijzen en quotes kunnen echter ook bid-ask-bounce, prijsdiscretie, vertraging of registratiefouten bevatten. Het verschil tussen twee ruisbevattende prijzen neemt beide waarnemingsfouten mee in het rendement; aangrenzende rendementen delen één fout met tegengesteld teken. Seriële autocovarianties van rendementen bevatten daarom informatie over de waarnemingsruis.
De gewone gerealiseerde variantie gebruikt alleen het product op vertraging nul: zij telt gekwadrateerde rendementen op. Bij zeer fijne bemonstering kan die som sneller ruis opstapelen dan nieuwe bewegingen van de latente prijs vastleggen. Een gerealiseerde kernel gebruikt de term op vertraging nul plus gewogen autocovarianties op positieve en negatieve vertragingen. Onder passende aannames en met een groeiende bandbreedte helpen de termen met een niet-nulvertraging het belangrijkste ruiseffect te compenseren terwijl de variatie van de efficiënte prijs behouden blijft.
Barndorff-Nielsen, Hansen, Lunde en Shephard ontwikkelden gerealiseerde kernels voor variatie achteraf in aanwezigheid van marktfricties in hun oorspronkelijke Econometrica-artikel. De methode is een zorgvuldig gewogen berekening van langetermijnvariantie, geen instructie om zonder datacontrole elke tick te gebruiken. Voor een eenvoudiger hoogfrequent referentiepunt, zie de gids voor de berekening van gerealiseerde volatiliteit. Dit artikel richt zich op de kernelcorrectie en de keuzes daarbij.
Scheid de efficiënte prijs van de geregistreerde prijs
Laat \(X_t\) de latente efficiënte logprijs zijn en de geregistreerde logprijs op tijdstip \(t_i\) \[ Y_{t_i}=X_{t_i}+\epsilon_{t_i}, \] waar \(\epsilon_{t_i}\) staat voor microstructuurruis. Een gebruikelijk basismodel behandelt de latente prijs als een continu proces met lokale variantiesnelheid \(\sigma_t^2\). Het doel over een vast interval \([0,T]\) is \[ IV_T=\int_0^T \sigma_t^2\,dt. \]
De eenvoudigste afleiding veronderstelt dat de ruis een gemiddelde van nul heeft, onafhankelijk is door de tijd en van het efficiënte-prijsproces, en een stabiele variantie heeft. Zo is goed te zien waar de correctie vandaan komt. Echte transacties en quotes kunnen hiervan afwijken: ruis kan serieel afhankelijk zijn, in de tijd variëren, samenhangen met de efficiënte prijs of worden beïnvloed door de keuze van waarnemingstijdstippen.
Als het latente proces sprongen bevat, omvat de kwadratische variatie ook de gekwadrateerde sprongen. Of dat het doel is, hangt af van het model en de onderzoeksvraag. Een afleiding met een continu prijsproces richt zich op geïntegreerde variantie; zeg niet dat een gerealiseerde kernel continue variantie van sprongen scheidt tenzij een sprongrobuuste constructie wordt toegevoegd. De gids voor kwadratische variatie legt het verschil uit tussen geïntegreerde variantie en de totale padvariatie.
Deze opzet schat een al afgesloten interval. Ze reconstrueert de latente prijs niet exact, voorspelt het volgende interval niet en geeft geen uitvoerbare transactieprijs. Leg ook de conventie voor de hoogfrequente invoer vast: transacties, quote-midpoints of andere prijsproxies kunnen verschillende rendementsreeksen en ruiseigenschappen opleveren.
Retourautocovarianties laten het ruispatroon zien
Voor een reeks van \(n\) waargenomen rendementen \(r_i=Y_{t_i}-Y_{t_{i-1}}\) definiëren we de niet-genormaliseerde som van autocovarianties op vertraging \(h\): \[ \Gamma_h=\sum_{i=h+1}^{n} r_i r_{i-h}, \qquad \Gamma_{-h}=\Gamma_h. \] Op vertraging nul is \(\Gamma_0=\sum_{i=1}^n r_i^2\), de gewone gerealiseerde variantie. Op vertraging één worden aangrenzende rendementen met elkaar vermenigvuldigd. Bij additieve onafhankelijke prijsruis hebben de ruiscomponenten in aangrenzende rendementen tegengestelde tekens: een positieve waarnemingsfout verhoogt het ene rendement en verlaagt het volgende. Dit leidt vaak tot een negatieve autocovariantie op vertraging één. Meer algemeen kunnen patronen over meerdere vertragingen laten zien hoe ruis de rendementsreeks beïnvloedt.
De sommen per vertraging worden niet gedeeld door het aantal producten. Dat is belangrijk omdat de gerealiseerde kernel ze op dezelfde schaal combineert als de gerealiseerde-variantiesom. De estimator hangt samen met een HAC-estimator voor langetermijnvariantie, maar is niet zomaar een willekeurige som van genormaliseerde steekproefautocorrelaties. Eindpuntbehandeling en de precieze somconventie horen bij de definitie van de estimator.
Autocovarianties geven niet aan welke afzonderlijke tick “ruis” en welke “signaal” is; ze aggregeren kruisproducten over het interval. Een negatieve \(\Gamma_1\) is verenigbaar met bid-ask-bounce, maar bewijst op zichzelf geen bepaald mechanisme. Als echte rendementen serieel afhankelijk zijn of de ruis een andere structuur heeft, kunnen meerdere effecten dezelfde autocovariantie veroorzaken. De schatting steunt op het opgegeven model en de kernelgewichten, niet op een directe diagnose van de markt per vertraging.
Vloeiende kernelgewichten combineren nabije en verre vertragingen
Voor een maximale vertraging \(H\) definieert een gebruikelijke eindige-steekproefconventie \[ \widehat{IV}_{RK}(H)=\Gamma_0+2\sum_{h=1}^{H} k\!\left(\frac{h}{H}\right)\Gamma_h. \] De factor 2 neemt de symmetrische termen met negatieve vertraging mee. \(k(x)\) is een kernelgewicht op \(0\le x\le1\), met \(k(0)=1\) en gewichten die richting de bandbreedtegrens vloeiend naar nul aflopen. Artikelen en software kunnen iets andere endpoint- en indexconventies gebruiken, bijvoorbeeld \(H+1\) in de noemer. Vermeld de conventie en pas die consequent toe om een resultaat te reproduceren.
Een veelgebruikte niet-negatieve keuze is de Parzen-kernel: \[ k(x)= \begin{cases} 1-6x^2+6x^3, & 0\le x\le \tfrac12,\\ 2(1-x)^3, & \tfrac12 < x\le1,\\ 0, & x>1. \end{cases} \] Deze geeft korte vertragingen veel gewicht en verlaagt het gewicht voor langere vertragingen geleidelijk. Die vloeiende taper is nuttig omdat hoogfrequente ruis afhankelijkheid tussen rendementen kan veroorzaken, terwijl schattingen voor verre vertragingen steeds variabeler worden. De niet-negatieve Parzen-constructie is zo ontworpen dat de univariate gerealiseerde-kernelschatting onder de opgegeven implementatie niet-negatief blijft. Andere kernels hebben die eigenschap niet per se. Een flat-top-kernel kan gunstig biasgedrag hebben, maar in een eindige steekproef een negatieve schatting opleveren.
De illustratie bij deze gids is een analogie voor de taper: bijdragen van nabije vertragingen worden benadrukt en die van verder weg vervagen. Het is geen grafiek van gemeten rendementen, empirische gewichten uit een bepaalde steekproef of uitvoer van een volatiliteitsschatting.
<!-- learn:illustration -->

De bandbreedte bepaalt de afruil tussen bias en variantie
De bandbreedte \(H\) is de grootste vertraging die in de som zit. Is ze te klein, dan kan de estimator belangrijke seriële afhankelijkheid door waarnemingsruis onvoldoende corrigeren. Is ze te groot, dan worden extra ruisgevoelige lagproducten opgenomen en kan de steekproefvariantie stijgen. De bandbreedte is dus een statistische tuningkeuze, geen aantal waarnemingen om weg te laten en geen tijdsinterval dat universeel voor elk activum werkt.
In de asymptotische theorie voor de Parzen-gerealiseerde kernel groeit de optimale bandbreedte van orde \(n^{3/5}\). Een praktische uitdrukking uit de literatuur is \[ H^*=c^*\,\xi^{4/5}n^{3/5}, \qquad c^*_{\text{Parzen}}=3.5134, \] waarbij \(n\) het aantal rendementen op het fijne raster is en \(\xi\) het relatieve ruisniveau en de quarticiteit van de latente prijs samenvat. Een schaaluitdrukking is \[ \xi^2=\frac{\omega^2}{\sqrt{T\int_0^T\sigma_u^4\,du}}, \] met \(\omega^2\) als variantie van de waarnemingsruis. In de praktijk zijn deze grootheden onbekend en moeten ze worden geschat, vaak met voorlopige schattingen van ruisvariantie en geïntegreerde quarticiteit. De formule laat zien waarom het optimale aantal vertragingen afhangt van zowel de steekproefomvang als de verhouding tussen ruis en signaal; ze levert geen vaste universele instelling.
Het asymptotische ontwerp vereist dat de bandbreedte groeit maar klein blijft ten opzichte van de steekproefomvang, vaak geschreven als \(H\to\infty\) en \(H/n\to0\). De regel \(n^{3/5}\) balanceert de leidende bias en variantie onder het model en de kernelvoorwaarden van het artikel. In één eindige sessie kan een plug-inschatting instabiel zijn wanneer de voorlopige ruis- of quarticiteitsschatting slecht is. Rapporteer de gekozen \(H\), gebruikte conventie, voorlopige invoer en een gevoeligheidsanalyse voor verdedigbare alternatieven.
Een hypothetische berekening met vier rendementen
Neem een bewust kleine hypothetische rendementsreeks, uitgedrukt in basispunten: \[ (r_1,r_2,r_3,r_4)=(1,-1,1,-1)\ \mathrm{bp}. \] Deze reeks dient alleen om de rekenstappen te controleren. Het is geen marktdata en vier rendementen zijn veel te weinig om een asymptotische bandbreedtekeuze te rechtvaardigen. De som op vertraging nul is \[ \Gamma_0=1^2+(-1)^2+1^2+(-1)^2=4\ \mathrm{bp}^2. \]
Alle producten op vertraging één zijn \(-1\), dus \(\Gamma_1=-3\ \mathrm{bp}^2\). Op vertraging twee zijn de producten \(r_3r_1=1\) en \(r_4r_2=1\), zodat \(\Gamma_2=2\ \mathrm{bp}^2\).
Neem alleen om de formule te laten zien \(H=2\). Voor de Parzen-kernel is \(k(1/2)=1-6(1/4)+6(1/8)=1/4\), terwijl \(k(1)=0\). Dan geldt \[ \widehat{IV}_{RK}=4+2\left(\tfrac14\right)(-3)+2(0)(2) =2.5\ \mathrm{bp}^2. \]
De gewone gerealiseerde variantie is \(4\ \mathrm{bp}^2\); de gewogen negatieve term op vertraging één verlaagt de kernelschatting in dit voorbeeld. De som op vertraging twee draagt niets bij omdat het Parzen-gewicht aan de grens nul is. De uitkomst is niet-negatief, maar die rekensom bewijst niet dat ze gelijk is aan de verborgen variatie van de efficiënte prijs. Het latente pad is niet waargenomen, er is geen onzekerheidsinterval berekend en er volgt geen voorspelling of handelsconclusie uit. De vierkantswortel, ongeveer \(1.58\) bp, is alleen de schaal van de standaardafwijking voor dit hypothetische interval.
Het voorbeeld laat ook zien waarom de bandbreedte en indexregel bij de schatting moeten staan. Een andere \(H\), endpointconventie of rendementsreeks verandert de gewichten en opgenomen producten. De uitkomst is reproduceerbaar doordat elk rendement, elke lagsom, elk gewicht en elke eenheid is weergegeven.
Endpointbehandeling en gegevensopschoning horen bij de methode
Niet-genormaliseerde lagsommen kunnen endpointwaarnemingen een onevenredige invloed geven, vooral als de eerste of laatste geregistreerde prijs een grote ruisfout bevat. Praktijkonderzoek naar gerealiseerde kernels bespreekt lokale middeling, vaak jittering genoemd, om endpointeffecten te beperken. Een veelgebruikte implementatie vervangt een endpoint door een lokaal gemiddelde van nabije waarnemingen voordat rendementen worden berekend. De exacte vensterlengte en de keuze om één of beide uiteinden te middelen zijn implementatiekeuzes en moeten worden beschreven.
Gegevensopschoning kan net zo belangrijk zijn als de formule. Eén foutieve transactie, verouderde quote, crossed market, dubbele tijdstempel of prijs-schaalfout kan rendementen en lagproducten opleveren die in meerdere sommen terechtkomen. Documenteer het prijsveld, de tijdstempeluitlijning, sessiegrenzen, duplicaatverwerking, filters en de behandeling van veilingen en marktstilstanden. Bepaal opschoningsregels onafhankelijk van de vraag of ze de uiteindelijke schatting plausibeler laten lijken.
De praktijkstudie naar gerealiseerde kernels uit 2009 behandelt transactie- en quotedata, endpointeffecten, lokale trends en de niet-negatieve Parzen-kernel. De praktische les is dat “robuust voor ruis” niet betekent “ongevoelig voor data”. Een geleidelijk bewegend prijscomponent in een kort venster, veranderende marktfricties of de constructie van quotes kunnen de basisinterpretatie onder druk zetten. Jittering kan één endpointprobleem beperken, maar herstelt geen verkeerd uitgelijnde reeks of foutieve waarneming midden in de steekproef.
Modelaannames en belangrijke beperkingen
De klassieke theorie steunt op aannames over het latente prijsproces, bemonstering, ruis, kernelregulariteit en bandbreedte. Sommige gerealiseerde-kernelconstructies zijn robuust voor bredere vormen van serieel afhankelijke ruis en endogene observatietijden dan het eenvoudigste voorbeeld met onafhankelijke ruis. Die robuustheid is specifiek voor een stelling: kernel en bandbreedte moeten aan de relevante voorwaarden voldoen. De studie van Aït-Sahalia, Mykland en Zhang over afhankelijke microstructuurruis helpt verklaren waarom ruisafhankelijkheid expliciet aandacht verdient in plaats van aan te nemen dat elke uitbreiding vanzelf uit de basisformule volgt.
De kernelkeuze is van belang. Parzen wordt vaak gebruikt voor een niet-negatieve univariate schatting. Flat-top-gewichten kunnen andere bias-eigenschappen nastreven en in eindige steekproeven negatieve schattingen opleveren. Vervang een willekeurige HAC-kernel niet op basis van oppervlakkige gelijkenis: de literatuur over gerealiseerde kernels laat zien dat sommige vertrouwde keuzes, waaronder Bartlett in de onderzochte constructie, niet dezelfde consistentie opleveren. Vermeld bij een negatieve schatting de kernel en de eindige-steekproefregel; kap haar niet stilzwijgend af en noem haar geen negatieve fysieke variantie.
Het resultaat erft ook de beperkingen van de prijsproxy en het doel. Sprongen kunnen deel uitmaken van kwadratische variatie; uitschieters kunnen producten domineren; onregelmatige of niet-synchrone waarnemingen kunnen de geschatte grootheid veranderen; volatiliteit of ruis kan binnen het interval variëren. Een univariate gerealiseerde kernel lost niet vanzelf multivariate niet-synchrone bemonstering op, verwijdert geen sprongen en onderscheidt bid-ask-bounce niet van alle andere bronnen van retourafhankelijkheid. Een estimator is robuust binnen een omschreven model, niet tegen elk mogelijk dataprobleem.
Rapporteer een intervalschaatting, geen voorspelling of uitvoeringsquote
Een reproduceerbaar rapport vermeldt de prijsreeks en het bemonsteringsontwerp, het observatievenster, rendementeenheden, kernelfunctie, maximale vertraging \(H\), endpointconventie, endpointmiddelingsregel en opschoning. Rapporteer bij een plug-inbandbreedte de geschatte ruis- en quarticiteitsinvoer of voldoende detail om die te reconstrueren. Maak duidelijk of de uitkomst een schatting van geïntegreerde variantie is, een schatting van kwadratische variatie inclusief sprongen of een getransformeerde volatiliteitsmaat.
De schatting beschrijft variatie over het bemonsterde interval. Het is geen schatting van toekomstige volatiliteit tenzij een afzonderlijk voorspellingsmodel historische metingen naar een toekomstige horizon vertaalt en buiten de steekproef wordt geëvalueerd. Het is ook geen spreadquote of uitvoeringskostenschatting: de gids voor de Roll-bid-askspread gebruikt retourautocovariantie om een andere grootheid te schatten. De gids voor tweeschaals gerealiseerde volatiliteit beschrijft een andere ruisrobuuste methode met een andere correctiestructuur.
De centrale vraag is niet alleen of je een gerealiseerde kernel moet gebruiken. Het gaat erom of prijsdata, bemonsteringsschema, doel, kernel en bandbreedte voldoende aansluiten bij de onderzoeksvraag om de gerapporteerde interpretatie te dragen. Een gevoeligheidstabel en expliciete modelgrenzen maken dat oordeel controleerbaar. Zelfs een zorgvuldige schatting blijft een historische meting met steekproefonzekerheid; ze bewijst geen winstgevende handelsregel en garandeert niet dat microstructuureffecten verdwenen zijn.
Veelgestelde vragen
Q1Verwijdert een gerealiseerde kernel alle microstructuurruis?
Nee. Onder bepaalde aannames, met een passende kernel en bandbreedte, kan ze het effect van ruis beperken. Datafouten, veranderende of afhankelijke ruis, bemonsteringsproblemen en modelspecificatiefouten kunnen de schatting blijven beïnvloeden.
Q2Is de Parzen-kernel hetzelfde als de bandbreedte?
Nee. De kernel is de functie die relatieve gewichten aan vertragingen toekent. De bandbreedte is de grootste opgenomen vertraging en bepaalt over welke afstand de gewichten aflopen.
Q3Waarom kunnen twee implementaties verschillende gerealiseerde kernels rapporteren?
Ze kunnen andere bandbreedten, endpointindexering, jitteringvensters, prijsvelden, opschoningsregels of kernelconventies gebruiken. Die keuzes veranderen de autocovariantiesommen en moeten worden vermeld.
Q4Is een gerealiseerde-kernelschatting een volatiliteitsprognose?
Niet op zichzelf. Ze meet variatie over het waargenomen interval. Voor een toekomstige horizon zijn een apart model en evaluatie buiten de steekproef nodig.
Bronnen en verder lezen
Probleem melden
We bereiden een e-mail met de link naar dit artikel voor. Mark ontvangt je melding pas nadat je die verstuurt
Snelle check
De gids gelezen? Test jezelf met 3 vragen
Vraag 01
Wat voegt een gerealiseerde kernel toe aan de gewone som van gerealiseerde variantie?
Kies een antwoord om de uitleg te zien
Optiewoordenlijst
Volatility calculated from price changes that occurred under a stated return, sampling-window, and annualization rule; different conventions can produce different values.
Lees de uitgebreide gidsQuadratic variationThe limit of sums of squared process increments over increasingly fine partitions, measuring accumulated second-order path variation and generating Itô corrections.
Lees de uitgebreide gids