Stimatori realized kernel: misurare la volatilità con il rumore di microstruttura
Scopri come i realized kernel pesano le autocovarianze dei rendimenti per stimare la variazione dei prezzi ad alta frequenza in presenza di rumore di microstruttura, con un esempio Parzen, indicazioni sulla banda e limiti pratici.
In questa guidaPerché un kernel è utile quando campionare più spesso aggiunge rumore
Breve sintesi
Un realized kernel stima la variazione dei prezzi dai rendimenti ad alta frequenza tenendo conto della dipendenza seriale causata dal rumore nelle osservazioni dei prezzi. Calcola le autocovarianze dei rendimenti a diversi ritardi e le combina con pesi kernel regolari. La banda determina quanti ritardi entrano nella somma. È una misura della variazione su un intervallo campionato basata su un modello, non una previsione della volatilità né la garanzia che ogni errore nei dati di mercato sia stato rimosso.
Perché un kernel è utile quando campionare più spesso aggiunge rumore
In assenza di rumore, sommare i quadrati dei rendimenti infragiornalieri è un modo naturale per stimare la variazione nell’intervallo osservato. Prezzi di transazione e quotazioni, però, possono riflettere l’alternanza tra bid e ask, la granularità dei prezzi, la latenza o errori di registrazione. Differenziando due prezzi rumorosi, gli errori entrano nel rendimento; due rendimenti adiacenti condividono uno di questi errori con segno opposto. Le autocovarianze seriali dei rendimenti contengono quindi informazioni sul rumore delle osservazioni.
La realized variance ordinaria usa solo il prodotto dei rendimenti al ritardo zero, cioè somma i rendimenti al quadrato. Con campionamenti molto frequenti, questa somma può accumulare rumore più rapidamente di quanto catturi nuovi movimenti del prezzo latente. Un realized kernel aggiunge al termine di ritardo zero autocovarianze pesate a ritardi positivi e negativi. Sotto ipotesi adeguate e con una banda che cresce nel modo previsto, i termini a ritardo non nullo aiutano a compensare l’effetto principale del rumore conservando la variazione del prezzo efficiente.
Barndorff-Nielsen, Hansen, Lunde e Shephard svilupparono i realized kernel per misurare ex post la variazione in presenza di frizioni di mercato nel loro articolo originale su Econometrica. Si tratta di un calcolo accurato della varianza di lungo periodo con pesi, non dell’invito a usare ogni tick senza verificare i dati. Per un riferimento più semplice sull’alta frequenza, consulta la guida al calcolo della volatilità realizzata. Questo articolo si concentra sulla correzione kernel e sulle relative scelte.
Distinguere il prezzo efficiente dal prezzo registrato
Sia \(X_t\) il log-prezzo efficiente latente e sia il log-prezzo registrato al tempo \(t_i\) \[ Y_{t_i}=X_{t_i}+\epsilon_{t_i}, \] dove \(\epsilon_{t_i}\) rappresenta il rumore di microstruttura. Un modello di base comune considera il prezzo latente un processo continuo con tasso di varianza locale \(\sigma_t^2\); l’obiettivo sull’intervallo fisso \([0,T]\) è \[ IV_T=\int_0^T \sigma_t^2\,dt. \]
La derivazione più semplice suppone che il rumore abbia media zero, sia indipendente nel tempo e dal processo del prezzo efficiente e abbia varianza stabile. Queste ipotesi rendono chiara la fonte della correzione. Nelle transazioni e nelle quotazioni reali possono non valere: il rumore può essere serialmente dipendente, variare nel tempo, essere legato al prezzo efficiente o risentire del modo in cui vengono scelti gli orari di osservazione.
Se il processo latente presenta salti, la variazione quadratica include anche i salti al quadrato. La scelta dipende dal modello e dalla domanda di ricerca. Una derivazione con prezzi continui mira alla varianza integrata; non si deve descrivere un realized kernel come separazione tra varianza continua e salti senza aggiungere una costruzione robusta ai salti. La guida alla variazione quadratica spiega la differenza fra varianza integrata e variazione totale del percorso.
Questo impianto stima una misura per un intervallo già concluso. Non ricostruisce con esattezza il prezzo latente, non prevede l’intervallo successivo e non indica il prezzo a cui si sarebbe potuto eseguire un’operazione. Anche la convenzione dei dati ad alta frequenza va documentata: transazioni, midpoint delle quotazioni o altre proxy possono produrre serie di rendimenti e proprietà del rumore differenti.
Le autocovarianze dei rendimenti rivelano il disegno del rumore
Per \(n\) rendimenti osservati \(r_i=Y_{t_i}-Y_{t_{i-1}}\), definiamo la somma non normalizzata delle autocovarianze al ritardo \(h\): \[ \Gamma_h=\sum_{i=h+1}^{n} r_i r_{i-h}, \qquad \Gamma_{-h}=\Gamma_h. \] Al ritardo zero, \(\Gamma_0=\sum_{i=1}^n r_i^2\), cioè la realized variance ordinaria. Al ritardo uno, i prodotti riguardano rendimenti adiacenti. Con rumore additivo indipendente sui prezzi, la componente di rumore in rendimenti contigui ha segni opposti: un errore di osservazione positivo alza un rendimento e abbassa quello successivo. Questo spesso genera un’autocovarianza di ritardo uno negativa. Più in generale, i pattern su diversi ritardi possono mostrare come il rumore influisca sulla sequenza dei rendimenti.
Le somme per ritardo non sono divise per il numero di prodotti. Questo è importante perché il realized kernel le combina sulla stessa scala della somma di realized variance. Lo stimatore è legato a uno stimatore di varianza di lungo periodo robusto a eteroschedasticità e autocorrelazione, ma non è una somma arbitraria di autocorrelazioni campionarie normalizzate. La gestione degli estremi e la convenzione precisa di somma fanno parte dello stimatore.
Le autocovarianze non indicano quale singolo tick sia “rumore” e quale “segnale”: aggregano prodotti incrociati nell’intervallo. Una \(\Gamma_1\) negativa è compatibile con l’alternanza bid–ask, ma da sola non dimostra un meccanismo specifico. Se i rendimenti veri sono serialmente dipendenti o il rumore ha un’altra struttura, la stessa autocovarianza può riflettere più effetti. La stima dipende dal modello dichiarato e dai pesi kernel, non da una diagnosi diretta del mercato per ciascun ritardo.
Pesi kernel regolari combinano ritardi vicini e lontani
Per un ritardo massimo \(H\), una convenzione comune per campioni finiti definisce \[ \widehat{IV}_{RK}(H)=\Gamma_0+2\sum_{h=1}^{H} k\!\left(\frac{h}{H}\right)\Gamma_h. \] Il fattore 2 include i termini simmetrici a ritardo negativo. \(k(x)\) è un peso kernel per \(0\le x\le1\), con \(k(0)=1\) e pesi che calano gradualmente verso zero vicino alla banda. Articoli e software possono usare convenzioni leggermente diverse per estremi e indici, ad esempio \(H+1\) al denominatore. Per riprodurre un risultato, dichiara la convenzione e applicala con coerenza.
Una scelta non negativa comune è il kernel di Parzen: \[ k(x)= \begin{cases} 1-6x^2+6x^3, & 0\le x\le \tfrac12,\\ 2(1-x)^3, & \tfrac12 < x\le1,\\ 0, & x>1. \end{cases} \] Assegna pesi elevati ai ritardi brevi e riduce in modo regolare quelli più lontani. Questa attenuazione graduale è utile perché il rumore ad alta frequenza può creare dipendenza tra rendimenti, mentre le stime sui ritardi lontani sono via via più variabili. La costruzione Parzen non negativa è progettata affinché la stima univariata realized-kernel resti non negativa nell’implementazione dichiarata. Altri kernel non hanno necessariamente la stessa proprietà. Un kernel flat-top può avere buone caratteristiche di bias, ma dare una stima negativa in un campione finito.
La figura associata illustra questa attenuazione: i contributi dei ritardi vicini sono evidenziati e quelli più lontani sfumano. Non è un grafico di rendimenti misurati, di pesi empirici di un campione specifico o di un risultato di stima della volatilità.
<!-- learn:illustration -->

La banda determina il compromesso fra bias e varianza
La banda \(H\) è il ritardo massimo incluso nella somma. Se è troppo piccola, lo stimatore può lasciare parte della dipendenza seriale dovuta al rumore di osservazione. Se è troppo grande, aggiunge prodotti tra ritardi rumorosi e può aumentare la varianza campionaria. La banda è quindi una scelta statistica di tuning, non il numero di osservazioni da eliminare né un intervallo temporale valido per ogni attività.
Nella teoria asintotica del realized kernel di Parzen, la banda ottimale cresce all’ordine di \(n^{3/5}\). Un’espressione pratica usata in letteratura è \[ H^*=c^*\,\xi^{4/5}n^{3/5}, \qquad c^*_{\text{Parzen}}=3.5134, \] dove \(n\) è il numero di rendimenti sulla griglia fine e \(\xi\) riassume il livello relativo di rumore e la quarticità del prezzo latente. Una possibile scala è \[ \xi^2=\frac{\omega^2}{\sqrt{T\int_0^T\sigma_u^4\,du}}, \] con \(\omega^2\) varianza del rumore di osservazione. In pratica queste quantità non sono note e vanno stimate, spesso con stime preliminari della varianza del rumore e della quarticità integrata. La formula spiega perché il numero ottimale di ritardi dipende sia dalla dimensione del campione sia dal rapporto rumore-segnale; non fornisce un’impostazione universale.
Il disegno asintotico richiede che la banda cresca ma resti piccola rispetto al campione, in genere \(H\to\infty\) e \(H/n\to0\). La regola \(n^{3/5}\) bilancia bias e varianza principali sotto il modello e le condizioni sul kernel del lavoro di riferimento. In una singola sessione finita, una stima plug-in può essere instabile se la stima preliminare di rumore o quarticità è scadente. Riporta \(H\) scelto, convenzione, input preliminari e sensibilità rispetto ad alternative difendibili.
Un calcolo ipotetico con quattro rendimenti
Consideriamo una sequenza ipotetica volutamente piccola, espressa in punti base: \[ (r_1,r_2,r_3,r_4)=(1,-1,1,-1)\ \mathrm{bp}. \] Serve soltanto a controllare l’aritmetica: non è un dato di mercato e quattro rendimenti sono troppo pochi per giustificare la scelta asintotica della banda. La somma al ritardo zero è \[ \Gamma_0=1^2+(-1)^2+1^2+(-1)^2=4\ \mathrm{bp}^2. \]
I prodotti al ritardo uno sono tutti \(-1\), quindi \(\Gamma_1=-3\ \mathrm{bp}^2\). Al ritardo due, i prodotti sono \(r_3r_1=1\) e \(r_4r_2=1\), perciò \(\Gamma_2=2\ \mathrm{bp}^2\).
Poniamo \(H=2\) solo per mostrare la formula. Per il kernel Parzen, \(k(1/2)=1-6(1/4)+6(1/8)=1/4\), mentre \(k(1)=0\). Quindi \[ \widehat{IV}_{RK}=4+2\left(\tfrac14\right)(-3)+2(0)(2) =2.5\ \mathrm{bp}^2. \]
La realized variance semplice è \(4\ \mathrm{bp}^2\); in questo esempio il termine negativo pesato al ritardo uno abbassa la stima kernel. La somma al ritardo due non contribuisce perché il peso Parzen sul bordo è zero. Il risultato è non negativo, ma questo calcolo non dimostra che coincida con la variazione latente del prezzo efficiente. Il percorso latente non è osservato, non è stato calcolato un intervallo di incertezza e non ne derivano previsioni o conclusioni operative. La radice quadrata, circa \(1.58\) bp, è solo una scala di deviazione standard per l’intervallo ipotetico.
L’esempio mostra anche perché banda e regola di indicizzazione devono accompagnare la stima. Un altro \(H\), una diversa convenzione sugli estremi o rendimenti diversi cambiano pesi e prodotti inclusi. Il risultato è riproducibile perché sono mostrati tutti i rendimenti, le somme per ritardo, i pesi e le unità.
La gestione degli estremi e la pulizia dei dati fanno parte del metodo
Le somme non normalizzate per ritardo possono dare un’influenza sproporzionata alle osservazioni agli estremi, soprattutto se la prima o l’ultima quotazione registrata contiene un grande errore di rumore. I lavori pratici sui realized kernel discutono la media locale, spesso chiamata jittering, per ridurre gli effetti di bordo. Una realizzazione comune sostituisce un prezzo estremo con una media locale delle osservazioni vicine prima di calcolare i rendimenti. Ampiezza della finestra e scelta di mediare uno o entrambi gli estremi sono decisioni operative da descrivere, non convenzioni da lasciare implicite.
La pulizia può contare quanto la formula. Una singola transazione errata, quotazione obsoleta, mercato incrociato, timestamp duplicato o errore di scala del prezzo crea rendimenti e prodotti per ritardo che entrano in più somme. Documenta campo prezzo, allineamento dei timestamp, confini di sessione, duplicati, filtri e trattamento di aste e chiusure. Le regole di pulizia vanno definite indipendentemente dal fatto che rendano la stima finale più plausibile.
Lo studio pratico sui realized kernel del 2009 esamina dati di transazioni e quotazioni, effetti di bordo, trend locali e kernel Parzen non negativo. La lezione pratica è che “robusto al rumore” non significa “indifferente ai dati”. Una componente di prezzo che si muove gradualmente in una finestra corta, frizioni di mercato variabili o il modo in cui sono costruite le quotazioni possono mettere in dubbio l’interpretazione di base. Il jittering può ridurre un problema agli estremi, ma non corregge una serie disallineata né un’osservazione errata nel mezzo del campione.
Ipotesi del modello e limiti importanti
La teoria classica si basa su ipotesi relative al processo di prezzo latente, al campionamento, al rumore, alla regolarità del kernel e alla banda. Alcune costruzioni realized-kernel sono robuste a forme più ampie di rumore serialmente dipendente e a tempi di osservazione endogeni rispetto al semplice esempio di rumore indipendente. Questa robustezza è specifica del teorema: kernel e banda devono rispettare le condizioni pertinenti. Lo studio di Aït-Sahalia, Mykland e Zhang sul rumore di microstruttura dipendente aiuta a capire perché la dipendenza del rumore vada trattata esplicitamente, senza supporre che ogni estensione segua automaticamente dalla formula di base.
La scelta del kernel conta. Parzen è comune per ottenere una stima univariata non negativa. I pesi flat-top possono puntare a proprietà di bias diverse e dare stime negative in campioni finiti. Non sostituire un kernel HAC arbitrario per analogia: la letteratura sui realized kernel spiega che alcune scelte apparentemente familiari, incluso Bartlett nella costruzione analizzata, non danno lo stesso risultato di consistenza. Se la stima è negativa, indica il kernel e la regola di campione finito; non troncarla senza dirlo né chiamarla varianza fisica negativa.
Il risultato eredita anche i limiti della proxy di prezzo e dell’obiettivo. I salti possono far parte della variazione quadratica; gli outlier possono dominare i prodotti; osservazioni irregolari o asincrone possono cambiare la quantità stimata; volatilità e rumore possono variare nell’intervallo. Un realized kernel univariato non risolve da solo il campionamento multivariato asincrono, non elimina i salti e non distingue l’alternanza bid–ask da ogni altra fonte di dipendenza dei rendimenti. Uno stimatore è robusto entro un modello dichiarato, non contro ogni possibile difetto dei dati.
Riporta una stima sull’intervallo, non una previsione o una quotazione di esecuzione
Un rapporto riproducibile specifica la serie dei prezzi e il disegno di campionamento, la finestra osservata, le unità dei rendimenti, la funzione kernel, il lag massimo \(H\), la convenzione sugli estremi, la regola di media locale e la pulizia. Se si usa una banda plug-in, indica gli input stimati di rumore e quarticità o dettagli sufficienti per ricalcolarli. Chiarisci se il risultato è una stima di varianza integrata, una stima di variazione quadratica che include salti o una misura di volatilità trasformata.
La stima descrive la variazione nell’intervallo campionato. Non è una stima della volatilità futura, a meno che un modello previsionale separato colleghi le misure storiche a un orizzonte futuro e venga valutato fuori campione. Non è una quotazione di spread né una stima dei costi di esecuzione: la guida allo spread bid–ask di Roll usa l’autocovarianza dei rendimenti per stimare una quantità diversa. La guida alla volatilità realizzata a due scale offre un’altra correzione robusta al rumore con struttura differente.
La decisione centrale non è semplicemente se usare un realized kernel. È se dati di prezzo, campionamento, obiettivo, kernel e banda sono abbastanza adatti alla domanda di ricerca da sostenere l’interpretazione riportata. Una tabella di sensibilità e limiti espliciti rendono il giudizio più verificabile. Anche una stima accurata resta una misura storica con incertezza campionaria: non prova l’esistenza di una regola di trading redditizia e non garantisce che gli effetti di microstruttura siano scomparsi.
Domande frequenti
Q1Un realized kernel elimina tutto il rumore di microstruttura?
No. Può ridurne l’effetto con ipotesi specifiche, un kernel adatto e una banda adeguata. Errori nei dati, rumore variabile o dipendente, problemi di campionamento e un modello errato possono comunque influire sulla stima.
Q2Il kernel Parzen è la stessa cosa della banda?
No. Il kernel è la funzione che assegna pesi relativi ai ritardi. La banda è il ritardo massimo incluso e determina l’intervallo su cui quei pesi si attenuano.
Q3Perché due implementazioni possono riportare realized kernel diversi?
Possono usare bande, indici degli estremi, finestre di jittering, campi prezzo, regole di pulizia o convenzioni kernel differenti. Queste scelte cambiano le somme di autocovarianze e vanno documentate.
Q4Una stima realized-kernel è una previsione di volatilità?
Non da sola. Misura la variazione nell’intervallo osservato. Per prevedere un orizzonte futuro servono un modello separato e una valutazione fuori campione.
Fonti e approfondimenti
Segnala un problema
Prepareremo un’e-mail con il link a questo articolo. Mark riceverà la segnalazione solo dopo l’invio
Controllo rapido
Hai finito la guida? Verifica ciò che hai capito con 3 domande
Domanda 01
Che cosa aggiunge un realized kernel alla somma ordinaria della realized variance?
Scegli una risposta per vedere la spiegazione
Glossario delle opzioni
Volatility calculated from price changes that occurred under a stated return, sampling-window, and annualization rule; different conventions can produce different values.
Leggi la guida completaQuadratic variationThe limit of sums of squared process increments over increasingly fine partitions, measuring accumulated second-order path variation and generating Itô corrections.
Leggi la guida completa