Skip to content
Tutte le guide sulle opzioni
Stima il numero di relazioni di lungo periodo in un sistema15 min read

Test di cointegrazione di Johansen: rango, traccia e massimo autovalore

Scopri che cosa conta il rango di cointegrazione nel test di Johansen, in che modo differiscono i test della traccia e del massimo autovalore e perché contano la scelta dei ritardi e dei termini deterministici.

In questa guidaIl rango di cointegrazione conta le relazioni stazionarie indipendenti

Breve sintesi

La procedura di Johansen verifica il rango della matrice di lungo periodo in un sistema multivariato di serie temporali. Il rango \(r\) conta le combinazioni stazionarie indipendenti secondo il modello specificato. Da solo non identifica un portafoglio negoziabile, non dimostra la causalità e non garantisce che una relazione stimata persista.

Il rango di cointegrazione conta le relazioni stazionarie indipendenti

Supponiamo che \(y_t\) contenga \(k\) variabili, ciascuna trattata come \(I(1)\) secondo un processo di generazione dei dati specificato. Il rango di cointegrazione \(r\) è il numero di combinazioni linearmente indipendenti dei loro livelli che sono stazionarie. Se \(r=0\), con questa specifica il modello non trova combinazioni di questo tipo. Se \(0<r<k\), esistono \(r\) relazioni indipendenti di lungo periodo e, nelle condizioni usuali di un sistema \(I(1)\), restano \(k-r\) trend stocastici comuni. Un rango pari a uno indica una relazione che attraversa l'intero sistema, non necessariamente una coppia ovvia di attività.

È una domanda sul sistema. La procedura Engle–Granger in due passaggi stima una singola equazione di lungo periodo normalizzata e verifica il suo residuo stimato. Il metodo di massima verosimiglianza di Johansen stima e verifica invece la dimensione dello spazio di cointegrazione in un modello autoregressivo vettoriale; può quindi rappresentare più di una relazione indipendente. I metodi rispondono a domande correlate ma diverse e possono dare risultati discordanti in campioni finiti o con specifiche diverse per ritardi e termini deterministici.

Il VECM rende visibile il rango

Un VAR in livelli può essere riscritto in una forma semplificata di correzione dell'errore, omettendo qui i termini deterministici:

\[ \Delta y_t = \Pi y_{t-1} + \sum_{j=1}^{p-1}\Gamma_j\Delta y_{t-j}+\varepsilon_t, \qquad \Pi=\alpha\beta^{\mathsf T}. \]

Qui \(p\) è l'ordine dei ritardi del VAR in livelli. Le colonne di \(\beta\) descrivono le combinazioni di lungo periodo, mentre \(\alpha\) contiene i coefficienti di aggiustamento che collegano lo squilibrio precedente alle variazioni correnti. Se \(\Pi\) ha rango \(r\), può essere scomposta in matrici \(\alpha\) e \(\beta\) di dimensione \(k\times r\). È il rango, non il solo numero di variabili, a determinare quanti termini di correzione dell'errore entrano nel sistema.

Se tutte le \(k\) serie sono effettivamente \(I(1)\), nei consueti casi di cointegrazione vale \(r<k\). Un risultato a rango pieno indica che i livelli sono stazionari attorno ai termini deterministici ammessi dalla specifica stimata e dovrebbe indurre a verificare nuovamente l'ipotesi iniziale sull'ordine di integrazione. Un rango pari a zero non dimostra che le variabili siano prive di qualsiasi legame; significa che il modello selezionato non ha trovato una combinazione stazionaria dei livelli al rango sottoposto a test.

Tre serie rumorose condividono una tendenza di lungo periodo mantenendo oscillazioni di breve periodo distinte.
Illustrazione concettuale di una possibile struttura di cointegrazione multivariata; non sono dati di mercato e non determina rango, relazione unica o operazione.

I test della traccia e del massimo autovalore usano alternative diverse

Ordiniamo gli autovalori stimati in modo che \(1>\hat\lambda_1\ge\hat\lambda_2\ge\cdots\ge\hat\lambda_k\ge0\). Provengono dal problema a rango ridotto della procedura di massima verosimiglianza e non sono le consuete percentuali di varianza spiegata. Per un rango candidato \(r\), la statistica della traccia è

\[ \operatorname{LR}_{\mathrm{trace}}(r)=-T\sum_{i=r+1}^{k}\ln(1-\hat\lambda_i), \]

e verifica \(H_0:\operatorname{rank}(\Pi)\le r\) contro \(H_A:\operatorname{rank}(\Pi)>r\). Somma l'evidenza fornita dagli autovalori rimanenti. La statistica del massimo autovalore è

\[ \operatorname{LR}_{\max}(r,r+1)=-T\ln(1-\hat\lambda_{r+1}), \]

e confronta il rango \(r\) con quello successivo, \(r+1\). Il test della traccia chiede quindi se esistono in totale più di \(r\) relazioni; il test del massimo autovalore chiede se i dati sostengono l'aggiunta della relazione successiva. Sotto questa ipotesi nulla sul rango, nessuna delle due statistiche segue la consueta distribuzione di riferimento chi-quadrato.

Un risultato ipotetico degli autovalori mostra il calcolo

Immaginiamo un sistema a tre variabili con 200 osservazioni utilizzabili e autovalori stimati ordinati pari a \(0.16\), \(0.05\) e \(0.01\). Sono numeri inventati a scopo didattico, non stime di mercato. Con \(r=0\), la statistica della traccia somma tutti e tre i termini e vale circa \(47.14\); quella del massimo autovalore usa solo il primo e vale circa \(34.87\). Con \(r=1\), i valori corrispondenti sono circa \(12.27\) e \(10.26\); con \(r=2\), entrambe usano l'ultimo autovalore e valgono circa \(2.01\).

Il calcolo produce statistiche di test, non una decisione sul rango. Per decidere, confronta ogni statistica con i valori critici o i valori p corrispondenti all'esatto caso dei termini deterministici e alla sequenza di test. Per esempio, l'indicazione di una tabella software «rifiuta con \(r=0\)» è un'evidenza contro il rango zero solo secondo le ipotesi della tabella e al livello scelto; non è la probabilità diretta che uno specifico spread tra attività sia stazionario. Un valore p superiore alla soglia significa che non si rifiuta l'ipotesi nulla sul rango, non che sia stata dimostrata.

L'ordine dei ritardi e i termini deterministici definiscono il sistema sottoposto a test

Scegli un ordine dei ritardi VAR difendibile prima di interpretare il rango. Un VAR in livelli di ordine \(p\) corrisponde a \(p-1\) ritardi delle differenze nel VECM. Troppi pochi ritardi possono lasciare autocorrelazione nei residui; troppi ne consumano i gradi di libertà e possono rendere instabile l'inferenza in campioni finiti. I criteri informativi aiutano a organizzare le alternative, ma contano anche la diagnostica dei residui, la dimensione del campione e la tempistica economica. Indica come è stato selezionato l'ordine e verifica alternative ragionevoli.

Decidi dove collocare intercette e trend: fuori dalla relazione di cointegrazione, vincolati al suo interno oppure assenti secondo il modello assunto. Questi casi implicano dinamiche di lungo periodo e distribuzioni dei test di rango diverse. Scegli la specifica in base alla domanda e ai dati, non cercando il valore p più favorevole. Usa valori critici che corrispondano esattamente al caso deterministico, al numero di variabili e all'implementazione. Le statistiche di rango di Johansen hanno distribuzioni non standard. MacKinnon, Haug e Michelis calcolano distribuzioni basate su superfici di risposta per specifici test del rapporto di verosimiglianza di tipo Johansen, inclusa un'estensione che ammette variabili esogene \(I(1)\). I loro valori non vanno trasferiti a qualsiasi configurazione di test del rango.

La posizione di un termine deterministico non è una semplice opzione cosmetica del software. Nelle parametrizzazioni più comuni, una costante vincolata all'interno della relazione di cointegrazione permette alla combinazione di equilibrio corrispondente di avere una media diversa da zero; una costante non vincolata all'esterno della relazione può consentire una deriva deterministica diversa nei livelli. Anche i vincoli sul trend modificano il percorso di lungo periodo assunto. Una tabella che riporti solo «costante inclusa» è incompleta se non specifica dove entra la costante. Esamina l'equazione del modello e riporta ogni vincolo.

I vettori stimati richiedono normalizzazione e interpretazione economica

Lo spazio di cointegrazione è l'oggetto centrale della stima. In un modello con rango uno, moltiplicare il vettore \(\beta\) per una costante diversa da zero non cambia quale combinazione dei livelli è stazionaria. Perciò chi analizza sceglie una normalizzazione, per esempio fissando un coefficiente a uno. Con rango più elevato, molte basi possono generare lo stesso spazio; i vettori mostrati dal software non sono automaticamente relazioni economiche univoche. Per interpretare un particolare vettore servono vincoli o teoria aggiuntiva, e la normalizzazione va riportata.

La matrice di aggiustamento \(\alpha\) descrive quali variabili reagiscono allo squilibrio nel sistema stimato. Il segno dipende dalla normalizzazione scelta e gli elementi sono coefficienti condizionati del sistema, non effetti causali autonomi. Un coefficiente di aggiustamento piccolo o nullo può suggerire di verificare l'esogeneità debole, ma per concluderlo servono i relativi vincoli formali e il modello assunto. Il solo rango di cointegrazione non dice quale variabile «guida», quale relazione abbia significato economico o come uno shock influirà sui prezzi futuri.

La non unicità è una proprietà della fattorizzazione, non solo del modo in cui i risultati vengono visualizzati. Per una matrice \(H\) non singolare, \(\beta H\) e \(\alpha(H^{-1})^{\mathsf T}\) producono la stessa matrice di lungo periodo \(\Pi\). Lo spazio stimato può quindi essere identificato anche quando un particolare insieme di vettori visualizzati non è unico. Scegliere un vettore come spread negoziabile richiede una normalizzazione esplicita o un vincolo economico; le unità e il rischio vanno analizzati separatamente.

Le decisioni sequenziali e l'incertezza del modello limitano le conclusioni sul rango

Di norma i ranghi candidati vengono verificati in sequenza, partendo da zero e salendo fino alla prima ipotesi nulla non rifiutata. Il rango selezionato è una scelta di modello condizionata al livello di significatività e alla specifica adottati. Se i risultati della traccia e del massimo autovalore differiscono, riportali entrambi e indaga la lunghezza dei ritardi, i termini deterministici, la bassa potenza, le discontinuità strutturali e la sensibilità al campione invece di nascondere la divergenza.

I valori critici del rapporto di verosimiglianza sono non standard e dipendono dalla specifica del sistema. Comportamenti vicini alla radice unitaria, campioni brevi, valori anomali, cambiamenti di regime, variabili \(I(2)\) o regressori integrati esogeni possono rendere inadeguata la semplice impostazione \(I(1)\). Una tabella standard dei ranghi non copre automaticamente questi casi. I lavori originali di Johansen sviluppano l'inferenza di massima verosimiglianza sotto ipotesi di VAR gaussiano; i successivi calcoli con superfici di risposta forniscono distribuzioni di riferimento per specifiche configurazioni di test, non per ogni possibile problema nei dati.

Per esempio, se il test della traccia rifiuta \(r=0\) e \(r=1\), ma non rifiuta \(r=2\), la sequenza convenzionale seleziona il rango due per quella specifica e quel livello di significatività. Questo non significa che la probabilità che il rango vero sia due sia pari a uno. La sequenza del massimo autovalore confronta ipotesi nulle di ranghi adiacenti, quindi vanno mostrate anche le relative decisioni. Non applicare il valore critico di un test alla statistica dell'altro.

Il rango selezionato dipende anche dal periodo campionario. Cambiamenti nella relazione economica, nella struttura del mercato o nella definizione delle variabili possono produrre stime diverse nei sottocampioni iniziali e finali. L'analisi di sensibilità può rivelare l'instabilità, ma cercare molti punti finali introduce un ulteriore problema di test multipli. Spiega quali finestre erano state pianificate e tratta le suddivisioni non pianificate come evidenza esplorativa.

Un rango di cointegrazione non è un segnale di pairs trading

In uno studio di trading, il vettore stimato \(\beta\) può essere una possibile definizione di spread, ma il rango non fornisce livelli di ingresso e uscita, dimensioni delle posizioni o rendimenti attesi. Se ci sono più vettori di cointegrazione, scegliere una combinazione può richiedere normalizzazione, vincoli e selezione dei dati. Anche quando si stima una relazione statistica, i pesi possono implicare posizioni corte, leva o scarsa liquidità.

Stima il sistema usando solo le informazioni disponibili a ogni data decisionale e verifica in ordine cronologico l'intero processo di selezione e ristima. Controlla se la relazione resta stabile fuori campione e includi, quando opportuno, dividendi, rollover dei contratti, conversioni valutarie, finanziamento, disponibilità del prestito titoli, spread denaro-lettera, impatto sul mercato e tempi di esecuzione. Il rifiuto dell'ipotesi nulla sul rango è evidenza relativa a un modello specificato, non un'affermazione di redditività. La guida al test di Engle–Granger e alla correzione dell'errore tratta l'alternativa a equazione singola; cointegrazione e correlazione nel pairs trading spiega perché la correlazione è una proprietà diversa.

Riporta abbastanza dettagli da rendere riproducibile il test del rango

Specifica le \(k\) variabili, le trasformazioni, la frequenza delle osservazioni, le date del campione e gli elementi a sostegno dell'ordine di integrazione. Riporta l'ordine dei ritardi del VAR in livelli, la collocazione dei termini deterministici, la dimensione effettiva del campione, le statistiche della traccia e del massimo autovalore, i valori critici o i valori p corrispondenti, il livello di significatività e le decisioni sequenziali sul rango. Dichiara se i due test concordano, quale rango è stato usato nell'analisi successiva e quali verifiche di sensibilità hanno modificato il risultato.

Quando presenti i vettori, indica la normalizzazione, i vincoli e i relativi coefficienti di aggiustamento. Per un'applicazione di trading, dichiara quali dati erano disponibili a ogni ribilanciamento, la regola per scegliere i vettori, il disegno fuori campione, i costi e la gestione dei fallimenti. L'analisi del 1988 di Johansen sui vettori di cointegrazione90041-3) sviluppa l'approccio di massima verosimiglianza allo spazio e al rango di cointegrazione. Il suo lavoro del 1991 sui VAR gaussiani tratta l'inferenza sul rango e le ipotesi sui vettori. MacKinnon, Haug e Michelis presentano distribuzioni basate su superfici di risposta per i test del rapporto di verosimiglianza di cointegrazione. Altre guide spiegano stazionarietà e radici unitarie.

Domande frequenti

Q1Un rango uno significa che esattamente due attività formano una coppia?

No. Significa che esiste una combinazione stazionaria indipendente nell'intero sistema. La relazione può includere diverse variabili e richiede una normalizzazione interpretabile.

Q2I test della traccia e del massimo autovalore devono selezionare lo stesso rango?

No. Usano alternative diverse e possono dare risultati discordanti. Riporta entrambi ed esamina modello, ritardi, termini deterministici e sensibilità al campione.

Q3Rifiutare il rango zero dimostra che uno spread sarà redditizio?

No. È evidenza contro l'ipotesi nulla di assenza di cointegrazione sotto un modello specificato. Non fornisce regole di trading, stabilità fuori campione o rendimenti netti dei costi di esecuzione. ---

Fonti e approfondimenti

Segnala un problema

Prepareremo un’e-mail con il link a questo articolo. Mark riceverà la segnalazione solo dopo l’invio

Controllo rapido

Hai finito la guida? Verifica ciò che hai capito con 3 domande

Domanda 1 / 3

Domanda 01

In un sistema di tre variabili trattate come I(1), che cosa significa un rango di cointegrazione pari a uno?

Scegli una risposta per vedere la spiegazione

Glossario delle opzioni

Come i residui rivelano una relazione di lungo periodoTest di cointegrazione di Engle–Granger: residui e correzione degli erroriScopri come funziona il test di cointegrazione di Engle–Granger in due passaggi, perché i test di radice unitaria sui residui richiedono valori critici specifici e come interpretare un modello a correzione dell’errore.Perché co-movement È non enough Per un stable spreadcointegrazione vs correlazione in negoziazione di coppieConfronta short-run correlazione Con long-run cointegrazione, inclusi integration order, cointegrating vectors, error correction, Engle–Granger e Johansen tests, hedge rapporti, spread stability, breaks, e pairs-negoziazione rischioTre idee spesso trattate come sinonimi ma che rispondono a domande diverseStazionarietà, radici unitarie e mean reversion nella finanzaComprendi stazionarietà forte e debole, random walk, radici unitarie, persistenza, mean reversion, half-life, regressione spuriosa, test ADF e KPSS, rotture strutturali e diagnostica finanziariaFondamenti delle opzioniChe cosa significano in-the-money, at-the-money e out-of-the-money?Scopri come funzionano le etichette in-the-money, at-the-money e out-of-the-money per call e put, con esempi di valore intrinseco e punto di pareggioFondamenti delle opzioniCos'è una call?Comprendi i concetti fondamentali delle call con una definizione semplice, esempi di strike, calcolo del break-even e cosa possono cambiare assegnazione o esercizio anticipato alla fine