Skip to content
Alle optiegidsen
Schat het aantal langetermijnrelaties in een systeem15 min read

Johansen-cointegratietoets: rang, trace en maximale eigenwaarde

Lees wat de cointegratierang van de Johansen-toets telt, waarin de trace- en maximale-eigenwaardetoets verschillen en waarom keuzes voor vertragingen en deterministische termen ertoe doen.

In deze gidsDe cointegratierang telt onafhankelijke stationaire relaties

Korte samenvatting

De Johansen-procedure toetst de rang van de langetermijnmatrix in een multivariaat tijdreeksensysteem. Rang \(r\) telt de onafhankelijke stationaire combinaties onder het gespecificeerde model. Op zichzelf identificeert deze rang geen verhandelbare portefeuille, bewijst hij geen causaliteit en garandeert hij niet dat een geschatte relatie blijft bestaan.

De cointegratierang telt onafhankelijke stationaire relaties

Stel dat \(y_t\) \(k\) variabelen bevat die onder een gespecificeerd datagenererend proces elk als \(I(1)\) worden behandeld. De cointegratierang \(r\) is het aantal lineair onafhankelijke combinaties van hun niveaus die stationair zijn. Bij \(r=0\) vindt het model onder deze specificatie geen dergelijke combinatie. Bij \(0<r<k\) zijn er \(r\) onafhankelijke langetermijnrelaties en, onder de gebruikelijke voorwaarden voor een \(I(1)\)-systeem, blijven er \(k-r\) gemeenschappelijke stochastische trends over. Rang één betekent één relatie door het hele systeem heen, niet noodzakelijk één voor de hand liggend paar activa.

Dit is een vraag over het systeem als geheel. De tweestapsprocedure van Engle–Granger schat één genormaliseerde langetermijnvergelijking en toetst het geschatte residu daarvan. De likelihoodmethode van Johansen schat en toetst daarentegen de dimensie van de cointegratieruimte in een vectorautoregressief model, zodat ook meer dan één onafhankelijke relatie kan worden weergegeven. De methoden beantwoorden verwante maar verschillende vragen en kunnen uiteenlopen in eindige steekproeven of bij verschillende keuzes voor vertragingen en deterministische termen.

De VECM maakt de rang zichtbaar

Een VAR in niveaus kan worden herschreven als een vereenvoudigde vectorfoutcorrectievorm; deterministische termen laten we hier weg:

\[ \Delta y_t = \Pi y_{t-1} + \sum_{j=1}^{p-1}\Gamma_j\Delta y_{t-j}+\varepsilon_t, \qquad \Pi=\alpha\beta^{\mathsf T}. \]

Hier is \(p\) de vertragingsorde van de VAR in niveaus. De kolommen van \(\beta\) beschrijven langetermijncombinaties, terwijl \(\alpha\) de aanpassingscoëfficiënten bevat die de eerdere onevenwichtigheid verbinden met de huidige veranderingen. Als \(\Pi\) rang \(r\) heeft, kan de matrix worden ontbonden in matrices \(\alpha\) en \(\beta\) van \(k\times r\). De rang, en niet alleen het aantal variabelen, bepaalt hoeveel foutcorrectietermen het systeem bevat.

Als alle \(k\) reeksen daadwerkelijk \(I(1)\) zijn, geldt in de gebruikelijke cointegratiegevallen \(r<k\). Een uitkomst met volledige rang wijst erop dat de niveaus stationair zijn rond de deterministische termen die in de geschatte specificatie zijn toegestaan; dat is aanleiding om de oorspronkelijke aanname over de integratieorde opnieuw te beoordelen. Rang nul bewijst niet dat de variabelen op geen enkele manier samenhangen. Het betekent dat het gekozen model bij de getoetste rang geen stationaire combinatie van niveaus heeft gevonden.

Drie ruisende reeksen delen een langetermijntrend en behouden verschillende kortetermijnschommelingen.
Conceptuele illustratie van een mogelijke multivariate cointegratiestructuur; geen marktdata en geen gekozen rang, unieke relatie of transactie.

De trace- en maximale-eigenwaardetoets gebruiken verschillende alternatieven

Orden de geschatte eigenwaarden als \(1>\hat\lambda_1\ge\hat\lambda_2\ge\cdots\ge\hat\lambda_k\ge0\). Ze komen uit het probleem met gereduceerde rang van de likelihoodprocedure. Het zijn geen gewone percentages verklaarde variantie. Voor een kandidaat-rang \(r\) is de trace-statistiek

\[ \operatorname{LR}_{\mathrm{trace}}(r)=-T\sum_{i=r+1}^{k}\ln(1-\hat\lambda_i), \]

en toetst zij \(H_0:\operatorname{rank}(\Pi)\le r\) tegen \(H_A:\operatorname{rank}(\Pi)>r\). De statistiek telt het bewijs uit de resterende eigenwaarden bij elkaar op. De maximale-eigenwaardestatistiek is

\[ \operatorname{LR}_{\max}(r,r+1)=-T\ln(1-\hat\lambda_{r+1}), \]

en vergelijkt rang \(r\) met de eerstvolgende rang \(r+1\). De trace-toets vraagt dus of er in totaal meer dan \(r\) relaties zijn; de maximale-eigenwaardetoets vraagt of de gegevens steun bieden voor het toevoegen van de volgende relatie. Geen van beide statistieken heeft onder deze rangnulhypothese de gebruikelijke chi-kwadraatverdeling als referentieverdeling.

Een hypothetische reeks eigenwaarden laat de berekening zien

Neem een systeem met drie variabelen, 200 bruikbare waarnemingen en geschatte eigenwaarden in aflopende volgorde van \(0.16\), \(0.05\) en \(0.01\). Dit zijn verzonnen onderwijsgetallen, geen marktschattingen. Bij \(r=0\) telt de trace-statistiek alle drie termen op en is de uitkomst ongeveer \(47.14\), terwijl de maximale-eigenwaardestatistiek alleen de eerste gebruikt en ongeveer \(34.87\) bedraagt. Bij \(r=1\) zijn de waarden respectievelijk ongeveer \(12.27\) en \(10.26\); bij \(r=2\) gebruiken beide de laatste eigenwaarde en komen ze uit op ongeveer \(2.01\).

De berekening levert toetsingsgrootheden op, geen rangbeslissing. Vergelijk voor die beslissing elke statistiek met kritieke waarden of p-waarden die horen bij de exacte specificatie van de deterministische termen en de toetsvolgorde. Een softwaretabel die bijvoorbeeld meldt “verwerp bij \(r=0\)” levert alleen onder de aannames van die tabel en op het gekozen significantieniveau bewijs tegen rang nul; het is niet de rechtstreekse kans dat een bepaalde spread tussen activa stationair is. Een p-waarde boven de grens betekent dat de rangnulhypothese niet wordt verworpen, niet dat zij bewezen waar is.

De vertragingsorde en deterministische termen bepalen het getoetste systeem

Kies een verdedigbare VAR-vertragingsorde voordat je de rang interpreteert. Een VAR in niveaus met orde \(p\) komt overeen met \(p-1\) vertraagde verschillen in de VECM. Te weinig vertragingen kunnen seriële correlatie in de residuen achterlaten; te veel kosten vrijheidsgraden en kunnen de inferentie in een eindige steekproef instabiel maken. Informatiecriteria helpen kandidaatmodellen te ordenen, maar ook residudiagnostiek, steekproefomvang en economische timing zijn van belang. Vermeld hoe de orde is gekozen en controleer redelijke alternatieven.

Bepaal waar constanten en trends thuishoren: buiten de cointegratierelatie, beperkt binnen die relatie of afwezig in het aangenomen model. Deze gevallen impliceren verschillende langetermijndynamiek en verschillende verdelingen voor rangtoetsen. Kies een specificatie op basis van de vraag en de gegevens, niet door naar de gunstigste p-waarde te zoeken. Gebruik kritieke waarden die exact passen bij het deterministische geval, het aantal variabelen en de implementatie. Johansen-rangstatistieken hebben niet-standaardverdelingen. MacKinnon, Haug en Michelis berekenen via responsoppervlakken verdelingen voor gespecificeerde Johansen-achtige likelihood-ratiotoetsen, waaronder een uitbreiding met exogene \(I(1)\)-variabelen. Hun waarden zijn niet zonder meer toepasbaar op elke rangtoetsopzet.

De plaats van een deterministische term is geen cosmetische softwareoptie. In gebruikelijke parameterisaties kan een constante die binnen de cointegratierelatie is beperkt ervoor zorgen dat die evenwichtscombinatie een gemiddelde heeft dat niet nul is; een onbegrensde constante buiten die relatie kan een andere deterministische drift in de niveaus toelaten. Ook trendrestricties veranderen het aangenomen langetermijnpad. Een tabel die alleen meldt “constante opgenomen” is onvolledig als niet staat waar de constante binnenkomt. Lees de modelvergelijking en rapporteer elke restrictie.

De geschatte vectoren vragen om normalisatie en economische interpretatie

De cointegratieruimte is het centrale schattingsobject. In een model met rang één verandert vermenigvuldiging van vector \(\beta\) met een niet-nulconstante niet welke combinatie van niveaus stationair is. Daarom kiest de analist een normalisatie, bijvoorbeeld door één coëfficiënt op één te zetten. Bij een hogere rang kunnen meerdere bases dezelfde ruimte opspannen; de vectoren die software toont zijn niet automatisch unieke economische relaties. Voor de interpretatie van een bepaalde vector zijn restricties of aanvullende theorie nodig, en de normalisatie moet worden vermeld.

De aanpassingsmatrix \(\alpha\) geeft aan welke variabelen in het geschatte systeem op onevenwichtigheden reageren. Het teken hangt af van de gekozen normalisatie en de elementen zijn conditionele systeemcoëfficiënten, geen op zichzelf staande causale effecten. Een kleine of nulbelasting kan aanleiding geven tot een hypothese van zwakke exogeniteit, maar daarvoor zijn de bijbehorende formele restricties en het aangenomen model nodig. De cointegratierang alleen zegt niet welke variabele “leidend” is, welke relatie economisch betekenisvol is of hoe een schok toekomstige prijzen beïnvloedt.

De niet-uniciteit is een eigenschap van de factorisatie, niet alleen een weergavekwestie. Voor een niet-singuliere matrix \(H\) leveren \(\beta H\) en \(\alpha(H^{-1})^{\mathsf T}\) dezelfde langetermijnmatrix \(\Pi\) op. De geschatte ruimte kan dus geïdentificeerd zijn, ook als een bepaalde verzameling weergegeven vectoren niet uniek is. Om één vector als verhandelbare spread te kiezen, is een expliciete normalisatie of economische restrictie nodig; eenheden en risico moeten daarnaast afzonderlijk worden geanalyseerd.

Sequentiële beslissingen en modelonzekerheid begrenzen de rangconclusie

Kandidaatrangen worden doorgaans opeenvolgend getoetst, beginnend bij nul en oplopend totdat de eerste nulhypothese niet wordt verworpen. De gekozen rang is een modelkeuze onder het gekozen significantieniveau en de gekozen specificatie. Verschillen de uitkomsten van de trace- en maximale-eigenwaardetoets, rapporteer ze dan allebei en onderzoek de vertragingslengte, deterministische termen, geringe toetskracht, structurele breuken en gevoeligheid voor de steekproef in plaats van het verschil te verbergen.

Kritieke waarden voor likelihood-ratiotoetsen zijn niet-standaard en hangen af van de systeemspecificatie. Gedrag dicht bij een eenheidswortel, korte steekproeven, uitschieters, regimewisselingen, \(I(2)\)-variabelen of exogene geïntegreerde regressoren kunnen de eenvoudige \(I(1)\)-opzet ongeschikt maken. Een standaard rangtabel dekt die gevallen niet automatisch. Het oorspronkelijke werk van Johansen ontwikkelt likelihoodinferentie onder aannames van een Gaussiaanse VAR; latere responsoppervlakberekeningen bieden referentieverdelingen voor bepaalde toetsspecificaties, niet voor elk mogelijk gegevensprobleem.

Als de trace-toets bijvoorbeeld \(r=0\) en \(r=1\) verwerpt, maar \(r=2\) niet verwerpt, selecteert de gebruikelijke sequentie rang twee onder die specificatie en dat significantieniveau. Dat betekent niet dat de kans dat rang twee waar is gelijk is aan één. De maximale-eigenwaardetoets vergelijkt opeenvolgende rangnulhypothesen; rapporteer daarom ook de beslissingen van die toets. Pas de kritieke waarde van de ene toets niet toe op de statistiek van de andere.

De gekozen rang hangt ook af van de steekproefperiode. Veranderingen in de economische relatie, marktstructuur of variabelendefinitie kunnen tot verschillende rangschattingen in vroege en late deelsteekproeven leiden. Een gevoeligheidsanalyse kan die instabiliteit zichtbaar maken, maar zoeken over veel eindpunten veroorzaakt een extra probleem van meervoudig toetsen. Leg uit welke vensters vooraf waren gepland en behandel niet vooraf geplande splitsingen als verkennend bewijs.

Een cointegratierang is geen signaal voor pairs trading

In een handelsstudie kan de geschatte vector \(\beta\) een mogelijke definitie van een spread zijn, maar de rang geeft geen instap- en uitstapniveaus, positiegroottes of verwachte rendementen. Als er meerdere cointegratievectoren zijn, kan de keuze van één combinatie normalisatie, restricties en gegevensselectie vergen. Zelfs bij een geschatte statistische relatie kunnen de gewichten shortposities, hefboomwerking of beperkte liquiditeit inhouden.

Schat het systeem op elke beslisdatum alleen met de informatie die op dat moment beschikbaar was en toets het volledige selectie- en herschattingsproces chronologisch. Controleer of de relatie buiten de steekproef stabiel blijft en neem waar passend dividenden, contractrollen, valutaomrekening, financiering, beschikbaarheid om te lenen, bied-laatspreads, marktimpact en uitvoeringstiming mee. Verwerping van een rangnulhypothese is bewijs over een gespecificeerd model, geen winstgevendheidsclaim. De gids over de Engle–Granger-toets en foutcorrectie behandelt het alternatief met één vergelijking; cointegratie versus correlatie bij pairs trading legt uit waarom correlatie een andere eigenschap is.

Rapporteer genoeg details om de rangtoets te reproduceren

Noem de \(k\) variabelen, transformaties, waarnemingsfrequentie, steekproefdatums en het bewijs voor de integratieorde. Rapporteer de VAR-vertragingsorde in niveaus, de plaatsing van deterministische termen, de effectieve steekproefomvang, de trace- en maximale-eigenwaardestatistieken, passende kritieke waarden of p-waarden, het significantieniveau en de opeenvolgende rangbeslissingen. Vermeld of de twee toetsen overeenstemden, welke rang in de vervolganalyse is gebruikt en welke gevoeligheidscontroles de uitkomst veranderden.

Geef bij vectoren de normalisatie, restricties en bijbehorende aanpassingscoëfficiënten. Beschrijf voor een handelstoepassing welke gegevens bij elke herbalancering beschikbaar waren, de selectieregel voor vectoren, het out-of-sample-ontwerp, de kosten en de afhandeling van mislukking. Johansens analyse uit 1988 van cointegratievectoren90041-3) ontwikkelt de likelihoodbenadering voor de cointegratieruimte en rang. Zijn behandeling van Gaussiaanse VAR-modellen uit 1991 bespreekt ranginferentie en hypothesen over de vectoren. MacKinnon, Haug en Michelis geven responsoppervlakverdelingen voor likelihood-ratiotoetsen op cointegratie. Andere gidsen leggen stationariteit en eenheidswortels uit.

Veelgestelde vragen

Q1Betekent rang één dat precies twee activa een paar vormen?

Nee. Het betekent één onafhankelijke stationaire combinatie in het volledige systeem. Er kunnen meerdere variabelen in die relatie voorkomen en een interpreteerbare normalisatie is nodig.

Q2Moeten de trace- en maximale-eigenwaardetoets dezelfde rang kiezen?

Nee. Ze gebruiken verschillende alternatieven en kunnen uiteenlopen. Rapporteer beide uitkomsten en onderzoek het model, de vertragingen, deterministische termen en gevoeligheid voor de steekproef.

Q3Bewijst verwerping van rang nul dat een spread winstgevend zal zijn?

Nee. Het is bewijs tegen de nulhypothese van geen cointegratie onder een gespecificeerd model. Het levert geen handelsregels, stabiele resultaten buiten de steekproef of netto rendement na uitvoeringskosten. ---

Bronnen en verder lezen

Probleem melden

We bereiden een e-mail met de link naar dit artikel voor. Mark ontvangt je melding pas nadat je die verstuurt

Snelle check

De gids gelezen? Test jezelf met 3 vragen

Vraag 1 / 3

Vraag 01

Wat betekent een cointegratierang van één in een systeem met drie variabelen die als I(1) worden behandeld?

Kies een antwoord om de uitleg te zien

Optiewoordenlijst