Skip to content
Tous les guides sur les options et contrats à terme
Estimer le nombre de relations de long terme dans un système15 min read

Test de cointégration de Johansen : rang, trace et valeur propre maximale

Comprenez ce que compte le rang de cointégration dans le test de Johansen, en quoi les tests de la trace et de la valeur propre maximale diffèrent, et pourquoi le choix des retards et des termes déterministes compte.

Dans ce guideLe rang de cointégration compte les relations stationnaires indépendantes

Bref résumé

La procédure de Johansen teste le rang de la matrice de long terme dans un système multivarié de séries temporelles. Le rang \(r\) compte les combinaisons stationnaires indépendantes selon le modèle spécifié. À lui seul, il ne définit pas un portefeuille négociable, ne prouve pas une causalité et ne garantit pas qu’une relation estimée perdurera.

Le rang de cointégration compte les relations stationnaires indépendantes

Supposons que \(y_t\) contienne \(k\) variables, chacune considérée comme \(I(1)\) dans un processus générateur des données spécifié. Le rang de cointégration \(r\) correspond au nombre de combinaisons linéairement indépendantes de leurs niveaux qui sont stationnaires. Si \(r=0\), le modèle ne trouve aucune combinaison de ce type selon cette spécification. Si \(0<r<k\), il existe \(r\) relations de long terme indépendantes et, sous les conditions habituelles d’un système \(I(1)\), il reste \(k-r\) tendances stochastiques communes. Un rang de un décrit une relation à l’échelle du système, pas nécessairement une paire évidente d’actifs.

Il s’agit d’une question portant sur le système entier. La procédure d’Engle–Granger en deux étapes estime une équation de long terme normalisée, puis teste son résidu estimé. La méthode du maximum de vraisemblance de Johansen estime et teste plutôt la dimension de l’espace de cointégration dans un modèle autorégressif vectoriel ; elle peut donc représenter plusieurs relations indépendantes. Les méthodes répondent à des questions proches, mais distinctes, et peuvent différer en échantillon fini ou selon les retards et les termes déterministes retenus.

Le VECM rend le rang visible

Un VAR en niveaux peut être réécrit sous une forme simplifiée de correction d’erreur, en omettant ici les termes déterministes :

\[ \Delta y_t = \Pi y_{t-1} + \sum_{j=1}^{p-1}\Gamma_j\Delta y_{t-j}+\varepsilon_t, \qquad \Pi=\alpha\beta^{\mathsf T}. \]

Ici, \(p\) est l’ordre de retard du VAR en niveaux. Les colonnes de \(\beta\) décrivent les combinaisons de long terme, tandis que \(\alpha\) contient les coefficients d’ajustement qui relient le déséquilibre antérieur aux variations actuelles. Lorsque \(\Pi\) est de rang \(r\), elle peut se factoriser en matrices \(\alpha\) et \(\beta\) de dimension \(k\times r\). C’est le rang, et non le seul nombre de variables, qui détermine combien de termes de correction d’erreur entrent dans le système.

Si les \(k\) séries sont bien \(I(1)\), les cas de cointégration habituels vérifient \(r<k\). Un résultat de rang complet suggère que les niveaux sont stationnaires autour des termes déterministes autorisés par la spécification estimée ; il faut alors réexaminer l’hypothèse initiale sur l’ordre d’intégration. Un rang nul ne prouve pas que les variables n’ont aucun lien ; il signifie que le modèle retenu n’a pas trouvé de combinaison stationnaire des niveaux au rang testé.

Trois séries bruitées partagent une tendance de long terme tout en conservant des fluctuations de court terme distinctes.
Illustration conceptuelle d’une structure de cointégration multivariée possible ; elle ne représente pas des données de marché et ne choisit ni rang, ni relation unique, ni opération.

Les tests de la trace et de la valeur propre maximale ont des alternatives différentes

Ordonnons les valeurs propres estimées ainsi : \(1>\hat\lambda_1\ge\hat\lambda_2\ge\cdots\ge\hat\lambda_k\ge0\). Elles proviennent du problème de rang réduit de la procédure du maximum de vraisemblance. Ce ne sont pas des pourcentages ordinaires de variance expliquée. Pour un rang candidat \(r\), la statistique de la trace est

\[ \operatorname{LR}_{\mathrm{trace}}(r)=-T\sum_{i=r+1}^{k}\ln(1-\hat\lambda_i), \]

et teste \(H_0:\operatorname{rank}(\Pi)\le r\) contre \(H_A:\operatorname{rank}(\Pi)>r\). Elle cumule les éléments apportés par les valeurs propres restantes. La statistique de la valeur propre maximale est

\[ \operatorname{LR}_{\max}(r,r+1)=-T\ln(1-\hat\lambda_{r+1}), \]

et compare le rang \(r\) au rang immédiatement supérieur \(r+1\). Le test de la trace demande donc s’il existe au total plus de \(r\) relations, tandis que le test de la valeur propre maximale demande si les données étayent l’ajout de la relation suivante. Sous cette hypothèse nulle de rang, aucune de ces statistiques ne suit la loi de référence du khi-deux habituelle.

Un jeu hypothétique de valeurs propres illustre le calcul

Imaginons un système de trois variables, avec 200 observations utilisables et des valeurs propres estimées ordonnées de \(0.16\), \(0.05\) et \(0.01\). Ces nombres sont inventés pour l’apprentissage et ne sont pas des estimations de marché. Pour \(r=0\), la statistique de la trace additionne les trois termes et vaut environ \(47.14\), tandis que la statistique de la valeur propre maximale ne prend que le premier terme et vaut environ \(34.87\). Pour \(r=1\), les valeurs correspondantes sont environ \(12.27\) et \(10.26\) ; pour \(r=2\), les deux utilisent la dernière valeur propre et valent environ \(2.01\).

Le calcul fournit des statistiques de test, pas une décision sur le rang. Pour prendre cette décision, comparez chaque statistique aux valeurs critiques ou aux valeurs p correspondant exactement au cas des termes déterministes et à la séquence de tests. Par exemple, la mention « rejeter pour \(r=0\) » dans un tableau logiciel constitue un élément contre le rang nul uniquement sous les hypothèses de ce tableau et au seuil choisi ; ce n’est pas la probabilité directe qu’un écart entre actifs donné soit stationnaire. Une valeur p supérieure au seuil signifie que l’hypothèse nulle de rang n’est pas rejetée, et non qu’elle est prouvée.

L’ordre des retards et les termes déterministes définissent le système testé

Choisissez un ordre de retard VAR défendable avant d’interpréter le rang. Un VAR en niveaux d’ordre \(p\) correspond à \(p-1\) retards des différences dans le VECM. Trop peu de retards peut laisser de l’autocorrélation dans les résidus ; trop de retards consomme des degrés de liberté et peut rendre l’inférence instable en échantillon fini. Les critères d’information peuvent aider à organiser les options, mais les diagnostics des résidus, la taille de l’échantillon et le calendrier économique comptent aussi. Indiquez comment l’ordre a été choisi et examinez des solutions de rechange raisonnables.

Décidez où se trouvent les constantes et les tendances : à l’extérieur de la relation de cointégration, sous restriction à l’intérieur, ou absentes du modèle retenu. Ces cas impliquent des dynamiques de long terme et des lois de distribution différentes pour les tests de rang. Choisissez la spécification en fonction de la question et des données, pas en recherchant la valeur p la plus favorable. Utilisez des valeurs critiques adaptées au cas déterministe exact, au nombre de variables et à l’implémentation. Les statistiques de rang de Johansen ont des lois non standard. MacKinnon, Haug et Michelis calculent, par surfaces de réponse, les lois de certains tests du rapport de vraisemblance de type Johansen, notamment une extension autorisant des variables \(I(1)\) exogènes. Leurs valeurs ne s’appliquent pas automatiquement à tous les tests de rang.

L’emplacement d’un terme déterministe n’est pas une option logicielle cosmétique. Dans les paramétrisations courantes, une constante contrainte à l’intérieur de la relation de cointégration permet à la combinaison d’équilibre concernée d’avoir une moyenne non nulle ; une constante non contrainte à l’extérieur de cette relation peut autoriser une dérive déterministe différente dans les niveaux. Les restrictions sur la tendance modifient aussi la trajectoire de long terme retenue. Un tableau qui indique seulement « constante incluse » est incomplet s’il ne précise pas où elle intervient. Lisez l’équation du modèle et indiquez chaque restriction.

Les vecteurs estimés nécessitent une normalisation et une interprétation économique

L’espace de cointégration est l’objet principal de l’estimation. Dans un modèle de rang un, multiplier un vecteur \(\beta\) par une constante non nulle ne change pas la combinaison des niveaux qui est stationnaire. L’analyste choisit donc une normalisation, par exemple en fixant un coefficient à un. Lorsque le rang est supérieur, plusieurs bases peuvent engendrer le même espace ; les vecteurs affichés par un logiciel ne sont pas automatiquement des relations économiques uniques. Des restrictions ou une théorie supplémentaire sont nécessaires pour interpréter un vecteur particulier, et la normalisation doit être indiquée.

La matrice d’ajustement \(\alpha\) indique quelles variables réagissent au déséquilibre dans le système estimé. Son signe dépend de la normalisation choisie, et ses éléments sont des coefficients conditionnels du système, pas des effets causaux autonomes. Une charge faible ou nulle peut motiver une hypothèse d’exogénéité faible, mais cette conclusion exige les restrictions formelles correspondantes et le modèle retenu. Le rang de cointégration, à lui seul, n’indique pas quelle variable « mène », quelle relation a un sens économique ni comment un choc influencera les prix futurs.

Cette non-unicité tient à la factorisation, pas seulement à la façon dont les résultats sont affichés. Pour une matrice \(H\) non singulière, \(\beta H\) et \(\alpha(H^{-1})^{\mathsf T}\) produisent la même matrice de long terme \(\Pi\). L’espace estimé peut donc être identifié même si un ensemble particulier de vecteurs affichés ne l’est pas de façon unique. Choisir un vecteur comme écart négociable exige une normalisation explicite ou une restriction économique ; ses unités et son risque doivent aussi faire l’objet d’une analyse distincte.

Les décisions séquentielles et l’incertitude du modèle limitent la portée du rang

On teste généralement les rangs candidats par ordre croissant, en commençant à zéro et en poursuivant jusqu’à la première hypothèse nulle non rejetée. Le rang retenu est un choix de modèle conditionné par le seuil de signification et la spécification sélectionnés. Si les tests de la trace et de la valeur propre maximale diffèrent, rapportez les deux résultats et examinez la longueur des retards, les termes déterministes, la faible puissance, les ruptures structurelles et la sensibilité à l’échantillon, au lieu de masquer le désaccord.

Les valeurs critiques des rapports de vraisemblance sont non standard et dépendent de la spécification du système. Un comportement proche d’une racine unitaire, un échantillon court, des valeurs aberrantes, des changements de régime, des variables \(I(2)\) ou des régresseurs intégrés exogènes peuvent rendre le modèle simple \(I(1)\) inadapté. Un tableau standard des rangs ne couvre pas automatiquement ces cas. Les travaux initiaux de Johansen développent l’inférence par maximum de vraisemblance sous des hypothèses de VAR gaussien ; les calculs ultérieurs par surfaces de réponse fournissent des lois de référence pour certaines spécifications de test, pas pour tous les problèmes de données possibles.

Par exemple, si le test de la trace rejette \(r=0\) et \(r=1\), mais ne rejette pas \(r=2\), la procédure séquentielle habituelle retient le rang deux pour cette spécification et ce seuil de signification. Cela ne signifie pas que la probabilité que le vrai rang soit deux est égale à un. La séquence du test de la valeur propre maximale compare des hypothèses nulles de rangs adjacents ; il faut donc aussi présenter ses décisions. N’appliquez pas la valeur critique d’un test à la statistique de l’autre.

Le rang retenu dépend aussi de la période de l’échantillon. Une évolution de la relation économique, de la structure du marché ou de la définition des variables peut entraîner des estimations différentes dans les sous-échantillons du début et de la fin. Une analyse de sensibilité peut révéler cette instabilité, mais la recherche de nombreux points de fin ajoute un problème de tests multiples. Précisez les fenêtres définies à l’avance et traitez les découpages non planifiés comme des éléments exploratoires.

Un rang de cointégration ne constitue pas un signal de pairs trading

Dans une étude de trading, le vecteur estimé \(\beta\) peut servir de définition candidate d’un écart, mais le rang ne donne ni seuils d’entrée et de sortie, ni taille de position, ni rendement attendu. En présence de plusieurs vecteurs de cointégration, le choix d’une combinaison peut faire intervenir normalisation, contraintes et sélection des données. Les pondérations peuvent imposer des positions vendeuses, de l’effet de levier ou une faible liquidité, même si une relation statistique est estimée.

Estimez le système avec les seules informations disponibles à chaque date de décision et testez chronologiquement l’ensemble du processus de sélection et de réestimation. Vérifiez si la relation demeure stable hors échantillon et prenez en compte, si nécessaire, les dividendes, les roulements de contrats, les conversions de devises, le financement, la disponibilité des emprunts, les écarts acheteur-vendeur, l’impact de marché et le moment d’exécution. Le rejet d’une hypothèse nulle de rang constitue un élément concernant un modèle spécifié, pas une affirmation de rentabilité. Le guide sur le test d’Engle–Granger et la correction d’erreur présente l’alternative à une équation ; cointégration et corrélation en pairs trading explique pourquoi la corrélation est une propriété différente.

Indiquez assez de détails pour reproduire le test de rang

Précisez les \(k\) variables, les transformations, la fréquence d’observation, les dates de l’échantillon et les éléments justifiant l’ordre d’intégration. Indiquez l’ordre de retard du VAR en niveaux, la position des termes déterministes, la taille effective de l’échantillon, les statistiques de la trace et de la valeur propre maximale, les valeurs critiques ou valeurs p correspondantes, le seuil de signification et les décisions séquentielles sur le rang. Dites si les deux tests concordent, quel rang a été retenu pour la suite et quelles analyses de sensibilité ont modifié le résultat.

Lorsque vous présentez les vecteurs, donnez la normalisation, les restrictions et les charges d’ajustement correspondantes. Pour une application de trading, précisez les données disponibles à chaque rééquilibrage, la règle de sélection des vecteurs, le protocole hors échantillon, les coûts et la gestion des échecs. L’analyse des vecteurs de cointégration de Johansen publiée en 198890041-3) développe l’approche du maximum de vraisemblance appliquée à l’espace et au rang de cointégration. Son étude de 1991 sur les VAR gaussiens traite de l’inférence du rang et des hypothèses sur les vecteurs. MacKinnon, Haug et Michelis proposent des lois par surfaces de réponse pour les tests du rapport de vraisemblance de cointégration. D’autres guides expliquent la stationnarité et les racines unitaires.

Questions fréquentes

Q1Un rang de un signifie-t-il que deux actifs exactement forment une paire ?

Non. Il désigne une combinaison stationnaire indépendante dans l’ensemble du système. Cette relation peut inclure plusieurs variables et nécessite une normalisation interprétable.

Q2Les tests de la trace et de la valeur propre maximale doivent-ils retenir le même rang ?

Non. Leurs alternatives diffèrent et leurs résultats peuvent diverger. Présentez-les tous les deux et examinez le modèle, les retards, les termes déterministes et la sensibilité à l’échantillon.

Q3Le rejet du rang zéro prouve-t-il qu’un écart sera rentable ?

Non. Il apporte un élément contre l’hypothèse nulle d’absence de cointégration dans un modèle spécifié. Il ne fournit ni règle de trading, ni stabilité hors échantillon, ni rendement net après frais d’exécution. ---

Sources et lectures complémentaires

Signaler un problème

Nous préparons un e-mail avec le lien de cet article. Mark ne reçoit le signalement qu’après son envoi

Vérification rapide

Guide terminé ? Vérifiez vos acquis avec 3 questions

Question 1 / 3

Question 01

Que signifie un rang de cointégration égal à un dans un système de trois variables traitées comme I(1) ?

Choisissez une réponse pour voir l'explication

Glossaire des options

Comment les résidus révèlent une relation de long termeTest de cointégration d’Engle–Granger : résidus et correction d’erreurDécouvrez le test de cointégration d’Engle–Granger en deux étapes, pourquoi les tests de racine unitaire sur les résidus exigent des valeurs critiques particulières et comment interpréter un modèle à correction d’erreur.Pourquoi la co-mobilité ne suffit pas à obtenir un spread stableCointégration et corrélation dans le trading par pairesComparez la corrélation à court terme à la cointégration à long terme, notamment l'ordre d'intégration, les vecteurs de cointégration, la correction d'erreur, les tests d'Engle–Granger et de Johansen, les ratios de couverture, la stabilité du spread, les ruptures et le risque du trading par pairesTrois notions souvent traitées comme des synonymes alors qu'elles répondent à des questions différentesStationnarité, racines unitaires et retour à la moyenne en financeComprendre la stationnarité stricte et faible, les marches aléatoires, les racines unitaires, la persistance, le retour à la moyenne, la demi-vie, la régression fallacieuse, les tests ADF et KPSS, les ruptures structurelles et les diagnostics financiersFondamentaux des optionsQue veulent dire dans la monnaie, à la monnaie et hors de la monnaie ?Comprendre comment le prix d'exercice se compare au cours du sous-jacent et pourquoi le sens diffère entre options d'achat et de venteFondamentaux des optionsOption d'achat : droit de l'acheteur et risque du vendeurComprendre la différence entre acheteur et vendeur, le rôle d'un prix d'exercice à 50 $, l'effet de la prime et l'assignation