Test de cointégration d’Engle–Granger : résidus et correction d’erreur
Découvrez le test de cointégration d’Engle–Granger en deux étapes, pourquoi les tests de racine unitaire sur les résidus exigent des valeurs critiques particulières et comment interpréter un modèle à correction d’erreur.
Dans ce guideLa cointégration est une affirmation sur un résidu estimé
Bref résumé
La méthode d’Engle–Granger cherche à savoir si une combinaison particulière de séries non stationnaires est stationnaire. Elle estime d’abord une relation de long terme, puis teste son résidu estimé à l’aide de valeurs critiques propres à la cointégration. La détection d’une relation peut motiver un modèle à correction d’erreur, mais elle ne prouve ni que les prix doivent converger ni qu’une opération sera rentable.
La cointégration est une affirmation sur un résidu estimé
Deux séries tendancielles peuvent sembler liées parce qu’elles comportent toutes deux une tendance stochastique. La cointégration est une affirmation plus précise : si les séries prises séparément sont intégrées d’ordre un, I(1), une combinaison pondérée particulière peut être stationnaire, I(0). Cette combinaison représente l’erreur d’équilibre de long terme dans le modèle retenu. Elle fluctue autour d’une distribution stable au lieu de dériver sans limite.
La procédure d’Engle–Granger en deux étapes étudie cette affirmation au moyen d’une équation unique. La première étape estime une relation de long terme en niveaux. La seconde teste si le résidu estimé possède une racine unitaire. En échantillon fini, le test dépend du sens de la régression, car l’équation de première étape doit choisir la variable placée à gauche. Ce guide porte sur le cas classique à deux variables ; il ne remplace pas une méthode systémique lorsque plusieurs relations de cointégration sont possibles.
Vérifier d’abord les séries et les termes déterministes
La spécification habituelle suppose que les variables composantes sont I(1) : leurs niveaux sont non stationnaires selon la spécification retenue, tandis que leurs premières différences sont stationnaires. Les tests de racine unitaire sont imparfaits, surtout dans les petits échantillons et à proximité d’une rupture structurelle. Il faut donc considérer les vérifications de l’ordre d’intégration comme des éléments de preuve, et non comme un filtre mécanique. Le mélange d’une série I(0) et d’une série I(1) ne correspond pas au cas classique de cointégration I(1) présenté ici.
Selon la question économique, décidez si l’équation de long terme comporte une constante, une tendance déterministe ou ni l’une ni l’autre. Par exemple, des prix d’actifs logarithmiques peuvent justifier une constante sans tendance déterministe dans leur écart ; un agrégat économique peut nécessiter une tendance. Les termes déterministes influencent à la fois l’équilibre estimé et la distribution du test sur le résidu. Les choisir après avoir recherché une petite valeur p rend le résultat plus difficile à interpréter.
Étape 1 : estimer une équation de long terme en niveaux
Pour deux séries en niveau \(y_t\) et \(x_t\), une équation simple de première étape s’écrit
\[ y_t = a + \beta x_t + u_t. \]
Estimez \(a\) et \(\beta\) par les moindres carrés ordinaires, sous les hypothèses retenues, puis enregistrez \(\hat u_t = y_t-\hat a-\hat\beta x_t\). Si les séries sont cointégrées dans cette spécification, cette combinaison estimée devrait être stationnaire même si les niveaux individuels ne le sont pas.
Dans un exemple financier, \(y_t\) et \(x_t\) pourraient être les logarithmes d’indices de rendement total de deux actifs observés à la même fréquence. Le coefficient \(\hat\beta\) définit la combinaison de long terme estimée ; il ne représente pas automatiquement une pondération de portefeuille neutre en dollars ou peu risquée. Modifier la variable à gauche, l’échantillon, le traitement des dividendes, la devise ou la spécification de tendance peut changer l’estimation et le résidu. Il faut expliciter le sens économique de l’équation.
Étape 2 : tester le résidu avec des valeurs critiques particulières
Une régression du résidu de type Dickey–Fuller augmenté peut s’écrire ainsi :
\[ \Delta\hat u_t = \rho\hat u_{t-1} + \sum_{j=1}^{q}\phi_j\Delta\hat u_{t-j} + e_t. \]
L’hypothèse nulle d’absence de cointégration correspond à une racine unitaire dans le résidu ; l’hypothèse alternative est que le résidu estimé est stationnaire. Dans la notation simplifiée ci-dessus, une statistique de test du résidu suffisamment négative constitue un élément contre l’hypothèse nulle. Les termes retardés aident à représenter la dépendance sérielle du résidu : l’ordre des retards et les diagnostics des résidus sont donc importants. Ce choix est distinct de celui de la constante ou de la tendance dans la première étape, qui détermine le cas de valeurs critiques de cointégration. Un nombre insuffisant de retards d’augmentation peut laisser subsister une autocorrélation. Indiquez comment l’ordre des retards a été choisi et examinez des variantes plausibles, comme le discutent Agiakloglou et Newbold.
Le résidu est estimé à la première étape, ce qui modifie sa distribution sous l’hypothèse nulle. Ne comparez donc cette statistique ni aux valeurs critiques ordinaires de Dickey–Fuller ni à une valeur p générique d’ADF. Utilisez les valeurs critiques ou les valeurs p conçues pour le test résiduel d’Engle–Granger et adaptées aux termes déterministes retenus, au nombre de variables et à la taille de l’échantillon. Phillips et Ouliaris développent la théorie asymptotique des tests fondés sur les résidus ; MacKinnon fournit des valeurs critiques calculées par surfaces de réponse pour des spécifications courantes. Si les termes déterministes de la première étape ou le nombre de variables explicatives changent, la même statistique résiduelle peut être comparée à d’autres valeurs critiques de référence.
Un résultat hypothétique montre comment interpréter la décision
Supposons qu’une chercheuse étudie deux indices mensuels de prix logarithmiques sur un échantillon fixe. D’après les spécifications de racine unitaire indiquées, les deux séries semblent I(1). La régression de première étape comprend une constante et produit un résidu estimé. La statistique fondée sur ce résidu est ensuite évaluée à l’aide de la distribution d’Engle–Granger correspondant à ces termes déterministes et à cet échantillon, et non avec une table ADF habituelle.
Imaginons que le test correspondant donne une valeur p inférieure au seuil de 5 % défini à l’avance par la chercheuse. Pour cette spécification, elle rejette l’hypothèse nulle d’absence de cointégration et obtient des éléments indiquant que la combinaison estimée est stationnaire. Cette conclusion dépend de l’échantillon, du choix des retards, des termes déterministes et des hypothèses sur l’intégration. Elle ne montre ni que toutes les paires d’actifs sont liées, ni que la relation persistera hors échantillon, ni que le résidu estimé constitue un signal d’entrée rentable. Si la valeur p dépassait 5 %, l’interprétation correcte serait : « le test n’a pas rejeté l’absence de cointégration dans la spécification indiquée », et non : « il est prouvé que les séries ne sont pas liées ».
L’illustration ci-dessous est conceptuelle : des tendances stochastiques communes peuvent coexister avec un résidu borné, et les écarts à une relation estimée peuvent ensuite se resserrer. Elle ne contient aucune série mesurée et ne signifie pas que l’ajustement se produit toujours à une vitesse prévisible.

Un modèle à correction d’erreur décrit l’ajustement à court terme
Si une relation de long terme est étayée, un modèle à correction d’erreur peut combiner les variations de court terme avec l’erreur d’équilibre de la période précédente. Avec \(\hat u_{t-1}=y_{t-1}-\hat a-\hat\beta x_{t-1}\), un exemple est
\[ \Delta y_t = c + \lambda\hat u_{t-1} + \sum_{i=1}^{r}\phi_i\Delta y_{t-i} + \sum_{j=0}^{s}\theta_j\Delta x_{t-j} + \epsilon_t. \]
Ici, \(\lambda\) est le coefficient d’ajustement de \(y_t\) dans cette paramétrisation. Si \(y\) est supérieur à sa relation estimée et que \(\lambda<0\), le terme de correction d’erreur contribue à une variation négative de \(y\), toutes choses égales par ailleurs. Cette interprétation du signe repose sur la définition \(\hat u=y-\hat a-\hat\beta x\) ; inverser la convention du résidu inverse le signe du coefficient. Les coefficients de court terme décrivent d’autres réponses conditionnelles. Une autre variable peut également s’ajuster : la cointégration seule ne dit pas quel marché ou quelle variable économique supporte l’ajustement.
Ne traduisez pas mécaniquement \(\lambda\) par « l’écart se résorbe de ce pourcentage chaque mois », à moins que le modèle ait effectivement cette forme dynamique simple. Les variations retardées, la présence de plusieurs variables d’ajustement, les réponses non linéaires et les ruptures influencent la trajectoire. Une relation de long terme stable n’est pas un mécanisme causal structurel, et le coefficient d’ajustement dépend du modèle et de l’ensemble d’information spécifiés.
Le test en deux étapes a des limites de portée précises
Une spécification d’Engle–Granger à équation unique peut tester une combinaison de long terme proposée, y compris lorsqu’elle comprend une variable dépendante et plusieurs régresseurs. Avec deux variables I(1), le rang de cointégration maximal est un ; dans un système plus vaste, plusieurs vecteurs de cointégration peuvent exister. Un seul test résiduel ne détermine pas le rang complet du système. La procédure de Johansen vise cette question de rang sous ses propres hypothèses relatives au VAR et aux termes déterministes.
La normalisation de première étape importe également en échantillon fini. La régression de \(y\) sur \(x\) n’est généralement pas numériquement identique à celle de \(x\) sur \(y\), même si une relation de long terme porte conceptuellement sur une combinaison. Choisissez la normalisation pour une raison économique claire et indiquez-la. Si les conclusions changent lorsque l’équation est inversée, décrivez cette sensibilité au lieu de retenir le résultat le plus favorable.
Le test peut manquer de puissance dans un petit échantillon, et le choix des retards, les termes déterministes, les valeurs aberrantes et les ruptures structurelles peuvent influencer son résultat. Une rupture de la relation de long terme peut faire paraître instable, sur l’échantillon complet, une combinaison auparavant stationnaire. Un seul rejet est un élément de preuve sous une spécification maintenue, pas la preuve que la relation est permanente.
Un résultat de cointégration ne constitue pas une stratégie de trading prête à l’emploi
Dans une application de trading, le résidu estimé peut être appelé un spread, mais ce nom ne définit pas un portefeuille exécutable. Un spread construit à partir de prix logarithmiques diffère d’une position exprimée en valeur monétaire ; une série de prix seuls diffère d’une série de rendement total. Le coefficient de régression peut évoluer, et la stationnarité estimée ne détermine pas automatiquement un seuil d’entrée, une durée de détention, un stop ou une taille de position.
Estimez la relation de long terme uniquement avec les données disponibles à chaque date de décision. Si vous estimez le coefficient de couverture sur l’ensemble du backtest puis négociez à des dates antérieures, des observations futures contaminent le signal. Séparez chronologiquement les fenêtres de formation et d’évaluation ; tenez compte des dividendes, des divisions d’actions, de la disponibilité des titres à emprunter, du financement, de l’écart acheteur-vendeur, de l’impact de marché et du rééquilibrage ; et définissez la conduite à tenir lorsque les diagnostics signalent une rupture. La recherche parmi de nombreuses paires et fenêtres crée aussi un biais de sélection que le test de cointégration ne corrige pas.
La question pratique n’est pas seulement de savoir si un test résiduel rejette. Il faut se demander si le lien économique proposé a une raison de durer, s’il résiste à un contrôle de stabilité transparent et si une règle applicable demeure viable après prise en compte de l’incertitude et des coûts. La cointégration peut éclairer un modèle ; elle ne garantit ni convergence, ni efficacité de couverture, ni rendement.
Présenter la spécification pour permettre la réplication
Précisez les variables, les transformations, la fréquence, les dates de l’échantillon, les éléments attestant de l’ordre d’intégration et la normalisation de première étape. Indiquez les termes constants ou tendanciels, le type de test résiduel, la règle de sélection des retards, la statistique de test et la source des valeurs critiques ou valeurs p propres à la cointégration. Présentez la sensibilité à une autre valeur plausible du nombre de retards ou à une autre fenêtre d’échantillon, et mentionnez toute analyse de rupture.
Si vous estimez un modèle à correction d’erreur, définissez le terme de déséquilibre retardé et la convention de signe, indiquez les variables autorisées à s’ajuster et séparez les coefficients de court terme de la relation de long terme. Pour une étude de trading, précisez les découpages chronologiques de l’échantillon, les règles de sélection des paires, les coûts, le financement, les hypothèses d’emprunt et le traitement des échecs. Ces détails distinguent un test reproductible d’un graphique qui semble simplement montrer une convergence.
L’article original d’Engle et Granger sur la représentation, l’estimation et les tests développe le lien entre cointégration et correction d’erreur. Phillips et Ouliaris établissent la théorie asymptotique des tests de cointégration fondés sur les résidus. L’étude des valeurs critiques de MacKinnon présente des valeurs par surfaces de réponse qui dépendent de la taille de l’échantillon et de la spécification du test. Agiakloglou et Newbold étudient la structure des retards du test de Dickey–Fuller augmenté90022-Q). Pour un système susceptible de comporter plusieurs relations, voir l’analyse des vecteurs de cointégration de Johansen90041-3). D’autres guides expliquent cointégration et corrélation dans le trading par paires, les racines unitaires et le retour à la moyenne ainsi que les projections locales pour les réponses impulsionnelles.
Questions fréquentes
Q1Puis-je appliquer des valeurs critiques ordinaires d’ADF au résidu estimé ?
Non. L’estimation préalable de la relation de long terme modifie la distribution nulle du test résiduel. Utilisez des valeurs adaptées à la spécification d’Engle–Granger retenue.
Q2Un résultat significatif d’Engle–Granger prouve-t-il qu’une paire va converger ?
Non. Il apporte des éléments en faveur d’une combinaison estimée stationnaire selon les hypothèses du test et dans l’échantillon étudié. Les ruptures, l’erreur d’estimation et les nouvelles données peuvent modifier la relation.
Q3Quand utiliser plutôt Johansen ?
Lorsqu’un système comporte plus de deux variables ou plusieurs relations de cointégration possibles, une méthode de rang systémique telle que Johansen répond à une question différente de celle d’une relation unique fondée sur les résidus.
Sources et lectures complémentaires
Signaler un problème
Nous préparons un e-mail avec le lien de cet article. Mark ne reçoit le signalement qu’après son envoi
Vérification rapide
Guide terminé ? Vérifiez vos acquis avec 3 questions
Question 01
Quelle est la deuxième étape de la procédure classique d’Engle–Granger ?
Choisissez une réponse pour voir l'explication
Glossaire des options
The existence of a stationary linear combination among nonstationary series, implying a shared long-run equilibrium restriction under a specified model.
Lire le guide approfondiMean reversionA model-dependent tendency for a variable to move back toward a fixed or changing reference; it does not automatically imply stationarity or tradability.
Lire le guide approfondi