Teste de cointegração de Johansen: posto, traço e máximo autovalor
Entenda o que o posto de cointegração do teste de Johansen conta, como os testes do traço e do máximo autovalor diferem e por que a escolha das defasagens e dos termos determinísticos importa.
Neste guiaO posto de cointegração conta relações estacionárias independentes
Resumo breve
O procedimento de Johansen testa o posto da matriz de longo prazo em um sistema multivariado de séries temporais. O posto \(r\) conta as combinações estacionárias independentes sob o modelo especificado. Por si só, ele não identifica uma carteira negociável, não prova causalidade nem garante que uma relação estimada vá persistir.
O posto de cointegração conta relações estacionárias independentes
Suponha que \(y_t\) contenha \(k\) variáveis, cada uma tratada como \(I(1)\) segundo um processo gerador de dados especificado. O posto de cointegração \(r\) é o número de combinações linearmente independentes de seus níveis que são estacionárias. Se \(r=0\), o modelo não encontra nenhuma combinação desse tipo sob essa especificação. Se \(0<r<k\), existem \(r\) relações independentes de longo prazo e, nas condições usuais de um sistema \(I(1)\), restam \(k-r\) tendências estocásticas comuns. Um posto igual a um representa uma relação que atravessa o sistema; não significa necessariamente um par óbvio de ativos.
Esta é uma questão sobre o sistema como um todo. O procedimento de duas etapas de Engle–Granger estima uma equação de longo prazo normalizada e testa seu resíduo estimado. Já o método de máxima verossimilhança de Johansen estima e testa a dimensão do espaço de cointegração em um modelo autorregressivo vetorial, podendo representar mais de uma relação independente. Os métodos respondem a perguntas relacionadas, mas diferentes, e podem divergir em amostras finitas ou com especificações distintas de defasagens e termos determinísticos.
O VECM torna o posto visível
Um VAR em níveis pode ser reescrito em uma forma simplificada de correção de erros, omitindo aqui os termos determinísticos:
\[ \Delta y_t = \Pi y_{t-1} + \sum_{j=1}^{p-1}\Gamma_j\Delta y_{t-j}+\varepsilon_t, \qquad \Pi=\alpha\beta^{\mathsf T}. \]
Aqui, \(p\) é a ordem de defasagem do VAR em níveis. As colunas de \(\beta\) descrevem as combinações de longo prazo, enquanto \(\alpha\) contém os coeficientes de ajuste que conectam o desequilíbrio anterior às variações atuais. Quando \(\Pi\) tem posto \(r\), ela pode ser fatorada em matrizes \(\alpha\) e \(\beta\) de dimensão \(k\times r\). É o posto, e não apenas o número de variáveis, que determina quantos termos de correção de erros entram no sistema.
Se todas as \(k\) séries forem de fato \(I(1)\), os casos usuais de cointegração têm \(r<k\). Um resultado de posto completo aponta que os níveis são estacionários em torno dos termos determinísticos permitidos pela especificação estimada e deve levar a uma revisão da premissa original sobre a ordem de integração. Posto zero não prova que as variáveis não tenham qualquer relação; significa que o modelo escolhido não encontrou uma combinação estacionária de níveis no posto testado.

Os testes do traço e do máximo autovalor usam alternativas diferentes
Ordene os autovalores estimados de modo que \(1>\hat\lambda_1\ge\hat\lambda_2\ge\cdots\ge\hat\lambda_k\ge0\). Eles vêm do problema de posto reduzido do procedimento de máxima verossimilhança e não são porcentagens comuns da variância explicada. Para um posto candidato \(r\), a estatística do traço é
\[ \operatorname{LR}_{\mathrm{trace}}(r)=-T\sum_{i=r+1}^{k}\ln(1-\hat\lambda_i), \]
e testa \(H_0:\operatorname{rank}(\Pi)\le r\) contra \(H_A:\operatorname{rank}(\Pi)>r\). Ela acumula a evidência dos autovalores restantes. A estatística do máximo autovalor é
\[ \operatorname{LR}_{\max}(r,r+1)=-T\ln(1-\hat\lambda_{r+1}), \]
e compara o posto \(r\) com o seguinte, \(r+1\). Portanto, o teste do traço pergunta se há mais de \(r\) relações no total, enquanto o teste do máximo autovalor pergunta se os dados sustentam a inclusão da próxima relação. Sob essa hipótese nula de posto, nenhuma das estatísticas segue a distribuição de referência qui-quadrado usual.
Um resultado hipotético de autovalores mostra a conta
Imagine um sistema de três variáveis, com 200 observações utilizáveis e autovalores estimados ordenados de \(0.16\), \(0.05\) e \(0.01\). São números inventados para fins didáticos, não estimativas de mercado. Para \(r=0\), o teste do traço soma os três termos e resulta em aproximadamente \(47.14\), enquanto o teste do máximo autovalor usa apenas o primeiro e resulta em aproximadamente \(34.87\). Para \(r=1\), os valores correspondentes são aproximadamente \(12.27\) e \(10.26\); para \(r=2\), ambos usam o último autovalor e resultam em aproximadamente \(2.01\).
A conta produz estatísticas de teste, não uma decisão sobre o posto. Para decidir, compare cada estatística com valores críticos ou valores p da especificação exata dos termos determinísticos e da sequência de testes. Por exemplo, se uma tabela de software indicar “rejeitar em \(r=0\)”, isso é evidência contra o posto zero somente sob as premissas daquela tabela e o nível escolhido; não é a probabilidade direta de que um spread específico entre ativos seja estacionário. Um valor p acima do limite significa que não se rejeita a hipótese nula do posto, e não que ela tenha sido comprovada.
A ordem de defasagem e os termos determinísticos definem o sistema testado
Escolha uma ordem de defasagem VAR defensável antes de interpretar o posto. Um VAR em níveis de ordem \(p\) corresponde a \(p-1\) defasagens das diferenças no VECM. Defasagens insuficientes podem deixar autocorrelação nos resíduos; defasagens em excesso consomem graus de liberdade e podem tornar instável a inferência em amostras finitas. Critérios de informação ajudam a organizar os candidatos, mas também importam os diagnósticos dos resíduos, o tamanho da amostra e a cronologia econômica. Informe como a ordem foi escolhida e avalie alternativas razoáveis.
Decida onde entram as constantes e tendências: fora da relação de cointegração, restritas dentro dela ou ausentes no modelo adotado. Esses casos implicam dinâmicas de longo prazo e distribuições dos testes de posto diferentes. Escolha a especificação de acordo com a pergunta e os dados, em vez de procurar o valor p mais favorável. Use valores críticos compatíveis com o caso determinístico exato, o número de variáveis e a implementação. As estatísticas de posto de Johansen têm distribuições não padrão. MacKinnon, Haug e Michelis calculam, por superfícies de resposta, distribuições para testes de razão de verossimilhança do tipo Johansen especificados, incluindo uma extensão que admite variáveis exógenas \(I(1)\). Os valores não devem ser aplicados indistintamente a todas as configurações de teste de posto.
A localização de um termo determinístico não é uma opção cosmética do software. Nas parametrizações usuais, uma constante restrita à relação de cointegração permite que essa combinação de equilíbrio tenha média diferente de zero; uma constante irrestrita fora da relação pode permitir uma deriva determinística diferente nos níveis. As restrições sobre a tendência também mudam o caminho de longo prazo adotado. Uma tabela que informe apenas “constante incluída” é incompleta se não disser onde ela entra. Leia a equação do modelo e informe cada restrição.
Os vetores estimados precisam de normalização e interpretação econômica
O espaço de cointegração é o objeto central da estimação. Em um modelo de posto um, multiplicar o vetor \(\beta\) por uma constante diferente de zero não altera qual combinação de níveis é estacionária. Por isso, quem analisa escolhe uma normalização, como fixar um coeficiente em um. Em postos mais altos, várias bases podem gerar o mesmo espaço; os vetores exibidos pelo software não são automaticamente relações econômicas únicas. Para interpretar um vetor específico, são necessárias restrições ou teoria adicional, e a normalização deve ser informada.
A matriz de ajuste \(\alpha\) trata de quais variáveis respondem ao desequilíbrio no sistema estimado. Seu sinal depende da normalização escolhida, e seus elementos são coeficientes condicionais do sistema, não efeitos causais isolados. Uma carga pequena ou igual a zero pode motivar uma hipótese de exogeneidade fraca, mas essa conclusão exige as restrições formais correspondentes e o modelo adotado. O posto de cointegração, sozinho, não diz qual variável “lidera”, qual relação tem significado econômico nem como um choque afetará os preços futuros.
A não unicidade é uma propriedade da fatoração, não apenas da forma como os resultados são exibidos. Para uma matriz \(H\) não singular, \(\beta H\) e \(\alpha(H^{-1})^{\mathsf T}\) produzem a mesma matriz de longo prazo \(\Pi\). Portanto, o espaço estimado pode estar identificado mesmo quando um conjunto específico de vetores exibidos não é único. Escolher um vetor como spread negociável exige uma normalização explícita ou uma restrição econômica; suas unidades e seu risco também precisam de análise separada.
Decisões sequenciais e incerteza do modelo limitam a conclusão sobre o posto
Em geral, os postos candidatos são testados em sequência, começando em zero e avançando até a primeira hipótese nula que não é rejeitada. O posto selecionado é uma escolha de modelo condicionada ao nível de significância e à especificação adotados. Se os resultados do traço e do máximo autovalor divergirem, informe ambos e investigue o número de defasagens, os termos determinísticos, o baixo poder do teste, as quebras estruturais e a sensibilidade da amostra, em vez de esconder a divergência.
Os valores críticos da razão de verossimilhança são não padrão e dependem da especificação do sistema. Comportamento próximo de uma raiz unitária, amostras curtas, valores atípicos, mudanças de regime, variáveis \(I(2)\) ou regressores integrados exógenos podem tornar inadequada a configuração simples \(I(1)\). Uma tabela padrão de posto não cobre automaticamente esses casos. Os trabalhos originais de Johansen desenvolvem a inferência por máxima verossimilhança sob hipóteses de VAR gaussiano; cálculos posteriores por superfícies de resposta fornecem distribuições de referência para configurações específicas de teste, não para todos os problemas de dados possíveis.
Por exemplo, se o teste do traço rejeitar \(r=0\) e \(r=1\), mas não rejeitar \(r=2\), a sequência convencional seleciona o posto dois sob aquela especificação e aquele nível de significância. Isso não significa que a probabilidade de o posto verdadeiro ser dois seja igual a um. A sequência do máximo autovalor compara hipóteses nulas de postos adjacentes; por isso, apresente também as decisões desse teste. Não aplique o valor crítico de um teste à estatística do outro.
O posto selecionado também depende do período da amostra. Mudanças na relação econômica, na estrutura do mercado ou na definição das variáveis podem levar a estimativas diferentes em subamostras iniciais e finais. A análise de sensibilidade pode revelar essa instabilidade, mas pesquisar muitos pontos finais cria outro problema de testes múltiplos. Explique quais janelas foram planejadas e trate divisões não planejadas como evidência exploratória.
Um posto de cointegração não é um sinal para pairs trading
Em um estudo de trading, o vetor estimado \(\beta\) pode ser uma definição candidata para um spread, mas o posto não fornece níveis de entrada e saída, tamanho de posição nem retornos esperados. Se houver vários vetores de cointegração, escolher uma combinação pode envolver normalização, restrições e seleção de dados. Mesmo quando uma relação estatística é estimada, os pesos podem exigir posições vendidas, alavancagem ou ativos com baixa liquidez.
Estime o sistema usando apenas as informações disponíveis em cada data de decisão e teste cronologicamente todo o processo de seleção e reestimação. Verifique se a relação permanece estável fora da amostra e, quando apropriado, inclua dividendos, rolagem de contratos, conversão cambial, financiamento, disponibilidade de empréstimo, spreads entre compra e venda, impacto no mercado e momento da execução. Rejeitar uma hipótese nula de posto é evidência sobre um modelo especificado, não uma afirmação de rentabilidade. O guia sobre o [teste de Engle–Granger e a correção de erros](/pt-BR/learn/engle-granger-cointegration-test-error-correction-explained) apresenta a alternativa de equação única; [cointegração e correlação em pairs trading](/pt-BR/learn/cointegration-vs-correlation-pairs-trading-explained) explica por que correlação é uma propriedade diferente.
Informe detalhes suficientes para reproduzir o teste de posto
Identifique as \(k\) variáveis, transformações, frequência das observações, datas da amostra e evidências sobre a ordem de integração. Informe a ordem de defasagem do VAR em níveis, a posição dos termos determinísticos, o tamanho efetivo da amostra, as estatísticas do traço e do máximo autovalor, os valores críticos ou valores p correspondentes, o nível de significância e as decisões sequenciais sobre o posto. Diga se os dois testes concordaram, qual posto foi levado adiante e quais verificações de sensibilidade alteraram o resultado.
Ao apresentar vetores, informe a normalização, as restrições e os coeficientes de ajuste correspondentes. Em uma aplicação de trading, divulgue os dados disponíveis em cada rebalanceamento, a regra de seleção dos vetores, o desenho fora da amostra, os custos e o tratamento de falhas. A análise de 1988 de Johansen sobre vetores de cointegração90041-3) desenvolve a abordagem de máxima verossimilhança para o espaço e o posto de cointegração. Seu trabalho de 1991 sobre VARs gaussianos discute a inferência do posto e hipóteses sobre os vetores. MacKinnon, Haug e Michelis apresentam distribuições por superfícies de resposta para testes de razão de verossimilhança de cointegração. Outros guias explicam [estacionariedade e raízes unitárias](/pt-BR/learn/stationarity-unit-root-mean-reversion-finance-explained).
Perguntas frequentes
Q1Posto um significa que exatamente dois ativos formam um par?
Não. Significa que há uma combinação estacionária independente no sistema como um todo. Essa relação pode envolver várias variáveis e precisa de uma normalização interpretável.
Q2Os testes do traço e do máximo autovalor precisam selecionar o mesmo posto?
Não. Eles usam alternativas diferentes e podem divergir. Informe os dois resultados e examine o modelo, as defasagens, os termos determinísticos e a sensibilidade da amostra.
Q3Rejeitar posto zero prova que um spread será lucrativo?
Não. É evidência contra a hipótese nula de ausência de cointegração sob um modelo especificado. Não fornece regras de trading, estabilidade fora da amostra nem retornos líquidos após os custos de execução. ---
Fontes e leituras adicionais
Relatar um problema
Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar
Verificação rápida
Terminou o guia? Confira o que aprendeu com 3 perguntas
Pergunta 01
Em um sistema de três variáveis tratadas como I(1), o que significa um posto de cointegração igual a um?
Escolha uma resposta para ver a explicação
Glossário de opções
The existence of a stationary linear combination among nonstationary series, implying a shared long-run equilibrium restriction under a specified model.
Ler o guia completoMean reversionA model-dependent tendency for a variable to move back toward a fixed or changing reference; it does not automatically imply stationarity or tradability.
Ler o guia completoNo dinheiroSituação em que o preço de exercício da opção está muito próximo do preço de mercado do ativo subjacente. Ela pode não ter valor intrínseco relevante, mas ainda pode ter prêmio por causa do tempo e da incerteza restantes.
Ler o guia completo