Johansen 공적분 검정: 순위, Trace와 최대 고유값
Johansen 검정의 공적분 순위가 무엇을 세는지, trace와 최대 고유값 검정이 어떻게 다른지, 시차와 결정적 항을 왜 신중하게 정해야 하는지 설명합니다.
이 글에서 다루는 내용공적분 순위는 독립적인 정상 관계의 개수입니다
짧은 요약
Johansen 절차는 다변량 시계열 시스템에서 장기 관계 행렬의 순위를 검정합니다. 순위 \(r\)은 명시한 모형 아래 서로 독립적인 정상 선형결합의 개수입니다. 이 값만으로 거래할 포트폴리오를 정하거나 인과관계를 입증하거나 추정 관계가 앞으로도 유지된다고 보장할 수는 없습니다.
공적분 순위는 독립적인 정상 관계의 개수입니다
명시한 자료 생성 설정에서 각 변수가 \(I(1)\)이라고 간주하는 \(k\)개 시계열 \(y_t\)를 생각해보겠습니다. 공적분 순위 \(r\)은 이 변수들의 수준을 선형결합했을 때 정상성을 갖는 독립 관계의 개수입니다. \(r=0\)이면 해당 설정 아래 그런 결합을 찾지 못한 것입니다. \(0<r<k\)이면 서로 독립적인 장기 관계가 \(r\)개 있고, 통상적인 \(I(1)\) 시스템 조건에서는 공통 확률 추세가 \(k-r\)개 남습니다. 순위 1은 시스템 전체의 변수들을 가로지르는 관계 하나를 뜻하며, 반드시 분명한 자산 쌍 하나를 뜻하지는 않습니다.
이는 시스템에 관한 질문입니다. 2단계 Engle–Granger 절차는 정규화한 장기 방정식 하나를 추정하고 적합 잔차를 검정합니다. Johansen의 우도 방법은 대신 벡터자기회귀의 공적분 공간 차원을 추정하고 검정하므로 독립 관계가 둘 이상인 경우도 나타낼 수 있습니다. 두 방법은 서로 연결되지만 질문은 다르며, 유한 표본 또는 서로 다른 시차·결정적 항 설정에서는 결과가 일치하지 않을 수 있습니다.
VECM에서 장기 관계 행렬의 순위를 봅니다
수준 VAR은 결정적 항을 생략한 간단한 벡터오차수정 형태로 다시 쓸 수 있습니다.
\[ \Delta y_t = \Pi y_{t-1} + \sum_{j=1}^{p-1}\Gamma_j\Delta y_{t-j}+\varepsilon_t, \qquad \Pi=\alpha\beta^{\mathsf T}. \]
여기서 \(p\)는 수준 VAR의 시차 차수입니다. \(\beta\)의 열은 장기 관계를 나타내고, \(\alpha\)에는 이전 시점의 균형 이탈과 현재 변화량을 연결하는 조정 부하량이 들어갑니다. \(\Pi\)의 순위가 \(r\)이면 \(\alpha\)와 \(\beta\)를 각각 \(k\times r\) 행렬로 분해할 수 있습니다. 시스템에 포함된 변수 수만으로는 오차수정 항의 개수가 결정되지 않고 행렬의 순위가 결정합니다.
모든 \(k\)개 시계열이 실제로 \(I(1)\)이라면 보통 다루는 공적분 경우에는 \(r<k\)입니다. 완전 순위 결과가 나오면 적합한 설정에서 허용한 결정적 항을 중심으로 수준이 정상적이라는 뜻일 수 있으므로 원래의 적분 차수 전제를 다시 확인해야 합니다. 순위 0이라고 해서 변수가 어떤 식으로든 전혀 연결되지 않는다는 뜻은 아닙니다. 선택한 모형은 그 순위 검정에서 정상인 수준 결합을 찾지 못했다는 뜻입니다.

Trace와 최대 고유값 검정은 대립가설이 다릅니다
추정한 고유값을 \(1>\hat\lambda_1\ge\hat\lambda_2\ge\cdots\ge\hat\lambda_k\ge0\) 순서로 둡니다. 이는 우도 절차의 축소 순위 문제에서 얻는 값입니다. 일반적인 분산 설명 비율은 아닙니다. 후보 순위 \(r\)에서 trace 통계량은 다음과 같습니다.
\[ \operatorname{LR}_{\mathrm{trace}}(r)=-T\sum_{i=r+1}^{k}\ln(1-\hat\lambda_i), \]
귀무가설 \(H_0:\operatorname{rank}(\Pi)\le r\)와 대립가설 \(H_A:\operatorname{rank}(\Pi)>r\)를 비교합니다. 남은 고유값들의 근거를 합산합니다. 최대 고유값 통계량은 다음과 같습니다.
\[ \operatorname{LR}_{\max}(r,r+1)=-T\ln(1-\hat\lambda_{r+1}), \]
순위 \(r\)과 바로 다음 순위 \(r+1\)을 비교합니다. Trace는 관계가 총 \(r\)개보다 많은지를 묻고, 최대 고유값 검정은 자료가 다음 관계를 추가하는 것을 뒷받침하는지 묻습니다. 순위 귀무가설에서 두 통계량은 일반적인 카이제곱 기준 분포를 따르지 않습니다.
가상 고유값 출력으로 계산을 살펴봅니다
사용 가능한 관측치 200개와 추정 고유값 \(0.16\), \(0.05\), \(0.01\)이 순서대로 나온 세 변수 시스템을 가정해보겠습니다. 설명을 위한 가상 수치이지 시장 추정치가 아닙니다. \(r=0\)에서 trace 통계량은 세 항을 모두 더해 약 \(47.14\), 최대 고유값 통계량은 첫 번째 항만 사용해 약 \(34.87\)입니다. \(r=1\)에서는 각각 약 \(12.27\)과 \(10.26\)이고, \(r=2\)에서는 마지막 고유값만 사용하므로 둘 다 약 \(2.01\)입니다.
이 계산은 검정 통계량을 만들지만 순위를 결정하지는 않습니다. 정확한 결정적 항 설정과 검정 순서에 맞는 임계값 또는 p값과 비교해야 합니다. 예를 들어 소프트웨어 표에서 “\(r=0\) 기각”이 나오면 해당 표의 가정과 선택한 유의수준 아래 순위 0에 반하는 근거가 있다는 뜻이지 특정 자산 스프레드가 정상일 확률을 바로 말하지 않습니다. p값이 임계값보다 높으면 해당 순위 귀무가설을 기각하지 못했다는 뜻입니다. 귀무가설이 참임을 증명한 것은 아닙니다.
시차와 결정적 항이 검정할 시스템을 정합니다
순위를 해석하기 전에 타당한 VAR 시차 차수를 정합니다. 수준 VAR의 \(p\)차 모형은 VECM의 차분 시차 \(p-1\)개에 해당합니다. 시차가 너무 적으면 잔차에 계열 상관이 남을 수 있고, 너무 많으면 자유도가 줄어 유한 표본 추론이 불안정해질 수 있습니다. 정보 기준으로 후보를 좁힐 수 있지만 잔차 진단, 표본 크기, 경제적 발생 시점도 살펴야 합니다. 시차 선택 방법을 밝히고 합리적인 대안을 확인합니다.
상수와 추세를 공적분 관계 바깥에 둘지, 관계 안에 제한할지, 모형에서 제외할지 결정합니다. 각 경우에는 장기 동학과 순위 검정 분포가 달라집니다. 가장 유리한 p값을 찾기 위해 명세를 바꾸지 말고 질문과 자료에 맞춰 설정해야 합니다. 정확한 결정적 항 설정, 변수 개수, 구현 방식과 일치하는 임계값을 사용합니다. Johansen 순위 통계량은 비표준 분포를 따릅니다. MacKinnon, Haug, Michelis는 외생 \(I(1)\) 변수를 허용하는 확장 모형 등을 포함한 특정 Johansen형 우도비 검정의 응답곡면 분포를 계산했습니다. 이 값을 모든 순위 검정 설정에 그대로 적용하면 안 됩니다.
결정적 항의 위치는 소프트웨어에서 상수를 선택하는 단순한 옵션이 아닙니다. 일반적인 모수화에서 공적분 관계 안에 제한한 상수는 해당 정상 조합의 평균이 0이 아닐 수 있게 합니다. 관계 바깥에 제한 없이 둔 상수는 수준의 결정적 추세를 다른 방식으로 허용할 수 있습니다. 추세를 어디에 제한하느냐도 장기 경로와 검정의 기준 분포를 바꿉니다. 출력에 “상수 포함”이라고만 적혀 있으면 어느 경우인지 알 수 없으므로 모형식과 제약 위치를 함께 밝혀야 합니다.
추정 벡터에는 정규화와 경제적 해석이 필요합니다
중심 추정 대상은 공적분 공간입니다. 순위 1 모형에서 \(\beta\) 벡터에 0이 아닌 상수를 곱해도 어느 수준 결합이 정상인지는 바뀌지 않습니다. 그래서 계수 하나를 1로 두는 것처럼 분석자가 정규화를 선택합니다. 순위가 높으면 같은 공간을 만들 수 있는 기저가 여러 개입니다. 소프트웨어가 보여주는 벡터가 자동으로 하나의 고유한 경제 관계가 되는 것은 아닙니다. 특정 벡터를 해석하려면 제약이나 추가 이론이 필요하며, 정규화 기준을 함께 보고해야 합니다.
조정 행렬 \(\alpha\)는 적합 시스템에서 어떤 변수가 불균형에 반응하는지를 다룹니다. 계수 부호는 선택한 정규화에 달려 있으며, 각 항은 시스템 조건을 둔 계수이지 독립적인 인과 효과가 아닙니다. 작거나 0인 조정 부하량은 약외생성 가설을 생각하게 할 수 있지만, 결론을 내리려면 해당 형식 제약과 모형 전제를 둔 검정이 필요합니다. 공적분 순위만으로 어느 변수가 “선도”하는지, 어떤 관계가 경제적으로 의미 있는지, 충격이 미래 가격에 어떤 영향을 줄지 알 수는 없습니다.
이런 비유일성은 표시 형식만의 문제가 아니라 행렬 분해의 성질입니다. 가역행렬 \(H\)를 사용하면 \(\beta H\)와 \(\alpha(H^{-1})^{\mathsf T}\)가 같은 장기 행렬 \(\Pi\)를 만듭니다. 따라서 공적분 공간은 식별되어도 출력된 벡터 각각은 유일하게 정해지지 않을 수 있습니다. 특정 벡터를 거래 가능한 스프레드로 선택하려면 명시적인 정규화나 경제적 제약이 필요하며, 단위와 위험도 별도로 분석해야 합니다.
순차 검정과 모형 불확실성을 함께 봅니다
일반적으로 후보 순위를 0부터 차례로 검정하고, 처음으로 기각하지 못하는 귀무가설이 나올 때까지 올라갑니다. 선택된 순위는 정한 유의수준과 명세 아래의 모형 선택입니다. Trace와 최대 고유값 결과가 다르면 불일치를 감추지 말고 시차 차수, 결정적 항, 낮은 검정력, 구조적 단절, 표본 민감도를 살펴 두 결과를 함께 보고합니다.
우도비 임계값은 시스템 설정에 따라 달라지는 비표준 값입니다. 근접 단위근, 짧은 표본, 이상치, 체제 변화, \(I(2)\) 변수, 적분된 외생 변수가 있으면 단순한 \(I(1)\) 설정이 적절하지 않을 수 있습니다. 표준 순위표가 이런 경우까지 자동으로 다루지는 않습니다. 초기 Johansen 연구는 가우시안 VAR 가정 아래 우도 추론을 전개했고, 뒤이은 응답곡면 계산은 특정 검정 설정에서 기준 분포를 제시했지만 모든 자료 문제를 해결한 것은 아닙니다.
예를 들어 trace 검정에서 \(r=0\)과 \(r=1\)은 기각하지만 \(r=2\)는 기각하지 못한다면, 통상적인 순차 절차는 그 명세와 유의수준에서 순위 2를 선택합니다. 그렇다고 순위가 실제로 2일 확률이 1이라는 뜻은 아닙니다. 최대 고유값 검정은 인접 순위끼리 다른 귀무가설을 비교하므로 두 방법의 판단을 나란히 제시해야 합니다. 한 검정의 임계값을 다른 검정 통계량에 대입해서는 안 됩니다.
선택한 순위는 표본 기간에도 종속됩니다. 경제적 관계, 시장 구조, 변수 정의에 변화가 있으면 초기와 후기 하위 표본의 순위 추정이 다를 수 있습니다. 민감도 분석으로 불안정성을 살펴볼 수 있지만 여러 종료 시점을 탐색하면 다중 검정 문제가 생깁니다. 사전에 정한 구간과 사후에 고른 탐색 구간을 구분해 설명해야 합니다.
공적분 순위만으로 페어 트레이딩 신호가 완성되지 않습니다
거래 연구에서는 추정된 \(\beta\) 벡터를 스프레드 정의의 후보로 쓸 수 있지만, 순위만으로 진입·청산 기준, 포지션 크기, 기대 수익이 정해지지는 않습니다. 공적분 벡터가 여러 개면 하나의 결합을 고르는 과정에 정규화, 제약, 자료 선택이 들어갈 수 있습니다. 추정된 관계가 있어도 비중이 공매도나 레버리지 또는 낮은 유동성을 초래할 수 있습니다.
각 의사결정 시점에 알 수 있던 정보만 사용해 시스템을 추정하고 선택·재추정 절차 전체를 시간 순서대로 검증합니다. 표본 밖 관계가 유지되는지 확인하고 필요에 따라 배당, 선물 롤, 환율 변환, 금융 비용, 차입 가능성, 매수·매도 호가 차이, 시장 충격, 체결 시점을 반영합니다. 순위 기각은 특정 모형에 관한 근거이지 수익성 주장이 아닙니다. Engle–Granger 검정과 오차수정은 단일 방정식 대안을 설명하고, 페어 트레이딩의 공적분과 상관관계는 상관관계가 같은 성질이 아닌 이유를 다룹니다.
순위 검정을 재현할 정보를 보고합니다
변수 \(k\)개, 변환 방식, 관측 주기, 표본 기간, 적분 차수 근거를 적습니다. 수준 VAR 시차 차수, 결정적 항의 배치, 실제 사용 관측치 수, trace와 최대 고유값 통계량, 일치하는 임계값 또는 p값, 유의수준, 순차적인 순위 판단을 보고합니다. 두 검정이 일치했는지, 어떤 순위를 다음 분석에 사용했는지, 민감도 점검이 결과를 바꿨는지도 밝혀야 합니다.
벡터를 제시할 때는 정규화, 제약, 이에 대응하는 조정 부하량도 설명합니다. 거래 적용에서는 재조정 시점의 이용 가능 정보, 벡터 선택 규칙, 표본 밖 평가 설계, 비용, 실패 처리 기준을 공개합니다. Johansen의 1988년 공적분 벡터 분석90041-3)은 공적분 공간과 순위에 대한 우도 접근법을 전개합니다. 1991년 가우시안 VAR 연구는 순위 추론과 공적분 벡터에 대한 가설을 다룹니다. MacKinnon, Haug, Michelis는 공적분 우도비 검정의 응답곡면 분포를 제시합니다. 함께 읽을 글은 정상성과 단위근입니다.
자주 묻는 질문
Q1순위 1이면 정확히 두 자산이 한 쌍을 이룬다는 뜻인가요?
아닙니다. 전체 시스템에서 독립적인 정상 결합이 하나라는 뜻입니다. 여러 변수가 관계에 포함될 수 있고 해석을 위해 정규화가 필요합니다.
Q2Trace와 최대 고유값 검정이 같은 순위를 선택해야 하나요?
아닙니다. 대립가설이 달라서 결과가 다를 수 있습니다. 두 결과를 함께 보고하고 명세, 시차, 결정적 항, 표본 민감도를 확인합니다.
Q3순위 0을 기각하면 스프레드가 수익성이 있다는 뜻인가요?
아닙니다. 특정 모형 아래 공적분이 없다는 귀무가설에 반하는 근거입니다. 거래 규칙이나 표본 밖 안정성, 체결 비용 이후 순수익을 알려주지는 않습니다. ---
출처와 더 읽을 자료
내용 정정 제보
이 아티클 링크를 담은 이메일 초안을 준비합니다. 직접 보내야 Mark에 제보가 접수됩니다
QUICK CHECK
글을 다 읽었다면, 3문항으로 확인해보세요
Question 01
I(1)로 취급하는 세 변수 시스템에서 공적분 순위가 1이라는 뜻은 무엇인가요?
정답을 고르면 바로 설명을 볼 수 있어요