Pesaran–Timmermann 검정: 방향 예측은 정보를 더할까?
Pesaran–Timmermann 검정이 실제 상승 비율과 예측 상승 비율로 계산한 기준선과 방향 적중률을 비교하는 방법, 시계열 의존성이 추론에 미치는 영향을 알아봅니다.
이 글에서 다루는 내용적중률 64%의 의미는 기준선에 따라 달라집니다
짧은 요약
Pesaran–Timmermann(PT) 검정은 예측이 결과의 상승·하락 방향에 관한 정보를 담고 있는지 묻습니다. 상승·하락 예측을 이진 분류로 만들면, 관측된 방향 적중률을 실제 상승 비율과 예측 상승 비율을 따로 반영한 일치 기준선과 비교합니다. 이 기준선은 언제나 50%인 것이 아닙니다. 통상적인 검정에는 예측 시점 간 의존성에 관한 가정도 필요하며, 통계적으로 유의하다고 해서 매매 규칙의 수익성이 입증되는 것은 아닙니다.
적중률 64%의 의미는 기준선에 따라 달라집니다
평가 표본의 60%에서 시장이 상승했다고 가정해 봅시다. 예측기는 그 날짜 중 70%에 “상승”을 예측합니다. 예측과 결과가 서로 무관하더라도 두 계열은 종종 일치합니다. 어떤 날짜에는 둘 다 상승을 가리키고, 다른 날짜에는 둘 다 하락을 가리키기 때문입니다. 이 불균형을 무시하고 적중률을 기계적으로 50%와 비교하면 안 됩니다.
PT 틀은 이 비교를 명시합니다. 예측 방향과 실현 방향이 각자의 표본 빈도만으로 독립 상태에서 기대되는 것보다 자주 일치하는지 묻습니다. 이는 방향 예측 정보에 관한 검정이지, 수익률 크기나 매매 시점, 전략 전체의 가치를 평가하는 점수는 아닙니다. Pesaran과 Timmermann은 분할표를 사용한 예측 성과 검정을 제시했고, 이진 2×2 경우에는 독립성 검정과 점근적으로 동등합니다 {source:pesaranTimmermannDirectionalTests1992}.
같은 예측 시점의 결과를 2×2 표에 담습니다
실현 결과를 상승으로 분류하면 \(Y_t=1\), 하락으로 분류하면 \(Y_t=0\)이라고 합시다. 예측이 상승을 가리키면 \(Z_t=1\), 하락을 가리키면 \(Z_t=0\)입니다. 평가의 각 행은 시점 \(t\)에 생성한 예측과 그 예측이 겨냥한 기간의 실현 결과를 짝지어야 합니다.
네 칸에는 상승/상승, 상승/하락, 하락/상승, 하락/하락 조합을 셉니다. 일치하는 두 칸이 \(n_{11}\), \(n_{00}\)이고 사용 가능한 짝의 수가 \(n\)이면 관측 방향 적중률은 다음과 같습니다.
\[ \widehat{P}=\frac{n_{11}+n_{00}}{n}. \]
이 설정은 두 범주만 사용합니다. 수익률 0, 예측값 0, 중립 구간을 어떻게 다룰지 미리 정하세요. 예를 들어 수익률이 0 이하이면 “비상승”, 예측이 정한 임계값 이하이면 “비상승”으로 분류할 수 있습니다. 동률을 제외하는 방식도 가능하지만 표본이 바뀌므로 일관되게 적용해야 합니다. 0 대 0을 세 번째 종류의 일치로 세면서 두 범주 기준선 공식을 사용해서는 안 됩니다.
예측 원점과 목표 기간도 서로 맞아야 합니다. \(Z_t\)가 앞으로 5거래일의 누적 수익률 부호를 예측한다면 \(Y_t\)도 같은 시점에서 시작하는 그 5거래일 수익률의 부호여야 합니다. 다음 하루 수익률을 연결하면 서로 다른 사건이 한 표에 들어갑니다. 매일 만든 5일 예측을 표에 넣을 수는 있지만 목표 기간이 겹치므로 뒤에서 설명할 의존성 문제가 생깁니다.
두 상승 비율로 독립 기준선을 계산합니다
\(\hat p_y\)를 상승으로 분류된 실현 결과의 표본 비율, \(\hat p_z\)를 상승을 예측한 표본 비율이라고 합시다. 실제와 예측의 분류가 독립이라면 기대되는 일치 비율은 다음과 같습니다.
\[ \widehat{P}^{*}=\hat p_y\hat p_z+(1-\hat p_y)(1-\hat p_z). \]
첫째 곱은 독립 상태의 상승/상승 일치 확률이고, 둘째 곱은 하락/하락 일치 확률입니다. 따라서 기준선은 두 주변 비율에 따라 달라집니다. 50%보다 높을 수도 낮을 수도 있습니다. 가장 자주 나타나는 방향만 계속 예측하는 모형은 유용한 정보를 더하지 않으면서도 겉보기에는 높은 적중률을 보일 수 있습니다.
극단적인 경우가 이를 잘 보여줍니다. 분류기가 모든 날짜에 “상승”을 예측하면 \(\hat p_z=1\)이고, 관측 적중률은 실제 상승 비율 \(\hat p_y\)와 같습니다. 독립 기준선도 \(\hat p_y\)이므로 초과 일치가 구조상 0입니다. 상승이 흔한 표본에서는 이런 상수 예측도 정확해 보일 수 있지만 어느 날짜가 오를지 구별하지 못합니다. 추정 분산도 퇴화할 수 있어 통상적인 PT p값 자체가 없을 수 있습니다.
가상의 예측 시점 100개를 생각해 봅시다. 실제 결과는 60번 상승이고, 예측은 70번 상승입니다. 분할표를 다음처럼 만들 수 있습니다.
| 실현 방향 | 예측 상승 | 예측 하락 | 합계 |
|---|---|---|---|
| 상승 | 47 | 13 | 60 |
| 하락 | 23 | 17 | 40 |
| 합계 | 70 | 30 | 100 |
일치는 64회이므로 \(\widehat P=0.64\)입니다. 독립 기준선은 \(0.60\times0.70+0.40\times0.30=0.54\)입니다. 관측 적중률은 기준선보다 10퍼센트포인트 높습니다. 이 가상 도수는 계산을 보여줄 뿐이며, 차이 자체가 유효한 불확실성 추정치나 거래 성과의 증거는 아닙니다.
적중률 차이를 추정 불확실성으로 나눕니다
표준 이진 PT 통계량에서 다음을 정의합니다.
\[ \widehat v=\frac{\widehat P^{*}(1-\widehat P^{*})}{n} \]
그리고
\[ \widehat w=\frac{(2\hat p_y-1)^2\hat p_z(1-\hat p_z)+(2\hat p_z-1)^2\hat p_y(1-\hat p_y)}{n}. \]
그러면
\[ PT=\frac{\widehat P-\widehat P^{*}}{\sqrt{\widehat v-\widehat w}}. \]
귀무가설과 표준적인 큰 표본 가정 아래에서 이 통계량은 점근적으로 표준정규분포를 기준으로 해석합니다. 분자는 독립 기준선을 넘어선 초과 일치이고, 분모는 그 기준선을 고정된 50%로 취급하지 않고 같은 표본으로 추정한다는 점을 반영합니다. statsmodels 구현 문서에 공식과 표기법이 정리되어 있습니다 {source:statsmodelsPesaranTimmermannAPI}.
위 식은 statsmodels에 문서화된 선도 점근 분산식입니다. 원래 논문의 더 완전한 유한표본 델타 분산식은 \(\widehat w\)에 \(4\hat p_y\hat p_z(1-\hat p_y)(1-\hat p_z)/n^2\) 항을 더합니다. 이 고차 항은 일차 점근 결과를 바꾸지 않지만 유한 표본 통계량에는 차이를 낼 수 있습니다. 구현에 따라 결과가 달라질 수 있다면 모든 패키지가 유한 표본 산술을 똑같이 사용한다고 가정하지 말고 공식의 형태와 소프트웨어 버전을 밝히세요.
공식이 부실한 설계를 바로잡지는 않습니다. 표본이 매우 작거나, 예측이 거의 항상 같은 값을 내거나, 특정 칸이 비어 있거나, 추정 분산이 0 또는 유효하지 않으면 통상적인 근사가 불안정하거나 정의되지 않을 수 있습니다. 이때 억지로 p값을 만들지 마세요. 주변 비율과 분할표를 제시하고 표본과 자료 구조에 맞는 추론 절차를 선택하세요.
앞의 가상 표에 선도 공식을 대입하면 \(\widehat v=0.54(0.46)/100=0.002484\), \(\widehat w=[0.2^2(0.7)(0.3)+0.4^2(0.6)(0.4)]/100=0.000468\)입니다. 표준오차는 \(\sqrt{0.002484-0.000468}\approx0.0449\)이고, \(PT\approx0.10/0.0449=2.23\)입니다. 양측 표준정규 기준 p값은 약 0.026입니다. 가상 도수에 선도 점근 공식을 적용한 계산일 뿐이며, 더 완전한 유한표본 항을 넣으면 값이 조금 달라지고 시계열 의존성이 있으면 정규 기준분포가 맞지 않을 수 있습니다. 이를 실증 결과처럼 제시하지 마세요.

기각은 방향에 대한 증거이지 매매 판정이 아닙니다
분자가 양수이면 독립 기준선보다 실제 방향 일치가 잦았고, 음수이면 덜 잦았다는 뜻입니다. 사전에 정한 단측 검정은 기준선보다 일치가 높은지를 물을 수 있고, 양측 검정은 방향 연관성이 어느 쪽으로든 다른지 묻습니다. 대립가설과 유의수준은 결과를 보기 전에 정해야 합니다.
작은 p값은 검정 가정 아래에서 명시된 귀무가설과 자료가 덜 부합한다는 증거입니다. 귀무가설이 참일 확률도 아니고 다음 기간에 예측이 맞을 확률도 아닙니다. 스프레드, 수수료, 시장충격, 펀딩, 차입 비용을 감안할 만큼 수익률이 컸다는 뜻도 아닙니다. 여러 자산, 기간, 임계값, 모형, 예측 방향을 시도한 뒤 승자만 보고하는 탐색도 교정해 주지 않습니다. 후보 전략을 탐색했다면 White Reality Check 안내에서 선택 과정을 추론에 반영하는 이유를 확인할 수 있습니다.
반대로 귀무가설을 기각하지 못했다고 실제와 예측 방향이 독립이라고 입증되는 것은 아닙니다. 표본이 짧거나 방향 분포가 불균형하면 연관성을 찾을 검정력이 낮을 수 있습니다. PT 분자가 음수인 경우에도 예측에 아무 구조가 없다는 뜻은 아닙니다. 방향이 체계적으로 어긋났을 수 있습니다. 그 결과를 본 뒤 예측 부호를 뒤집는 것은 새로운 모형 선택이므로 새 표본에서 평가하거나 처음 검색 절차에 포함해야 합니다.
결과를 보고할 때는 실제 상승 비율, 예측 상승 비율, 관측 적중률, 독립 기준선, 퍼센트포인트 차이, 대립가설, 불확실성 추정 방법을 함께 적으세요. 분할표의 주변 비율이나 효과 크기 없이 p값만 제시하면 정밀하게 추정된 작은 차이와 크지만 불확실한 차이를 구별하기 어렵습니다. 평가에 포함한 관측 수와 제외한 동률·결측치의 수도 기록하세요. 정렬이나 분류 규칙에 따라 표본이 달라지면 주변 비율과 기준선도 바뀌므로 제외 기준을 결과와 함께 공개해야 합니다. 이를 생략하면 같은 예측을 재현해도 다른 2×2 표와 추론이 나올 수 있습니다.
시계열 의존성은 통상적인 기준분포를 왜곡할 수 있습니다
일반적인 PT 통계량은 시계열 방향 관측치가 서로 독립이라는 조건으로 자주 소개됩니다. 그러나 금융 분류는 같은 방향으로 이어질 수 있습니다. 매일 내는 다일 예측은 목표 기간이 겹치고, 변동성 국면은 지속될 수 있으며, 롤링 예측은 대부분 같은 추정 자료를 재사용하기도 합니다. 이때 관측한 \(n\)개 짝은 서로 독립적인 \(n\)개의 정보가 아닙니다. 통상적인 표준오차가 너무 작아져 기각이 지나치게 잦아질 수 있습니다.
Pesaran과 Timmermann은 동적으로 확장한 회귀와 유한 차수 마르코프 틀을 이용해 시계열 상관이 있는 다범주 변수의 의존성을 검정하는 방법을 후속 연구에서 제시했습니다 {source:pesaranTimmermannSerialCategories2009}. 방향 예측을 다룬 연구도 시계열 상관이 있을 때 독립성에 기반한 기존 PT 절차의 과잉 기각을 보고하고 부트스트랩 등을 포함한 의존성 강건 대안을 검토합니다 {source:blaskowitzHerwartzDirectionalSerialCorrelation2014}. 적절한 방법은 예측 생성 방식, 예측 기간, 의존 구조에 따라 달라지며, 임의의 재표집 절차가 자동으로 유효한 것은 아닙니다.
예측 시점이 겹치는지, 간격이 얼마나 되는지, 어떤 의존성 방법으로 불확실성을 추정했는지 밝히세요. 표준 통계량을 설명용 기준으로 제시한다면 독립성 가정을 표시하세요. 설계가 그 가정을 위반하는데 명목상 5% 결과를 실제 오기각률도 5%인 것처럼 해석하지 마세요.
실제로 만들 수 있었던 예측으로 평가를 구성합니다
각 시점에 당시 이용할 수 있었던 예측값, 예측 기간, 정보 마감 시점, 실현 결과, 상승·하락 분류 규칙을 그대로 보존하세요. 분할표를 만들기 전에 시각, 상품, 가격이나 수익률 정의, 결측 처리 기준을 맞춥니다. 수정된 거시경제 자료를 사용하거나 평가 기간에서 신호를 조정한 예측은 손대지 않은 표본 외 예측이 아닙니다.
홀드아웃 결과를 보기 전에 분류 임계값을 정하세요. 모형이 확률을 출력하면 임계값이 이를 이진 방향으로 바꿉니다. 같은 표본에서 임계값을 탐색하면 질문이 바뀌고 선택 편향이 생깁니다. 학습·검증·최종 평가 역할을 분리하고, 모형 탐색을 반영하려는 재표집에서는 전체 선택 절차를 매번 다시 실행하세요.
PT가 묻는 질문은 예측 오차 크기 비교와 다릅니다. Diebold–Mariano 안내는 짝지은 손실 차이를 비교하고, Giacomini–White 안내는 사전에 정한 정보를 바탕으로 상대 예측력이 달라지는지 묻습니다. 중첩 예측 모형은 Clark–West 조정 안내를 참고하세요. 익숙한 검정통계량을 돌려준다는 이유로 서로 다른 검정을 바꿔 사용할 수는 없습니다.
방향 검정의 유의성은 수익성 증거가 아닙니다
PT 검정은 결과를 방향 라벨 하나로 줄입니다. 1틱 상승과 큰 폭 상승은 모두 상승으로 세고, 작은 방향 오차와 큰 손실도 같은 한 번의 오답으로 셉니다. 따라서 적중률이 높아져도 오답의 손실 폭이 더 크거나, 신호가 가격 변동 뒤에 나오거나, 거래 비용이 우위를 소진하면 손실을 볼 수 있습니다.
예를 들어 크기가 같은 가상 매매 100건에서 64건은 방향을 맞혀 평균 0.10%씩 이익을 내고, 36건은 틀려 평균 0.25%씩 손실을 냈다고 합시다. 복리와 비용을 빼고 단순 합산하면 \(64(0.10\%)-36(0.25\%)=-2.6\)퍼센트포인트입니다. 적중률은 64%지만 거래 전 총손익은 음수입니다. 이 단순 산술은 복리를 무시한 설명용 가정이며 시장 실증자료가 아닙니다. 적중률만으로 기대손익을 알 수 없는 이유를 보여줍니다.
거래 수익을 평가하려면 진입·청산 시점, 포지션 크기, 위험 한도, 미체결 주문 처리법을 수익 계산 전에 정하세요. 해당하는 경우 호가 스프레드, 수수료, 슬리피지, 시장충격, 금융비용, 거래소별 비용을 포함합니다. 표본 외 순수익을 적절한 기준과 비교하고 규칙을 고른 다중 검정도 반영해야 합니다. PT 결과는 방향 연관성에 관한 증거의 한 조각이며, 실행 가능한 비용 반영 평가를 대신하지 않습니다.
자주 묻는 질문
Q1Pesaran–Timmermann 검정은 정확도를 50%와 비교하나요?
아닙니다. 실제 상승 비율과 예측 상승 비율을 각각 반영해 계산한 독립 기준선과 관측 일치율을 비교합니다. 기준선은 50%보다 높거나 낮을 수 있습니다.
Q2예측 기간이 겹치면 일반 PT p값을 써도 되나요?
의존성을 처리하지 않고 그대로 쓰면 안 됩니다. 겹치는 목표와 지속적인 방향 라벨은 독립성에 기반한 표준 불확실성 추정을 작게 만들 수 있습니다. 예측 기간과 의존 구조에 맞는 방법을 사용하세요.
Q3PT 결과가 유의하면 매매 전략이 수익을 내나요?
그렇지 않습니다. 이 검정은 방향 라벨만 사용하므로 변동 폭, 진입·청산 가격, 포지션 크기, 수수료, 슬리피지, 펀딩을 측정하지 않습니다. 표본 외 순수익을 별도로 평가해야 합니다.
출처와 더 읽을 자료
내용 정정 제보
이 아티클 링크를 담은 이메일 초안을 준비합니다. 직접 보내야 Mark에 제보가 접수됩니다
QUICK CHECK
글을 다 읽었다면, 3문항으로 확인해보세요
Question 01
실제 결과는 60% 상승이고 예측은 70% 상승일 때 독립 기준 일치율은 얼마인가요?
정답을 고르면 바로 설명을 볼 수 있어요
옵션 용어 사전
콜·풋과 옵션 체인부터 IV, 그릭스, 미결제약정, 맥스 페인까지 핵심 옵션 용어를 정확하게 설명합니다
옵션 용어 사전 보기