Giacomini–White 검정: 조건부 예측 정확도
Giacomini–White 검정으로 예측 시점의 정보에 따라 예측 성능이 달라지는지 살펴보고, 검정 함수의 선택과 결과 해석을 알아봅니다
이 글에서 다루는 내용평균 정확도와 조건부 정확도는 서로 다른 질문입니다
짧은 요약
Giacomini–White(GW) 틀은 예측을 만들 때 이미 알 수 있었던 정보가 두 예측의 상대적 손실과 관련되는지 묻습니다. 평균 점수에 가려진 차이를 찾을 수 있지만, 결론은 미리 정한 예측 방법, 평가 창, 손실함수, 조건 변수에 달려 있습니다.
평균 정확도와 조건부 정확도는 서로 다른 질문입니다
검정 표본에서 A의 평균 손실이 B보다 낮다고 해보겠습니다. 이 평균에는 유용한 패턴이 가려질 수 있습니다. A는 시장이 조용할 때 더 잘 맞지만 변동성이 높은 시기에는 B가 앞설 수 있습니다. 평균적으로 어느 예측이 더 나았는지를 묻는다면 무조건부 비교가 적절합니다. 예측 시점에 알고 있던 정보로 앞으로 어느 쪽이 더 정확할지 가려낼 수 있는지를 묻는다면 조건부 예측 능력이 관심 대상입니다.
Giacomini와 White는 이를 정해진 손실함수와 정보집합 아래에서 예측 방법을 비교하는 문제로 정리했습니다. 예측 목적에 맞는 손실을 정의할 수 있다면 점 예측, 구간 예측, 확률 예측, 밀도 예측에 적용할 수 있습니다. 여기서 평가 대상은 예측값만이 아닙니다. 그 값을 만든 추정 절차도 포함됩니다. 따라서 롤링 창, 고정된 학습 표본, 가중치 규칙은 결과를 본 뒤 바꾸어도 되는 사소한 설정이 아니라 비교 대상인 예측 방법의 일부입니다(Giacomini와 White, 2006).
조건부 검정은 구조 변화 검정과 관련은 있지만 같은 검정은 아닙니다. 조건부 검정은 상대적 손실이 선택한 정보와 체계적으로 연결되는지 묻습니다. 구조 변화 검정은 미지의 시점이나 정해진 시점에 모수 또는 관계가 바뀌었는지 살펴봅니다. Diebold–Mariano 검정 안내는 평균 손실 차이를 비교하는 무조건부 질문을 다룹니다. 조건부 질문에는 어떤 정보에 따라 비교할지 명시해야 합니다.
검정 전에 예측, 실현값, 정보 시점을 맞춥니다
예측 원점 t 이후에 관측되는 목표를 (Y_{t+1})이라고 하겠습니다. ŷA,t+1과 ŷB,t+1은 같은 목표, 예측기간, 단위, 정보 마감시각에 맞추어야 합니다. 낮을수록 좋은 손실함수 (L)을 쓰면 손실 차이를 다음처럼 정의할 수 있습니다.
dₜ₊₁ = L(Yₜ₊₁, ŷA,ₜ₊₁) − L(Yₜ₊₁, ŷB,ₜ₊₁)
이 부호에서는 양수가 A의 손실이 더 커 B가 해당 시점에 유리하다는 뜻이고, 음수는 A가 유리하다는 뜻입니다. 예측 원점마다 한 행을 두고 같은 실현값에 두 예측을 모두 채점합니다. 예측 당시 저장한 값, 사용한 자료의 버전, 모형 버전도 보존해야 합니다. 개정된 입력값이나 나중에 알게 된 정보로 과거 예측을 다시 만들면 안 됩니다.
조건 변수도 예측 원점에 알 수 있어야 합니다. 과거 자료로 계산한 변동성 추정치, 미리 공지된 이벤트 표시, 시차를 둔 상대 손실, 과거 관측만으로 구한 시장 상태가 예가 될 수 있습니다. t 이후에 측정한 변수를 사용해 t 시점에서 어떤 예측이 더 나았는지를 설명하면 미래 정보가 섞입니다.
점수는 예측 대상에 맞춥니다. 제곱오차는 조건부 평균 예측의 한 선택지지만 변동성, 분위수, 밀도 예측에도 자동으로 적절한 것은 아닙니다. 한 모형이 분산을 예측하고 다른 모형은 표준편차를 예측한다면 같은 양을 예측하도록 먼저 변환해야 합니다. 검정은 서로 다른 질문을 같은 척도로 바꾸어 주지 않습니다.
변동성 예측을 비교한다면 두 예측을 동일한 실현분산 정의와 표본주기로 채점합니다. 한쪽은 장중 가격만 이용하고 다른 쪽은 야간 수익률까지 포함한 목표를 예측하면, 차이는 모형의 성능만이 아니라 목표 정의에서 생길 수 있습니다. 시장이 닫힌 시간의 움직임을 포함할지, 가격 자료의 빈도와 결측치를 어떻게 처리할지, 실현값을 어떤 추정량으로 만들지 정한 뒤 양쪽에 똑같이 적용합니다. 실현값 자체에 측정오차가 있다면 그 오차도 두 손실 점수에 함께 영향을 준다는 점을 해석에 남깁니다.
조건부 귀무가설을 정하고 검정 함수를 선택합니다
비교에서 사용할 정보를 ᵊₜ라고 쓰면 이상적인 귀무가설은 다음과 같습니다.
H₀: E[dₜ₊₁ | 𝒢ₜ] = 0
이는 선택한 정보가 주어졌을 때 기대 손실 차이가 0이라는 뜻입니다. 1기간 GW 검정은 이 조건부 명제를 시점 t에 알려진 정보만으로 계산하는 사전 지정 검정 함수 (h_t)의 모멘트로 바꿉니다.
H₀,ₕ: E[hₜ dₜ₊₁] = 0
(h_t)에는 상수가 들어갈 수 있으며, 이 항은 평균 손실 차이를 포함합니다. 다른 항에는 시장 상태, 시차 상대 손실, 결과를 보기 전에 정한 비선형 변환을 넣을 수 있습니다. 예를 들어 (S_t)가 t 시점에 알려진 고변동성 여부를 나타내는 이진 변수라면 (h_t=(1,S_t)')로 두어 상수 모멘트와 손실 차이가 그 상태에 연관되는지를 함께 시험할 수 있습니다.
유한한 검정 함수 집합은 그 함수가 정하는 모멘트만 검정합니다. 기각되면 검정 가정 아래 선택한 모멘트 중 적어도 하나가 0과 맞지 않는다는 근거입니다. 모든 가능한 시장 상태에서 항상 우수한 모형을 찾아냈다는 뜻은 아니며, 생각할 수 있는 모든 상태변수가 관련된다는 증거도 아닙니다. 기각하지 못해도 조건부 성능이 같다고 증명되는 것은 아닙니다. 검정 함수에 상수만 넣었다면 조건을 폭넓게 탐색한 것이 아니라 무조건부 모멘트 하나를 비교한 것입니다.
어떤 모형이 이길지 확인하기 전에 손실, 도구변수, 변환, 표본, 예측기간을 정합니다. 결과를 확인한 뒤 상태 표시, 임계값, 시차를 많이 추가하면 별도의 탐색 문제가 생깁니다. 조건부 검정 자체가 그런 선택을 보정해 주지는 않습니다.
상태변수의 계산 시점도 고정합니다. 전체 표본에서 변동성의 상위 20%를 계산해 과거의 고변동 상태를 표시하면 미래 관측값이 임계값 설정에 들어갑니다. 각 예측 원점까지의 자료만 사용해 임계값을 추정하거나, 정책·거래소에서 그 전에 공개한 기준을 사용해야 합니다. 연속형 상태변수를 쓰면 단위를 확인하고 중심화나 표준화를 일관되게 적용합니다. 서로 거의 같은 상태변수 여러 개를 검정 함수에 넣으면 모멘트가 중복되어 행렬을 역산하기 어려워질 수 있으므로, 해석 가능한 최소 집합을 사전에 설계합니다.
Wald 통계량을 만들고 기준분포를 해석합니다
검정 함수가 q개라면 (g_{t+1}=h_t d_{t+1})인 모멘트 벡터를 구성합니다. 표본 평균은 다음과 같습니다.
ḡ = (1/n) Σₜ gₜ₊₁
1기간 GW 통계량은 다음 형태의 Wald 통계량입니다.
GW = n ḡ′ Ω̂⁻¹ ḡ
(Ω̂)는 모멘트 벡터의 공분산 행렬을 추정합니다. 귀무가설과 논문이 제시한 정규조건 아래에서 통계량은 자유도 q인 점근 카이제곱 기준분포를 따릅니다. 검정 함수의 수가 기준분포에 영향을 주고 검정력에도 영향을 줄 수 있습니다. 약하거나 서로 중복되는 변수를 많이 넣으면 정보는 거의 늘지 않은 채 공분산 추정이 불안정해질 수 있습니다.
1기간 설정에서는 귀무가설이 모멘트 벡터에 마팅게일 차분 구조를 부과하므로 원래 검정은 표본 2차 모멘트 추정량을 사용할 수 있습니다. 예측기간이 다르거나 목표 기간이 서로 겹치는 등 그 설정에서 벗어날 때는 선택한 검정의 가정과 의존 구조에 맞는 분산 추정량이 필요합니다. 다른 검정에서 쓴 HAC 대역폭을 그대로 가져오지 말고 실제 구현에 적용되는 정리를 따라야 합니다. Newey와 West(1987)의 HAC 추정량을 비롯한 공분산 방법은 필요한 설정에서 쓰는 도구이지 GW에 늘 같은 대역폭을 적용하라는 처방은 아닙니다. 분산 추정과 예측 설계가 타당해야 결과도 해석할 수 있습니다.
수치적으로도 Ω̂가 잘 추정되는지 확인할 필요가 있습니다. 거의 같은 열을 가진 검정 함수, 특정 상태에서 관측값이 거의 없는 더미 변수, 지나치게 많은 상호작용은 공분산 행렬을 특이하거나 불안정하게 만들 수 있습니다. 이런 상황에서 역행렬은 작은 자료 변화에도 크게 달라져 검정통계량을 왜곡할 수 있습니다. 함수 수를 정할 때는 각 항이 어떤 경제적 조건이나 예측 능력 차이를 대변하는지 설명할 수 있는지 확인하고, 함수 수와 모멘트 분산을 결과와 함께 기록합니다. 유의하지 않은 변수를 사후에 삭제해 같은 표본에서 다시 기각을 노리는 것도 선택의 일부로 남겨야 합니다.
p값은 정해 둔 모멘트 제한이 기준분포와 검정 가정 아래 자료에 얼마나 맞지 않는지 보여주는 근거입니다. A 또는 B가 참일 확률이 아니며, 거래 규칙이 수익을 낼 확률도 아닙니다. 기각의 의미를 독자가 알 수 있도록 검정 통계량, 자유도, p값과 시험한 모멘트를 구체적으로 보고합니다.
<!-- learn:illustration -->

두 상태 예시로 평균에 가려진 차이를 살펴봅니다
1기간 예측 원점이 여덟 개라고 가정하겠습니다. (S_t=0)은 시장이 안정적인 상태, (S_t=1)은 변동성이 높은 상태입니다. 가상의 손실 차이 (d_{t+1}=L_A-L_B)가 안정 상태 네 시점에는 −2, −2, −2, −2이고 고변동 상태 네 시점에는 +2, +2, +2, +2라고 하겠습니다. 음수는 A, 양수는 B에 유리합니다.
여덟 시점의 전체 평균은 0이므로 이 작은 예시에는 무조건부 손실 차이가 없습니다. 그러나 안정 상태의 평균은 −2이고 고변동 상태의 평균은 +2입니다. 상태에 따라 상대적 순위가 바뀝니다. (h_t=(1,S_t)')를 쓰면 상수 모멘트와 고변동 상태의 모멘트가 들어가므로 이 패턴과 일치하는지를 함께 확인할 수 있습니다.
이 여덟 값은 계산 원리를 보이기 위한 예시이지 신뢰할 수 있는 추론에 충분한 표본이 아닙니다. 실제 자료에서는 예측을 만든 추정 절차, 상태 변수를 사전에 고정했는지, 예측 원점 수가 충분한지, 손실 차이 모멘트가 시간에 따라 어떻게 움직이는지를 반영해야 합니다. 상태별 그림만 보고 패턴이 앞으로도 지속될 것이라고 결론 내릴 수 없습니다.
추정 창도 비교하는 예측 방법의 일부입니다
GW의 원래 점근 이론은 표본외 예측 수가 늘어나더라도 최대 추정 창 크기를 유한하게 두어 예측 추정의 불확실성을 남깁니다. 롤링 창과 한 번 정한 학습 표본이 그 핵심 설정에 들어갑니다. 창의 길이와 자료에 따라 창을 고르는 규칙도 각 예측 방법의 구성 요소이므로 정해서 보고해야 합니다.
예측 모형을 반복해 다시 추정한다면 이 구분이 중요합니다. 추정 방법을 무시한 비교는 과거 자료를 배우는 과정에서 생긴 불확실성을 놓칠 수 있습니다. 명시된 조건 아래 GW는 중첩·비중첩 모형에서 만든 예측을 비교할 수 있지만, 어떤 확장 창 구현과 추정량에서나 같은 결과가 보장되는 것은 아닙니다. 원래의 1기간 틀은 유한 창 가정 아래 정리되어 있고, 통상적인 확장 창은 그 가정에 들어가지 않습니다. 실제 예측 생성 방식과 다른 설정이라면 그 설정을 다룬 결과를 사용해야 합니다.
검정이 적절한 창 길이를 대신 골라 주는 것도 아닙니다. 짧은 창은 최근 상태에 적응할 수 있지만 관측값이 줄고, 긴 창이나 확장 창은 추정을 안정시킬 수 있는 대신 이미 낡은 관계를 남길 수 있습니다. 미리 정한 평가 절차로 비교하고 창 선택 과정도 기록합니다. Giacomini와 Rossi(2010)는 불안정한 환경에서 상대적 예측 성능의 시간 경로를 살펴보는 별도 검정을 다룹니다. 이는 관련 질문이지만 기본 GW 조건부 검정 통계량과 같은 것은 아닙니다.
GW와 DM, 중첩모형, 불안정성 검정을 구분합니다
Diebold–Mariano 검정은 평가 표본에서 두 예측의 평균 손실이 같은지를 묻습니다. GW는 선택한 정보가 상대 손실과 연관되는지 묻고, 무조건부 비교를 가능한 모멘트 제한으로 포함합니다. 두 상태 예시처럼 평균 점수가 같더라도 조건별 성능은 다를 수 있습니다.
예측이 중첩모형에서 나오고 관심 대상이 평균 제곱오차의 동등성이라면 Clark–West 보정처럼 다른 귀무가설과 추정 잡음을 다루는 방법을 검토할 수 있습니다. 거래 규칙이나 예측 후보를 많이 탐색한 뒤 그중 우수한 후보가 하나라도 있는지를 묻는다면 White Reality Check와 Hansen SPA 검정 안내와 같은 계열 단위 절차가 별도로 필요할 수 있습니다. 선택된 한 쌍에 대한 조건부 검정이 더 넓은 탐색 과정을 없애 주지는 않습니다.
상대 정확도가 선택한 도구변수와 연결되는지보다 시간이 지나며 성능이 어느 시점에 반전되는지가 연구 질문이라면 시간 경로의 불안정성 검정이 더 적절할 수 있습니다. Giacomini와 Rossi(2010)는 그런 예측 비교를 다룹니다. 질문에 맞는 방법을 택해야 하며, 검정이 기각됐다는 이유만으로 국면전환 거래전략이 입증됐다고 해석하면 안 됩니다.
여러 예측 모형을 함께 비교하고 통계적으로 구분하기 어려운 모형 집합을 찾으려면 Model Confidence Set 안내를 참고할 수 있습니다. 이 계열 절차도 GW 분석에서 어떤 조건을 사전에 정할지 대신 결정해 주지는 않습니다.
낮은 검정력과 반복 검정을 고려합니다
조건부 검정에는 충분한 자료가 필요할 수 있습니다. 표본을 안정기와 고변동기로 나누면 각 비교를 뒷받침하는 관측 수가 줄어듭니다. 검정 함수가 많아지면 모멘트와 자유도도 늘어납니다. 여러 조건이 상대 손실과 약하게 관련되어 있다면 실제 조건부 차이가 있어도 검정력이 낮을 수 있습니다.
McCracken의 미국 세인트루이스 연방준비은행 연구보고서는 단순한 제곱손실 예제에서 GW 검정의 존재, 크기, 검정력을 살펴봅니다. 그 연구에서 검정은 크기를 적절히 유지할 수 있었지만 검정력은 조사한 설정에서 대체로 낮았습니다(McCracken, 2020). 이 결과는 모든 적용에서 같은 검정력이 나온다는 보편적 수치가 아니라 결과 해석의 주의점입니다. 기각하지 못하면 자료량이나 검정력이 부족했을 수 있으므로 예측이 서로 바꿔 쓸 수 있다고 증명된 것처럼 쓰면 안 됩니다.
상태 정의, 임계값, 예측기간, 손실함수, 평가 날짜를 계속 바꾸어 보면서 유의한 결과를 고르면 우연한 발견 가능성이 커집니다. 시험한 항목을 모두 기록하고 탐색 분석과 미리 지정한 확인 표본을 구분합니다. 여러 전략 가운데 하나라도 예측력이 있다고 주장하려면 탐색한 전체 계열에 적합한 다중 검정 또는 데이터 스누핑 절차를 적용합니다. 조건 변수를 늘리는 일만으로 근거가 강해지지는 않습니다.
여러 예측 모형을 함께 비교할 때는 쌍별 조건부 검정과 다른 질문을 다루는 계열별 방법이 필요할 수 있습니다. Model Confidence Set 안내는 정한 유의수준에서 서로 구분하기 어려운 모형을 반복적인 비교를 통해 하나의 집합으로 남기는 절차를 설명합니다. 그래도 GW 분석에 넣을 조건을 사전에 정하는 일을 대신하지는 않습니다.
다른 연구자가 재현할 수 있게 설계를 보고합니다
두 예측 방법의 이름과 추정법, 중첩 여부, 목표변수, 예측기간, 평가 날짜를 밝힙니다. 손실함수와 (d_{t+1})의 부호 규칙을 정확히 씁니다. (h_t)의 각 항목, 계산 방식, 관측 가능한 시점, 결과를 보기 전에 정했는지 여부도 설명합니다.
예측 원점의 간격, 추정 창 규칙, 자료 버전, 공통 표본 규칙, 표본외 예측 원점 수, 검정 함수 개수, 공분산 추정량, 기준분포, 통계량, 자유도, p값을 보고합니다. 예측기간이 겹치는지와 의존성을 어떻게 다루었는지 적습니다. 검정 결과뿐 아니라 두 모형의 평균 손실과 손실 차이 요약도 제시해야 합니다.
시도한 다른 검정 함수, 임계값, 추정 창, 손실, 예측 쌍도 목록으로 남깁니다. 같은 관측값으로 모형이나 조건 변수를 선택한 뒤 그것을 검정했다면 밝혀야 합니다. 확증적이지 않은 결과도 정보를 줄 수 있습니다. 투명한 기록은 독자가 결론의 범위를 판단하고 별도 검증을 설계하도록 돕습니다.
자주 묻는 질문
Q1Giacomini–White 검정은 Diebold–Mariano 검정과 같은가요?
아닙니다. Diebold–Mariano 검정은 평균 손실이 같은지를 살펴봅니다. 1기간 GW 틀은 선택한 조건부 모멘트를 검정하며, 무조건부 모멘트는 가능한 제한 중 하나로 포함합니다.
Q2기각하면 모든 시장 국면에서 사용할 예측을 알 수 있나요?
그렇지 않습니다. 검정 가정 아래 선택한 모멘트 중 적어도 하나가 0과 맞지 않는다는 뜻입니다. 결과는 선택한 도구변수, 표본, 손실함수에 따라 달라지며 모든 상태에서의 성능을 보장하지 않습니다.
Q3기각될 때까지 변동성 임계값을 계속 추가해도 되나요?
조건 변수에 대한 탐색이 됩니다. 가능하면 변수를 미리 정하고 시도한 설정을 모두 보고해야 합니다. 넓은 예측력 주장을 하려면 별도의 확인 표본이나 전체 후보 계열에 적절한 보정을 사용합니다.
Q4조건부 예측 능력은 거래전략 수익성을 뜻하나요?
아닙니다. 예측 손실을 비교하는 검정입니다. 거래 주장을 하려면 의사결정 규칙을 정하고 체결, 수수료, 금융비용, 시장충격, 위험을 별도로 평가해야 합니다. 주요 연구 - Giacomini와 White, “Tests of Conditional Predictive Ability” (2006) - Giacomini와 Rossi, “Forecast Comparisons in Unstable Environments” (2010) - McCracken, “Tests of Conditional Predictive Ability: Existence, Size, and Power” (세인트루이스 연방준비은행 연구보고서, 2020) - Diebold와 Mariano, “Comparing Predictive Accuracy” (1995) - Newey와 West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)
출처와 더 읽을 자료
내용 정정 제보
이 아티클 링크를 담은 이메일 초안을 준비합니다. 직접 보내야 Mark에 제보가 접수됩니다
QUICK CHECK
글을 다 읽었다면, 3문항으로 확인해보세요
Question 01
dₜ₊₁ = L(A) − L(B)일 때 손실 차이가 양수라면 무엇을 뜻하나요?
정답을 고르면 바로 설명을 볼 수 있어요