예측모형 신뢰집합(MCS): 단일 승자 없이 예측력을 비교하는 방법
모형 신뢰집합(MCS)이 순차 검정과 시계열 부트스트랩으로 어떤 예측모형을 남기는지, 결과 해석과 한계까지 설명합니다.
이 글에서 다루는 내용모형 신뢰집합은 어떤 질문에 답하나
짧은 요약
예측모형 신뢰집합(Model Confidence Set, MCS)은 정해 둔 예측 절차들을 하나의 손실 기준으로 비교해, 통계적으로 열등하다고 판정되지 않은 후보들을 집합으로 남깁니다. 표본이 후보를 구별하기에 부족하면 여러 모형이 남을 수 있으며, 결과는 후보군과 예측 설계, 손실 함수, 추론 방법에 따라 달라집니다.
모형 신뢰집합은 어떤 질문에 답하나
다음 거래일의 변동성을 예측하는 절차가 여러 개 있다고 해 보겠습니다. 각 절차의 예측 오차는 서로 다르지만, 표본이 짧거나 결과의 잡음이 커서 어느 절차의 기대 손실이 가장 작은지 판단하기 어려울 수 있습니다. 단순히 평균 손실이 제일 낮은 절차를 고르면, 표본 변동만으로 생긴 작은 차이에도 억지로 승자를 하나 정하게 됩니다. MCS는 대신 “지정된 성과 기준에서 현재 자료가 열등하다고 구별해 내지 못한 후보는 무엇인가?”라는 집합형 답을 제공합니다.
MCS는 후보 집합 \(\mathcal M_0\), 성과를 평가할 손실 또는 기준, 신뢰수준을 입력으로 받습니다. 현재 비교 중인 후보들의 예측 성능이 동등하다는 귀무가설을 검정하고, 기각되면 제거 규칙에 따라 상대적으로 성과가 나쁜 후보 하나를 뺍니다. 이렇게 줄어든 집합에서 다시 검정하며, 더는 기각하지 못할 때 살아남은 후보들이 MCS가 됩니다. Hansen, Lunde, Nason은 주어진 후보 집합에서 최선인 모형 또는 모형들을 정해진 신뢰수준으로 포함하도록 구성한 집합을 제안했습니다. 모수의 신뢰구간이 자료의 불확실성 때문에 여러 값을 포함할 수 있는 것과 비슷한 발상입니다(2011년 논문).
여기서 “최선”은 비교 범위 안에서만 성립합니다. 후보군, 예측 대상, 예측 시계, 각 예측 시점에 실제로 이용할 수 있었던 정보, 평가 기준이 달라지면 최선인 절차도 달라질 수 있습니다. MCS는 어떤 후보 하나가 참인 자료생성과정을 대표한다고 전제하지 않습니다. 기대 손실이 같은 후보가 둘 이상이라면 여러 후보를 함께 남기는 것도 자연스럽습니다. MCS는 남은 모형이 옳을 사후확률을 주는 방법이 아닙니다.
후보군과 예측 문제를 먼저 고정한다
손실을 계산하기 전에 후보 집합 \(\mathcal M_0\)를 정의합니다. 후보는 추정된 모형 하나일 수도 있고, 모형 추정과 예측 갱신 규칙을 결합한 절차일 수도 있습니다. 통계 모형이 아닌 예측 규칙도 비교할 수 있습니다. 예를 들어 “GARCH”라는 이름만으로는 완전한 후보가 되지 않습니다. 오차분포, 이동 추정창의 길이, 계수 갱신 방식, 예측 시계가 서로 다르면 서로 다른 예측 절차입니다.
모든 후보는 같은 예측 시점에서, 그때 이용 가능했던 정보만 사용해, 같은 대상과 시계를 예측해야 합니다. 하루 뒤 조건부 분산 예측과 5일 뒤 변동성 예측은 원자료의 단위부터 다를 수 있으므로 손실을 그대로 나란히 놓기 어렵습니다. 공통 평가 표본을 사용하고 누락 관측을 어떻게 정렬했는지 밝히며, 자료의 빈티지, 최초 추정 구간, 순차추정 또는 이동추정 일정, 개정 자료의 처리도 기록해야 합니다. 여러 시점 앞 예측 구간이 겹친다면 각 예측은 서로 다른 시점에 나왔더라도 손실이 같은 실현값을 공유할 수 있습니다.
평가 기준은 결과를 보기 전에 정합니다. 점예측은 제곱오차, 절대오차, 의사결정에 맞춘 손실 중 무엇을 쓰느냐에 따라 순위가 달라질 수 있습니다. 분산 예측에는 잡음이 섞인 대용변수의 특성을 고려한 변동성 손실을, 분위수 예측에는 분위수 점수를 적용해야 합니다. 한 손실에서 나온 MCS가 다른 손실에서도 좋은 MCS라는 뜻은 아닙니다. 동일한 평가 결과를 확인한 뒤 후보를 미리 솎았다면 형식상 얻은 집합은 공개하지 않은 사전 선별에 조건부이며, 그 절차가 만든 탐색을 전부 반영한 결과는 아닙니다.
공통 예측 결과에서 짝지은 손실 차이를 만든다
예측 시점 \(t\)에서 내놓은 예측의 실현값을 \(y_{t+h}\), 후보 \(i\)의 예측을 \(\hat y_{i,t+h|t}\)라고 하겠습니다. 미리 정한 손실 함수 \(L\)로 후보별·시점별 손실을 계산합니다.
\[ L_{i,t}=L(y_{t+h},\hat y_{i,t+h|t}) \]
손실이 낮을수록 좋다고 정하면, 후보 \(i,j\)의 짝지은 손실 차이는 다음과 같습니다.
\[ d_{ij,t}=L_{i,t}-L_{j,t}, \qquad \bar d_{ij}=\frac{1}{P}\sum_{t=1}^{P}d_{ij,t} \]
여기서 \(P\)는 공통 예측 시점의 개수입니다. 이 부호 규칙에서는 \(\bar d_{ij}>0\)이면 표본상 후보 \(i\)의 평균 손실이 \(j\)보다 높았고, \(\bar d_{ij}<0\)이면 \(i\)가 더 낮은 손실을 보였다는 뜻입니다. 두 후보가 같은 실현값을 대상으로 예측했기 때문에 짝짓기가 중요합니다. 공통 시장 충격은 두 손실을 함께 높일 수 있지만, 차이를 보면 동일 날짜에 어느 쪽의 손실이 상대적으로 컸는지 비교할 수 있습니다.
현재 남아 있는 집합 \(\mathcal M\)의 예측 성능 동등성(EPA) 귀무가설은 다음처럼 쓸 수 있습니다.
\[ H_{0,\mathcal M}:\quad \mu_{ij}=E[d_{ij,t}]=0 \quad \text{for every } i,j\in\mathcal M \]
이는 현재 후보 집합 전체에 대한 공동 가설입니다. 서로 무관한 쌍별 검정을 여러 번 시행해 마음에 드는 결과를 고르는 것과 같지 않습니다. MCS는 후보 간 비교를 묶는 동등성 검정과 제거 규칙을 결합합니다. 각 날짜의 예측값이 문자 그대로 같은지를 묻는 검정도 아닙니다.
현재 집합을 검정하고 제거 규칙을 정한다
MCS는 집합 단위 검정과 제거 단계를 번갈아 수행합니다. 처음에는 \(\mathcal M=\mathcal M_0\)로 두고, 정한 유의수준 \(\alpha\)에서 예측 성능 동등성 가설을 검정합니다. 기각하지 못하면 현재 집합에서 멈춥니다. 기각하면 미리 정한 제거 규칙을 적용해 후보 하나를 빼고, 줄어든 집합을 다시 검정합니다. 살아남은 집합이 절차의 가정 아래 \((1-\alpha)\) 수준의 MCS입니다.
원 논문에서 자주 쓰이는 통계량 가운데 하나는 표준화된 쌍별 손실 차이의 최댓값을 보는 범위 통계량입니다.
\[ T_{R,\mathcal M}=\max_{i,j\in\mathcal M}|t_{ij}|, \qquad t_{ij}=\frac{\bar d_{ij}}{\widehat{\mathrm{se}}(\bar d_{ij})} \]
이에 짝을 이루는 제거 규칙은 다른 후보와 비교해 표준화된 불리함이 가장 큰 후보를 빼는 방식입니다. 또 다른 통계량은 각 후보의 손실 차이를 현재 집합 평균과 비교합니다.
\[ T_{\max,\mathcal M}=\max_{i\in\mathcal M}t_{i\cdot}, \qquad d_{i\cdot,t}=\frac{1}{|\mathcal M|}\sum_{j\in\mathcal M}d_{ij,t} \]
여기서 \(t_{i\cdot}\)는 \(d_{i\cdot,t}\)의 평균을 표준오차로 나눈 값이며, 이에 짝을 이루는 규칙은 현재 집합 평균보다 표준화된 초과손실이 가장 큰 후보를 제거합니다. 검정통계량과 제거 규칙은 한 쌍으로 정해야 합니다. 결과를 확인한 다음 집합이 작아지는 쪽으로 서로 다른 통계량과 제거 규칙을 섞어서는 안 됩니다. Hansen, Lunde, Nason은 기각 검정과 실제 제거 대상이 서로 논리적으로 맞물려야 하는 이유를 설명합니다(원 논문).
부트스트랩에서 시계열 의존성을 보존한다
최댓값 통계량의 분포는 후보들의 손실 차이가 함께 움직이는 방식에 좌우됩니다. 각 모형이나 날짜를 독립 관측치처럼 다루면 두 종류의 의존성이 깨질 수 있습니다. 연속된 날짜의 손실은 시계열적으로 관련될 수 있고, 같은 날에 두 후보가 낸 손실은 짝지어져 있습니다. 그러므로 MCS 부트스트랩은 집합 단위 통계량의 귀무분포를 근사하면서 두 구조를 가능한 한 보존해야 합니다.
한 방법은 모든 후보의 손실 또는 손실 차이 벡터를 같은 시점 순서로 묶어 시계열 블록을 다시 뽑는 것입니다. 정상 부트스트랩에서는 블록 길이를 무작위로 정하고, 원래 표본의 시작점을 무작위로 골라 블록을 이어 붙입니다. Politis와 Romano는 약하게 의존하는 정상 시계열 관측치에 사용할 수 있는 이 방법을 제시했습니다(1994년 논문). MCS 원 논문의 구현 부록도 블록 부트스트랩을 설명하면서 정상 부트스트랩을 대안으로 언급합니다. 모형마다 따로 손실 시계열을 재표집하면 같은 날짜의 짝짓기가 사라져 비교 대상 자체가 달라질 수 있습니다.
평균 블록 길이, 부트스트랩 방식, 예측력 동등성 귀무가설 아래의 중심화 방법, 반복 횟수, 예측 시계가 불확실성 추정에 영향을 줍니다. 여러 시점 앞의 예측 구간이 겹치면 손실 차이의 의존성도 더 길어질 수 있지만 모든 자료에 적용되는 보편적 블록 길이는 없습니다. 선택한 설계를 설명하고, 합리적인 의존성 설정을 바꾸어도 결론이 유지되는지 살펴보세요. 부트스트랩은 가정 아래의 근사 방법입니다. 미래 정보를 쓴 예측, 반복해서 들여다본 홀드아웃, 비정상적인 점수 변화, 누락된 후보군을 바로잡아 주지는 않습니다.
네 후보를 비교하는 가상 예를 따라간다
네 예측 절차 A, B, C, D가 동일한 변동성 대상을 120개 공통 일별 예측 시점에서 평가한다고 하겠습니다. 제곱오차 손실의 평균은 설명을 위한 제곱 퍼센트포인트 단위로 각각 1.20, 1.23, 1.45, 1.90입니다. 이 평균만 정렬하면 A가 가장 낮고 D가 가장 높지만, 순위표는 차이가 표본 불확실성보다 큰지 알려주지 않습니다.
A와 B의 평균 짝손실 차이는 \(1.20-1.23=-0.03\)입니다. 시계열 의존성을 고려한 표준오차가 \(0.04\)라면 해당 쌍의 통계량은 \(-0.03/0.04=-0.75\)입니다. 이 한 쌍만 보면 A와 B 사이에 통계적으로 분명한 차이가 있다고 하기 어렵습니다. MCS는 여기서 끝나지 않습니다. 집합 검정은 네 후보 간 공동 손실 차이를 사용합니다.
계산 흐름을 보여 주기 위해, \(T_R\), \(\alpha=0.05\), 그리고 결과가 나쁜 후보를 제거하는 일관된 규칙을 사용한 블록 부트스트랩 결과를 가정해 보겠습니다. 120개 시점 전체 후보 집합의 p값이 0.018로 나와 D를 제거하고, \(\{A,B,C\}\) 집합에서 다시 계산한 p값은 0.11이라고 합시다. 이 값은 0.05보다 크므로 더는 기각하지 못하고, 예시의 95% MCS는 \(\{A,B,C\}\)에서 멈춥니다. C는 A보다 평균 손실이 높지만, 이 공동 검정에서는 C가 열등하다고 입증되지 않았습니다.
이 p값들은 절차를 설명하기 위한 가상 결과입니다. 네 개의 평균 손실이나 A와 B의 쌍별 대비만으로 재현할 수 없습니다. 실제 p값을 얻으려면 각 예측 시점의 전체 손실 자료와 후보 예측, 부트스트랩 설계, 단계별 제거 순서가 필요합니다. 실무에서는 이런 입력과 검정 순서를 보존하고, 각 단계에서 어떤 후보가 왜 제거되었는지 보고해야 합니다. <!-- learn:illustration -->

살아남은 집합을 과장하지 않고 해석한다
95% 수준의 MCS는 정해진 규칙과 표본 조건 아래에서, 지정한 후보 집합 중 기대 성과가 가장 좋은 후보를 반복 표본에서 적어도 표시한 신뢰수준으로 포함하도록 구성됩니다. 이것은 남은 각 모형이 최고일 사후확률이 95%라는 뜻이 아닙니다. 신뢰수준은 같은 절차를 여러 표본에 적용했을 때의 커버리지를 설명하는 빈도주의 해석이지, 개별 모형 이름에 확률을 붙인 결과가 아닙니다.
예측 성능 동등성을 기각하지 못했다고 후보들의 기대 손실이 정확히 같다는 사실이 입증된 것은 아닙니다. 표본이 짧거나 손실 차이가 매우 요동치거나 서로 비슷한 후보가 여럿이면 검정력이 부족할 수 있습니다. 큰 집합이 남는 것은 자료가 대안을 구별하지 못한다는 신호일 수 있습니다. 또한 MCS는 후보들끼리 비교하며 필수 외부 기준을 요구하지 않으므로, 남은 모형 전부가 절대적으로 나쁜 경우에도 집합을 반환할 수 있습니다.
집합의 경계는 처음 \(\mathcal M_0\)에 넣은 후보로 정해집니다. 실제로 더 좋은 예측 절차가 후보군에서 빠져 있으면 MCS가 이를 발견할 수 없습니다. 동일한 평가 구간을 미리 살펴본 뒤 약한 후보를 제거했다면, 명목상 커버리지는 공개되지 않은 선별 과정을 반영하지 않습니다. 후보를 만든 방법과 사전 선별 기록을 함께 설명하세요. 기대 손실이 같은 후보가 여러 개라면 둘 이상이 남는 결과는 방법의 실패가 아니라 허용된 결과입니다.
쌍별 검정과 기준모형 검정은 다른 질문을 한다
Diebold–Mariano 검정은 두 예측 절차가 같은 결과를 맞힌 자료에서 짝지은 손실 차이를 비교합니다. MCS는 후보 집합 전체를 순차 검정하고 공동 제거 절차의 생존 후보를 보고합니다. DM 검정을 여러 번 시행한 뒤 유의하지 않은 쌍들을 추려내는 일이 MCS와 자동으로 같아지지는 않습니다. 공동 부트스트랩과 검정·제거 규칙의 짝이 중요합니다.
Clark–West 검정은 한 예측모형이 제한된 기준모형을 포함하는 중첩 구조에서, 추정 잡음이 원래 제곱오차 차이에 미치는 영향을 다룹니다. MCS는 후보가 중첩되어 있을 것을 요구하지 않고 사용자가 정한 손실 기준을 쓸 수 있지만, 공통 예측 설계는 여전히 필요합니다.
White의 Reality Check와 Hansen의 SPA 검정은 미리 정한 기준모형보다 더 나은 후보가 탐색된 집합에 하나라도 있는지 묻습니다. MCS는 지정한 기준모형이 필요하지 않은 절차이며, 단일 기준모형보다 우월한지 검정하기보다 상대적으로 우수한 후보 집합을 보여 줍니다. 세 방법 모두 탐색 과정과 의존성 처리가 중요하지만 귀무가설은 서로 다릅니다. 자세한 비교는 Reality Check와 SPA 안내와 White의 2000년 논문, Hansen의 2005년 논문을 참고하세요.
설계를 재현할 수 있게 보고하고 매매가치와 분리한다
재현 가능한 MCS 보고서에는 모든 후보 절차, 공통 예측 대상과 시계, 정보 사용 규칙, 추정 일정, 평가 날짜, 누락 자료 처리, 손실 함수와 우수한 쪽의 부호가 들어가야 합니다. 유의수준, 검정통계량과 제거 규칙, 부트스트랩 방식, 블록 길이, 귀무가설 중심화 방법, 반복 횟수, 단계별 p값, 최종 후보 집합도 명시합니다. 평균 손실과 차이는 맥락으로 함께 제시하되, 단순 순위표로 집합 검정을 대체하지 마세요.
변동성 예측을 비교한다면 관측한 분산 대용변수를 어떻게 구성했는지, 자료에 측정 잡음이나 개정이 있는지 적어야 합니다. 다기간 예측은 목표 구간이 겹치는지와 의존성을 처리한 방법을 공개해야 합니다. 손실 함수, 표본 기간, 부트스트랩 설정을 합리적인 범위에서 바꿨을 때 집합 구성도 비교해 보세요. 제거 대상과 절차를 빼고 아주 작은 p값만 보고해서는 집합을 재현하기 어렵습니다.
MCS는 한 가지 평가 기준에서 예측 절차의 상대 성과를 비교합니다. 인과관계를 밝히거나 참인 자료생성과정을 찾거나, 남은 후보가 수익 나는 매매를 만든다는 사실을 입증하지 않습니다. 예측을 포지션으로 바꾸면 신호 기준, 규모, 회전율, 체결 시점, 스프레드, 수수료, 슬리피지, 금융 비용, 차입, 위험 한도가 추가됩니다. 고정한 의사결정 절차를 적절한 후속 자료에서 별도로 평가하고 순비용 후 매매 결과를 따로 보고해야 합니다. 잡음이 있는 변동성 대용변수의 손실 기준은 QLIKE와 제곱오차 비교를 참고하세요.
자주 묻는 질문
Q1MCS가 최선의 모형 하나를 선택하나요?
항상 그렇지는 않습니다. 자료가 후보를 구별하면 하나만 남을 수 있지만, 어떤 후보가 열등한지 판정할 수 없으면 여러 개가 남습니다. 생존 후보 중 하나를 실제로 배포하려면 별도 의사결정 규칙이 필요합니다.
Q2MCS에 남은 모형이 참일 확률은 95%인가요?
아닙니다. 신뢰수준은 방법의 가정 아래에서 지정된 후보군 중 최선인 후보를 반복 표본에서 포함하는 절차의 커버리지를 설명합니다. 모형이 참일 사후확률이 아닙니다.
Q3변동성 예측 이외의 비교에도 MCS를 쓸 수 있나요?
가능합니다. 공통 기준과 적절한 표본 설계를 정할 수 있다면 예측, 계량모형 또는 다른 후보 절차를 비교할 수 있습니다. 결과는 선택한 후보군과 손실 기준에 따라 달라집니다.
Q4MCS가 제가 시도한 모든 모형을 자동으로 반영하나요?
실제 탐색이 후보군과 평가 절차에 포함된 경우에만 그렇습니다. 공개되지 않은 선별이나 평가 자료의 반복 사용은 MCS를 실행하는 것만으로 교정되지 않습니다.
출처와 더 읽을 자료
내용 정정 제보
이 아티클 링크를 담은 이메일 초안을 준비합니다. 직접 보내야 Mark에 제보가 접수됩니다
QUICK CHECK
글을 다 읽었다면, 3문항으로 확인해보세요
Question 01
모형 신뢰집합(MCS)이 보고하는 결과는 무엇인가요?
정답을 고르면 바로 설명을 볼 수 있어요
옵션 용어 사전
콜·풋과 옵션 체인부터 IV, 그릭스, 미결제약정, 맥스 페인까지 핵심 옵션 용어를 정확하게 설명합니다
옵션 용어 사전 보기