Fissler–Ziegel VaR–ES 공동 점수와 예측 비교
VaR와 기대부족액(Expected Shortfall)을 왜 공동 점수로 평가하는지, Fissler–Ziegel 점수로 예측을 비교하는 방법과 VaR 예외 횟수 검정과의 차이를 설명합니다.
이 글에서 다루는 내용예측 쌍과 꼬리 기준부터 고정하기
짧은 요약
VaR는 손실 분포의 분위수이므로 분위수 손실로 단독 평가할 수 있습니다. 기대부족액(ES)은 성격이 다릅니다. 폭넓은 분포군에서 ES만을 입력하는 점수로 ES를 엄밀하게 유도할 수는 없지만, Fissler와 Ziegel은 적절한 조건 아래 VaR와 ES의 쌍을 엄밀 일관 공동 점수로 평가할 수 있음을 보였습니다. 따라서 두 예측을 비교할 근거는 생기지만, 낮은 점수가 위험 모형의 정확성을 증명하지는 않습니다.
예측 쌍과 꼬리 기준부터 고정하기
L_t를 손실로 두면 값이 클수록 손실이 큽니다. 신뢰수준 c가 97.5%일 때 조건부 VaR v(c,t)는 t−1 시점까지의 정보로 계산한 손실 분포에서 누적확률이 c에 도달하는 분위수입니다. 상위 손실 꼬리를 사용하는 ES는 e(c,t) = [1/(1−c)] × c부터 1까지 VaR_u의 적분으로 정의할 수 있습니다. 꼬리 평균이 유한하다는 조건이 필요합니다. 분포가 연속이면 VaR를 넘는 손실의 평균과 일치합니다. VaR 경계에 확률질량이 있는 분포에서는 경계의 질량을 필요한 만큼만 반영하는 적분 정의가 단순 조건부 평균보다 안전합니다.
먼저 이 글의 부호를 분명히 합니다. 여기서는 양수 손실을 쓰는 상위 꼬리 기준을 사용하므로 ES는 VaR보다 작지 않습니다. 논문에 따라 수익률의 하위 꼬리를 사용하고 꼬리확률 α=1−c로 표기하면 VaR와 ES가 음수가 될 수 있고 부등호도 뒤집힙니다. 수익률 기준 점수식을 양수 손실 자료에 그대로 대입하면 지시함수와 부호가 맞지 않을 수 있습니다. 예측과 실현값의 부호, 신뢰수준, 예측 기간, 그리고 예측 시점에 이용할 수 있었던 정보집합을 함께 기록하세요.
VaR와 ES를 같은 방식으로 단독 채점할 수 없는 이유
분위수는 핀볼 점수로 단독 평가할 수 있습니다. 손실 관측값 L과 c 분위수 예측 v에 대해 한 가지 VaR 점수는 S_VaR(v,L)=(I{L≤v}−c)(v−L)입니다. 손실이 예측 분위수보다 크면 c에 해당하는 가중치로 초과 폭을 반영하고, 분위수 아래에 있으면 1−c에 해당하는 가중치로 차이를 반영합니다. 일반적인 분위수 조건에서 이 점수의 기대값은 올바른 c 분위수에서 최소가 됩니다. 즉 VaR는 실현값과 분위수 예측을 이용하는 엄밀 일관 점수가 존재합니다.
ES에는 같은 의미의 단독 점수가 없습니다. 더 정확히 말하면, 위험관리에서 쓰는 폭넓은 손실 분포군을 대상으로 ES 예측값 하나만 입력하고 기대 점수를 유일하게 최소화하는 엄밀 일관 점수는 존재하지 않습니다. 이 명제는 ES가 무의미하다거나, ES 예측을 비교하거나 검정할 수 없다는 뜻이 아닙니다. 어떤 추정량이나 평가 절차가 가능한지에 관한 수학적 범위를 구분하는 말입니다.
Fissler와 Ziegel의 2016년 연구는 일반적인 엄밀 일관 점수의 조건을 분석하고, VaR와 ES의 쌍이 약한 정규성·적률 조건 아래 공동으로 유도될 수 있음을 보였습니다(Fissler와 Ziegel, 2016). 공동 유도라는 말은 점수 함수 하나가 VaR 예측, ES 예측, 실현값을 함께 받아 두 추정량을 올바른 조합으로 평가한다는 뜻입니다. VaR 핀볼 손실과 임의로 만든 ES 오차를 더하기만 하면 유효한 공동 점수가 되는 것은 아닙니다.
Fissler–Ziegel 공동 점수의 의미
신뢰수준 c에서 예측한 쌍을 (v,e), 실현 손실을 L이라고 하고 공동 점수를 S_c(v,e;L)로 쓰겠습니다. 엄밀 일관성이란 올바른 분포 아래 기대 점수가 정답 쌍에서 최소가 되고, 조건이 충분하면 그 최소점이 유일하다는 뜻입니다. 식으로 표현하면 (VaR_c, ES_c)=arg min_(v,e) E[S_c(v,e;L)]입니다. 이 성질이 있어야 표본의 평균 점수를 이용한 순위가 적어도 해당 통계적 질문에 맞는 근거를 가질 수 있습니다. 손실 양수 기준에서는 ES가 VaR보다 작지 않도록 예측 쌍과 허용 영역을 일관되게 다뤄야 합니다.
Fissler–Ziegel 점수는 단일 식이 아니라 조건을 충족하는 함수군입니다. Patton, Ziegel, Chen은 이 결과를 이용해 시변 VaR·ES를 함께 모형화하고 예측을 비교했습니다(Patton, Ziegel, Chen, 2019). 예를 들어 FZ0 점수는 수익률의 하위 꼬리 Y=−L, 꼬리확률 α=1−c, 음수 예측 e≤v<0을 사용하는 경우 다음과 같이 표현할 수 있습니다.
S_FZ0(Y,v,e;α) = −I{Y≤v}(v−Y)/(αe) + v/e + ln(−e) − 1
이 식은 부호와 음수 ES 가정이 붙은 특정 점수입니다. 양수 손실에 적힌 식으로 그대로 적용할 수 없고, 모든 허용 점수 가운데 보편적으로 가장 좋은 식이라는 뜻도 아닙니다. 적용할 점수의 수식과 제약을 먼저 명시한 다음 자료의 부호, 꼬리 수준, 분위수 정의가 그 조건을 만족하는지 확인해야 합니다.
평균 점수와 점수 차이를 읽는 법
모형 m은 각 시점 t에 VaR와 ES 예측을 내고, 그날의 같은 실현 손실에 대해 S_c(v_hat(m,t), e_hat(m,t); L_t)를 계산합니다. T개 시점의 평균은 mean_S_m=(1/T)Σ_t S_c(v_hat(m,t),e_hat(m,t);L_t)입니다. 같은 허용 점수와 날짜, 손실 정의, 신뢰수준으로 계산했다면 평균이 낮은 예측 쌍이 그 점수 기준에서 더 나은 표본 성과를 보인 것입니다. 평균 점수의 단위나 크기는 함수 선택과 입력 척도에 따라 달라지므로 확률, VaR 금액, 미래 손실의 달러 추정치로 읽으면 안 됩니다.
두 모형 A와 B는 같은 시점과 같은 실현값에 대해 비교해야 합니다. 시점별 차이를 d_t=S_A,t−S_B,t로 두면 평균 차이가 음수일 때 A의 점수가 낮았다는 의미입니다. 짝지어진 차이를 직접 분석하면 서로 다른 표본에서 산출한 평균 두 개만 비교하는 것보다 같은 시장 충격에 대한 상대 성과를 보기 쉽습니다. 다만 꼬리 관측이 적으면 평균 차이도 큰 표본오차를 가질 수 있습니다.
예측 원점, 평가 날짜, 포트폴리오 또는 대상 손실, 보유 기간, 신뢰수준, 자료 빈티지를 맞추세요. 실현값이 나온 뒤 수정된 데이터를 사용해 과거 예측을 다시 만들면 사후정보가 섞입니다. 예측은 당시 이용 가능했던 정보로 생성되었는지 기록해야 합니다. 여러 기간이 겹치는 예측이거나 점수 차이에 자기상관이 남아 있다면 표준오차도 그 의존 구조를 반영해야 합니다. 평균 차이만 제시하지 말고 적절한 표준오차나 구간 추정 방법을 함께 보고하세요. 점수 차이가 작다는 이유만으로 의미 있는 승리라고 단정하면 안 됩니다.
<!-- learn:illustration -->

임의의 두 손실을 합쳐서는 안 되는 이유
VaR에는 핀볼 점수를 쓰고 ES에는 예측값과 어떤 대용치 사이의 절대오차를 붙여 합산하고 싶을 수 있습니다. 하지만 ES 대용치 자체가 타당한 기준인지 확인해야 하고, 그런 절대오차의 기대값이 정답 ES에서 최소가 된다는 보장도 없습니다. 각 항목에 임의 가중치를 곱한 합도 VaR–ES 쌍에 대한 엄밀 일관성을 자동으로 갖지 않습니다. 핵심은 두 점수가 모두 그럴듯해 보이는지가 아니라, 전체 점수의 기대값이 목표인 VaR와 ES를 함께 식별하는지입니다.
Fissler–Ziegel 함수군에는 여러 점수가 있으며 점수마다 실현값을 반영하는 방식과 수치 척도가 다릅니다. 한 점수에서 계산한 평균 0.4와 다른 점수의 평균 0.2를 비교해 두 번째가 더 낫다고 할 수 없습니다. 같은 데이터에서 점수식을 바꾸면 모형 순위도 달라질 수 있으므로 선택한 점수와 선택 근거를 사전에 기록하고 보고해야 합니다. Patton, Ziegel, Chen은 자산 수익률 위험 예측을 위해 추가 부호 조건 아래 척도 특성을 가진 FZ0 변형을 다룹니다. 그 조건부 장점은 모든 포트폴리오와 자료에서 FZ0가 최선이라는 뜻이 아닙니다.
VaR와 ES 예측 자체도 쌍으로 보아야 합니다. ES 숫자가 직관적으로 작거나 커 보인다는 이유만으로 좋은 예측이라 할 수 없습니다. VaR 경계와 함께 분포의 같은 꼬리를 설명해야 하고, 허용 영역이나 수학적 정의와 충돌하지 않아야 합니다. 반대로 공동 점수에서 좋은 결과를 얻어도 조건부 분포 전체가 올바르거나 모든 극단 손실이 설명되었다고 결론내릴 수는 없습니다. 평가한 대상은 정해 둔 꼬리 수준의 VaR–ES 함수와 선택한 점수입니다.
VaR 예외가 같아도 꼬리 손실은 다를 수 있다
VaR 예외 지표는 I_t=1{L_t>v_hat(c,t)}처럼 임계값을 넘었는지만 기록합니다. 두 모형이 같은 시점에 같은 횟수로 예외를 냈더라도 경계를 넘은 손실의 크기는 다를 수 있습니다. 예외 네 번이라는 집계에는 네 번 모두 VaR를 조금 넘었는지, 그중 큰 초과가 있었는지가 들어 있지 않습니다. ES는 선택한 꼬리의 평균 손실 규모를 설명하려는 지표이므로 관측된 손실 크기를 버린 평가로는 VaR–ES 예측 쌍을 충분히 평가할 수 없습니다.
공동 점수는 예측한 VaR와 ES를 실현 손실과 함께 사용하므로 예외 횟수 외에 초과 손실의 크기에도 반응할 수 있습니다. 다만 각 관측값이 기여하는 정확한 방식은 선택한 FZ 점수식이 결정합니다. 큰 손실 하나만 보고 전체 표본에서 어느 모형이 이겼다고 결론내릴 수 없습니다. 같은 공통 표본 전체에서 점수를 계산하고, 몇 개의 꼬리 관측치가 순위를 바꾸는지 민감도도 살펴보세요. 예를 들어 두 모형이 매일 같은 VaR 100을 제시했다면 예외가 난 날짜와 횟수는 두 모형에서 같을 수 있습니다. 하지만 한 표본의 꼬리 실현값이 101과 103인 경우와 101과 180인 경우는 초과 손실 규모가 다릅니다. 여기에 모형별 ES 전망도 다르면 공동 점수 입력이 달라집니다. 어느 모형이 낫다고 말하려면 전체 날짜의 VaR·ES 예측과 실현 손실을 선택한 점수식에 넣어야 합니다. 이 숫자 예시는 점수를 계산한 결과가 아니라 예외 지표가 버리는 정보만 보여 줍니다.
따라서 공동 점수와 VaR 예외 검정은 같은 질문이 아닙니다. 공동 점수는 정해 둔 규칙으로 두 예측 쌍 중 상대적으로 어느 쪽이 더 잘 수행했는지 평가합니다. 예외 검정은 한 VaR 예측이 목표 예외율과 시간적 독립성에 맞는지 살펴봅니다. 상대 비교 점수의 순위만으로 한 모형이 충분히 보정되었다고 말할 수는 없습니다.
예외 횟수 검정과 ES 백테스트의 차이
Kupiec 계열 VaR 검정은 임계값 초과 횟수가 목표 발생률과 맞는지 비교합니다. Christoffersen 계열 검정은 여기에 예외 발생의 독립성이나 군집 여부를 추가로 살펴볼 수 있습니다. 이런 검정은 각 시점의 손실을 초과 또는 비초과라는 이진값으로 압축하므로 VaR 경계를 넘은 손실이 얼마나 컸는지는 반영하지 않습니다. 또한 그 자체로 ES 예측이 맞았는지 검정하지 않습니다. 먼저 VaR와 기대부족액 비교 안내에서 두 위험 지표가 담는 정보 차이를 확인할 수 있습니다.
점수 기반 상대 비교와 위험 예측의 백테스트도 구별해야 합니다. 전자는 두 예측 중 어떤 것이 선택한 점수에서 더 나은지 묻고, 후자는 정해진 검정 절차 아래 예측이 보정되었는지를 묻습니다. Acerbi와 Szekely는 비모수적 ES 백테스트를 제안하며, 점수 기반 선택에 관련된 유도 가능성(elicitability)이 위험 지표를 검정하는 데 필수 전제는 아니라고 설명합니다(Acerbi와 Szekely, 2014). 이후 Bayer와 Dimitriadis는 VaR–ES 공동 회귀 구조를 활용한 ES 백테스트를 연구했습니다(Bayer와 Dimitriadis, 2022). 이 방법들은 변형별 가정과 공분산 추정 요건이 있습니다. 점수 순위를 별도 백테스트의 대체물로 제시해서는 안 되고, 검정에서 기각되지 않았다는 사실도 정확성의 증명이 아닙니다.
짝지은 추론을 계획하고 사후 선택을 막기
시점별 점수 차이 d_t 자체가 분석 대상입니다. 겹치지 않는 1기간 예측이고 필요한 의존성 가정이 맞는다면 평균 차이에 대한 짝지은 검정을 고려할 수 있습니다. 시계열 상관이나 겹치는 보유 기간이 있으면 장기분산 추정 또는 블록 재표집처럼 의존성을 고려한 방법을 선택하세요. 어떤 표준오차와 대역폭, 블록 길이를 썼는지 공개해야 합니다. 단일 p값만으로 모든 시계열 구조가 처리되었다고 주장할 수 없습니다.
점수 함수, 꼬리 확률, 신뢰수준, 평가 구간, 자산 또는 포트폴리오, 비교할 모형 목록은 결과를 확인하기 전에 정하는 편이 좋습니다. 여러 점수, 표본 구간, 모형 변형을 모두 시도한 뒤 가장 낮은 점수만 보고하면 선택 과정 때문에 승자 성과가 과장될 수 있습니다. 가능하면 모형 선택과 튜닝에 쓰지 않은 후속 평가 구간을 남겨 두고, 어떤 대안을 검토했는지 기록하세요. 평가 표본을 반복적으로 확인해 모형이나 점수를 수정했다면 일반적인 표준오차가 그 탐색을 자동으로 보정해 주지는 않습니다.
최종 보고에는 평균 점수만이 아니라 평균 점수 차이와 불확실성, 공통 평가 날짜, 실현 꼬리 관측 수, VaR·ES 부호와 신뢰수준, 점수의 정확한 정의를 포함하세요. 합리적인 점수 선택이나 평가 기간을 바꾸었을 때 순위가 바뀐다면 해당 민감도를 숨기지 말고 함께 보여 주어야 합니다. 이것은 통계 평가 결과의 적용 범위를 독자가 판단하도록 돕습니다.
한계와 보고 전 점검 사항
높은 신뢰수준에서는 꼬리 관측치가 드뭅니다. 시계열이 길어 보여도 실제 ES를 평가하는 데 기여하는 극단 손실은 적을 수 있어 모형 순위가 불안정합니다. 조건부 이분산, 국면 변화, 수익률의 중첩, 모수 추정 오차, 가격 자료 오류, 포트폴리오 구성 변경도 점수 차이를 바꿀 수 있습니다. VaR–ES 공동 유도 가능성은 적절한 점수군을 제공할 뿐, 자료 문제나 모형 오지정을 해결하지 않습니다.
해석하기 전에 실현 손실이 예측 대상의 포트폴리오, 보유 기간, 평가 시각, 부호와 일치하는지 확인하세요. VaR와 ES가 동일 꼬리확률을 가리키는지, 예측이 실현값을 보기 전에 만들어졌는지, 점수 함수가 정한 분포·적률·부호 조건을 만족하는지도 확인해야 합니다. 평가 표본 길이와 꼬리 관측 수, 점수식, 짝지은 불확실성 추정, 시도한 모형과 점수의 선택 과정을 기록하세요. 보고서의 결론은 이러한 설계와 조건에 한정됩니다.
특정 Fissler–Ziegel 점수에서 평균이 더 낮다는 결과는 그 점수와 표본 아래 상대 예측력이 더 좋았다는 증거입니다. 모든 꼬리 사건을 설명한다거나 위험 추정치가 안전하다는 뜻은 아니며, 미래 결과가 표본과 같을 것이라는 약속도 아닙니다. 이 내용은 계량적 평가 방법을 설명하는 교육 자료이며 특정 투자, 포트폴리오 또는 위험 모형을 권하는 투자 조언이 아닙니다.
자주 묻는 질문
Q1기대부족액 예측을 절대오차로 비교할 수 있나요?
일반적인 엄밀 일관 점수를 대신한다고 볼 수는 없습니다. 넓은 분포군에서 ES만을 유도하는 단독 점수는 없으므로, 점수 기반 비교라면 VaR와 ES를 함께 채점하거나 보정 여부를 묻는 전용 ES 백테스트를 사용해야 합니다.
Q2VaR–ES 공동 점수는 위험 모형이 보정되었는지 알려 주나요?
선택한 공동 점수에 따른 상대 예측 성과를 평가합니다. 보정과 모형 오지정은 별도의 질문이므로 목적에 맞는 백테스트와 진단을 함께 사용해야 합니다.
Q3VaR 예외 횟수가 같아도 공동 점수는 다를 수 있나요?
그렇습니다. 예외 지표가 같아도 VaR를 넘은 실현 손실의 크기나 ES 예측값은 다를 수 있습니다. 공동 점수는 두 예측과 실현값을 사용하며 정확한 영향은 점수식에 달려 있습니다.
Q4낮은 점수를 받은 모형은 사용해도 안전한가요?
그 결과만으로 안전하다고 말할 수 없습니다. 점수는 정한 표본과 가정 아래의 비교입니다. 꼬리 자료 부족, 국면 변화, 사후 모형 선택, 자료 오류가 결과를 바꿀 수 있습니다. 이 글은 교육 자료이지 투자 조언이 아닙니다.
출처와 더 읽을 자료
내용 정정 제보
이 아티클 링크를 담은 이메일 초안을 준비합니다. 직접 보내야 Mark에 제보가 접수됩니다
QUICK CHECK
글을 다 읽었다면, 3문항으로 확인해보세요
Question 01
기대부족액(ES)을 VaR와 함께 채점하는 주된 이유는 무엇인가요?
정답을 고르면 바로 설명을 볼 수 있어요