VaR 백테스트: 쿠피에크·크리스토페르센 검정 설명
쿠피에크 POF 검정과 크리스토페르센 조건부 커버리지 검정이 VaR 예외 횟수와 군집을 어떻게 확인하는지, 250일 사례와 함께 살펴봅니다.
이 글에서 다루는 내용VaR 백테스트는 무엇을 확인하나요?
짧은 요약
VaR 백테스트는 매번 산출한 손실 기준과 그 뒤에 실현된 손실을 비교합니다. 쿠피에크 검정은 예외가 목표 비율에 맞게 나왔는지 묻고, 크리스토페르센 검정은 예외가 서로 독립적으로 나타났는지, 아니면 군집했는지도 살핍니다. 두 검정은 다른 특징을 확인하며, 어느 쪽도 위험모형의 정확성을 증명하지는 않습니다.
VaR 백테스트는 무엇을 확인하나요?
위험가치(Value at Risk, VaR)는 정해진 신뢰수준과 기간에 대응하는 손실 경계입니다. 하루 99% VaR가 1만 달러라면, 모형은 명시된 정보와 가정 아래 하루 손실이 1만 달러를 넘을 확률을 1%로 평가합니다. 1만 달러가 손실의 상한이라는 뜻은 아니며, 경계를 넘었을 때 손실이 얼마나 커질지도 알려주지 않습니다.
백테스트에서는 매일의 예측과 결과를 예외 여부로 바꿉니다. 99% 일간 VaR가 제대로 보정되어 있다면 비슷한 조건의 관측이 반복될 때 예외가 장기적으로 약 1% 발생해야 합니다. 그러나 횟수만 맞으면 충분한 것은 아닙니다. 예외가 몰려서 나타나는지, 위험예측에 맞지 않는 시간 패턴이 있는지도 별개의 질문입니다. 쿠피에크의 POF(proportion of failures) 검정은 주로 횟수를 확인합니다. 크리스토페르센의 독립성 검정과 조건부 커버리지 검정은 발생 순서까지 분석에 포함합니다.
실무에서도 이 구분은 중요합니다. 한 모형에서 1년 동안 예외가 네 번 나왔더라도 네 번 모두 변동성이 커진 한 주에 몰렸을 수 있습니다. 다른 모형은 같은 네 번이 일 년에 걸쳐 흩어져 있을 수 있습니다. 횟수만 보는 검정은 둘 다 네 번으로 처리하지만, 순서를 보는 검정은 서로 다른 예외열을 봅니다. 아래 검정은 이러한 특징을 기술하는 도구이지, 보유 포지션과 시장 자료, 모형 가정, 손실 규모를 대신 검토하지 않습니다. GARCH 모형이 변동성 군집을 표현하는 방식을 설명하는 글도 참고할 수 있습니다. 분산 모형은 변동성이 시간에 따라 어떻게 움직이는지 표현하고, 백테스트는 예측된 위험과 실현된 결과가 맞았는지 점검합니다.
예외를 세기 전에 정의를 고정합니다
먼저 부호 규칙을 하나로 정합니다. Lₜ를 t일에 실현된 손실, VaRₜ|ₜ₋₁를 t일 이전 정보로 산출한 당일 손실 기준이라고 하겠습니다. 예외 지시변수 Iₜ는 Lₜ가 VaRₜ|ₜ₋₁보다 크면 1, 그렇지 않으면 0입니다. 99% VaR라면 목표 예외확률은 α = 1 − 0.99 = 0.01입니다. 원문이나 구현에 따라 수익률을 기준으로 부호를 반대로 쓰거나 손실 구간의 포함 여부를 나타낼 수도 있습니다. 이런 표기 차이는 부호와 확률을 함께 바꾸면 같은 개념이므로, 글이나 분석에서 사용한 정의를 먼저 밝혀야 합니다.
예측과 결과는 같은 포트폴리오, 기간, 평가시각, 손실 정의를 가리켜야 합니다. 장 마감 후 다음 거래일 VaR를 산출했다면, 사전에 정한 평가 규칙으로 그 다음 거래일 손실과 비교합니다. VaR 경계와 정확히 같은 경우를 어떻게 처리할지, 휴장일과 결측 관측은 어떻게 다룰지, 평가 중 포트폴리오가 바뀌었을 때 무엇을 기록할지도 미리 정해야 합니다. 예외가 드물수록 한 건의 분류 차이가 결과에 큰 영향을 줄 수 있습니다.
모형을 고른 기간과 최종 검정 기간도 구분하는 편이 좋습니다. 검정에 쓴 기간을 보면서 파라미터나 위험한도를 반복 조정했다면, 그 p값은 독립적인 표본 밖 점검으로 해석하기 어렵습니다. 롤링 예측을 평가할 때는 각 예측을 어느 시점에 만들었고, 당시 어떤 정보까지 이용했는지 남깁니다. 매일 새로 계산하는 다일간 VaR는 기간이 서로 겹쳐 예외 지시변수끼리 의존할 수 있습니다. 아래 표준 검정은 기간 불일치, 미래정보 유입, 수정된 입력자료, 모형 선택 과정을 자동으로 교정하지 않습니다.
쿠피에크 POF 검정은 어떤 질문에 답하나요?
서로 비교할 수 있는 예측·결과 쌍이 T개이고 예외가 x번 나왔다고 하겠습니다. 실제 예외비율은 p̂ = x/T입니다. 쿠피에크의 POF 검정은 두 이항우도를 비교합니다. 하나는 예외확률을 목표값 α로 고정하고, 다른 하나는 실제 표본비율 p̂를 자유롭게 추정합니다. 이 검정은 쿠피에크의 1995년 논문에 제시되어 있으며, 미 연방준비제도 자료실에서도 원문 기록을 확인할 수 있습니다. 우도비 통계량은 다음과 같습니다.
LRᵤ꜀ = −2 ln [ (1−α)^(T−x) α^x / ((1−p̂)^(T−x) p̂^x) ]
귀무가설 아래에서는 예외가 서로 독립적인 베르누이 사건이고 각 확률이 α라고 둡니다. 표본이 충분히 크면 통계량은 자유도 1인 카이제곱분포에 근사합니다. 통계량이 크면 지정한 예외빈도와 관측된 횟수가 맞지 않는다는 근거가 됩니다. 대립모형이 예외확률을 자유롭게 추정하기 때문에 예외가 너무 많아도, 너무 적어도 기각될 수 있습니다. VaR 경계를 거의 넘지 않는 모형이 자동으로 잘 보정되었다고 할 수는 없습니다. 실제 위험보다 지나치게 넉넉한 기준을 제시했을 수도 있기 때문입니다.
POF 검정은 예외 날짜가 아니라 횟수 x만 사용합니다. 동일한 예외 지시변수의 순서를 바꾸어도 통계량은 달라지지 않습니다. 그러므로 이 검정만으로 예외 네 번이 흩어졌는지 연속되었는지 알 수 없습니다. 또한 이항우도의 기준분포는 예외들이 독립적이라는 가정을 사용합니다. 예외가 군집하는지가 궁금하다면 POF 결과에 그 해석을 덧붙이지 말고, 의존성을 직접 검정하는 절차를 추가해야 합니다.
250일 중 네 번의 예외를 해석해 봅니다
가상의 99% 일간 VaR 예측을 250일 동안 평가한다고 가정해 봅니다. 귀무가설에서 목표 예외확률은 α = 0.01이고 기대 예외 수는 Tα = 250 × 0.01 = 2.5회입니다. 실제 예외가 네 번 관측되면 p̂ = 4/250 = 0.016, 즉 1.6%입니다. 목표인 1%보다 크기는 하지만, 차이만 보고 우도비 검정의 기각 여부를 단정할 수는 없습니다.
T = 250, x = 4, α = 0.01을 식에 넣으면 LRᵤ꜀는 약 0.769입니다. 점근적 카이제곱(1) 기준을 적용하면 p값은 약 0.38이고, 5% 임계값은 약 3.84입니다. 이 근사를 따르면 예시는 5% 수준에서 무조건적 커버리지 귀무가설을 기각하지 않습니다. 이 수치는 계산 방식을 보여주기 위한 가정값이며, 실제 시장 자료에서 얻은 결과도 아니고 모든 분석에 적용할 승인 기준도 아닙니다.
로그우도 두 값을 비교하면 통계량이 어떻게 나오는지 볼 수 있습니다. 예외확률을 목표값으로 고정한 모형에서는 ℓ₀ = 246 ln(0.99) + 4 ln(0.01) ≈ −20.893입니다. 실제 관측률을 쓰는 모형에서는 ℓ₁ = 246 ln(0.984) + 4 ln(0.016) ≈ −20.508입니다. 자유롭게 맞춘 우도가 약 0.385 로그우도 단위만큼 높으므로 LRᵤ꜀ = −2(ℓ₀ − ℓ₁) ≈ 0.769가 됩니다. 이 검정은 목표 예외확률을 고정했을 때의 적합도 손실을 비교하며, 달러 단위의 오차를 재는 것은 아닙니다.
기각하지 못했다는 말은 모형이 잘 보정되었다는 증명이 아닙니다. 250일 동안 기대되는 예외가 2.5회뿐이라 한두 건 차이로 관측 비율이 눈에 띄게 바뀝니다. 카이제곱 기준은 점근적 근사이고, 드문 사건을 짧은 표본으로 검정하면 검정력이 낮을 수 있습니다. 통계량만 읽지 말고 기대 횟수와 실제 횟수, 예측기간, 검정 설계, 표본 크기를 함께 보세요. p값은 VaR 모형이 맞을 확률이 아닙니다.
예외 횟수가 같아도 발생 순서는 다를 수 있습니다
같은 250일의 예외열을 두 가지로 가정해 봅니다. A에서는 20일, 80일, 140일, 220일에 네 번 예외가 납니다. B에서는 60일과 61일, 180일과 181일에 예외가 납니다. 두 경우 모두 x = 4, p̂ = 1.6%이므로 쿠피에크 통계량은 같습니다. 하지만 A에는 연속된 예외가 없고, B에는 이틀 연속 예외가 두 쌍 있습니다.
아래 그림은 총횟수만 저장하지 말고 예외열의 순서도 남겨야 하는 이유를 개념적으로 보여줍니다. 250일의 실제 관측자료도 아니고 유의성 검정 결과도 아닙니다. 예외가 연달아 나타나면 변동성 변화에 모형이 따라가지 못하는지 살펴볼 이유가 되지만, 몇 개 지점만으로 원인을 특정할 수는 없습니다. 모형 지정 오류, 급격한 시장 충격, 포트폴리오 구성 변경, 겹치는 평가기간, 자료와 시각 규칙도 패턴에 영향을 줄 수 있습니다.
전이 횟수를 세기 위해 이전 지시변수가 i이고 현재 지시변수가 j인 경우의 수를 nᵢⱼ로 둡니다. 0은 예외 없음, 1은 예외입니다. 표본 경계에서 떨어진 위치를 기준으로 A는 n₀₁ = 4, n₁₁ = 0이고, B는 n₀₁ = 2, n₁₁ = 2입니다. 예외 수는 네 번으로 같지만 B에서는 예외 중 두 번이 전날의 예외 직후에 나왔습니다. 1차 독립성 검정은 바로 이 순서 정보를 활용합니다.
전이표 전체를 적으면 A는 n₀₀ = 241, n₀₁ = 4, n₁₀ = 4, n₁₁ = 0이고, B는 각각 243, 2, 2, 2입니다. 전날 예외가 없었을 때의 적합 확률은 n₀₁/(n₀₀+n₀₁)이고, 전날 예외가 있었을 때는 n₁₁/(n₁₀+n₁₁)입니다. A에서는 각각 4/245 ≈ 1.63%와 0/4 = 0%입니다. B에서는 2/245 ≈ 0.82%와 2/4 = 50%입니다. B의 50%는 예외 직후 전이 네 건 중 두 건이 예외였다는 가상 표본의 비율입니다. 실제 모형의 다음 날 위험을 그 정도로 정확히 추정했다는 뜻은 아닙니다.


크리스토페르센 독립성 검정은 무엇을 더하나요?
크리스토페르센의 1998년 논문은 조건부 구간예측을 평가하는 틀을 제시합니다. 독립성 검정은 전날 예외가 있었는지에 따라 오늘 예외가 날 확률이 달라지는지 묻습니다. π₀ = Pr(Iₜ = 1 | Iₜ₋₁ = 0)은 전날 예외가 없을 때의 확률이고, π₁ = Pr(Iₜ = 1 | Iₜ₋₁ = 1)은 전날 예외가 있었을 때의 확률입니다. 독립성 귀무가설은 π₀ = π₁입니다. 대립가설에서는 n₀₀, n₀₁, n₁₀, n₁₁ 전이횟수에 맞춰 두 확률을 따로 추정합니다.
독립성 우도비 통계량은 두 모형을 비교하며, 보통 자유도 1인 카이제곱분포에 근사해 평가합니다. POF 검정과 달리 지시변수의 순서를 사용합니다. 예외 다음에 예외가 이어지는 일이 많으면 π₁이 π₀보다 커질 수 있습니다. 다만 이 검정은 이진 예외열에서 1차 의존성을 확인합니다. 과거 정보, 변동성, 포지션 상태가 미래 손실을 예측하는 모든 경우를 검정하는 것은 아닙니다.
예외가 몇 번뿐이면 전이확률은 더 불안정해집니다. 연속 예외가 한 건도 없는 표본에서 π₁의 추정값이 0 경계에 놓일 수 있지만, 그것이 두 번째 예외가 불가능하다는 뜻은 아닙니다. 이 표본에서 그런 경우를 관측하지 못했다는 뜻일 뿐입니다. 통계량과 함께 전이횟수와 표본 크기를 보세요. 전이표가 희박한데도 다음 날의 꼬리위험을 정밀하게 알아낸 것처럼 해석해서는 안 됩니다.
조건부 커버리지는 빈도와 독립성을 함께 봅니다
조건부 커버리지 검정은 쿠피에크 빈도 통계량과 크리스토페르센 독립성 통계량을 더합니다. LR꜀꜀ = LRᵤ꜀ + LRᵢₙd입니다. 결합 귀무가설은 예외확률이 α이고, 예외가 시간에 걸쳐 독립적이라는 것입니다. 표준적인 큰 표본 설정에서는 합산 통계량을 자유도 2인 카이제곱분포와 비교합니다.
결합검정 하나만 보고하지 말고 각 구성 검정 결과도 함께 기록하는 편이 낫습니다. 조건부 커버리지 기각은 가정된 조건 아래 관측된 예외열과 두 조건이 함께 맞지 않는다는 뜻이지, 원인을 바로 알려주지는 않습니다. POF만 기각되고 독립성 검정은 기각되지 않는다면 전체 횟수가 더 뚜렷한 문제일 수 있습니다. 독립성 검정이 기각되면 총횟수가 목표와 비슷하더라도 예외 시점의 군집을 점검해야 합니다. 둘 다 기각되지 않아도 표본이 짧아 오류를 발견할 정보가 부족했을 수 있습니다.
해석 범위는 좁습니다. 두 검정은 하루 손실을 예외 여부라는 0/1 값으로 줄입니다. VaR를 1달러 넘겼는지 100만 달러 넘겼는지는 구분하지 않습니다. 전체 손실분포나 기대손실(Expected Shortfall)이 정확한지도 검증하지 않습니다. 꼬리위험 측정치가 서로 무엇을 답하는지 더 알아보려면 VaR와 Expected Shortfall 비교를 보세요.
드문 예외는 짧은 표본에서 검정하기 어렵습니다
99% VaR를 250일 평가하면 기대 예외가 2.5회뿐입니다. 독립적인 1% 예외를 가정하면 인접한 249개 날짜쌍에서 연속 예외의 기대횟수는 대략 249 × 0.01² = 0.025회입니다. 모형이 제대로 보정되어 있어도 대부분의 표본에는 연속 예외가 하나도 없을 수 있습니다. 이렇게 횟수가 적으면 전이확률을 정밀하게 추정하기 어렵고, 의존성 검정의 검정력도 제한될 수 있습니다.
Christoffersen과 Pelletier는 2004년 논문에서 현실적인 작은 표본에서는 기존 VaR 백테스트의 검정력이 낮을 수 있다고 보고하고, 예외 사이의 경과일을 모형화하는 기간기반 검정을 연구했습니다. 이 결과는 추가 진단을 고려할 근거이지, 기간기반 검정이 언제나 더 우월하거나 어떤 VaR 예측에도 그대로 맞는다는 뜻은 아닙니다. 관측이 적을수록 기각하지 못한 결과를 건전성 확인서처럼 쓰지 말고 표본 한계를 밝혀야 합니다.
목표 꼬리확률에 따라서도 증거의 양은 달라집니다. 95% VaR라면 250일 동안 기대 예외가 12.5회이고, 99.9% VaR라면 0.25회입니다. 같은 이름의 검정을 사용해도 설계별 증거가 같다고 볼 수 없습니다. 신뢰수준, 예측기간, 관측 수, 목표·실제 예외 수, 전이횟수, 점근적 기준인지 유한표본 방법인지 함께 적으세요.
언제 다른 진단을 함께 써야 하나요?
두 검정이 버린 정보가 무엇인지 묻고 다음 방법을 고르면 됩니다. 예외가 과거 예외, 당시 VaR 예측값, 또는 예측시점에 알 수 있던 다른 변수로 예측되는지 보고 싶다면 엥글과 망가넬리의 CAViaR 논문에 실린 동적 분위수(DQ) 검정을 참고할 수 있습니다. 이 검정은 중심화한 예외 지시변수와 선택한 설명변수에 대한 제약을 검정합니다. 어떤 변수를 골랐는지, 그 변수가 예측 시점에 이용 가능했는지에 따라 결론이 달라집니다. DQ도 가능한 모든 조건부 오지정을 검사하는 것은 아닙니다. 기간기반 검정은 예외 사이의 대기시간을 살펴보므로 다른 정보를 확장합니다.
VaR 경계를 넘은 뒤 손실이 얼마나 컸는지가 관심사라면 빈도와 독립성만으로는 부족합니다. 초과손실 크기를 따로 살피고 예측과 가정에 맞는 Expected Shortfall 평가 방법을 골라야 합니다. 여러 모형 중 과거 성과가 가장 좋았던 것을 선택한 위험이 문제라면 VaR 백테스트로 해결되지 않습니다. PBO와 CSCV 설명은 후보군 안에서 선택된 모형의 순위를 다루는 별도 진단입니다.
재현 가능한 보고서에는 포트폴리오와 손실 정의, 예측기간, 신뢰수준, 평가일, 예측 생성방법, 예외 규칙, 기대·실제 횟수, POF 통계량, 전이횟수, 독립성 및 조건부 커버리지 결과를 적습니다. 겹치는 기간이나 짧은 표본에서 오는 한계도 분명히 밝힙니다. 예측 기준과 실현 손실을 시간순 그림으로 함께 보여주고, 모형 선택 중에는 이후 평가자료를 닫아 두세요. 이런 절차는 과거 결과를 해석 가능하게 만들지만, 통과한 백테스트가 미래 위험통제를 보장하지는 않습니다.
자주 묻는 질문
Q1쿠피에크 검정이 기각되지 않으면 VaR 모형이 정확하다는 뜻인가요?
아닙니다. 검정 가정 아래 지정한 예외빈도와 다르다는 근거를 충분히 찾지 못했다는 뜻입니다. 특히 99% 이상 신뢰수준의 짧은 표본은 문제를 드러내기에 예외가 너무 적을 수 있습니다.
Q2쿠피에크 검정이 같은 결과를 내는 두 모형도 예외 패턴은 다를 수 있나요?
그렇습니다. 쿠피에크 통계량은 횟수에만 의존합니다. 크리스토페르센 독립성 검정은 예외가 인접한 관측에 몰리는지에 관한 정보를 더합니다.
Q3이 검정으로 VaR를 넘긴 뒤 손실이 얼마나 커질지 알 수 있나요?
알 수 없습니다. 두 검정은 예외 여부만 사용하며 초과손실의 크기는 측정하지 않습니다. VaR 경계를 넘은 뒤의 손실 규모가 중요하다면 꼬리손실을 따로 검토하고 Expected Shortfall도 별도로 평가해야 합니다.
출처와 더 읽을 자료
내용 정정 제보
이 아티클 링크를 담은 이메일 초안을 준비합니다. 직접 보내야 Mark에 제보가 접수됩니다
QUICK CHECK
글을 다 읽었다면, 3문항으로 확인해보세요
Question 01
쿠피에크 POF 검정은 어떤 특징을 사용하나요?
정답을 고르면 바로 설명을 볼 수 있어요