확률적분변환(PIT): 밀도예측 보정 평가 가이드
연속형·이산형 밀도예측에 확률적분변환을 적용하는 법, PIT 히스토그램의 해석 범위, 균등성만으로 충분하지 않은 이유를 설명합니다
이 글에서 다루는 내용밀도예측은 점오차만으로 평가할 수 없습니다
짧은 요약
밀도예측은 가능한 결과의 범위와 각 범위에 부여한 확률을 함께 제시합니다. 확률적분변환(PIT)은 실제 관측값을 예측 누적확률로 바꿉니다. 조건이 맞으면 PIT가 균등분포를 따르는 것이 유용한 보정 진단이지만, 히스토그램이 균등해 보인다는 사실만으로 조건부 예측이 옳다거나 시간에 따른 독립성이 성립한다고 결론낼 수는 없습니다.
밀도예측은 점오차만으로 평가할 수 없습니다
점예측은 내일 수익률이 0.2%라고 나타낼 수 있습니다. 밀도예측은 여기서 더 나아가 평범한 변동뿐 아니라 꼬리 사건까지 포함한 전체 수익률 범위에 확률을 배분합니다. 따라서 밀도예측 평가는 결과를 보기 전에 발표한 확률분포가 이후 관측된 값과 얼마나 부합하는지를 묻습니다. 수치형 점예측의 선형 보정 회귀는 별개의 질문이며 Mincer–Zarnowitz 안내에서 다룹니다.
PIT는 확률분포를 진단하는 방법입니다. 각 예측 시점에 예측분포가 실제 관측값 이하에 얼마만큼의 확률을 배정했는지를 계산합니다. 이는 확률 순위이지 수익률 자체나 매매 신호, 수익의 척도가 아닙니다. 금융에서는 수익률 밀도모형이 위험 측정이나 의사결정에 쓰일 수 있지만, PIT가 평가하는 대상은 예측분포입니다. Diebold–Mariano 안내는 정한 점수에 따른 평균 예측 손실을 비교합니다. 이는 밀도예측의 보정 여부를 살펴보는 질문과 다릅니다.
연속형 예측의 누적분포함수로 관측값을 변환합니다
예측 시점 t 이후의 결과를 (Y_{t+1}), 그 시점에 이용할 수 있었던 정보집합 \(\mathcal I_t\)를 바탕으로 한 예측 누적분포함수를 (F_{t+1}(y\mid\mathcal I_t))라고 두겠습니다. 예측분포가 연속형이면 PIT는 다음과 같습니다.
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ)
누적분포함수는 값 y 이하의 결과에 배정된 확률입니다. 예측 CDF가 실제 결과의 참 조건부 분포와 일치하면 확률적분변환 정리에 따라 다음 성질이 성립합니다.
Pr(Uₜ₊₁ ≤ u | 𝓘ₜ) = u, 0 ≤ u ≤ 1
즉 올바른 연속형 1기간 예측을 이용하면 각 PIT는 예측 시점의 정보가 주어졌을 때 균등분포를 따릅니다. 과거 관측과 이전 PIT 값을 정보집합에 포함하는 순차 평가라면, 유지되는 조건 아래 이상적인 PIT는 시점 간 독립성도 가져야 합니다. 이 변환은 Rosenblatt의 연구와 연결되며, Diebold·Gunther·Tay는 PIT 시계열을 밀도예측 평가에 적용하는 운영적 틀을 제시했습니다(Rosenblatt, 1952; Diebold, Gunther, Tay, 1998).
손으로 확인해보겠습니다. 어떤 예측 시점의 분포가 (N(0,1))이고 실제 관측값이 (y=1)이라면 PIT는 (\Phi(1)\approx0.8413)입니다. 해당 예측은 1 이하의 결과가 나올 확률을 약 84.13%로 보았다는 뜻입니다. 이 한 건은 계산 방법만 보여줍니다. 보정 여부를 판단하려면 여러 시점의 예측과 결과가 필요합니다.
이산형 결과에는 무작위화 PIT를 적용합니다
이산형 분포의 누적분포함수는 가능한 결과에서 점프합니다. 따라서 예측이 정확해도 보통의 (F(Y))는 몇몇 누적확률값만 가질 수 있고, 일반적으로 균등분포를 따르지 않습니다. 점프 구간 안에 무작위 값을 넣는 무작위화 PIT를 사용하면 다음과 같습니다.
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ) + Vₜ₊₁ [Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ) − Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ)]
여기서 (F(y^-))는 y 바로 왼쪽의 극한, 즉 y보다 작은 값에 누적된 확률이고, (V)는 평가에만 사용하는 독립적인 (U(0,1)) 난수입니다. 연속형 분포는 점프가 없으므로 식이 (F(Y))로 줄어듭니다. Brockwell은 이산형과 혼합형을 포함하는 임의의 분포에 대해 무작위화 변환을 제시합니다(Brockwell, 2007).
가상의 베르누이 예측에서 (P(Y=1)=0.20), 따라서 (P(Y=0)=0.80)이라고 하겠습니다. 결과가 0이면 확률 0.80으로 보통 PIT는 0.80이고, 결과가 1이면 확률 0.20으로 PIT는 1.00입니다. 이 두 값만으로는 균등분포가 되지 않습니다. 무작위화를 적용하면 (Y=0)일 때 (0.80V)가 되어 ([0,0.80]) 구간을 채우고, (Y=1)일 때 (0.80+0.20V)가 되어 ([0.80,1])을 채웁니다. 앞 구간의 확률은 0.80이고 뒤 구간은 0.20이므로 두 구간 전체에서 확률밀도는 1입니다. 이 보조 난수는 원래 예측의 일부가 아니라 평가 절차의 일부입니다. 계수형 결과에서는 무작위화를 피하는 이산형 진단도 연구됐습니다. Czado, Gneiting, Held는 순서가 있는 계수형 결과를 대상으로 무작위화하지 않는 PIT 시각화와 주변 보정 도표를 제안합니다. 이런 방법은 결과의 이산적 지지집합에 맞춰 해석해야 하며 보통의 (F(Y))를 연속형 균등분포 기준에 그대로 대어 판단해서는 안 됩니다(2009).
주변 균등성과 독립성·조건부 보정을 구분합니다
PIT의 주변 분포가 균등하다는 것은 이상적인 연속형 밀도예측에 필요한 조건이지만 충분조건은 아닙니다. 여러 상태의 결과를 한데 모으면 오차가 상쇄될 수 있습니다. 한 국면에서 예측을 지나치게 높게, 다른 국면에서 낮게 제시해도 전체 히스토그램은 평평해 보일 수 있습니다. Gneiting, Balabdaoui, Raftery는 PIT 히스토그램이 대체로 균등해도 개별 예측이 편향된 사례를 설명합니다(2007).
시계열에서는 순서도 중요합니다. PIT 히스토그램이 균등해도 큰 값이 이어지거나 작은 값이 번갈아 나타나는 등 시간적 의존성이 있을 수 있습니다. 과거 정보가 적절히 포함된 정보집합 아래 올바른 1기간 조건부 예측이 성립하면, 단순한 주변 균등성보다 강한 성질을 기대합니다. 하지만 여러 기간 앞을 내다보는 예측의 평가 구간이 서로 겹치거나 다른 의존성이 있으면 기준분포와 독립성 조건도 그 구조에 맞춰야 합니다. 독립·동일분포를 가정하는 검정을 무조건 적용할 수는 없습니다.
예를 들어 각 구간의 PIT 값이 한 번씩 나타난 뒤 같은 순서가 반복된다고 해보겠습니다. 전체 표본에서는 구간별 빈도가 균등해도 시간 패턴은 반복적으로 예측 가능하고, 이는 이상적인 독립 PIT와 맞지 않습니다. 반대로 시점 간 독립성 검정에서 기각하지 못했다고 해서 선택하지 않은 변동성 구간이나 꼬리 조건의 오차가 없다고 증명되는 것도 아닙니다. 확인할 정보와 국면은 예측 시점에 알 수 있고 연구 질문과 관련된 것인지 먼저 정해야 합니다.
따라서 PIT 분포와 함께 시간, 시차 PIT, 예측 원점의 변수, 미리 정한 시장 국면과의 관계를 확인하는 편이 좋습니다. 조건별 그림이나 검정은 전체 자료를 합칠 때 사라지는 오류를 드러낼 수 있지만, 구간 나누기와 표본 크기에 따른 한계가 있습니다. 조건을 더 잘게 나눌수록 한 구간의 관측 수가 줄어 불확실성이 커집니다. 표본을 나누는 기준을 결과를 보고 바꾸면 유리한 모양을 찾아낸 선택 과정이 해석에 섞입니다. 선택한 유한 개의 진단만으로 모든 조건변수에 대한 보정을 입증할 수는 없습니다.
PIT 히스토그램은 단서로 읽고 판정으로 쓰지 않습니다
PIT 히스토그램은 PIT 값의 주변 분포를 구간별로 요약합니다. 양 끝에 값이 몰리는 U자형은 예측분포가 실제보다 지나치게 집중되었거나 분산이 작을 가능성과, 가운데가 솟는 모양은 분포가 지나치게 퍼졌을 가능성과 흔히 부합합니다. 왼쪽과 오른쪽의 불균형은 위치 편향의 신호일 수 있습니다. 그러나 이런 모양이 원인을 하나로 특정해주지는 않습니다. 상태별 분포가 섞이거나, 이산형 결과를 일반 CDF로 변환하거나, 표본이 작거나, 구간을 다르게 나눈 것만으로도 모양이 달라질 수 있습니다.
히스토그램은 관측 순서를 버립니다. 보정 문제가 언제 시작되었는지, 큰 PIT가 뭉쳐 나타나는지, 특정 하위집단이 잘못 보정되었는지는 보여주지 않습니다. 폭이 큰 구간과 작은 표본은 평평한 모양을 만들 수 있고, 폭이 작은 구간에서는 우연한 표본 변동이 두드러질 수 있습니다. 가능한 경우 표본 크기, 구간 경계, 불확실성 정보를 함께 보고합니다. 결과를 보기 전에 정한 조건별 진단과 시계열 의존성도 확인합니다. Diebold–Gunther–Tay의 밀도예측 평가 틀이나 Berkowitz는 내부 PIT 값을 (Z_t=\Phi^{-1}(U_t))로 변환하고, 독립 표준정규 분포라는 결합 귀무가설을 AR(1) 같은 지정된 동태 대립가설과 우도비로 비교합니다. 대립가설과 표본 구조에 따라 해석이 달라지므로, 그림이나 단일 검정이 보편적인 보증서가 되지는 않습니다(Berkowitz, 2001).
<!-- learn:illustration -->

모수 추정과 표본 외 평가를 반영합니다
균등성 정리는 예측 CDF가 참 조건부 분포라고 가정합니다. 실제 모형에서는 모수를 추정하고 분포 형태를 선택하며, 변수나 임계값을 조정하기도 합니다. 따라서 (F_{t+1}(\cdot;\hat\theta_t))는 알려진 참 CDF가 아니라 하나의 예측 절차가 만듭니다. 평가 기간의 결과까지 사용해 모수를 추정한 뒤 PIT를 계산하면서 이를 독립적인 표본 외 증거라고 부르면, 검증하려던 결과가 모형 적합에 이미 들어가게 됩니다.
롤링 평가에서는 각 예측 원점 시점에 이용할 수 있었던 정보로만 다음 예측을 만듭니다. 추정 창, 재추정 주기, 자료 빈티지, 모형 버전, 변수 선택 단계를 기록합니다. 이 설정이 달라지면 평가하는 예측 절차 자체가 달라집니다. 연속된 롤링 추정은 공통 자료를 많이 사용하므로 예측끼리 의존할 수 있고, 여러 기간 예측의 평가 구간이 겹치면 추가 의존성이 생깁니다. 예를 들어 매일 갱신하는 5일 후 예측은 이웃한 두 결과 구간에서 4일을 공유할 수 있습니다. 예측분포가 정확해도 이런 중첩은 평가된 PIT의 시계열 구조에 영향을 주므로, 비중첩 원점을 쓰거나 해당 중첩 설계에 맞는 추론을 선택합니다. 실제 운영 절차가 롤링 재추정을 쓴다면 검정용 모의실험이나 부트스트랩에서도 가능한 한 같은 창 길이, 재추정 주기, 변수 선택과 모형 재적합을 반복해야 합니다. 모수를 고정한 단순 난수 생성만으로는 추정 절차에서 생기는 변동을 반영하지 못할 수 있습니다.
형식적 검정의 크기와 검정력에 미치는 영향은 추정량, 표본, 검정 절차에 따라 다릅니다. 여러 분포 형태와 변수 조합을 시험한 다음 같은 평가 구간에서 가장 평평한 히스토그램만 보고하면 선택 과정의 불확실성이 남습니다. 데이터에 맞춰 선택한 설정은 별도 검증 표본에서 확인하고, 수치 결과를 보고할 때는 탐색한 후보와 선택 기준을 기록합니다. 개발용 표본에서 여러 번 진단한 결과와 끝까지 보류한 평가 표본의 결과를 구분하면, 반복적인 선택을 거친 통계량을 독립적인 최종 확인처럼 제시하는 일을 줄일 수 있습니다. PIT 히스토그램 자체는 모수 불확실성을 반영하지 않습니다. 추정·모형 선택·겹치는 예측이 포함된 모든 설계에 교과서적 독립·동일분포 기준값을 그대로 적용해서도 안 됩니다. 추론이 중요하다면 설계의 가정에 맞는 검정을 사용하거나, 모수 재추정부터 예측 생성까지 전체 절차를 반복하는 부트스트랩·시뮬레이션으로 귀무분포를 구할 수 있습니다. 진정한 표본 외 성과를 묻는 연구라면 최종 평가 표본을 모형 선택에서 제외합니다.
보정과 예측분포의 집중도는 다른 속성입니다
보정은 예측분포와 관측값의 결합 관계를 봅니다. 특정 확률을 부여한 사건이 그에 맞는 빈도로 일어나는지, 예측분포가 관측 결과와 부합하는지가 질문입니다. 예측분포의 집중도(sharpness)는 결과를 보지 않고 분포 자체가 얼마나 좁거나 퍼져 있는지를 나타냅니다. Gneiting, Balabdaoui, Raftery는 보정을 전제로 집중도를 높이는 것이 바람직하다고 설명합니다.
넓은 분포가 평균적으로 올바른 위치에 놓이면 보정은 양호할 수 있지만 정보가 적을 수 있습니다. 좁은 분포는 정밀해 보일 수 있어도 실제 결과가 그 확률질량을 자주 벗어나면 보정이 나쁠 수 있습니다. PIT는 분포의 일관성을 진단하고, 집중도 요약치는 예측분포의 폭이나 구간 길이를 설명합니다. 어느 한쪽만 보고하면 전체 평가의 일부가 빠집니다.
보정이라는 말은 질문에 따라서도 달리 쓰일 수 있습니다. 모든 시점의 PIT를 합친 그림은 균등해 보여도 변동성 국면이나 예측기간에 따른 조건부 오류를 가릴 수 있습니다. 실제 활용에서 특정 조건이 중요하다면 사전에 그 조건을 정하고 따로 살펴봅니다. 이는 점예측 회귀와 관련은 있지만 같은 질문은 아닙니다. 선택한 정보에 따라 두 예측의 손실 차이가 달라지는지 묻는 Giacomini–White 조건부 예측능력 검정과도 구분해야 합니다.
공통 표본에서 적정 점수 규칙으로 예측을 비교합니다
PIT는 주로 진단 도구이지 경쟁하는 밀도예측 하나에 순위를 매기는 점수가 아닙니다. 로그 점수와 연속 순위 확률 점수(CRPS) 같은 적정 점수 규칙은 각 예측과 결과에 숫자 손실을 부여합니다. 적정 점수 규칙 아래에서는 참 예측분포를 보고하는 것이 기대 손실을 최소화합니다. 공통 표본 외 표본에서 예측을 비교할 수 있지만, 한 번 관측된 평균 점수가 모형의 정답을 증명하지는 않습니다. Model Confidence Set 안내는 예측 방법을 집합 단위로 비교하는 절차를 다룹니다. 밀도예측을 비교할 때는 전체 분포에 정의된 적정 점수를 공통 결과에 적용해야 합니다.
점수 비교에서는 예측 목표, 기간, 공통 평가 날짜, 손실 관례, 기준 모형을 밝힙니다. 로그 점수는 관측값에 매우 낮은 밀도를 부여한 예측에 특히 민감합니다. CRPS는 예측 누적분포와 관측값을 비교하며 민감도와 해석이 다릅니다. 시계열 의존성, 모수 추정, 모형 탐색을 반영한 불확실성 아래 점수 차이를 보고합니다. 어떤 적정 점수도 한 건의 실현값에서 각 모형의 순위를 보장하지는 않습니다. 기대 손실 최소화라는 성질은 예측과 결과가 반복되는 상황의 성질입니다. 평가 기간이 짧거나 관측값이 꼬리에 몰리면 표본 평균과 장기 기대점수의 순위가 다를 수 있습니다. PIT 그림은 분포상의 결함을 보여줄 수 있고 적정 점수는 정해진 손실 관점에서 상대 성능을 요약하므로, 둘은 보완적으로 읽습니다.
보정이 잘되거나 적정 점수가 낮다는 사실만으로 매매 수익이 더 높다고 결론내릴 수는 없습니다. 매매에 관한 주장을 하려면 예측을 행동으로 바꾸는 규칙, 정보 이용 시점, 포지션 크기, 거래비용과 자금조달비용, 표본 외 수익 평가를 별도로 정의해야 합니다. 예측 평가 통계량은 백테스트 수익률이 아닙니다.
재현 가능한 PIT 평가 절차를 기록합니다
먼저 예측 목표, 기간, 원점 시각, 결과 자료 빈티지, 분포가 연속형·이산형·혼합형 중 무엇인지 정합니다. 모든 시점의 예측 CDF 또는 이를 재현하는 정보를 실제 결과와 함께 보관합니다. 각 시점에 연속형이면 (F_t(Y_t))를 계산하고, 점프가 있으면 무작위화 PIT 또는 이산형 예측에 맞는 진단법을 사용했다고 밝힙니다.
그다음 주변 분포와 시간 순서를 함께 살펴봅니다. 이산형 예측에는 히스토그램 구간, 표본 크기, 동률 처리, 무작위 시드 또는 여러 번 무작위화했는지 기록합니다. 사전에 세운 질문을 확인하는 독립성·조건부 검정을 추가하되, 롤링 추정, 겹치는 예측, 모수 추정에 맞는 추론을 사용합니다. 마지막으로 같은 미관측 결과에 적정 점수 규칙을 적용해 모형을 별도로 비교합니다. 이러한 결과는 정해진 예측과 조건에 대한 증거이지, 이후에도 항상 보정될 모형이라는 증명이나 수익성 보장이 아닙니다.
자주 묻는 질문
Q1PIT가 균등하면 밀도예측이 옳다는 뜻인가요?
아닙니다. 올바른 연속형 예측에서 필요한 진단 조건이지만, 주변 균등성만으로 독립성이나 조건부 보정을 확인할 수는 없습니다. 시간 의존성과 관련 조건변수도 점검해야 합니다.
Q2이산형 예측에는 무작위화 PIT를 써야 하나요?
올바른 이산형 분포에서 연속 균등분포를 기준으로 확인하고 싶다면 쓸 수 있습니다. 보조 난수가 관측 결과에 해당하는 CDF 점프를 펼쳐 줍니다. 사용 방법과 난수 시드를 기록하고, 무작위화를 피하고 싶다면 이산형 예측용 진단법을 검토합니다.
Q3U자형 PIT 히스토그램은 무엇을 뜻하나요?
흔히 예측분포가 실제보다 지나치게 집중된 경우와, 가운데가 높은 모양은 분포가 지나치게 퍼진 경우와 부합합니다. 원인을 하나로 특정하는 신호로 보지 말고 의존성, 국면, 표본 크기, 구간 설정을 함께 확인합니다.
Q4PIT 히스토그램이 더 좋으면 예측 점수도 더 좋은가요?
같은 뜻이 아닙니다. PIT 그림은 분포의 진단이고 적정 점수는 정해진 손실과 목표 아래 예측을 비교합니다. 필요하면 같은 표본 외 결과에서 둘 다 보고하되, 어느 쪽도 거래 수익으로 해석하지 않습니다. 주요 연구 - Rosenblatt, “Remarks on a Multivariate Transformation” (1952) - Diebold, Gunther, Tay, “Evaluating Density Forecasts with Applications to Financial Risk Management” (1998) - Berkowitz, “Testing Density Forecasts, with Applications to Risk Management” (2001) - Gneiting, Balabdaoui, Raftery, “Probabilistic Forecasts, Calibration and Sharpness” (2007) - Brockwell, “Universal Residuals: A Multivariate Transformation” (2007) - Czado, Gneiting, Held, “Predictive Model Assessment for Count Data” (2009)
출처와 더 읽을 자료
내용 정정 제보
이 아티클 링크를 담은 이메일 초안을 준비합니다. 직접 보내야 Mark에 제보가 접수됩니다
QUICK CHECK
글을 다 읽었다면, 3문항으로 확인해보세요
Question 01
올바른 연속형 1기간 조건부 분포로 결과를 예측했습니다. PIT 정리가 말해주는 성질은 무엇인가요?
정답을 고르면 바로 설명을 볼 수 있어요
옵션 용어 사전
콜·풋과 옵션 체인부터 IV, 그릭스, 미결제약정, 맥스 페인까지 핵심 옵션 용어를 정확하게 설명합니다
옵션 용어 사전 보기