확률 예측 평가: 브라이어 점수와 로그 손실 비교
이진 사건의 확률 예측을 브라이어 점수와 로그 손실로 계산하고, 적정 점수 규칙·보정·기준 대비 성능을 구분합니다
이 글에서 다루는 내용적중률만 보면 예측한 확률이 사라집니다
짧은 요약
확률 예측은 어느 결과가 더 유력한지만 고르는 대신, 사건이 발생할 가능성 자체를 제시합니다. 브라이어 점수와 로그 손실은 그 확률을 실제로 확인된 결과와 비교합니다. 두 방법 모두 적정 점수 규칙이지만 오차를 벌점으로 바꾸는 방식은 다릅니다. 따라서 점수를 비교하기 전에 사건, 표본, 산식의 관례, 기준 예측을 먼저 정해야 합니다.
적중률만 보면 예측한 확률이 사라집니다
모형이 “상승” 또는 “하락”을 맞혔는지만 기록한다고 해보겠습니다. 적중률에서는 상승 확률을 51%라고 한 예측과 99%라고 한 예측이 똑같은 정답 한 건입니다. 49%와 1% 예측도 같은 오답이 됩니다. 하지만 확률이 달라지면 의사결정의 손익이나 위험도 달라질 수 있으므로, 정답·오답만 세면 예측의 확신 정도가 기록에서 사라집니다.
이진 사건의 확률 예측은 예측 시점 (t)에서 사건이 발생할 가능성을 0과 1 사이의 (p_t)로 나타냅니다. 나중에 사건이 일어나면 결과 (y_t=1), 일어나지 않으면 (y_t=0)으로 기록합니다. 점수 규칙은 예측 확률과 실제 결과를 함께 평가합니다. 브라이어 점수는 확률의 제곱 오차를, 로그 손실은 실제 일어난 결과에 부여한 확률의 음의 로그를 사용합니다.
두 점수는 트레이딩 모형이 제시한 사건 확률을 포함해 여러 확률 예측을 비교하는 데 쓸 수 있습니다. 그렇다고 점수 하나가 예측의 보정을 입증하거나, 합리적인 기준 예측보다 낫다고 보이거나, 그 예측을 이용한 거래가 이익을 낸다는 뜻은 아닙니다. 수치형 점예측의 선형 보정 회귀는 Mincer–Zarnowitz 안내에서 따로 다룹니다.
사건 하나를 정의하고 예측과 결과를 짝짓습니다
점수를 계산하기 전에 결과를 일관되게 판정할 수 있도록 사건을 정의합니다. “자산 가격이 오를까?”만으로는 부족합니다. 자산, 가격 자료원, 시작·종료 시각, 통화, 수익률 계산 방식, 누락되거나 정정된 기록의 처리 규칙까지 정해야 합니다. 경제지표 사건이라면 결과를 판정하는 발표 자료와 빈티지도 기록합니다. 사건 정의나 평가 날짜가 다른 예측끼리 점수를 바로 비교해서는 안 됩니다.
각 예측은 해당 원점에 이용할 수 있었던 값 그대로 보관합니다. 시점 (t)에 낸 확률은 미리 정한 정보 마감시각까지 공개된 정보만 사용해야 하며, 같은 예측 기간의 결과와 짝을 이뤄야 합니다. 개정된 자료, 나중에 확정된 거래소 종가, 결과를 본 뒤 정한 분류 기준을 소급 적용하면 목표변수가 달라지거나 미래 정보가 섞일 수 있습니다.
반복 예측을 평가할 때는 모형 버전, 입력 데이터 빈티지, 시각, 예측 확률, 결과 판정 규칙을 함께 보관합니다. 모형을 비교할 때는 같은 예측 원점을 사용합니다. 일부 확률이 빠졌다면 제외 사유와 처리 규칙을 밝히고 모든 후보에 같은 표본 규칙을 적용합니다. 이런 기록이 있어야 점수가 나중에 바뀌는 스프레드시트의 요약값이 아니라 다시 계산할 수 있는 평가가 됩니다.
제곱 확률 오차로 브라이어 점수를 계산합니다
이진 사건 하나의 (t)번째 브라이어 손실은 다음과 같습니다.
BSₜ = (pₜ − yₜ)²
예측 (n)개의 평균 브라이어 점수는 다음과 같습니다.
BS = (1/n) Σₜ (pₜ − yₜ)²
여기서는 점수가 낮을수록 좋고, 0이면 완벽하며, 단일 사건 기준 점수 범위는 0부터 1까지입니다. 예를 들어 사건이 발생할 확률을 (p=0.70)으로 예측했고 실제로 발생했다면 손실은 ((0.70-1)^2=0.09)입니다. 같은 70% 예측 뒤에 사건이 발생하지 않았다면 ((0.70-0)^2=0.49)입니다. 빗나간 확신이 작은 오차보다 큰 벌점을 받지만, 이진 사례 한 건의 손실은 1을 넘지 않습니다.
논문이나 보고서의 숫자를 비교할 때는 산식을 확인해야 합니다. 범주가 여러 개인 예측에서 결과 범주별 제곱오차를 모두 더하는 관례가 있고, 두 범주의 확률 벡터를 합하면 위 단일 사건 손실의 두 배가 될 수 있습니다. 하나의 사건과 산식으로 계산한 값에 같은 배수를 곱하면 순위는 그대로지만 점수의 숫자는 달라지므로, 비교할 때 배율을 밝혀야 합니다.
로그 손실을 계산하고 극단적 오답의 벌점을 봅니다
이진 사건의 로그 손실은 다음과 같습니다.
LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]
사건이 발생하면 손실은 (-\log(p_t)), 발생하지 않으면 (-\log(1-p_t))입니다. 따라서 사건을 맞힌 70% 예측의 손실은 (-\log(0.70)\approx0.357), 틀린 70% 예측의 손실은 (-\log(0.30)\approx1.204)입니다. 평균 로그 손실은 사례별 값을 평균냅니다. 일어난 사건에 거의 0의 확률을 부여하면 벌점에 고정된 상한이 없습니다.
(p=0) 또는 (p=1)로 예측했는데 정반대 사건이 일어나면 로그 손실은 무한대입니다. 무한대를 피하려고 소프트웨어가 확률을 작은 하한 (ε)로 잘라낸다면 그 하한을 보고하고, 결과를 보기 전에 모든 예측에 똑같이 적용해야 합니다. 잘라내기는 평가 규칙의 숫자를 바꾸므로 단순한 자료 정리 과정처럼 숨겨서는 안 됩니다.
브라이어 점수와 로그 손실은 오차를 벌점으로 바꾸는 곡선이 달라 예측 순위를 다르게 매길 수 있습니다. 로그 손실은 실제 발생한 사건에 거의 0의 확률을 준 예측을 특히 크게 벌하고, 이진 브라이어 손실은 한 건당 최대 1로 제한됩니다. 사전에 주 점수를 정하고, 극단 확률이 의사결정에 중요하다면 결과를 본 뒤 유리한 점수만 고르지 말고 두 점수를 함께 보여줄 수 있습니다.
<!-- learn:illustration -->

적정 점수는 기대값에서 솔직한 확률을 보상합니다
점수 규칙은 예측자가 믿는 확률을 그대로 보고할 때 기대 보상을 극대화하거나 기대 손실을 최소화하면 적정(proper)하다고 합니다. 그 값이 유일한 최적점이면 엄격 적정(strictly proper)이라고 합니다. 브라이어 점수와 로그 점수는 통상적인 정의에서 이진 확률 예측에 대해 엄격 적정합니다(Gneiting과 Raftery, 2007). 따라서 확률을 단순한 정답·오답으로 바꾸기 전에 직접 평가할 근거가 됩니다.
‘적정’은 기대값에 대한 성질이지 실제 표본에서 매번 좋은 점수를 받는다는 약속은 아닙니다. 실제 믿음에 따라 70%라고 보고한 예측자가 한 사례에서 틀릴 수 있고, 짧은 표본 점수는 다른 사람이 운 좋게 맞힌 결과보다 나쁠 수 있습니다. 평균 성능을 평가하려면 서로 비교 가능한 예측을 반복해 관찰해야 합니다. 별도의 보상 규칙이 작동하는 경우에는 점수만으로 보고된 확률이 예측자의 믿음을 반영한다고 보장할 수도 없습니다.
두 점수 모두 보정만 측정하지는 않습니다. 집계 점수에는 확률이 실제 빈도와 얼마나 맞는지, 발생과 미발생 사례를 얼마나 구별하는지가 함께 반영될 수 있습니다. 확률을 자신 있게 제시해도 체계적으로 보정이 틀릴 수 있고, 항상 전체 발생률만 내놓는 모형은 평균적으로는 잘 보정돼 보여도 사례별 정보를 거의 주지 못할 수 있습니다.
브라이어 분해에서 신뢰도, 분해능, 불확실성을 읽습니다
Murphy의 분해는 평균 브라이어 점수를 세 항으로 나눕니다(Murphy, 1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)).
BS = 신뢰도 오차 − 분해능 + 불확실성
서로 다른 확률값 또는 그 대표값으로 만든 구간 (k)별로 (w_k)는 표본에서 구간이 차지하는 비율, ̅pₖ는 구간 평균 예측확률, ̅yₖ는 관측된 사건 빈도, ̅y는 전체 사건 빈도라고 하겠습니다. 이때 항은 다음과 같이 나타낼 수 있습니다.
신뢰도 오차 = Σₖ wₖ(̅pₖ − ̅yₖ)² 분해능 = Σₖ wₖ(̅yₖ − ̅y)² 불확실성 = ̅y(1 − ̅y)
신뢰도 오차는 낮을수록 좋습니다. 같은 확률로 묶인 예측의 실제 발생 빈도가 보고한 확률과 가까워야 합니다. 분해능은 높을수록 좋습니다. 서로 다른 구간의 사건 빈도가 전체 발생률과 구분되면 사례별 정보를 더 담고 있다는 뜻입니다. 불확실성은 표본에서 사건이 얼마나 자주 발생했는지를 반영하므로 모형의 성과로 돌릴 수 없습니다. 이 분해는 총 브라이어 점수가 같아도 모형이 가진 장점은 다를 수 있음을 보여줍니다.
이 식이 원래 점수를 정확히 분해하려면 서로 다른 확률값별로 사례를 묶거나, 연속 확률을 각 구간의 대표값으로 바꾼 구간화 예측을 평가해야 합니다. 연속 확률을 임의로 구간화해 그린 신뢰도 도표는 편리한 진단이지만, 구간 안의 확률 차이를 버린 근사입니다. 열 개 등폭 구간과 분위수 구간은 작은 표본이나 극단 확률에서 다른 그림을 만들 수 있습니다. 구간별 사례 수와 표본 불확실성을 함께 보여주고, 구간화된 분해를 미래 보정의 독립 증거처럼 해석하지 않습니다.
기준 예측 대비 점수를 계산합니다
다른 모형보다 원점수가 낮다는 것은 비교 결과이지, 유용한 기준보다 나아졌다는 뜻은 아닙니다. 브라이어 스킬 점수(Brier skill score)는 이름이 정해진 기준 예측과 평가 대상의 브라이어 점수를 비교합니다.
BSS = 1 − BS_모형 / BS_기준
기준 예측과 점수가 같으면 0, 개선이면 양수, 악화면 음수입니다. 기준 점수가 양수일 때 모형의 브라이어 손실이 0이면 1입니다. 기준은 의사결정과 정보집합에 맞춰야 합니다. 과거 전체의 기준 발생률, 학습 구간 안의 사건 빈도, 기존 운영 예측 중 무엇이 적절한지는 문제에 따라 다릅니다.
예측 시점에 알 수 없던 평가기간 결과를 기준 예측에 넣으면 안 됩니다. 시계열에서는 전체 표본 발생률보다 과거 자료만 쓰는 확장형 또는 이동형 발생률이 실제 운영의 기준에 더 가까울 수 있습니다. 기준 점수가 0이면 분모가 0이라 비율을 계산할 수 없습니다. 기준을 어떻게 만들었는지 밝히고 BSS와 함께 모형 및 기준의 원점수도 보고합니다.
BSS는 기준 예측과 사건 발생률에 따라 달라집니다. 전체 평균 발생률을 내는 예측과 현재 운영 모형을 기준으로 한 점수는 서로 다른 질문에 답합니다. 사건 정의, 기준 예측, 평가기간, 이진 또는 다범주 산식을 확인하지 않은 채 연구 간 BSS를 직접 비교하지 않습니다.
희귀 사건에서는 다수 범주만 늘 맞히는 분류기의 적중률이 높아 보여도 사건 확률의 품질을 말해 주지 않습니다. 발생률이 2%인 사건을 매번 미발생으로 분류하면 정확도는 높게 보이지만 위험 사건을 구별하지 못합니다. 브라이어 점수와 로그 손실은 임계값 없이 확률을 평가하고, BSS는 기준 발생률 예측과의 차이를 보여줍니다. 그래도 평가 표본에서 실제 사건이 몇 건 있었는지 함께 보고해야 합니다. 점수가 소수의 발생 사례에 크게 좌우될 수 있기 때문입니다.
같은 표본외 결과로 모형을 짝지어 비교합니다
시간순으로 확률을 만들고, 모형 조정·변수 선택·임계값 결정에 쓰지 않은 평가기간을 남겨 둡니다. 모든 모형을 같은 결과와 예측 원점에서 채점합니다. 선택한 손실 (L)에 대해 짝지은 손실 차이를 다음과 같이 정의할 수 있습니다.
dₜ = Lₐ,ₜ − Lᵦ,ₜ
이 부호 약속에서 평균이 양수이면 모형 B의 평균 손실이 더 낮습니다. Diebold–Mariano 방법은 예측 비교의 가정과 분산 추정이 연구 설계에 맞는 경우 평균 손실 차이를 검정할 수 있습니다. 상대적 점수 차이가 예측 시점에 알 수 있던 조건에 따라 달라지는지를 묻는다면 Giacomini–White 안내에서 조건부 비교를 다룹니다. 예측 원점이 반복되거나 사건 구간이 겹치고 모형을 검색해 골랐다면 손실 차이가 의존하거나 선택될 수 있습니다. 단순 표준오차나 보정하지 않은 p값 하나로 근거를 부풀리지 않습니다.
사건, 기간, 평가 표본, 주 점수, 기준 예측, 비교 방향을 결과 확인 전에 정합니다. 평균 브라이어 점수와 로그 손실, 각 표본 수, 모형과 기준의 정의, 확률 하한 규칙, 의존성 또는 검색 보정 방법을 보고합니다. 집계 점수와 함께 보정 도표 및 짝별 손실 차이를 보면 어떤 부분이 달라졌는지 설명하기 쉽습니다. 예측 조합 방법은 여러 예측을 합칠 수 있지만, 최종 조합도 선택에 쓰지 않은 기간에서 평가해야 합니다.
두 점수는 단위가 같지 않습니다. 브라이어 점수 차이 0.01을 로그 손실 차이 0.01과 같은 크기로 해석하면 안 됩니다. 점수가 낮아도 확률 모형 자체가 참이라는 뜻은 아닙니다. 정해진 결과와 표본에서 평가된 예측에 관한 근거입니다.
예측 품질과 거래 수익성을 분리합니다
확률 예측을 거래 결정에 쓰려면 확률을 행동으로 바꾸는 규칙이 필요합니다. 그 결정은 가능한 보상, 오답일 때 손실, 체결가격, 스프레드, 수수료, 슬리피지, 펀딩, 대차 비용, 자본 한도, 확률이 거래 가능한 시점에도 달려 있습니다. 적정 점수는 확률 예측을 평가할 뿐, 거래 비용이나 포지션 크기를 계산하지 않습니다.
로그 손실 평균이 개선돼도 특정 거래규칙의 결과는 개선되지 않을 수 있습니다. 그 규칙은 일부 확률 구간에서만 거래하거나 다른 기간의 예측에 반응할 수 있기 때문입니다. 반대로 전체 점수에는 조금만 반영되는 소수 구간에서 유용한 신호가 나타날 수도 있습니다. 확률을 평가한 뒤에는 사전에 정한 거래 규칙을 선택에 쓰지 않은 날짜에서 따로 평가하고, 현실적인 비용을 뺀 수익률과 불확실성을 계산합니다.
다른 연구자가 결과를 재현할 수 있도록 사건, 확률, 결과, 점수 산식과 관례, 기준 예측, 표본, 평가 시점을 보고합니다. 확률이 표본외에서 생성됐는지, 결과 구간이 겹치는지, 누락 사례를 어떻게 처리했는지, 다른 모형과 점수를 몇 개 시도했는지도 밝힙니다. 이런 기록이 예측 점수를 해석 가능한 통계량으로 남겨 두고 미래 수익 보장처럼 보이지 않게 합니다.
브라이어 점수와 로그 손실은 각 관측치의 손실을 전체 평가 표본에서 평균합니다. 실제 의사결정이 사전에 정한 경보 확률 이상에서만 행동한다면, 그 구간의 사례 수와 결과도 보조 분석으로 살펴볼 수 있습니다. 결과를 확인한 뒤 유리해 보이는 확률 구간을 골라 보고하면 선택 편향이 생깁니다. 따라서 관심 구간과 거래 규칙은 분석 전에 정하고, 규칙 조정에 쓴 검증기간과 최종 평가기간을 분리합니다. 희귀 구간은 사례가 적어 추정이 불안정하므로 원점수와 함께 표본 수와 불확실성 범위도 보고합니다.
자주 묻는 질문
Q1브라이어 점수가 낮으면 항상 더 좋은가요?
사건 정의, 표본, 산식 관례, 결과 코딩이 같을 때 낮은 점수가 더 좋습니다. 사건이 다르거나 다범주 산식이 다르면 점수를 직접 비교하지 마세요.
Q2브라이어 점수가 좋으면 확률이 보정됐다는 뜻인가요?
아닙니다. 집계 브라이어 점수는 신뢰도, 분해능, 사건 불확실성의 영향을 함께 받습니다. 보정 진단과 표본 불확실성도 살펴야 합니다.
Q3브라이어 점수와 로그 손실 중 무엇을 사용해야 하나요?
결과를 평가하기 전에 선택합니다. 브라이어 손실은 확률 오차의 제곱으로 상한이 있고, 로그 손실은 확신에 찬 오답을 더 크게 벌합니다. 과제의 결과와 원하는 민감도에 따라 정합니다.
Q4확률 점수가 좋아지면 거래 전략이 수익을 내나요?
아닙니다. 점수는 예측을 평가합니다. 보상 구조, 체결비용, 자금조달, 포지션 크기, 모형 선택은 거래 전략에서 따로 평가해야 합니다. 주요 연구 - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)
출처와 더 읽을 자료
내용 정정 제보
이 아티클 링크를 담은 이메일 초안을 준비합니다. 직접 보내야 Mark에 제보가 접수됩니다
QUICK CHECK
글을 다 읽었다면, 3문항으로 확인해보세요
Question 01
이진 사건이 실제로 발생했고 예측 확률이 70%였다면, 단일 사건 관례의 브라이어 손실은 얼마인가요?
정답을 고르면 바로 설명을 볼 수 있어요
옵션 용어 사전
콜·풋과 옵션 체인부터 IV, 그릭스, 미결제약정, 맥스 페인까지 핵심 옵션 용어를 정확하게 설명합니다
옵션 용어 사전 보기