Deflated Sharpe Ratio(DSR) 설명: 여러 백테스트와 선택 편향
Deflated Sharpe Ratio가 여러 전략을 시험한 뒤 Sharpe를 선택할 때 다중 시도와 비정규 수익률을 어떻게 반영하는지, 가상 계산과 함께 설명합니다.
이 글에서 다루는 내용DSR은 탐색 이후 Sharpe의 기준을 높여 평가합니다
짧은 요약
Deflated Sharpe Ratio(DSR)는 여러 대안 가운데 선택된 전략의 추정 Sharpe가 탐색 범위와 수익률 분포를 반영한 기준을 넘는지 묻습니다. 선택을 고려한 벤치마크에 확률적 Sharpe 계산을 적용합니다. DSR은 조건부 통계 진단입니다. 백테스트를 미래 수익의 증거로 바꾸거나, 누락된 시도·비현실적 거래비용·시계열 누출을 바로잡지는 않습니다.
DSR은 탐색 이후 Sharpe의 기준을 높여 평가합니다
연구자는 신호 정의, 룩백 기간, 진입 임계값, 투자 유니버스, 보유 기간, 비용 가정을 바꾸어 여러 전략을 시험한 다음 가장 높은 Sharpe ratio를 보인 버전을 보고할 수 있습니다. 후보마다 실제 능력이 전혀 없더라도 추정치는 표본 변동 때문에 달라집니다. 탐색 범위가 넓어지면 그중 최댓값은 높아지는 경향이 있습니다. 그렇게 선택된 결과는 데이터를 보기 전에 하나로 지정한 전략을 평가한 결과와 다릅니다.
Bailey와 López de Prado가 제안한 Deflated Sharpe Ratio는 선택된 Sharpe의 두 가지 부풀림 원인을 다룹니다. 하나는 여러 가설을 시험하고 그중 좋은 결과를 고르는 과정입니다. 다른 하나는 수익률이 정규분포와 다를 때 Sharpe 추정의 불확실성이 달라지는 현상입니다. 원 논문에서 DSR은 선택에 따라 조정한 임계값을 사용해 Probabilistic Sharpe Ratio를 계산하는 방식입니다. 원 논문은 이 통계량의 유도와 시도 횟수 추정을 설명합니다.
이 정의는 흔한 오해를 줄여 줍니다. DSR은 보고된 Sharpe에서 고정된 벌점을 빼 새 성과비율을 만드는 계산이 아닙니다. 탐색, 표본 길이, 수익률의 모양에 비추어 관측된 Sharpe가 기준을 얼마나 강하게 넘어서는지 추정합니다. 따라서 보고된 Sharpe 점추정치는 그대로여도 그 결과를 뒷받침하는 근거가 약하면 DSR은 낮아질 수 있습니다. Sharpe 자체의 의미는 샤프의 원래 설명도 참고할 수 있습니다.
여러 noisy 추정치 중 최댓값은 우연히 높을 가능성이 큽니다
시험한 규칙 모두의 진짜 Sharpe가 같다고 가정해도, 유한한 표본으로 계산한 각 추정치에는 오차가 있습니다. 그중 가장 큰 값을 고르면 좋은 쪽으로 움직인 측정 오차도 함께 선택됩니다. 이것이 승자의 저주입니다. 선택된 추정치는 새로운 자료에서 후보 집단의 전형적인 값 쪽으로 되돌아갈 수 있습니다.
시도 횟수뿐 아니라 추정치 사이의 차이도 중요합니다. 후보들이 거의 같은 수익 경로를 낸다면 추정 Sharpe도 밀접하게 움직일 수 있습니다. 이렇게 상관된 후보 100개가, 서로 무관한 후보 100개와 같은 수의 독립적인 최대값 기회를 제공한다고 볼 수는 없습니다. 따라서 파라미터 그리드의 행 개수를 그대로 독립 시도 횟수라고 부르면 선택 효과를 과장해서 계산할 수 있습니다.
탐색 기록에는 정형화된 그리드 밖의 선택도 들어갈 수 있습니다. 결과를 보고 임계값을 바꾸거나, 한 시장을 유니버스에서 빼거나, 거래비용 가정을 고쳐 살아남은 후보를 고른 경우가 그렇습니다. 최종 후보만 모아 계산한 DSR은 기록하거나 입력하지 않은 실험을 추정에 반영할 수 없습니다. 실제로 의사결정에 영향을 준 시도를 보존하는 일이 계산보다 먼저입니다.
Probabilistic Sharpe Ratio가 표본 불확실성을 계산합니다
Probabilistic Sharpe Ratio(PSR)는 표본 Sharpe가 지정한 기준을 넘는지 확률 형태로 요약합니다. 표본 관측 수와 수익률의 왜도·첨도를 고려합니다. DSR은 이 계산 구조를 쓰되, 기준을 탐색 과정에서 기대할 수 있는 최대 Sharpe를 반영하도록 정합니다. PSR의 기준이 사용자가 지정한 값일 수 있다면, DSR의 핵심은 여러 후보를 탐색한 선택 효과가 기준값에 들어간다는 점입니다.
표준적으로 쓰이는 PSR 근사식에 선택 조정 기준을 넣으면 다음과 같이 쓸 수 있습니다.
$$ \mathrm{DSR}=\Phi\!\left( \frac{(\widehat{SR}-SR_0)\sqrt{T-1}} {\sqrt{1-\widehat{\gamma}_3\widehat{SR} +\frac{\widehat{\gamma}_4-1}{4}\widehat{SR}^{\,2}}} \right) $$
여기서 $\Phi$는 표준 정규 누적분포함수, $\widehat{SR}$은 관측치 한 기간 단위의 추정 Sharpe, $SR_0$는 동일한 단위로 표시한 선택 조정 기준, $T$는 관측 수입니다. $\widehat{\gamma}_3$은 표본 왜도이고 $\widehat{\gamma}_4$는 Pearson 첨도입니다. 정규분포의 Pearson 첨도는 3입니다. 분모는 왜도와 첨도가 Sharpe 추정의 불확실성을 어떻게 바꾸는지 반영합니다.
계산은 수익률을 정의하는 방식에 민감합니다. 동일한 주기의 초과수익률을 사용하고 Sharpe와 기준값도 같은 주기로 맞춰야 합니다. 둘 중 하나만 연율화하면 비교가 바뀝니다. 첨도가 초과첨도인지 Pearson 첨도인지도 맞춰야 합니다. 널리 쓰이는 식은 수익 관측치의 의존구조에 대한 가정에도 기대고 있으므로, 자기상관은 $T$에 조용히 끼워 넣지 말고 별도로 다뤄야 합니다.
기대 최댓값 기준은 후보군의 가정에 따라 달라집니다
서로 독립이며 추정 Sharpe의 분포가 대략 정규라고 놓으면, Bailey와 López de Prado는 $N$개 추정치의 기대 최댓값을 극값 근사로 계산합니다.
$$ SR_0 \approx \mu_{SR}+\sigma_{SR} \left[(1-\gamma_E)\Phi^{-1}\!\left(1-\frac{1}{N}\right) +\gamma_E\Phi^{-1}\!\left(1-\frac{1}{Ne}\right)\right] $$
$\mu_{SR}$과 $\sigma_{SR}$은 후보별 Sharpe 추정치의 평균과 표준편차이고, $\Phi^{-1}$은 표준 정규분포의 분위수 함수, $e$는 자연상수입니다. $\gamma_E \approx 0.5772$는 오일러-마스케로니 상수입니다. 이 식은 가정한 시도 모형에서 선택만으로 최고 추정치가 어느 정도까지 올라갈 수 있는지를 근사합니다. 모든 전략 탐색에 통용되는 보편적 기준값은 아닙니다.
후보 결과가 서로 상관되면 모든 변형을 독립으로 취급하는 방식은 실질적인 시도 수를 부풀릴 수 있습니다. 원 논문은 후보 간 의존성을 바탕으로 독립 시도 수를 추정하는 방법도 다룹니다. 하지만 이 추정 자체가 추가적인 모델 선택입니다. 상관은 의존성의 한 형태에 불과하며, 후보 수가 많고 수익 이력이 짧으면 평균 상관도 불안정할 수 있습니다. 원시 후보 수, 유효 시도 수의 추정법, 타당한 다른 가정으로 바꿨을 때의 민감도를 공개해야 합니다.
가상 계산으로 관측 Sharpe와 선택 기준을 나눠 봅니다
단순화된 탐색에서 후보 전략 20개가 서로 독립이라고 가정해 보겠습니다. 귀무상태에서 후보별 Sharpe 추정치의 평균은 0, 표준편차는 월간 단위 0.20이라고 놓습니다. 기대 최댓값 근사는 선택 기준을 월간 Sharpe 약 $SR_0=0.380$으로 제시합니다. 이 입력값은 계산 과정을 보여주기 위한 가정일 뿐 시장에서 측정한 값도, 권장 기준도 아닙니다.
이제 선택된 전략에 월간 초과수익률 관측치 60개가 있고, 추정 월간 Sharpe가 0.50, 표본 왜도가 0, Pearson 첨도가 3이라고 가정합니다. PSR 부분은 0.50을 0이 아니라 0.380에 비교합니다.
$$ z=\frac{(0.50-0.380)\sqrt{59}}{\sqrt{1+((3-1)/4)(0.50)^2}} \approx 0.868,\qquad \mathrm{DSR}=\Phi(z)\approx 0.807 $$
단순화한 가정에서 DSR은 약 80.7%입니다. 이를 전략이 다음 달에 수익을 낼 확률 80.7%로 읽으면 안 됩니다. 미래 수익 예측도 아닙니다. 해당 모형과 입력을 조건으로 놓았을 때, 진짜 Sharpe가 선택 기준을 넘는다는 통계적 근거를 추정한 값입니다. 시도 수, 후보 의존성 추정, 표본, 수익 분포를 바꾸면 결과도 달라질 수 있습니다.
이 사례에서 후보 Sharpe 추정치의 표준편차만 0.20에서 0.10으로 낮춘다고 가정하면 같은 20개 탐색의 기준은 약 0.190이 되고, DSR은 약 98.8%로 올라갑니다. 반대로 표준편차가 0.30이면 기준은 약 0.570, DSR은 약 30.6%가 됩니다. 표본 Sharpe 0.50, 관측 수 60, 왜도와 첨도를 그대로 두어도 후보군의 추정치 분산 가정만으로 결과가 달라집니다. 숫자를 계산기에 넣기 전에 $\sigma_{SR}$와 후보 간 의존성을 어떻게 추정했는지 확인해야 하는 이유입니다. 이 민감도도 동일한 월간 단위와 단순화된 모형 안의 가상 계산입니다.
왜도와 첨도는 서술뿐 아니라 불확실성 계산을 바꿉니다
표본 Sharpe와 기간 수가 같아도 두 전략의 수익 분포는 다를 수 있습니다. 왼쪽 꼬리가 길거나 비대칭이 크거나 극단적인 값이 자주 관측되면 PSR 분모가 나타내는 표본 불확실성도 달라집니다. 이 보정은 모든 비정규 분포를 똑같이 해롭다고 판단하지 않습니다. 소수의 표본 모멘트가 꼬리 위험의 모든 측면을 설명한다고 보장하지도 않습니다.
관측 단위를 무엇으로 정하느냐에 따라 계산도 달라집니다. 일간·주간·월간 자료는 $T$, Sharpe, 왜도, 첨도에 각각 다른 값을 줍니다. 보유 기간이 겹치는 수익률을 행마다 넣으면 이웃한 관측치가 서로 종속될 수 있습니다. 오래된 가격을 사용하거나 거래가 뜸한 자산은 실제 경제적 위험보다 변동성이 낮게 보일 수도 있습니다. 연율화 Sharpe 하나만 제시하지 말고 표본 빈도와 수익률 생성 방식을 밝혀야 합니다.
DSR과 다른 검증법은 서로 다른 질문에 답합니다
PBO는 Combinatorially Symmetric Cross-Validation으로 IS 우승 후보가 보완적인 블록에서 후보 중위수 이하의 순위를 받는 경우가 얼마나 되는지 봅니다. Bailey와 공저자들은 이 선택 진단을 PBO 원 논문에서 형식화했습니다. DSR은 선택된 Sharpe가 탐색과 비정규 수익률을 반영한 기준을 넘는지 추정합니다. 출력값과 재표본 가정이 달라 서로 대체할 수 없습니다. 각각의 범위를 설명하는 PBO와 CSCV 안내와 금융의 다중 검정 안내를 함께 참고하세요.
White의 원 Reality Check 논문은 후보군에서 가장 좋은 규칙이 지정한 기준 전략을 앞서는지 데이터 스누핑을 고려한 부트스트랩으로 검정합니다. 여기서는 벤치마크 대비 질문이 중심이고, DSR은 Sharpe 기준을 사용합니다. 반면 시간순 walk-forward나 최종 홀드아웃은 고정된 연구 절차가 나중의 기간에 어떻게 작동하는지 묻습니다. 세 접근은 연구 주장의 서로 다른 부분을 점검하므로 보완적으로 사용할 수 있습니다.
DSR과 함께 탐색 기록과 계산 가정을 보고합니다
재현 가능한 보고에는 후보군, 선택에 영향을 준 의사결정, 원시 시도 수, 유효 시도 추정법, 수익률 시계열, 표본 길이와 빈도, Sharpe 정의, 왜도, 첨도 관례, 선택 조정 기준이 포함됩니다. 수익률이 스프레드, 수수료, 시장 충격, 펀딩, 차입 및 그 밖의 비용을 차감했는지 밝혀야 합니다. 관측 Sharpe와 DSR을 함께 보여 주면 독자가 선택 기준을 적용했을 때 달라진 점을 볼 수 있습니다.
일반적인 식은 시계열 상관이 있는 수익 관측치에 맞지 않을 수 있습니다. Lo의 Sharpe ratio 통계 연구는 시간 단위 통합과 의존성이 Sharpe 추론에 영향을 주는 이유를 설명합니다. 수익률 기간이 겹치거나 자기상관이 있으면 그 구조를 처리하는 추론 절차를 선택하고 가정을 밝혀야 합니다. 월간 Sharpe에 $\sqrt{12}$를 곱한다고 자기상관이 보정되지는 않습니다. 시간순 평가에는 expanding 및 rolling walk-forward 윈도우 안내도 참고하세요.
DSR은 기록되지 않은 탐색을 찾아낼 수 없고, 미래정보 누출을 제거하거나 생존 편향 데이터의 대표성을 검증하거나, 체결 현실성·거래 용량·새 국면에서의 안정성을 보장하지 않습니다. 경제적 근거나 실제보다 늦은 기간의 평가도 대신하지 못합니다. 후보 이력과 데이터 처리를 재현할 수 있도록 남기고 DSR은 연구 과정 안에서 가정이 명시된 하나의 진단값으로 다루세요.
자주 묻는 질문
Q1Deflated Sharpe Ratio는 벌점을 빼고 다시 계산한 Sharpe ratio인가요?
아닙니다. DSR은 선택 조정 기준, 표본 길이, 왜도, 첨도를 적용하는 확률 형태의 통계량입니다. 보고된 Sharpe 점추정치에서 기계적으로 일정 비율을 차감해 새 Sharpe를 만들지 않습니다.
Q2파라미터 조합을 모두 독립 시도로 세야 하나요?
아닙니다. 비슷한 후보의 수익률은 상관될 수 있으므로 원시 그리드 크기와 독립적인 최대값 기회의 수가 다를 수 있습니다. 전체 탐색 기록을 보존하고 의존성 추정법과 그 불확실성을 공개하세요.
Q3DSR이 높으면 전략이 실제로 통한다는 뜻인가요?
아닙니다. DSR은 후보군, 데이터, 수익 구성, 시도 가정, 표본 모형에 조건부입니다. 기록에서 빠진 실험, 체결 오류, 데이터 누출, 국면 변화나 미래 불확실성을 해결하지 않습니다.
출처와 더 읽을 자료
내용 정정 제보
이 아티클 링크를 담은 이메일 초안을 준비합니다. 직접 보내야 Mark에 제보가 접수됩니다
QUICK CHECK
글을 다 읽었다면, 3문항으로 확인해보세요
Question 01
Probabilistic Sharpe 계산을 DSR의 바탕으로 쓸 때 핵심적으로 달라지는 점은 무엇인가요?
정답을 고르면 바로 설명을 볼 수 있어요