Bias–Variance Tradeoff와 금융모형 과적합
예측편향, 추정분산, 불가약 잡음, 모형복잡도, 시계열 검증, 자료탐색과 백테스트 과적합을 이해하고 금융모형의 관리원칙을 설명합니다
Mark 작성 · 하단에 공식 출처 표기
한눈에 답하기
Bias–Variance Tradeoff는 체계적인 모형불일치에서 오는 예측오차와 훈련표본 민감도에서 오는 오차를 나눕니다. 과적합은 모형이나 전략이 표본고유 잡음을 반복 가능한 구조처럼 학습할 때 생깁니다. 금융에서는 반복 백테스트와 국면변화 때문에 두 문제가 특히 심각합니다
예측오차에는 여러 원인이 있습니다
고정 입력 x의 제곱손실에서 기대 시험오차는 편향제곱, 추정량분산과 불가약 조건부 잡음으로 분해됩니다
편향은 가상의 여러 훈련표본에서 얻은 평균예측과 참 조건부평균을 비교합니다
분산은 훈련표본에 따라 적합예측이 얼마나 바뀌는지 측정하며 시장수익률의 분산이 아닙니다
높은 편향은 지속적인 구조를 놓칩니다
너무 경직된 모형은 비선형 지급, 상호작용, 시간변화나 중요한 위험요인을 무시할 수 있습니다
훈련오차와 시험오차가 모두 나쁠 수 있으며 관련 구조나 더 나은 특성을 더하면 체계적 오차가 줄어듭니다
모형이 일관되게 틀린 양을 예측하거나 의사결정과 다른 목표를 쓰면 낮은 분산도 성공이 아닙니다
높은 분산은 우연한 세부를 학습합니다
유연한 모형은 반복되지 않는 이상값, 잡음, 미시구조 인공물과 일회성 국면패턴을 맞출 수 있습니다
훈련오차는 낮아져도 재표본, 관측창, 난수시드나 작은 명세선택에 따라 성과가 크게 바뀝니다
정규화, 풀링, 단순한 특성, 큰 유효표본과 평균화는 분산을 낮추지만 편향을 더하거나 남길 수 있습니다
복잡도는 모수 개수보다 넓습니다
탐색범위, 특성구성, 중단규칙, 초모수조정과 분석가 반복은 모두 유효유연성을 높입니다
현대모형이 단순한 U자 오차곡선을 따르지 않아도 보간이나 Double Descent가 검증위험을 없애지는 않습니다
최종보고서에서 사라진 폐기모형까지 포함한 적응적 연구과정 전체가 관련 복잡도입니다
금융검증은 시간을 존중해야 합니다
무작위 행분할은 중첩라벨, 미래 정규화, 구성종목 변경과 인접국면 정보를 누출할 수 있습니다
시간순 보류, Walk-forward 평가, 라벨중첩 시 Embargo와 시험 전에 고정한 거래비용 가정을 사용합니다
한 백테스트의 양수성과가 아니라 부분기간, 자산, 그럴듯한 비용·지연·교란에서 안정적이어야 합니다
자료탐색은 거짓발견을 늘립니다
많은 전략을 시험하고 최고만 보고하면 선택만으로 Sharpe Ratio·t 통계량·낙폭이 좋아 보입니다
White의 Reality Check와 관련 다중검정 방법은 각자의 가정 아래 대안탐색을 다룹니다
마지막 보류표본도 한 번도 보지 않을 때만 도움이 되며 반복해서 보면 또 다른 훈련표본이 됩니다
거버넌스는 연구경로를 세어야 합니다
시험한 모든 가설, 특성, 유니버스, 관측창, 비용과 기각을 기록해 실제 시도횟수를 축소하지 않습니다
탐색적 발견과 확인을 분리하고 가능하면 결정적 검사를 사전등록하며 경제적 기제와 실패사례를 요구합니다
성과분포, 신뢰범위, 회전율, 수용력, 꼬리손실과 연구에서 실거래로의 성과저하를 보고합니다
자주 묻는 질문
Bias–Variance Tradeoff란 무엇인가요?
제약적인 가정의 체계적 예측오차와 표본고유 변동을 맞추는 불안정성 사이의 긴장입니다
금융모형의 과적합이란 무엇인가요?
백테스트는 개선하지만 미래 의사결정에는 일반화되지 않는 역사적 잡음이나 일회성 구조를 학습하는 것입니다
금융에서 무작위 훈련·시험 분할이 위험한 이유는 무엇인가요?
시간종속, 중첩라벨, 전처리와 국면인접성이 분할 사이로 미래정보를 누출할 수 있기 때문입니다
최종 보류표본이면 모든 백테스트 과적합을 막을 수 있나요?
아닙니다. 계속 보지 않을 때만 도움이 되며 숨은 대규모 탐색, 국면변화, 나쁜 비용과 잘못된 목표는 고치지 못합니다