금융 다중검정과 False Discovery Rate
다중비교, 가족단위 오류율, 거짓발견율, Bonferroni, Holm, Benjamini–Hochberg, 종속성, q-value, 팩터 발굴, 백테스트 선택과 연구통제를 이해합니다
Mark 작성 · 하단에 공식 출처 표기
한눈에 답하기
다중검정은 많은 가설·전략·팩터·자산·기간·설정을 함께 탐색할 때 생깁니다. 개별 p-value가 유효해도 우연한 승자가 나타납니다. 가족단위 오류율은 거짓기각이 하나라도 생길 확률을, 거짓발견율은 기각된 결과 중 거짓 비중의 기대값을 가정 아래 통제합니다. 최종 표가 아니라 전체 연구집합이 문제의 크기를 정합니다
검정이 늘면 우연한 승자도 늘어납니다
서로 독립인 참 귀무가설 m개를 각각 수준 α로 검정하면 거짓기각이 하나 이상 생길 확률은 1−(1−α)^m입니다
α=0.05이고 m=20이면 모든 귀무가설이 참이어도 그 확률은 약 64%입니다
종속성은 정확한 계산을 바꾸지만 보고한 승자 하나만 검정했다고 취급할 근거가 되지는 않습니다
검정군이 오류 질문을 정합니다
하나의 연구주장을 위해 고려한 모든 팩터, 변환, 자산군, 시차, 기간, 필터, 모형선택과 재실행이 검정군에 들어갈 수 있습니다
결과를 본 뒤 검정군을 정하면 다중성을 축소하고 관련 시행을 보정이 무의미해질 때까지 나눌 수 있습니다
방어 가능한 검정군은 논문이나 화면에 남은 행이 아니라 의사결정 과정과 선택기회를 따라야 합니다
FWER과 FDR은 다른 손실을 통제합니다
가족단위 오류율은 정한 검정군 안에서 거짓기각을 하나 이상 만들 확률입니다
거짓발견율은 E[V/max(R,1)]이며 V는 거짓기각 수, R은 전체 기각 수입니다
거짓주장 하나도 큰 비용일 때 FWER이 엄격하고 많은 후보 중 일정한 거짓비중을 감수할 수 있을 때 FDR이 더 강력할 수 있습니다
보정절차에는 가정이 필요합니다
Bonferroni는 각 가설을 α/m으로 검정하며 독립성을 요구하지 않고 FWER을 통제하지만 보수적일 수 있습니다
Holm의 단계하향법도 FWER을 통제하며 기본 Bonferroni 기각규칙보다 검정력이 낮지 않습니다
Benjamini–Hochberg는 p-value를 정렬해 독립 또는 특정 양의 종속 아래 FDR을 통제하며 다른 종속구조에는 정당화된 방법이 필요합니다
보정값은 사후 진실확률이 아닙니다
보정 p-value는 선택한 절차에서 해당 가설이 기각되는 가장 작은 가족 오류수준입니다
q-value는 흔히 한 결과를 발견이라 부를 수 있는 최소 추정 FDR 문턱으로 해석되며 방법과 가정에 의존합니다
어느 값도 선택한 전략 하나가 거짓일 확률은 아니며 그러려면 다른 모형과 명확한 조건부 진술이 필요합니다
금융에는 큰 적응형 검정군이 숨어 있습니다
팩터 발굴, 기술적 규칙, 옵션 신호, 대체자료, 포트폴리오 제약과 비용가정은 수천 개의 상관된 시행을 만듭니다
발표된 팩터는 과거 탐색에서 선택됐으므로 새 팩터를 t통계량 약 2 하나로 판단하면 누적된 발견압력을 무시하게 됩니다
공통 자산과 기간은 검정을 종속적으로 만들며 국면변화는 선택보정만으로 미래 경제성과를 보장할 수 없게 합니다
연구통제는 탐색기록을 보존해야 합니다
모든 가설, 코드버전, 자산군, 결과변수, 변환, 지연, 비용과 중단선택을 안정적인 연구식별자와 함께 기록합니다
발견·확인·실전감시를 분리하고 확인규칙을 고정한 뒤 실제로 손대지 않은 자료나 전향적 평가를 사용합니다
원시·보정 증거, 검정군 정의, 종속가정, 효과크기, 비용, 안정성, 기각한 아이디어와 실전성과 저하를 함께 보고합니다
자주 묻는 질문
다중검정 문제란 무엇인가요?
많은 가설을 시험하고 승자를 고른 뒤 각 검정이 홀로 수행된 것처럼 평가해서 거짓발견이 늘어나는 문제입니다
FWER과 FDR은 어떻게 다른가요?
FWER은 거짓기각이 하나 이상 생길 확률을, FDR은 전체 기각 중 거짓기각 비중의 기대값을 통제합니다
Benjamini–Hochberg 절차는 어떻게 작동하나요?
p-value를 정렬해 순위별 문턱과 비교하고 가정 아래 조건을 만족하는 가장 큰 순위까지 기각합니다
FDR을 통제하면 거래전략을 신뢰할 수 있나요?
아닙니다. 정한 검정군의 선택오류를 다룰 뿐 국면변화, 비용, 누출, 모형위험이나 미래수익성을 보장하지 않습니다