Множественная проверка и доля ложных открытий в финансах
Разберитесь во множественных сравнениях, семейной вероятности ошибки, доле ложных открытий, методах Бонферрони, Холма и Бенджамини–Хохберга, зависимости, q-значениях, поиске факторов, отборе бэктестов и управлении исследованиями
Короткий ответ
Множественная проверка возникает, когда вместе ищут среди множества гипотез, стратегий, факторов, активов, горизонтов или спецификаций. Даже корректные отдельные p-значения тогда порождают случайных победителей. Семейная вероятность ошибки контролирует вероятность хотя бы одного ложного отклонения, а доля ложных открытий — ожидаемую долю ложных результатов среди отклонений при заданных предпосылках. Проблему определяет всё семейство исследования, а не только финальная таблица
Чем больше тестов, тем больше случайных победителей
Если m независимых истинных нулевых гипотез проверяются на уровне α, вероятность хотя бы одного ложного отклонения равна 1−(1−α)^m
При α=0.05 и m=20 эта вероятность составляет около 64%, хотя номинальная вероятность ложного отклонения каждого отдельного теста равна 5%
Зависимость меняет точный расчёт, но не оправдывает вид, будто проверялся только опубликованный победитель
Семейство определяет вопрос об ошибке
В одно семейство могут входить все факторы, преобразования, вселенные, лаги, горизонты, фильтры, варианты моделей и повторные запуски, рассмотренные для одного исследовательского утверждения
Определение семейства после просмотра результатов занижает множественность и позволяет разделять связанные испытания, пока поправка не станет безвредной
Защищаемое семейство следует процессу решения и возможности отбора, а не только строкам, которые пережили отбор в статью или дашборд
FWER и FDR контролируют разные потери
Семейная вероятность ошибки — вероятность сделать хотя бы одно ложное отклонение внутри семейства
Доля ложных открытий равна E[V/max(R,1)], где V — число ложных отклонений, а R — общее число отклонений
FWER строже, когда дорого любое ложное утверждение; FDR часто мощнее при отборе множества кандидатов, если контролируемая доля ложных результатов допустима
Процедуры требуют своих предпосылок
Метод Бонферрони проверяет каждую гипотезу на уровне α/m и контролирует FWER без требования независимости, хотя может быть консервативным
Пошаговый метод Холма также контролирует FWER и никогда не менее мощен, чем базовое правило отклонения Бонферрони
Бенджамини–Хохберг упорядочивает p-значения и контролирует FDR при независимости и некоторых видах положительной зависимости; для других структур нужны обоснованные методы
Поправки не являются апостериорными вероятностями истины
Скорректированное p-значение — минимальный уровень семейной ошибки, при котором гипотеза была бы отклонена выбранной процедурой
q-значение обычно трактуют как оценённый минимальный порог FDR, при котором результат можно объявить открытием, с учётом метода и предпосылок
Ни одна величина автоматически не является вероятностью ложности выбранной стратегии; для этого нужны другая модель и другое условное утверждение
Финансы скрывают большое адаптивное семейство
Поиск факторов, технических правил, опционных сигналов, альтернативных данных, портфельных ограничений и предпосылок об издержках создаёт тысячи коррелированных испытаний
Опубликованные факторы отобраны из прошлых поисков, поэтому оценка нового фактора по изолированной t-статистике около двух игнорирует накопленное давление отбора
Общие активы и периоды делают тесты зависимыми, а смена режима означает, что поправка на отбор не гарантирует будущую экономическую эффективность
Управление должно сохранять историю поиска
Записывайте каждую гипотезу, версию кода, вселенную, исход, преобразование, задержку, издержки и решение об остановке под стабильным идентификатором исследования
Разделяйте открытие, подтверждение и живой мониторинг; зафиксируйте подтверждающие правила и используйте действительно нетронутые данные или перспективную оценку
Отчитывайтесь о необработанном и скорректированном свидетельстве, определении семейства, предпосылках зависимости, размерах эффектов, издержках, стабильности, отвергнутых идеях и ухудшении в реальном времени
Частые вопросы
В чём проблема множественной проверки?
Это рост числа ложных открытий из-за проверки и отбора множества гипотез, когда победителей оценивают так, будто каждый тест был единственным
Чем отличаются FWER и FDR?
FWER контролирует вероятность хотя бы одного ложного отклонения, а FDR — ожидаемую ложную долю среди всех отклонений
Как работает Бенджамини–Хохберг?
Он упорядочивает p-значения, сравнивает их с порогами, зависящими от ранга, и отклоняет гипотезы до наибольшего подходящего ранга при своих предпосылках
Делает ли контроль FDR торговую стратегию надёжной?
Нет. Он контролирует ошибку отбора в заданном семействе тестов, но не смену режима, издержки, утечку, модельный риск или будущую прибыльность