Все руководства по опционам и фьючерсам
Почему модель может объяснять историю и терпеть крах в следующий период15 минут чтения

Байесовско-дисперсионный компромисс и переобучение финансовых моделей

Поймите предсказательное смещение, дисперсию оценок, необратимый шум, сложность модели, временную валидацию, поиск данных, переобучение бэктестов и управление финансовыми моделями

Подготовлено Mark · Первичные источники ниже

Короткий ответ

Байесовско-дисперсионный компромисс разделяет ошибку предсказания, вызванную систематическим несоответствием модели, от ошибки, вызванной чувствительностью к обучающей выборке. Переобучение возникает, когда модель или стратегия улавливает специфический для выборки шум как повторяющуюся структуру. В финансах повторные бэктесты и изменение режимов делают обе эти проблемы необычно острыми

Ошибка предсказания имеет несколько источников

Для квадратичной потери и фиксированного входа x ожидаемая ошибка теста разлагается на квадрат смещения, дисперсию оценщика и необратимую условную шумовую компоненту

Смещение сравнивает среднее предсказанное значение по гипотетическим обучающим наборам с истинным условным средним

Дисперсия измеряет, насколько сильно предсказание оценки меняется между теми обучающими наборами; это не дисперсия рыночных доходностей

Высокое смещение упускает устойчивую структуру

Слишком жёсткая модель может игнорировать нелинейные выигрыши, взаимодействия, временную изменчивость или важные факторы риска

Ошибки на обучении и тесте могут быть обе плохими, и добавление релевантной структуры или лучших признаков может сократить систематическую ошибку

Низкая дисперсия — это не успех, когда модель последовательно предсказывает неверную величину или использует целевую переменную, не согласованную с решением

Высокая дисперсия осваивает случайные детали

Гибкая модель может подгонять выбросы, шум, артефакты микроструктуры и разовые режимные паттерны, которые не повторяются

Ошибка на обучении падает, а результаты резко меняются между ресэмплами, окнами, семенами или малыми изменениями спецификации

Регуляризация, пулинг, более простые признаки, увеличение эффективного объёма выборки и усреднение могут снизить дисперсию, но вносят или сохраняют смещение

Сложность — это не только количество параметров

Ширина поиска, конструирование признаков, правила останова, настройка гиперпараметров и итерации аналитика — всё это увеличивает эффективную гибкость

Современные модели не обязаны следовать простой кривой ошибок в форме «U», но наблюдения интерполяции или двойного спуска не устраняют риск валидации

Релевантная сложность — это весь адаптивный исследовательский процесс, включая отброшенные модели, которые никогда не появляются в финальном отчёте

Финансовая валидация должна учитывать время

Случайное разбиение по строкам может привести к утечке перекрывающихся меток, нормализации по будущим данным, изменений состава и близкой режимной информации

Используйте хронологические отборы, пошаговую оценку, эмбарго там, где метки перекрываются, и допущения о транзакционных издержках, зафиксированные до тестирования

Результаты должны быть устойчивыми по подпериодам, активам, правдоподобным издержкам, задержкам и возмущениям, а не просто положительными в одном бэктесте

Подбор данных умножает ложные открытия

Пробуя множество стратегий и публикуя только лучшую, вы улучшите её Шарп-коэффициент, t-статистику или максимальную просадку за счёт одного лишь отбора

Реальность-тест Уайта и связанные методы множественного тестирования адресуют поиск среди альтернатив на основании их собственных допущений

Нетронутый финальный отбор помогает только в том случае, если он остаётся нетронутым; многократное рассмотрение превращает его в ещё одну обучающую выборку

Управление должно учитывать исследовательский путь

Ведите журнал каждой проверенной гипотезы, признака, универсума, окна, издержек и отказа, чтобы явное число испытаний не преуменьшалось

Разделяйте исследовательское открытие и подтверждение, предварительно регистрируйте решающие тесты, где практически возможно, и требуйте экономических механизмов и сценариев отказа

Публикуйте распределения результатов, доверительные интервалы, оборачиваемость, ёмкость, хвостовые потери и деградацию от исследования к живой торговле

Частые вопросы

Что такое байесовско-дисперсионный компромисс?

Это напряжение между систематической ошибкой предсказания из-за ограничивающих допущений и нестабильностью из-за подгонки под выборочную изменчивость

Что такое переобучение в финансовой модели?

Это обучение историческому шуму или разовой структуре, которые улучшают бэктест, но не обобщаются на будущие решения

Почему случайное разбиение на обучающую и тестовую выборки рискованно для финансов?

Временная зависимость, перекрывающиеся метки, предобработка и близость режимов могут привести к утечке будущей информации через границу разбиения

Может ли финальный отбор предотвратить всё переобучение бэктеста?

Нет. Он помогает лишь до тех пор, пока остаётся нетронутым, и не может компенсировать огромный нераскрытый поиск, смену режима, плохие издержки или неверную целевую переменную

Источники и дополнительное чтение

Связанные руководства