Байесовско-дисперсионный компромисс и переобучение финансовых моделей
Поймите предсказательное смещение, дисперсию оценок, необратимый шум, сложность модели, временную валидацию, поиск данных, переобучение бэктестов и управление финансовыми моделями
Короткий ответ
Байесовско-дисперсионный компромисс разделяет ошибку предсказания, вызванную систематическим несоответствием модели, от ошибки, вызванной чувствительностью к обучающей выборке. Переобучение возникает, когда модель или стратегия улавливает специфический для выборки шум как повторяющуюся структуру. В финансах повторные бэктесты и изменение режимов делают обе эти проблемы необычно острыми
Ошибка предсказания имеет несколько источников
Для квадратичной потери и фиксированного входа x ожидаемая ошибка теста разлагается на квадрат смещения, дисперсию оценщика и необратимую условную шумовую компоненту
Смещение сравнивает среднее предсказанное значение по гипотетическим обучающим наборам с истинным условным средним
Дисперсия измеряет, насколько сильно предсказание оценки меняется между теми обучающими наборами; это не дисперсия рыночных доходностей
Высокое смещение упускает устойчивую структуру
Слишком жёсткая модель может игнорировать нелинейные выигрыши, взаимодействия, временную изменчивость или важные факторы риска
Ошибки на обучении и тесте могут быть обе плохими, и добавление релевантной структуры или лучших признаков может сократить систематическую ошибку
Низкая дисперсия — это не успех, когда модель последовательно предсказывает неверную величину или использует целевую переменную, не согласованную с решением
Высокая дисперсия осваивает случайные детали
Гибкая модель может подгонять выбросы, шум, артефакты микроструктуры и разовые режимные паттерны, которые не повторяются
Ошибка на обучении падает, а результаты резко меняются между ресэмплами, окнами, семенами или малыми изменениями спецификации
Регуляризация, пулинг, более простые признаки, увеличение эффективного объёма выборки и усреднение могут снизить дисперсию, но вносят или сохраняют смещение
Сложность — это не только количество параметров
Ширина поиска, конструирование признаков, правила останова, настройка гиперпараметров и итерации аналитика — всё это увеличивает эффективную гибкость
Современные модели не обязаны следовать простой кривой ошибок в форме «U», но наблюдения интерполяции или двойного спуска не устраняют риск валидации
Релевантная сложность — это весь адаптивный исследовательский процесс, включая отброшенные модели, которые никогда не появляются в финальном отчёте
Финансовая валидация должна учитывать время
Случайное разбиение по строкам может привести к утечке перекрывающихся меток, нормализации по будущим данным, изменений состава и близкой режимной информации
Используйте хронологические отборы, пошаговую оценку, эмбарго там, где метки перекрываются, и допущения о транзакционных издержках, зафиксированные до тестирования
Результаты должны быть устойчивыми по подпериодам, активам, правдоподобным издержкам, задержкам и возмущениям, а не просто положительными в одном бэктесте
Подбор данных умножает ложные открытия
Пробуя множество стратегий и публикуя только лучшую, вы улучшите её Шарп-коэффициент, t-статистику или максимальную просадку за счёт одного лишь отбора
Реальность-тест Уайта и связанные методы множественного тестирования адресуют поиск среди альтернатив на основании их собственных допущений
Нетронутый финальный отбор помогает только в том случае, если он остаётся нетронутым; многократное рассмотрение превращает его в ещё одну обучающую выборку
Управление должно учитывать исследовательский путь
Ведите журнал каждой проверенной гипотезы, признака, универсума, окна, издержек и отказа, чтобы явное число испытаний не преуменьшалось
Разделяйте исследовательское открытие и подтверждение, предварительно регистрируйте решающие тесты, где практически возможно, и требуйте экономических механизмов и сценариев отказа
Публикуйте распределения результатов, доверительные интервалы, оборачиваемость, ёмкость, хвостовые потери и деградацию от исследования к живой торговле
Частые вопросы
Что такое байесовско-дисперсионный компромисс?
Это напряжение между систематической ошибкой предсказания из-за ограничивающих допущений и нестабильностью из-за подгонки под выборочную изменчивость
Что такое переобучение в финансовой модели?
Это обучение историческому шуму или разовой структуре, которые улучшают бэктест, но не обобщаются на будущие решения
Почему случайное разбиение на обучающую и тестовую выборки рискованно для финансов?
Временная зависимость, перекрывающиеся метки, предобработка и близость режимов могут привести к утечке будущей информации через границу разбиения
Может ли финальный отбор предотвратить всё переобучение бэктеста?
Нет. Он помогает лишь до тех пор, пока остаётся нетронутым, и не может компенсировать огромный нераскрытый поиск, смену режима, плохие издержки или неверную целевую переменную