Skip to content
Все руководства по опционам и фьючерсам
Зачем проверять победителя поиска стратегий на уровне всей группы13 мин чтения

White’s Reality Check против data snooping в бэктестах стратегий

Узнайте, как White’s Reality Check сравнивает лучшую стратегию из поиска с бенчмарком и учитывает максимум bootstrap-распределения с зависимостями

В этом руководствеТест проверяет, превосходит ли победитель поиска выбранный бенчмарк

Краткое резюме

White’s Reality Check проверяет, превосходит ли лучший кандидат из заданной поисковой группы выбранный бенчмарк с учетом того, что он был отобран как максимум. Метод выполняет bootstrap совместных, зависящих от времени разностей доходности и сравнивает наблюдаемый максимум с нулевым распределением bootstrap-максимумов. Низкое скорректированное p-value служит свидетельством против совместной нулевой гипотезы об отсутствии превосходства в этой группе и относительно этого бенчмарка; оно не прогнозирует прибыльность в реальной торговле.

Тест проверяет, превосходит ли победитель поиска выбранный бенчмарк

Исследователь может перепробовать десятки периодов скользящих средних, правил пробоя, сроков удержания, рынков и фильтров, а затем сообщить о стратегии с наивысшей оценкой бэктеста. Это не обычный отдельный кандидат: поиск дал ему множество шансов выглядеть особенно успешным. Если тестировать победителя так, будто его выбрали до просмотра данных, этап отбора останется неучтенным.

White’s Reality Check включает отбор в сам тест. Он проверяет, есть ли в изученной группе кандидат с ожидаемой доходностью выше заданного бенчмарка. White формулирует нулевую гипотезу как пересечение односторонних сравнений: ожидаемое превосходство каждого кандидата над бенчмарком не больше нуля. Альтернатива утверждает, что хотя бы у одного кандидата ожидаемое преимущество положительное. Бенчмарком может служить стратегия «купи и держи», простое правило прогнозирования или другой ориентир, но его определение должно соответствовать исследовательскому вопросу и быть задано до просмотра результата. Формальная постановка приведена в оригинальной статье White.

Это вопрос о всей группе кандидатов, а не гарантия для случайно победившей стратегии. Отклонение нулевой гипотезы говорит, что в зарегистрированной группе есть свидетельства превосходства при выбранной статистике и принятых предположениях. Оно не доказывает полезность каждого кандидата, сохранение победителем первого места или устойчивость преимущества при смене рыночного режима.

Выразите результат каждого кандидата как сопоставимую разность

Пусть d[k,t] — результат кандидата k за период t минус результат бенчмарка за тот же период; большее значение всегда должно быть лучше для кандидата. Для сравнения доходностей можно вычесть чистую доходность бенчмарка из чистой доходности кандидата. При сравнении ошибок прогноза направление обратное: ошибка бенчмарка минус ошибка кандидата. Знак должен быть выбран так, чтобы положительное значение означало преимущество кандидата.

Каждая строка должна описывать один и тот же временной интервал для всех кандидатов. Используйте одну валюту, метод расчета доходности, учет финансирования и политику издержек. Если речь о доходности стратегии, которую реально можно исполнить, до вычисления d[k,t] вычтите применимые комиссии, спреды, проскальзывание, финансирование и стоимость займа. Тестирование валовой доходности с упоминанием расходов лишь в сноске отвечает на другой вопрос.

Выборочное среднее для кандидата k равно d̄[k] = (1/T) Σ_t d[k,t]. Совместная нулевая гипотеза имеет вид H0: max_k E[d[k,t]] ≤ 0, альтернатива — H1: max_k E[d[k,t]] > 0. Для всей группы используется общий бенчмарк и один критерий оценки. Если у кандидатов различаются пропущенные даты или частота наблюдений, до расчета разностей задайте обоснованную общую выборку, а не предоставляйте одному кандидату незаметно более выгодный интервал.

Учитывайте всю группу кандидатов в исследовательском выводе

Группа включает правила, результаты которых могли повлиять на выбор опубликованного победителя: проверенные окна ретроспективы, пороги входа, сочетания сигналов, наборы активов, сроки удержания, ограничения портфеля и предположения об исполнении. Сюда также входят вручную опробованные варианты, отброшенные после просмотра результатов. В статье 2000 года White широко трактует «specification search»: проблему создает сам процесс выбора, а не только финальная таблица.

Возможны две противоположные ошибки. Если не включить эксперименты, которые помогли выбрать опубликованную стратегию, скорректированный тест будет чрезмерно оптимистичным: bootstrap увидит поиск уже, чем он был на самом деле. Если задним числом добавить множество произвольных несвязанных правил, тест может стать излишне консервативным и потерять способность обнаруживать полезного кандидата. Определяйте группу исходя из фактического процесса выбора и храните журнал исследования, позволяющий проверить ее границы.

Тест не восстановит эксперименты, которые нигде не записали. Одних выигравших параметров в блокноте недостаточно, чтобы реконструировать поиск. Храните вместе реестр кандидатов, версию данных, даты оценки, целевую метрику, допущения о расходах и решения по отбору. Если группа изменилась после просмотра результатов, укажите, что именно и почему; не выдавайте составленную постфактум группу за заранее заданную.

Статистика максимума включает отбор в нулевое распределение

Рассчитайте среднюю относительную доходность каждого кандидата и возьмите наибольшую. Распространенный нестандартизированный показатель — Vobs = √T × max_k d̄[k]. Максимум необходим: он воспроизводит тот же шаг «выбрать лучшего», который создал кажущегося победителя. Отдельная проверка только выигравшей колонки исключила бы этот шаг из эталонного распределения.

Bootstrap приближает величину максимума, которая могла бы возникнуть из-за выборочной вариации при истинной совместной гипотезе об отсутствии превосходства. Для повторения b повторно выбирается индексированный по времени вектор разностей всех кандидатов и вычисляется центрированный показатель, например V*b = √T × max_k(d̄*[k,b] − d̄[k]). Центрирование помещает средние кандидатов на наименее благоприятную границу нулевой гипотезы, где ожидаемое преимущество равно нулю, а максимум сохраняет отбор по всей группе. В статье White описано bootstrap-распределение максимума и его сравнение с наблюдаемой статистикой.

Повторите процедуру много раз. Скорректированное p-value — доля bootstrap-максимумов не меньше Vobs. При конечном числе B повторов часто используют оценку Монте-Карло (1 + count{V*b ≥ Vobs})/(B + 1). Реализации могут различаться стандартизацией и деталями оценки моделей, поэтому документируйте статистику и способ центрирования при нулевой гипотезе. Главное — в каждой репликации заново находить максимум всей группы, а не оценивать только наблюдаемого победителя.

Сохраняйте зависимость при повторной выборке истории кандидатов

Финансовые наблюдения упорядочены во времени. Независимое перемешивание может уничтожить серийную зависимость, кластеры волатильности и последовательности коррелированных прибылей или убытков. Оно также искажает связь стратегий, реагирующих на одни и те же рыночные дни. Эти свойства влияют на хвост распределения максимума; отдельная повторная выборка для каждого кандидата или вытягивание отдельных дат с возвращением может дать неверное эталонное распределение.

White описывает методы для зависимых данных, в том числе moving-block bootstrap, и анализирует стационарный bootstrap Politis и Romano. В нем выбранный блок обычно продолжается следующим временным наблюдением; при случайном перезапуске он начинается с другой выбранной даты. Длины блоков поэтому имеют геометрическое распределение с заданным средним. При соблюдении предположений и настройке метода такой подход лучше сохраняет короткие последовательности, чем i.i.d.-выборка. См. статью Politis и Romano о стационарном bootstrap.

Для группы стратегий выбирайте одну общую последовательность временных индексов и применяйте ее ко всему вектору (d[1,t], …, d[K,t]). Так сохраняются и порядок внутри выбранных блоков, и одновременная зависимость между кандидатами. Выбирайте длину блока с учетом горизонта стратегии и диагностики зависимостей, а также сообщайте чувствительность к разумным вариантам. Если исследовательская процедура переоценивает параметры, решите, входит ли этот этап в объект статистического вывода, и при необходимости воспроизводите его в каждой репликации. Повторная выборка только фиксированных оцененных доходностей может условиться на части процедуры и исключить ее.

Гипотетический пример bootstrap меняет интерпретацию

Допустим, исследователь сравнивает три стратегии с бенчмарком за T = 252 торговых дня. Средние дневные разности после расходов равны +2.0, +1.0 и −0.5 базисного пункта. Среднее победителя составляет 2.0 базисного пункта, а наблюдаемая статистика — √252 × 2.0 bp ≈ 31.75 bp·√торговый день. Это масштабирование входит в тестовую статистику; это не t-статистика, поскольку деления на оцененную стандартную ошибку нет.

Теперь предположим, что выполнено 9 999 повторов стационарного bootstrap, использующих одни и те же выбранные даты для всех трех кандидатов. В этом гипотетическом результате 1 199 максимумов повторов равны или превышают 31.75. Оценка Монте-Карло с поправкой плюс один равна (1 + 1,199)/(9,999 + 1) = 0.12. Отдельный тест только победителя мог бы дать гипотетическое значение 0.03, но он не учитывал бы выбор среди трех кандидатов. p-value Reality Check охватывает всю группу и при пороге 5% в этом примере не позволяет отклонить совместную нулевую гипотезу.

Эти цифры придуманы для демонстрации расчета: это не измеренные рыночные показатели и не результат из статьи White. p-value 0.12 не означает 12-процентную вероятность убытка стратегии. Оно означает, что при указанном bootstrap и построении нулевой гипотезы максимум такого размера встречается достаточно часто, чтобы не отклонять гипотезу на выбранном уровне. Выборочные средние также не показывают, является ли доходность экономически значимой после учета риска, емкости и исполнения.

Интерпретируйте скорректированное p-value как свидетельство о заданной группе

Низкое p-value Reality Check служит свидетельством против утверждения, что ни один кандидат из включенной группы не превосходит выбранный бенчмарк по ожидаемой доходности, при предположениях теста. Поскольку нулевая гипотеза совместная, тест сам по себе не указывает кандидата с устойчивым преимуществом. Победитель может меняться от выборки к выборке, а свидетельства для одной стратегии могут быть слабыми, даже если гипотеза для всей группы отвергнута.

Высокое p-value означает, что гипотеза не отвергнута, а не то, что все стратегии эквивалентны бенчмарку. Причиной могут быть короткая выборка, шумные результаты, слишком широкая группа, неточные измерения или низкая мощность теста. p-value также не является вероятностью истинности нулевой гипотезы. Это хвостовая вероятность для эталонного распределения, зависящего от набора кандидатов, метрики результатов, бенчмарка, схемы bootstrap и наблюдаемых данных.

White рассматривает относительное превосходство. Правило может превзойти слабый бенчмарк, но все равно терять деньги; стратегия может не дотянуть до сильного бенчмарка, но иметь положительную доходность. Показывайте абсолютные и относительные результаты вместе с неопределенностью, оборотом, просадкой, емкостью и реалистичными расходами. Статистическое свидетельство относительного прогнозного превосходства и экономическая привлекательность инвестиций — разные выводы.

Проверьте предположения и ограничения, прежде чем полагаться на результат

Исходная теория опирается на условия регулярности для процесса разностей доходности и его предельного распределения. Постановка White включает стационарные временные ряды с сильным перемешиванием; зависимый bootstrap также требует подходящей последовательности длин блоков. На конечных выборках смены рыночных режимов, структурные сдвиги, долговременная зависимость, редкие скачки и нестабильная волатильность могут сделать стационарную аппроксимацию сомнительной. Блочный bootstrap сохраняет часть локальной зависимости, но не воспроизводит неизвестный будущий режим.

Тест наследует ошибки исходных данных и оценки стратегии. Утечка будущей информации, систематическая ошибка выживших, пересмотренные данные, нереалистичное исполнение, пропущенные расходы, неправильный учет корпоративных действий и бенчмарк, выбранный после просмотра результатов, могут обесценить разности доходности. Если периоды удержания пересекаются, доходности могут быть зависимыми по построению; единица ресэмплинга и длина блока должны отражать это. Если итоговая метрика нелинейна, например коэффициент Шарпа, пересчитывайте ее в каждой репликации, а не предполагайте, что bootstrap среднего дохода автоматически проверяет ее.

Реализации Reality Check могут быть консервативными, особенно когда в большой группе много явно слабых альтернатив. Широкое распределение максимума затрудняет отклонение гипотезы даже при наличии хорошего кандидата. Тест Superior Predictive Ability Хансена — родственный bootstrap-метод с другим подходом к слабым альтернативам; он не является универсальной заменой, и его предположения тоже требуют проверки. Сравнивайте методы с учетом исследовательского вопроса и сообщайте чувствительность результатов, а не выбирайте процедуру, дающую желаемый ответ.

Используйте его вместе с хронологической проверкой и другими методами отбора

White’s Reality Check отвечает на вопрос, содержит ли зарегистрированная поисковая группа кандидата, превосходящего бенчмарк относительно него, после учета отбора. Он не заменяет хронологическую отложенную выборку или walk-forward-оценку зафиксированной стратегии. Он также сам по себе не устраняет перекрытие меток или утечку данных. В отличие от него, PBO суммирует, как часто внутривыборочный победитель оказывается ниже медианы кандидатов в комбинаторных разбиениях; оригинальная статья PBO формализует эту диагностику риска отбора. Процедуры false discovery оценивают ожидаемую долю ложных результатов среди нескольких отклонений. Deflated Sharpe Ratio, напротив, корректирует проверку значимости на основе Sharpe с учетом отбора и ненормальных доходностей. Читайте также руководства о множественном тестировании и доле ложных открытий в финансах, PBO и CSCV, walk-forward-валидации и purged cross-validation с embargo.

На практике сначала фиксируют бенчмарк и метрику результата, восстанавливают фактическую группу кандидатов, считают парные разности по каждому периоду, выбирают и обосновывают ресэмплинг, учитывающий зависимости, и сообщают статистику максимума с bootstrap-хвостовой вероятностью. Затем зафиксированный процесс отбора проверяют на более поздних хронологических данных, отдельно оценивая расходы и возможность исполнения. Применение Sullivan, Timmermann и White к правилам технической торговли показывает, почему важен весь набор правил: вывод может измениться, если учитывать полный поиск, а не только опубликованного победителя. Reality Check корректирует конкретную проблему отбора, но не подтверждает, что бэктест выдержит торговлю в реальном времени.

Частые вопросы

Q1Что проверяет White’s Reality Check?

Он проверяет, превосходит ли лучший кандидат из заданной поисковой группы выбранный бенчмарк по ожидаемому результату с учетом отбора среди кандидатов.

Q2Доказывает ли низкое p-value Reality Check, что стратегия будет прибыльной?

Нет. Это свидетельство против групповой нулевой гипотезы об отсутствии превосходства при выбранных бенчмарке, метрике, данных и предположениях bootstrap. Оно не гарантирует будущую доходность или чистую прибыль.

Q3Зачем использовать блочный bootstrap вместо независимой выборки отдельных дней?

Блоки могут сохранять часть локальной серийной зависимости, а общие даты для всех кандидатов сохраняют их одновременные связи. Схема блоков всё равно должна соответствовать данным и исследовательскому вопросу.

Источники и дополнительное чтение

Сообщить о проблеме

Мы подготовим письмо со ссылкой на эту статью. Mark получит сообщение только после отправки

Быстрая проверка

Прочитали руководство? Проверьте себя в 3 вопросах

Вопрос 1 / 3

Вопрос 01

Что утверждает совместная нулевая гипотеза White?

Выберите ответ, чтобы увидеть объяснение

Словарь опционов

Понятные определения ключевых терминов — от коллов, путов и опционной цепочки до подразумеваемой волатильности, греков и бид-аск спреда

Открыть словарь опционов
Как часто лидер бэктеста оказывается ниже медианы группыВероятность переобучения бэктеста (PBO) и CSCVУзнайте, как комбинаторная симметричная перекрёстная проверка оценивает PBO, превращает ранги OOS в логиты и почему это не прогноз будущих убытковКоличественные исследованияDeflated Sharpe Ratio: множественные проверки и выбор бэктестаУзнайте, как Deflated Sharpe Ratio корректирует статистические свидетельства Sharpe после выбора стратегии с учетом множественных проверок и ненормальных доходностей; в статье есть условный пример и четкие ограничения.Выберите историю, на которой обучается финансовая модельРасширяющиеся и скользящие окна в walk-forward-валидацииСравните расширяющиеся и скользящие окна обучения фиксированной длины, отделите валидацию от финального теста и выбирайте правила без будущих результатов.Проверка моделей на финансовых временных рядахPurged cross-validation и embargo: как предотвратить утечку меток в торговых моделяхУзнайте, как исключать пересекающиеся интервалы будущей доходности и чем различаются purging, embargo, walk-forward, TimeSeriesSplit и CPCV.Оценка направленных прогнозовТест Песарана—Тиммерманна: содержит ли прогноз информацию о направлении?Узнайте, как тест Песарана—Тиммерманна сравнивает совпадения направлений с базовым уровнем, рассчитанным по долям фактических и прогнозируемых повышений, и почему серийная зависимость меняет выводы.