Skip to content
Все руководства по опционам и фьючерсам
Как часто лидер бэктеста оказывается ниже медианы группы14 мин чтения

Вероятность переобучения бэктеста (PBO) и CSCV

Узнайте, как комбинаторная симметричная перекрёстная проверка оценивает PBO, превращает ранги OOS в логиты и почему это не прогноз будущих убытков

В этом руководствеPBO измеряет процесс отбора, а не отдельную стратегию

Краткое резюме

Вероятность переобучения бэктеста (PBO) показывает, как часто стратегия, выбранная лучшей внутри выборки (IS), занимает вне выборки (OOS) место ниже медианы набора кандидатов. Комбинаторная симметричная перекрёстная проверка (CSCV) оценивает эту долю, многократно отдавая половину равных временных блоков на отбор, а вторую половину — на оценку. PBO — это условная диагностика для заданного поиска, метрики и исторической матрицы результатов. Это не вероятность того, что работающая стратегия потеряет деньги.

PBO измеряет процесс отбора, а не отдельную стратегию

Исследовательская группа может проверять разные окна истории, пороги входа, периоды удержания, наборы инструментов, издержки и ограничения портфеля, а затем оставить вариант с максимальным результатом бэктеста. У выбранного результата было много возможностей подстроиться под особенности выборки. PBO обобщает одно из последствий такого поиска: в заданных разбиениях IS/OOS как часто победитель IS оказывается ниже медианы тех же кандидатов в OOS?

Bailey, Borwein, López de Prado и Zhu предложили PBO как способ оценивать риск отбора стратегий и описали CSCV как один из методов оценки. Определение относится к процедуре выбора среди проверенных конфигураций, а не только к числу параметров одной прогнозной модели. Для каждого разбиения IS — это подмножество, по которому выбирают кандидата; оно не обязано совпадать с периодом оценки всех базовых моделей. Формальная постановка приведена в исходной статье о PBO.

Стратегия может показывать высокий коэффициент Шарпа на всей выборке и при этом быть лишь самым удачливым вариантом в слабом семействе исследований. И наоборот, отбор может часто находить кандидата выше медианы OOS, даже если доходность всех кандидатов отрицательна. PBO сравнивает относительные ранги внутри переданного набора и сама по себе не проверяет, положительна ли ожидаемая доходность.

PBO отвечает на другой вопрос, чем другие методы проверки

Хронологический holdout или walk-forward-тест показывает, как заданный исследовательский процесс сработал бы на более поздних наблюдениях, не использованных в предыдущих решениях. Purged cross-validation устраняет пересечение интервалов обучающих меток и тестовых результатов; embargo может добавить отдельно обоснованный буфер. Ни одна из этих мер сама по себе не оценивает, как часто победитель широкого поиска стратегий падает ниже медианы кандидатов OOS. См. руководство по purged cross-validation и embargo.

PBO также отличается от поправки на множественное тестирование. Reality Check Уайта использует bootstrap, чтобы проверить, превосходит ли лучшее правило в семействе бенчмарк с учётом подглядывания в данные. Deflated Sharpe Ratio корректирует расчёт значимости на основе Шарпа с учётом эффекта отбора и ненормального распределения доходности. PBO же суммирует ранг OOS кандидата, выбранного в IS, по разбиениям. У методов разные статистики и предположения, поэтому они не заменяют друг друга автоматически. См. исходную статью Уайта о Reality Check и работу Bailey и López de Prado о Deflated Sharpe Ratio.

Начните с полной синхронизированной матрицы результатов

Пусть M — матрица размера T на N. Каждый из N столбцов соответствует стратегии или конфигурации-кандидату, а каждая из T строк — одному и тому же интервалу наблюдения для всех кандидатов. В строке может быть дневная доходность после нужных торговых издержек. Если частота торговли различается, сначала задайте общую временную шкалу и одинаково агрегируйте результаты. Сравнение дневной доходности одной стратегии с месячными итогами другой по строкам не создаёт содержательной матрицы.

Набор кандидатов должен отражать реальные возможности отбора: варианты, отброшенные при grid search, ручные изменения после просмотра результатов, альтернативные универсумы и правила, повлиявшие на итоговый выбор. PBO оценивает лишь переданных кандидатов и их историю доходности. Если после гораздо более широкого поиска записаны только финалисты, оценка занижает фактический масштаб перебора.

Используйте для всех одну конвенцию доходности, валюту, учёт плеча и критерий качества. Если отбор основан на чистом коэффициенте Шарпа, включите в каждый столбец нужные комиссии, спреды, финансирование, funding, стоимость займа и предположения об исполнении до его расчёта. Метрика должна вычисляться и на последующих подвыборках. Исходная статья требует синхронных строк и метрики, оцениваемой на каждой подвыборке; при разной частоте торговли она рекомендует общий индекс.

CSCV объединяет каждую половину выборки с её дополнением

Выберите чётное число S непересекающихся временных блоков одинакового размера, сохраняя хронологический порядок внутри блока. Для каждого возможного выбора S/2 блоков объедините их в обучающую выборку (IS), а оставшиеся S/2 используйте как тестовую (OOS). Для метрик, зависящих от траектории, сохраните исходный порядок блоков и опишите, что означает их склейка.

Число разбиений IS равно C(S,S/2). Для четырёх блоков A, B, C и D это шесть вариантов: AB, AC, AD, BC, BD и CD; дополнение каждого тоже считается отдельным вариантом. При S = 16 получаем C(16,8) = 12 870. Это детерминированные сочетания одной истории, а не 12 870 независимых рыночных экспериментов.

«Симметричная» означает, что дополнение используется как выборка для отбора в другом сочетании: в одном разбиении AB — IS, CD — OOS, в другом наоборот. «Комбинаторная» означает перебор всех вариантов выбора половины блоков вместо случайного разбиения. Это не хронологическое воспроизведение. В выбранную часть могут попасть ранние и поздние блоки, а в дополнение — средние; поэтому OOS здесь не означает «будущее после обучения».

Временные блоки многократно делятся на половины для обучения и проверки; некоторые победители внутри выборки получают вневыборочный ранг ниже середины
Концептуальная схема симметричных разбиений CSCV и рангов; это не реальные данные и не хронологическая симуляция торговли

Преобразуйте ранг выбранного кандидата в OOS в логит

Для разбиения c примените правило отбора к IS и выберите лучшего кандидата n*(c). Затем оцените всех N кандидатов на дополнительной выборке OOS той же метрикой. Обозначьте r(c) ранг выбранного кандидата в OOS: 1 — худший, N — лучший. Заранее определите обработку равенств и применяйте её неизменно во всех разбиениях.

Преобразуйте ранг в относительный ранг: ω(c) = r(c)/(N+1). Знаменатель N+1 оставляет значение строго между нулём и единицей даже для крайних рангов. Логит равен λ(c) = ln(ω(c)/(1−ω(c))). Он отрицателен ниже медианы OOS, равен нулю на медиане и положителен выше неё. Оценка PBO — доля всех разбиений CSCV, где λ(c) ≤ 0.

Одно значение PBO показывает, как часто победитель IS достигает не выше медианы OOS. Полное распределение логитов дополнительно показывает, остаются ли выбранные кандидаты около середины, часто ли они сильно проваливаются или обычно оказываются выше медианы. Логит — преобразованный относительный ранг, а не вероятность убытка отдельной реальной сделки и не калиброванный прогноз будущей доходности.

Гипотетический пример с четырьмя блоками даёт PBO 66,7%

Предположим, есть четыре равных исторических блока и четыре правила-кандидата R1–R4. В таблице приведены шесть разбиений IS. Ранг OOS показывает место выбранного в IS правила среди четырёх правил на дополнительных блоках. Все значения гипотетические и нужны только для иллюстрации расчёта.

Блоки ISПобедитель ISРанг OOS rОтносительный ранг ω = r/5Логит ln(ω/(1−ω))На медиане или ниже?
ABR110,20−1,386Да
ACR340,80+1,386Нет
ADR220,40−0,405Да
BCR110,20−1,386Да
BDR430,60+0,405Нет
CDR320,40−0,405Да

У четырёх из шести выбранных правил относительный ранг OOS не превышает половины. Эмпирическая PBO равна 4/6 ≈ 0,667, то есть примерно 66,7%. Например, ранг 2 даёт ω = 2/(4+1) = 0,4 и λ = ln(0,4/0,6) ≈ −0,405. Ранг 3 даёт ω = 0,6 и противоположный логит около +0,405.

Это не означает, что вероятность потерять деньги в следующем месяце равна 66,7%. В этой гипотетической матрице и при таком соглашении о ранжировании победитель IS оказался на медиане кандидатов OOS или ниже в четырёх из шести разбиений. У двух остальных победителей также могла быть отрицательная абсолютная доходность OOS, несмотря на превосходство над конкурентами.

Считайте PBO условной диагностикой с ограничениями

PBO зависит от семейства кандидатов, наблюдаемой матрицы результатов, метрики отбора, временных блоков и правила равенства. Незадокументированные эксперименты остаются вне оценки. «Не зависящая от модели» означает, что расчёт можно провести по истории результатов без знания прогнозных уравнений; это не устраняет проектные решения, проблемы качества данных и предположения.

CSCV комбинирует блоки в симметричные подвыборки одинакового размера, но OOS обычно не является одним непрерывным более поздним периодом. Повторная сборка блоков может нарушить долгосрочную зависимость, сезонность или последовательность экономических режимов. S определяет число сочетаний и продолжительность каждого блока; выбирайте и документируйте его с учётом горизонтов и структуры стратегии. Много сочетаний не создаёт столько же независимых наблюдений: одни блоки используются снова.

Статистика наследует смещения исходной доходности. Survivorship bias, пересмотренные данные, признаки, недоступные в тот момент, нереалистичное исполнение, пропущенные издержки или выбранный постфактум универсум могут исказить историю всех кандидатов. CSCV автоматически не удаляет перекрывающиеся интервалы меток, не переоценивает каждую модельную цепочку в каждом разбиении и не предотвращает утечку данных при предобработке. Эти меры нужно явно реализовать в соответствии с исследовательским вопросом. Для защиты хронологии см. официальную документацию TimeSeriesSplit и руководство по purged-валидации.

Метрики, зависящие от траектории, например максимальная просадка, требуют отдельной осторожности: склейка несмежных блоков меняет траекторию и, возможно, метрику. В статье о PBO отмечено, что для некоторых показателей порядок наблюдений важен, в отличие от коэффициента Шарпа. До интерпретации ранга объясните обработку порядка, пропусков между блоками, отсутствующих наблюдений и капитализации.

Представляйте PBO вместе с хронологическими данными и полным журналом поиска

До расчёта сохраните реестр кандидатов, каждое изменение после просмотра результатов, матрицу доходности, метрику отбора и правило равенства. Укажите T, N, S, построение блоков, C(S,S/2), соглашение о ранге OOS, оценку PBO и распределение логитов. Добавьте абсолютную доходность OOS, издержки, оборот, просадки и число убыточных кандидатов: один ранг не показывает, слабы ли все варианты.

Используйте walk-forward или настоящий хронологический holdout, чтобы оценить зафиксированный исследовательский процесс на более поздних данных. Не открывайте финальный период при выборе модели и порогов: повторные проверки превращают его в дополнительную выборку для отбора. Инструменты с временным порядком, например TimeSeriesSplit, создают хронологические фолды согласно своей документации, тогда как PBO измеряет другое ранговое свойство исследованного семейства кандидатов.

Таким образом, PBO дополняет, но не заменяет контроль перекрытия меток, анализ множественного тестирования, реалистичное моделирование исполнения, проспективную оценку и мониторинг в реальном времени. См. также множественное тестирование и долю ложных открытий в финансах и поправки коэффициента Шарпа на серийную корреляцию. Ни одна отдельная статистика не превращает исторический рейтинг в доказательство устойчивого торгового преимущества.

Частые вопросы

Q1Означает ли PBO, что стратегия потеряет деньги с такой вероятностью?

Нет. Она оценивает, как часто кандидат, выбранный в IS, оказывается на медиане OOS или ниже в заданных разбиениях. Это не вероятность будущих убытков и не калиброванный прогноз доходности в реальной торговле.

Q2То же ли CSCV, что и walk-forward-тестирование?

Нет. CSCV сопоставляет каждую выбранную половину блоков с дополнением, поэтому OOS может включать ранние и поздние блоки. Walk-forward сохраняет обучение до каждого последующего тестового периода, чтобы изучить хронологический путь, похожий на внедрение.

Q3Доказывает ли низкий PBO наличие преимущества у выбранной стратегии?

Нет. Победитель может обойти слабую группу и всё равно иметь отрицательный абсолютный результат. Отдельно оценивайте чистую доходность, неопределённость, издержки, утечки и результаты на действительно более поздних данных.

Источники и дополнительное чтение

Сообщить о проблеме

Мы подготовим письмо со ссылкой на эту статью. Mark получит сообщение только после отправки

Быстрая проверка

Прочитали руководство? Проверьте себя в 3 вопросах

Вопрос 1 / 3

Вопрос 01

Какое событие учитывается в оценке PBO?

Выберите ответ, чтобы увидеть объяснение

Словарь опционов

Проверка моделей на финансовых временных рядахPurged cross-validation и embargo: как предотвратить утечку меток в торговых моделяхУзнайте, как исключать пересекающиеся интервалы будущей доходности и чем различаются purging, embargo, walk-forward, TimeSeriesSplit и CPCV.Почему один порог не работает, когда исследователи проверяют множество идейМножественная проверка и доля ложных открытий в финансахРазберитесь во множественных сравнениях, семейной вероятности ошибки, доле ложных открытий, методах Бонферрони, Холма и Бенджамини–Хохберга, зависимости, q-значениях, поиске факторов, отборе бэктестов и управлении исследованиямиКоэффициент Шарпа и годовой пересчётМожно ли умножить месячный коэффициент Шарпа на √12?Разберите условия годового пересчёта месячного коэффициента Шарпа, влияние автокорреляции и поправку Ло на временную агрегацию. В статье есть гипотетический расчёт и список проверок.Оценка направленных прогнозовТест Песарана—Тиммерманна: содержит ли прогноз информацию о направлении?Узнайте, как тест Песарана—Тиммерманна сравнивает совпадения направлений с базовым уровнем, рассчитанным по долям фактических и прогнозируемых повышений, и почему серийная зависимость меняет выводы.Количественные исследованияDeflated Sharpe Ratio: множественные проверки и выбор бэктестаУзнайте, как Deflated Sharpe Ratio корректирует статистические свидетельства Sharpe после выбора стратегии с учетом множественных проверок и ненормальных доходностей; в статье есть условный пример и четкие ограничения.