Reality Check Уайта и тест SPA Хансена для торговых правил
Сравните Reality Check и SPA для семейства найденных торговых правил: глобальная нулевая гипотеза, бутстрэп-механика и ограничения интерпретации.
В этом руководствеПочему нельзя проверять только победителя бэктеста
Краткое резюме
Reality Check Уайта (RC) и тест SPA Хансена (Superior Predictive Ability) проверяют, превосходит ли хотя бы один вариант из исследованного семейства заранее заданный бенчмарк. Оба учитывают выбор лучшего результата по той же выборке, но не подтверждают пригодность конкретного правила и не гарантируют будущую прибыль.
Почему нельзя проверять только победителя бэктеста
Если до просмотра данных вы задали единственную стратегию, обычное сравнение одного кандидата с бенчмарком может соответствовать вопросу. Но если вы попробовали десятки правил, увидели результаты и затем проверили только победителя как будто он был единственным изначально, процедура игнорирует поиск. Даже когда истинного преимущества нет ни у одного правила, максимум среди множества шумных оценок часто оказывается положительным просто потому, что это максимум. Обычный тест для одного заранее выбранного кандидата не учитывает, что выбор уже зависел от той же выборки.
RC и SPA отвечают на вопрос о семействе в целом: есть ли после учёта поиска свидетельства, что хотя бы одна альтернатива имеет более высокое ожидаемое значение выбранной метрики, чем бенчмарк? Кандидатами могут быть технические правила, прогнозные модели или другие стратегии. В статье Уайт предложил проверять, превосходит ли бенчмарк лучшая модель из поиска спецификаций (White, 2000). Салливан, Тиммерманн и Уайт применили эту идею к большому набору технических торговых правил (исследование 1999 года). Важно включать альтернативы, которые участвовали в выборе результата, а не только сохранившегося победителя. Руководство по FDR и множественным проверкам касается связанной, но иной задачи.
Зафиксируйте семейство кандидатов и бенчмарк
Пусть k обозначает правило из проверяемого семейства K, а t — дату, общую для оценки всех правил и бенчмарка. Для сравнения доходностей зададим разность за период так:
d(k,t) = чистая доходность кандидата k − чистая доходность бенчмарка
Положительная разность означает преимущество кандидата. Если сравниваются прогнозные потери, определите разность в обратном порядке: потери бенчмарка минус потери кандидата; тогда положительное значение тоже означает, что кандидат лучше. Знак не должен меняться между правилами и датами. Заранее согласуйте состав кандидатов, даты, бенчмарк, учёт комиссий и само понятие превосходства. Разность средних чистых доходностей сама по себе не измеряет риск-скорректированную доходность или просадку.
Обозначим μ(k)=E[d(k,t)] ожидаемую разность для k-го кандидата. Совместная проверка формулируется так:
H0: max(k∈K) μ(k) ≤ 0 H1: max(k∈K) μ(k) > 0
Это слабая глобальная нулевая гипотеза: ни у одного кандидата нет положительного ожидаемого преимущества, хотя истинные разности отдельных правил могут быть отрицательными. Речь идёт об одной семейной проверке, а не о наборе независимых выводов по каждому правилу.
Reality Check сравнивает максимум по всему семейству
Пусть d̄(k) — средняя разность за n дат оценки. В простом варианте со средними разностями статистика RC имеет вид:
T_RC = max(k∈K) sqrt(n) × d̄(k)
Полученный максимум сравнивают с бутстрэп-распределением, построенным для нулевой гипотезы. Уайт использует наименее благоприятную границу составной гипотезы: при построении нулевого распределения истинная ожидаемая разность каждого кандидата устанавливается в ноль. Отрицательные средние также допустимы при H0, но эта граница рассматривает всё семейство как равное бенчмарку и тем самым может быть консервативной. Если в семье много явно слабых вариантов, критическое значение способно вырасти и тесту станет труднее отвергнуть H0. В формуле RC максимум берётся без дополнительного усечения снизу по нулю.
Именно семейный максимум отличает этот вопрос от проверки одной выбранной стратегии. Нужно узнать, насколько необычен максимум после того, как такой же поиск выполнен по всему зарегистрированному семейству. Сравнение только победителя с эталонным распределением одного заранее заданного правила пропускает эффект выбора.
SPA стандартизирует статистику и зависит от данных при построении нулевого распределения
SPA Хансена сохраняет семейную нулевую гипотезу и бенчмарк-относительные разности, но изменяет статистику и построение распределения. Статистика записывается в виде:
T_SPA = max(0, max(k∈K) sqrt(n) × d̄(k) / ω̂(k))
Величина ω̂(k) оценивает долгосрочное стандартное отклонение величины √n d̄(k). Стандартизация приводит кандидатов с разной вариативностью к единицам неопределённости среднего, вместо прямого сравнения сырых разностей. Внешний максимум с нулём не позволяет итоговой SPA-статистике стать отрицательной. Это отличается от записанной выше статистики RC без усечения.
Второе отличие — зависимое от выборки нулевое распределение. В согласованном варианте достаточно сильно отрицательные наблюдаемые средние сохраняются как отрицательные при построении нулевого распределения; варианты, которые данные считают правдоподобно близкими к границе, центрируются в нуле. SPA не просто удаляет проигравшие правила из проверяемого семейства. Такой подход призван ослабить влияние явно плохих альтернатив на критическое распределение по сравнению с предположением RC, что все истинные разности равны нулю. Хансен сообщает, что студентизация и выборочное центрирование могут повысить мощность и уменьшить чувствительность к плохим альтернативам (Hansen, 2005). Однако SPA не превосходит RC равномерно при любых данных и условиях.
Повторно выбирайте временные векторы кандидатов совместно
Доходности разных правил за один день часто связаны общим движением рынка. Кроме того, временной ряд каждой стратегии может быть зависимым от соседних периодов. Если отдельно повторно выбирать строки для каждого кандидата, изменится их одновременная ковариация, а вместе с ней и распределение максимума. Поэтому в каждом периоде рассматривают вектор d_t=(d(1,t),…,d(K,t)) и применяют к его столбцам одни и те же временные индексы или последовательность блоков.
Блоки позволяют частично сохранять временную структуру. Например, стационарный бутстрэп формирует псевдоряд из блоков случайной геометрической длины; исходная работа Политиса и Романо рассматривает вывод для стационарных слабо зависимых наблюдений (Politis и Romano, 1994). Никакой способ повторной выборки не гарантирует подходящую модель зависимости для любого рынка. Требуются условия устойчивости процесса и достаточно слабой зависимости. Структурный сдвиг или смена режима не исчезнут от того, что ряд разбили на блоки. Руководство по блочному бутстрэпу подробнее разбирает его механику для заранее фиксированной статистики.

Пример с 240 правилами — только арифметическая иллюстрация
Предположим исключительно для подсчёта, что исследователь перебирает 12 периодов lookback, 4 фильтра входа и 5 вариантов выхода. Полная сетка содержит 12×4×5=240 сочетаний. Если каждое сочетание оценено на одних датах и при одинаковом учёте расходов, для каждого правила можно вычислить чистую доходность и вычесть доходность одного заранее заданного бенчмарка, например стратегии «купить и держать». Проверяемый максимум строится по всем 240 кандидатам, если именно весь этот набор участвовал в поиске.
Число 240 не описывает реальный результат исследования. Здесь нет выдуманных доходностей, p-значений или утверждения, что какое-либо правило выиграло. В реальном проекте фактическое семейство может включать дополнительно опробованные рынки, частоты, интервалы удержания, фильтры, определения затрат, варианты бенчмарка или периоды. Если решение о победителе зависело и от них, их нельзя молча исключать из записи поиска.
Также нужно до просмотра результатов определить, что означает «лучше». Средняя чистая доходность отвечает только на этот вопрос и не означает автоматически, что стратегия лучше по волатильности, просадке или полезности. Должны совпадать календарь наблюдений, правила исполнения и издержки: сравнение при разных предположениях о комиссиях или проскальзывании способно отражать не преимущество стратегии, а различие расчётов.
Не путайте FDR и интервал для фиксированной статистики с RC/SPA
Процедура FDR, например Benjamini–Hochberg, корректирует набор индивидуальных p-значений и при своих предпосылках контролирует ожидаемую долю ложных открытий среди отклонённых гипотез. RC и SPA задают один глобальный тест максимума относительно бенчмарка. Методы связаны с множественными проверками, но не взаимозаменяемы. Руководство по многократному тестированию и FDR объясняет контроль FDR отдельно.
Доверительный интервал блочного бутстрэпа обычно строят для одной заранее выбранной статистики — например средней доходности или коэффициента Шарпа фиксированного правила. Он описывает выборочную неопределённость этой величины. Если правило выбрано из большого набора после просмотра результатов, интервал сам по себе не исправляет выбор победителя. RC и SPA на каждом повторе заново рассматривают максимум по всему семейству, используя распределение, построенное под соответствующей нулевой гипотезой. Блоки — способ учитывать временную зависимость при создании распределения, но слово «бутстрэп» само по себе не означает коррекцию поиска.
Purged cross-validation решает другую задачу: уменьшает временную утечку информации между обучающими и тестовыми наблюдениями при разбиении упорядоченных по времени данных. Она не проверяет, превышает ли максимум семейства правил бенчмарк, — это глобальный вопрос RC/SPA. Руководство по purged CV и embargo отдельно объясняет такую временную защиту.
Отклонение гипотезы не определяет победителя и не обещает прибыль
Если RC или SPA отвергает глобальную H0, вывод ограничен заданным семейством, бенчмарком, выборочным периодом, метрикой, конструкцией нулевого распределения и предпосылками теста. Есть статистическое свидетельство, что хотя бы один кандидат превосходит бенчмарк по указанному критерию. Это не показывает, какой именно кандидат истинно лучше, не подтверждает индивидуальную значимость выбранного правила и не означает, что все остальные правила тоже выиграли. Если H0 не отклонена, это не доказательство равенства или бесполезности каждого кандидата; данных и метода может быть недостаточно для такого вывода.
Ни один тест не является прогнозом будущей доходности или гарантией положительного результата после запуска. Неполная запись экспериментов, утечка информации, смещение выживших, нереалистичные комиссии, рыночный импакт и нестационарность остаются отдельными проблемами. Кроме того, повторное изменение семейства после просмотра результата меняет вопрос, который был формально проверен. Отдельное подтверждение на действительно неиспользованных датах полезно, но и оно не гарантирует перенос результатов на новые рыночные режимы.
Документируйте процедуру, чтобы результат можно было воспроизвести
В отчёте укажите бенчмарк, полный набор кандидатов и происхождение вариантов, даты и частоту наблюдений, формулу чистой доходности или потерь, комиссионные и другие расходы, выбранную статистику, название теста и p-значение. Для SPA следует назвать вариант реализации и тип сообщаемого p-значения. Также опишите способ повторной выборки, структуру и длину блоков или ожидаемую длину, число повторов и центрирование под H0.
Зафиксируйте, какие параметры, рынки, фильтры, горизонты и предположения о затратах просматривали до того, как выбрали победителя. Если проверку проводят только для сокращённого списка, объясните, как он был выбран и какие данные при этом уже использовались. Такая запись позволяет понять, соответствует ли тест фактическому процессу отбора. Результат RC или SPA остаётся условным статистическим свидетельством для заданных данных и допущений; он не заменяет отдельную оценку исполнения и дальнейшее наблюдение за стратегией.
Частые вопросы
Q1SPA всегда лучше Reality Check?
Нет. Студентизация и выборочное центрирование SPA могут уменьшить влияние слабых альтернатив и повысить мощность. Однако эти методы не дают SPA равномерного преимущества при любых данных и предположениях.
Q2Показывает ли значимый результат SPA, какое правило выбрать?
Нет. Результат говорит о семейном превосходстве хотя бы одного кандидата при указанном критерии. Для выбора конкретного правила нужны подходящие отдельные процедуры и проверка на данных, не использованных для отбора.
Q3Можно ли убрать проигравшие варианты из семейства?
Если вы пробовали их до выбора победителя, исключение может занизить фактический объём поиска. Определите и документируйте полный релевантный набор до интерпретации корректированного результата. Основные исследования - White, “A Reality Check for Data Snooping” (2000) - Hansen, “A Test for Superior Predictive Ability” (2005) - Sullivan, Timmermann, and White, “Data-Snooping, Technical Trading Rule Performance, and the Bootstrap” (1999) - Politis and Romano, “The Stationary Bootstrap” (1994)
Источники и дополнительное чтение
Сообщить о проблеме
Мы подготовим письмо со ссылкой на эту статью. Mark получит сообщение только после отправки
Быстрая проверка
Прочитали руководство? Проверьте себя в 3 вопросах
Вопрос 01
Что утверждает глобальная нулевая гипотеза RC и SPA?
Выберите ответ, чтобы увидеть объяснение
Словарь опционов
The probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
Читать подробное руководствоназначение опционаПроцесс, при котором после уведомления об исполнении обязанность выполнить контракт распределяется на продавца опциона и может создать поставку или покупку акций.
Читать подробное руководство