Skip to content
Все руководства по опционам и фьючерсам
Оценка направленных прогнозов13 минут чтения

Тест Песарана—Тиммерманна: содержит ли прогноз информацию о направлении?

Узнайте, как тест Песарана—Тиммерманна сравнивает совпадения направлений с базовым уровнем, рассчитанным по долям фактических и прогнозируемых повышений, и почему серийная зависимость меняет выводы.

В этом руководствеДоля верных ответов 64% может быть слабой или полезной — всё зависит от базового уровня

Краткое резюме

Тест Песарана—Тиммерманна (PT) проверяет, содержит ли прогноз информацию о направлении движения результата. Для бинарного прогноза «вверх/вниз» он сопоставляет наблюдаемую долю верных направлений с долей совпадений, ожидаемой исходя из отдельных долей фактических и прогнозируемых повышений. Этот базовый уровень не обязательно равен 50%. Обычный тест также опирается на предположения о зависимости между моментами прогноза, а статистическая значимость сама по себе не доказывает прибыльность торгового правила.

Доля верных ответов 64% может быть слабой или полезной — всё зависит от базового уровня

Предположим, что рынок рос в 60% дат оценочной выборки. Прогнозист указывает «вверх» в 70% случаев. Даже если прогнозы и результаты не связаны, они будут довольно часто совпадать: в некоторые даты оба укажут на рост, а в другие — на снижение. Простое сравнение доли верных ответов с 50% игнорировало бы этот дисбаланс.

Подход PT явно учитывает это. Он проверяет, совпадают ли направление прогноза и фактическое направление чаще, чем следовало бы ожидать лишь из их отдельных частот при независимости. Это тест направленной прогнозной информации, а не оценка размера доходности, момента сделки или ценности стратегии в целом. Песаран и Тиммерманн предложили тест прогнозных характеристик на основе таблиц сопряженности; в бинарном случае 2×2 их тест асимптотически эквивалентен проверке независимости {source:pesaranTimmermannDirectionalTests1992}.

Сведите каждый соответствующий прогноз и результат в таблицу 2×2

Пусть \(Y_t=1\), если фактический результат классифицирован как рост, и \(Y_t=0\), если как снижение. Пусть \(Z_t=1\), когда прогноз указывает на рост, и \(Z_t=0\), когда он указывает на снижение. Каждая строка оценки должна связывать прогноз, сделанный в момент \(t\), с результатом за горизонт, который этот прогноз должен был предсказать.

В четырех ячейках подсчитываются пары «рост/рост», «рост/снижение», «снижение/рост» и «снижение/снижение». Если \(n_{11}\) и \(n_{00}\) — две ячейки совпадений, а \(n\) — число пригодных сопоставленных пар, наблюдаемая доля верных направлений равна

\[ \widehat{P}=\frac{n_{11}+n_{00}}{n}. \]

Это бинарная схема. Заранее решите, как учитывать нулевую доходность, нулевой прогноз или нейтральный диапазон. Например, в исследовании доходность не выше нуля можно классифицировать как «не рост», а прогноз не выше заданного порога — как «не рост». Исключение равенств — еще один вариант, но оно меняет выборку и должно применяться последовательно. Не считайте сочетание «ноль/ноль» третьим видом совпадения, одновременно используя формулу базового уровня для двух категорий.

Момент прогноза и целевой горизонт тоже должны совпадать. Если \(Z_t\) предсказывает знак доходности за следующие пять торговых сессий, то \(Y_t\) должен обозначать ту же доходность за пять сессий от того же момента, а не доходность за одну сессию до следующего дня. Иначе в таблицу попадут разные события. Ежедневные прогнозы для перекрывающихся пятидневных результатов можно свести в описательную таблицу, но они создают проблему зависимости, о которой речь пойдет ниже.

Рассчитайте базовый уровень независимости по обеим долям повышений

Пусть \(\hat p_y\) — выборочная доля фактических результатов, классифицированных как рост, а \(\hat p_z\) — выборочная доля прогнозов роста. Если бы фактические и прогнозируемые метки были независимы, ожидаемая доля совпадений составила бы

\[ \widehat{P}^{*}=\hat p_y\hat p_z+(1-\hat p_y)(1-\hat p_z). \]

Первое произведение — вероятность совпадения «рост/рост» при независимости, второе — вероятность совпадения «снижение/снижение». Поэтому базовый уровень зависит от обеих маргинальных долей. Он может быть как выше, так и ниже 50%. Прогноз, который всегда выбирает наиболее частое направление, может показать вполне приличную долю верных ответов, не добавляя полезной информации.

Это особенно заметно в крайнем случае. Если классификатор каждый раз говорит «вверх», то \(\hat p_z=1\), наблюдаемая доля верных направлений равна доле фактических повышений \(\hat p_y\), и базовый уровень независимости тоже равен \(\hat p_y\). Избыточное совпадение по построению равно нулю. Такой постоянный прогноз может выглядеть точным, когда повышения часты, но он не различает даты, в которые рынок вырастет; оцененная дисперсия также может выродиться, и обычное p-значение PT может быть неопределенным.

Рассмотрим 100 гипотетических сопоставленных дат. Фактический результат был положительным в 60 случаях, а прогноз указывал на рост 70 раз. Пусть таблица выглядит так:

Фактическое направлениеПрогноз ростаПрогноз сниженияВсего
Рост471360
Снижение231740
Всего7030100

Всего совпадений 64, поэтому \(\widehat P=0.64\). Базовый уровень независимости равен \(0.60\times0.70+0.40\times0.30=0.54\). Наблюдаемая доля верных направлений на 10 процентных пунктов выше этого уровня. Эти вымышленные числа иллюстрируют расчет; сама разница не является ни корректной оценкой неопределенности, ни доказательством практической торговой пользы.

Масштабируйте разницу долей верных ответов на оцененную неопределенность

Для стандартной бинарной статистики PT зададим

\[ \widehat v=\frac{\widehat P^{*}(1-\widehat P^{*})}{n} \]

и

\[ \widehat w=\frac{(2\hat p_y-1)^2\hat p_z(1-\hat p_z)+(2\hat p_z-1)^2\hat p_y(1-\hat p_y)}{n}. \]

Тогда

\[ PT=\frac{\widehat P-\widehat P^{*}}{\sqrt{\widehat v-\widehat w}}. \]

При нулевой гипотезе и стандартных предположениях для больших выборок статистику сопоставляют с асимптотическим стандартным нормальным распределением. Числитель — превышение доли совпадений над базовым уровнем независимости. Знаменатель учитывает, что базовый уровень оценен по той же выборке, а не задан как фиксированная цель 50%. Формула и обозначения приведены в документации реализации statsmodels {source:statsmodelsPesaranTimmermannAPI}.

Выражение выше — ведущая асимптотическая форма дисперсии, документированная statsmodels. В более полной дельта-формуле для конечной выборки из исходной работы к \(\widehat w\) добавляется член \(4\hat p_y\hat p_z(1-\hat p_y)(1-\hat p_z)/n^2\). Этот член более высокого порядка не меняет асимптотику первого порядка, но может сдвинуть статистику в конечной выборке. Если результаты зависят от реализации, укажите использованную формулу и версию программного обеспечения, а не сравнивайте p-значения так, словно все пакеты выполняют идентичные вычисления для конечной выборки.

Формула не исправляет слабый дизайн. При очень малой выборке, почти неизменных прогнозах, пустых ячейках или нулевой либо некорректной оцененной дисперсии обычное приближение может быть ненадежным или неопределенным. В таких случаях не следует любой ценой получать p-значение из этой формулы: представьте маргинальные доли и таблицу и выберите процедуру вывода, соответствующую данным и размеру выборки.

Для приведенной гипотетической таблицы компоненты ведущей формулы равны \(\widehat v=0.54(0.46)/100=0.002484\) и \(\widehat w=[0.2^2(0.7)(0.3)+0.4^2(0.6)(0.4)]/100=0.000468\). Стандартная ошибка равна \(\sqrt{0.002484-0.000468}\approx0.0449\), поэтому \(PT\approx0.10/0.0449=2.23\). Двусторонняя проверка по стандартному нормальному распределению дает приблизительное p-значение 0.026. Это расчет по вымышленным числам с ведущей асимптотической формулой; более полное слагаемое для конечной выборки немного меняет результат, а серийная зависимость может сделать нормальное эталонное распределение неприменимым. Не представляйте этот расчет как эмпирический результат.

Парные стрелки медного и бирюзового цвета в схеме 2×2 показывают совпадение и расхождение фактического и прогнозируемого направлений, а также разные маргинальные доли направлений.
Концептуальная схема; она не отражает эмпирические данные.

Отвергнутая нулевая гипотеза — свидетельство о направлении, а не вердикт о сделке

Положительный числитель означает, что направления совпадали чаще базового уровня независимости; отрицательный — реже. Заранее заданный односторонний тест может проверить, превышает ли доля совпадений базовый уровень. Двусторонний тест спрашивает, отличается ли направленная связь от нуля в любую сторону. Альтернативу и уровень значимости следует выбрать до изучения результатов.

Малое p-значение — свидетельство против указанной нулевой гипотезы при предположениях теста. Это не вероятность истинности нулевой гипотезы и не вероятность того, что прогноз сработает в следующем периоде. Оно не говорит, что доходности были достаточно велики, чтобы покрыть спред, комиссии, рыночное воздействие, финансирование или стоимость займа. Оно также не корректирует поиск по множеству активов, горизонтов, порогов, вариантов модели или знаков прогноза с последующей публикацией только победителя. Если вы отбирали кандидатные стратегии, руководство по White Reality Check объясняет, почему при выводе нужно учитывать отбор.

И наоборот, неотклонение нулевой гипотезы не доказывает независимость направлений. В короткой или несбалансированной выборке может не хватить мощности, чтобы обнаружить связь. Отрицательная статистика PT также не доказывает отсутствие какой-либо структуры: она может указывать на систематическое несовпадение. Если после такого результата изменить знак прогноза, это будет новый выбор модели, который нужно оценить на свежих данных или включить в первоначальную процедуру поиска.

Вместе укажите долю фактических повышений, долю прогнозов роста, наблюдаемую долю верных направлений, базовый уровень независимости, превышение в процентных пунктах, альтернативную гипотезу и метод оценки неопределенности. p-значение без маргинальных итогов таблицы и величины эффекта не позволяет понять, идет ли речь о небольшом, но точно оцененном превышении или о более крупном, но шумном.

Серийная зависимость может сделать стандартное эталонное распределение вводящим в заблуждение

Обычную статистику PT обычно представляют для серийно независимых наблюдений направления. Однако финансовые метки могут образовывать серии. Ежедневные наблюдения могут иметь перекрывающиеся многодневные цели; режимы волатильности могут сохраняться; а скользящие прогнозы могут повторно использовать почти одни и те же данные для оценивания. Тогда \(n\) пар — это не \(n\) независимых порций информации. Стандартная ошибка может оказаться слишком малой, и нулевая гипотеза будет отвергаться слишком часто.

Позднее Песаран и Тиммерманн разработали тесты зависимости между серийно коррелированными многокатегориальными переменными с помощью динамически расширенных регрессий и модели марковского порядка {source:pesaranTimmermannSerialCategories2009}. Исследования направленных прогнозов также показывают, что обычные процедуры PT, основанные на независимости, могут слишком часто отвергать нулевую гипотезу при серийной корреляции, и рассматривают устойчивые к зависимости альтернативы, включая бутстрэп {source:blaskowitzHerwartzDirectionalSerialCorrelation2014}. Подходящий метод зависит от способа построения прогнозов, горизонта и структуры зависимости; произвольная схема повторной выборки не становится корректной автоматически.

Укажите, перекрываются ли моменты выпуска прогнозов, каковы интервалы между ними и какой метод учета зависимости используется для оценки неопределенности. Если вы приводите стандартную статистику как описательный ориентир, обозначьте предположение независимости. Не трактуйте номинальный результат на уровне 5% так, будто фактическая частота ложных отклонений тоже равна 5%, если дизайн нарушает это предположение.

Стройте оценку на прогнозах, которые действительно можно было сделать

Для каждого момента сохраните прогноз именно в том виде, в каком он был доступен тогда, его горизонт, временную границу доступной информации, фактический результат и правило перевода каждого значения в метку «вверх/вниз». До составления таблицы согласуйте временные метки, инструменты, определение цены или доходности и обработку пропусков. Прогноз на пересмотренных макроэкономических данных или сигнал, настроенный по оценочному периоду, уже нельзя считать нетронутым прогнозом вне выборки.

Задайте порог классификации до просмотра результатов на контрольной выборке. Если модель выдает вероятность, порог переводит ее в бинарное направление; поиск порога на той же выборке меняет исследовательский вопрос и создает смещение отбора. Разделяйте роли обучающей, валидационной и итоговой выборок; при повторной выборке, учитывающей поиск модели, заново выполняйте всю процедуру отбора.

Вопрос PT отличается от сравнения величин ошибок прогноза. Руководство по Diebold–Mariano сравнивает парные разности потерь, а Giacomini–White проверяет, меняется ли относительная прогнозная способность в зависимости от заранее заданной информации. Для вложенных прогнозных моделей см. руководство по поправке Clark–West. Эти тесты отвечают на разные вопросы, и их не следует подменять друг другом только потому, что они выдают знакомые статистики.

Значимость направленного прогноза не доказывает прибыльность стратегии

Тест PT сводит каждый результат к метке направления. Рост на один тик и сильное ралли оба считаются ростом; небольшой промах и большой убыток одинаково считаются ошибкой направления. Поэтому доля верных ответов может повыситься, но стратегия всё равно понесет убытки, если ошибки крупнее удачных сделок, сигнал появляется после движения цены или торговые издержки съедают преимущество.

Например, представим 100 гипотетических сделок одинакового размера: 64 верных прогноза направления приносят в среднем по 0,10%, а 36 неверных теряют в среднем по 0,25%. Простая сумма без учета сложного процента и издержек равна \(64(0.10\%)-36(0.25\%)=-2.6\) процентного пункта, несмотря на долю верных направлений 64%. Это намеренно упрощенный расчет, который игнорирует сложный процент, и он не является рыночными данными; он показывает, почему одной доли верных ответов недостаточно для определения математического ожидания.

Для оценки сделки до расчета доходности задайте время входа и выхода, размер позиции, лимиты риска и порядок учета неисполненных заявок. При необходимости включите спред между ценами покупки и продажи, комиссии, проскальзывание, рыночное воздействие, финансирование и расходы конкретной площадки. Сравните чистую доходность вне выборки с подходящим ориентиром и учтите тот же поиск по множественным вариантам, который породил правило. Результат PT может быть одним из свидетельств направленной связи, но не заменяет такой оценки с учетом исполнимости и издержек.

Частые вопросы

Q1Сравнивает ли тест Песарана—Тиммерманна точность с 50%?

Нет. Он сравнивает наблюдаемое совпадение с базовым уровнем независимости, рассчитанным по отдельным долям фактических и прогнозируемых повышений. Этот уровень может быть как выше, так и ниже 50%.

Q2Можно ли использовать обычное p-значение PT, если горизонты прогнозов перекрываются?

Не без учета зависимости. Перекрывающиеся цели и устойчивые метки могут занижать стандартную оценку неопределенности, основанную на независимости. Используйте метод, предположения которого соответствуют горизонту прогноза и структуре зависимости.

Q3Означает ли значимый результат PT, что торговая стратегия прибыльна?

Нет. Тест использует метки направления и не измеряет размер движения, цены входа и выхода, размер позиции, комиссии, проскальзывание или финансирование. Чистую доходность вне выборки нужно оценивать отдельно.

Источники и дополнительное чтение

Сообщить о проблеме

Мы подготовим письмо со ссылкой на эту статью. Mark получит сообщение только после отправки

Быстрая проверка

Прочитали руководство? Проверьте себя в 3 вопросах

Вопрос 1 / 3

Вопрос 01

Если фактический результат растет в 60% случаев, а прогноз указывает на рост в 70% случаев, каков базовый уровень совпадения при независимости?

Выберите ответ, чтобы увидеть объяснение

Словарь опционов

Понятные определения ключевых терминов — от коллов, путов и опционной цепочки до подразумеваемой волатильности, греков и бид-аск спреда

Открыть словарь опционов
Оценка прогнозовТест Диболда—Мариано: как сравнить точность прогнозовУзнайте, как тест Диболда—Мариано сравнивает парные потери прогнозов, учитывает перекрывающиеся горизонты и почему низкое p-значение не доказывает торговое мастерство.Проверка прогнозовТест Джакомини—Уайта: условная точность прогнозаУзнайте, как тест Джакомини—Уайта проверяет зависимость качества прогноза от известных условий, как выбирать инструменты и какие выводы допускает результатСравнение вложенных прогнозовТест Кларка—Уэста для вложенных прогнозов: формула, пример и ограниченияУзнайте, зачем корректировать сравнение MSPE вложенных прогнозных моделей, как работает тест Кларка—Уэста и чего не доказывает односторонний результат.Зачем проверять победителя поиска стратегий на уровне всей группыWhite’s Reality Check против data snooping в бэктестах стратегийУзнайте, как White’s Reality Check сравнивает лучшую стратегию из поиска с бенчмарком и учитывает максимум bootstrap-распределения с зависимостямиСравнение прогнозных моделейModel Confidence Set (MCS): сравнение прогнозных моделей без навязанного победителяУзнайте, как Model Confidence Set применяет последовательные тесты и бутстрэп для зависимых данных, чтобы сохранить прогнозные модели, которые имеющиеся данные не позволяют различить.