Тест Кларка—Уэста для вложенных прогнозов: формула, пример и ограничения
Узнайте, зачем корректировать сравнение MSPE вложенных прогнозных моделей, как работает тест Кларка—Уэста и чего не доказывает односторонний результат.
В этом руководствеПочему вложенные прогнозы требуют отдельного сравнения
Краткое резюме
Тест Кларка—Уэста корректирует сравнение квадратов ошибок, если одна прогнозная модель включает более компактную базовую модель. Оценивание дополнительных параметров может добавить шум в прогнозы большой модели, даже когда эти параметры не содержат реальной прогнозной информации. Поправка меняет разность потерь для вывода, но не сами прогнозы и не гарантирует полезность большой модели.
Почему вложенные прогнозы требуют отдельного сравнения
Предположим, ограниченная модель прогнозирует доходность следующего месяца с помощью константы, а большая модель добавляет коэффициент оценки стоимости. Ограниченная модель является частным случаем большой: если положить дополнительный коэффициент равным нулю, получится базовая модель. Даже если истинное значение коэффициента равно нулю, его оценивание может внести выборочный шум в прогнозы большой модели. Поэтому средняя квадратичная ошибка прогноза (MSPE) может оказаться выше, хотя в генеральной совокупности обе модели содержат одинаковую прогнозную информацию.
Поправка Кларка—Уэста учитывает этот шум оценивания при вневыборочном сравнении MSPE вложенных прогнозов. Она проверяет, добавляет ли большая модель прогнозную ценность к ограниченной в такой постановке. Это более узкий вопрос, чем общее сравнение парных потерь в руководстве по тесту Диболда—Мариано; стандартное опорное распределение DM не становится автоматически корректным для вложенных моделей. Кларк и Мак-Кракен изучают иные асимптотические и конечновыборочные свойства тестов вложенных прогнозов, а Кларк и Уэст предлагают скорректированную процедуру MSPE и приближённый вывод. Clark и McCracken (2001)00071-9); Clark и West (2007).
Установите вложенность и сохраните вневыборочную оценку
Ограниченная модель и большая альтернатива должны прогнозировать одну и ту же целевую величину yₜ₊ₕ. Большая модель должна включать ограниченную как частный случай, обычно если приравнять один или несколько дополнительных коэффициентов к нулю. Большее число переменных, сложность или лучшая подгонка внутри выборки сами по себе не устанавливают вложенность.
Для каждого момента прогноза используйте только информацию, доступную тогда. Оцените модели на хронологическом обучающем окне и проверьте прогнозы на более позднем интервале. Совпадать должны цель, горизонт, единицы, даты прогноза и реализованные значения. Рекурсивное оценивание или скользящее окно могут подойти, но опишите схему и сохраните прогнозы, фактически сделанные в каждом моменте. Если многократно просматривать оценочный период при выборе предикторов, преобразований или горизонтов, он становится частью отбора модели. Руководство CAViaR показывает, почему прогноз хвостового квантиля требует функции потерь, подходящей его цели, а не должен без оговорок смешиваться со сравнением среднего.
Поправка не устраняет заглядывание в будущее, несовпадающие выборки, поздние ревизии данных, представленные как известные в прошлом, или скрытый перебор моделей. Укажите начальный обучающий интервал, число моментов прогноза, горизонт, версию данных и способ рекурсивного либо скользящего обновления.
Рассчитайте скорректированную разность потерь
Обозначим прогноз ограниченной модели через f₀,t+h, большой модели — через f₁,t+h, а ошибку j-й модели — eⱼ,t+h = yₜ₊ₕ − fⱼ,t+h. При квадратичной функции потерь скорректированная разность Кларка—Уэста за период равна:
dCW,t+h = (e₀,t+h)² − [(e₁,t+h)² − (f₀,t+h − f₁,t+h)²]
Это квадрат ошибки ограниченной модели минус квадрат ошибки большой плюс квадрат расстояния между прогнозами. Последнее слагаемое оценивает дополнительный шум прогноза из-за оценивания новых параметров при нулевой гипотезе. Кларк и Уэст предлагают вычесть этот член из выборочного MSPE большой модели до сравнения. Clark и West (2007).
Усредните скорректированные разности по P общим моментам оценки: среднее(dCW) = (1/P) Σ dCW,t+h. Если исходы и прогнозы измерены в базисных пунктах, квадраты ошибок и разности выражаются в bp². Положительное среднее при данной конвенции знаков указывает в сторону большой модели. Это скорректированная сравнительная величина, а не реализованный MSPE большой модели и не прогноз для торговли.
Заранее задайте одностороннюю гипотезу
Обычный вопрос теста Кларка—Уэста: ниже ли ожидаемый MSPE у большой вложенной модели, чем у ограниченной базовой? Нулевая гипотеза означает отсутствие улучшения от дополнительной компоненты, односторонняя альтернатива говорит в пользу большой модели. По приведённой формуле достаточно положительное среднее с учётом стандартной ошибки поддерживает эту альтернативу.
В обозначениях скорректированных потерь рабочие гипотезы таковы: H₀: E[dCW] = 0 против H₁: E[dCW] > 0. Положительное направление следует из того, что сначала берётся потеря ограниченной модели. Если поменять порядок вычитания, знак тоже изменится; указывайте конвенцию вместе с результатом.
Статистику обычно записывают как выборочное среднее dCW, делённое на оценённую стандартную ошибку. Кларк и Уэст рекомендуют приближённо нормальный односторонний тест для изученных ими постановок, используя обычную или устойчивую к автокорреляции стандартную ошибку в зависимости от случая. West (1996) развивает вывод о моментах гладких функций вневыборочных прогнозов и ошибок, в том числе когда прогнозы зависят от оценённых параметров. p-значение зависит от вложенности, способа формирования прогнозов, цели, функции потерь и предпосылок; это не вероятность истинности большой модели и не доказательство причинности.
Разберите пример с четырьмя периодами
Рассмотрим четыре гипотетических результата в базисных пунктах: [0, 1, −1, 0]. Прогнозы ограниченной модели: [−1, 0, 0, 0], большой вложенной модели: [−1,5, 0,5, −0,5, 0,5]. Квадраты ошибок ограниченной модели равны [1, 1, 1, 0], средний MSPE — 0,75 bp². У большой модели квадраты ошибок [2,25, 0,25, 0,25, 0,25], средний MSPE также 0,75 bp².
Квадраты расхождения прогнозов (f₀ − f₁)² равны [0,25, 0,25, 0,25, 0,25]. После применения e₀² − e₁² + (f₀ − f₁)² получаем скорректированные разности [−1, 1, 1, 0] bp² со средним 0,25 bp². Исходные MSPE совпадают, но скорректированное среднее положительно, так как учитывает шум оценивания большой модели.
Эти четыре периода показывают только арифметику. Их слишком мало, чтобы надёжно оценить неопределённость или установить статистическую значимость. Само по себе положительное скорректированное среднее не доказывает реальное преимущество прогноза; все числа гипотетические, а не рыночные наблюдения.
<!-- learn:illustration -->

Учитывайте зависимость ошибок и горизонт прогноза
Даже однопериодные прогнозы могут давать серийно зависимые скорректированные разности потерь, если целевая переменная, предикторы или обучающие окна меняются во времени. Многопериодные прогнозы с перекрытием используют одни и те же фактические результаты в соседних моментах. Стандартная ошибка, предполагающая независимость всех прогнозов, может занижать неопределённость.
Оценивайте стандартную ошибку по ряду скорректированных разностей методом, соответствующим дизайну, например оценкой долгосрочной дисперсии, устойчивой к гетероскедастичности и автокорреляции, если её условия выполнены. Кларк и Уэст отдельно отмечают такие стандартные ошибки при автокоррелированных прогнозных ошибках. Укажите горизонт, оценку ковариации, ядро, полосу и метод ресэмплинга, если используете. Руководство по блочному бутстрэпу объясняет, почему ресэмплинг временного ряда должен сохранять структуру порядка; обычный бутстрэп сам по себе не реализует нулевую гипотезу Кларка—Уэста.
Подход к зависимости определяется дизайном. Длинные горизонты, устойчивые цели, повторная оценка параметров и меняющаяся волатильность могут создавать зависимость дальше простой схемы перекрытия. Сравните разумные варианты и не выбирайте только тот, который даёт наименьшее p-значение.
Считайте нормальные критические значения приближением, а не гарантией
У вложенных моделей нулевое распределение может быть нестандартным, особенно когда одновременно растут оценочная и тестовая выборки. Кларк и Мак-Кракен показывают, что тесты равной точности и encompassing для вложенных прогнозов имеют иные асимптотические и конечновыборочные свойства, чем привычные сравнения невложенных моделей. Кларк и Уэст обосновывают полезное приближённо нормальное в некоторых изученных дизайнах, но это не универсальная гарантия для конечной выборки. Clark и McCracken (2001)00071-9); Clark и West (2007).
Малая оценочная выборка, множество дополнительных параметров, неверно заданная базовая модель, подбор предикторов по данным и выбор скользящего или рекурсивного оценивания могут влиять на размер и мощность теста. Если дизайн сильно отличается от исследованных, рассмотрите подходящие критические значения либо тщательно заданную симуляцию или бутстрэп. Укажите размеры обеих выборок и распределение, использованное для p-значения.
Отличайте соседние тесты и ограничивайте вывод
Тест Диболда—Мариано проверяет равенство ожидаемых потерь двух прогнозов в общей постановке парного сравнения. Поправка Кларка—Уэста относится к квадратам ошибок, когда одна модель вложена в другую, а оценивание новых параметров смещает исходную разность MSPE под нулём. Не переносите её на невложенные модели без обоснования. Исходная работа DM допускает широкий выбор функций потерь и рассматривает ошибки, которым не обязательно быть нормальными или независимыми. Это смежная литература, но другой тест. Diebold и Mariano (1995).
Ни один тест не решает проблему перебора множества целей, горизонтов, базовых моделей и предикторов. Если итоговое сравнение выбрано после широкой поисковой процедуры, сохраните полный набор вариантов и используйте метод для вопроса о всём поиске. Руководство по Reality Check Уайта и SPA Хансена рассматривает вывод для семейства проверенных торговых правил.
Значимый односторонний результат при указанных предпосылках служит свидетельством снижения ожидаемой квадратичной ошибки для данной цели и дизайна оценки. Он не доказывает причинность, устойчивость сигнала или прибыльность стратегии. Для доходности нужны отдельное правило, нетронутые оценочные данные и реалистичные спреды, комиссии, проскальзывание, рыночное воздействие, финансирование и ограничения риска.
Описывайте дизайн так, чтобы сравнение можно было повторить
Назовите ограниченную и большую модели, ограничения, задающие вложенность, цель, горизонт, единицы, окно оценивания, расписание прогнозов, даты оценки и правило общей выборки. Опишите повторную оценку параметров и сохранение информационного набора и версий данных для каждого момента.
Приведите оба исходных MSPE, среднюю скорректированную разность, знак, стандартную ошибку, одностороннюю альтернативу, опорное распределение или критические значения, p-значение и метод оценки зависимости. Также укажите число дополнительных параметров, размеры выборок, какие спецификации перебирались и повлиял ли оценочный период на выбор модели. Так читатели смогут отличить скорректированный тест вложенных моделей от общего сравнения прогнозов и оценить оставшуюся неопределённость.
Частые вопросы
Q1Заменяет ли тест Кларка—Уэста тест Диболда—Мариано?
Нет. Кларк—Уэст предназначен для сравнения MSPE вложенных моделей. Диболд—Мариано — общая схема парных потерь, и обычное опорное распределение не следует автоматически переносить на вложенные прогнозы.
Q2Доказывает ли положительное скорректированное среднее превосходство большой модели?
Нет. По принятой конвенции оно указывает в её сторону, но нужны подходящая стандартная ошибка, правдоподобный вневыборочный дизайн и достаточное число наблюдений.
Q3Можно ли применять Кларка—Уэста к невложенным моделям?
Не по умолчанию. Поправка мотивирована шумом оценивания при вложенной нулевой гипотезе. Для невложенных моделей выберите тест под соответствующие прогнозную постановку и функцию потерь.
Q4Означает ли значимый результат Кларка—Уэста прибыльную торговую стратегию?
Нет. Он проверяет точность прогноза для одной цели и дизайна. Итог торговли зависит также от правил, исполнения, комиссий, финансирования, риска и дополнительной вневыборочной проверки. Основные исследования - Clark и West, “Approximately Normal Tests for Equal Predictive Accuracy in Nested Models” (2007) - Clark и McCracken, “Tests of Equal Forecast Accuracy and Encompassing for Nested Models” (2001)00071-9) - West, “Asymptotic Inference about Predictive Ability” (1996) - Diebold и Mariano, “Comparing Predictive Accuracy” (1995)
Источники и дополнительное чтение
Сообщить о проблеме
Мы подготовим письмо со ссылкой на эту статью. Mark получит сообщение только после отправки
Быстрая проверка
Прочитали руководство? Проверьте себя в 3 вопросах
Вопрос 01
Зачем поправка Кларка—Уэста добавляет квадрат разности двух прогнозов?
Выберите ответ, чтобы увидеть объяснение