Тест Джакомини—Уайта: условная точность прогноза
Узнайте, как тест Джакомини—Уайта проверяет зависимость качества прогноза от известных условий, как выбирать инструменты и какие выводы допускает результат
В этом руководствеСредняя и условная точность отвечают на разные вопросы
Краткое резюме
Подход Джакомини—Уайта (GW) проверяет, связана ли относительная функция потерь двух прогнозов с информацией, доступной в момент их построения. Он может выявить различия, скрытые средним показателем, однако вывод зависит от заранее выбранных методов прогнозирования, периода оценки, функции потерь и условных переменных.
Средняя и условная точность отвечают на разные вопросы
Предположим, что средние потери прогноза A в тестовой выборке ниже, чем у прогноза B. За этим средним может скрываться полезная закономерность: A может лучше работать на спокойном рынке, а B — при высокой волатильности. Если нужно понять, какой прогноз был лучше в среднем, подойдет безусловное сравнение. Если вопрос состоит в том, помогает ли известная на дату прогноза информация определить, какой метод будет точнее, следует оценивать условную прогнозную способность.
Джакомини и Уайт формулируют задачу как сравнение методов прогнозирования при заданных функции потерь и наборе информации. Подход применим к точечным, интервальным, вероятностным прогнозам и прогнозам плотности, если функция потерь соответствует задаче. В объект оценки входит и процедура оценивания, с помощью которой строится прогноз. Поэтому скользящее окно, фиксированная обучающая выборка или правило взвешивания — это не мелкие настройки, которые можно менять после просмотра результатов, а часть сравниваемого метода прогнозирования (Giacomini и White, 2006).
Условный тест связан с тестом структурного сдвига, но это разные процедуры. Условный тест проверяет, связаны ли относительные потери с выбранной информацией систематически. Тест структурного сдвига оценивает, изменились ли параметры или взаимосвязь в неизвестный либо заданный момент. Руководство по тесту Диболда—Мариано посвящено безусловному сравнению средних потерь; для условного вопроса нужно явно указать информацию, по которой проводится сравнение.
Сначала согласуйте прогнозы, результаты и время доступности информации
Пусть (Y_{t+1}) — целевая величина, которая наблюдается после момента прогноза (t). Прогнозы ŷA,t+1 и ŷB,t+1 должны относиться к одной цели, горизонту, единицам измерения и одному времени отсечения информации. Для функции потерь (L), где меньшее значение лучше, зададим разность потерь так:
dₜ₊₁ = L(Yₜ₊₁, ŷA,ₜ₊₁) − L(Yₜ₊₁, ŷB,ₜ₊₁)
При таком соглашении о знаке положительное значение означает, что потери A выше и на данном моменте прогноза лучше оказался B. Отрицательное значение говорит в пользу A. Используйте по одной строке на каждый момент прогноза и оценивайте оба прогноза по одному фактическому результату. Сохраняйте значения, доступные тогда, а также версии данных и модели. Не пересоздавайте исторические прогнозы с помощью пересмотренных исходных данных или информации, появившейся позже.
Условные переменные также должны быть известны в момент прогноза. Это могут быть запаздывающая оценка волатильности, заранее объявленный индикатор события, запаздывающая разность относительных потерь или состояние рынка, рассчитанное только по прошлым наблюдениям. Переменная, измеренная после (t), не может без смещения из-за заглядывания в будущее объяснять, какой прогноз оказался лучше в (t+1).
Подбирайте оценку под целевую величину. Квадратичная ошибка — один из вариантов для прогноза условного среднего, но она не всегда подходит для прогнозов волатильности, квантилей или плотности. Если одна модель прогнозирует дисперсию, а другая — стандартное отклонение, сначала приведите прогнозы к одной и той же величине. Тест не устраняет несоответствие в самой постановке задачи.
Для прогнозов волатильности оценивайте обе модели по одинаковому определению реализованной дисперсии и одному интервалу выборки. Если один прогноз относится к внутридневным ценам, а другой дополнительно включает ночную доходность, разность потерь может отражать различие целевых величин, а не качество прогнозирования. Заранее решите, как учитывать движения при закрытом рынке, частоту выборки, пропуски и меру реализованной дисперсии, и применяйте эти решения последовательно. Если прокси реализованной величины зашумлена, ошибка измерения влияет на обе оценки потерь и должна учитываться при интерпретации.
Сформулируйте условную нулевую гипотезу и выберите тестовые функции
Пусть (𝒢ₜ) обозначает информацию, по которой проводится условное сравнение. Идеализированная нулевая гипотеза имеет вид:
H₀: E[dₜ₊₁ | 𝒢ₜ] = 0
Это означает, что ожидаемая разность потерь равна нулю при заданной информации. Одношаговый тест GW преобразует это условное утверждение в набор моментных условий с помощью заранее выбранного вектора тестовых функций (h_t), вычисляемых по информации, доступной в момент (t):
H₀,ₕ: E[hₜ dₜ₊₁] = 0
В вектор (h_t) можно включить константу, которая охватывает среднюю разность потерь. Другие элементы могут представлять состояние рынка, запаздывающие относительные потери или нелинейное преобразование, выбранное до просмотра результатов. Например, если (S_t) — известный в момент (t) бинарный индикатор высокой волатильности, то (h_t=(1,S_t)') позволяет проверить и постоянный момент, и связь разности потерь с этим состоянием.
Конечный набор тестовых функций проверяет только заданные ими моменты. Отклонение означает, что при предпосылках теста по крайней мере один выбранный момент не согласуется с нулем; оно не выявляет модель, лучшую во всех возможных условиях, и не доказывает значимость каждой мыслимой переменной состояния. Неотклонение не доказывает равенство условного качества прогнозов. Тест с одной константой сравнивает безусловный момент, а не выполняет широкий поиск по всем возможным условиям.
Заранее определите функцию потерь, инструменты, преобразования, выборку и горизонт прогнозирования. Если после просмотра результатов добавлять множество индикаторов состояний, порогов и лагов, возникает дополнительная проблема поиска. Сам условный тест не корректирует такую селекцию.
Зафиксируйте и момент расчета каждой переменной состояния. Если «высокая волатильность» означает верхние 20 процентов волатильности по всей выборке, будущие наблюдения участвуют в определении порога для прошлых моментов прогноза. Оценивайте порог только по информации, доступной к каждому моменту прогноза, либо используйте правило, объявленное заранее. Для непрерывной переменной состояния заранее задайте единицы измерения и способ центрирования или масштабирования. Несколько почти одинаковых индикаторов создают избыточные моменты и могут затруднить обращение ковариационной матрицы, поэтому используйте минимальный набор с ясной интерпретацией.
Рассчитайте статистику Вальда и интерпретируйте эталонное распределение
При (q) тестовых функциях сформируйте вектор моментов (g_{t+1}=h_t d_{t+1}). Его выборочное среднее равно
ḡ = (1/n) Σₜ gₜ₊₁
Одношаговая статистика GW имеет вид статистики Вальда:
GW = n ḡ′ Ω̂⁻¹ ḡ
(Ω̂) оценивает ковариационную матрицу вектора моментов. При нулевой гипотезе и регулярных условиях исходной статьи статистика асимптотически имеет эталонное распределение хи-квадрат с (q) степенями свободы. Поэтому число тестовых функций задает эталонное распределение и может влиять на мощность. Большое число слабых или избыточных инструментов способно сделать оценку ковариации нестабильной, почти не добавляя полезной информации.
В одношаговой постановке нулевая гипотеза подразумевает для вектора моментов структуру разностей мартингала, поэтому в исходном тесте можно использовать оценку на основе выборочного второго момента. Для других горизонтов, перекрывающихся результатов или отклонений от этой постановки оценка дисперсии должна соответствовать предпосылкам и структуре зависимости выбранного теста. Не копируйте автоматически полосу HAC из другого теста; следуйте формулировке выбранной реализации. Общие методы оценки HAC-ковариации, включая оценку Ньюи и Уэста (1987), применяются в тех случаях, где они нужны, а не задают универсальную ширину полосы для GW. Достоверность результата зависит от оценки ковариации и конструкции прогноза.
Проверьте также, можно ли оценить (Ω̂) по выбранным моментам. Почти дублирующие функции теста, индикатор с очень малым числом наблюдений в одном состоянии или чрезмерное количество взаимодействий могут привести к вырожденной или нестабильной матрице. Тогда ее обратная матрица может резко меняться при небольшом пересмотре данных и искажать статистику. Для каждой функции должно быть ясное основание, связанное с условием или разницей в качестве прогнозирования; укажите количество функций и ковариацию моментов. Удаление бесполезной функции после просмотра результата — еще один шаг селекции, о котором нужно сообщить.
p-значение служит свидетельством против заявленных моментных ограничений при заданном эталонном распределении и предпосылках теста. Это не вероятность того, что A или B является истинной моделью, и не вероятность прибыльности торгового правила. Укажите статистику, число степеней свободы, p-значение и конкретные проверяемые моменты, чтобы читатели понимали смысл отклонения.
<!-- learn:illustration -->

Пример с двумя состояниями показывает, что может скрывать среднее
Рассмотрим восемь гипотетических одношаговых моментов прогноза. Пусть (S_t=0) обозначает спокойное состояние, а (S_t=1) — состояние высокой волатильности. Предположим, что гипотетические разности потерь (d_{t+1}=L_A-L_B) равны −2, −2, −2 и −2 для четырех спокойных моментов, а для четырех моментов высокой волатильности составляют +2, +2, +2 и +2. Отрицательные значения говорят в пользу A, положительные — в пользу B.
Среднее по всем восьми моментам равно нулю, поэтому в этом небольшом примере безусловной разницы потерь нет. При этом средняя разность в спокойном состоянии равна −2, а в состоянии высокой волатильности — +2. Относительное ранжирование меняется в зависимости от состояния. Тест с (h_t=(1,S_t)') включает постоянный и высоковолатильный моменты, которые могут отразить эту закономерность.
Эти восемь значений — иллюстрация для обучения, а не достаточный объем данных для надежных статистических выводов. В реальном исследовании нужно учитывать способ оценки прогнозов, был ли индикатор состояния задан заранее, число моментов прогноза и изменение во времени моментных условий разности потерь. Один лишь график по состояниям не подтверждает, что закономерность сохранится.
Рассматривайте окно оценивания как часть метода
Исходная асимптотика GW предполагает, что максимальная длина окна оценивания остается конечной при росте числа прогнозов вне выборки. Скользящие окна и фиксированная обучающая выборка соответствуют этой базовой постановке. Длина окна и любые зависящие от данных правила его выбора являются частью каждого метода прогнозирования, поэтому их нужно задать и описать.
Это важно при повторной оценке моделей. Сравнение, игнорирующее неопределенность параметров, может не учитывать неопределенность, возникающую из-за того, как каждый метод учится на прошлых данных. При указанных условиях GW применим к прогнозам вложенных и невложенных моделей, но это не гарантирует корректность любого варианта расширяющегося окна или любого оценивателя. В исходной одношаговой постановке конечное окно — основное предположение; обычное расширяющееся окно выходит за его рамки. Если конструкция прогнозов отличается, используйте результат, выведенный для фактической схемы.
Этот тест также не подбирает подходящее окно за вас. Короткое окно может быстрее адаптироваться к недавним условиям, но содержит меньше наблюдений; длинное или расширяющееся окно может стабилизировать оценки, сохраняя устаревшие взаимосвязи. Сравнивайте варианты по заранее спланированной процедуре и фиксируйте сам выбор окна. Джакомини и Росси (2010) разработали отдельные тесты временной траектории относительного качества прогнозов в нестабильной среде. Это родственный вопрос, но статистика отличается от базового условного теста GW.
Само по себе условное отклонение не создает торговое правило, которое в реальном времени выбирает подходящий прогноз. Инструмент может быть связан с разностью потерь в выборке оценки, но не давать стабильного или практически применимого правила переключения. Чтобы использовать текущую информацию для выбора прогноза, определите правило на основе прошлых наблюдений и проверьте его на более поздней, ранее не использованной последовательности моментов прогноза, учитывая неопределенность оценивания и принятия решения.
Отличайте GW от DM, тестов вложенных моделей и тестов нестабильности
Тест Диболда—Мариано проверяет, равны ли средние потери двух прогнозов в выборке оценки. GW проверяет, связана ли выбранная информация с относительными потерями, включая безусловное сравнение как частный вариант моментного ограничения. Как показывает пример с двумя состояниями, средние оценки могут совпадать, хотя относительное качество зависит от состояния.
Если прогнозы получены на основе вложенных моделей, а вопрос состоит именно в равенстве среднеквадратичных ошибок прогнозирования (MSPE), метод вроде поправки Кларка—Уэста отвечает на другую нулевую гипотезу и учитывает иной вопрос шума оценивания. Если было проверено много торговых правил или прогнозов и требуется выяснить, обладает ли какой-либо кандидат превосходящей прогностической способностью, нужна процедура для всего семейства, например Reality Check Уайта или тест SPA Хансена. Условный тест для одной выбранной пары не отменяет более широкий поиск.
Наконец, свидетельство изменения относительной точности во времени не определяет конкретную дату сдвига. Если исследовательский вопрос касается траектории относительного качества, а не его связи с выбранными инструментами, лучше может подойти тест локальной нестабильности или разворота. Джакомини и Росси (2010) изучают такие сравнения прогнозов. Выбирайте метод по поставленному вопросу, а не трактуйте любое отклонение как подтверждение торговой стратегии переключения режимов.
Если сравнивается несколько моделей, процедура для всего семейства может отвечать на вопрос, отличный от парного условного теста. Руководство по набору Model Confidence Set объясняет, как итеративное сравнение оставляет множество моделей, которые нельзя различить на выбранном уровне значимости. Этот подход не заменяет предварительное задание условий в анализе GW.
Учитывайте низкую мощность и повторные проверки
Условным тестам может требоваться много данных. Разделение выборки на спокойные периоды и периоды высокой волатильности уменьшает число наблюдений для каждого сравнения. Добавление тестовых функций увеличивает число моментов и степеней свободы. Если связь многих условий с относительными потерями слаба, мощность теста может быть низкой даже при наличии условных различий.
В рабочей статье Маккрэкена из Федерального резервного банка Сент-Луиса исследуются существование, размер и мощность теста GW на простом примере с квадратичной функцией потерь. В рассмотренных симуляциях размер теста обычно контролировался корректно, но мощность в исследованных постановках, как правило, была низкой (McCracken, 2020). Это предупреждение для интерпретации, а не универсальный количественный прогноз для любого применения. Неотклонение может объясняться недостатком информации или низкой мощностью и не доказывает взаимозаменяемость прогнозов.
Повторные попытки с разными определениями состояния, порогами, горизонтами, функциями потерь и датами оценки повышают вероятность случайного результата. Фиксируйте всех проверенных кандидатов и отделяйте поисковый анализ от заранее определенной подтверждающей выборки. Если утверждение состоит в том, что хотя бы одна стратегия из семейства обладает прогностической ценностью, применяйте подходящую поправку на множественные проверки или процедуру защиты от подглядывания в данные ко всему семейству. Большее число условных инструментов не делает доказательства автоматически убедительнее.
Если сравниваются несколько моделей, процедура для всего семейства отвечает на вопрос, отличный от парного условного теста. Руководство по набору Model Confidence Set описывает итеративное сравнение, сохраняющее набор моделей, неразличимых на выбранном уровне. Оно также не заменяет предварительное определение условий для анализа GW.
Опишите схему так, чтобы другой исследователь мог ее воспроизвести
Укажите оба метода прогнозирования, способ оценивания каждого, вложенность моделей, целевую величину и горизонт, а также даты оценки. Точно задайте функцию потерь и соглашение о знаке для (d_{t+1}). Опишите каждый элемент (h_t), способ его построения, время, когда он становится наблюдаемым, и был ли он выбран до просмотра результатов.
Сообщите график моментов прогноза, правило выбора окна оценивания, версию данных, правило общей выборки, число прогнозов вне выборки, число тестовых функций, оцениватель ковариации, эталонное распределение, статистику, степени свободы и p-значение. Укажите, перекрываются ли горизонты и как учитывается зависимость. Приведите средние потери и сводные показатели разностей потерь, а не только результат теста.
Перечислите другие проверенные инструменты, пороги, окна, функции потерь и пары прогнозов. Если те же наблюдения использовались для выбора модели или условных переменных, а затем для тестирования, сообщите об этом. Исследовательский результат может быть полезен, даже если он не является подтверждающим. Прозрачное описание помогает оценить границы вывода и спланировать независимую проверку.
Частые вопросы
Q1Тест Джакомини—Уайта — это то же самое, что тест Диболда—Мариано?
Нет. Тест Диболда—Мариано посвящен равенству средних потерь. Одношаговый подход GW проверяет выбранные условные моменты, а безусловный момент выступает одним из возможных ограничений.
Q2Показывает ли отклонение, какой прогноз использовать в каждом рыночном режиме?
Нет. Оно означает, что при предпосылках теста хотя бы один выбранный момент не согласуется с нулем. Результат зависит от выбранных инструментов, выборки и функции потерь и не гарантирует качество во всех состояниях.
Q3Можно ли добавлять пороги волатильности, пока тест не отклонит гипотезу?
Это превращается в поиск по условным переменным. По возможности задайте переменные заранее и укажите все проверенные спецификации. Для широкого утверждения о прогностической способности используйте отдельную подтверждающую выборку или подходящую поправку для всего семейства кандидатов.
Q4Означает ли условная прогнозная способность, что торговая стратегия прибыльна?
Нет. Тест сравнивает потери прогнозов. Для торгового утверждения нужно определить правило принятия решений и отдельно оценить исполнение сделок, комиссии, финансирование, рыночное воздействие и риск. Основные исследования - Giacomini and White, “Tests of Conditional Predictive Ability” (2006) - Giacomini and Rossi, “Forecast Comparisons in Unstable Environments” (2010) - McCracken, “Tests of Conditional Predictive Ability: Existence, Size, and Power” (Federal Reserve Bank of St. Louis Working Paper, 2020) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995) - Newey and West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)
Источники и дополнительное чтение
Сообщить о проблеме
Мы подготовим письмо со ссылкой на эту статью. Mark получит сообщение только после отправки
Быстрая проверка
Прочитали руководство? Проверьте себя в 3 вопросах
Вопрос 01
Что означает положительная разность потерь при dₜ₊₁ = L(A) − L(B)?
Выберите ответ, чтобы увидеть объяснение