Skip to content
Все руководства по опционам и фьючерсам
Сравните два прогноза по потерям на одних и тех же результатах13 минут

Тест Диболда—Мариано: сравнение точности прогнозов

Узнайте, что сравнивает тест Диболда—Мариано, как разности потерь и серийная зависимость влияют на статистику и почему точность прогноза не равна прибыли от торговли.

В этом руководствеТест сравнивает ожидаемые потери прогнозов

Краткое резюме

Тест Диболда—Мариано (DM) проверяет, одинаковы ли ожидаемые потери двух процедур прогнозирования на сопоставимых результатах. Он использует временной ряд разностей потерь, поэтому на результат влияют функция потерь, горизонт прогноза и зависимость между датами. Отклонение нулевой гипотезы подтверждает различие в рамках заданной схемы оценки; оно не доказывает, что одна модель останется лучше или что торговая стратегия принесёт прибыль после издержек.

Тест сравнивает ожидаемые потери прогнозов

Тест Диболда—Мариано сравнивает прогнозы одной целевой переменной на одни и те же даты оценки. В каждой точке начала прогноза обе процедуры должны использовать одинаковые фактический результат, горизонт и момент отсечения доступной информации. Затем тест оценивает, отличается ли средняя потеря одной процедуры от другой систематически, допуская, что разности потерь меняются во времени.

Диболд и Мариано формулируют задачу для общей функции потерь, а не только для среднеквадратической ошибки. В исходной работе описаны тесты нулевой гипотезы о равной прогностической точности конкурирующих прогнозов (Diebold and Mariano, 1995). Здесь «точность» означает меньшую ожидаемую потерю при выбранной функции. Это не означает, что прогноз истинен, объясняет причинность, хорошо откалиброван по всей части распределения или полезен для любого решения.

Пусть модели A и B в один момент прогнозируют одну и ту же будущую доходность. DM-тест не проверяет, равен ли нулю коэффициент какой-либо модели, и не сравнивает подогнанные значения моделей в обучающей выборке. Он сравнивает, как их ошибки прогноза преобразуются в выбранную потерю на выборке оценки.

Сначала задайте схему исследования: цель, точки начала прогноза, горизонт, функцию потерь, обработку пропущенных результатов, расписание переоценки модели, а также одностороннюю или двустороннюю альтернативу. Эти решения определяют проверяемый вопрос. Если они различаются между моделями, разность потерь уже не является сопоставлением на равных условиях.

Определите парные прогнозы и разность потерь

Пусть $y_t$ — фактическое значение в точке начала прогноза $t$, а $\hat y_{A,t}$ и $\hat y_{B,t}$ — прогнозы моделей A и B. Ошибки равны $e_{A,t}=y_t-\hat y_{A,t}$ и $e_{B,t}=y_t-\hat y_{B,t}$. Для функции потерь $L$ разность потерь на дату определяется так:

$$ d_t=L(e_{A,t})-L(e_{B,t}) $$

При таком соглашении отрицательное среднее $d_t$ означает, что наблюдаемая потеря A ниже, а положительное — что ниже потеря B. Популяционная нулевая гипотеза: $E[d_t]=0$. Двусторонняя альтернатива ищет различие в любом направлении, односторонняя — в направлении, заданном заранее. Не выбирайте направление после того, как увидели победителя.

Квадратичная потеря $L(e)=e^2$ придаёт большим промахам непропорционально большой вес. Абсолютная потеря $L(e)=|e|$ меньше зависит от одного крупного промаха. Квантильная потеря может соответствовать асимметричной цели. Поскольку другая функция потерь способна изменить ранжирование моделей, у выражения «лучший прогноз» нет единственного смысла без явного выбора потери. Обзор Ташмана по тестам вневыборочного прогнозирования также подчёркивает, что метод оценки должен соответствовать задаче (Tashman, 200000065-0)).

Используйте одни и те же точки начала и фактические результаты для обеих моделей. Если у одной модели отсутствует прогноз именно для сложной даты, незаметное исключение этой даты только из её выборки меняет сравнение. Если при реальном применении модель переоценивается каждый месяц с новыми данными, используйте тот же график переоценки при создании прогнозов оценки; прогноз с фиксированными параметрами отвечает на другой вопрос. Последовательную схему, исключающую будущую информацию, объясняет руководство по walk-forward-проверке.

Пример с четырьмя точками прогноза показывает смысл среднего различия

Рассмотрим четыре гипотетические точки прогноза; целевая переменная и ошибки измеряются в процентных пунктах. Ошибки A равны $[1,2,0,1]$, а ошибки B — $[2,1,1,1]$. В каждой паре один и тот же реализованный доход и горизонт. Числа придуманы исключительно для иллюстрации арифметики.

При квадратичной потере A получает значения $[1,4,0,1]$, а среднеквадратическая ошибка составляет $(1+4+0+1)/4=1.50$ квадратного процентного пункта. Для B значения равны $[4,1,1,1]$, а среднеквадратическая ошибка — $(4+1+1+1)/4=1.75$. На этих четырёх наблюдениях MSE модели A ниже на 0.25 квадратного процентного пункта.

Разности потерь $d_t=L(e_{A,t})-L(e_{B,t})$ по датам равны $[-3,3,-1,0]$. Их среднее $(-3+3-1+0)/4=-0.25$ совпадает с разностью средних MSE A и B. Отрицательный знак поддерживает A при указанном соглашении. Он ещё не показывает, превышает ли разница выборочный шум: четырёх пар прогнозов недостаточно для убедительного статистического вывода.

Выбор потери также меняет смысл слова «лучше». В отдельном примере абсолютные ошибки C равны $[0,0,0,3]$, D — $[1,1,1,1]$. Средняя абсолютная ошибка составляет 0.75 у C и 1 у D, поэтому лучше C. При квадратичной потере средние равны 2.25 и 1, поэтому лучше D. Тест не разрешит это противоречие, пока не определено, какие промахи важнее.

<!-- Illustration placement: after this section; text-free conceptual scene showing two forecast paths against one realized path, with visibly different miss distances and no labels or numerical claims. -->

Статистика DM соотносит средний разрыв потерь с его неопределённостью

Выборочное среднее разности потерь равно $\bar d=T^{-1}\sum_{t=1}^{T}d_t$, где $T$ — число сопоставимых прогнозов. Его стандартная ошибка зависит от долгосрочной дисперсии $d_t$, а не только от дисперсии в отдельную дату. Общий вид статистики:

$$ DM=\frac{\bar d}{\sqrt{\widehat{\Omega}/T}} $$

$\widehat{\Omega}$ оценивает долгосрочную дисперсию ряда разностей потерь. При независимых датах она при выбранном оценивателе сводилась бы к дисперсии $d_t$. Но потери прогнозов часто кластеризуются: в период высокой волатильности ошибки обеих моделей могут вырасти, а цель на $h$ шагов вперёд приводит к перекрытию окон, в которых используются одни и те же фактические доходности. Игнорирование положительной зависимости может занизить стандартную ошибку и преувеличить убедительность результата.

Распространённый HAC-подход оценивает автоковариации $\hat\gamma_k$ центрированной разности потерь и суммирует их как $\widehat{\Omega}=\hat\gamma_0+2\sum_{k=1}^{q}w_k\hat\gamma_k$. При весах Бартлетта до полосы $q$ используется $w_k=1-k/(q+1)$. Ньюи и Уэст предложили положительно полуопределённую оценку ковариации, устойчивую к гетероскедастичности и автокорреляции (Newey and West). Ядро и полоса — решения реализации: указывайте их и выбирайте с учётом схемы прогнозирования, а не желаемого p-значения. Общую задачу оценки ковариации рассматривает руководство по HAC-стандартным ошибкам.

При обычных регулярных условиях стандартную статистику DM сравнивают с асимптотическим стандартным нормальным распределением. Большой абсолютный результат означает, что наблюдаемый средний разрыв велик по сравнению с оценённой неопределённостью. Знак показывает, у какой модели была ниже потеря согласно определённому порядку; p-значение не измеряет величину или экономическую ценность разрыва. Оно также не равно вероятности истинности нулевой гипотезы или будущего успеха прогноза.

Многошаговые прогнозы перекрываются, поэтому важна конечная выборка

Если каждый период прогнозировать цель на несколько периодов вперёд, окна оценки перекрываются. Например, ежемесячный прогноз совокупной доходности за следующие три месяца разделяет два из трёх месячных доходов с прогнозом, выпущенным месяц спустя. Даже независимость месячных доходов не исключает серийную зависимость ошибок прогноза и разностей потерь из-за такого перекрытия.

Для базовой схемы с горизонтом $h$ разумно учитывать зависимость как минимум до лага $h-1$. Это не универсальное правило выбора полосы: скользящая переоценка параметров, устойчивость цели, кластеризация волатильности и функция потерь могут создавать более длинную зависимость. Записывайте горизонт, шаг между точками прогноза и обоснование HAC-отсечения либо другой оценки дисперсии. Число строк прогнозов не равно автоматически числу независимых свидетельств.

Исходный асимптотический тест может иметь неверный фактический уровень значимости при выборках умеренного размера. Харви, Лейборн и Ньюболд предложили поправку для конечной выборки при сравнении среднеквадратических ошибок прогноза (HLN, 199700719-4)). Для горизонта $h$ и $T$ прогнозов часто умножают статистику DM на коэффициент:

$$ DM_{HLN}=DM\sqrt{\frac{T+1-2h+h(h-1)/T}{T}} $$

Скорректированную статистику обычно сравнивают с t-распределением с $T-1$ степенью свободы. При $T=60$ и $h=5$ множитель составляет примерно $0.925$. Это лишь пример арифметики поправки; он не означает, что 60 наблюдений достаточно для конкретной модели или что выполнены предпосылки. Поправка решает определённую проблему малой выборки, но не исправляет утечку данных, неверную цель, неучтённую зависимость, повторный отбор моделей или неправильно заданную функцию потерь.

Для вложенных моделей нужна другая логика сравнения прогнозов

Модель A может быть ограниченным вариантом модели B, например, если B добавляет предикторы к A. Даже если дополнительные переменные не имеют прогностической ценности в генеральной совокупности, оценённые коэффициенты могут добавить шум в прогнозы B. Поэтому у большей модели может оказаться выше наблюдаемый MSE, хотя дополнительные признаки не улучшают основной процесс прогнозирования. Обычная логика равной точности для невложенных моделей здесь не применяется автоматически.

Кларк и Уэст описывают приблизительно нормальные тесты равной прогностической точности для вложенных моделей и корректируют сравнение квадратичных ошибок на шум оценивания, возникающий из-за большей модели (Clark and West, 2007). Это не универсальная замена всем DM-тестам: метод предназначен для конкретного вопроса о вложенных моделях, функции потерь и асимптотической схеме. Установите, вложена ли одна модель в другую, и выберите тест с нулевым распределением, подходящим к дизайну. Не считайте стандартное программное p-значение DM подходящим для любых отношений между моделями.

Важно различать и другие свойства прогнозов. Меньший MSE не обязательно улучшает покрытие интервалов, калибровку вероятностей, точность направления или последующие решения. Даже вневыборочное сравнение может использовать непригодную отложенную выборку, которую многократно просматривали при разработке модели. Укажите взаимосвязь моделей, схему оценивания, горизонт и данные, доступные при построении каждого прогноза.

Точность прогнозов не равна торговому преимуществу

Результат DM оценивает прогнозную потерю; торговое решение оценивает процесс доходности и риска. Более низкий MSE доходности следующего периода не гарантирует, что сигнал достаточно часто указывает верную сторону сделки, задаёт подходящий размер позиции или выдерживает оборот, спред, рыночное воздействие, комиссии, стоимость займа, фондирование и задержку исполнения. И наоборот, прогноз с немного более высокой средней квадратической ошибкой может улучшить решение, если он точнее в периоды высокой экспозиции стратегии. Для такого утверждения функция потерь может отражать фактическое решение, а не удобную общую метрику прогноза.

Даже статистически значимое различие может быть экономически ничтожным. Указывайте величину средней разности потерь в понятных единицах вместе с неопределённостью, а не только p-значение или ярлык победителя. Если речь о портфельных результатах, повторно проверьте полное зафиксированное правило принятия решений на подходящих более поздних данных при реалистичных торговых допущениях и отдельно покажите результат после издержек. DM сам не рассчитывает такие результаты и не учитывает затраты, если потери специально не сконструированы с их учётом.

Тест также не корректирует поиск среди множества моделей, целей, горизонтов, функций потерь, дат и торговых правил, после которого приводится только самый благоприятный результат. Повторные попарные проверки создают проблему отбора. Сохраняйте историю поиска и используйте метод множественной проверки, подходящий к семейству утверждений. Руководство по множественным проверкам и доле ложных открытий объясняет, почему обычные пороги могут вводить в заблуждение после широкого поиска. DM — метод оценки, а не поправка на подглядывание в данные.

Укажите достаточно сведений для воспроизведения сравнения

В отчёте обозначьте целевую переменную и единицы, момент отсечения информации, точки прогнозирования, горизонт, расписание переоценки и общую выборку оценки. Укажите функцию потерь и знак $d_t$, среднюю потерю каждой модели и среднюю разность, заранее выбранную одностороннюю или двустороннюю гипотезу, оцениватель дисперсии, ядро, полосу, статистику, эталонное распределение и p-значение, а при необходимости — доверительный интервал или оценку неопределённости.

Также раскройте, вложены ли модели, как обработаны пропущенные результаты и выбросы, сколько альтернативных спецификаций проверялось и повлиял ли период оценки на выбор модели. Покажите величину разницы, а не только прохождение порога. График $d_t$ во времени или накопленных разностей потерь может выявить смену режима, скрытую средним значением, но визуализация не заменяет выводы с учётом зависимости.

В количественной торговле опишите переход от прогноза к действию: порог сигнала, размер позиции, время ребалансировки, ограничения риска, цену исполнения и допущения об издержках. DM сравнивает только ряд прогнозных потерь, который ему передан. Он не проверяет корректность конвейера данных, не делает разные оценочные выборки сопоставимыми, не доказывает причинность и не обещает сохранения исторических ранжирований. Используйте его как прозрачную часть оценки модели вместе с временно корректной схемой прогнозирования и явной оценкой на уровне решений.

Частые вопросы

Q1Сравнивает ли тест Диболда—Мариано коэффициенты моделей?

Нет. Он сравнивает ожидаемые потери ошибок прогнозирования двух процедур на сопоставимых результатах. Тест коэффициента отвечает на другой вопрос о параметре модели.

Q2Можно ли применять его для прогнозов на несколько периодов вперёд?

Да, но перекрывающиеся целевые окна могут создать серийную зависимость между последовательными разностями потерь. Используйте оценку дисперсии и, если уместно, поправку для конечной выборки, соответствующие горизонту и схеме модели; укажите свои решения.

Q3Значит ли статистически значимый результат, что лучший прогноз принесёт прибыль?

Нет. Он подтверждает различие выбранной прогнозной потери в рамках схемы оценки. Прибыльность также зависит от преобразования прогнозов в позиции, принятого риска, фактического исполнения и торговых издержек.

Источники и дополнительное чтение

Сообщить о проблеме

Мы подготовим письмо со ссылкой на эту статью. Mark получит сообщение только после отправки

Быстрая проверка

Прочитали руководство? Проверьте себя в 3 вопросах

Вопрос 1 / 3

Вопрос 01

Какова нулевая гипотеза базового сравнения Диболда—Мариано?

Выберите ответ, чтобы увидеть объяснение

Словарь опционов

Выберите историю, на которой обучается финансовая модельРасширяющиеся и скользящие окна в walk-forward-валидацииСравните расширяющиеся и скользящие окна обучения фиксированной длины, отделите валидацию от финального теста и выбирайте правила без будущих результатов.Один и тот же коэффициент может иметь разную неопределённостьГетероскедастичность, автокорреляция и устойчивые стандартные ошибкиУзнайте, почему классические стандартные ошибки не работают, что допускают оценки Уайта, кластерные и HAC-оценки Ньюи–Уэста, как их выбирать и где устойчивый вывод заканчивается в финансовых данныхПочему один порог не работает, когда исследователи проверяют множество идейМножественная проверка и доля ложных открытий в финансахРазберитесь во множественных сравнениях, семейной вероятности ошибки, доле ложных открытий, методах Бонферрони, Холма и Бенджамини–Хохберга, зависимости, q-значениях, поиске факторов, отборе бэктестов и управлении исследованиямиОценка направленных прогнозовТест Песарана—Тиммерманна: содержит ли прогноз информацию о направлении?Узнайте, как тест Песарана—Тиммерманна сравнивает совпадения направлений с базовым уровнем, рассчитанным по долям фактических и прогнозируемых повышений, и почему серийная зависимость меняет выводы.Как часто лидер бэктеста оказывается ниже медианы группыВероятность переобучения бэктеста (PBO) и CSCVУзнайте, как комбинаторная симметричная перекрёстная проверка оценивает PBO, превращает ранги OOS в логиты и почему это не прогноз будущих убытков