Бэктестирование VaR: тесты Купиеца и Кристофферсена
Разберитесь, как тест POF Купиеца и тесты Кристофферсена оценивают превышения VaR, как прочитать пример на 250 днях и почему неотклонение гипотезы не доказывает точность модели.
В этом руководствеЧто проверяет бэктест VaR?
Краткое резюме
При бэктестировании VaR каждый прогнозный порог убытка сравнивают с последующим фактическим убытком. Тест Купиеца проверяет, соответствует ли число превышений целевой частоте. Тесты Кристофферсена также проверяют, возникают ли превышения независимо или группируются. Они оценивают разные свойства прогноза, и ни один из них не доказывает правильность модели риска.
Что проверяет бэктест VaR?
Value at Risk (VaR, стоимость под риском) — это порог убытка для заданного уровня доверия и горизонта. Если однодневный VaR на уровне 99% равен 10 000 долларов, модель при своих предположениях и доступной ей информации оценивает вероятность убытка за день свыше этой суммы в 1%. Это не верхняя граница возможного убытка и не оценка того, насколько большим он может стать после превышения порога.
При бэктестировании ряд прогнозов и результатов переводят в индикаторы превышений. Для корректной модели однодневного VaR 99% доля таких событий в повторяющихся сопоставимых наблюдениях должна быть около 1%. Здесь есть два разных требования: долгосрочная частота должна быть близка к целевой, а последовательность событий не должна противоречить условному прогнозу риска. Тест доли неудач (POF) Купиеца сосредоточен на первом требовании. Тест независимости и тест условного покрытия Кристофферсена учитывают и порядок событий.
Различие имеет практическое значение. За год модель может дать четыре превышения, причем все четыре случатся в одну турбулентную неделю. Другая модель может дать те же четыре случая, равномерно распределенные по году. Тест, учитывающий только число, увидит четыре в обоих случаях; тест временного рисунка увидит разные ряды. Эти методы помогают описать отдельные характеристики прогноза, но не заменяют проверку позиций, рыночных данных, предположений и размера убытков. О том, как модели GARCH описывают кластеризацию волатильности, читайте в руководстве «Кластеризация волатильности и модели GARCH»: модель волатильности описывает динамику риска, а бэктест сопоставляет прогноз с реализацией.
Сначала определите событие превышения
Используйте одно соглашение о знаках на протяжении всего анализа. Пусть Lₜ — фактический убыток в день t, а VaRₜ|ₜ₋₁ — однодневный порог убытка, рассчитанный до начала дня t. Индикатор Iₜ равен 1, если Lₜ > VaRₜ|ₜ₋₁, и 0 в противном случае. Для VaR 99% целевая вероятность превышения составляет α = 1 − 0,99 = 0,01. В некоторых источниках индикатор задают через доходность или определяют событие покрытия интервала; после согласованного изменения знака и вероятности это эквивалентные соглашения. Явно укажите, какое используете.
Прогноз и исход должны относиться к одному портфелю, горизонту, моменту оценки и определению убытка. Если прогноз составлен после закрытия торгов на следующий день, сравните его с убытком за этот следующий день по заранее установленному правилу оценки. До анализа решите, как учитывать равенство порогу VaR, праздники, пропуски, закрытие рынка, внутридневные исправления данных и изменения портфеля. При редких превышениях даже одно различие в классификации может заметно изменить результат.
Разделяйте подбор модели и итоговую оценку. Если параметры или пороги риска настраивали после просмотра того же периода, который используется в тесте, p-значение уже не является чистой проверкой вне обучающей выборки. Для скользящих прогнозов фиксируйте время их выпуска и доступную на тот момент информацию. Перекрывающиеся многодневные прогнозы могут создавать зависимость между индикаторами превышений. Стандартные тесты ниже не исправляют автоматически несогласованные горизонты, утечку будущей информации, пересмотр входных данных или последствия выбора модели.
На какой вопрос отвечает тест POF Купиеца?
Пусть имеется T сопоставимых пар «прогноз—результат» и x превышений. Наблюдаемая доля равна p̂ = x/T. Тест доли неудач Купиеца (работа Купиеца 1995 года), также называемый тестом безусловного покрытия, сравнивает два биномиальных правдоподобия: в первом вероятность превышения зафиксирована на целевом уровне α, во втором она свободно оценивается как p̂. Статистика отношения правдоподобий:
LRᵤ꜀ = −2 ln [ (1−α)^(T−x) α^x / ((1−p̂)^(T−x) p̂^x) ].
При нулевой гипотезе индикаторы превышений — независимые испытания Бернулли с вероятностью α. Для достаточно большой выборки статистика приближенно имеет распределение хи-квадрат с одной степенью свободы. Большое значение дает основание отвергнуть заданную частоту. Поскольку альтернатива свободно оценивает наблюдаемую долю, тест может отвергнуть гипотезу как при избытке, так и при недостатке превышений. Почти никогда не нарушающий порог VaR прогноз не обязательно хорошо откалиброван: он может быть чрезмерно консервативным и непригодным для своей цели.
POF использует количество x, но не даты превышений. Перестановка тех же индикаторов не меняет статистику. Поэтому по одному результату POF нельзя понять, были ли четыре превышения разнесены во времени или шли подряд. Биномиальный эталон также опирается на независимость индикаторов. Если важна кластеризация, добавьте тест зависимости, а не пытайтесь вывести ее из POF.
Пример на 250 днях показывает, как читать p-значение
Рассмотрим условный ряд из 250 однодневных прогнозов VaR 99%. Целевая вероятность α = 0,01, поэтому ожидаемое число превышений при нулевой гипотезе равно Tα = 250 × 0,01 = 2,5. Допустим, превышений было четыре. Тогда p̂ = 4/250 = 0,016, или 1,6%. Это выше целевого 1%, но одного различия недостаточно, чтобы решить, отвергается ли гипотеза по отношению правдоподобий.
Подстановка T = 250, x = 4 и α = 0,01 дает LRᵤ꜀ ≈ 0,769. По асимптотическому распределению хи-квадрат(1) p ≈ 0,38; критическое значение для уровня 5% — около 3,84. Согласно этой аппроксимации пример не отвергает безусловное покрытие на уровне 5%. Это условный расчет для иллюстрации, а не эмпирический результат или универсальный критерий приемки.
Два логарифма правдоподобия показывают происхождение статистики. При фиксированной целевой частоте ℓ₀ = 246 ln(0,99) + 4 ln(0,01) ≈ −20,893. При свободной оценке наблюдаемой частоты ℓ₁ = 246 ln(0,984) + 4 ln(0,016) ≈ −20,508. Второе значение выше примерно на 0,385 логарифмической единицы, поэтому LRᵤ꜀ = −2(ℓ₀ − ℓ₁) ≈ 0,769. Тест измеряет потерю соответствия модели с целевой частотой, а не ошибку в долларах.
Неотклонение не устанавливает, что модель хорошо откалибрована. При ожидании всего 2,5 превышения за 250 дней одно-два события заметно меняют наблюдаемую долю. Расчет по хи-квадрат асимптотический, а мощность теста редких событий на такой выборке может быть низкой. Сопоставляйте статистику с ожидаемым числом, горизонтом прогноза, дизайном теста и размером выборки. p-значение — не вероятность того, что VaR-модель верна.
За одинаковым числом превышений может скрываться разный порядок
Сравним две условные последовательности из 250 дней, каждая с четырьмя превышениями. В A они приходятся на дни 20, 80, 140 и 220. В B — на дни 60, 61, 180 и 181. В обеих последовательностях x = 4 и p̂ = 1,6%, поэтому статистика Купиеца одинакова. Но в B есть две соседние пары превышений, а в A таких пар нет.
Схема ниже объясняет, почему важно сохранять порядок индикаторов, а не только их сумму. Это концептуальная иллюстрация, не реальные данные за 250 дней и не результат теста. Несколько подряд идущих превышений могут быть поводом проверить, успевает ли модель реагировать на изменение волатильности, однако по нескольким точкам нельзя установить причину. Возможны неверная спецификация модели, рыночный шок, изменение портфеля, перекрывающиеся горизонты либо правила данных и времени оценки.
Обозначим nᵢⱼ число переходов, когда предыдущий индикатор равен i, а текущий — j; 0 означает отсутствие превышения, 1 — наличие. Полные таблицы переходов таковы: для A n₀₀ = 241, n₀₁ = 4, n₁₀ = 4, n₁₁ = 0; для B n₀₀ = 243, n₀₁ = 2, n₁₀ = 2, n₁₁ = 2. В обеих последовательностях четыре события, но в B два превышения следуют сразу за предыдущим. Именно эту информацию использует тест независимости первого порядка.
Вероятность превышения после спокойного дня оценивается как n₀₁/(n₀₀+n₀₁), а после дня с превышением — как n₁₁/(n₁₀+n₁₁). Для A это 4/245 ≈ 1,63% и 0/4. Для B — 2/245 ≈ 0,82% и 2/4 = 50%. Оценка 50% опирается лишь на четыре перехода после превышения: это свойство крошечного условного примера, а не достоверная оценка риска реальной модели на следующий день.

Что добавляет тест независимости Кристофферсена?
Тест независимости Кристофферсена (статья 1998 года) сравнивает вероятность превышения после спокойного дня с вероятностью после дня с превышением. Пусть π₀ = Pr(Iₜ = 1 | Iₜ₋₁ = 0), а π₁ = Pr(Iₜ = 1 | Iₜ₋₁ = 1). Нулевая гипотеза независимости утверждает π₀ = π₁: статус превышения вчера не меняет вероятность события сегодня. При альтернативе обе вероятности оценивают отдельно по n₀₀, n₀₁, n₁₀ и n₁₁.
Статистика отношения правдоподобий независимости сопоставляет эти модели и обычно сравнивается с распределением хи-квадрат с одной степенью свободы. В отличие от POF она зависит от порядка индикаторов. Если после превышения часто бывает следующее, π₁ может быть выше π₀. Тест касается зависимости первого порядка в бинарной последовательности, а не всех способов, которыми прошлые данные, волатильность или состояние портфеля могут предсказывать будущие убытки.
При небольшом числе превышений оценки переходов особенно нестабильны. Если последовательных событий не было, оценка π₁ может оказаться на границе и равняться нулю. Это не доказывает невозможность второго превышения — лишь показывает, что в данной выборке оно не наблюдалось. Изучайте переходы вместе со статистикой и размером выборки. Редкую таблицу нельзя трактовать как точную оценку будущего хвостового риска.
Условное покрытие объединяет частоту и независимость
Тест условного покрытия складывает статистику частоты Купиеца и статистику независимости Кристофферсена: LR꜀꜀ = LRᵤ꜀ + LRᵢₙd. Совместная нулевая гипотеза состоит в том, что вероятность превышения равна α и события независимы во времени. В стандартной асимптотической постановке сумму сравнивают с хи-квадрат распределением с двумя степенями свободы.
Показывайте компоненты отдельно от общего результата. Отвержение условного покрытия означает, что совместные требования не согласуются с наблюдаемой последовательностью при предположениях теста, но не указывает причину. Если POF отвергается, а независимость — нет, более явным сигналом может быть число превышений. Если отвергается независимость, стоит изучить временную кластеризацию даже при частоте около целевой. Если обе гипотезы не отвергнуты, выборка все равно может быть слишком короткой, чтобы обнаружить ошибку модели.
Интерпретация узкая: каждый дневной убыток сводится к бинарному признаку. Тест не различает превышение на один доллар и на миллион долларов, не проверяет все распределение убытков и не подтверждает точность Expected Shortfall. О различии вопросов, на которые отвечают VaR и Expected Shortfall, читайте в руководстве «VaR и Expected Shortfall».
Редкие превышения затрудняют выводы по короткой выборке
При VaR 99% за 250 дней ожидается всего 2,5 превышения. Для независимых событий с вероятностью 1% ожидаемое число переходов «превышение—превышение» среди 249 соседних пар составляет примерно 249 × 0,01² = 0,025. Даже у правильно откалиброванной модели в большинстве таких выборок не будет ни одной пары последовательных превышений. Поэтому переходные вероятности трудно оценить точно, а мощность теста зависимости может быть низкой.
Кристофферсен и Пеллетье отмечают, что у существующих тестов VaR может быть низкая мощность на реалистичных коротких выборках, и изучают тесты длительности, моделирующие время между превышениями. Это основание рассмотреть дополнительную диагностику, но не доказательство всеобщего превосходства теста длительности и не отмена необходимости согласовать метод с прогнозом риска и дизайном выборки. При малом числе наблюдений прямо указывайте ограничение, а не принимайте неотклонение за справку о безупречности.
Имеет значение и целевая вероятность. Для VaR 95% на 250 днях ожидается 12,5 превышения, а для VaR 99,9% — 0,25. Одинаковое название теста не означает одинаковую силу доказательств в разных постановках. Указывайте уровень доверия, горизонт, число наблюдений, целевое и фактическое количество событий, переходы и то, использовали ли вы асимптотический расчет или метод для конечной выборки.
Когда нужны другие диагностические методы?
Выбирая следующий тест, спросите, какую информацию отбрасывают два базовых метода. Если нужно проверить, предсказываются ли превышения лагированными событиями, прогнозом VaR или другими переменными, известными к моменту прогноза, динамический квантильный тест (DQ) Энгла и Манганелли (CAViaR, 2004) проверяет ограничения для центрированного индикатора и выбранного набора факторов. Вывод зависит от набора факторов и от того, были ли они доступны к моменту прогноза; DQ не проверяет все мыслимые условные сбои. Тест длительности вместо этого анализирует интервалы ожидания между событиями.
Если важна величина убытка за порогом VaR, частоты и независимости недостаточно. Изучите размеры превышений и подберите оценку Expected Shortfall, соответствующую прогнозу и предположениям. Если проблема в выборе лучшего результата после перебора множества моделей, бэктест VaR ее не решает. В руководстве «PBO и CSCV» описана отдельная диагностика рангового выбора среди кандидатов.
В полезном отчете укажите портфель и определение убытка, горизонт, уровень доверия, даты оценки, способ построения прогнозов, правило превышения, ожидаемое и фактическое число событий, статистику POF, переходы, результаты тестов независимости и условного покрытия, а также ограничения короткой выборки и перекрывающихся горизонтов. Покажите временной график порогов и реализованных убытков; не используйте будущий оценочный период при выборе модели. Это делает выводы о прошлом понятнее, но не гарантирует контроль риска в будущем.
Частые вопросы
Q1Если тест Купиеца не отвергает гипотезу, значит ли это, что модель VaR точна?
Нет. Это означает, что при предположениях теста не найдено достаточно свидетельств против заданной частоты превышений. В короткой выборке, особенно при доверии 99% и выше, событий может быть слишком мало, чтобы выявить проблему.
Q2Могут ли две модели с одинаковым результатом теста Купиеца иметь разные последовательности превышений?
Да. Статистика Купиеца зависит от числа, а не от порядка событий. Тест независимости Кристофферсена добавляет информацию о кластеризации превышений в соседних наблюдениях.
Q3Показывают ли эти тесты размер убытка после превышения VaR?
Нет. Они используют индикатор превышения и не измеряют величину сверхпорогового убытка. Если важен размер хвостового убытка, изучите его отдельно и оцените Expected Shortfall.
Источники и дополнительное чтение
Сообщить о проблеме
Мы подготовим письмо со ссылкой на эту статью. Mark получит сообщение только после отправки
Быстрая проверка
Прочитали руководство? Проверьте себя в 3 вопросах
Вопрос 01
Какую характеристику использует тест POF Купиеца?
Выберите ответ, чтобы увидеть объяснение
Словарь опционов
The average loss from a chosen VaR quantile through the worst tail under a precise convention; it measures severity beyond the threshold rather than only its location.
Читать подробное руководствоGARCHA time-series model that updates conditional variance from past squared shocks and prior variance; it models volatility persistence, not return direction.
Читать подробное руководствоназначение опционаПроцесс, при котором после уведомления об исполнении обязанность выполнить контракт распределяется на продавца опциона и может создать поставку или покупку акций.
Читать подробное руководство