Преобразование интеграла вероятности: калибровка прогнозов плотности
Узнайте, как PIT оценивает непрерывные и дискретные прогнозы плотности, что показывает гистограмма и почему одной равномерности недостаточно
В этом руководствеПочему для прогноза плотности недостаточно точечной ошибки
Краткое резюме
Прогноз плотности задаёт вероятности для диапазона возможных результатов. Преобразование интеграла вероятности (PIT) переводит каждый наблюдённый результат в его накопленную вероятность согласно прогнозу. При заданных предпосылках равномерные значения PIT полезны для диагностики, но плоская гистограмма сама по себе не доказывает условную калибровку или независимость во времени.
Почему для прогноза плотности недостаточно точечной ошибки
Точечный прогноз может ожидать доходность завтра на уровне 0,2%. Прогноз плотности задаёт вероятности для полного диапазона доходностей — от обычных колебаний до экстремальных событий. Поэтому проверяют, согласуется ли распределение, выпущенное до наблюдения результата, с последующими данными. Руководство Mincer–Zarnowitz посвящено линейной калибровке числовых точечных прогнозов — это другой вопрос.
PIT измеряет накопленную вероятность, назначенную значениям не выше реализации. Это вероятностный ранг, а не доходность, торговый сигнал или мера прибыли. Руководство Diebold–Mariano сравнивает средние потери прогнозов по выбранной функции оценки; оно не проверяет калибровку плотности.
Преобразуйте непрерывный прогноз через функцию распределения
Пусть (Y_{t+1}) — результат после момента прогноза (t), а (F_{t+1}(y\mid\mathcal I_t)) — прогнозная функция распределения (CDF), основанная только на доступной тогда информации (\mathcal I_t). Для непрерывного распределения вычисляют
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ)
CDF задаёт вероятность значений, не превышающих (y). Если прогнозная CDF является истинным условным распределением, теорема PIT даёт
Pr(Uₜ₊₁ ≤ u | 𝓘ₜ) = u, for 0 ≤ u ≤ 1
Значит, идеальный непрерывный прогноз на один шаг даёт PIT, равномерную условно на прогнозную информацию. В последовательной схеме, где информационный набор включает прошлое, идеальные значения PIT также независимы между моментами прогноза при соответствующих предпосылках. Преобразование изучал Rosenblatt; Diebold, Gunther и Tay применили последовательности PIT к оценке прогнозов плотности (1952; 1998).
Проверяемый пример: прогноз (N(0,1)) и наблюдение (y=1) дают (Phi(1)\approx0.8413), то есть около 84,13% вероятности значений до 1. Одного наблюдения недостаточно для оценки калибровки — нужна последовательность.
Рандомизируйте преобразование для дискретных результатов
Дискретная CDF имеет скачки в возможных исходах. Поэтому обычное (F(Y)) принимает лишь некоторые уровни и обычно не является равномерным даже при верном прогнозе. Рандомизированное PIT заполняет каждый интервал скачка:
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ) + Vₜ₊₁ [Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ) − Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ)]
(F(y^-)) — левый предел, то есть вероятность значения строго меньше (y); (V) — независимое Uniform(0,1), используемое только для оценки. Для непрерывного распределения скачок равен нулю и формула сводится к (F(Y)). Brockwell доказывает рандомизированное преобразование для произвольных, в том числе дискретных и смешанных, распределений (2007). Для упорядоченных данных счёта Czado, Gneiting и Held также рассматривают нерандомизированное PIT и диаграммы маргинальной калибровки; дискретные значения (F(Y)) нельзя оценивать как непрерывно-равномерные (2009).
Гипотетический пример Бернулли: (P(Y=1)=0.20), (P(Y=0)=0.80). Обычное PIT равно 0,80 при (Y=0) и 1,00 при (Y=1), поэтому оно неравномерно. После рандомизации (Y=0) даёт (0.80V) на ([0,0.80]), а (Y=1) — (0.80+0.20V) на ([0.80,1]). С учётом вероятностей исходов общая плотность равномерна на ([0,1]). Случайная величина нужна для оценки, а не входит в прогноз.
Различайте маргинальную равномерность, независимость и условную калибровку
Маргинальная равномерность PIT необходима для идеальных непрерывных прогнозов, но недостаточна. Противоположные ошибки в разных режимах могут компенсироваться при объединении данных, оставляя плоскую гистограмму. Gneiting, Balabdaoui и Raftery показывают, что почти равномерное PIT может сочетаться со смещёнными отдельными прогнозами (2007).
Важен и порядок: равномерная гистограмма может скрывать серийную зависимость, например кластеры или длинные серии близких значений. Идеальные условные прогнозы предполагают больше, чем объединённая равномерность. Для перекрывающихся горизонтов эталонное распределение должно учитывать перекрытие; iid-тест подходит не автоматически.
Проверяйте распределение PIT и его связь со временем, лагами, переменными на момент прогноза и заранее заданными режимами. Групповые графики или условные тесты выявляют скрытые закономерности, но выбор условий и конечная выборка накладывают ограничения. Набор конечного размера не докажет калибровку для всех возможных условных переменных.
Считайте гистограмму PIT подсказкой, а не вердиктом
U-образная форма часто согласуется с чрезмерно концентрированным прогнозом или недостаточной дисперсией; центральный горб — с чрезмерно рассеянным прогнозом. Асимметрия может указывать на смещение положения. Это эвристики, а не однозначные диагнозы: зависимость, смесь режимов, дискретность, разбиение на интервалы и малая выборка могут ввести в заблуждение.
Гистограмма теряет временной порядок и не показывает начало проблемы, кластеры экстремальных значений или некалиброванную подгруппу. Широкие интервалы могут скрыть нехватку данных, узкие — выглядеть неровными из-за шума. Указывайте число прогнозов, границы интервалов и по возможности неопределённость. Подходы Diebold–Gunther–Tay и Berkowitz — примеры тестов, чьи предпосылки должны соответствовать дизайну. Berkowitz преобразует внутреннее PIT в (Z_t=\Phi^{-1}(U_t)) и проверяет совместную нулевую гипотезу независимых стандартно-нормальных значений против заданной динамической альтернативы, например AR(1). Это не универсальный сертификат (2001).
<!-- learn:illustration -->

Учитывайте оценивание и проверяйте вне выборки
Результат об равномерности предполагает, что CDF — истинный условный закон. На практике параметры оценивают, семейство распределений выбирают, пороги и признаки настраивают. Поэтому прогноз (F_{t+1}(\cdot;\hat\theta_t)) — часть процедуры прогнозирования. Подгонка модели по результатам периода оценки с последующим представлением PIT как нетронутого свидетельства вне выборки приводит к утечке информации.
При скользящей оценке используйте только информацию, доступную на каждом прогнозном шаге. Фиксируйте окно оценивания, частоту переоценки, версии данных и модели, этапы отбора. Соседние окна часто делят наблюдения, а перекрывающиеся результаты добавляют зависимость.
Размер и мощность теста зависят от оценивателя, выборки и процедуры. Гистограмма PIT не учитывает неопределённость параметров; учебные iid-ориентиры подходят не всякому оценённому или перекрывающемуся дизайну. Для важных выводов выберите подходящий тест или симулируйте/bootstrap-ируйте нулевую гипотезу, повторяя всю процедуру оценки и прогноза. При необходимости оставьте финальную выборку вне отбора модели.
Отличайте калибровку от резкости
Калибровка описывает связь прогноза с исходом: происходят ли события с заданной вероятностью с соответствующей частотой? Резкость — концентрацию самих прогнозных распределений без учёта результатов. Gneiting, Balabdaoui и Raftery считают резкость желательной при условии калибровки, но не её заменой.
Широкий прогноз может быть откалиброван, но малоинформативен. Узкий прогноз выглядит точным, однако может быть плохо откалиброван, если исходы часто выходят за пределы его вероятностной массы. PIT проверяет согласованность распределения; показатели резкости описывают разброс и ширину. Один показатель не покрывает всю оценку.
Плоское общее PIT может скрывать ошибки по режимам волатильности или горизонтам. Важные условия задавайте заранее. Это связано, но не тождественно регрессии точечных прогнозов и тесту условной прогнозной способности Giacomini–White, который сравнивает потери при выбранной условной информации.
Сравнивайте полные прогнозы корректными оценками на одинаковых исходах
PIT — прежде всего диагностика, а не самостоятельный рейтинг прогнозов плотности. Логарифмическая оценка и continuous ranked probability score (CRPS) назначают скалярную потерю каждой паре «прогноз–исход»; по определению ожидаемая потеря минимальна при истинном прогнозном распределении. Среднее по одной выборке не доказывает правильность модели. Руководство Model Confidence Set рассматривает сравнение множеств. Используйте оценку для полного распределения на общих исходах.
Указывайте цель, горизонт, общие даты, соглашение о потерях и бенчмарк. Логарифмическая оценка особенно чувствительна к очень низкой плотности в наблюдаемой точке; CRPS сравнивает CDF с другой чувствительностью. Неопределённость разностей должна учитывать серийную зависимость, оценивание и поиск модели. Графики PIT и оценки дополняют друг друга.
Ни калибровка, ни лучшая оценка не доказывают торговую прибыльность. Для торгового утверждения нужны отдельные правило принятия решений, момент доступности информации, размер позиции, транзакционные и финансовые издержки и вневыборочная оценка доходностей. Статистика прогноза — не доходность бэктеста.
Используйте воспроизводимый процесс PIT
Зафиксируйте цель, горизонт, время прогноза, версию исхода и тип распределения: непрерывный, дискретный или смешанный. Сохраняйте каждую прогнозную CDF или данные для её восстановления вместе с результатом и информационным набором. Для непрерывного случая вычислите (F_t(Y_t)); для скачков документируйте рандомизированное PIT или подходящую дискретную диагностику.
Проверьте маргинальное распределение и временной порядок. Укажите интервалы, размер выборки, обработку совпадений и seed или процедуру повторной рандомизации. Добавьте тесты независимости или условные проверки под заранее определённый вопрос и используйте выводы, подходящие скользящему, перекрывающемуся или оценённому дизайну. Сравнивайте модели отдельно корректными оценками на одинаковых отложенных исходах. Вывод относится к заданным прогнозам и условиям и не гарантирует будущую калибровку или прибыль.
Частые вопросы
Q1Доказывает ли равномерное PIT правильность прогноза плотности?
Нет. Это необходимое диагностическое условие для правильного непрерывного прогноза, но общая равномерность не доказывает независимость или условную калибровку. Проверяйте временную зависимость и значимые условные переменные.
Q2Нужно ли рандомизировать PIT для дискретного прогноза?
Да, если требуется непрерывно-равномерный эталон для правильного дискретного распределения. Дополнительная случайная величина распределяет исход внутри скачка CDF. Фиксируйте метод и seed; при необходимости используйте дискретную диагностику без рандомизации.
Q3Что означает U-образная гистограмма PIT?
Часто она согласуется со слишком концентрированными прогнозами; центральный горб — со слишком рассеянными. Это подсказки, а не однозначные диагнозы: проверяйте зависимость, режимы, размер выборки и интервалы.
Q4Означает ли лучшая гистограмма PIT лучший прогнозный score?
Нет. PIT диагностирует распределительное поведение; корректные оценки сравнивают прогнозы при заданных потерях и цели. Используйте общие вневыборочные результаты и не трактуйте их как торговую прибыль. Первичные исследования - Rosenblatt, “Remarks on a Multivariate Transformation” (1952) - Diebold, Gunther, and Tay, “Evaluating Density Forecasts with Applications to Financial Risk Management” (1998) - Berkowitz, “Testing Density Forecasts, with Applications to Risk Management” (2001) - Gneiting, Balabdaoui, and Raftery, “Probabilistic Forecasts, Calibration and Sharpness” (2007) - Brockwell, “Universal Residuals: A Multivariate Transformation” (2007) - Czado, Gneiting, and Held, “Predictive Model Assessment for Count Data” (2009)
Источники и дополнительное чтение
Сообщить о проблеме
Мы подготовим письмо со ссылкой на эту статью. Mark получит сообщение только после отправки
Быстрая проверка
Прочитали руководство? Проверьте себя в 3 вопросах
Вопрос 01
Что следует из теоремы PIT для верного непрерывного условного прогноза на один шаг?
Выберите ответ, чтобы увидеть объяснение