Brier score и log loss для вероятностных прогнозов
Сравните Brier score и log loss для бинарных вероятностных прогнозов, узнайте, как их рассчитывать, и разберитесь в proper scoring, калибровке и качестве прогнозов
В этом руководствеДоля верных прогнозов не учитывает предсказанную вероятность
Краткое резюме
Вероятностный прогноз показывает, насколько вероятно событие, а не только какой исход наиболее вероятен. Brier score и log loss сопоставляют такие вероятности с уже наступившими исходами. Оба показателя являются proper scoring rules, но по-разному штрафуют ошибки. Поэтому меньший score имеет смысл только тогда, когда заранее зафиксированы событие, выборка, способ расчёта и ориентир для сравнения.
Доля верных прогнозов не учитывает предсказанную вероятность
Представьте, что вы записываете, правильно ли модель предсказала «рост» или «снижение». Доля верных прогнозов считает одинаковыми верный прогноз с вероятностью 51% и верный прогноз с вероятностью 99%. Она также не различает ошибочные прогнозы с вероятностями 49% и 1%. Так теряется информация об уверенности, хотя она может быть важна, когда решения связаны с разными выплатами или рисками.
Бинарный вероятностный прогноз присваивает значение \(p_t\) от нуля до единицы чётко определённому событию в момент прогноза \(t\). Если событие происходит, ему соответствует \(y_t=1\), иначе \(y_t=0\). Scoring rule оценивает прогноз вместе с результатом. Brier score использует квадрат ошибки вероятности, а log loss — отрицательный логарифм вероятности, назначенной фактически наступившему исходу.
Эти показатели помогают сравнивать вероятностные прогнозы, в том числе вероятности событий, рассчитанные торговой моделью. Сами по себе они не показывают, откалиброван ли прогноз, превосходит ли он разумный ориентир и принесёт ли торговля на его основе прибыль. Руководство по Mincer–Zarnowitz рассматривает другую линейную регрессию для проверки калибровки числовых точечных прогнозов.
Определите событие и сопоставьте каждый прогноз с его исходом
До расчёта score определите событие так, чтобы его можно было однозначно разрешить. Вопрос «подорожает ли актив?» неполон без указания актива, источника цены, времени начала и окончания, валюты, правила расчёта доходности и обработки пропущенных или исправленных записей. Для экономического события запишите публикацию и версию данных, по которым определяется исход. Не сравнивайте прогнозы, рассчитанные по разным определениям или наборам дат.
Сохраняйте каждый прогноз в том виде, в котором он был доступен на момент его выпуска. Вероятность, опубликованная в момент \(t\), должна опираться только на информацию, доступную до установленного cutoff, и сопоставляться с исходом на том же горизонте. Пересмотренный ряд данных, более поздняя цена закрытия биржи или правило классификации, выбранное после просмотра результата, могут незаметно изменить target или добавить информацию из будущего.
Для rolling forecasts сохраняйте версию модели, версию входных данных, timestamp, вероятность и правило определения исхода. При сравнении моделей используйте одни и те же forecast origins. Если вероятность отсутствует, задокументируйте исключение и применяйте одинаковое правило выборки ко всем вариантам. Тогда score можно воспроизвести, а не просто прочитать в изменяющейся таблице.
Рассчитайте Brier score по квадратам ошибок вероятности
Для одного бинарного события Brier loss в случае \(t\) равен:
BSₜ = (pₜ − yₜ)²
Средний Brier score по \(n\) прогнозам равен:
BS = (1/n) Σₜ (pₜ − yₜ)²
Меньше — лучше, ноль означает идеальный прогноз, а в этой конвенции для одного события score лежит между нулём и единицей. Например, если прогноз равен \(p=0.70\) и событие произошло, loss составляет \((0.70-1)^2=0.09\). Если после того же прогноза событие не произошло, loss равен \((0.70-0)^2=0.49\). Ошибка, сделанная с высокой уверенностью, обходится дороже умеренной ошибки, но штраф ограничен.
Проверяйте формулу при сравнении опубликованных значений. Некоторые конвенции суммируют квадраты ошибок по всем категориям прогноза с несколькими исходами; для двух категорий такая векторная сумма может вдвое превышать loss для одного события, приведённый выше. Умножение всех score на два не меняет ранжирование моделей для одного события, но численные значения разных конвенций несопоставимы без указания масштаба.
Рассчитайте log loss и разберитесь, почему крайние ошибки особенно заметны
Для бинарного события log loss определяется так:
LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]
Если событие произошло, loss равен \(-\log(p_t)\); если не произошло — \(-\log(1-p_t)\). Поэтому верный прогноз с вероятностью 70% получает \(-\log(0.70)\approx0.357\), а такой же, но ошибочный прогноз — \(-\log(0.30)\approx1.204\). Средний log loss усредняет штрафы для отдельных случаев и не имеет фиксированной верхней границы, если прогноз назначает почти нулевую вероятность событию, которое произошло.
При \(p=0\) или \(p=1\) уверенный, но ошибочный прогноз даёт бесконечный log loss. Если программа обрезает вероятности до небольшого нижнего порога, например \(\varepsilon\), чтобы избежать бесконечности, укажите этот порог и применяйте его одинаково до просмотра исходов. Clipping меняет численное правило оценки, поэтому его нельзя скрывать как техническую деталь очистки данных.
Brier score и log loss могут по-разному ранжировать одни и те же прогнозы, поскольку их штрафные кривые различаются. Log loss особенно сильно штрафует почти нулевую вероятность для произошедшего события; бинарный Brier loss ограничен единицей. Выберите основной score заранее. Если решения зависят от крайних вероятностей, можно показать оба показателя, а не выбирать постфактум более выгодный.
<!-- learn:illustration -->

Proper scoring поощряет честные вероятности в среднем
Score является proper, если прогнозист максимизирует ожидаемое вознаграждение или минимизирует ожидаемый убыток, сообщая вероятность, в которую действительно верит. Если именно эта честная вероятность является единственным оптимумом, score называется strictly proper. По стандартным определениям Brier score и логарифмический score strictly proper для бинарных вероятностных прогнозов (Gneiting и Raftery, 2007). Это даёт теоретическое основание оценивать вероятности, а не сначала превращать их в жёсткие метки.
Свойство proper относится к математическому ожиданию, а не гарантирует результат для каждой наблюдаемой выборки. Прогнозист, честно сообщивший вероятность 70%, всё ещё может ошибиться в конкретном случае и получить худший score на конечной выборке, чем тот, кто угадал. Для оценки среднего качества нужны повторяющиеся сопоставимые прогнозы. Важны и стимулы: отдельное правило выплат означает, что один score не гарантирует соответствие сообщённой вероятности убеждениям человека.
Ни один из двух показателей не измеряет только калибровку. Агрегированный score может сочетать близость вероятностей к наблюдаемым частотам и способность различать случаи с разными исходами. Модель может выдавать чётко разделённые прогнозы и при этом систематически быть некалиброванной; модель, всегда сообщающая базовую частоту, может быть откалибрована в целом, но давать мало информации о каждом отдельном случае.
Интерпретируйте разложение Brier через reliability, resolution и uncertainty
Разложение Murphy делит средний Brier score на три слагаемых (Murphy, 1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)):
BS = reliability − resolution + uncertainty
Пусть прогнозы со схожими вероятностями объединены в группы \(k\). Тогда \(w_k\) — доля группы в выборке, \(\bar p_k\) — средняя прогнозная вероятность, \(\bar y_k\) — наблюдаемая частота события, а \(\bar y\) — общая частота события. Компоненты по bins имеют вид:
reliability = Σₖ wₖ(̅pₖ − ̅yₖ)² resolution = Σₖ wₖ(̅yₖ − ̅y)² uncertainty = ̅y(1 − ̅y)
Меньшая ошибка reliability лучше: прогнозы внутри группы должны соответствовать наблюдаемой частоте в этой группе. Более высокая resolution лучше: частоты событий в группах должны отличаться от общего базового уровня. Uncertainty отражает, как часто событие происходит в выборке, и не является заслугой модели. Разложение объясняет, почему у двух моделей может быть одинаковый Brier score, но разные сильные стороны.
Эмпирическое разложение является точным, если вместе сгруппировать случаи с одинаковой опубликованной вероятностью. При разбиении непрерывных вероятностей на bins разложение точно для укрупнённого прогноза, но не для различий исходных вероятностей, потерянных внутри интервалов. Группировка требует выбрать границы bins. Reliability diagram с десятью равными интервалами может отличаться от диаграммы с квантильными bins, особенно на малой выборке или у краёв диапазона вероятностей. Показывайте число наблюдений и uncertainty для каждого bin; используйте разложение как диагностику, а не способ устранить ошибку выборки. График калибровки не является независимым доказательством будущей надёжности.
Выберите ориентир, прежде чем называть score показателем skill
Более низкий raw score, чем у другой модели, — это сравнение, но ещё не утверждение об улучшении относительно полезного baseline. Brier skill score сравнивает систему прогнозирования с явно названным reference forecast:
BSS = 1 − BS_model / BS_reference
При таком определении ноль означает равенство с reference, положительное значение — улучшение, отрицательное — худший результат. Значение один означает, что Brier loss модели равен нулю, если loss reference положителен. Выберите reference с учётом решения и доступной информации. В зависимости от задачи подойдут фиксированная историческая базовая частота, частота события в обучающем окне или уже используемая процедура прогнозирования.
Не рассчитывайте reference по будущим результатам оценки, если во время выпуска прогноза они были недоступны. Для временного ряда expanding или rolling историческая частота может быть более чистым operational baseline, чем частота по всей выборке. Если reference score равен нулю, отношение не определено; объясните построение benchmark и приведите raw score модели и ориентира.
Brier skill score зависит от reference и частоты события. Score относительно безусловного прогноза базовой частоты отвечает на другой вопрос, чем score относительно текущей production model. Не сравнивайте BSS между исследованиями, не проверив определения событий, reference forecasts, периоды выборки и бинарные или многокатегорийные конвенции.
Сравнивайте модели на парных out-of-sample результатах
Формируйте вероятности в хронологическом порядке и оставьте период оценки, который не использовался для настройки модели, выбора признаков или порога. Оценивайте все модели на одних и тех же разрешившихся событиях и origins. Для выбранного loss определите парную разность:
dₜ = Lₐ,ₜ − Lᵦ,ₜ
При таком знаке положительное среднее означает, что у модели B был ниже средний loss. Подход Diebold–Mariano позволяет проверить среднюю разность loss, если предпосылки сравнения прогнозов и оценка дисперсии подходят к дизайну. Если вопрос в том, меняется ли относительный score в зависимости от условий, известных в момент прогноза, это условное сравнение рассматривается в руководстве Giacomini–White. Повторяющиеся origins, перекрывающиеся окна событий и перебор моделей могут сделать разности зависимыми или отобранными; наивная стандартная ошибка или одна нескорректированная p-value могут преувеличить силу доказательств.
До просмотра результатов зафиксируйте событие, горизонт, выборку, основной score, benchmark и направление сравнения. Укажите средние Brier и log loss, объём выборки, определения модели и reference, правило clipping, а также корректировки зависимости или перебора. Reliability plot и парные разности score рядом с агрегатом помогают объяснить изменения. Методы объединения прогнозов позволяют комбинировать прогнозы, но итоговую комбинацию тоже нужно оценивать на периоде, который не использовался для её выбора.
У score разные единицы измерения. Разность Brier в 0.01 напрямую не равна разности log loss в 0.01. Более низкий score также не доказывает правильность базовой вероятностной модели; это свидетельство о прогнозах, проверенных на указанных исходах.
Отделяйте качество прогноза от прибыльности торговли
Вероятность помогает принять торговое решение только через правило, которое преобразует её в действие. Результат также зависит от размера выплат, убытков при ошибке, цен исполнения, spreads, комиссий, slippage, funding, затрат на заём, лимитов капитала и момента, когда прогноз можно использовать для сделки. Proper score оценивает вероятностный прогноз; он не включает эти затраты и не выбирает размер позиции.
Модель может улучшить средний log loss, но не конкретное торговое правило: оно может торговать только в определённом диапазоне вероятностей или учитывать другой горизонт. И наоборот, полезный сигнал для решения может быть сосредоточен в небольшой группе случаев и слабо влиять на общий score. После оценки прогноза отдельно проверьте заранее заданное правило принятия решений на датах, не использованных при его выборе, с реалистичными чистыми доходностями и оценками uncertainty.
Хороший отчёт позволяет другому исследователю воспроизвести событие, вероятность, исход, формулу и конвенцию score, reference, выборку и время оценки. В нём следует указать, были ли вероятности out-of-sample, перекрываются ли исходы, как обработаны пропуски и сколько альтернативных моделей или вариантов score проверялось. Такая дисциплина делает прогнозный score полезным, не превращая его в обещание будущей прибыли.
Частые вопросы
Q1Всегда ли более низкий Brier score лучше?
Да, если совпадают определение события, выборка, конвенция scoring и кодирование исхода. Показатели для разных событий или многокатегорийных конвенций могут быть напрямую несопоставимы.
Q2Доказывает ли хороший Brier score, что вероятности откалиброваны?
Нет. Агрегированный Brier score объединяет reliability, resolution и uncertainty события. Проверяйте также диагностику калибровки и неопределённость выборки.
Q3Что выбрать: Brier score или log loss?
Выберите показатель до оценки результатов. Brier loss ограничен и использует квадрат ошибки вероятности; log loss сильнее наказывает за ошибочные вероятности, заявленные с высокой уверенностью. Выбор зависит от последствий задачи и требуемой чувствительности.
Q4Означает ли улучшение вероятностного score, что торговая стратегия прибыльна?
Нет. Score оценивает прогнозы, а не решения с учётом выплат, торговых издержек, финансирования, размера позиции и выбора модели. Первичные исследования - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)
Источники и дополнительное чтение
Сообщить о проблеме
Мы подготовим письмо со ссылкой на эту статью. Mark получит сообщение только после отправки
Быстрая проверка
Прочитали руководство? Проверьте себя в 3 вопросах
Вопрос 01
После прогноза 70% происходит бинарное событие. Чему равен Brier loss по конвенции одного события?
Выберите ответ, чтобы увидеть объяснение