Skip to content
Todos os guias de opções e contratos futuros
Avaliação de previsões probabilísticas12 min de leitura

Brier score versus log loss em previsões probabilísticas

Compare Brier score e log loss para previsões de probabilidade binária, aprenda a calculá-los e entenda scoring próprio, calibração e habilidade preditiva

Neste guiaA taxa de acerto descarta a probabilidade prevista

Resumo breve

Uma previsão probabilística informa a chance de um evento acontecer, e não apenas qual resultado é mais provável. Brier score e log loss comparam essas probabilidades com resultados já observados. Ambos são proper scoring rules, mas penalizam erros de maneiras diferentes. Por isso, um score menor só é significativo depois que o evento, a amostra, a convenção de cálculo e a referência foram definidos.

A taxa de acerto descarta a probabilidade prevista

Imagine registrar se um modelo acertou ao prever “alta” ou “baixa”. A taxa de acerto trata uma previsão correta de 51% da mesma forma que uma correta de 99%. Também considera iguais uma previsão errada de 49% e outra de 1%. Isso elimina a confiança expressa na previsão, embora ela possa importar quando as decisões envolvem retornos ou riscos diferentes.

Uma previsão binária de probabilidade atribui um valor \(p_t\), entre zero e um, a um evento definido com clareza na origem da previsão \(t\). Depois, registra-se \(y_t=1\) se o evento ocorrer e \(y_t=0\) caso contrário. Uma scoring rule avalia a previsão junto com o resultado. Brier score usa o erro de probabilidade ao quadrado; log loss usa o logaritmo negativo da probabilidade atribuída ao que realmente aconteceu.

Esses scores ajudam a comparar previsões probabilísticas, inclusive probabilidades de eventos geradas por um modelo de trading. Sozinhos, eles não mostram que uma previsão está calibrada, supera uma referência razoável ou geraria lucro se fosse usada para operar. O guia de Mincer–Zarnowitz apresenta outra regressão linear de calibração para previsões pontuais numéricas.

Defina um evento e alinhe cada previsão ao resultado correspondente

Antes de calcular o score, defina o evento de modo que ele possa ser apurado de forma consistente. “O ativo vai subir?” é uma pergunta incompleta sem especificar o ativo, a fonte do preço, os horários de início e fim, a moeda, a convenção de retorno e o tratamento de registros ausentes ou corrigidos. Para um evento econômico, registre a divulgação e a versão dos dados usada para determinar o resultado. Não compare previsões avaliadas com definições ou conjuntos de datas diferentes.

Guarde cada previsão tal como estava disponível em sua origem. Uma probabilidade emitida no instante \(t\) deve usar as informações disponíveis até o cutoff definido e ser associada ao resultado do mesmo horizonte. Uma série de dados revisada, um fechamento posterior da bolsa ou uma regra de classificação escolhida depois de observar o resultado podem alterar o target sem que isso fique evidente ou introduzir informação futura.

Em previsões rolling, mantenha a versão do modelo, a versão dos dados de entrada, o timestamp, a probabilidade e a regra de apuração. Use as mesmas origens para comparar modelos. Se faltar uma probabilidade, documente a exclusão e aplique a mesma regra de amostra a todos os candidatos. Esses registros tornam o score reproduzível, em vez de um resumo de uma planilha que muda.

Calcule o Brier score a partir dos erros quadráticos de probabilidade

Para um único evento binário, o Brier loss no caso \(t\) é:

BSₜ = (pₜ − yₜ)²

O Brier score médio de \(n\) previsões é:

BS = (1/n) Σₜ (pₜ − yₜ)²

Quanto menor, melhor; zero é perfeito, e essa convenção de evento único varia de zero a um. Por exemplo, se a previsão é \(p=0.70\) e o evento acontece, o loss é \((0.70-1)^2=0.09\). Se o evento não acontece depois da mesma previsão, o loss é \((0.70-0)^2=0.49\). Errar com muita confiança custa mais do que cometer um erro moderado, mas a penalidade continua limitada.

Confira a fórmula ao comparar números publicados. Algumas convenções somam os erros quadráticos de todas as categorias de uma previsão com vários resultados; no caso binário, essa soma vetorial pode ser o dobro do loss de evento único apresentado acima. Multiplicar todos os scores por dois não altera a classificação dentro do mesmo evento, mas os valores numéricos não são comparáveis entre convenções se a escala não for informada.

Calcule log loss e veja por que erros extremos pesam mais

Para um evento binário, log loss é:

LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]

Se o evento acontecer, o loss é \(-\log(p_t)\); se não acontecer, é \(-\log(1-p_t)\). Assim, uma previsão correta de 70% recebe \(-\log(0.70)\approx0.357\), enquanto a mesma previsão, quando está errada, recebe \(-\log(0.30)\approx1.204\). O log loss médio calcula a média dessas penalidades por caso e não tem um limite superior fixo quando uma previsão atribui probabilidade quase zero ao evento que acontece.

Em \(p=0\) ou \(p=1\), uma previsão errada feita com plena confiança gera log loss infinito. Se o software limita as probabilidades a um piso pequeno, como \(\varepsilon\), para evitar o infinito, informe esse piso e aplique-o de maneira consistente antes de observar os resultados. Clipping muda a regra numérica de avaliação e não deve ser escondido como um detalhe de limpeza de dados.

Brier score e log loss podem classificar as mesmas previsões de formas diferentes porque suas curvas de penalidade não são iguais. Log loss atribui um custo especialmente alto a dar probabilidade quase zero a um evento que ocorreu; o Brier loss binário é limitado a um. Escolha com antecedência qual score usar. Se as decisões dependerem de probabilidades extremas, considere mostrar ambos em vez de escolher depois o resultado mais favorável.

<!-- learn:illustration -->

Gotas de vidro azuis ficam diante de pedras âmbar que representam resultados; uma previsão muito confiante fica longe do evento ocorrido
Conceito visual de probabilidades e resultados observados, com penalidade maior para um erro confiante; sem dados de mercado, resultado de teste ou sinal de negociação

Proper scoring incentiva probabilidades honestas em expectativa

Um score é proper quando a pessoa que prevê maximiza a recompensa esperada ou minimiza a perda esperada ao informar a probabilidade em que realmente acredita. Ele é strictly proper quando esse valor honesto é o único ótimo. Pelas definições usuais, Brier e o score logarítmico são strictly proper para previsões binárias de probabilidade (Gneiting e Raftery, 2007). Isso oferece uma justificativa para avaliar probabilidades em vez de convertê-las primeiro em rótulos rígidos.

“Proper” é uma afirmação sobre a expectativa, não uma promessa para cada amostra observada. Quem informa honestamente uma probabilidade de 70% ainda pode errar em um caso e obter um score de amostra finita pior que o de alguém que chutou. Para aprender sobre o desempenho médio, são necessárias previsões repetidas e comparáveis. Incentivos também importam: se a pessoa estiver sujeita a uma regra de pagamento separada, o score por si só não garante que a probabilidade informada reflita sua crença.

Nenhum dos dois scores mede apenas calibração. Um resultado agregado pode combinar a proximidade das probabilidades às frequências observadas e a capacidade de separar casos com resultados diferentes. Um modelo pode produzir previsões bem diferenciadas e ainda estar sistematicamente mal calibrado; outro que sempre informa a taxa-base pode estar calibrado no agregado, mas fornecer pouca informação sobre cada caso.

Interprete a decomposição de Brier como reliability, resolution e uncertainty

A decomposição de Murphy separa o Brier score médio em três termos (Murphy, 1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)):

BS = reliability − resolution + uncertainty

Para grupos \(k\) de previsões com probabilidades semelhantes, \(w_k\) é a participação de cada grupo na amostra, \(\bar p_k\) é sua probabilidade média prevista, \(\bar y_k\) é a frequência observada do evento e \(\bar y\) é a frequência geral. Os componentes por bin são:

reliability = Σₖ wₖ(̅pₖ − ̅yₖ)² resolution = Σₖ wₖ(̅yₖ − ̅y)² uncertainty = ̅y(1 − ̅y)

Um erro de reliability menor é melhor: as previsões de um grupo devem corresponder à frequência observada nesse grupo. Uma resolution maior é melhor: as frequências dos eventos nos grupos devem diferir da taxa-base geral. Uncertainty reflete a frequência do evento na amostra e não é mérito do modelo de previsão. A decomposição explica por que dois modelos podem ter o mesmo Brier score, mas pontos fortes diferentes.

A decomposição empírica é exata quando são agrupados casos com a mesma probabilidade emitida. Se probabilidades contínuas forem agrupadas em bins, a decomposição é exata para a previsão agrupada, não para as diferenças entre as probabilidades originais que se perdem dentro dos bins. Agrupar exige escolher os limites dos bins. Um reliability diagram com dez bins de mesma largura pode contar uma história diferente de um com bins por quantis, especialmente em amostras pequenas ou perto dos extremos de probabilidade. Mostre a quantidade de casos e a uncertainty de cada bin; trate a decomposição agrupada como diagnóstico, não como forma de apagar o erro amostral. Gráficos de calibração não são prova independente de reliability futura.

Escolha uma referência antes de chamar um score de skill

Um raw score menor que o de outro modelo é uma comparação, mas ainda não declara uma melhora em relação a uma baseline útil. O Brier skill score compara um sistema de previsão com uma previsão de referência identificada:

BSS = 1 − BS_model / BS_reference

Por essa definição, zero equivale à referência, um valor positivo indica melhora e um negativo indica resultado pior. O valor um corresponde a Brier loss zero do modelo quando o loss da referência é positivo. Escolha uma referência adequada à decisão e ao conjunto de informações. Uma taxa-base histórica fixa, a frequência do evento na janela de treinamento ou um procedimento de previsão já utilizado podem fazer sentido em tarefas diferentes.

Não calcule a referência com resultados futuros de avaliação se eles não estariam disponíveis quando a previsão fosse feita. Em uma série temporal, uma frequência histórica expanding ou rolling pode ser uma baseline operacional mais adequada que a taxa de toda a amostra. Se o score da referência for zero, a razão não está definida; explique como o benchmark foi construído e apresente também os raw scores do modelo e da referência.

O Brier skill score depende da referência e da frequência do evento. Um score contra uma previsão incondicional da taxa-base responde a uma pergunta diferente de um score contra um modelo de produção atual. Não compare valores de BSS entre estudos sem verificar as definições dos eventos, as previsões de referência, os períodos de amostra e as convenções binárias ou multicategoriais.

Compare modelos em resultados pareados out-of-sample

Gere probabilidades em ordem cronológica e reserve um período de avaliação que não tenha sido usado para ajustar o modelo, escolher atributos ou selecionar um threshold. Avalie todos os modelos nos mesmos resultados apurados e nas mesmas origens. Para o loss escolhido, defina a diferença pareada assim:

dₜ = Lₐ,ₜ − Lᵦ,ₜ

Com essa convenção de sinal, uma média positiva significa que o modelo B teve loss médio menor. O framework de Diebold–Mariano pode testar uma diferença média de loss quando as premissas da comparação de previsões e a estimativa de variância forem adequadas ao desenho. Se a pergunta for se o score relativo muda conforme condições conhecidas no momento da previsão, o guia de Giacomini–White trata dessa comparação condicional. Origens repetidas, janelas de eventos sobrepostas e busca de modelos podem tornar as diferenças dependentes ou selecionadas; um erro-padrão ingênuo ou um único p-value sem ajuste pode exagerar as evidências.

Defina o evento, horizonte, amostra, score principal, benchmark e direção da comparação antes de ver os resultados. Informe os Brier e log losses médios, tamanhos de amostra, definições do modelo e da referência, regra de clipping e qualquer ajuste para dependência ou busca. Um reliability plot e diferenças pareadas ao lado do agregado ajudam a explicar o que mudou. Os métodos de forecast combination combinam previsões, mas a combinação final também precisa ser avaliada em dados que não foram usados para selecioná-la.

Os scores não têm a mesma unidade. Uma diferença de Brier de 0.01 não equivale diretamente a uma diferença de log loss de 0.01. Um score menor tampouco prova que o modelo de probabilidade subjacente está correto; é uma evidência sobre as previsões avaliadas para os resultados definidos.

Separe a qualidade da previsão da rentabilidade do trading

Uma probabilidade só pode apoiar uma decisão de trading por meio de uma regra que a transforme em ação. A decisão também depende do tamanho dos payoffs, das perdas quando a previsão erra, dos preços de execução, spreads, comissões, slippage, funding, custo de empréstimo, limites de capital e do momento em que a previsão pode ser negociada. Um proper score avalia uma previsão probabilística; não inclui esses custos nem escolhe o tamanho da posição.

Um modelo pode melhorar o log loss médio sem melhorar uma regra específica de trading, porque ela pode operar apenas em uma faixa de probabilidades ou reagir a outro horizonte. Por outro lado, um sinal útil para a decisão pode se concentrar em poucos casos e contribuir pouco para o score geral. Depois de avaliar a previsão, avalie separadamente a regra de decisão especificada de antemão em datas que não foram usadas para selecioná-la, com retornos líquidos realistas e estimativas de incerteza.

Um relatório adequado permite que outra pessoa reproduza o evento, a probabilidade, o resultado, a fórmula e a convenção do score, a referência, a amostra e o momento da avaliação. Informe se as probabilidades são out-of-sample, se os resultados se sobrepõem, como os casos ausentes foram tratados e quantos modelos alternativos ou escolhas de score foram testados. Essa disciplina mantém o score informativo sem transformá-lo em uma afirmação sobre lucros futuros.

Perguntas frequentes

Q1Um Brier score menor é sempre melhor?

É melhor quando a definição do evento, a amostra, a convenção de scoring e a codificação do resultado são iguais. Scores de eventos ou convenções multicategoriais diferentes podem não ser diretamente comparáveis.

Q2Um bom Brier score prova que as probabilidades estão calibradas?

Não. O Brier score agregado combina reliability, resolution e incerteza do evento. Examine também os diagnósticos de calibração e a incerteza amostral.

Q3Devo usar Brier score ou log loss?

Escolha antes de avaliar os resultados. Brier loss é limitado e usa o erro de probabilidade ao quadrado; log loss penaliza mais as probabilidades erradas dadas com confiança. A escolha depende das consequências da tarefa e da sensibilidade desejada.

Q4Um score probabilístico melhor significa que uma estratégia de trading dá lucro?

Não. O score avalia previsões, não decisões depois de considerar payoffs, custos de execução, financiamento, tamanho de posição e seleção de modelo. Pesquisa primária - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)

Fontes e leituras adicionais

Relatar um problema

Vamos preparar um e-mail com o link deste artigo. Mark só receberá o relato depois que você enviar

Verificação rápida

Terminou o guia? Confira o que aprendeu com 3 perguntas

Pergunta 1 / 3

Pergunta 01

Um evento binário ocorre após uma previsão de 70%. Qual é o Brier loss pela convenção de evento único?

Escolha uma resposta para ver a explicação

Glossário de opções