Brier score frente a log loss en pronósticos probabilísticos
Compara Brier score y log loss para pronósticos binarios, calcúlalos a mano y entiende la propiedad propia, la calibración y la habilidad predictiva
En esta guíaLa tasa de aciertos descarta la probabilidad pronosticada
Resumen breve
Un pronóstico probabilístico indica la probabilidad de un evento, no solo cuál resultado es más probable. El Brier score y el log loss comparan esas probabilidades con los resultados observados. Ambos son reglas de puntuación propias, pero penalizan los errores de manera distinta. Por eso, un score menor solo es significativo cuando se han fijado el evento, la muestra, la convención de cálculo y la referencia.
La tasa de aciertos descarta la probabilidad pronosticada
Imagine que registra si un modelo acertó al pronosticar “sube” o “baja”. La tasa de aciertos trata igual un pronóstico correcto del 51% y otro del 99%. También considera igual un pronóstico del 49% y otro del 1% si ambos fallan. Así se pierde la confianza expresada, aunque pueda importar cuando las decisiones tienen pagos o riesgos distintos.
Un pronóstico de probabilidad binaria asigna un valor \(p_t\), entre cero y uno, a un evento definido con claridad en el origen del pronóstico \(t\). Después, el evento se registra como \(y_t=1\) si ocurre y \(y_t=0\) si no ocurre. Una regla de puntuación evalúa conjuntamente el pronóstico y el resultado. El Brier score usa el error de probabilidad al cuadrado; el log loss usa el logaritmo negativo de la probabilidad asignada a lo que realmente ocurrió.
Estos scores sirven para comparar pronósticos probabilísticos, incluidas las probabilidades de eventos de un modelo de trading. Por sí solos no demuestran que un pronóstico esté calibrado, supere una referencia razonable o produzca ganancias al operar con él. La guía de Mincer–Zarnowitz presenta otra regresión lineal de calibración para pronósticos numéricos puntuales.
Defina un evento y alinee cada pronóstico con su resultado
Antes de puntuar, defina el evento de modo que pueda resolverse de forma coherente. “¿Subirá el activo?” está incompleto hasta especificar el activo, la fuente del precio, las horas de inicio y fin, la moneda, la convención de rentabilidad y el tratamiento de registros faltantes o corregidos. Para un evento económico, registre la publicación y la versión de los datos usados para determinar el resultado. No compare pronósticos evaluados con definiciones o conjuntos de fechas diferentes.
Guarde cada pronóstico tal como estaba disponible en su origen. Una probabilidad emitida en \(t\) debe usar la información disponible hasta el corte definido y emparejarse con el resultado del mismo horizonte. Una serie revisada, un cierre bursátil posterior o una regla de clasificación elegida tras observar el resultado pueden cambiar silenciosamente el objetivo o introducir información futura.
En pronósticos móviles, conserve la versión del modelo, la versión de los datos de entrada, la marca temporal, la probabilidad y la regla de resolución. Use los mismos orígenes al comparar modelos. Si falta una probabilidad, documente la exclusión y aplique la misma regla muestral a cada candidato. Así, el score puede reproducirse y no queda como un resumen de una hoja de cálculo cambiante.
Calcule el Brier score con errores de probabilidad al cuadrado
Para un evento binario, la pérdida de Brier del caso \(t\) es:
BSₜ = (pₜ − yₜ)²
El Brier score medio de \(n\) pronósticos es:
BS = (1/n) Σₜ (pₜ − yₜ)²
Un valor menor es mejor; cero es perfecto, y esta convención de evento único va de cero a uno. Por ejemplo, si el pronóstico es \(p=0.70\) y ocurre el evento, la pérdida es \((0.70-1)^2=0.09\). Si el mismo pronóstico va seguido de que no ocurra, es \((0.70-0)^2=0.49\). Un error confiado cuesta más que uno moderado, pero la penalización está acotada.
Compruebe la fórmula al comparar cifras publicadas. Algunas convenciones suman los errores al cuadrado de todas las categorías de un pronóstico multiclase; en el caso binario, esa suma vectorial puede duplicar la pérdida de evento único anterior. La clasificación relativa en un mismo evento no cambia al multiplicar todos los scores por dos, pero el nivel numérico no es comparable entre convenciones si no se indica la escala.
Calcule el log loss y observe el peso de los errores extremos
Para un evento binario, el log loss es:
LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]
Si ocurre el evento, la pérdida es \(-\log(p_t)\); si no ocurre, es \(-\log(1-p_t)\). Así, un pronóstico correcto del 70% recibe \(-\log(0.70)\approx0.357\), mientras que el mismo pronóstico, si falla, recibe \(-\log(0.30)\approx1.204\). El log loss medio promedia estas penalizaciones por caso y no tiene un límite superior fijo cuando un pronóstico asigna una probabilidad casi nula al evento que sí ocurre.
Con \(p=0\) o \(p=1\), el log loss de un pronóstico confiado pero incorrecto es infinito. Si el software recorta las probabilidades a un mínimo pequeño, como \(\varepsilon\), para evitar el infinito, informe ese límite y aplíquelo de manera uniforme antes de observar los resultados. El recorte cambia la regla numérica de evaluación y no debe ocultarse como un detalle de limpieza de datos.
El Brier score y el log loss pueden ordenar los mismos pronósticos de forma distinta porque sus curvas de penalización difieren. El log loss asigna un costo especialmente alto a dar una probabilidad casi nula a un evento ocurrido; la pérdida binaria de Brier está limitada a uno. Decida de antemano qué score usará. Si las decisiones dependen de probabilidades extremas, considere mostrar ambos en vez de elegir después el resultado más favorable.
<!-- learn:illustration -->

El proper scoring recompensa las probabilidades sinceras en expectativa
Un score es propio si quien pronostica maximiza su recompensa esperada o minimiza su pérdida esperada al informar la probabilidad que realmente cree. Es estrictamente propio si ese valor sincero es el único óptimo. Según las definiciones habituales, Brier y el score logarítmico son estrictamente propios para pronósticos binarios (Gneiting y Raftery, 2007). Esto da una razón fundada para evaluar probabilidades en vez de convertirlas primero en etiquetas duras.
“Propio” es una propiedad en expectativa, no una promesa para cada muestra observada. Quien informa sinceramente un 70% puede equivocarse en un caso y obtener un score finito peor que alguien que adivinó. Se necesitan pronósticos repetidos y comparables para aprender sobre el rendimiento medio. También importan los incentivos: si la persona se enfrenta a otra regla de pagos, el score por sí solo no garantiza que la probabilidad informada refleje su creencia.
Ninguno de los dos scores mide solo la calibración. Un agregado puede combinar la cercanía de las probabilidades a las frecuencias observadas con la capacidad de separar los casos que terminan de forma distinta. Un modelo puede producir pronósticos muy diferenciados y aun así estar mal calibrado de manera sistemática. Uno que siempre informa la tasa base puede estar calibrado en agregado, pero aportar poca información específica para cada caso.
Lea la descomposición de Brier como fiabilidad, resolución e incertidumbre
La descomposición de Murphy divide el Brier score medio en tres términos (Murphy, 1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)):
BS = fiabilidad − resolución + incertidumbre
Para grupos \(k\) de pronósticos con probabilidades similares, sea \(w_k\) la proporción de la muestra de cada grupo, ̅pₖ su probabilidad media pronosticada, ̅yₖ la frecuencia observada del evento y ̅y la frecuencia total. Los componentes agrupados son:
fiabilidad = Σₖ wₖ(̅pₖ − ̅yₖ)² resolución = Σₖ wₖ(̅yₖ − ̅y)² incertidumbre = ̅y(1 − ̅y)
Menor error de fiabilidad es mejor: el pronóstico del grupo debe coincidir con su frecuencia observada. Una mayor resolución es mejor: las frecuencias de los grupos deben diferir de la tasa base general. La incertidumbre refleja con qué frecuencia ocurre el evento en la muestra y no es mérito del modelo. La descomposición explica por qué dos modelos pueden tener el mismo Brier score y fortalezas distintas.
La descomposición empírica es exacta cuando se agrupan casos con la misma probabilidad emitida. Si las probabilidades continuas se agrupan en intervalos, la descomposición es exacta para el pronóstico agrupado, no para las diferencias entre las probabilidades originales que se pierden dentro de cada intervalo. Agrupar exige elegir límites. Un diagrama de fiabilidad con diez intervalos de igual anchura puede contar una historia distinta de uno con intervalos por cuantiles, sobre todo en muestras pequeñas o cerca de los extremos. Muestre el número de casos y la incertidumbre de cada intervalo y trate la descomposición agrupada como diagnóstico, no como forma de borrar el error muestral. Los gráficos de calibración no son prueba independiente de fiabilidad futura.
Elija una referencia antes de llamar habilidad al score
Un score bruto menor que el de otro modelo es una comparación, pero aún no expresa mejora frente a una base útil. El Brier skill score compara un sistema de pronóstico con una referencia nombrada:
BSS = 1 − BS_model / BS_reference
Un valor cero iguala la referencia, uno positivo indica mejora y uno negativo un resultado peor con esta definición. Un valor de uno corresponde a pérdida de Brier cero del modelo cuando la pérdida de referencia es positiva. Elija la referencia según la decisión y el conjunto de información. Según la tarea, pueden ser razonables una tasa base histórica fija, la frecuencia del evento en la ventana de entrenamiento o un procedimiento de pronóstico ya existente.
No calcule la referencia con resultados futuros de evaluación si no estaban disponibles al emitir el pronóstico. En series temporales, una frecuencia histórica expansiva o móvil puede ser una base operativa más limpia que la tasa de toda la muestra. Si el score de referencia es cero, el cociente no está definido; explique cómo se construyó el benchmark y muestre también los scores brutos del modelo y la referencia.
El Brier skill score depende de la referencia y de la frecuencia del evento. Un score frente a un pronóstico incondicional de la tasa base responde a una pregunta distinta de uno frente a un modelo de producción actual. No compare BSS entre estudios sin comprobar las definiciones del evento, las referencias, los periodos muestrales y las convenciones binarias o multiclase.
Compare modelos con resultados emparejados fuera de muestra
Genere probabilidades cronológicamente y reserve un periodo de evaluación que no se usó para ajustar el modelo, elegir variables o seleccionar un umbral. Evalúe todos los modelos con los mismos resultados resueltos y orígenes. Para una pérdida elegida, defina la diferencia emparejada como:
dₜ = Lₐ,ₜ − Lᵦ,ₜ
Con esta convención, una media positiva significa que el modelo B tuvo menor pérdida media. El marco de Diebold–Mariano puede contrastar una diferencia media de pérdidas cuando sus supuestos y estimación de varianza se ajustan al diseño. Si se pregunta si la calidad relativa cambia con condiciones conocidas en el momento del pronóstico, la guía de Giacomini–White cubre esa comparación condicional. Los orígenes repetidos, ventanas de eventos solapadas y la búsqueda de modelos pueden volver dependientes o seleccionadas las diferencias; un error estándar ingenuo o un único valor p sin ajustar puede exagerar la evidencia.
Fije el evento, horizonte, muestra, score principal, benchmark y dirección de comparación antes de ver resultados. Informe los promedios de Brier y log loss, sus tamaños muestrales, las definiciones de modelo y referencia, la regla de recorte y cualquier ajuste por dependencia o búsqueda. Mostrar un gráfico de fiabilidad y las diferencias emparejadas junto al agregado ayuda a explicar los cambios. Los métodos de combinación de pronósticos pueden combinar predicciones, pero la combinación final también necesita una evaluación en un periodo no usado para seleccionarla.
Los scores no comparten unidades. Una diferencia de Brier de 0.01 no equivale directamente a una diferencia de log loss del mismo valor. Un score menor tampoco demuestra que el modelo probabilístico subyacente sea correcto; es evidencia sobre los pronósticos evaluados en los resultados especificados.
Separe la calidad del pronóstico de la rentabilidad del trading
Una probabilidad solo apoya una decisión de trading mediante una regla que la transforma en acción. La decisión también depende del tamaño de los pagos, las pérdidas al equivocarse, los precios de ejecución, spreads, comisiones, deslizamiento, financiación, préstamo, límites de capital y el momento en que el pronóstico se vuelve negociable. Un score propio evalúa una probabilidad pronosticada; no incluye esos costes ni elige el tamaño de la posición.
Un modelo puede mejorar el log loss medio sin mejorar una regla de trading concreta, porque la regla quizá opere solo en un rango de probabilidades o responda a otro horizonte. A la inversa, una señal útil puede concentrarse en pocos casos y aportar poco al score general. Tras evaluar el pronóstico, evalúe por separado la regla de decisión preespecificada en fechas que no se usaron para seleccionarla, con rentabilidades netas realistas y estimaciones de incertidumbre.
Un informe adecuado permite a otro investigador reproducir el evento, la probabilidad, el resultado, la fórmula y convención del score, la referencia, la muestra y el momento de evaluación. Debe indicar si las probabilidades son fuera de muestra, si los resultados se solapan, cómo se trataron los casos ausentes y cuántos modelos o scores alternativos se probaron. Esa disciplina mantiene útil el score sin convertirlo en una afirmación sobre ganancias futuras.
Preguntas frecuentes
Q1¿Un Brier score más bajo siempre es mejor?
Es mejor si coinciden la definición del evento, la muestra, la convención de puntuación y la codificación del resultado. Scores de eventos o convenciones multiclase distintos pueden no ser comparables directamente.
Q2¿Un buen Brier score demuestra que las probabilidades están calibradas?
No. El score agregado combina fiabilidad, resolución e incertidumbre del evento. Revise también los diagnósticos de calibración y la incertidumbre muestral.
Q3¿Debería usar Brier score o log loss?
Elija antes de evaluar los resultados. Brier está acotado y usa error de probabilidad al cuadrado; log loss penaliza más las probabilidades equivocadas expresadas con confianza. La elección depende de las consecuencias de la tarea y de la sensibilidad buscada.
Q4¿Un mejor score probabilístico significa que una estrategia de trading es rentable?
No. El score evalúa pronósticos, no decisiones tras considerar pagos, costes de ejecución, financiación, tamaño de posición y selección del modelo. Investigación original - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
Ocurre un evento binario después de un pronóstico del 70%. ¿Cuál es la pérdida de Brier con la convención de evento único?
Elige una respuesta para ver la explicación
Glosario de opciones
Definiciones claras de términos esenciales, desde calls, puts y cadenas de opciones hasta IV, griegas, interés abierto y max pain
Ver el glosario de opciones