Skip to content
Tous les guides sur les options et contrats à terme
Évaluation des prévisions probabilistes12 min de lecture

Brier score ou log loss pour les prévisions probabilistes

Comparez le Brier score et le log loss pour les prévisions binaires, calculez-les à la main et comprenez les scores propres, la calibration et la qualité prévisionnelle

Dans ce guideUn taux de réussite ignore la probabilité annoncée

Bref résumé

Une prévision probabiliste indique la probabilité d’un événement, pas seulement le résultat le plus probable. Le Brier score et le log loss comparent ces probabilités aux résultats observés. Les deux sont des règles de score propres, mais ils pénalisent les erreurs différemment. Un score plus faible n’a donc de sens que si l’événement, l’échantillon, la convention de calcul et la référence sont définis.

Un taux de réussite ignore la probabilité annoncée

Imaginez que vous releviez si un modèle a correctement prévu une hausse ou une baisse. Le taux de réussite traite de la même façon une prévision correcte à 51 % et une autre à 99 %. Il traite aussi de la même façon une prévision à 49 % et une à 1 % si toutes deux échouent. L’assurance exprimée disparaît alors, même si elle peut compter lorsque les gains ou les risques diffèrent selon la décision.

Une prévision de probabilité binaire attribue une valeur \(p_t\), comprise entre zéro et un, à un événement clairement défini au moment d’émission \(t\). L’événement est ensuite codé \(y_t=1\) s’il se produit et \(y_t=0\) dans le cas contraire. Une règle de score évalue ensemble la prévision et le résultat. Le Brier score utilise l’erreur de probabilité au carré ; le log loss utilise le logarithme négatif de la probabilité attribuée au résultat effectivement observé.

Ces scores permettent de comparer des prévisions probabilistes, y compris des probabilités d’événements issues d’un modèle de trading. Ils ne démontrent pas à eux seuls qu’une prévision est calibrée, qu’elle surpasse une référence pertinente ou qu’une stratégie fondée dessus serait rentable. Le guide Mincer–Zarnowitz présente une autre régression linéaire de calibration pour les prévisions numériques ponctuelles.

Définissez un événement et associez chaque prévision à son résultat

Avant le calcul, définissez l’événement de façon à pouvoir déterminer son résultat de manière cohérente. « L’actif va-t-il monter ? » est incomplet tant que l’actif, la source de prix, les heures de début et de fin, la devise, la convention de rendement et le traitement des données manquantes ou corrigées ne sont pas précisés. Pour un événement économique, consignez la publication et la version des données utilisées pour établir le résultat. Ne comparez pas des prévisions évaluées sur des définitions ou des périodes différentes.

Conservez chaque prévision telle qu’elle était disponible à son origine. Une probabilité publiée au temps \(t\) doit utiliser uniquement l’information disponible avant l’échéance définie et être associée au résultat du même horizon. Une série de données révisée, une clôture boursière postérieure ou une règle de classification choisie après observation du résultat peut modifier discrètement la cible ou introduire une information future.

Pour des prévisions glissantes, gardez la version du modèle, la version des données d’entrée, l’horodatage, la probabilité et la règle de résolution. Utilisez les mêmes origines de prévision pour comparer les modèles. Si une probabilité manque, documentez son exclusion et appliquez la même règle d’échantillonnage à tous les candidats. Ces éléments rendent le score reproductible au lieu d’en faire le résumé d’un tableur qui change.

Calculez le Brier score à partir des erreurs de probabilité au carré

Pour un événement binaire, la perte de Brier au cas \(t\) est :

BSₜ = (pₜ − yₜ)²

Le Brier score moyen sur \(n\) prévisions est :

BS = (1/n) Σₜ (pₜ − yₜ)²

Plus il est faible, mieux c’est ; zéro est parfait, et cette convention à événement unique va de zéro à un. Par exemple, si la prévision est \(p=0.70\) et que l’événement se produit, la perte est \((0.70-1)^2=0.09\). Si l’événement ne se produit pas après la même prévision, la perte vaut \((0.70-0)^2=0.49\). Une erreur très assurée coûte plus cher qu’une erreur modérée, mais la pénalité reste bornée.

Vérifiez la formule lorsque vous comparez des chiffres publiés. Certaines conventions additionnent les erreurs au carré de toutes les catégories d’une prévision à plusieurs résultats ; avec deux catégories, cette somme vectorielle peut être deux fois la perte à événement unique ci-dessus. Dans un même événement, multiplier tous les scores par deux ne change pas leur classement, mais les valeurs numériques ne sont pas comparables entre conventions si l’échelle n’est pas précisée.

Calculez le log loss et observez l’effet des erreurs extrêmes

Pour un événement binaire, le log loss est :

LLₜ = −[yₜ log(pₜ) + (1 − yₜ) log(1 − pₜ)]

Si l’événement se produit, la perte est \(-\log(p_t)\) ; sinon, elle est \(-\log(1-p_t)\). Une prévision correcte à 70 % reçoit donc \(-\log(0.70)\approx0.357\), tandis que la même prévision incorrecte reçoit \(-\log(0.30)\approx1.204\). Le log loss moyen fait la moyenne de ces pénalités par cas et n’a pas de borne supérieure fixe lorsqu’une prévision attribue une probabilité quasi nulle à l’événement qui se produit.

Pour \(p=0\) ou \(p=1\), le log loss d’une prévision assurée mais fausse est infini. Si le logiciel tronque les probabilités à un petit plancher, par exemple \(\varepsilon\), afin d’éviter l’infini, indiquez ce plancher et appliquez-le uniformément avant d’observer les résultats. Le tronquage modifie la règle d’évaluation numérique et ne doit pas être dissimulé comme un détail de nettoyage des données.

Le Brier score et le log loss peuvent classer les mêmes prévisions différemment, car leurs courbes de pénalité diffèrent. Le log loss impose un coût particulièrement élevé lorsqu’une probabilité quasi nulle est attribuée à un événement observé ; la perte binaire de Brier est plafonnée à un. Choisissez à l’avance le score principal. Si les décisions dépendent de probabilités extrêmes, envisagez de présenter les deux plutôt que de retenir après coup le résultat le plus favorable.

<!-- learn:illustration -->

Des gouttes de verre bleues font face à des pierres ambrées représentant les résultats; une prévision très sûre s’éloigne fortement de l’événement réalisé
Illustration conceptuelle des probabilités et des résultats observés, où une erreur très confiante reçoit une pénalité plus forte; sans données de marché, résultat de test ni signal de trading

Un proper scoring récompense les probabilités sincères en espérance

Un score est propre si la personne qui prévoit maximise sa récompense espérée, ou minimise sa perte espérée, en annonçant la probabilité qu’elle croit réellement. Il est strictement propre si cette valeur sincère est l’unique optimum. Selon leurs définitions usuelles, les scores de Brier et logarithmique sont strictement propres pour des prévisions binaires (Gneiting et Raftery, 2007). Cela justifie d’évaluer directement les probabilités au lieu de les convertir d’abord en étiquettes rigides.

« Propre » décrit une propriété en espérance, pas une garantie pour chaque échantillon réalisé. Une personne peut annoncer honnêtement une probabilité de 70 % et se tromper dans un cas ; son score sur un petit échantillon peut être pire que celui d’une personne qui devine. Il faut des prévisions répétées et comparables pour estimer la performance moyenne. Les incitations comptent aussi : si une autre règle de paiement s’applique à la personne, le score ne garantit pas à lui seul que la probabilité annoncée reflète sa croyance.

Aucun des deux scores ne mesure la calibration à lui seul. Un agrégat peut combiner la proximité entre probabilités et fréquences observées avec la capacité à distinguer des cas dont les résultats diffèrent. Un modèle peut produire des prévisions contrastées tout en étant systématiquement mal calibré ; un modèle qui annonce toujours le taux de base peut être calibré globalement mais apporter peu d’information propre à chaque cas.

Interprétez la décomposition de Brier : fiabilité, résolution et incertitude

La décomposition de Murphy répartit le Brier score moyen entre trois termes (Murphy, 1973012%3C0595%3AANVPOT%3E2.0.CO%3B2)) :

BS = fiabilité − résolution + incertitude

Pour des groupes \(k\) de prévisions aux probabilités proches, notons \(w_k\) la part de l’échantillon dans chaque groupe, ̅pₖ sa probabilité moyenne prévue, ̅yₖ la fréquence observée de l’événement et ̅y la fréquence globale. Les composantes groupées sont :

fiabilité = Σₖ wₖ(̅pₖ − ̅yₖ)² résolution = Σₖ wₖ(̅yₖ − ̅y)² incertitude = ̅y(1 − ̅y)

Une erreur de fiabilité plus faible est préférable : la fréquence observée du groupe devrait correspondre à sa probabilité annoncée. Une meilleure résolution signifie que les fréquences des groupes diffèrent du taux de base global. L’incertitude reflète la fréquence de l’événement dans l’échantillon et ne constitue pas un mérite du modèle. La décomposition explique comment deux modèles peuvent avoir le même Brier score tout en présentant des forces différentes.

La décomposition empirique est exacte lorsque les cas ayant exactement la même probabilité annoncée sont regroupés. Si des probabilités continues sont regroupées en classes, la décomposition est exacte pour la prévision ainsi regroupée, pas pour les différences entre probabilités initiales perdues dans les classes. Il faut choisir les frontières de classe. Un diagramme de fiabilité à dix classes de largeur égale peut différer d’un diagramme par quantiles, surtout avec un petit échantillon ou près des extrêmes. Affichez le nombre de cas et l’incertitude pour chaque classe ; traitez la décomposition regroupée comme un diagnostic et non comme un moyen d’éliminer l’erreur d’échantillonnage. Les graphiques de calibration ne prouvent pas indépendamment la fiabilité future.

Choisissez une référence avant de parler de skill

Un score brut inférieur à celui d’un autre modèle est une comparaison, pas encore une amélioration par rapport à une base utile. Le Brier skill score compare un système de prévision à une prévision de référence nommée :

BSS = 1 − BS_model / BS_reference

Une valeur de zéro égale la référence ; une valeur positive indique une amélioration et une valeur négative une dégradation selon cette définition. Une valeur de un correspond à une perte de Brier nulle pour le modèle lorsque la perte de référence est positive. Choisissez une référence adaptée à la décision et à l’ensemble d’informations. Selon la tâche, un taux de base historique fixe, la fréquence observée dans la fenêtre d’apprentissage ou une procédure de prévision existante peut convenir.

Ne calculez pas la référence à partir de résultats futurs d’évaluation qui n’auraient pas été connus au moment de la prévision. Pour une série temporelle, une fréquence historique croissante ou glissante peut être une base opérationnelle plus propre que le taux calculé sur tout l’échantillon. Si le score de référence vaut zéro, le ratio est indéfini ; indiquez la construction du benchmark et présentez aussi les scores bruts du modèle et de la référence.

Les Brier skill scores dépendent de la référence et de la fréquence de l’événement. Un score par rapport à une prévision inconditionnelle du taux de base répond à une autre question qu’un score par rapport à un modèle de production actuel. Ne comparez pas des BSS entre études sans vérifier les définitions de l’événement, les références, les périodes d’échantillonnage et les conventions binaires ou multiclasse.

Comparez les modèles sur des résultats appariés hors échantillon

Produisez les probabilités dans l’ordre chronologique et réservez une période d’évaluation qui n’a servi ni à ajuster le modèle, ni à choisir les variables, ni à sélectionner un seuil. Évaluez tous les modèles sur les mêmes résultats résolus et les mêmes origines. Pour une perte choisie, définissez la différence appariée ainsi :

dₜ = Lₐ,ₜ − Lᵦ,ₜ

Avec cette convention de signe, une moyenne positive signifie que le modèle B a eu une perte moyenne plus faible. Le cadre de Diebold–Mariano peut tester une différence moyenne de pertes si ses hypothèses de comparaison et l’estimation de variance conviennent au plan d’étude. Si la question porte sur l’évolution de la qualité relative selon des conditions connues au moment de la prévision, le guide de Giacomini–White traite cette comparaison conditionnelle. Des origines répétées, des fenêtres d’événement qui se chevauchent et la recherche de modèles peuvent rendre les différences dépendantes ou sélectionnées ; une erreur standard naïve ou une seule valeur p non corrigée peut exagérer les preuves.

Fixez l’événement, l’horizon, l’échantillon, le score principal, le benchmark et le sens de comparaison avant de consulter les résultats. Indiquez les Brier scores et log loss moyens, les tailles d’échantillon, les définitions du modèle et de la référence, la règle de tronquage des probabilités et les corrections de dépendance ou de recherche. Un diagramme de fiabilité et les différences appariées à côté de l’agrégat aident à expliquer les changements. Les méthodes de combinaison de prévisions peuvent combiner des prévisions, mais il faut aussi évaluer la combinaison finale sur une période qui n’a pas servi à la sélectionner.

Les scores n’ont pas d’unité commune. Une différence de Brier de 0,01 n’a pas directement la même ampleur qu’une différence de log loss de 0,01. Un score plus faible ne prouve pas non plus que le modèle probabiliste sous-jacent est correct ; il renseigne sur les prévisions évaluées pour les résultats définis.

Distinguez la qualité des prévisions de la rentabilité du trading

Une probabilité ne peut soutenir une décision de trading qu’au moyen d’une règle qui la transforme en action. La décision dépend aussi du gain possible, des pertes en cas d’erreur, des prix d’exécution, des spreads, commissions, glissements, coûts de financement, emprunts, limites de capital et du moment où la prévision devient négociable. Une règle de score propre évalue une prévision probabiliste ; elle n’intègre pas ces coûts et ne choisit pas la taille de position.

Un modèle peut améliorer le log loss moyen sans améliorer une règle de trading particulière, si cette règle n’agit que dans une plage de probabilités ou répond à un autre horizon. À l’inverse, un signal utile peut être concentré dans quelques cas et contribuer peu au score global. Après l’évaluation de la prévision, évaluez séparément la règle de décision préspécifiée sur des dates qui n’ont pas servi à la sélectionner, avec des rendements nets réalistes et des mesures d’incertitude.

Un rapport adéquat permet à un autre chercheur de reproduire l’événement, la probabilité, le résultat, la formule et la convention de score, la référence, l’échantillon et la date d’évaluation. Il précise si les probabilités sont hors échantillon, si les résultats se chevauchent, comment les cas manquants ont été traités et combien de modèles ou de scores alternatifs ont été essayés. Cette discipline rend le score informatif sans en faire une affirmation de profits futurs.

Questions fréquentes

Q1Un Brier score plus faible est-il toujours préférable ?

Il est préférable si la définition de l’événement, l’échantillon, la convention de score et le codage du résultat sont identiques. Des scores d’événements ou de conventions multiclasse différents ne sont pas forcément comparables directement.

Q2Un bon Brier score prouve-t-il que les probabilités sont calibrées ?

Non. Le Brier score agrégé combine fiabilité, résolution et incertitude de l’événement. Examinez aussi les diagnostics de calibration et l’incertitude d’échantillonnage.

Q3Dois-je utiliser le Brier score ou le log loss ?

Choisissez avant d’évaluer les résultats. La perte de Brier est bornée et fondée sur l’erreur de probabilité au carré ; le log loss pénalise davantage les probabilités erronées annoncées avec assurance. Le choix dépend des conséquences de la tâche et de la sensibilité recherchée.

Q4Un meilleur score probabiliste signifie-t-il qu’une stratégie de trading est rentable ?

Non. Le score évalue des prévisions, pas des décisions tenant compte des gains, des coûts d’exécution, du financement, de la taille de position et de la sélection du modèle. Recherche originale - Brier, “Verification of Forecasts Expressed in Terms of Probability” (1950)078%3C0001%3AVOFEIT%3E2.0.CO%3B2) - Murphy, “A New Vector Partition of the Probability Score” (1973)012%3C0595%3AANVPOT%3E2.0.CO%3B2) - Gneiting and Raftery, “Strictly Proper Scoring Rules, Prediction, and Estimation” (2007) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995)

Sources et lectures complémentaires

Signaler un problème

Nous préparons un e-mail avec le lien de cet article. Mark ne reçoit le signalement qu’après son envoi

Vérification rapide

Guide terminé ? Vérifiez vos acquis avec 3 questions

Question 1 / 3

Question 01

Un événement binaire se produit après une prévision de 70 %. Quelle est la perte de Brier selon la convention à événement unique ?

Choisissez une réponse pour voir l'explication

Glossaire des options

Des définitions claires des termes essentiels, des calls, puts et chaînes d’options à la volatilité implicite, aux sensibilités et à l’écart acheteur-vendeur

Parcourir le glossaire des options
Évaluation des prévisionsRégression de Mincer–Zarnowitz : tester le biais et le calibrage d’une prévisionComprenez comment la régression de Mincer–Zarnowitz teste l’ordonnée à l’origine et l’échelle d’une prévision, pourquoi une erreur moyenne nulle ne signifie pas qu’elle est calibrée et ce que le test ne prouve pasComparer la précision des prévisionsTest de Diebold–Mariano : comparer deux prévisionsDécouvrez comment le test de Diebold–Mariano compare des pertes appariées, traite les horizons qui se chevauchent et pourquoi une faible valeur p ne prouve pas une aptitude à trader.Évaluation des prévisionsTest de Giacomini–White : précision conditionnelle des prévisionsDécouvrez comment le test de Giacomini–White évalue les variations de précision selon des conditions connues, comment choisir les instruments et ce que le résultat permet de conclureComparaison de modèles de prévisionModel Confidence Set (MCS) : comparer des prévisions sans imposer un gagnantDécouvrez comment le Model Confidence Set combine des tests séquentiels et un bootstrap tenant compte de la dépendance temporelle pour conserver des modèles que les données ne permettent pas de départager.Évaluation des prévisions de densitéTransformée intégrale de probabilité : calibrer une prévision de densitéDécouvrez comment la PIT évalue les prévisions de densité continues et discrètes, ce que montre un histogramme et pourquoi l’uniformité ne suffit pas