Skip to content
Tous les guides sur les options et contrats à terme
Évaluation des prévisions de densité13 min read

Transformée intégrale de probabilité : calibrer une prévision de densité

Découvrez comment la PIT évalue les prévisions de densité continues et discrètes, ce que montre un histogramme et pourquoi l’uniformité ne suffit pas

Dans ce guidePourquoi une prévision de densité va au-delà d’une erreur ponctuelle

Bref résumé

Une prévision de densité attribue des probabilités à une gamme de résultats. La transformée intégrale de probabilité (PIT) convertit chaque résultat observé en sa probabilité cumulée selon la prévision. Des valeurs PIT uniformes sont un diagnostic utile sous certaines hypothèses, mais un histogramme uniforme ne prouve ni la justesse conditionnelle ni l’indépendance dans le temps.

Pourquoi une prévision de densité va au-delà d’une erreur ponctuelle

Une prévision ponctuelle peut annoncer un rendement de 0,2 % demain. Une prévision de densité attribue des probabilités à l’ensemble des rendements possibles, des mouvements ordinaires aux événements extrêmes. Il faut donc vérifier si la distribution publiée avant l’observation est cohérente avec les résultats ultérieurs. Le guide Mincer–Zarnowitz traite de la calibration linéaire des prévisions ponctuelles numériques, une question distincte.

La PIT mesure la position cumulative du résultat observé dans la distribution annoncée. C’est un rang probabiliste, ni un rendement, ni un signal de trading, ni une mesure de profit. Le guide Diebold–Mariano compare les pertes moyennes sous un score donné; il répond à une autre question que la calibration d’une densité.

Transformer une prévision continue avec sa fonction de répartition

Soit (Y_{t+1}) le résultat après l’origine (t), et (F_{t+1}(y\mid\mathcal I_t)) la fonction de répartition (CDF) prévue à partir des seules informations disponibles dans (\mathcal I_t). Pour une loi continue, calculer

Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ)

La CDF est la probabilité d’obtenir une valeur inférieure ou égale à (y). Si la CDF prévisionnelle est la véritable loi conditionnelle, le théorème de la PIT donne

Pr(Uₜ₊₁ ≤ u | 𝓘ₜ) = u, for 0 ≤ u ≤ 1

Chaque prévision continue à un pas produit donc une PIT uniformément distribuée conditionnellement. Dans une séquence où l’information inclut le passé, les PIT idéales sont aussi indépendantes entre origines sous les hypothèses retenues. Rosenblatt a étudié cette transformation; Diebold, Gunther et Tay l’ont appliquée à l’évaluation des prévisions de densité (Rosenblatt, 1952; Diebold, Gunther et Tay, 1998).

Exemple vérifiable : une prévision (N(0,1)) et une observation (y=1) donnent (Phi(1)\approx0.8413). La prévision attribuait environ 84,13 % de probabilité aux valeurs au plus égales à 1. Cette observation seule ne permet pas d’évaluer la calibration; il faut une séquence.

Randomiser la transformation pour les résultats discrets

Pour une loi discrète, la CDF saute aux résultats possibles. La valeur ordinaire (F(Y)) ne peut prendre que certains niveaux et n’est généralement pas uniforme, même si la prévision est correcte. La PIT randomisée remplit chaque intervalle de saut :

Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ) + Vₜ₊₁ [Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ) − Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ)]

Ici, (F(y^-)) est la limite à gauche, soit la probabilité d’une valeur strictement inférieure à (y), et (V) est un tirage indépendant Uniform(0,1) utilisé pour l’évaluation. Pour une loi continue, le saut est nul et l’expression devient (F(Y)). Brockwell démontre la transformation randomisée pour les lois arbitraires, y compris discrètes et mixtes (2007). Pour les comptages ordonnés, Czado, Gneiting et Held discutent aussi une PIT non randomisée et des diagrammes de calibration marginale; les diagnostics discrets ne doivent pas être évalués comme si (F(Y)) était continu-uniforme (2009).

Exemple hypothétique : si (P(Y=1)=0.20) et (P(Y=0)=0.80), la PIT ordinaire vaut 0,80 lorsque (Y=0), événement de probabilité 0,80, et 1 lorsque (Y=1), de probabilité 0,20. Avec randomisation, (Y=0) donne (0.80V), dans ([0,0.80]), et (Y=1) donne (0.80+0.20V), dans ([0.80,1]). Les deux intervalles sont pondérés par leurs probabilités; la densité totale est uniforme sur ([0,1]). Le tirage sert au diagnostic, pas à la prévision.

Distinguer uniformité marginale, indépendance et calibration conditionnelle

Une distribution marginale uniforme des PIT est nécessaire pour une prévision continue idéale, mais ne suffit pas. En regroupant les données, des erreurs opposées entre régimes peuvent se compenser et produire un histogramme apparemment plat. Gneiting, Balabdaoui et Raftery montrent que l’uniformité peut coexister avec des prévisions individuelles biaisées (2007).

L’ordre compte aussi : une série peut avoir un histogramme uniforme et conserver une dépendance sérielle, par exemple des grappes alternées ou de longues séquences de valeurs proches. Les prévisions conditionnelles idéales impliquent davantage que l’uniformité groupée. Pour des horizons qui se chevauchent, la référence statistique doit toutefois tenir compte du chevauchement; un test iid n’est pas automatiquement valide.

Examinez donc la distribution PIT et ses liens avec le temps, les retards, les variables d’origine et les régimes définis à l’avance. Les coupes conditionnelles peuvent révéler des défauts masqués, mais leurs choix et leur puissance limitée comptent. Aucun ensemble fini de tests ne démontre la calibration pour toutes les informations possibles.

Lire l’histogramme PIT comme un indice, pas comme un verdict

Un profil en U est souvent compatible avec des prévisions trop concentrées ou sous-dispersées; une bosse centrale avec des prévisions trop diffuses ou surdispersées. Une asymétrie peut signaler un biais de position. Ce sont des heuristiques, pas des diagnostics uniques : dépendance, mélange de régimes, discrétisation, choix des classes et petit échantillon peuvent tromper.

L’histogramme efface l’ordre temporel. Il ne montre ni le début du défaut, ni les grappes, ni une sous-population mal calibrée. Des classes larges peuvent rendre plat un échantillon insuffisant; des classes fines peuvent sembler irrégulières par bruit. Indiquez le nombre de prévisions, les bornes et, si possible, l’incertitude. Diebold–Gunther–Tay et l’approche de Berkowitz sont des exemples de tests dont les hypothèses doivent correspondre au protocole. Berkowitz transforme une PIT intérieure en (Z_t=\Phi^{-1}(U_t)) et teste le nul conjoint de valeurs normales standard indépendantes contre une alternative dynamique spécifiée, par exemple AR(1). Ce test n’est pas un certificat universel (Berkowitz, 2001).

<!-- learn:illustration -->

Une courbe de densité sans texte relie des repères de valeurs observées à des points équidistants sur une bande uniforme
Illustration conceptuelle de la transformation d’une observation par la fonction de répartition prévue ; elle ne présente ni données réelles ni résultat de diagnostic.

Tenir compte de l’estimation et évaluer hors échantillon

Le résultat d’uniformité suppose que la CDF est la vraie loi conditionnelle. En pratique, les paramètres, la famille de lois, les seuils ou les variables sont estimés et sélectionnés. La CDF estimée (F_{t+1}(\cdot;\hat\theta_t)) appartient donc à une procédure de prévision. Ajuster le modèle avec les résultats de la période d’évaluation puis présenter les PIT comme une preuve hors échantillon intacte introduit une fuite d’information.

À chaque origine glissante, n’utilisez que les informations alors disponibles. Consignez la fenêtre d’estimation, la fréquence de réestimation, la version des données et du modèle, et la sélection. Des fenêtres adjacentes partagent souvent des observations; les horizons qui se chevauchent ajoutent une dépendance.

La taille et la puissance d’un test dépendent de l’estimateur, de l’échantillon et du protocole. Un histogramme n’intègre pas l’incertitude des paramètres, et les références iid scolaires ne s’appliquent pas à tous les cas estimés ou chevauchants. Pour une inférence importante, choisissez un test adapté ou simulez/bootstrapez le nul en répétant toute la chaîne d’estimation et de prévision. Gardez si nécessaire un échantillon final à l’écart de la sélection.

Distinguer calibration et netteté

La calibration concerne la relation entre prévisions et résultats : les événements annoncés à une probabilité donnée surviennent-ils à cette fréquence? La netteté décrit la concentration des distributions prévisionnelles sans regarder les résultats. Gneiting, Balabdaoui et Raftery la considèrent souhaitable sous contrainte de calibration, et non comme son substitut.

Une prévision large centrée correctement peut être calibrée mais peu informative. Une prévision étroite peut sembler précise tout en étant mal calibrée si les observations dépassent trop souvent sa masse. La PIT examine la cohérence distributionnelle; les résumés de netteté décrivent l’étalement ou la concentration. Rapporter seulement l’histogramme ou seulement la largeur des intervalles laisse une partie de l’évaluation de côté.

Une PIT uniforme en moyenne peut masquer des erreurs selon le régime de volatilité ou l’horizon. Définissez les conditions importantes avant l’analyse. Cette question est liée, mais distincte, d’une régression de prévision ponctuelle et du test de capacité prédictive conditionnelle de Giacomini–White, qui compare des pertes selon une information choisie.

Comparer les distributions avec des scores propres sur les mêmes résultats

La PIT est d’abord un diagnostic; elle ne classe pas seule des prévisions concurrentes. Le score logarithmique et le score probabiliste continu classé (CRPS) attribuent une perte scalaire à chaque prévision et résultat. Par définition, leur perte espérée est minimisée par la vraie distribution prédictive. Une moyenne réalisée ne prouve toutefois pas qu’un modèle est correct. Le guide Model Confidence Set traite des comparaisons par ensembles. Comparez les prévisions de densité au moyen d’un score défini pour la distribution complète et des mêmes observations.

Précisez la cible, l’horizon, les dates communes, la convention de perte et le benchmark. Le score logarithmique pénalise particulièrement l’attribution d’une densité très faible à l’observation; le CRPS compare les fonctions cumulatives avec une sensibilité différente. Estimez l’incertitude en tenant compte de la dépendance sérielle, de l’estimation et de la recherche de modèles. Les scores résument une pénalité donnée; les graphiques PIT peuvent mettre en lumière un défaut.

Ni la calibration ni un score meilleur ne prouvent la rentabilité. Une affirmation de trading exige une règle de décision, le calendrier d’information, la taille des positions, les coûts de transaction et de financement, et une évaluation hors échantillon des rendements. Une statistique d’évaluation des prévisions n’est pas un rendement de backtest.

Appliquer un protocole PIT reproductible

Fixez d’abord la cible, l’horizon, l’heure d’origine, la version des résultats et la nature continue, discrète ou mixte de la distribution. Conservez la CDF ou de quoi la reproduire, avec la valeur observée et l’ensemble d’information. Calculez (F_t(Y_t)) pour une loi continue; pour les sauts, documentez la randomisation ou un diagnostic discret approprié.

Examinez ensuite la distribution marginale et l’ordre temporel. Indiquez les classes, l’effectif, le traitement des égalités et la graine ou les répétitions de randomisation. Ajoutez des contrôles d’indépendance ou conditionnels répondant à une question définie avant l’analyse, avec une inférence adaptée aux fenêtres glissantes, horizons chevauchants ou estimations. Comparez séparément les modèles par des scores propres sur les mêmes observations réservées. Le résultat concerne un ensemble défini de prévisions et de conditions; il ne garantit ni la calibration future ni la rentabilité.

Questions fréquentes

Q1Une PIT uniforme prouve-t-elle qu’une prévision de densité est correcte?

Non. C’est une condition diagnostique nécessaire sous une prévision continue correcte, mais l’uniformité groupée ne démontre ni l’indépendance ni la calibration conditionnelle. Vérifiez les dépendances temporelles et les variables pertinentes.

Q2Faut-il randomiser la PIT pour une prévision discrète?

Utilisez la PIT randomisée si vous souhaitez la référence continue uniforme sous une loi discrète correcte. Le tirage répartit le résultat dans son saut de CDF. Documentez la méthode et la graine; un diagnostic conçu pour les lois discrètes peut aussi être préférable.

Q3Que signifie un histogramme PIT en U?

Il est souvent compatible avec des prévisions trop concentrées; une bosse centrale est souvent compatible avec des prévisions trop diffuses. Ce ne sont pas des diagnostics uniques : examinez dépendance, régimes, effectif et classes.

Q4Un meilleur histogramme PIT signifie-t-il un meilleur score?

Non. La PIT diagnostique le comportement distributionnel; les scores propres comparent les prévisions sous une perte et une cible spécifiées. Utilisez les mêmes résultats hors échantillon et ne confondez aucun des deux avec le profit. Recherche primaire - Rosenblatt, « Remarks on a Multivariate Transformation » (1952) - Diebold, Gunther et Tay, « Evaluating Density Forecasts with Applications to Financial Risk Management » (1998) - Berkowitz, « Testing Density Forecasts, with Applications to Risk Management » (2001) - Gneiting, Balabdaoui et Raftery, « Probabilistic Forecasts, Calibration and Sharpness » (2007) - Brockwell, « Universal Residuals: A Multivariate Transformation » (2007) - Czado, Gneiting et Held, « Predictive Model Assessment for Count Data » (2009)

Sources et lectures complémentaires

Signaler un problème

Nous préparons un e-mail avec le lien de cet article. Mark ne reçoit le signalement qu’après son envoi

Vérification rapide

Guide terminé ? Vérifiez vos acquis avec 3 questions

Question 1 / 3

Question 01

Que garantit le théorème PIT pour une prévision conditionnelle continue correcte?

Choisissez une réponse pour voir l'explication

Glossaire des options

Des définitions claires des termes essentiels, des calls, puts et chaînes d’options à la volatilité implicite, aux sensibilités et à l’écart acheteur-vendeur

Parcourir le glossaire des options
Évaluation des prévisionsRégression de Mincer–Zarnowitz : tester le biais et le calibrage d’une prévisionComprenez comment la régression de Mincer–Zarnowitz teste l’ordonnée à l’origine et l’échelle d’une prévision, pourquoi une erreur moyenne nulle ne signifie pas qu’elle est calibrée et ce que le test ne prouve pasComparer la précision des prévisionsTest de Diebold–Mariano : comparer deux prévisionsDécouvrez comment le test de Diebold–Mariano compare des pertes appariées, traite les horizons qui se chevauchent et pourquoi une faible valeur p ne prouve pas une aptitude à trader.Évaluation des prévisionsTest de Giacomini–White : précision conditionnelle des prévisionsDécouvrez comment le test de Giacomini–White évalue les variations de précision selon des conditions connues, comment choisir les instruments et ce que le résultat permet de conclureComparaison de modèles de prévisionModel Confidence Set (MCS) : comparer des prévisions sans imposer un gagnantDécouvrez comment le Model Confidence Set combine des tests séquentiels et un bootstrap tenant compte de la dépendance temporelle pour conserver des modèles que les données ne permettent pas de départager.Évaluation des prévisions probabilistesBrier score ou log loss pour les prévisions probabilistesComparez le Brier score et le log loss pour les prévisions binaires, calculez-les à la main et comprenez les scores propres, la calibration et la qualité prévisionnelle