Skip to content
Tous les guides sur les options et contrats à terme
Comparer la précision des prévisions14 min de lecture

Test de Diebold–Mariano : comparer deux prévisions

Découvrez comment le test de Diebold–Mariano compare des pertes appariées, traite les horizons qui se chevauchent et pourquoi une faible valeur p ne prouve pas une aptitude à trader.

Dans ce guideUne erreur de backtest plus faible ne prouve pas encore qu’une prévision est meilleure

Bref résumé

Le test de Diebold–Mariano compare deux prévisions en examinant leurs pertes sur les mêmes résultats observés. Son résultat dépend de la fonction de perte, de l’échantillon d’évaluation, de l’horizon de prévision et de l’estimation de l’incertitude. Une erreur d’échantillon plus faible ne prouve pas automatiquement une meilleure précision attendue, et une prévision plus précise ne démontre pas qu’une stratégie de trading est rentable.

Une erreur de backtest plus faible ne prouve pas encore qu’une prévision est meilleure

Supposons que deux modèles prévoient le même rendement, la même volatilité ou la même variable économique aux mêmes dates. Dans l’échantillon d’évaluation, le modèle A peut présenter une erreur moyenne plus faible que le modèle B. Cela décrit l’écart observé, mais ne permet pas de savoir s’il se reproduirait de façon fiable ou s’il tient simplement aux dates retenues pour le test.

Le test de Diebold–Mariano (DM) transforme cette comparaison en série temporelle appariée. À chaque origine de prévision, il compare les deux prévisions au même résultat réalisé, les évalue avec une fonction de perte choisie à l’avance, puis étudie la séquence des différences de perte. L’appariement est essentiel : une journée de marché volatile peut augmenter les pertes des deux modèles, tandis que la comparaison cherche à savoir si l’un perd généralement moins que l’autre ces mêmes jours.

Le cadre d’origine ne se limite ni à l’erreur quadratique ni aux erreurs de prévision normalement distribuées. Il peut comparer différentes fonctions de perte, y compris asymétriques, à condition qu’elles correspondent à la question de prévision. Il faut toutefois un protocole d’évaluation défendable et une estimation de l’incertitude de la différence moyenne de perte. Diebold et Mariano (1995) présentent le test d’égalité de précision prédictive ; Harvey, Leybourne et Newbold (1997)00719-4) étudient une modification pour les petits échantillons.

Comparez des prévisions comparables avant de calculer la statistique

Chaque ligne doit représenter une origine de prévision comparable. Les deux modèles doivent viser la même variable et le même horizon, en utilisant uniquement les informations disponibles à cette origine. Alignez les résultats réalisés, les horodatages, la devise ou l’unité, la version des données et les règles relatives aux observations manquantes. Si un modèle prévoit le cours de clôture du lendemain et l’autre une moyenne sur cinq jours, leurs erreurs répondent à des questions différentes.

Utilisez des prévisions produites sans regarder le futur. Une période de test chronologique ou une évaluation pseudo-hors-échantillon glissante peut aider, mais une simple séparation ne suffit pas si la même période test a servi à plusieurs reprises à ajuster des variables, des seuils ou des variantes de modèle. Conservez la prévision établie à chaque origine historique, ainsi que la version des données et du modèle qui l’a produite. Les révisions de données macroéconomiques, filtres liés au biais de survivance ou ajustements ultérieurs aux opérations sur titres pourraient sinon modifier l’évaluation après coup.

Évaluez les deux modèles sur les mêmes origines. Supprimer les dates difficiles pour un seul modèle rompt la comparaison appariée. En cas de prévisions manquantes, définissez un échantillon commun ou justifiez le traitement retenu ; ne laissez pas silencieusement les modèles affronter des régimes de marché différents. Choisissez les dates de début et de fin avant d’examiner quel échantillon produit le résultat souhaité.

La fonction de perte définit ce que signifie « plus précis »

Notons yₜ la valeur réalisée à l’origine t et ŷA,ₜ et ŷB,ₜ les prévisions des modèles A et B. Leurs erreurs sont eA,ₜ = yₜ − ŷA,ₜ et eB,ₜ = yₜ − ŷB,ₜ. Une fonction de perte L transforme chaque erreur en un score pour lequel une valeur plus faible est préférable. La perte quadratique L(e) = e² pénalise davantage les grandes erreurs. La perte absolue L(e) = |e| augmente linéairement avec l’écart. Une prévision de quantile peut utiliser une perte « pinball » asymétrique, car les coûts de surestimation et de sous-estimation peuvent différer.

Le choix du score peut changer le modèle qui paraît meilleur. Considérons deux paires d’erreurs hypothétiques exprimées dans la même unité : A présente les erreurs 0 et 2 ; B, les erreurs 1 et 1. Les pertes quadratiques moyennes sont de 2 pour A et de 1 pour B ; B obtient donc le meilleur score. Avec la perte absolue, la moyenne vaut 1 pour chacun. Aucun calcul n’est universellement juste : chacun répond à une question différente sur les erreurs qui comptent.

Pour une prévision du rendement moyen conditionnel, l’erreur quadratique peut être utile. Une prévision de volatilité demande un score adapté à sa cible ; une prévision de valeur à risque (VaR) peut nécessiter une perte de quantile ou un backtest adapté au risque. Choisir la perte après avoir vu quel modèle gagne revient à transformer le test en nouvelle recherche. Définissez le score et le sens de « meilleur » avant d’examiner la comparaison.

Une prévision de VaR vise un quantile de queue plutôt qu’une prévision ponctuelle ordinaire. Le guide du backtest de la VaR explique comment les tests de fréquence et de calendrier des dépassements évaluent séparément ce type de prévision du risque.

Construisez les différences de perte appariées et énoncez l’hypothèse nulle

Pour une fonction de perte où une valeur plus faible est préférable, définissez la différence à la période t ainsi :

dₜ = L(eA,ₜ) − L(eB,ₜ)

Avec cette convention de signe, un dₜ positif signifie que la perte de B est plus faible à cette origine ; une valeur négative favorise A. La moyenne de l’échantillon est d̄ = (1/n) Σ dₜ. L’hypothèse nulle d’égalité inconditionnelle de précision est E[dₜ] = 0. Une alternative bilatérale cherche une différence dans un sens ou dans l’autre. Une alternative unilatérale définie à l’avance peut demander si un modèle nommé présente une perte attendue plus faible.

La statistique de base est :

DM = d̄ / √(Ŝd / n)

Ŝd estime la variance de long terme de la série des différences de perte, et non la seule variance des erreurs de prévision de chaque modèle. Sous l’hypothèse nulle et des conditions de régularité adéquates, la statistique suit asymptotiquement une loi normale centrée réduite. De grandes valeurs positives favorisent B selon la convention ci-dessus ; de grandes valeurs négatives favorisent A. La valeur p mesure la compatibilité des données avec l’hypothèse et les hypothèses d’échantillonnage précisées, non la probabilité qu’un modèle soit vrai.

L’appariement écarte certaines différences générales d’échelle des erreurs, dans la mesure où elles apparaissent dans les différences par origine. Il ne rend pas la série des pertes indépendante, ne supprime pas automatiquement l’incertitude liée à l’estimation des paramètres et ne corrige pas une recherche menée sur de nombreuses cibles ou spécifications. Le protocole et le calcul de l’incertitude doivent tenir compte de ces choix.

Un exemple à un pas distingue l’écart observé de la force des éléments

Supposons 100 prévisions hypothétiques appariées à un pas. La perte quadratique moyenne du modèle A est 0,26 et celle du modèle B est 0,23, en points de pourcentage au carré. La différence moyenne est donc d̄ = 0,26 − 0,23 = 0,03 en faveur de B dans l’échantillon. Pour simplifier cet exemple, supposons que la variance de long terme estimée de dₜ soit égale à 0,04 et qu’il n’y ait pas de covariance sérielle entre les origines.

L’erreur-type de la différence moyenne est √(0,04 / 100) = 0,02. La statistique non ajustée est 0,03 / 0,02 = 1,50. Pour l’horizon h = 1 et T = 100, le facteur de correction de petit échantillon de Harvey–Leybourne–Newbold est √[(T + 1 − 2h + h(h − 1)/T) / T] = √0,99 ≈ 0,995. Après multiplication, la statistique ajustée vaut environ 1,49 ; avec la loi de Student t₉₉ comme référence approximative, la valeur p bilatérale est d’environ 0,14.

B présente la plus faible erreur quadratique moyenne observée, mais cet exemple ne fournit pas de preuve solide contre l’égalité de précision attendue aux seuils de significativité habituels. Ne pas rejeter l’hypothèse ne prouve pas que les modèles ont la même précision ; la rejeter resterait conditionnel au score, aux origines et aux hypothèses choisis. Les valeurs de perte et de variance sont des entrées hypothétiques à visée pédagogique, pas des résultats empiriques.

Les racines correspondantes des erreurs quadratiques moyennes (RMSE) sont d’environ 0,510 et 0,480 point de pourcentage, soit un écart descriptif de 0,030 point. La statistique DM utilise néanmoins les différences appariées des pertes quadratiques ; ce n’est pas un test t de la différence entre ces deux racines carrées.

Schéma conceptuel en trois volets : deux courbes de prévision face à une même trajectoire réalisée, des repères de pertes appariées à chaque origine, puis des barres de différences de perte signées autour de leur moyenne avec une bande d’incertitude ; sans libellé ni valeur numérique.
Représentation conceptuelle des pertes appariées et de leurs différences dans le test de Diebold–Mariano ; elle ne montre ni données de marché réelles ni résultat empirique du test.

Les horizons qui se chevauchent rendent les différences de perte dépendantes

Lorsque des prévisions à cinq jours sont émises chaque jour, deux prévisions consécutives partagent quatre de leurs cinq jours cibles. Leurs erreurs, pertes et différences de perte peuvent donc évoluer ensemble. Traiter 100 origines quotidiennes comme 100 comparaisons indépendantes peut sous-estimer l’incertitude et faire paraître la statistique trop élevée.

La variance de long terme tient compte de la covariance sérielle de dₜ. Un estimateur courant robuste à l’hétéroscédasticité et à l’autocorrélation (HAC) prend la forme suivante :

Ŝd = γ̂₀ + 2 Σₖ₌₁ᵐ wₖ γ̂ₖ

Ici, γ̂ₖ est l’autocovariance empirique au retard k, wₖ un poids de noyau et m la largeur de bande choisie. Newey et West (1987) proposent un estimateur HAC semi-défini positif. Pour des erreurs idéales de prévision à h pas, sous les hypothèses pertinentes, le chevauchement induit souvent une dépendance jusqu’à au moins h − 1 retards ; le cadre DM d’origine traite un estimateur tronqué dans ce cas. Les données réelles peuvent présenter une dépendance plus longue en raison de cibles persistantes, d’estimations glissantes ou de la construction de stratégies ; h − 1 n’est donc pas une règle générale pour choisir la largeur de bande.

Indiquez l’horizon, le noyau, la largeur de bande et toute correction de petit échantillon. Montrez si les conclusions changent avec des réglages raisonnables de dépendance, au lieu de choisir une largeur de bande qui donne la valeur p souhaitée. Si les origines sont assez espacées pour éviter le chevauchement, dites-le et expliquez quelles informations ou quelle taille d’échantillon ce choix fait perdre. La prise en compte de la dépendance dans l’incertitude fait partie du test, ce n’est pas une simple option d’affichage.

Les modèles emboîtés et l’évolution de la capacité prédictive appellent d’autres questions

La comparaison DM ordinaire est plus facile à interpréter lorsque les prévisions ne sont pas emboîtées sous l’hypothèse nulle d’égalité de précision. Si un modèle plus vaste inclut un modèle de référence plus simple, les coefficients supplémentaires estimés peuvent ajouter du bruit aux prévisions même si leurs vraies valeurs sont nulles. Dans ce cas, sous l’hypothèse nulle, la différence ordinaire des erreurs quadratiques moyennes de prévision peut suivre une loi non standard. Pour comparer les erreurs quadratiques moyennes hors échantillon de modèles emboîtés, une méthode comme l’ajustement de Clark–West tient compte de cet effet du bruit d’estimation ; elle ne remplace pas généralement le test DM dans tous les protocoles. Voir Clark et West (2007).

L’hypothèse nulle DM ordinaire porte sur la perte moyenne inconditionnelle sur l’ensemble de la période d’évaluation. Elle peut masquer des variations dans le temps : A peut être meilleur en période calme, B en période volatile, alors que leurs moyennes globales sont similaires. Si la question porte sur une précision relative dépendant d’informations connues à la date de prévision, les tests de capacité prédictive conditionnelle utilisent les différences de perte avec des instruments spécifiés à l’avance. Giacomini et White (2006) développent ce cadre. Ses hypothèses et la conception de la fenêtre d’évaluation comptent ; ajouter des indicateurs arbitraires après avoir examiné les résultats n’est pas un raccourci valide.

Le choix du test doit suivre la structure de la comparaison : prévisions indépendantes, modèles emboîtés, capacité conditionnelle variable ou famille sélectionnée parmi de nombreux candidats sont des situations distinctes. Pour ce dernier cas, le guide White Reality Check et Hansen SPA explique la correction à l’échelle de la famille après une recherche sur de nombreuses règles de trading.

Une perte de prévision plus faible ne démontre pas une stratégie rentable

Une prévision peut être statistiquement plus précise sans améliorer les résultats nets de trading. Une stratégie doit convertir la prévision en position, décider quand intervenir et supporter les spreads, commissions, glissement, impact de marché, financement, coûts d’emprunt et limites de risque. Une petite amélioration de l’erreur quadratique moyenne des rendements peut ne rien changer à une décision utile ; un modèle présentant une erreur moyenne un peu plus élevée peut mieux détecter un événement de queue important pour une règle donnée.

Évaluez la prévision et le portefeuille en deux étapes distinctes. Testez d’abord la prévision avec une cible et une perte correspondant à la tâche annoncée. Évaluez ensuite une règle de trading entièrement définie sur des données qui n’ont pas servi à choisir la prévision, avec des hypothèses réalistes d’exécution et de financement. La valeur p du test de prévision n’est ni un rendement de backtest, ni un ratio de Sharpe, ni la probabilité d’un gain futur.

Essayer à plusieurs reprises différents modèles, cibles, horizons, fonctions de perte et fenêtres d’échantillon crée un biais de sélection, même si chaque calcul DM individuel est correct. Consignez toute la recherche et appliquez une méthode de correction pour la famille si la question est de savoir si un candidat a résisté à cette recherche. Le guide du bootstrap par blocs traite l’incertitude préservant la dépendance pour une statistique choisie à l’avance ; il ne corrige pas à lui seul une recherche de modèles non documentée.

Donnez assez de détails pour permettre la réplication

Nommez les deux modèles, leur relation avec la référence, la cible, l’horizon, le calendrier des origines, les dates d’évaluation, l’ensemble d’information, la version des données et la règle d’échantillon commun. Définissez la fonction de perte mathématiquement et indiquez si un dₜ positif favorise A ou B. Rapportez n, la perte moyenne de chaque modèle, d̄, l’estimateur de variance de long terme, le noyau et la largeur de bande HAC, la correction de petit échantillon, la loi de référence, le sens du test et la valeur p.

Indiquez aussi si les modèles sont emboîtés, comment les paramètres ont été estimés, si la comparaison a été choisie avant ou après examen des résultats et quelles autres variantes ont été essayées. Si l’échantillon a servi à choisir le modèle, présentez le test comme faisant partie de cette sélection plutôt que comme une preuve hors échantillon intacte. Un rapport précis montre ce que le test compare et les problèmes d’incertitude ou de sélection qu’il ne résout pas.

Questions fréquentes

Q1Le test de Diebold–Mariano exige-t-il des erreurs de prévision normalement distribuées ?

Non. Le cadre peut traiter des erreurs qui ne suivent pas une loi normale. Il faut néanmoins une estimation adaptée de la variance des différences de perte et des conditions de régularité qui justifient la loi de référence.

Q2Puis-je comparer deux modèles qui prévoient des horizons différents ?

Pas comme une comparaison équivalente de précision. Alignez d’abord la cible et l’horizon ; sinon chaque modèle répond à une question de prévision différente.

Q3Un résultat DM significatif suffit-il pour choisir un modèle de trading ?

Non. Il indique des éléments sur la perte de prévision attendue dans une comparaison définie. Il faut aussi tenir compte de la recherche de modèles, des règles de décision, des coûts d’exécution et de financement et des performances de la stratégie hors échantillon. Recherche fondamentale - Diebold et Mariano, « Comparing Predictive Accuracy » (1995) - Harvey, Leybourne et Newbold, « Testing the Equality of Prediction Mean Squared Errors » (1997)00719-4) - Giacomini et White, « Tests of Conditional Predictive Ability » (2006) - Clark et West, « Approximately Normal Tests for Equal Predictive Accuracy in Nested Models » (2007) - Newey et West, « A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix » (1987)

Sources et lectures complémentaires

Signaler un problème

Nous préparons un e-mail avec le lien de cet article. Mark ne reçoit le signalement qu’après son envoi

Vérification rapide

Guide terminé ? Vérifiez vos acquis avec 3 questions

Question 1 / 3

Question 01

Avec dₜ = L(eA,ₜ) − L(eB,ₜ), qu’est-ce qu’une moyenne empirique positive favorise ?

Choisissez une réponse pour voir l'explication

Glossaire des options

Des définitions claires des termes essentiels, des calls, puts et chaînes d’options à la volatilité implicite, aux sensibilités et à l’écart acheteur-vendeur

Parcourir le glossaire des options
Deux tests bootstrap pour une famille de règles évaluées simultanémentWhite Reality Check et Hansen SPA pour les règles de tradingDécouvrez comment Reality Check et Hansen SPA évaluent toute une famille de règles techniques face à un benchmark, comment leurs bootstraps diffèrent et ce que signifie une p-valeur globale.Quelle est l’incertitude autour du rendement estimé ?Bootstrap par blocs et intervalles de confiance des stratégies de tradingDécouvrez comment le bootstrap par blocs mobiles et le bootstrap stationnaire préservent la dépendance temporelle pour estimer l’incertitude d’un rendement moyen ou d’un ratio de Sharpe.Évaluer la fréquence et le calendrier des exceptionsBacktesting de la VaR : les tests de Kupiec et ChristoffersenComprenez comment les tests POF de Kupiec et de couverture conditionnelle de Christoffersen évaluent les exceptions de VaR, avec un exemple sur 250 jours et les limites d’un non-rejet.Comparez deux prévisions selon leurs pertes sur les mêmes résultatsTest de Diebold–Mariano : comparer la précision des prévisionsDécouvrez ce que compare le test de Diebold–Mariano, comment les écarts de perte et l'autocorrélation entrent dans la statistique, et pourquoi la précision d'une prévision ne garantit pas un profit de trading.Comparer des prévisionsTest d’encompassing des prévisions : l’une contient-elle l’information de l’autre ?Comprenez comment tester l’information prédictive incrémentale et pourquoi l’encompassing ne se confond ni avec une comparaison de pertes, ni avec la calibration ou la rentabilité.