Skip to content
Tous les guides sur les options et contrats à terme
Comparez deux prévisions selon leurs pertes sur les mêmes résultats13 min de lecture

Test de Diebold–Mariano : comparer la précision des prévisions

Découvrez ce que compare le test de Diebold–Mariano, comment les écarts de perte et l'autocorrélation entrent dans la statistique, et pourquoi la précision d'une prévision ne garantit pas un profit de trading.

Dans ce guideLe test compare la perte attendue des prévisions

Bref résumé

Le test de Diebold–Mariano (DM) demande si deux procédures de prévision ont la même perte attendue sur des résultats évalués de façon appariée. Il repose sur une série d'écarts de perte : la fonction de perte, l'horizon et la dépendance entre dates influent donc sur le résultat. Un rejet étaye l'existence d'une différence dans le cadre du protocole d'évaluation défini ; il ne montre ni qu'un modèle restera supérieur ni qu'une stratégie sera rentable après frais.

Le test compare la perte attendue des prévisions

Le test de Diebold–Mariano compare deux prévisions de la même variable cible aux mêmes dates d'évaluation. À chaque origine de prévision, les deux procédures doivent viser le même résultat réalisé, le même horizon et le même instant de coupure de l'information. Le test demande ensuite si la perte moyenne d'une procédure diffère systématiquement de celle de l'autre, en autorisant les écarts de perte à varier dans le temps.

Diebold et Mariano posent la question pour une fonction de perte générale, et pas seulement pour l'erreur quadratique moyenne. Leur article fondateur développe des tests de l'hypothèse nulle selon laquelle des prévisions concurrentes ont la même précision prédictive (Diebold et Mariano, 1995). Ici, la « précision » signifie une perte attendue plus faible selon la fonction choisie pour la comparaison. Cela ne signifie pas qu'une prévision soit vraie, qu'elle explique causalement le résultat, qu'elle soit bien calibrée dans toutes les parties de sa distribution ni qu'elle soit utile à toute décision.

Supposons que les modèles A et B prévoient le même rendement futur au même moment. Le test DM ne vérifie pas si un coefficient de l'un des modèles est nul, ni si leurs valeurs ajustées sont identiques dans l'échantillon d'estimation. Il compare la manière dont leurs erreurs de prévision se traduisent en pertes dans l'échantillon d'évaluation, selon la fonction retenue.

Le protocole doit être défini avant d'interpréter la statistique. La variable cible, les origines de prévision, l'horizon, la fonction de perte, le traitement des résultats manquants, le calendrier de réestimation et l'alternative unilatérale ou bilatérale déterminent la question testée. Si ces choix diffèrent entre les modèles, leur écart de perte ne correspond plus à une comparaison à conditions égales.

Définir des prévisions appariées et un écart de perte

Soit $y_t$ la valeur cible réalisée à l'origine de prévision $t$, et $\hat y_{A,t}$ et $\hat y_{B,t}$ les prévisions des modèles A et B. Leurs erreurs sont $e_{A,t}=y_t-\hat y_{A,t}$ et $e_{B,t}=y_t-\hat y_{B,t}$. Pour une fonction de perte $L$, l'écart de perte à la date $t$ est défini ainsi :

$$ d_t=L(e_{A,t})-L(e_{B,t}) $$

Avec cette convention de signe, une moyenne de $d_t$ négative signifie que la perte observée de A est plus faible ; une moyenne positive indique une perte plus faible pour B. L'hypothèse nulle dans la population est $E[d_t]=0$. Une alternative bilatérale recherche un écart dans un sens ou dans l'autre ; une alternative unilatérale vise un sens choisi à l'avance. Ne choisissez pas le sens après avoir vu quel modèle l'emporte.

Avec une perte quadratique $L(e)=e^2$, les grandes erreurs pèsent de manière disproportionnée. Avec une perte absolue $L(e)=|e|$, une seule erreur importante domine moins le classement. La perte quantile peut convenir à un objectif de prévision asymétrique, et d'autres pertes ciblent d'autres dimensions de la performance prédictive. Le classement peut s'inverser selon la fonction : « meilleure prévision » n'a donc pas de sens unique tant que la perte n'est pas précisée. La revue de Tashman sur les tests de prévision hors échantillon souligne également que l'évaluation doit correspondre au problème étudié (Tashman, 200000065-0)).

Utilisez les mêmes origines de prévision et les mêmes résultats pour les deux modèles. Si une prévision difficile manque pour l'un d'eux, la supprimer silencieusement seulement pour ce modèle modifie l'échantillon de comparaison. Si le modèle doit être réestimé chaque mois en production avec de nouvelles données, générez les prévisions d'évaluation selon cette même règle ; une expérience à paramètres fixes répond à une autre question. Une évaluation séquentielle telle que la validation walk-forward précise comment produire les prévisions ultérieures sans utiliser de données futures.

Un exemple à quatre origines montre le sens de l'écart moyen

Considérons quatre origines de prévision hypothétiques ; la cible et les erreurs sont mesurées en points de pourcentage. Les erreurs du modèle A sont $[1,2,0,1]$ et celles du modèle B $[2,1,1,1]$. Chaque paire vise le même rendement réalisé et le même intervalle de prévision. Ces valeurs sont inventées uniquement pour illustrer le calcul.

Avec une perte quadratique, les pertes de A sont $[1,4,0,1]$ et son erreur quadratique moyenne vaut $(1+4+0+1)/4=1.50$ point de pourcentage au carré. Les pertes de B sont $[4,1,1,1]$ et son erreur quadratique moyenne vaut $(4+1+1+1)/4=1.75$. Sur ces quatre résultats, le MSE de A est inférieur de 0.25 point de pourcentage au carré.

Les écarts par date, $d_t=L(e_{A,t})-L(e_{B,t})$, sont $[-3,3,-1,0]$. Leur moyenne est $(-3+3-1+0)/4=-0.25$, soit la différence entre le MSE moyen de A et celui de B. Le signe négatif favorise A selon cette convention. Il ne dit pas encore si l'écart dépasse le bruit d'échantillonnage : quatre paires de prévisions ne constituent pas une preuve statistique convaincante.

La définition de la perte change aussi le sens de « meilleur ». Dans un autre exemple hypothétique, le modèle C a des erreurs absolues $[0,0,0,3]$ et le modèle D $[1,1,1,1]$. Avec la perte absolue, les moyennes sont 0.75 pour C et 1 pour D, donc C est préférable. Avec la perte quadratique, elles sont 2.25 pour C et 1 pour D, donc D est préférable. Le test ne peut trancher ce désaccord sans décider quelles erreurs comptent le plus.

<!-- Illustration placement: after this section; text-free conceptual scene showing two forecast paths against one realized path, with visibly different miss distances and no labels or numerical claims. -->

La statistique DM rapporte l'écart moyen à son incertitude

L'écart de perte moyen dans l'échantillon est $\bar d=T^{-1}\sum_{t=1}^{T}d_t$, où $T$ désigne le nombre de résultats de prévision appariés. Son erreur type dépend de la variance de long terme de $d_t$, et pas seulement de sa variance à une date donnée. Une forme générale de la statistique est :

$$ DM=\frac{\bar d}{\sqrt{\widehat{\Omega}/T}} $$

$\widehat{\Omega}$ estime la variance de long terme de la série des écarts de perte. Si les dates étaient indépendantes, elle se ramènerait à la variance de $d_t$ avec l'estimateur retenu. Or les pertes de prévision ont souvent tendance à se regrouper : une période très volatile peut accroître les erreurs des deux modèles, et une cible à $h$ pas peut faire partager des rendements réalisés aux fenêtres d'erreur voisines. Ignorer une dépendance positive peut sous-estimer l'erreur type et exagérer la force des éléments observés.

Une construction HAC courante estime les autocovariances $\hat\gamma_k$ de l'écart de perte centré, puis les combine sous la forme $\widehat{\Omega}=\hat\gamma_0+2\sum_{k=1}^{q}w_k\hat\gamma_k$. Avec des poids de Bartlett jusqu'à la bande passante $q$, $w_k=1-k/(q+1)$. Newey et West ont proposé un estimateur de covariance semi-défini positif, cohérent face à l'hétéroscédasticité et à l'autocorrélation (Newey et West). Le noyau et la bande passante sont des choix de mise en œuvre : indiquez-les et adaptez-les au protocole de prévision plutôt que de les régler pour obtenir une valeur p préférée. Le guide sur les erreurs types HAC traite le problème plus général d'estimation de covariance.

Sous les conditions de régularité du test, la statistique DM standard est comparée asymptotiquement à une loi normale standard. Une grande valeur absolue indique que l'écart moyen observé est important par rapport à son incertitude estimée. Le signe précise quel modèle a eu la perte la plus faible selon l'ordre défini ; la valeur p ne mesure ni l'ampleur ni la valeur économique de l'écart. Elle n'est pas non plus la probabilité que l'hypothèse nulle soit vraie ou qu'une prévision fonctionne à l'avenir.

Les prévisions à plusieurs pas se chevauchent ; la taille d'échantillon compte

Lorsque les prévisions sont produites à chaque période pour une cible située plusieurs périodes plus loin, les fenêtres d'évaluation se chevauchent. Par exemple, une prévision mensuelle du rendement cumulé des trois prochains mois partage deux de ces trois rendements avec celle publiée un mois plus tard. Même si les rendements mensuels étaient indépendants, ce chevauchement peut induire une autocorrélation dans les erreurs de prévision et les écarts de perte.

Dans une configuration de base à $h$ pas, le calcul de variance doit prendre en compte au moins la dépendance jusqu'au retard $h-1$. Ce n'est pas une règle universelle de bande passante : réestimations glissantes, cibles persistantes, grappes de volatilité et fonction de perte peuvent créer d'autres dépendances. Consignez l'horizon, l'espacement des origines et la raison du choix de la troncature HAC ou d'un autre estimateur de variance. Le nombre de lignes de prévision ne correspond pas automatiquement au nombre d'observations indépendantes.

Le test asymptotique d'origine peut avoir une taille effective inadéquate dans des échantillons modérés. Harvey, Leybourne et Newbold ont proposé une correction en échantillon fini pour comparer des erreurs quadratiques moyennes de prévision (HLN, 199700719-4)). Une forme courante, pour un horizon $h$ et $T$ prévisions, multiplie la statistique DM par :

$$ DM_{HLN}=DM\sqrt{\frac{T+1-2h+h(h-1)/T}{T}} $$

La statistique modifiée est généralement comparée à une loi de Student à $T-1$ degrés de liberté. Pour $T=60$ et $h=5$, le multiplicateur vaut environ $0.925$. Cet exemple illustre uniquement le calcul de la correction ; il ne signifie pas que 60 observations suffisent pour un modèle particulier ni que les hypothèses sont satisfaites. La correction traite un problème précis de petit échantillon, mais ne corrige ni une fuite d'information, ni une cible invalide, ni une dépendance omise, ni la sélection répétée de modèles, ni une fonction de perte mal spécifiée.

Les modèles emboîtés exigent un raisonnement différent pour comparer les prévisions

Le modèle A peut être une version contrainte du modèle B ; par exemple, B peut ajouter des prédicteurs à A. Sous l'hypothèse nulle selon laquelle les prédicteurs ajoutés n'ont aucune valeur prédictive dans la population, leurs coefficients estimés peuvent malgré tout injecter du bruit dans les prévisions de B. Le modèle plus grand peut alors avoir un MSE observé plus élevé même si ses prédicteurs supplémentaires n'améliorent pas le processus de prévision sous-jacent. Le raisonnement d'égalité de précision prévu pour des modèles concurrents non emboîtés ne s'applique pas automatiquement sans changement.

Clark et West développent des tests approximativement normaux d'égalité de précision prédictive pour les modèles emboîtés et ajustent la comparaison des erreurs quadratiques pour tenir compte du bruit d'estimation du modèle plus grand (Clark et West, 2007). Leur ajustement ne remplace pas universellement tous les tests DM : il est conçu pour une question, une perte et un cadre asymptotique précis. Vérifiez si un modèle en emboîte un autre, puis choisissez un test dont la loi nulle convient au protocole. Ne supposez pas qu'une valeur p DM standard fournie par un logiciel couvre toutes les relations entre modèles.

D'autres distinctions comptent. Une prévision au MSE inférieur n'améliore pas forcément la couverture des intervalles, le calibrage probabiliste, la précision directionnelle ou la décision en aval. Une comparaison peut être hors échantillon tout en reposant sur un jeu de validation inadéquat, examiné à répétition pendant le développement du modèle. Indiquez la relation entre les modèles, la méthode d'estimation, l'horizon et les données utilisées pour chaque prévision.

La précision des prévisions n'est pas un avantage de trading

Un résultat DM évalue une perte prédictive ; une décision de trading évalue un processus de rendement et de risque. Un MSE plus faible pour les rendements de la période suivante ne garantit pas qu'un signal indique assez souvent le bon sens de la position, dimensionne correctement les positions ou résiste au turnover, aux spreads, à l'impact de marché, aux commissions, à l'emprunt, au funding et aux délais d'exécution. À l'inverse, une prévision au MSE légèrement supérieur peut tout de même améliorer une décision si elle est plus précise aux moments où la stratégie est fortement exposée. La perte pertinente doit alors éventuellement représenter la décision réelle plutôt qu'une mesure générale et commode de prévision.

Un écart statistiquement significatif peut aussi être très faible sur le plan économique. Présentez l'ampleur de l'écart moyen de perte dans des unités interprétables avec son incertitude, et pas seulement une valeur p ou une étiquette de gagnant. Si l'affirmation porte sur un portefeuille, rejouez la règle de décision complète et figée sur des données ultérieures adaptées, avec des hypothèses de trading réalistes, et communiquez séparément les résultats nets. DM ne calcule pas ces résultats et ne tient pas compte des frais, sauf si la perte a été explicitement construite pour cela.

Le test ne corrige pas non plus la recherche parmi de nombreux modèles, cibles, horizons, fonctions de perte, périodes ou règles de trading suivie de la publication de la comparaison la plus favorable. La répétition de tests par paires crée son propre problème de sélection. Conservez l'historique de recherche et utilisez une méthode de tests multiples adaptée à l'ensemble des affirmations. Le guide sur les tests multiples et le taux de fausses découvertes explique pourquoi les seuils ordinaires peuvent induire en erreur après une vaste recherche. Le test DM est un outil d'évaluation, pas une correction du data snooping.

Rapporter assez de détails pour reproduire la comparaison

Un compte rendu clair précise la cible et les unités, l'instant de coupure de l'information, les origines, l'horizon, le calendrier de réestimation et l'échantillon commun d'évaluation. Il indique la fonction de perte et le signe de $d_t$, fournit la perte moyenne de chaque modèle et leur écart moyen, décrit l'hypothèse unilatérale ou bilatérale choisie à l'avance et rapporte l'estimateur de variance, le noyau, la bande passante, la statistique, la loi de référence, la valeur p et, le cas échéant, un intervalle de confiance ou une mesure d'incertitude.

Précisez également si les modèles sont emboîtés, comment les résultats manquants et les valeurs extrêmes ont été traités, combien de spécifications alternatives ont été étudiées et si la période d'évaluation a influencé les choix de modèles. Montrez l'ampleur de l'écart et pas seulement le franchissement d'un seuil. Une série chronologique de $d_t$ ou un graphique des écarts de perte cumulés peut révéler des changements de régime masqués par une moyenne globale, mais un graphique ne remplace pas une inférence qui tient compte de la dépendance.

En trading quantitatif, décrivez également le passage de la prévision à l'action : seuil du signal, taille des positions, moment du rééquilibrage, contrôles du risque, prix d'exécution et hypothèses de frais. Le test DM ne compare que la série de pertes prédictives qui lui est fournie. Il ne certifie pas le pipeline de données, ne rend pas comparables des échantillons d'évaluation différents, ne prouve pas la causalité et ne garantit pas la persistance des classements historiques. Utilisez-le comme une composante transparente de l'évaluation des modèles, avec un protocole de prévision respectant l'ordre temporel et une évaluation explicite au niveau de la décision.

Questions fréquentes

Q1Le test de Diebold–Mariano compare-t-il les coefficients des modèles ?

Non. Il compare la perte attendue des erreurs de prévision produites par deux procédures sur des résultats appariés. Un test de coefficient pose une autre question sur un paramètre du modèle.

Q2Puis-je utiliser le test pour des prévisions à plusieurs périodes ?

Oui, mais des fenêtres cibles qui se chevauchent peuvent rendre les écarts de perte successifs dépendants dans le temps. Utilisez un estimateur de variance et, le cas échéant, une correction en échantillon fini adaptés à l'horizon et au protocole, et documentez vos choix.

Q3Un résultat significatif signifie-t-il que la meilleure prévision fera gagner de l'argent ?

Non. Il étaye une différence de perte de prévision selon le protocole d'évaluation. La rentabilité dépend aussi de la conversion des prévisions en positions, du risque pris, de l'exécution réelle et des frais de trading.

Sources et lectures complémentaires

Signaler un problème

Nous préparons un e-mail avec le lien de cet article. Mark ne reçoit le signalement qu’après son envoi

Vérification rapide

Guide terminé ? Vérifiez vos acquis avec 3 questions

Question 1 / 3

Question 01

Quelle est l'hypothèse nulle du test de Diebold–Mariano de base ?

Choisissez une réponse pour voir l'explication

Glossaire des options

Choisissez l’historique utilisé par un modèle financierFenêtres extensibles et glissantes pour la validation walk-forwardComparez les fenêtres d’entraînement extensibles et glissantes de longueur fixe, séparez validation et test final, et choisissez les règles sans résultats futurs.Un même coefficient peut avoir une incertitude différenteHétéroscédasticité, autocorrélation et erreurs-types robustesDécouvrez pourquoi les erreurs-types classiques échouent, ce que permettent les estimateurs White, groupés et HAC de Newey–West, comment les choisir et où l'inférence robuste s'arrête dans les données financièresPourquoi un seul seuil échoue lorsque les chercheurs testent de nombreuses idéesTests multiples et taux de fausses découvertes en financeComprenez les comparaisons multiples, l'erreur familiale, le taux de fausses découvertes, Bonferroni, Holm, Benjamini–Hochberg, la dépendance, les valeurs q, le mining de facteurs, la sélection par backtest et la gouvernance de la rechercheComparer la précision des prévisionsTest de Diebold–Mariano : comparer deux prévisionsDécouvrez comment le test de Diebold–Mariano compare des pertes appariées, traite les horizons qui se chevauchent et pourquoi une faible valeur p ne prouve pas une aptitude à trader.Évaluation des prévisions directionnellesTest de Pesaran–Timmermann : une prévision directionnelle apporte-t-elle de l’information ?Découvrez comment le test de Pesaran–Timmermann compare les bonnes prévisions de direction à une référence calculée à partir des parts de hausses réelles et prévues, et pourquoi la dépendance sérielle modifie l’inférence.