Skip to content
Tous les guides sur les options et contrats à terme
Évaluation des prévisions directionnelles13 min de lecture

Test de Pesaran–Timmermann : une prévision directionnelle apporte-t-elle de l’information ?

Découvrez comment le test de Pesaran–Timmermann compare les bonnes prévisions de direction à une référence calculée à partir des parts de hausses réelles et prévues, et pourquoi la dépendance sérielle modifie l’inférence.

Dans ce guideUn taux de réussite de 64 % peut être faible ou utile selon la référence

Bref résumé

Le test de Pesaran–Timmermann (PT) cherche à savoir si les prévisions contiennent de l’information sur le sens d’évolution d’un résultat. Pour une prévision binaire à la hausse ou à la baisse, il compare le taux de réussite directionnelle observé au taux de concordance impliqué séparément par les parts de résultats réellement à la hausse et de prévisions à la hausse. Cette référence n’est pas nécessairement de 50 %. Le test usuel repose aussi sur des hypothèses concernant la dépendance entre les origines de prévision. Enfin, la significativité statistique ne prouve pas qu’une règle de trading est rentable.

Un taux de réussite de 64 % peut être faible ou utile selon la référence

Supposons que le marché monte pendant 60 % des dates d’un échantillon d’évaluation. Le prévisionniste annonce une hausse pour 70 % de ces dates. Même si les prévisions et les résultats étaient indépendants, les deux séries concorderaient souvent : elles indiqueraient toutes deux une hausse à certaines dates et une baisse à d’autres. Comparer mécaniquement le taux de réussite à 50 % reviendrait à ignorer ce déséquilibre.

Le cadre PT rend cette comparaison explicite. Il demande si la direction prévue et la direction observée concordent plus souvent que ne le laisseraient prévoir leurs fréquences séparées sous l’hypothèse d’indépendance. Il s’agit d’un test de l’information prédictive directionnelle, et non d’une mesure de l’ampleur des rendements, du moment d’une opération ou de la valeur d’une stratégie complète. Pesaran et Timmermann ont introduit un test de performance prédictive fondé sur des tableaux de contingence ; dans le cas binaire 2×2, leur test est asymptotiquement équivalent à un test d’indépendance {source:pesaranTimmermannDirectionalTests1992}.

Place chaque prévision appariée dans un tableau 2×2

Soit \(Y_t=1\) si le résultat observé est classé à la hausse et \(Y_t=0\) s’il est classé à la baisse. Soit \(Z_t=1\) si la prévision annonce une hausse et \(Z_t=0\) si elle annonce une baisse. Chaque ligne de l’évaluation doit associer une prévision émise à l’origine \(t\) au résultat correspondant à l’horizon qu’elle visait.

Les quatre cellules dénombrent les paires hausse/hausse, hausse/baisse, baisse/hausse et baisse/baisse. Si \(n_{11}\) et \(n_{00}\) désignent les deux cellules concordantes et si \(n\) est le nombre de paires appariées utilisables, le taux de réussite directionnelle observé est

\[ \widehat{P}=\frac{n_{11}+n_{00}}{n}. \]

Cette classification est binaire. Décide à l’avance comment traiter un rendement nul, une prévision nulle ou une bande neutre. Une étude peut, par exemple, classer un rendement nul ou négatif comme « pas en hausse » et appliquer la même règle à une prévision égale ou inférieure à son seuil. Exclure les égalités est une autre possibilité, mais cela modifie l’échantillon et doit être appliqué de façon cohérente. Ne compte pas une égalité zéro/zéro comme une troisième forme de concordance si tu utilises une formule de référence à deux catégories.

L’origine de la prévision et son horizon cible doivent également coïncider. Si \(Z_t\) prévoit le signe du rendement cumulé des cinq prochaines séances, \(Y_t\) doit coder le signe de ce même rendement sur cinq séances à partir de la même origine, et non celui du rendement de demain sur une séance. Sinon, le tableau mélangerait des événements différents. Des prévisions quotidiennes d’un résultat à cinq séances qui se chevauchent peuvent figurer dans un tableau descriptif, mais elles créent le problème de dépendance évoqué plus bas.

Calcule la référence d’indépendance à partir des deux parts de hausse

Soit \(\hat p_y\) la part des résultats observés classés à la hausse dans l’échantillon et \(\hat p_z\) la part des prévisions qui annoncent une hausse. Si les catégories observées et prévues étaient indépendantes, la part attendue des concordances serait

\[ \widehat{P}^{*}=\hat p_y\hat p_z+(1-\hat p_y)(1-\hat p_z). \]

Le premier produit correspond à la probabilité d’une concordance hausse/hausse sous indépendance ; le second, à celle d’une concordance baisse/baisse. La référence dépend donc des deux parts marginales. Elle peut être supérieure ou inférieure à 50 %. Une prévision qui annonce toujours la direction la plus fréquente peut afficher un taux de réussite respectable sans apporter d’information.

Un cas extrême rend ce point visible. Si un classificateur annonce « hausse » à chaque date, alors \(\hat p_z=1\), le taux de réussite observé est égal à la part réelle des hausses \(\hat p_y\), et la référence d’indépendance vaut elle aussi \(\hat p_y\). L’excès de concordance est donc nul par construction. Une telle prévision constante peut sembler précise lorsque les hausses sont fréquentes, mais elle ne distingue pas les dates où le marché progressera ; sa variance estimée peut aussi être dégénérée, de sorte qu’une valeur \(p\) PT conventionnelle peut ne pas exister.

Considérons 100 dates appariées hypothétiques. Les résultats réels sont à la hausse sur 60 dates et les prévisions annoncent une hausse sur 70 dates. Le tableau est le suivant :

Direction observéePrévision de haussePrévision de baisseTotal
Hausse471360
Baisse231740
Total7030100

Il y a 64 concordances, donc \(\widehat P=0.64\). La référence d’indépendance vaut \(0.60\times0.70+0.40\times0.30=0.54\). Le taux de réussite observé dépasse cette référence de 10 points de pourcentage. Ces nombres inventés illustrent le calcul ; l’écart seul ne fournit ni une estimation valable de l’incertitude ni une preuve de performance de trading.

Rapporte l’écart de réussite à son incertitude estimée

Pour la statistique PT binaire standard, définissons

\[ \widehat v=\frac{\widehat P^{*}(1-\widehat P^{*})}{n} \]

et

\[ \widehat w=\frac{(2\hat p_y-1)^2\hat p_z(1-\hat p_z)+(2\hat p_z-1)^2\hat p_y(1-\hat p_y)}{n}. \]

On obtient alors

\[ PT=\frac{\widehat P-\widehat P^{*}}{\sqrt{\widehat v-\widehat w}}. \]

Sous l’hypothèse nulle et les hypothèses usuelles de grand échantillon, cette statistique se réfère asymptotiquement à la loi normale standard. Le numérateur mesure la concordance excédant la référence d’indépendance. Le dénominateur tient compte de l’estimation de cette référence à partir du même échantillon, au lieu de la traiter comme un objectif fixe de 50 %. La documentation de statsmodels précise la formule et sa notation {source:statsmodelsPesaranTimmermannAPI}.

L’expression ci-dessus est la forme asymptotique de premier ordre de la variance documentée par statsmodels. La formule delta plus complète en échantillon fini, dans le traitement d’origine, ajoute à \(\widehat w\) le terme \(4\hat p_y\hat p_z(1-\hat p_y)(1-\hat p_z)/n^2\). Ce terme d’ordre inférieur ne modifie pas l’asymptotique de premier ordre, mais peut déplacer la statistique en échantillon fini. Si les résultats dépendent de l’implémentation, indique la formule et la version logicielle utilisées. Ne compare pas les valeurs \(p\) comme si tous les logiciels effectuaient exactement le même calcul en échantillon fini.

La formule ne corrige pas un protocole d’évaluation fragile. Un échantillon minuscule, des prévisions presque constantes, des cellules vides ou une variance estimée nulle ou invalide peuvent rendre l’approximation usuelle peu fiable ou indéfinie. Dans ce cas, ne force pas le calcul d’une valeur \(p\). Présente les parts marginales et le tableau, puis choisis une méthode d’inférence adaptée aux données et à la taille de l’échantillon.

Pour le tableau hypothétique ci-dessus, les composantes de la formule de premier ordre sont \(\widehat v=0.54(0.46)/100=0.002484\) et \(\widehat w=[0.2^2(0.7)(0.3)+0.4^2(0.6)(0.4)]/100=0.000468\). L’erreur-type est \(\sqrt{0.002484-0.000468}\approx0.0449\), d’où \(PT\approx0.10/0.0449=2.23\). La référence normale standard bilatérale donne une valeur \(p\) proche de 0.026. Il s’agit d’un calcul fondé sur des effectifs inventés et sur la formule asymptotique de premier ordre ; le terme complet en échantillon fini modifie légèrement le résultat, et la dépendance sérielle peut invalider la référence normale. Ne le présente pas comme un résultat empirique.

Illustration conceptuelle sans texte : des paires de flèches cuivrées et turquoise dans une grille 2×2 montrent les directions réelles et prévues à la hausse ou à la baisse, les concordances et écarts, ainsi que des parts différentes ; il ne s’agit pas de données empiriques.
Représentation conceptuelle des concordances et écarts entre directions réelles et prévues, avec des parts de hausse différentes ; aucune donnée réelle de marché.

Lis un rejet comme un indice directionnel, pas comme un verdict de trading

Un numérateur positif signifie que les directions observées concordent plus souvent que ne le prévoit la référence d’indépendance ; un numérateur négatif signifie qu’elles concordent moins souvent. Un test unilatéral défini à l’avance peut demander si la concordance dépasse la référence. Un test bilatéral demande si l’association directionnelle diffère dans l’un ou l’autre sens. Il faut choisir l’hypothèse alternative et le seuil de significativité avant d’examiner les résultats.

Une petite valeur \(p\) constitue, sous les hypothèses du test, un indice contre l’hypothèse nulle formulée. Ce n’est ni la probabilité que cette hypothèse soit vraie, ni celle que la prévision fonctionne à la période suivante. Elle ne signifie pas non plus que les rendements suffisaient à couvrir l’écart acheteur-vendeur, les frais, l’impact de marché, le financement ou les coûts d’emprunt. Elle ne corrige pas davantage les essais portant sur de nombreux actifs, horizons, seuils, variantes de modèle ou signes de prévision suivis de la publication du seul gagnant. Si des stratégies candidates ont été explorées, le guide White Reality Check explique pourquoi cette sélection doit être prise en compte dans l’inférence.

Par ailleurs, ne pas rejeter l’hypothèse nulle ne prouve pas que les directions sont indépendantes. Un échantillon court ou déséquilibré peut manquer de puissance pour détecter une association. Un numérateur PT négatif ne prouve pas non plus l’absence totale de structure : il peut signaler un désaccord systématique. Inverser le signe de la prévision après avoir observé ce résultat constitue un nouveau choix de modèle ; il faut le tester sur de nouvelles données ou l’inclure dans la procédure de recherche initiale.

Présente ensemble la part réelle des hausses, la part des prévisions de hausse, le taux de réussite observé, la référence d’indépendance, le gain en points de pourcentage, l’hypothèse alternative et la méthode d’estimation de l’incertitude. Une valeur \(p\) sans les marges du tableau et la taille de l’effet permet difficilement de distinguer un faible gain estimé avec précision d’un gain plus important mais incertain.

La dépendance sérielle peut fausser la distribution de référence usuelle

La statistique PT ordinaire est souvent présentée sous l’hypothèse d’indépendance temporelle des observations directionnelles. Or les catégories financières peuvent se suivre par séquences. Des objectifs à plusieurs jours peuvent se chevaucher dans des observations quotidiennes, les régimes de volatilité peuvent persister et des prévisions glissantes peuvent réutiliser presque les mêmes données d’estimation. Les \(n\) paires ne représentent alors pas \(n\) informations indépendantes. L’erreur-type usuelle peut être trop faible, ce qui entraîne trop de rejets.

Pesaran et Timmermann ont ensuite élaboré des tests de dépendance entre variables sérielles à catégories multiples, à l’aide de régressions augmentées de façon dynamique et d’un cadre de Markov d’ordre fini {source:pesaranTimmermannSerialCategories2009}. Les travaux consacrés aux prévisions directionnelles constatent aussi que les procédures PT classiques fondées sur l’indépendance peuvent rejeter trop souvent en présence de corrélation sérielle et étudient des solutions robustes à la dépendance, dont le bootstrap {source:blaskowitzHerwartzDirectionalSerialCorrelation2014}. La méthode adaptée dépend de la manière dont les prévisions sont générées, de leur horizon et de la structure de dépendance ; une procédure de rééchantillonnage générique n’est pas automatiquement valide.

Précise si les origines de prévision se chevauchent, leur espacement et la méthode de prise en compte de la dépendance utilisée pour estimer l’incertitude. Si tu présentes la statistique classique comme référence descriptive, signale son hypothèse d’indépendance. Ne traite pas un résultat nominal au seuil de 5 % comme si le taux réel de faux rejets était aussi de 5 % lorsque le protocole viole cette hypothèse.

Évalue des prévisions qui auraient réellement pu être émises

Pour chaque origine, conserve exactement la prévision disponible à ce moment, son horizon, la date limite des informations, le résultat observé et la règle qui convertit chacun en catégorie de hausse ou de baisse. Aligne les horodatages, les instruments, la définition du prix ou du rendement et le traitement des valeurs manquantes avant de construire le tableau. Une prévision fondée sur des données macroéconomiques révisées ou sur un signal ajusté pendant la période d’évaluation n’est pas une véritable prévision hors échantillon intacte.

Fixe le seuil de classification avant de consulter les résultats de l’échantillon de réserve. Si un modèle produit une probabilité, le seuil la transforme en direction binaire ; le rechercher sur le même échantillon change la question et crée un biais de sélection. Sépare les rôles des échantillons d’entraînement, de validation et d’évaluation finale. Si une procédure de rééchantillonnage doit tenir compte de la recherche de modèles, répète-y l’ensemble du processus de sélection.

La question du PT diffère de la comparaison de l’ampleur des erreurs de prévision. Le guide Diebold–Mariano compare des différences de pertes appariées, tandis que le guide Giacomini–White demande si la capacité prédictive relative varie avec des informations définies à l’avance. Pour des modèles de prévision emboîtés, consulte le guide de l’ajustement de Clark–West. Ces tests répondent à des questions différentes ; il ne faut pas les remplacer les uns par les autres au seul motif qu’ils produisent des statistiques familières.

La significativité directionnelle ne prouve pas la rentabilité d’une stratégie

Le test PT réduit chaque résultat à une catégorie de direction. Une hausse d’un tick et un fort rally comptent tous deux comme une hausse ; une petite erreur et une lourde perte comptent chacune comme une seule erreur directionnelle. Un modèle peut donc améliorer son taux de réussite tout en perdant de l’argent si ses erreurs coûtent plus que ses gains, si le signal arrive après le mouvement du prix ou si les frais absorbent l’avantage.

Par exemple, imaginons 100 opérations hypothétiques de même taille : 64 directions correctes rapportent en moyenne 0,10 % chacune et 36 directions incorrectes perdent en moyenne 0,25 % chacune. Leur somme brute simple est \(64(0.10\%)-36(0.25\%)=-2.6\) points de pourcentage avant frais, malgré un taux de réussite de 64 %. Ce calcul volontairement simplifié ignore la capitalisation et ne constitue pas une observation de marché ; il montre pourquoi le taux de réussite ne suffit pas à déterminer l’espérance.

Pour évaluer une opération, définis avant le calcul des rendements le moment de l’entrée et de la sortie, la taille de la position, les limites de risque et le traitement des ordres non exécutés. Intègre, le cas échéant, l’écart acheteur-vendeur, les commissions, le glissement, l’impact de marché, le financement et les coûts propres à la plateforme. Compare les rendements nets hors échantillon à une référence adaptée et tiens compte de la même recherche parmi plusieurs tests qui a produit la règle. Le résultat PT peut constituer un élément de preuve sur l’association directionnelle ; il ne remplace pas une évaluation exécutable intégrant les coûts.

Questions fréquentes

Q1Le test de Pesaran–Timmermann compare-t-il la précision à 50 % ?

Non. Il compare la concordance observée à une référence d’indépendance calculée séparément à partir des parts de résultats réels et de prévisions à la hausse. Cette référence peut être supérieure ou inférieure à 50 %.

Q2Puis-je utiliser la valeur \(p\) PT habituelle lorsque les horizons de prévision se chevauchent ?

Pas sans traiter la dépendance. Les objectifs qui se chevauchent et les étiquettes persistantes peuvent rendre trop faible l’estimation usuelle de l’incertitude fondée sur l’indépendance. Utilise une méthode adaptée à l’horizon et à la structure de dépendance.

Q3Un résultat PT significatif signifie-t-il que la stratégie de trading est rentable ?

Non. Le test utilise des catégories de direction et ne mesure ni l’ampleur des mouvements, ni les prix d’entrée et de sortie, ni la taille de position, ni les frais, le glissement ou le financement. Évalue séparément les rendements nets hors échantillon.

Sources et lectures complémentaires

Signaler un problème

Nous préparons un e-mail avec le lien de cet article. Mark ne reçoit le signalement qu’après son envoi

Vérification rapide

Guide terminé ? Vérifiez vos acquis avec 3 questions

Question 1 / 3

Question 01

Si les résultats réels sont à la hausse 60 % du temps et que les prévisions annoncent une hausse 70 % du temps, quelle est la référence de concordance sous indépendance ?

Choisissez une réponse pour voir l'explication

Glossaire des options

Des définitions claires des termes essentiels, des calls, puts et chaînes d’options à la volatilité implicite, aux sensibilités et à l’écart acheteur-vendeur

Parcourir le glossaire des options
Comparer la précision des prévisionsTest de Diebold–Mariano : comparer deux prévisionsDécouvrez comment le test de Diebold–Mariano compare des pertes appariées, traite les horizons qui se chevauchent et pourquoi une faible valeur p ne prouve pas une aptitude à trader.Évaluation des prévisionsTest de Giacomini–White : précision conditionnelle des prévisionsDécouvrez comment le test de Giacomini–White évalue les variations de précision selon des conditions connues, comment choisir les instruments et ce que le résultat permet de conclureComparaison de prévisions emboîtéesTest de Clark–West pour les prévisions emboîtées : formule, exemple et limitesDécouvrez pourquoi les modèles de prévision emboîtés nécessitent une comparaison du MSPE ajustée, comment fonctionne la statistique de Clark–West et ce qu’un résultat unilatéral peut ou non établir.Pourquoi le gagnant d’une recherche de stratégies doit être évalué à l’échelle de la familleWhite’s Reality Check contre le data snooping dans les backtests de stratégiesDécouvrez comment White’s Reality Check compare la meilleure stratégie d’une recherche à un benchmark en utilisant le maximum d’un bootstrap qui tient compte des dépendancesComparaison de modèles de prévisionModel Confidence Set (MCS) : comparer des prévisions sans imposer un gagnantDécouvrez comment le Model Confidence Set combine des tests séquentiels et un bootstrap tenant compte de la dépendance temporelle pour conserver des modèles que les données ne permettent pas de départager.