Skip to content
Tous les guides sur les options et contrats à terme
Recherche quantitative12 min de lecture

Deflated Sharpe Ratio : tests multiples et sélection des backtests

Découvrez comment le Deflated Sharpe Ratio ajuste l’évidence du Sharpe après la sélection d’une stratégie, en tenant compte des tests multiples et des rendements non normaux, avec un exemple hypothétique et des limites explicites.

Dans ce guideAprès une recherche, le DSR relève le seuil du Sharpe

Bref résumé

Le Deflated Sharpe Ratio (DSR) demande si le Sharpe estimé d’une stratégie sélectionnée dépasse un seuil qui tient compte à la fois de la recherche parmi plusieurs options et de la forme de la distribution des rendements. Il applique un calcul probabiliste du Sharpe à une référence ajustée pour la sélection. Le DSR est un diagnostic statistique conditionnel : il ne transforme pas un backtest en preuve de profits futurs et ne corrige ni les essais omis, ni les coûts irréalistes, ni les fuites temporelles.

Après une recherche, le DSR relève le seuil du Sharpe

Une personne qui mène une recherche peut tester de nombreuses définitions de signaux, fenêtres rétrospectives, seuils d’entrée, univers, durées de détention et hypothèses de coûts, puis présenter la variante au Sharpe le plus élevé. Même si aucun candidat n’a de compétence réelle, les estimations varient à cause de l’échantillonnage. Plus la recherche est vaste, plus l’estimation maximale tend à augmenter. Le résultat retenu diffère donc de l’évaluation d’une stratégie unique définie avant l’examen des données.

Le Deflated Sharpe Ratio, proposé par Bailey et López de Prado, traite deux sources de gonflement du Sharpe sélectionné : les tests multiples et les rendements non normaux. Les tests multiples élèvent le seuil à dépasser ; la non-normalité modifie l’incertitude estimée du Sharpe. L’article d’origine décrit le DSR comme un Probabilistic Sharpe Ratio évalué par rapport à un seuil ajusté en fonction de la sélection. L’article d’origine expose la dérivation et l’estimation du nombre d’essais.

Cette interprétation évite une erreur fréquente. Le DSR ne retranche pas mécaniquement une pénalité fixe au Sharpe publié pour créer un nouveau ratio de performance. Il estime dans quelle mesure le Sharpe observé dépasse un seuil lié à la recherche, à la taille de l’échantillon et aux moments des rendements. L’estimation ponctuelle du Sharpe peut rester inchangée alors que le DSR diminue parce que les éléments à l’appui sont plus faibles. Pour le sens du Sharpe lui-même, consultez également l’explication originale de Sharpe.

Le meilleur résultat parmi de nombreuses estimations bruitées est souvent anormalement élevé

Supposons que toutes les règles testées aient le même Sharpe réel, mais que chaque estimation varie en raison d’un échantillon limité. Choisir l’estimation la plus élevée revient aussi à choisir une erreur de mesure favorable. C’est le biais du gagnant : sur de nouvelles données, l’estimation sélectionnée devrait revenir vers la valeur typique du groupe.

Le nombre d’essais compte, mais le degré de différence entre leurs estimations aussi. Si les candidats génèrent des rendements presque identiques, leurs Sharpes estimés évoluent ensemble et offrent moins d’occasions indépendantes d’obtenir un maximum fortuit qu’un ensemble de même taille composé de candidats sans lien. Le nombre de lignes d’une grille de paramètres n’est donc pas automatiquement le nombre d’essais indépendants.

Le journal de recherche peut inclure des décisions hors d’une grille formelle : un seuil modifié manuellement, un marché écarté ou une hypothèse de coûts révisée qui a influencé le résultat conservé. Un DSR calculé uniquement sur les candidats finaux ne peut pas tenir compte d’expériences qui n’ont pas été consignées ou fournies au calcul.

Le Probabilistic Sharpe Ratio calcule l’incertitude d’échantillonnage

Le Probabilistic Sharpe Ratio (PSR) estime si un Sharpe d’échantillon dépasse une référence choisie, en tenant compte du nombre d’observations de rendement ainsi que de l’asymétrie et de l’aplatissement estimés. Le DSR utilise le même calcul de base, mais choisit une référence qui reflète le Sharpe maximal attendu dans la recherche.

Pour une approximation courante du PSR, le calcul ajusté à la sélection s’écrit ainsi :

$$ \mathrm{DSR}=\Phi\!\left( \frac{(\widehat{SR}-SR_0)\sqrt{T-1}} {\sqrt{1-\widehat{\gamma}_3\widehat{SR} +\frac{\widehat{\gamma}_4-1}{4}\widehat{SR}^{\,2}}} \right) $$

Ici, $\Phi$ désigne la fonction de répartition de la loi normale standard, $\widehat{SR}$ le Sharpe observé par observation de rendement, $SR_0$ le seuil ajusté à la sélection dans les mêmes unités et $T$ le nombre d’observations. $\widehat{\gamma}_3$ est l’asymétrie de l’échantillon. $\widehat{\gamma}_4$ est l’aplatissement de Pearson, égal à 3 pour une loi normale. Le dénominateur traduit la façon dont l’asymétrie et l’aplatissement modifient l’incertitude de l’estimation du Sharpe.

Cette expression dépend des conventions. Utilisez des rendements excédentaires à une seule fréquence et calculez le Sharpe et le seuil à cette même fréquence ; définissez aussi l’aplatissement de manière cohérente. Annualiser une seule de ces valeurs modifie la comparaison. La formule usuelle repose également sur des hypothèses concernant la dépendance des observations. La dépendance sérielle doit être traitée séparément, plutôt que d’être intégrée silencieusement à $T$.

Le seuil du maximum attendu dépend de la famille de candidats

Pour $N$ estimations du Sharpe indépendantes, dont la distribution est approximativement normale, Bailey et López de Prado utilisent une approximation des valeurs extrêmes pour le maximum attendu :

$$ SR_0 \approx \mu_{SR}+\sigma_{SR} \left[(1-\gamma_E)\Phi^{-1}\!\left(1-\frac{1}{N}\right) +\gamma_E\Phi^{-1}\!\left(1-\frac{1}{Ne}\right)\right] $$

$\mu_{SR}$ et $\sigma_{SR}$ désignent la moyenne et l’écart-type des estimations du Sharpe des candidats ; $\Phi^{-1}$ est la fonction quantile de la loi normale standard, $e$ le nombre d’Euler et $\gamma_E \approx 0,5772$ la constante d’Euler-Mascheroni. Cette expression estime jusqu’où la sélection seule peut relever la meilleure estimation selon le modèle d’essais choisi. Ce n’est pas un seuil universel applicable à toute recherche de stratégie.

Lorsque les résultats des candidats sont corrélés, traiter chaque variante comme indépendante peut surestimer le nombre effectif d’essais. L’article traite de l’estimation du nombre d’essais indépendants à partir de la dépendance entre candidats, mais cette estimation constitue elle-même un choix de modélisation. La corrélation n’est qu’une forme de dépendance, et l’estimation peut être instable si le nombre de candidats est élevé et l’historique des rendements court. Indiquez le nombre brut de candidats, la méthode d’estimation du nombre effectif et la sensibilité à des solutions de rechange plausibles.

Un calcul hypothétique distingue le seuil du Sharpe observé

Considérons une recherche volontairement simplifiée avec 20 stratégies candidates indépendantes. Sous l’hypothèse nulle, supposons que la moyenne de leurs estimations du Sharpe soit 0 et leur écart-type 0,20 en unités mensuelles. L’approximation du maximum attendu donne un seuil de sélection d’environ $SR_0=0,380$ par mois. Ces valeurs sont des hypothèses de calcul, pas des observations de marché ni une référence recommandée.

Supposons maintenant que la stratégie sélectionnée compte 60 observations mensuelles de rendements excédentaires, un Sharpe mensuel estimé de 0,50, une asymétrie d’échantillon de 0 et un aplatissement de Pearson de 3. La composante PSR compare 0,50 à 0,380, et non à zéro :

$$ z=\frac{(0.50-0.380)\sqrt{59}}{\sqrt{1+((3-1)/4)(0.50)^2}} \approx 0.868,\qquad \mathrm{DSR}=\Phi(z)\approx 0.807 $$

Selon ces hypothèses simplificatrices, le DSR obtenu est d’environ 80,7 %. Ce n’est ni une probabilité de 80,7 % que la stratégie gagne de l’argent le mois prochain, ni une prévision du rendement du mois suivant. Il s’agit de l’évidence estimée que le Sharpe sous-jacent dépasse le seuil de sélection choisi, conditionnellement au modèle et aux données d’entrée. Un autre nombre d’essais, une autre estimation de la dépendance, un autre échantillon ou une autre forme de distribution peut modifier le résultat.

La sensibilité à la dispersion des estimations des essais est importante. Si seul l’écart-type supposé des Sharpes des candidats passe de 0,20 à 0,10, la même recherche de 20 essais donne un seuil d’environ 0,190 et un DSR d’environ 98,8 %. Si cet écart-type vaut 0,30, le seuil est d’environ 0,570 et le DSR d’environ 30,6 %. Le Sharpe observé de 0,50, les 60 observations, l’asymétrie et l’aplatissement restent inchangés. Cette sensibilité hypothétique montre pourquoi la méthode d’estimation de la dispersion et de la dépendance entre candidats compte ; les valeurs restent exprimées en unités mensuelles dans le même modèle simplifié.

L’asymétrie et l’aplatissement changent l’incertitude, pas seulement le récit

Deux stratégies peuvent afficher le même Sharpe d’échantillon et la même taille d’échantillon tout en ayant des distributions de rendement différentes. Une forte queue gauche, une asymétrie ou des valeurs extrêmes inhabituellement fréquentes peuvent modifier l’incertitude d’échantillonnage représentée au dénominateur du PSR. L’ajustement est calculé à partir des moments mesurés ; il ne considère pas toutes les distributions non normales comme aussi néfastes et ne garantit pas que quelques moments d’échantillon décrivent entièrement les queues.

Le calcul dépend aussi de ce qui compte comme une observation. Des données quotidiennes, hebdomadaires et mensuelles produisent des valeurs différentes de $T$, du Sharpe, de l’asymétrie et de l’aplatissement. Des rendements sur des périodes de détention qui se chevauchent peuvent rendre dépendantes des lignes voisines. Des valorisations lissées ou anciennes peuvent paraître moins volatiles que le risque économique sous-jacent. Précisez la fréquence et la construction de l’échantillon au lieu de considérer le seul Sharpe annualisé comme une donnée suffisante.

Le DSR et les autres méthodes de validation répondent à des questions distinctes

Le PBO utilise la validation croisée symétrique combinatoire pour mesurer à quelle fréquence le gagnant en échantillon se classe au niveau de la médiane des candidats, ou en dessous, sur des blocs complémentaires. Le DSR estime si un Sharpe sélectionné dépasse un seuil ajusté pour la recherche et la non-normalité. Leurs résultats et hypothèses de rééchantillonnage diffèrent ; l’un ne remplace pas l’autre. Consultez les guides sur le PBO et la CSCV et les tests multiples en finance. Bailey et ses coauteurs formalisent ce diagnostic de sélection dans leur article original sur le PBO.

Le Reality Check de White utilise un bootstrap pour tester si la meilleure règle d’une famille de candidats surpasse une référence spécifiée après prise en compte du data snooping. La comparaison à une référence est au cœur de cette question, tandis que le DSR utilise un seuil fondé sur le Sharpe. Un walk-forward chronologique ou un holdout final demande comment un processus figé se comporte sur des périodes ultérieures. Ces méthodes peuvent se compléter, car elles évaluent différentes parties de l’affirmation de recherche. White décrit cette méthode dans son article original sur le Reality Check.

Présentez la recherche et les hypothèses avec le DSR

Un rapport reproductible identifie l’univers de candidats, toutes les décisions consignées qui ont influencé la sélection, le nombre brut d’essais, toute méthode de calcul du nombre effectif, la série de rendements, la taille et la fréquence de l’échantillon, la définition du Sharpe, l’asymétrie, la convention d’aplatissement et le seuil ajusté à la sélection. Précisez si les rendements sont bruts ou nets du spread, des commissions, de l’impact de marché, du financement, de l’emprunt et des autres coûts. Présentez le Sharpe observé et le DSR ensemble pour rendre visible l’effet de l’ajustement.

La formule conventionnelle repose sur un modèle d’échantillonnage qui peut ne pas convenir aux observations présentant une corrélation sérielle. Le travail de Lo sur les statistiques du Sharpe explique pourquoi l’agrégation temporelle et la dépendance influencent l’inférence. Si les rendements se chevauchent ou présentent une corrélation sérielle, utilisez une méthode d’inférence qui traite cette structure et exposez ses hypothèses. Multiplier un Sharpe mensuel par $\sqrt{12}$ ne corrige pas l’autocorrélation. Pour une évaluation tenant compte du temps, consultez aussi le guide sur les fenêtres walk-forward croissantes et glissantes.

Le DSR ne peut pas découvrir une recherche non documentée, éliminer une fuite d’information future, rendre représentatives des données biaisées par la survie, valider les exécutions, estimer la capacité ni garantir la stabilité dans un nouveau régime. Il ne remplace ni le raisonnement économique ni les éléments chronologiques ultérieurs. Traitez-le comme un diagnostic documenté au sein d’un processus de recherche et conservez un historique des candidats et une chaîne de traitement des données reproductibles.

Questions fréquentes

Q1Le Deflated Sharpe Ratio est-il un Sharpe auquel on a soustrait une pénalité ?

Non. Le DSR est une statistique de type probabiliste fondée sur le Sharpe sélectionné, un seuil ajusté à la sélection, la taille de l’échantillon, l’asymétrie et l’aplatissement. L’estimation ponctuelle du Sharpe publiée n’est pas remplacée par un ratio réduit mécaniquement.

Q2Dois-je compter chaque combinaison de paramètres comme un essai indépendant ?

Non. Des candidats similaires peuvent produire des rendements corrélés ; la taille brute de la grille peut donc différer du nombre effectif d’occasions indépendantes de sélectionner une estimation élevée. Conservez l’historique complet de la recherche et indiquez la méthode de dépendance ainsi que son incertitude.

Q3Un DSR élevé prouve-t-il qu’une stratégie de trading fonctionnera ?

Non. Le DSR dépend de la famille de candidats, des données, de la construction des rendements, des hypothèses sur les essais et du modèle d’échantillonnage. Il ne corrige pas les expériences omises, les erreurs d’exécution, les fuites, les changements de régime ni l’incertitude future.

Sources et lectures complémentaires

Signaler un problème

Nous préparons un e-mail avec le lien de cet article. Mark ne reçoit le signalement qu’après son envoi

Vérification rapide

Guide terminé ? Vérifiez vos acquis avec 3 questions

Question 1 / 3

Question 01

Qu’est-ce qui change lorsque le calcul du Probabilistic Sharpe sert de base au DSR ?

Choisissez une réponse pour voir l'explication

Glossaire des options

À quelle fréquence le meilleur backtest passe sous la médiane du groupeProbabilité de surajustement du backtest (PBO) et CSCVDécouvrez comment la validation croisée symétrique combinatoire estime la PBO, transforme les rangs hors échantillon en logits et ne prédit pas les pertes futuresPourquoi un seul seuil échoue lorsque les chercheurs testent de nombreuses idéesTests multiples et taux de fausses découvertes en financeComprenez les comparaisons multiples, l'erreur familiale, le taux de fausses découvertes, Bonferroni, Holm, Benjamini–Hochberg, la dépendance, les valeurs q, le mining de facteurs, la sélection par backtest et la gouvernance de la rechercheMesurer la performance au bon horizonAnnualiser le ratio de Sharpe : pourquoi √12 peut tromper avec l’autocorrélationDécouvrez quand annualiser un Sharpe mensuel avec √12, comment la corrélation sérielle modifie le calcul et quelles précautions documenterChoisissez l’historique utilisé par un modèle financierFenêtres extensibles et glissantes pour la validation walk-forwardComparez les fenêtres d’entraînement extensibles et glissantes de longueur fixe, séparez validation et test final, et choisissez les règles sans résultats futurs.Évaluation des prévisions directionnellesTest de Pesaran–Timmermann : une prévision directionnelle apporte-t-elle de l’information ?Découvrez comment le test de Pesaran–Timmermann compare les bonnes prévisions de direction à une référence calculée à partir des parts de hausses réelles et prévues, et pourquoi la dépendance sérielle modifie l’inférence.