Skip to content
Tous les guides sur les options et contrats à terme
Pourquoi le gagnant d’une recherche de stratégies doit être évalué à l’échelle de la famille13 min de lecture

White’s Reality Check contre le data snooping dans les backtests de stratégies

Découvrez comment White’s Reality Check compare la meilleure stratégie d’une recherche à un benchmark en utilisant le maximum d’un bootstrap qui tient compte des dépendances

Dans ce guideLe test demande si le gagnant de la recherche dépasse un benchmark choisi

Bref résumé

White’s Reality Check cherche à savoir si le meilleur candidat d’une recherche définie dépasse un benchmark donné, en tenant compte du fait qu’il a été sélectionné comme maximum. Le test applique un bootstrap aux écarts de performance conjoints et dépendants dans le temps, puis compare le maximum observé à une distribution nulle de maxima bootstrap. Une petite p-valeur ajustée constitue un indice contre l’hypothèse nulle conjointe d’absence de supériorité dans cette famille et face à ce benchmark ; elle ne prédit pas la rentabilité en conditions réelles.

Le test demande si le gagnant de la recherche dépasse un benchmark choisi

Un chercheur peut tester des dizaines de fenêtres de moyennes mobiles, règles de cassure, durées de détention, marchés et filtres, puis publier la stratégie dont le score de backtest est le plus élevé. Ce gagnant n’est pas un candidat isolé ordinaire : la recherche lui a donné de nombreuses occasions de paraître exceptionnel. Le tester seul comme s’il avait été désigné avant l’examen des données ignore cette sélection.

White’s Reality Check intègre la sélection au test. Il demande si un candidat quelconque de la famille examinée a une performance espérée supérieure à un benchmark défini. White formule l’hypothèse nulle comme l’intersection de comparaisons unilatérales : la performance espérée de chaque candidat par rapport au benchmark est au plus égale à zéro. L’alternative affirme qu’au moins un candidat a un avantage espéré positif. Le benchmark peut être une stratégie acheter-conserver, une règle de prévision simple ou une autre référence ; il doit toutefois correspondre à la question et être défini avant la consultation du résultat. Le cadre formel figure dans l’article original de White.

La question porte sur la famille entière et ne garantit rien au sujet de la stratégie qui arrive en tête. Rejeter l’hypothèse nulle indique que la famille consignée fournit un indice de supériorité au regard de la statistique et des hypothèses retenues. Cela n’établit ni que tous les candidats sont utiles, ni que le gagnant restera le meilleur, ni que son avantage résistera à un nouveau régime de marché.

Exprimer chaque candidat comme un écart de performance comparable

Notons d[k,t] la performance du candidat k moins celle du benchmark sur la même période t ; une valeur plus élevée doit toujours favoriser le candidat. Pour comparer des rendements, on peut soustraire le rendement net du benchmark au rendement net du candidat. Pour comparer des pertes de prévision, on peut faire l’inverse : perte du benchmark moins perte du candidat. La convention de signe doit attribuer à une valeur positive le sens d’un avantage du candidat.

Chaque ligne doit correspondre au même intervalle pour tous les candidats. Utilisez une devise, une convention de rendement, un traitement du financement et une politique de coûts cohérents. Si l’affirmation concerne des rendements réellement exécutables, déduisez les commissions, spreads, coûts de glissement, de financement et d’emprunt pertinents avant de calculer d[k,t]. Tester des rendements bruts puis reléguer les coûts en note de bas de page répond à une autre question.

La moyenne empirique du candidat k est d̄[k] = (1/T) Σ_t d[k,t]. L’hypothèse nulle conjointe est H0: max_k E[d[k,t]] ≤ 0, et l’alternative est H1: max_k E[d[k,t]] > 0. Le même benchmark s’applique à toute la famille et tous les candidats sont évalués selon le même critère. Si les dates manquantes ou les fréquences d’observation diffèrent, définissez un échantillon commun défendable avant de calculer les écarts ; n’accordez pas en silence une fenêtre plus favorable à un candidat.

Inclure toute la famille de candidats dans l’affirmation de recherche

La famille comprend les règles dont les résultats ont pu influencer le gagnant publié : périodes de rétrospection testées, seuils d’entrée, combinaisons de signaux, univers d’actifs, durées de détention, contraintes de portefeuille et hypothèses d’exécution. Elle comprend aussi les variantes manuelles testées puis écartées après examen de leurs résultats. Dans son article de 2000, White emploie l’expression « specification search » au sens large : le processus de choix, et pas seulement le tableau final, crée le problème de sélection.

Deux erreurs opposées sont possibles. Omettre des expériences qui ont contribué au choix de la stratégie rend l’ajustement trop optimiste, car le bootstrap voit une recherche plus petite que celle réellement menée. Ajouter après coup de nombreuses règles arbitraires et sans rapport peut rendre le test inutilement conservateur et réduire sa capacité à repérer un candidat utile. Définissez la famille d’après le vrai processus de sélection et tenez un journal de recherche qui permette d’en auditer les limites.

Le test ne peut pas deviner les expériences qui n’ont pas été consignées. Un carnet qui ne contient que le jeu de paramètres gagnant ne suffit pas à reconstituer la recherche. Conservez ensemble le registre des candidats, la version des données, les dates d’évaluation, l’objectif, les hypothèses de coût et les décisions de sélection. Si la famille a changé après l’examen des résultats, indiquez ce qui a changé et pourquoi ; ne présentez pas une famille construite a posteriori comme si elle avait été fixée à l’avance.

La statistique du maximum transporte la sélection dans la loi nulle

Calculez la performance relative moyenne de chaque candidat, puis retenez la plus élevée. Une statistique courante non studentisée est Vobs = √T × max_k d̄[k]. Le maximum est essentiel : il représente l’opération « choisir le meilleur » qui a produit le gagnant apparent. Tester uniquement la colonne gagnante ferait disparaître cette opération de la distribution de référence.

Le bootstrap estime la taille qu’un maximum pourrait atteindre par simple variation d’échantillonnage si l’hypothèse nulle conjointe de non-supériorité était vraie. À la répétition b, on rééchantillonne le vecteur temporel des écarts de tous les candidats et on calcule une statistique centrée comme V*b = √T × max_k(d̄*[k,b] − d̄[k]). Le centrage place les moyennes des candidats à la frontière de l’hypothèse nulle la moins favorable, où les avantages espérés valent zéro ; le maximum conserve la sélection parmi les candidats. L’article de White développe la distribution bootstrap du maximum et la compare à la statistique observée.

Répétez l’opération de nombreuses fois. La p-valeur ajustée est la proportion de maxima bootstrap au moins aussi élevés que Vobs. Pour B tirages, un estimateur Monte-Carlo courant est (1 + count{V*b ≥ Vobs})/(B + 1). Les implémentations peuvent différer par la studentisation ou le traitement des modèles estimés ; indiquez donc la statistique et la convention de centrage sous l’hypothèse nulle. L’élément essentiel est de recalculer à chaque réplication le maximum de la famille, et non d’évaluer uniquement le gagnant observé.

Préserver la dépendance lors du rééchantillonnage de l’historique des candidats

Les observations financières sont ordonnées dans le temps. Un mélange indépendant peut effacer la dépendance sérielle, les grappes de volatilité et les séquences de gains ou de pertes corrélées. Il peut aussi déformer la relation entre deux stratégies qui réagissent souvent aux mêmes journées de marché. Ces caractéristiques influencent la queue de la statistique maximale : rééchantillonner chaque candidat séparément ou tirer des dates isolées avec remise peut donc produire une mauvaise distribution de référence.

White présente des méthodes pour données dépendantes, dont le bootstrap par blocs mobiles, et étudie le bootstrap stationnaire de Politis et Romano. Dans ce dernier, un bloc échantillonné se poursuit généralement à l’observation temporelle suivante ; lors d’un redémarrage aléatoire, il repart d’une autre date tirée. Les longueurs de bloc suivent ainsi une loi géométrique de moyenne choisie. Sous les hypothèses et les réglages de la méthode, cette approche préserve mieux les séquences de court terme qu’un rééchantillonnage i.i.d. Consultez l’article de Politis et Romano sur le bootstrap stationnaire.

Pour une famille de stratégies, tirez une séquence commune d’indices temporels et appliquez-la au vecteur de ligne complet (d[1,t], …, d[K,t]). Vous préservez ainsi l’ordre temporel à l’intérieur des blocs tirés ainsi que les dépendances contemporaines entre candidats. Choisissez la longueur des blocs en fonction de l’horizon de la stratégie et des diagnostics de dépendance, puis indiquez la sensibilité aux autres choix raisonnables. Si le processus de recherche réestime des paramètres, déterminez si cette étape fait partie de la cible d’inférence et reproduisez-la dans chaque réplication lorsque nécessaire. Rééchantillonner uniquement des rendements ajustés et figés peut conditionner une partie du processus et l’exclure du test.

Un exemple hypothétique de bootstrap change l’interprétation

Supposons qu’un chercheur compare trois stratégies à un benchmark sur T = 252 jours de cotation. Après coûts, les écarts moyens quotidiens sont de +2.0, +1.0 et −0.5 points de base. La moyenne du gagnant est donc de 2.0 points de base et la statistique observée vaut √252 × 2.0 bp ≈ 31.75 bp·√jour de cotation. Cette mise à l’échelle fait partie de la statistique ; ce n’est pas une statistique t, car aucun écart-type estimé ne divise le résultat.

Supposons maintenant 9 999 réplications de bootstrap stationnaire utilisant les mêmes dates échantillonnées pour les trois candidats. Dans ce résultat hypothétique, 1 199 maxima de réplication atteignent ou dépassent 31.75. L’estimation Monte-Carlo avec correction de un vaut (1 + 1,199)/(9,999 + 1) = 0.12. Un test séparé du seul gagnant pourrait donner par hypothèse 0.03, mais il omettrait la recherche parmi trois candidats. La p-valeur du Reality Check porte sur la famille entière : au seuil de 5 %, on ne rejetterait pas l’hypothèse nulle conjointe dans cet exemple.

Ces chiffres sont inventés pour illustrer le calcul ; ils ne correspondent ni à des rendements mesurés sur les marchés ni à un résultat de l’article de White. Une p-valeur de 0.12 ne signifie pas que la stratégie a 12 % de chances de perdre. Elle indique que, sous le bootstrap et la construction de l’hypothèse nulle retenus, un maximum au moins aussi élevé n’est pas assez rare pour entraîner un rejet au seuil choisi. Les moyennes de l’échantillon ne permettent pas non plus de savoir si le rendement est économiquement intéressant après prise en compte du risque, de la capacité et de l’exécution.

Interpréter la p-valeur ajustée comme un indice sur une famille définie

Une petite p-valeur du Reality Check constitue un indice contre l’affirmation selon laquelle aucun membre de la famille incluse ne dépasse le benchmark choisi en performance espérée, sous les hypothèses du test. Comme l’hypothèse nulle est conjointe, le rejet ne désigne pas automatiquement le candidat qui posséderait un avantage durable. Le gagnant peut changer d’un échantillon à l’autre et l’indice pour une stratégie donnée peut rester faible même si l’hypothèse familiale est rejetée.

Une grande p-valeur signifie que l’on ne rejette pas l’hypothèse nulle ; ce n’est pas la preuve que toutes les stratégies sont équivalentes au benchmark. Un échantillon court, des performances bruitées, une famille très large, une mesure imparfaite ou une puissance faible peuvent l’expliquer. La p-valeur n’est pas non plus la probabilité que l’hypothèse nulle soit vraie. C’est une probabilité de queue calculée sous une distribution de référence qui dépend des candidats, de la mesure de performance, du benchmark, du plan de bootstrap et des données observées.

La question de White est relative. Une règle peut battre un benchmark faible tout en perdant de l’argent, ou ne pas battre une référence forte tout en produisant des rendements positifs. Présentez conjointement les résultats absolus et relatifs, avec l’incertitude, la rotation, le drawdown, la capacité et des coûts réalistes. La preuve statistique d’une supériorité prédictive relative et l’intérêt économique d’un investissement sont deux décisions distinctes.

Examiner les hypothèses et limites avant de s’appuyer sur le résultat

La théorie d’origine suppose des conditions de régularité concernant le processus des écarts de performance et sa loi limite. Le cadre de White comprend des séries temporelles stationnaires à forte dépendance mélangeante ; le bootstrap dépendant exige lui aussi une séquence adéquate de longueurs de bloc. Sur un échantillon fini, changements de régime, ruptures structurelles, mémoire longue, sauts rares et volatilité instable peuvent fragiliser l’approximation par rééchantillonnage stationnaire. Un bootstrap par blocs préserve une partie de la dépendance locale, mais ne recrée pas un régime futur inconnu.

Le test hérite également des erreurs des données et de l’évaluation de la stratégie. Fuite d’information future, biais du survivant, données révisées, exécutions irréalistes, coûts omis, mauvais traitement des opérations sur titres et benchmark choisi après observation des résultats peuvent invalider les écarts. Lorsque les périodes de détention se chevauchent, les rendements peuvent être dépendants par construction ; l’unité de rééchantillonnage et la longueur des blocs doivent représenter cette dépendance. Si la mesure finale est non linéaire, comme le ratio de Sharpe, recalculez-la à chaque réplication au lieu de supposer qu’un bootstrap de la moyenne des rendements la teste automatiquement.

Les implémentations du Reality Check peuvent être conservatrices, surtout si une vaste famille contient de nombreuses solutions de remplacement manifestement médiocres. Une distribution large du maximum peut rendre le rejet difficile même lorsqu’un bon candidat existe. Le test Superior Predictive Ability de Hansen est une méthode bootstrap connexe qui traite différemment les mauvais candidats ; ce n’est pas un remplacement universel et ses hypothèses doivent aussi être examinées. Comparez les méthodes selon la question de recherche et présentez les analyses de sensibilité plutôt que de choisir celle qui fournit le résultat souhaité.

L’utiliser avec la validation chronologique et d’autres outils de sélection

White’s Reality Check demande si une famille de recherche consignée contient un candidat supérieur au benchmark après correction de la sélection. Il ne remplace pas une validation chronologique sur échantillon tenu à l’écart ou un walk-forward d’une stratégie figée. Il ne règle pas à lui seul les chevauchements d’étiquettes ou les fuites. Il diffère aussi du PBO, qui résume la fréquence à laquelle un gagnant in-sample se classe sous la médiane des candidats lors de partitions combinatoires ; l’article original sur le PBO formalise ce diagnostic du risque de sélection. Les procédures de fausses découvertes ciblent la proportion attendue de faux résultats parmi plusieurs rejets. Le Deflated Sharpe Ratio ajuste plutôt une évaluation de significativité fondée sur le Sharpe en tenant compte de la sélection et des rendements non normaux. Consultez aussi nos guides sur les tests multiples et le taux de fausses découvertes en finance, le PBO et la CSCV, la validation walk-forward et la validation croisée purgée et l’embargo.

Pour une vérification pratique, fixez le benchmark et la définition de performance, reconstituez la famille réellement utilisée, calculez les écarts appariés période par période, choisissez et justifiez un rééchantillonnage tenant compte des dépendances, puis indiquez la statistique maximale et la probabilité de queue bootstrap. Évaluez ensuite le processus de sélection figé sur des données chronologiques ultérieures et examinez séparément les coûts et l’exécution. L’application de Sullivan, Timmermann et White aux règles de trading technique montre pourquoi l’univers de règles compte : la conclusion peut changer selon que l’inférence porte sur toute la recherche ou seulement sur le gagnant publié. Le Reality Check corrige un problème de sélection précis ; il ne certifie pas qu’un backtest résistera au trading en conditions réelles.

Questions fréquentes

Q1Que teste White’s Reality Check ?

Il teste si le meilleur candidat d’une famille de recherche définie possède une performance espérée supérieure à un benchmark choisi, en tenant compte de la sélection parmi les candidats.

Q2Une petite p-valeur du Reality Check prouve-t-elle qu’une stratégie sera rentable ?

Non. Elle constitue un indice contre l’hypothèse nulle d’absence de supériorité de la famille, sous le benchmark, la mesure, les données et les hypothèses de bootstrap retenus. Elle ne garantit ni les rendements futurs ni la rentabilité nette.

Q3Pourquoi utiliser un bootstrap par blocs plutôt que rééchantillonner les jours indépendamment ?

Les blocs peuvent préserver une partie de la dépendance sérielle locale et l’emploi des mêmes dates tirées pour tous les candidats conserve leurs relations contemporaines. Le plan par blocs doit tout de même convenir aux données et à la question de recherche.

Sources et lectures complémentaires

Signaler un problème

Nous préparons un e-mail avec le lien de cet article. Mark ne reçoit le signalement qu’après son envoi

Vérification rapide

Guide terminé ? Vérifiez vos acquis avec 3 questions

Question 1 / 3

Question 01

Que signifie l’hypothèse nulle conjointe de White ?

Choisissez une réponse pour voir l'explication

Glossaire des options

Des définitions claires des termes essentiels, des calls, puts et chaînes d’options à la volatilité implicite, aux sensibilités et à l’écart acheteur-vendeur

Parcourir le glossaire des options