Probabilité de surajustement du backtest (PBO) et CSCV
Découvrez comment la validation croisée symétrique combinatoire estime la PBO, transforme les rangs hors échantillon en logits et ne prédit pas les pertes futures
Dans ce guideLa PBO mesure le processus de sélection, pas une stratégie isolée
Bref résumé
La probabilité de surajustement du backtest (PBO) mesure à quelle fréquence la stratégie retenue comme meilleure en échantillon (IS) se classe sous la médiane des stratégies candidates hors échantillon (OOS). La validation croisée symétrique combinatoire (CSCV) estime cette fréquence en affectant la moitié de blocs temporels égaux à la sélection et l’autre moitié à l’évaluation. La PBO est un diagnostic conditionnel à une recherche, une métrique et une matrice historique de performances précises. Ce n’est pas la probabilité qu’une stratégie en production perde de l’argent.
La PBO mesure le processus de sélection, pas une stratégie isolée
Une équipe de recherche peut essayer différents rétrospectifs, seuils d’entrée, durées de détention, univers, coûts et contraintes de portefeuille, puis retenir la variante au meilleur score de backtest. Le résultat choisi a ainsi bénéficié de nombreuses occasions de s’adapter aux particularités de l’échantillon. La PBO résume une conséquence de cette recherche : sur des partitions IS/OOS définies, à quelle fréquence le gagnant IS se retrouve-t-il sous la médiane OOS du même ensemble de candidats ?
Bailey, Borwein, López de Prado et Zhu ont introduit la PBO comme cadre d’analyse du risque de sélection de stratégies et proposé la CSCV comme méthode d’estimation. Leur définition porte sur le processus qui choisit parmi les configurations testées, et pas seulement sur le nombre de paramètres d’une équation de prévision. Pour chaque partition, IS désigne les données utilisées pour choisir parmi les candidats ; il ne s’agit pas forcément de la période d’estimation de tous les modèles sous-jacents. La formulation figure dans l’article original sur la PBO.
Une stratégie peut avoir un ratio de Sharpe élevé sur l’échantillon complet et n’être que le candidat le plus chanceux d’une famille médiocre. À l’inverse, le processus peut souvent sélectionner un candidat mieux classé que la médiane OOS alors que tous les candidats perdent de l’argent. La PBO compare les rangs au sein de l’ensemble fourni ; elle ne teste pas à elle seule si le rendement espéré est positif.
La PBO répond à une autre question que les autres méthodes de validation
Un holdout chronologique ou un test walk-forward examine les résultats d’un processus défini sur des observations ultérieures qui n’ont pas servi aux décisions précédentes. La validation croisée purgée traite le chevauchement entre les intervalles des labels d’entraînement et les résultats de test ; un embargo peut ajouter une marge justifiée séparément. Aucune de ces mesures ne quantifie à elle seule la fréquence à laquelle le gagnant d’une vaste recherche passe sous la médiane OOS des candidats. Consultez le guide de validation croisée purgée et d’embargo.
La PBO n’est pas non plus une correction des tests multiples. Le Reality Check de White utilise un bootstrap pour tester si la meilleure règle d’une famille dépasse une référence après prise en compte du data snooping. Le ratio de Sharpe défalqué ajuste un test fondé sur le Sharpe pour les effets de sélection et les rendements non normaux. La PBO résume plutôt le rang OOS du candidat sélectionné en IS au fil des partitions. Ces méthodes reposent sur des statistiques et hypothèses différentes : elles ne se remplacent pas automatiquement. Voir l’article original de White sur le Reality Check et l’étude de Bailey et López de Prado sur le ratio de Sharpe défalqué.
Commencez par une matrice de performances complète et synchronisée
Soit M une matrice de T lignes et N colonnes. Chaque colonne représente une stratégie ou configuration candidate, et chaque ligne le même intervalle d’observation pour tous les candidats. Une ligne peut contenir les rendements journaliers nets des coûts pertinents. Si la fréquence de négociation varie, définissez d’abord un index temporel commun et agrégez les performances de façon cohérente. Comparer ligne à ligne les rendements journaliers d’une stratégie aux totaux mensuels d’une autre ne produit pas une matrice comparable.
L’ensemble de candidats doit refléter les possibilités réellement examinées : variantes rejetées par une recherche en grille, ajustements manuels après examen des résultats, univers alternatifs et règles ayant influencé le choix final. La PBO ne peut évaluer que les candidats et historiques qui lui sont fournis. Si seuls les finalistes sont enregistrés après une recherche bien plus large, l’estimation sous-représente la recherche réelle.
Appliquez à tous les candidats la même convention de rendement, devise, prise en compte du levier et métrique. Si la sélection utilise le Sharpe net, intégrez dans chaque colonne les frais, spreads, financement, funding, emprunt et hypothèses d’exécution pertinents avant de le calculer. La métrique doit aussi pouvoir être calculée dans chaque sous-échantillon. L’article original demande des lignes synchronisées et une métrique estimable dans les sous-échantillons ; en cas de fréquences différentes, il recommande un index commun.
La CSCV associe chaque moitié à son complément
Choisissez un nombre pair S de blocs temporels disjoints et de même taille, en conservant l’ordre interne de chaque bloc. Pour chaque sélection possible de S/2 blocs, réunissez-les en échantillon de sélection (IS) et utilisez les S/2 autres comme échantillon d’évaluation (OOS). Pour une métrique dépendant du parcours, gardez l’ordre initial des blocs retenus et expliquez l’effet de leur concaténation.
Il existe C(S,S/2) affectations IS. Avec quatre blocs A, B, C et D, les six affectations sont AB, AC, AD, BC, BD et CD ; chaque complément est aussi compté comme une affectation. Avec S = 16, C(16,8) = 12 870. Ce sont des combinaisons déterministes du même historique, et non 12 870 expériences de marché indépendantes.
« Symétrique » signifie que le complément est réutilisé comme ensemble de sélection dans une autre combinaison : AB est IS et CD OOS dans un partage, puis l’inverse dans un autre. « Combinatoire » signifie que l’on énumère toutes les sélections de la moitié des blocs au lieu de tirer un seul partage aléatoire. La méthode ne rejoue pas la chronologie. La sélection peut contenir des blocs anciens et récents, tandis que son complément contient des blocs intermédiaires ; OOS ne veut donc pas dire « le futur qui suit la période d’entraînement ».

Transformez le rang OOS du candidat sélectionné en logit
Pour la partition c, appliquez la règle de sélection de l’étude à IS et retenez le meilleur candidat n*(c). Évaluez ensuite les N candidats sur le complément OOS avec la même métrique. Le rang r(c) du candidat retenu vaut 1 pour le plus mauvais et N pour le meilleur. Définissez le traitement des ex æquo à l’avance et gardez-le constant.
Convertissez le rang en rang relatif, ω(c) = r(c)/(N+1). Le dénominateur N+1 maintient la valeur strictement entre zéro et un, même aux extrêmes. Le logit est λ(c) = ln(ω(c)/(1−ω(c))). Il est négatif sous la médiane OOS, nul à la médiane et positif au-dessus. La PBO estimée est la part des affectations CSCV pour lesquelles λ(c) ≤ 0.
La valeur de PBO résume la fréquence à laquelle le gagnant IS atteint au plus la médiane OOS. La distribution complète des logits indique également si les candidats retenus restent près du milieu, chutent souvent très bas ou se classent plutôt au-dessus. Un logit transforme un rang relatif ; ce n’est ni une probabilité par transaction réelle ni une prévision calibrée de rendements futurs.
Un exemple hypothétique à quatre blocs donne une PBO de 66,7 %
Supposons quatre blocs historiques de même taille et quatre règles candidates R1 à R4. Le tableau présente les six affectations IS. Le rang OOS est celui de la règle retenue en IS parmi les quatre règles évaluées sur les blocs complémentaires. Toutes les valeurs sont hypothétiques et servent uniquement à illustrer le calcul.
| Blocs IS | Gagnant IS | Rang OOS r | Rang relatif ω = r/5 | Logit ln(ω/(1−ω)) | Médiane ou moins ? |
|---|---|---|---|---|---|
| AB | R1 | 1 | 0,20 | −1,386 | Oui |
| AC | R3 | 4 | 0,80 | +1,386 | Non |
| AD | R2 | 2 | 0,40 | −0,405 | Oui |
| BC | R1 | 1 | 0,20 | −1,386 | Oui |
| BD | R4 | 3 | 0,60 | +0,405 | Non |
| CD | R3 | 2 | 0,40 | −0,405 | Oui |
Quatre règles sélectionnées sur six ont un rang relatif OOS inférieur ou égal à un demi. La PBO empirique vaut donc 4/6 ≈ 0,667, soit environ 66,7 %. Au rang 2, par exemple, ω = 2/(4+1) = 0,4 et λ = ln(0,4/0,6) ≈ −0,405. Le rang 3 donne ω = 0,6 et le logit opposé, environ +0,405.
Cela ne signifie pas qu’il y a 66,7 % de chances de perdre de l’argent le mois suivant. Dans cette matrice hypothétique et selon cette convention de classement, le gagnant IS se trouvait au niveau ou sous la médiane OOS dans quatre des six partitions. Les deux autres gagnants pourraient eux aussi avoir des rendements OOS absolus négatifs tout en dépassant leurs pairs.
Traitez la PBO comme un diagnostic conditionnel qui a ses limites
La PBO dépend de la famille de candidats, de la matrice de performances observées, de la métrique de sélection, des blocs temporels et du traitement des ex æquo. Les essais non consignés échappent à son analyse. « Indépendante du modèle » signifie qu’on peut la calculer à partir des historiques de performances sans connaître les équations de prévision ; cela ne la libère ni des choix de conception, ni des problèmes de données et hypothèses.
La CSCV combine les blocs en sous-échantillons symétriques de même taille, mais l’ensemble OOS n’est généralement pas une seule période chronologique ultérieure. La recombinaison peut perturber dépendances de long terme, saisonnalité ou succession des régimes économiques. S détermine le nombre de combinaisons ainsi que la durée d’un bloc ; choisissez-le selon les horizons et la structure pertinents de la stratégie, puis documentez-le. Un grand nombre de combinaisons ne crée pas autant d’observations indépendantes, car les mêmes blocs sont réutilisés.
La statistique hérite des biais des rendements sources : biais de survie, données révisées, variables indisponibles à l’époque, exécutions irréalistes, coûts omis ou univers choisi après coup peuvent fausser toutes les historiques. La CSCV ne purge pas automatiquement les intervalles de labels qui se chevauchent, ne réestime pas forcément toute la chaîne de modèles dans chaque partage et n’empêche pas les fuites du prétraitement. Ces précautions doivent être définies selon la question de recherche. Pour les protections chronologiques, consultez la documentation officielle de TimeSeriesSplit et le guide sur la validation purgée.
Les métriques dépendantes du parcours, comme le drawdown maximal, demandent davantage de prudence : concaténer des blocs non contigus modifie le parcours et peut changer la mesure. L’article sur la PBO souligne que l’ordre compte pour certaines mesures, même si ce n’est pas le cas pour le ratio de Sharpe. Expliquez comment sont gérés ordre, lacunes, observations manquantes et capitalisation avant d’interpréter le rang.
Présentez la PBO avec des preuves chronologiques et l’historique complet de la recherche
Avant le calcul, conservez le registre des candidats, chaque ajustement fait après examen des résultats, la matrice de performances, la métrique de sélection et la règle d’égalité. Indiquez T, N, S, la construction des blocs, C(S,S/2), la convention de rang OOS, la PBO estimée et la distribution des logits. Ajoutez performances OOS absolues, coûts, rotation, drawdowns et nombre de candidats perdants : le rang seul ne révèle pas si tous sont faibles.
Utilisez un test walk-forward ou un véritable holdout chronologique pour évaluer le processus de recherche figé sur des données ultérieures. Gardez la période finale fermée pendant le choix du modèle et des seuils ; la consulter à répétition en fait un autre ensemble de sélection. Des outils temporels tels que TimeSeriesSplit créent des plis chronologiques selon leurs hypothèses documentées, tandis que la PBO mesure une autre propriété de rang de la famille testée.
La PBO complète donc, sans les remplacer, les contrôles de chevauchement des labels, les analyses de tests multiples, la modélisation réaliste de l’exécution, l’évaluation prospective et le suivi en production. Pour poursuivre, lisez tests multiples et taux de fausses découvertes en finance et corrections du Sharpe pour l’autocorrélation sérielle. Aucune statistique ne transforme un classement historique en preuve d’un avantage persistant.
Questions fréquentes
Q1La PBO signifie-t-elle que la stratégie a cette probabilité de perdre de l’argent ?
Non. Elle estime à quelle fréquence un candidat choisi en IS se classe à la médiane OOS ou en dessous dans les partitions définies. Ce n’est ni une probabilité de perte future ni une prévision calibrée du rendement réel.
Q2La CSCV est-elle identique au test walk-forward ?
Non. La CSCV associe chaque moitié des blocs à son complément, si bien que l’ensemble OOS peut inclure des blocs antérieurs et postérieurs. Le walk-forward garde l’entraînement avant chaque période de test ultérieure afin d’examiner un parcours chronologique proche du déploiement.
Q3Une PBO faible prouve-t-elle que la stratégie sélectionnée a un avantage ?
Non. Le gagnant peut dépasser un groupe faible tout en perdant en valeur absolue. Évaluez séparément rendement net, incertitude, coûts, fuites et résultats sur des données réellement ultérieures.
Sources et lectures complémentaires
Signaler un problème
Nous préparons un e-mail avec le lien de cet article. Mark ne reçoit le signalement qu’après son envoi
Vérification rapide
Guide terminé ? Vérifiez vos acquis avec 3 questions
Question 01
Quel événement contribue à une estimation de la PBO ?
Choisissez une réponse pour voir l'explication