White Reality Check et Hansen SPA pour les règles de trading
Découvrez comment Reality Check et Hansen SPA évaluent toute une famille de règles techniques face à un benchmark, comment leurs bootstraps diffèrent et ce que signifie une p-valeur globale.
Dans ce guideLa meilleure règle exige un test portant sur toute la famille
Bref résumé
Choisir la règle la plus performante après en avoir essayé beaucoup en backtest change la question statistique. Un test ordinaire appliqué à la seule règle gagnante ne tient pas compte de cette sélection. White Reality Check et Hansen SPA évaluent toute la famille face à un benchmark. SPA standardise les différences et utilise un centrage nul dépendant des données, qui réduit le poids des alternatives franchement mauvaises. Aucun des deux tests ne désigne à lui seul une règle qui gagnera à l’avenir.
La meilleure règle exige un test portant sur toute la famille
Si vous essayez vingt réglages puis ne publiez que celui dont le rendement historique est le plus élevé, vous n’avez pas testé une seule règle. Le résultat choisi reflète aussi la recherche : même si aucune variante n’a d’avantage véritable, l’une d’elles peut paraître excellente par hasard dans l’échantillon. Un test t ordinaire qui traite la gagnante comme si elle avait été fixée avant de consulter les données ignore ce mécanisme de sélection.
White a conçu le Reality Check pour poser cette question de data snooping sur l’ensemble des candidats. Sullivan, Timmermann et White ont ensuite appliqué cette méthode à un vaste univers de règles techniques et montré pourquoi il faut décrire la famille qui a servi à sélectionner le résultat. Hansen a proposé le test de capacité prédictive supérieure, ou SPA, qui standardise les écarts et se montre moins sensible aux règles mauvaises ou peu pertinentes. Les sources primaires sont White (2000), Sullivan, Timmermann et White (1999) et Hansen (2005).
Définir le benchmark et l’écart de performance
Pour chaque règle $k$ et date commune $t$, notons $d_{k,t}$ son avantage par rapport au benchmark. Pour des rendements, on peut écrire $d_{k,t}=R_{k,t}-R_{0,t}$. Pour des erreurs de prévision, inverser les termes — par exemple $d_{k,t}=L_{0,t}-L_{k,t}$ — fait qu’une valeur positive avantage la règle dans les deux cas. La quantité visée est alors la moyenne théorique $\mu_k=E[d_{k,t}]$.
Cette définition précise ce que « meilleur » signifie : rendement brut, rendement net de coûts, réduction d’une perte ou autre critère fixé à l’avance. Le benchmark, la fréquence des rendements, les dates évaluées et la convention de signe doivent être cohérents entre candidats. Les équations ci-dessous portent sur des moyennes de différences. Une mesure non linéaire comme le ratio de Sharpe demande une procédure d’inférence adaptée ; il ne suffit pas de remplacer la moyenne dans ces formules.
L’hypothèse nulle couvre toutes les variantes essayées
L’hypothèse nulle globale s’écrit $H_0:\max_{k=1,\ldots,K}\mu_k\leq0$ : aucune règle de la famille ne surperforme le benchmark en moyenne. L’hypothèse alternative est qu’au moins une règle possède un avantage moyen positif. Il s’agit d’un test global unilatéral, pas d’un test d’égalité entre les règles.
La taille de la famille doit refléter la recherche réelle, pas seulement les lignes retenues dans le tableau final. À titre de simple illustration arithmétique, 12 fenêtres de retour en arrière, 4 filtres et 5 paramètres de sortie donnent $12\times4\times5=240$ variantes. Ce calcul hypothétique ne fournit aucun résultat ni aucune p-valeur. Si d’autres actifs, seuils ou modèles de coûts ont aussi été essayés, ils font partie de l’historique à documenter.
Reality Check utilise la frontière nulle où toutes les moyennes valent zéro
Avec $n$ observations communes et une moyenne empirique $\bar d_k$, la statistique du Reality Check considérée ici est
$$T_{\mathrm{RC}}=\max_{k=1,\ldots,K}\sqrt{n}\,\bar d_k.$$
Le maximum mesure le meilleur avantage observé face au benchmark. Dans cette définition, on ne tronque pas artificiellement la statistique à zéro. Pour approximer sa distribution sous l’hypothèse nulle, chaque série de différences est recentrée sur sa moyenne observée, puis rééchantillonnée sous la frontière $\mu_k=0$ pour tous les candidats. C’est la configuration la moins favorable à l’alternative parmi les cas nuls, mais elle peut réduire la puissance du test.
Une règle très mauvaise reste incluse dans le maximum à chaque réplication et peut augmenter les quantiles critiques. La question prudente posée par White est de savoir si le meilleur avantage observé dépasse ce qu’on pourrait voir dans le cas limite où tous les avantages attendus sont nuls. Une petite p-valeur apporte un élément contre l’hypothèse nulle globale de cette famille précise ; elle ne porte pas sur les candidats qui n’ont pas été déclarés.
SPA standardise et centre la nulle selon les données
SPA divise chaque moyenne des écarts par une estimation de sa dispersion de long terme, $\hat\omega_k$. Sa statistique est
$$T_{\mathrm{SPA}}=\max\left(0,\max_k\frac{\sqrt n\,\bar d_k}{\hat\omega_k}\right).$$
La standardisation rend comparables des différences de volatilités distinctes. Le maximum extérieur avec zéro appartient à la statistique SPA ; on ne l’ajoute pas à la formule du Reality Check donnée plus haut. L’estimation de la dispersion doit tenir compte de la dépendance temporelle dans la série des écarts et doit être décrite.
SPA se distingue aussi par son centrage. Il calcule une correction $\hat\mu_{c,k}$ pour chaque candidat. Si sa moyenne standardisée est suffisamment négative — par exemple sous le seuil de Hansen $-\sqrt{2\log\log n}$ —, cette moyenne empirique négative est conservée dans la distribution bootstrap sous la nulle. Les règles qui restent plausibles au voisinage de la frontière sont, elles, centrées à zéro. Les variantes franchement mauvaises pèsent donc moins dans les quantiles critiques, sans retirer les alternatives qui pourraient être à la frontière. Précisez la règle de centrage et la version de la p-valeur SPA rapportée.

Le bootstrap par blocs doit préserver la structure conjointe
À chaque date, les données forment un vecteur $(d_{1,t},\ldots,d_{K,t})$ réunissant les écarts de toutes les règles. Chaque réplication bootstrap doit rééchantillonner des lignes entières de ce vecteur, par blocs consécutifs. Rééchantillonner les règles séparément ou tirer les dates une par une détruirait à la fois la corrélation entre candidats et leur dépendance dans le temps ; le maximum obtenu ne décrirait plus le même problème.
Le bootstrap stationnaire de Politis et Romano (1994) utilise des blocs de longueurs géométriques et une longueur moyenne choisie. D’autres schémas adaptés utilisent des blocs consécutifs fixes et chevauchants. Les blocs sont assemblés jusqu’à retrouver la longueur initiale de l’échantillon. Les deux tests supposent que le processus conjoint des écarts est suffisamment stable et faiblement dépendant. La longueur des blocs et les ruptures éventuelles peuvent changer les conclusions ; le rééchantillonnage ne répare pas un changement de régime.
Une p-valeur globale ne désigne pas la règle gagnante
Si le Reality Check ou SPA est significatif, les données fournissent, sous les hypothèses retenues, un élément en faveur de l’existence d’au moins une règle de la famille documentée dont l’avantage moyen est positif. La p-valeur globale n’est ni la probabilité que l’hypothèse nulle soit vraie, ni la probabilité qu’une règle particulière fonctionne à l’avenir. Elle ne dit pas non plus quelle règle surpasse individuellement le benchmark. Cette attribution demande une analyse supplémentaire tenant compte de la sélection et, idéalement, de nouvelles données.
Dans l’exemple hypothétique des 240 variantes, la meilleure observée pourrait être l’une d’entre elles ; le nombre de candidats ne permet pas à lui seul de savoir si le test rejette. Le résultat dépend des écarts observés, du nombre de dates, des dépendances et du bootstrap utilisé. Une p-valeur, qu’elle soit petite ou grande, ne corrige pas une phase de recherche omise et ne garantit pas la stabilité future de la performance.
La FDR et les intervalles répondent à d’autres questions
Le guide sur les tests multiples et le taux de fausses découvertes porte généralement sur plusieurs hypothèses individuelles et contrôle, sous des hypothèses déclarées, la proportion attendue de découvertes erronées parmi les rejets. Reality Check et SPA testent une affirmation globale sur le maximum d’une famille fixée : existe-t-il des éléments indiquant qu’au moins un candidat bat le benchmark ? Ils ne produisent pas automatiquement une liste corrigée de règles gagnantes.
Un intervalle de confiance par bootstrap de blocs pour une stratégie spécifiée à l’avance répond à une autre question. Le guide sur les intervalles bootstrap de rendements de stratégie quantifie l’incertitude d’une moyenne ou d’une autre statistique préétablie. Si la stratégie a été sélectionnée après de nombreux essais, cet intervalle ne corrige pas automatiquement le biais de sélection. Il faut choisir le test en fonction de la question de recherche.
La validation croisée purgée traite un autre problème : limiter les fuites d’information entre les observations d’entraînement et de test dans des données ordonnées dans le temps. Elle ne teste pas si le maximum d’une famille de règles dépasse le benchmark ; c’est la question globale de RC et SPA. Le guide sur la validation croisée purgée et l’embargo explique cette séparation.
Les coûts, les essais et les régimes de marché restent déterminants
Les différences de performance devraient inclure les coûts pertinents pour les règles étudiées : commissions, spread, glissement, impact de marché, financement, emprunt de titres et coût du capital, le cas échéant. Soustraire les coûts seulement après le test peut transformer un avantage brut statistique en résultat économiquement nul. Les délais d’exécution, la liquidité et la taille des positions influencent aussi la performance réalisable.
Un rapport reproductible décrit la famille entière, les étapes de sélection et de filtrage, les dates et les sources de données, le benchmark, la définition de $d_{k,t}$, les coûts, la méthode de blocs, le choix de leur longueur, le nombre de réplications et la variante de p-valeur SPA. Toute adaptation après examen des résultats élargit la recherche et doit être signalée. Si des ruptures modifient fortement la distribution ou si la série n’est pas approximativement stationnaire et faiblement dépendante, les deux bootstraps peuvent induire en erreur. Ce sont des tests statistiques d’un protocole historique, pas des prévisions, des garanties ni des conseils financiers personnalisés.
Questions fréquentes
Q1Un SPA significatif signifie-t-il que la meilleure règle est individuellement significative ?
Non. Le test porte sur le maximum de toute la famille étudiée. La p-valeur globale ne certifie pas une règle comme gagnante individuelle.
Q2SPA est-il toujours plus puissant que Reality Check ?
Non. Il peut être moins sensible à de nombreuses alternatives mauvaises ou non pertinentes et gagner en puissance dans certaines situations, sans dominer dans tous les cas.
Q3Ces tests peuvent-ils prévoir les rendements futurs ?
Non. Ils évaluent une famille historique précise sous des hypothèses sur sa série conjointe. Les ruptures, les coûts, de nouveaux choix de sélection et les conditions futures peuvent modifier les résultats.
Sources et lectures complémentaires
Signaler un problème
Nous préparons un e-mail avec le lien de cet article. Mark ne reçoit le signalement qu’après son envoi
Vérification rapide
Guide terminé ? Vérifiez vos acquis avec 3 questions
Question 01
Que dit l’hypothèse nulle globale de Reality Check et SPA ?
Choisissez une réponse pour voir l'explication