Tests multiples et taux de fausses découvertes en finance
Comprenez les comparaisons multiples, l'erreur familiale, le taux de fausses découvertes, Bonferroni, Holm, Benjamini–Hochberg, la dépendance, les valeurs q, le mining de facteurs, la sélection par backtest et la gouvernance de la recherche
Réponse directe
Les tests multiples apparaissent lorsque de nombreuses hypothèses, stratégies, facteurs, actifs, horizons ou spécifications sont recherchés ensemble. Même des valeurs p valides pour chaque test produisent alors des gagnants dus au hasard. Le taux d'erreur familial contrôle la probabilité d'au moins un rejet faux, tandis que le taux de fausses découvertes contrôle la part fausse attendue parmi les rejets selon les hypothèses indiquées. C'est la famille de recherche, et non seulement le tableau final, qui détermine le problème
Davantage de tests créent davantage de gagnants dus au hasard
Si m hypothèses nulles vraies indépendantes sont chacune testées au niveau α, la probabilité d'au moins un rejet faux est 1−(1−α)^m
Avec α=0,05 et m=20, cette probabilité est d'environ 64 %, même si chaque test individuel présente un taux nominal de faux rejet de 5 %
La dépendance change le calcul exact, mais elle ne justifie pas de faire comme si seul le gagnant présenté avait été testé
La famille définit la question d'erreur
Une famille de tests peut inclure tous les facteurs, transformations, univers, retards, horizons, filtres, choix de modèles et relances envisagés pour une affirmation de recherche
Définir la famille après avoir vu les résultats sous-estime la multiplicité et permet aux chercheurs de séparer des essais liés jusqu'à rendre la correction inoffensive
La famille défendable suit le processus de décision et la possibilité de sélection, pas seulement les lignes qui survivent dans un article ou un tableau de bord
FWER et FDR contrôlent des pertes différentes
Le taux d'erreur familial est la probabilité de commettre au moins un rejet faux dans la famille
Le taux de fausses découvertes est E[V/max(R,1)], où V est le nombre de rejets faux et R le nombre total de rejets
Le FWER est plus strict lorsque toute affirmation fausse est coûteuse ; le FDR est souvent plus puissant lorsque le filtrage de nombreux candidats peut tolérer une part fausse contrôlée
Les procédures ont besoin de leurs hypothèses
Bonferroni teste chaque hypothèse au niveau α/m et contrôle le FWER sans exiger l'indépendance, mais peut être conservateur
La méthode descendante de Holm contrôle également le FWER et n'est jamais moins puissante que la règle de rejet de Bonferroni élémentaire
Benjamini–Hochberg ordonne les valeurs p et contrôle le FDR sous indépendance et certaines dépendances positives ; les autres structures de dépendance nécessitent des méthodes justifiées
Les valeurs ajustées ne sont pas des probabilités postérieures de vérité
Une valeur p ajustée est le plus petit niveau d'erreur familiale auquel une hypothèse serait rejetée selon une procédure choisie
Une valeur q est couramment interprétée comme un seuil FDR minimal estimé pour déclarer un résultat comme découverte, sous réserve de la méthode et des hypothèses
Aucune de ces quantités n'est automatiquement la probabilité qu'une stratégie sélectionnée soit fausse ; cela exige un autre modèle et une autre formulation du conditionnement
La finance dissimule une grande famille adaptative
Le mining de facteurs, les règles techniques, les signaux d'options, les données alternatives, les contraintes de portefeuille et les hypothèses de coûts créent des milliers d'essais corrélés
Les facteurs publiés sont sélectionnés parmi des recherches passées ; évaluer un nouveau facteur avec une statistique t isolée proche de deux ignore la pression de découverte accumulée
Les actifs et les périodes partagés rendent les tests dépendants, tandis que le changement de régime signifie qu'une correction de la sélection ne peut pas garantir la performance économique future
La gouvernance doit conserver l'historique de recherche
Enregistrez chaque hypothèse, version du code, univers, résultat, transformation, délai, coût et choix d'arrêt avec un identifiant de recherche stable
Séparez découverte, confirmation et suivi en production ; figez les règles confirmatoires et utilisez des données réellement intactes ou une évaluation prospective
Présentez les éléments bruts et ajustés, la définition de la famille, les hypothèses de dépendance, les tailles d'effet, les coûts, la stabilité, les idées rejetées et la détérioration en production
Questions fréquentes
Quel est le problème des tests multiples ?
Il s'agit de l'augmentation des fausses découvertes causée par le test et la sélection parmi de nombreuses hypothèses, alors que les gagnants sont évalués comme si chaque test était isolé
Quelle est la différence entre FWER et FDR ?
Le FWER contrôle la probabilité d'au moins un rejet faux ; le FDR contrôle la proportion fausse attendue parmi tous les rejets
Comment fonctionne Benjamini–Hochberg ?
Il ordonne les valeurs p, les compare à des seuils dépendant du rang et rejette jusqu'au plus grand rang admissible selon ses hypothèses déclarées
Le contrôle du FDR rend-il une stratégie de trading fiable ?
Non. Il traite l'erreur de sélection dans une famille de tests définie, mais ni le changement de régime, ni les coûts, ni les fuites d'information, ni le risque de modèle, ni la rentabilité future