P-value et significativité statistique en finance
Comprenez les p-values, les hypothèses nulles, les statistiques de test, les niveaux de significativité, les erreurs de type I et II, la puissance, la taille d'effet, l'arrêt optionnel, la fouille de données et l'interprétation financière
Réponse directe
Une p-value est la probabilité, sous un modèle nul et un plan d'analyse spécifiés, d'obtenir une statistique de test au moins aussi incompatible avec ce modèle que celle observée. Ce n'est ni la probabilité que l'hypothèse nulle soit vraie, ni la probabilité qu'un résultat soit dû au hasard, ni la taille ou l'importance économique d'un effet. La significativité statistique est une règle de décision, pas une preuve
Un test commence avant la p-value
Spécifiez les hypothèses nulle et alternative, la statistique de test, le modèle d'échantillonnage, la règle d'arrêt, la direction de la queue et le niveau de significativité avant d'examiner le résultat
La nulle représente souvent l'absence d'effet ou une valeur de référence, mais elle peut aussi être composite et contenir des paramètres de nuisance à estimer
Modifier l'univers, l'horizon, les variables de contrôle, la règle sur les valeurs aberrantes ou le test après avoir vu les données modifie l'expérience dont la p-value est interprétée
La p-value est conditionnelle à un modèle
Sous la nulle, la statistique de test possède une loi de référence ; la p-value mesure jusqu'où la statistique observée pénètre dans sa queue pertinente
Une petite valeur indique une incompatibilité entre les données et l'ensemble du modèle nul, mais pas quelle hypothèse a échoué ni si l'alternative est vraie
Une dépendance mal spécifiée, des queues épaisses, l'hétéroscédasticité, des erreurs de données ou une sélection peuvent rendre la loi de référence et la p-value invalides
Les seuils de significativité définissent des règles d'erreur
Un niveau α fixé à l'avance limite la probabilité de rejeter une nulle vraie sous les hypothèses du test, et non la proportion d'affirmations publiées qui sont fausses
L'erreur de type I est un faux rejet ; l'erreur de type II est l'absence de rejet d'une nulle fausse, et la puissance est la probabilité de rejet sous une alternative spécifiée
Ne pas rejeter ne prouve pas l'absence d'effet, en particulier lorsque l'échantillon a une faible puissance pour des alternatives économiquement significatives
La taille d'effet et l'incertitude répondent à des questions différentes
De grands échantillons peuvent rendre des effets minuscules statistiquement significatifs, tandis que de petits échantillons bruités peuvent manquer des effets assez grands pour compter
Présentez avec la p-value une estimation de l'effet, un intervalle, les unités, les coûts de transaction, la capacité et un seuil pratique
Des résultats juste au-dessus et juste au-dessous de 0,05 fournissent généralement des éléments de preuve similaires ; transformer cette frontière en interrupteur de vérité brutal fait perdre de l'information
La flexibilité de la recherche déforme la significativité
L'arrêt optionnel, l'essai de nombreuses spécifications, la suppression d'observations, le changement de résultat étudié et la publication des seuls tests réussis modifient le comportement des faux positifs
La p-value nominale n'est valide que pour le chemin d'analyse qui l'a produite, y compris les règles séquentielles légitimes ou les ajustements déclarés à l'avance
La préinscription, les journaux de recherche complets, l'analyse multivers, les échantillons de validation intacts et la réplication révèlent la sensibilité, mais ne réparent pas un mauvais modèle
La dépendance financière affaiblit les tests de manuel
Les rendements peuvent être autocorrélés, dépendants en coupe transversale, hétéroscédastiques, se chevaucher et être conditionnés par un univers sélectionné qui a survécu
Des erreurs types iid naïves peuvent exagérer les statistiques t, tandis que la découverte répétée de facteurs et le backtesting créent une famille de tests implicite bien plus large
Utilisez des erreurs types et un rééchantillonnage justifiés par la structure temporelle, puis testez la stabilité selon les régimes, les actifs, les coûts, les délais et les données réelles
Les éléments de preuve doivent soutenir une décision
Traitez la p-value comme un diagnostic continu parmi la taille d'effet, l'incertitude, les éléments de preuve antérieurs, le mécanisme, la performance prédictive et les coûts de décision
Définissez à l'avance l'erreur qui compte : un faux signal de trade, une exposition au risque manquée, une couverture instable ou un modèle promu sans valeur économique
Rapportez la famille d'analyses complète et les réplications échouées afin qu'un seul résultat significatif sélectionné ne soit pas pris pour la force du programme de recherche
Questions fréquentes
Que signifie une p-value de 0,05 ?
Sous le modèle nul spécifié, des résultats au moins aussi incompatibles que la statistique de test observée surviennent avec une probabilité de 0,05
Une p-value inférieure à 0,05 prouve-t-elle l'hypothèse alternative ?
Non. Elle n'attribue pas de probabilité aux hypothèses et n'exclut ni une mauvaise spécification, ni une sélection, ni des erreurs de données, ni un effet économiquement négligeable
Une p-value supérieure à 0,05 prouve-t-elle qu'il n'y a aucun effet ?
Non. Elle signifie que le test n'a pas rejeté la nulle à ce seuil et peut refléter une faible puissance, du bruit, un modèle inadapté ou un effet réellement faible
Pourquoi les p-values financières sont-elles souvent surestimées ?
La dépendance, les recherches répétées de stratégies, les spécifications flexibles, les échantillons sélectionnés et des coûts irréalistes peuvent donner à la preuve nominale une apparence plus forte qu'elle ne l'est