Skip to content
Tous les guides sur les options et contrats à terme
Information du premier stade et inférence en présence d'identification faible14 min de lecture

Diagnostic des instruments faibles : F du premier stade et inférence robuste

Découvrez comment la statistique F du premier stade, le R² partiel, les critères de Stock–Yogo, les diagnostics robustes et l'inférence d'Anderson–Rubin répondent à différentes questions sur les instruments faibles.

Dans ce guidePourquoi la force de l'instrument compte

Bref résumé

Une statistique du premier stade indique dans quelle mesure les instruments exclus expliquent un régresseur endogène, conditionnellement aux contrôles inclus. Elle ne prouve pas la validité de l'instrument, et « F supérieur à 10 » n'est pas une garantie universelle. Le diagnostic pertinent dépend du nombre de régresseurs endogènes et des hypothèses sur les erreurs ; une inférence robuste aux instruments faibles peut rester large ou non bornée.

Pourquoi la force de l'instrument compte

Les variables instrumentales utilisent la variation d'un régresseur endogène \(X\) prédite par les instruments exclus \(Z\), conditionnellement aux contrôles inclus \(W\).

Si \(Z\) explique peu de la variation restante de \(X\), les données fournissent peu d'information sur l'effet structurel issu de cette source.

Lorsque la pertinence est faible, le 2SLS en échantillon fini peut être biaisé en direction des MCO et sa distribution d'échantillonnage peut s'écarter sensiblement de l'approximation normale. Un intervalle de Wald classique peut alors avoir une couverture médiocre, même si l'erreur-type semble précise.

Staiger et Stock développent une asymptotique des instruments faibles qui explique ces problèmes et motive des régions de confiance non standard (article de 1997).

La force n'est qu'une composante de l'identification. Un premier stade fort ne permet pas d'établir que \(Z\) est indépendant de l'erreur structurelle ou qu'il agit sur le résultat uniquement par l'intermédiaire de \(X\).

Le guide des variables instrumentales examine séparément ces hypothèses et l'effet identifié.

Le premier stade isole la variation conditionnelle de l'instrument

Pour un régresseur endogène et \(q\) instruments exclus, le premier stade s'écrit

\[ X_t = W_t'\delta + Z_t'\pi + v_t. \]

Ici, \(W_t\) contient les contrôles exogènes inclus, souvent avec une constante, tandis que \(Z_t\) contient les instruments exclus. Le test F standard du premier stade évalue \(H_0:\pi=0\), c'est-à-dire l'hypothèse conjointe selon laquelle les instruments exclus n'ajoutent aucun pouvoir explicatif après prise en compte de \(W_t\).

Il s'agit d'une question de pertinence conditionnelle, pas d'un test de la restriction d'exclusion ou de l'indépendance. Indiquez les contrôles inclus, le nombre d'instruments exclus testés, l'échantillon, les hypothèses de covariance et la statistique utilisée.

Le t individuel d'un coefficient ne remplace pas le test conjoint lorsqu'il y a plusieurs instruments exclus.

R² partiel et statistique F classique

Le \(R^2\) partiel mesure la part de la variation résiduelle de \(X\), après retrait de \(W\), expliquée par les instruments exclus résidualisés.

Notons \(R^2_p\) ce \(R^2\) partiel, \(n\) la taille de l'échantillon, \(k\) le nombre de régresseurs inclus, constante comprise le cas échéant, et \(q\) le nombre d'instruments exclus.

Dans le calcul classique d'une régression linéaire homoscédastique, la statistique F incrémentale est

\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]

Le numérateur mesure le gain d'ajustement par restriction portant sur les instruments exclus ; le dénominateur estime la variance résiduelle à l'aide de l'ensemble des degrés de liberté résiduels du premier stade. Cette formule n'est pas une identité universelle pour les statistiques robustes.

Un estimateur de covariance robuste modifie le calcul du test et sa loi de référence.

Le \(R^2\) partiel et F sont liés, mais répondent à des questions descriptives distinctes : le \(R^2\) partiel mesure l'ajustement sans unité, tandis que F dépend aussi de la taille de l'échantillon et du nombre de restrictions.

Un faible \(R^2\) partiel peut donner un F élevé dans un très grand échantillon sans rendre fiable toute approximation IV en échantillon fini.

Pourquoi F supérieur à 10 n'est pas un seuil universel

La valeur 10, souvent citée, est une règle pratique et non un théorème de validation. Staiger et Stock la présentent comme un repère pratique dans un cadre particulier d'instruments faibles ; elle ne garantit pas une inférence valide pour tout échantillon, estimateur, nombre d'instruments ou processus d'erreur.

Stock et Yogo définissent la faiblesse à partir de bornes portant sur le biais relatif du 2SLS ou la distorsion de la taille du test de Wald, puis tabulent les valeurs critiques correspondant à ces critères. La valeur critique dépend donc du critère retenu et des dimensions du modèle.

Leurs résultats classiques sur le premier stade et Cragg–Donald supposent des erreurs homoscédastiques et indépendantes.

Les valeurs de ces tableaux ne peuvent pas être transposées telles quelles à n'importe quel cadre robuste (page du chapitre hébergée par l'auteur).

Une valeur supérieure à 10 ne prouve ni l'exclusion, ni l'indépendance, ni une interprétation causale. Une valeur inférieure à 10 ne prouve pas qu'un instrument est inutile ou qu'une estimation particulière est invalide.

Interprétez la statistique comme un diagnostic reposant sur des hypothèses explicites, puis choisissez une méthode d'inférence adaptée au plan d'étude.

Le guide du test J de Hansen explique pourquoi un test de suridentification ne remplace pas l'évaluation de la force.

<!-- learn:illustration -->

Un fin filament doré relie un petit cristal ambré à une grande sphère de verre bleu dans une vaste brume
Illustration conceptuelle d’un lien faible en première étape et de l’incertitude qui l’entoure ; ni données ni résultat de diagnostic.

Plusieurs régresseurs endogènes nécessitent une évaluation conjointe de la force

S'il y a plusieurs régresseurs endogènes, les statistiques F calculées séparément pour chaque premier stade peuvent manquer une combinaison linéaire faiblement identifiée.

Chaque régresseur peut sembler prédit individuellement, alors que la variation induite par les instruments ne couvre pas les combinaisons nécessaires pour estimer avec précision tous les coefficients structurels.

Dans le cadre IV linéaire homoscédastique, la statistique de la valeur propre minimale de Cragg–Donald résume cette information d'identification conjointe. Les valeurs critiques de Stock–Yogo qui lui correspondent visent des critères déclarés de biais ou de distorsion de taille.

Les hypothèses comptent : les valeurs critiques habituelles ne restent pas automatiquement valides en présence d'hétéroscédasticité arbitraire, de dépendance sérielle ou de regroupement en clusters.

Le nombre d'instruments exclus, celui des régresseurs endogènes et le rang de la matrice des coefficients du premier stade comptent tous. Décrivez la configuration complète et utilisez un test conçu pour elle ; ne déduisez pas la force conjointe en faisant la moyenne des F individuels du premier stade.

Des erreurs robustes appellent des diagnostics adaptés au plan d'étude

Les observations financières peuvent être hétéroscédastiques, dépendantes dans le temps ou regroupées par entreprise, lieu de négociation ou unité de politique publique. Le F classique du premier stade et l'étalonnage de Cragg–Donald ne deviennent pas robustes simplement parce que les erreurs-types du second stade sont regroupées en clusters.

Pour un seul régresseur endogène, Montiel Olea et Pflueger proposent un test effective-F de faiblesse qui autorise l'hétéroscédasticité, l'autocorrélation et le regroupement en clusters, sous les conditions qu'ils précisent.

Il ajuste un F classique du premier stade à l'aide d'informations de covariance, puis compare le résultat aux valeurs critiques propres au critère (article de 2013).

L'effective F n'est pas la même quantité que tous les F de Wald robustes rapportés par les logiciels.

Le F de Wald Kleibergen–Paap rk est souvent publié avec des estimateurs de covariance robustes, mais les valeurs critiques de Stock–Yogo ont été dérivées pour d'autres statistiques classiques et d'autres hypothèses. Ne comparez pas ces valeurs comme si elles partageaient la même échelle étalonnée.

Indiquez l'estimateur, la statistique, l'estimateur de covariance, le niveau de regroupement ou le traitement de la dépendance, ainsi que le cadre des valeurs critiques.

Un estimateur de covariance Newey–West ou cluster-robust traite l'incertitude d'échantillonnage sous ses hypothèses ; à lui seul, il ne corrige pas une identification faible.

L'inférence d'Anderson–Rubin peut rester valide avec une pertinence faible

Pour une valeur candidate \(\beta_0\) du coefficient dans un modèle à un seul régresseur endogène, formez le résultat ajusté selon cette valeur, \(Y-X\beta_0\), puis testez si les instruments exclus l'expliquent conjointement après prise en compte des contrôles inclus.

Sous l'hypothèse nulle et l'exogénéité des instruments, il s'agit d'un test d'Anderson–Rubin de \(\beta=\beta_0\).

Comme le test ne divise pas par un coefficient de premier stade estimé, sa validité n'exige pas que ce coefficient soit élevé.

La construction originale d'Anderson–Rubin repose sur les hypothèses de distribution du modèle ; en pratique, l'estimateur de covariance et la loi de référence doivent également correspondre au plan d'échantillonnage. L'étiquette « robuste » ne justifie pas d'ignorer un faible nombre de clusters ou la dépendance sérielle.

L'inversion du test sur les valeurs candidates produit un ensemble de confiance. Lorsque l'information est faible, cet ensemble peut être large, disjoint ou non borné ; cela révèle une information identificatrice limitée et non une défaillance logicielle. Les tests d'Anderson–Rubin peuvent aussi avoir une faible puissance.

Le guide sur la suridentification en GMM répond à une autre question et ne doit pas être assimilé à une inférence sur les coefficients robuste aux instruments faibles.

L'article original est Anderson et Rubin (1949).

Exemple de calcul du F partiel

Considérons un premier stade hypothétique avec \(n=200\) observations, \(k=3\) régresseurs inclus, constante comprise, \(q=2\) instruments exclus et \(R^2_p=0.04\).

Avec la formule classique homoscédastique, les degrés de liberté résiduels sont \(200-3-2=195\).

\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]

Avec ces valeurs et ces hypothèses, le calcul donne une statistique conjointe classique de 4.0625. À lui seul, il ne prouve pas l'invalidité, ne détermine pas la conclusion propre au critère de Stock–Yogo et n'établit pas le résultat en présence d'hétéroscédasticité ou de regroupement en clusters.

Une analyse robuste exige sa propre statistique et son propre étalonnage, adaptés au plan d'étude.

Si les mêmes deux instruments sont utilisés dans un plan de discontinuité de régression flou, la discontinuité du premier stade fait partie de l'analyse de pertinence propre à ce plan.

Le calcul F ci-dessus ne remplace ni les hypothèses du RDD, ni le choix de la bandwidth, ni l'inférence adaptée à ce plan.

Présentez séparément le diagnostic et l'argument d'identification

Indiquez les régresseurs endogènes, les instruments exclus, les contrôles inclus, l'échantillon, les coefficients du premier stade, le \(R^2\) partiel et la statistique exacte de force.

Avec plusieurs régresseurs endogènes, précisez la statistique conjointe et ses hypothèses ; en contexte robuste, nommez la covariance et la méthode des valeurs critiques au lieu d'écrire seulement « F = … ».

Si la statistique indique une identification faible, rapportez un test ou un ensemble de confiance du coefficient cible robuste aux instruments faibles. Indiquez si l'ensemble est borné et comment sa forme modifie la conclusion de fond.

Ne remplacez pas un intervalle peu informatif par un intervalle de Wald classique simplement parce qu'il est plus facile à résumer.

Enfin, étayez l'indépendance de l'instrument et les restrictions d'exclusion par des éléments institutionnels et économiques. Les diagnostics de pertinence, tests d'équilibre, résultats placebo et tests de suridentification peuvent révéler des problèmes, mais ne prouvent pas toutes les hypothèses.

Un plan de différences de différences repose sur d'autres hypothèses d'identification ; un premier stade plus fort ne le rend pas interchangeable avec ce plan.

Questions fréquentes

Q1Un F du premier stade supérieur à 10 prouve-t-il qu'un instrument est valide ?

Non. C'est tout au plus un diagnostic de pertinence associé à un étalonnage particulier. Il ne peut établir ni l'indépendance ni l'exclusion.

Q2Le R² partiel est-il identique à la statistique F du premier stade ?

Non. Le R² partiel décrit le gain d'ajustement. Le F classique dépend également de la taille de l'échantillon, du nombre de restrictions et des degrés de liberté résiduels.

Q3Puis-je comparer directement un F robuste aux valeurs critiques de Stock–Yogo ?

Seulement si la statistique et les hypothèses correspondent à l'étalonnage. Les statistiques robustes exigent souvent des valeurs critiques et une interprétation différentes.

Q4Que faut-il rapporter lorsque l'instrument semble faible ?

Rapportez le diagnostic adapté au plan d'étude ainsi qu'un test ou un ensemble de confiance robuste aux instruments faibles, en précisant si cet ensemble est large, disjoint ou non borné.

Sources et lectures complémentaires

Signaler un problème

Nous préparons un e-mail avec le lien de cet article. Mark ne reçoit le signalement qu’après son envoi

Vérification rapide

Guide terminé ? Vérifiez vos acquis avec 3 questions

Question 1 / 3

Question 01

Qu'évalue le test F classique du premier stade ?

Choisissez une réponse pour voir l'explication

Glossaire des options

Identifier un effet lorsqu'un régresseur est lié à l'erreurEndogénéité et variables instrumentalesComprenez l'endogénéité due aux variables omises, à la simultanéité et à l'erreur de mesure ; la pertinence et l'exclusion d'un instrument ; les MC2E, le LATE, les instruments faibles et l'identification financièreCe que le test de suridentification GMM peut établir, et ce qu’il ne peut pas établirTest J de Hansen : les restrictions de suridentification en GMMDécouvrez comment la statistique J de Hansen teste les restrictions de moments suridentifiantes d’un modèle, comment lire ses degrés de liberté et sa valeur p, et pourquoi une non-rejection ne prouve pas la validité des instruments.Une expérience locale de part et d'autre d'un seuilMéthode de discontinuité de régression : logique et limitesComprenez l'affectation au franchissement d'un seuil, la continuité, les RDD sharp et fuzzy, la régression linéaire locale, le choix de bande passante, les diagnostics de manipulation et les applications financières fondées sur des seuilsConstruire un contrefactuel à partir des changements autour d'une politiqueDifférence de différences et tendances parallèlesComprenez le contraste DiD 2×2, les résultats potentiels sans traitement parallèles, les études d'événement, les tests de pré-tendance, l'adoption échelonnée, les effets hétérogènes et les applications aux politiques financières.Mécanique des optionsQu'est-ce que l'assignation d'une option ?Comprendre comment une option vendue peut créer une obligation de livrer ou d'acheter des actions avant ou à l'échéance