Диагностика слабых инструментов: F первой стадии и робастный вывод
Узнайте, на какие разные вопросы отвечают F-статистика первой стадии, частичный R², критерии Stock–Yogo, робастная диагностика и вывод Anderson–Rubin при слабых инструментах.
В этом руководствеПочему важна сила инструмента
Краткое резюме
Статистика первой стадии показывает, насколько исключенные инструменты объясняют эндогенный регрессор после учета включенных контролей. Она не доказывает валидность инструмента, а правило «F больше 10» не является универсальной гарантией. Подходящая диагностика зависит от числа эндогенных регрессоров и предположений об ошибках; робастный к слабым IV вывод может оставаться широким или неограниченным.
Почему важна сила инструмента
Метод инструментальных переменных использует ту часть вариации эндогенного регрессора \(X\), которую предсказывают исключенные инструменты \(Z\) при условии включенных контролей \(W\).
Если \(Z\) объясняет лишь малую долю оставшейся вариации \(X\), данные несут мало информации о структурном эффекте, идентифицируемом этим источником.
При слабой релевантности оценка 2SLS в конечной выборке может смещаться к OLS, а ее распределение существенно отклоняться от нормального приближения. Поэтому обычный интервал Wald может плохо покрывать истинное значение, даже если стандартная ошибка выглядит точной.
Стайгер и Сток объясняют эти сбои с помощью асимптотики слабых инструментов и обосновывают нестандартные доверительные множества (статья 1997 года).
Сила инструмента — лишь одна часть идентификации. Сильная первая стадия не доказывает, что \(Z\) независим от структурной ошибки или влияет на исход только через \(X\).
Руководство по инструментальным переменным рассматривает эти отдельные предположения и идентифицируемый эффект.
Первая стадия выделяет условную вариацию инструмента
Для одного эндогенного регрессора и \(q\) исключенных инструментов запишем первую стадию так:
\[ X_t = W_t'\delta + Z_t'\pi + v_t. \]
\(W_t\) включает заданные экзогенные контролы, часто и свободный член; \(Z_t\) содержит исключенные инструменты. Стандартный F-тест первой стадии проверяет совместное ограничение \(H_0:\pi=0\): исключенные инструменты не добавляют объясняющей силы после учета \(W_t\).
Это вопрос об условной релевантности, а не тест ограничения исключения или независимости. Укажите включенные контролы, число совместно проверяемых исключенных инструментов, выборку, предположения о ковариации и использованную статистику.
t-статистика отдельного коэффициента не заменяет совместную проверку при нескольких исключенных инструментах.
Частичный R-квадрат и обычная F-статистика
Частичный \(R^2\) измеряет долю остаточной вариации \(X\) после удаления влияния \(W\), которую объясняют остаточные значения исключенных инструментов.
Обозначим частичный \(R^2\) через \(R^2_p\), размер выборки через \(n\), число включенных регрессоров — включая константу, если она есть, — через \(k\), а число исключенных инструментов через \(q\).
При обычном расчете для гомоскедастичной линейной регрессии добавочная F-статистика равна
\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]
Числитель показывает прирост качества подгонки на одно ограничение для исключенного инструмента; знаменатель оценивает дисперсию ошибок с учетом всех остаточных степеней свободы первой стадии. Эта формула не является универсальным тождеством для робастных статистик.
Робастный оцениватель ковариации меняет расчет теста и референтное распределение.
Частичный \(R^2\) и F отвечают на связанные, но разные описательные вопросы: частичный \(R^2\) — безразмерная мера подгонки, тогда как F также зависит от размера выборки и числа ограничений.
В очень большой выборке небольшой частичный \(R^2\) может давать большое F, не делая все приближения IV в конечной выборке надежными.
Почему F выше 10 — не универсальный порог
Привычное значение 10 — эмпирическое правило, а не теорема о прохождении или провале. Стайгер и Сток обсуждают его как практический ориентир в конкретной схеме анализа слабых инструментов; оно не гарантирует корректный вывод для любой выборки, оценивателя, числа инструментов или процесса ошибок.
Сток и Його определяют слабость инструмента через границы относительного смещения 2SLS или искажения размера теста Wald и приводят критические значения для выбранных критериев. Поэтому критическое значение зависит от критерия и размерности модели.
Обычные результаты первой стадии и Cragg–Donald основаны на предположениях о гомоскедастичности и независимых ошибках.
Числа из этих таблиц нельзя без изменений переносить на любой робастный анализ (страница главы у автора).
F выше 10 не доказывает ограничение исключения, независимость или причинную интерпретацию. F ниже 10 не доказывает, что инструмент бесполезен или конкретная оценка недействительна.
Рассматривайте статистику как диагностическую при явно указанных предположениях, а затем выбирайте вывод, соответствующий дизайну.
Руководство по тесту Hansen J объясняет, почему тест сверхидентифицирующих ограничений не заменяет оценку силы инструментов.
<!-- learn:illustration -->

Для нескольких эндогенных регрессоров нужна совместная оценка силы
Если эндогенных регрессоров несколько, отдельные F-статистики первой стадии могут не выявить слабо идентифицируемую линейную комбинацию.
Каждый регрессор может выглядеть предсказуемым по отдельности, даже если вариация, создаваемая инструментами, не охватывает комбинации, необходимые для точной оценки всех структурных коэффициентов.
В гомоскедастичной линейной IV-модели минимум-эигензначение Cragg–Donald суммирует эту информацию о совместной идентификации. Критические значения Stock–Yogo для него относятся к заданным критериям смещения или искажения размера.
Предположения имеют значение: привычные критические значения не становятся автоматически корректными при произвольной гетероскедастичности, серийной зависимости или кластеризации.
Важны число исключенных инструментов, число эндогенных регрессоров и ранг матрицы коэффициентов первой стадии. Укажите модель целиком и используйте разработанный для нее тест; не выводите совместную силу как среднее отдельных F-статистик.
Робастные ошибки требуют диагностики под конкретный дизайн
Финансовые наблюдения могут быть гетероскедастичными, серийно зависимыми или кластеризованными по компании, торговой площадке или единице политики. Классические калибровки F первой стадии и Cragg–Donald не становятся робастными только потому, что стандартные ошибки второй стадии кластеризованы.
Для одного эндогенного регрессора Монтьель Олеа и Пфлюгер разработали effective-F-тест слабости, допускающий гетероскедастичность, автокорреляцию и кластеризацию при указанных ими условиях.
Он масштабирует обычную F первой стадии с помощью информации о ковариации, а затем сравнивает результат с критическими значениями для конкретного критерия (статья 2013 года).
Effective F — не та же величина, что любая робастная F Wald, выводимая программным обеспечением.
Kleibergen–Paap rk Wald F часто приводят вместе с робастными оценивателями ковариации, но критические значения Stock–Yogo получены для других обычных статистик и предположений. Не сравнивайте их так, словно это одна и та же калиброванная шкала.
Сообщайте оцениватель, статистику, оцениватель ковариации, уровень кластеризации или способ учета зависимости и систему критических значений.
Ковариация Newey–West или кластерно-робастная ковариация учитывает неопределенность выборки при своих предположениях, но сама по себе не устраняет слабую идентификацию.
Вывод Anderson–Rubin может оставаться корректным при слабой релевантности
Для предполагаемого значения коэффициента \(\beta_0\) в модели с одним эндогенным регрессором скорректируйте исход \(Y-X\beta_0\) и проверьте, объясняют ли исключенные инструменты эту величину совместно после учета включенных контролей.
При нулевой гипотезе и экзогенности инструментов это тест Anderson–Rubin гипотезы \(\beta=\beta_0\).
Поскольку тест не делит на оцененный коэффициент первой стадии, его корректность не требует, чтобы тот был большим.
Исходная конструкция Anderson–Rubin опирается на распределительные предположения модели; в приложениях оцениватель ковариации и референтное распределение также должны соответствовать схеме выборки. Пометка «робастный» не позволяет игнорировать малое число кластеров или серийную зависимость.
Инвертирование теста по кандидатным значениям дает доверительное множество. При слабой информации оно может быть широким, несвязным или неограниченным; это результат ограниченной идентифицирующей информации, а не ошибка программного обеспечения. Мощность тестов Anderson–Rubin тоже может быть низкой.
Руководство по сверхидентификации в GMM отвечает на другой вопрос и не должно считаться выводом о коэффициенте, робастным к слабым IV.
Исходная статья — Андерсон и Рубин (1949).
Пример расчета частичной F
Рассмотрим гипотетическую первую стадию с \(n=200\) наблюдениями, \(k=3\) включенными регрессорами вместе с константой, \(q=2\) исключенными инструментами и частичным \(R^2_p=0.04\).
По обычной гомоскедастичной формуле остаточное число степеней свободы равно \(200-3-2=195\).
\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]
Расчет означает, что обычная совместная статистика при этих входных данных и предположениях равна 4.0625. Сам по себе он не доказывает невалидность, не определяет вывод по конкретному критерию Stock–Yogo и не подтверждает тот же результат при гетероскедастичности или кластеризации.
Для робастного анализа нужны собственные статистика и калибровка, соответствующие дизайну.
Если те же два инструмента используются в нечетком дизайне регрессионного разрыва, скачок первой стадии входит в анализ релевантности этого дизайна.
Приведенный расчет F не заменяет предположения RDD, выбор ширины окна или вывод, подходящий для этого дизайна.
Отчитывайтесь отдельно о диагностике и аргументе идентификации
Укажите эндогенные регрессоры, исключенные инструменты, включенные контролы, выборку, коэффициенты первой стадии, частичный \(R^2\) и точную статистику силы.
При нескольких эндогенных регрессорах назовите совместную статистику и ее предположения; для робастных схем укажите ковариацию и метод критических значений, а не ограничивайтесь записью «F = …».
Если статистика указывает на слабую идентификацию, представьте тест или доверительное множество для целевого коэффициента, робастное к слабым IV. Объясните, ограничено ли множество и как его форма влияет на содержательный вывод.
Не заменяйте неинформативный интервал обычным интервалом Wald лишь потому, что его проще кратко описать.
Наконец, обоснуйте независимость инструмента и пути исключения институциональными и экономическими данными. Диагностика релевантности, проверки баланса, плацебо-исходы и тест сверхидентификации могут выявить проблемы, но не доказывают все предположения.
Дизайн разностей-в-разностях использует другие предположения идентификации; более сильная первая стадия не делает эти дизайны взаимозаменяемыми.
Частые вопросы
Q1Доказывает ли F первой стадии выше 10, что инструмент валиден?
Нет. В лучшем случае это диагностика релевантности при конкретной калибровке. Она не устанавливает независимость или исключение.
Q2Равен ли частичный R-квадрат F-статистике первой стадии?
Нет. Частичный R-квадрат описывает дополнительное качество подгонки. Обычная F также зависит от размера выборки, числа ограничений и остаточных степеней свободы.
Q3Можно ли напрямую сравнивать робастную F с критическими значениями Stock–Yogo?
Только если статистика и предположения соответствуют калибровке. Для робастных статистик часто нужны другие критические значения и интерпретация.
Q4Что сообщать, если инструмент кажется слабым?
Приведите диагностику, соответствующую дизайну, и робастный к слабым IV тест или доверительное множество, указав, является ли оно широким, несвязным или неограниченным.
Источники и дополнительное чтение
Сообщить о проблеме
Мы подготовим письмо со ссылкой на эту статью. Mark получит сообщение только после отправки
Быстрая проверка
Прочитали руководство? Проверьте себя в 3 вопросах
Вопрос 01
Что проверяет обычный F-тест первой стадии?
Выберите ответ, чтобы увидеть объяснение
Словарь опционов
Correlation between a regressor and the regression disturbance, causing OLS to mix a target effect with omitted pathways, simultaneity, or measurement error.
Читать подробное руководствоRegression discontinuity designA design using a treatment-probability jump at a known running-variable cutoff plus potential-outcome continuity to identify a local effect.
Читать подробное руководствоDifference-in-differencesA quasi-experimental method subtracting the comparison group's contemporaneous change from the treated group's change to construct an untreated counterfactual.
Читать подробное руководство