تشخيص الأدوات الضعيفة: إحصائية F للمرحلة الأولى والاستدلال المتين
تعرّف إلى الأسئلة المختلفة التي تجيب عنها إحصائية F للمرحلة الأولى، وR² الجزئي، ومعايير Stock–Yogo، والتشخيصات المتينة، واستدلال Anderson–Rubin.
في هذا الدليللماذا تهم قوة الأداة؟
ملخص موجز
تصف إحصائية المرحلة الأولى مقدار ما تفسره الأدوات المستبعدة من المتغير الداخلي بعد ضبط المتغيرات المدرجة. لكنها لا تثبت صلاحية الأداة، كما أن تجاوز F للرقم 10 ليس ضماناً عاماً. يعتمد التشخيص المناسب على عدد المتغيرات الداخلية وافتراضات الأخطاء؛ وقد يظل الاستدلال المتين تجاه ضعف الأدوات واسعاً أو غير محدود.
لماذا تهم قوة الأداة؟
تستخدم المتغيرات الأداتية الجزء من تباين المتغير الداخلي \(X\) الذي تتنبأ به الأدوات المستبعدة \(Z\) بعد اشتراط المتغيرات الضابطة المدرجة \(W\).
إذا لم تتنبأ \(Z\) إلا بقدر ضئيل من التباين المتبقي في \(X\)، فإن البيانات لا توفر معلومات كثيرة عن الأثر البنيوي من هذا المصدر.
مع الصلة الضعيفة، قد ينحاز 2SLS في العينات المحدودة نحو OLS، وقد يبتعد توزيعه عن التقريب الطبيعي بدرجة كبيرة. لذلك قد تكون تغطية فترة Wald التقليدية ضعيفة حتى عندما يبدو الخطأ المعياري دقيقاً.
يشرح Staiger وStock هذه الإخفاقات باستخدام التقاربات الخاصة بالأدوات الضعيفة، ويحفزان استخدام مجموعات ثقة غير معيارية (بحث 1997).
القوة جانب واحد فقط من التعريف. فالمرحلة الأولى القوية لا تثبت أن \(Z\) مستقل عن الخطأ البنيوي أو أنه يؤثر في النتيجة عبر \(X\) وحده.
يتناول دليل المتغيرات الأداتية تلك الافتراضات المنفصلة والأثر الذي يجري تعريفه.
تفصل المرحلة الأولى تباين الأداة المشروط
لمتغير داخلي واحد و\(q\) من الأدوات المستبعدة، اكتب المرحلة الأولى كما يلي:
\[ X_t = W_t'\delta + Z_t'\pi + v_t. \]
يحتوي \(W_t\) على المتغيرات الضابطة الخارجية المدرجة، وغالباً ما يشمل ثابتاً، بينما يحتوي \(Z_t\) على الأدوات المستبعدة. يختبر اختبار F القياسي للمرحلة الأولى الفرضية \(H_0:\pi=0\)، أي القيد المشترك الذي يقول إن الأدوات المستبعدة لا تضيف قدرة تفسيرية بعد \(W_t\).
هذا سؤال عن الصلة المشروطة، وليس اختباراً لقيد الاستبعاد أو الاستقلال. اذكر المتغيرات الضابطة المدرجة، وعدد الأدوات المستبعدة التي يجري اختبارها معاً، والعينة وافتراضات التغاير والإحصائية المستخدمة.
إحصائية t لمعامل منفرد لا تعوّض الاختبار المشترك عند وجود عدة أدوات مستبعدة.
معامل التحديد الجزئي وإحصائية F التقليدية
يقيس \(R^2\) الجزئي نسبة التباين المتبقي في \(X\)، بعد إزالة أثر \(W\)، التي تفسرها الأدوات المستبعدة بعد تحييدها.
لنفترض أن \(R^2_p\) هو معامل التحديد الجزئي، و\(n\) حجم العينة، و\(k\) عدد المتغيرات التفسيرية المدرجة، بما فيها الثابت إن استُخدم، و\(q\) عدد الأدوات المستبعدة.
في حساب الانحدار الخطي التقليدي المتجانس التباين، تكون إحصائية F الإضافية:
\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]
يقيس البسط تحسن الملاءمة لكل قيد على أداة مستبعدة؛ أما المقام فيقدر تباين البواقي باستخدام درجات الحرية الكاملة لبواقي المرحلة الأولى. هذه الصيغة ليست تعريفاً عاماً لإحصائية متينة.
يغيّر مقدّر التغاير المتين طريقة حساب الاختبار وتوزيعه المرجعي.
يجيب \(R^2\) الجزئي وF عن سؤالين وصفيين مترابطين لكن مختلفين: الأول مقياس ملاءمة بلا وحدات، بينما تعكس F أيضاً حجم العينة وعدد القيود.
قد ينتج عن \(R^2\) جزئي صغير إحصائية F كبيرة في عينة ضخمة، من دون أن تصبح كل تقريبات IV في العينات المحدودة موثوقة.
لماذا لا تمثل F الأكبر من 10 عتبة عامة؟
الرقم المألوف 10 قاعدة إرشادية، وليس مبرهنة نجاح أو إخفاق. ناقشه Staiger وStock كدليل عملي ضمن إطار معين للأدوات الضعيفة؛ ولا يضمن صلاحية الاستدلال لكل عينة أو مقدّر أو عدد أدوات أو عملية أخطاء.
يعرّف Stock وYogo ضعف الأداة من خلال حدود لانحياز 2SLS النسبي أو لتشوه حجم اختبار Wald، ويعرضان قيماً حرجة للمعايير المختارة. لذلك تعتمد القيمة الحرجة على المعيار وأبعاد النموذج.
تعتمد نتائج المرحلة الأولى التقليدية وCragg–Donald على افتراضات التجانس التبايني واستقلال الأخطاء.
لا يمكن نقل رقم من تلك الجداول دون تعديل إلى كل إعداد متين (صفحة الفصل لدى المؤلف).
القيمة التي تتجاوز 10 لا تثبت الاستبعاد أو الاستقلال أو التفسير السببي. والقيمة الأقل من 10 لا تثبت أن الأداة عديمة الفائدة أو أن تقديراً بعينه غير صالح.
تعامل مع الإحصائية بوصفها تشخيصاً تحت افتراضات معلنة، ثم اختر استدلالاً يناسب التصميم.
يشرح دليل اختبار Hansen J لماذا لا يحل اختبار القيود الزائدة محل تقييم قوة الأداة.
<!-- learn:illustration -->

المتغيرات الداخلية المتعددة تتطلب تقييماً مشتركاً للقوة
إذا كان هناك أكثر من متغير داخلي، فقد تفوّت إحصائيات F المنفصلة للمرحلة الأولى تركيبة خطية ضعيفة التحديد.
قد يبدو كل متغير متنبأً به على حدة، حتى عندما لا يغطي التباين الذي تولده الأدوات التركيبات اللازمة لتقدير كل المعاملات البنيوية بدقة.
في إعداد IV الخطي المتجانس التباين، تلخص إحصائية أصغر قيمة ذاتية لـ Cragg–Donald معلومات التعريف المشتركة هذه. وتستهدف القيم الحرجة لـ Stock–Yogo معايير محددة للانحياز أو لتشوه حجم الاختبار.
الافتراضات مهمة: فالقيم الحرجة المألوفة لا تصبح صالحة تلقائياً مع أي تغاير غير متجانس أو اعتماد تسلسلي أو تجميع.
عدد الأدوات المستبعدة وعدد المتغيرات الداخلية ورتبة مصفوفة معاملات المرحلة الأولى كلها عوامل مهمة. اذكر الإعداد كاملاً واستخدم اختباراً مصمماً له؛ ولا تستنتج القوة المشتركة من متوسط إحصائيات F الفردية.
الأخطاء المتينة تستدعي تشخيصات توافق تصميم العينة
قد تكون المشاهدات المالية غير متجانسة التباين، أو مترابطة تسلسلياً، أو مجمعة حسب الشركة أو منصة التداول أو وحدة السياسة. ولا تصبح معايرة F التقليدية للمرحلة الأولى أو Cragg–Donald متينة لمجرد تجميع الأخطاء المعيارية في المرحلة الثانية.
لمتغير داخلي واحد، يطور Montiel Olea وPflueger اختبار effective-F لضعف الأدوات، بما يسمح بالتغاير غير المتجانس والارتباط الذاتي والتجميع ضمن شروطهما المحددة.
يعدّل الاختبار F التقليدية للمرحلة الأولى باستخدام معلومات التغاير، ثم يقارن النتيجة بقيم حرجة مرتبطة بالمعيار (بحث 2013).
ليست effective F هي الكمية نفسها التي تعرضها كل البرامج على أنها Wald F متينة.
كثيراً ما تُعرض Kleibergen–Paap rk Wald F مع مقدّرات تغاير متينة، لكن القيم الحرجة لـ Stock–Yogo مشتقة لإحصائيات وافتراضات تقليدية مختلفة. لا تقارنها كما لو كانت على مقياس معاير مشترك.
أبلغ عن المقدّر والإحصائية ومقدّر التغاير ومستوى التجميع أو معالجة الاعتماد وإطار القيم الحرجة.
يعالج تقدير Newey–West أو التغاير المتين للتجميع عدم اليقين في المعاينة وفق افتراضاته؛ لكنه لا يعالج ضعف التعريف بمفرده.
قد يظل استدلال Anderson–Rubin صالحاً عند ضعف الصلة
لقيمة مرشحة للمعامل \(\beta_0\) في نموذج بمتغير داخلي واحد، كوّن النتيجة المعدلة بهذه القيمة، \(Y-X\beta_0\)، واختبر ما إذا كانت الأدوات المستبعدة تفسرها معاً بعد ضبط المتغيرات المدرجة.
تحت الفرضية الصفرية وخارجية الأدوات، يكون هذا اختبار Anderson–Rubin للفرضية \(\beta=\beta_0\).
ولأن الاختبار لا يقسم على معامل مرحلة أولى مقدّر، فلا يلزم لصلاحيته افتراض أن ذلك المعامل كبير.
يستخدم البناء الأصلي لـ Anderson–Rubin افتراضات التوزيع الخاصة بالنموذج؛ وفي التطبيقات يجب أيضاً أن يتوافق مقدّر التغاير والتوزيع المرجعي مع تصميم المعاينة. وصف الاختبار بأنه «متين» لا يبرر تجاهل قلة العناقيد أو الاعتماد التسلسلي.
يعطي قلب الاختبار عبر القيم المرشحة مجموعة ثقة. ومع ضعف المعلومات قد تكون المجموعة واسعة أو منفصلة أو غير محدودة؛ وهذا يعكس محدودية معلومات التعريف وليس عيباً برمجياً. وقد تكون قوة اختبارات Anderson–Rubin منخفضة أيضاً.
يتناول دليل فرط التعريف في GMM سؤالاً مختلفاً، ولا ينبغي اعتباره استدلالاً على المعاملات متيناً تجاه ضعف IV.
البحث الأصلي هو Anderson وRubin (1949).
مثال حسابي على F الجزئية
لنفترض مرحلة أولى افتراضية فيها \(n=200\) مشاهدة، و\(k=3\) متغيرات تفسيرية مدرجة تشمل الثابت، و\(q=2\) من الأدوات المستبعدة، و\(R^2_p=0.04\).
وفق الصيغة التقليدية المتجانسة التباين، تكون درجات حرية البواقي \(200-3-2=195\).
\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]
تعني العملية الحسابية أن الإحصائية المشتركة التقليدية تساوي 4.0625 في ظل هذه المدخلات والافتراضات. لكنها لا تثبت وحدها عدم الصلاحية، ولا تحدد النتيجة المرتبطة بمعيار Stock–Yogo، ولا تثبت النتيجة مع التغاير غير المتجانس أو التجميع.
يتطلب التحليل المتين إحصائية ومعايرة خاصتين به ومتوافقتين مع التصميم.
إذا استُخدمت الأداتان نفسيهما في تصميم انحدار متقطع ضبابي، فإن قفزة المرحلة الأولى جزء من تحليل الصلة الخاص بذلك التصميم.
ولا يحل حساب F أعلاه محل افتراضات RDD أو اختيارات عرض النطاق أو الاستدلال المناسب لذلك التصميم.
أبلغ عن التشخيص وحجة التعريف كلٌّ على حدة
اذكر المتغيرات الداخلية والأدوات المستبعدة والمتغيرات الضابطة المدرجة والعينة ومعاملات المرحلة الأولى و\(R^2\) الجزئي وإحصائية القوة المستخدمة تحديداً.
عند تعدد المتغيرات الداخلية، حدد الإحصائية المشتركة وافتراضاتها؛ وفي الإعدادات المتينة، اذكر التغاير وطريقة القيم الحرجة بدلاً من الاكتفاء بعبارة «F = …».
إذا أشارت الإحصائية إلى ضعف التعريف، فأبلغ عن اختبار أو مجموعة ثقة للمعامل المستهدف متينة تجاه ضعف IV. وضح ما إذا كانت المجموعة محدودة وكيف يؤثر شكلها في الاستنتاج الموضوعي.
لا تستبدل فترة غير مفيدة بفترة Wald تقليدية لمجرد سهولة تلخيصها.
وأخيراً، دافع عن استقلال الأداة ومسارات استبعادها بأدلة مؤسسية واقتصادية. قد تكشف تشخيصات الصلة واختبارات التوازن والنتائج الوهمية واختبار القيود الزائدة عن مشكلات، لكنها لا تثبت كل الافتراضات.
يستخدم تصميم الفروق في الفروق افتراضات تعريف مختلفة؛ ولا تجعل المرحلة الأولى الأقوى التصميمين قابلين للاستبدال.
أسئلة شائعة
Q1هل تثبت F في المرحلة الأولى إذا تجاوزت 10 أن الأداة صالحة؟
لا. هي في أحسن الأحوال تشخيص للصلة ضمن معايرة معينة، ولا تثبت الاستقلال أو الاستبعاد.
Q2هل يساوي معامل التحديد الجزئي إحصائية F للمرحلة الأولى؟
لا. يصف معامل التحديد الجزئي تحسن الملاءمة الإضافي، بينما تعتمد F التقليدية أيضاً على حجم العينة وعدد القيود ودرجات حرية البواقي.
Q3هل يمكن مقارنة F المتينة مباشرة بالقيم الحرجة لـ Stock–Yogo؟
فقط عندما تتطابق الإحصائية والافتراضات مع المعايرة. فكثيراً ما تتطلب الإحصائيات المتينة قيماً حرجة وتفسيراً مختلفين.
Q4ماذا أبلغ عندما تبدو الأداة ضعيفة؟
أبلغ عن التشخيص الموافق للتصميم واختبار أو مجموعة ثقة متينة تجاه ضعف IV، مع بيان ما إذا كانت المجموعة واسعة أو منفصلة أو غير محدودة.
المصادر والقراءة الإضافية
الإبلاغ عن مشكلة
سنُعدّ رسالة تتضمن رابط هذا المقال. لن يصل البلاغ إلى Mark إلا بعد إرسالها
تحقق سريع
بعد قراءة الدليل، اختبر نفسك في 3 أسئلة
السؤال 01
ماذا يقيّم اختبار F التقليدي للمرحلة الأولى؟
اختر إجابة لرؤية الشرح
معجم الخيارات
Correlation between a regressor and the regression disturbance, causing OLS to mix a target effect with omitted pathways, simultaneity, or measurement error.
اقرأ الدليل المتعمقRegression discontinuity designA design using a treatment-probability jump at a known running-variable cutoff plus potential-outcome continuity to identify a local effect.
اقرأ الدليل المتعمقDifference-in-differencesA quasi-experimental method subtracting the comparison group's contemporaneous change from the treated group's change to construct an untreated counterfactual.
اقرأ الدليل المتعمق