약한 도구변수 진단: 첫 단계 F 통계량과 강건 추론
첫 단계 F 통계량, 부분 R제곱, Stock–Yogo 기준, 강건 진단, Anderson–Rubin 추론이 약한 도구변수의 서로 다른 질문에 어떻게 답하는지 설명합니다
이 글에서 다루는 내용도구 강도를 확인하는 이유
짧은 요약
첫 단계 통계량은 포함된 통제변수 이후에 제외 도구가 내생 설명변수를 얼마나 설명하는지 요약합니다. 이 값은 도구의 유효성을 증명하지 않으며 “F가 10보다 크면 안전하다”도 보편적 보증이 아닙니다. 내생 설명변수의 수와 오차 가정에 따라 적절한 진단이 달라집니다. 약한 IV에 강건한 신뢰집합은 넓거나 무한할 수 있습니다.
도구 강도를 확인하는 이유
도구변수 추정은 내생 설명변수 \(X\)의 변동 중 포함된 통제변수 \(W\)를 조건으로 제외 도구 \(Z\)가 예측하는 부분을 사용합니다. \(Z\)가 \(X\)의 나머지 변동을 거의 설명하지 못하면, 이 도구가 제공하는 식별 정보도 적습니다.
관련성이 약하면 유한표본에서 2SLS 추정치가 OLS 쪽으로 편향될 수 있고, 추정량의 분포가 정규분포 근사에서 크게 벗어날 수 있습니다. 표준오차가 작아 보여도 통상적인 Wald 신뢰구간의 실제 포함률이 나쁠 수 있습니다. Staiger와 Stock은 약한 도구 아래의 점근 분포를 분석해 이런 문제와 비표준 신뢰집합의 필요성을 설명합니다(1997년 논문).
강도는 식별의 한 부분일 뿐입니다. 첫 단계가 강해도 \(Z\)가 구조오차와 독립인지, \(X\)를 통하지 않고 결과에 영향을 주지 않는지는 확인되지 않습니다. 도구변수 입문에서 이러한 가정과 추정 대상의 차이를 살펴볼 수 있습니다.
첫 단계는 조건부 도구 변동을 분리합니다
내생 설명변수 하나와 제외 도구 \(q\)개가 있을 때 첫 단계를 다음처럼 씁니다.
\[ X_t = W_t'\delta + Z_t'\pi + v_t. \]
여기서 \(W_t\)에는 절편을 포함할 수 있는 포함 외생 통제변수가 들어가고, \(Z_t\)에는 제외 도구가 들어갑니다. 표준 첫 단계 F 검정은 \(H_0:\pi=0\), 즉 \(W_t\) 이후에 모든 제외 도구가 추가 설명력을 주지 않는다는 공동가설을 검정합니다.
이는 조건부 관련성에 대한 질문이지, 배제제약이나 독립성에 대한 검정이 아닙니다. 어떤 통제변수를 포함했는지, 제외 도구를 몇 개 함께 검정하는지, 표본과 공분산 가정이 무엇인지, 어떤 통계량을 사용했는지 보고해야 합니다. 제외 도구가 여러 개라면 개별 계수의 t 통계량으로 공동검정을 대신할 수 없습니다.
부분 R제곱과 통상적인 F 통계량
부분 \(R^2\)는 먼저 \(W\)를 제거하고 남은 \(X\)의 변동 가운데 잔차화된 제외 도구가 설명하는 비율입니다. 이를 \(R^2_p\)라고 하겠습니다. \(n\)은 표본 크기, \(k\)는 절편을 포함할 수 있는 포함 회귀변수의 수, \(q\)는 제외 도구의 수입니다.
등분산 선형 회귀의 통상적인 계산에서 추가 F 통계량은 다음과 같습니다.
\[ F = \frac{R^2_p/q}{(1-R^2_p)/(n-k-q)}. \]
분자는 제외 도구 제한 하나당 적합도가 개선된 정도를 나타냅니다. 분모는 전체 첫 단계의 잔차 자유도로 잔차 분산을 추정합니다. 이 식이 모든 강건 통계량에 그대로 적용되는 것은 아닙니다. 강건 공분산 추정량을 쓰면 검정 통계량과 기준 분포의 계산이 달라집니다.
부분 \(R^2\)와 F는 관련 있지만 서로 다른 정보를 줍니다. 부분 \(R^2\)는 표본 크기와 무관한 적합도 지표이고, F는 표본 크기와 공동 제한 개수도 반영합니다. 표본이 매우 크면 부분 \(R^2\)가 작아도 F가 커질 수 있지만, 그렇다고 모든 유한표본 IV 근사가 안정적이라는 뜻은 아닙니다.
따라서 같은 표본 안에서 도구를 추가하기 전후의 설명력 변화를 볼 때는 부분 \(R^2\)가 직관적입니다. 표본 크기가 다른 연구의 F 숫자를 나란히 놓을 때는 관측치 수와 자유도 차이도 함께 읽어야 합니다. 큰 F가 곧 큰 경제적 관련성을 뜻하는 것은 아닙니다.
F가 10보다 크다는 것이 보편 기준은 아닙니다
익숙한 10이라는 값은 경험칙이지 통과·탈락 정리가 아닙니다. Staiger와 Stock은 특정 약한 도구 분석 틀에서 실무적 지침으로 논의했지만, 모든 표본·추정량·도구 수·오차 과정에 적용되는 보증선은 아닙니다.
Stock과 Yogo는 2SLS의 OLS 대비 편향 상한 또는 Wald 검정 크기 왜곡이라는 기준으로 도구 약함을 정의하고, 각 기준에 맞는 임계값을 제시합니다. 따라서 임계값은 어떤 기준을 택했는지와 모형 차원에 따라 달라집니다. 통상적인 첫 단계 및 Cragg–Donald 결과는 등분산·독립 오차 가정에 의존합니다.
그 표의 수치를 아무 강건 분석에나 그대로 적용할 수는 없습니다(저자 자료 페이지).
10을 넘었다고 배제제약, 독립성 또는 인과 해석이 증명되는 것은 아닙니다. 10보다 작다고 도구가 쓸모없거나 해당 추정치가 무효라고 자동으로 결론 내릴 수도 없습니다. 명시한 가정 아래 진단값으로 해석하고, 설계에 맞는 추론을 선택하세요. Hansen J 검정 안내는 과식별 검정이 도구 강도 검정을 대체하지 못하는 이유를 설명합니다.
실증적으로는 허용 가능한 최대 편향을 OLS 편향의 몇 퍼센트로 볼지, 또는 Wald 검정의 크기 왜곡을 어느 정도까지 허용할지 먼저 정해야 합니다. 기준을 정하지 않은 채 한 임계값을 제시하면 독자가 그 숫자가 어떤 실질적 오차를 제한하는지 알기 어렵습니다.
<!-- learn:illustration -->

내생 설명변수가 여러 개라면 공동 강도를 살펴봅니다
내생 설명변수가 여러 개이면 각각의 첫 단계 F가 약한 식별의 특정 선형 조합을 놓칠 수 있습니다. 각 설명변수가 따로 보면 예측되는 것처럼 보여도, 도구가 제공하는 변동이 모든 구조계수를 정밀하게 추정할 조합을 충분히 만들지 못할 수 있습니다.
등분산 선형 IV 설정에서 Cragg–Donald 최소 고윳값 통계량은 이 공동 식별 정보를 요약합니다. Stock–Yogo 임계값은 이 통계량에 대해 정해진 편향 또는 검정 크기 왜곡 기준을 다룹니다. 가정이 중요합니다. 익숙한 임계값을 임의의 이분산, 시계열 의존, 군집 자료에 그대로 적용할 수 없습니다.
제외 도구 수, 내생 설명변수 수, 첫 단계 계수 행렬의 계수가 모두 중요합니다. 전체 설정에 맞는 검정을 사용하고, 개별 첫 단계 F의 평균으로 공동 강도를 추정하지 마세요.
예를 들어 두 내생변수가 거의 같은 방향으로만 움직이고 도구도 그 공통 변동만 설명한다면, 두 개의 개별 첫 단계에서 각각 관계가 보여도 두 효과를 분리할 독립 정보가 부족할 수 있습니다. 필요한 식별 조건은 각 식을 따로 보는 것이 아니라 도구가 제공하는 변동의 전체 차원을 보는 것입니다.
강건 오차에는 설계에 맞는 진단이 필요합니다
금융 자료에는 이분산, 시계열 상관, 기업·거래소·정책 단위별 군집이 있을 수 있습니다. 2단계 표준오차를 군집화한다고 해서 고전적인 첫 단계 F나 Cragg–Donald 통계량의 보정 기준까지 강건해지는 것은 아닙니다.
내생 설명변수 하나를 다룰 때 Montiel Olea와 Pflueger는 명시한 조건 아래 이분산, 자기상관, 군집을 허용하는 effective-F 약한 도구 검정을 제안합니다. 이 통계량은 공분산 정보를 사용해 통상적인 첫 단계 F를 조정한 뒤, 기준에 맞는 임계값과 비교합니다(2013년 논문). Effective F는 소프트웨어가 보고하는 모든 강건 Wald F와 같은 값이 아닙니다.
Kleibergen–Paap rk Wald F도 강건 공분산 추정과 함께 자주 보고되지만, Stock–Yogo 임계값은 다른 통계량과 가정 아래 도출됐습니다. 서로 같은 척도에서 보정된 값처럼 비교하지 마세요. 추정량, 통계량, 공분산 추정량, 군집 수준 또는 의존성 처리, 임계값 기준을 함께 기록해야 합니다. Newey–West나 군집 강건 공분산은 해당 가정 아래 표본 불확실성을 다루지만 약한 식별 자체를 고치지는 않습니다.
| 자료와 모형 | 중심 진단 | 함께 밝혀야 할 조건 |
|---|---|---|
| 내생변수 하나, 통상 등분산 선형 모형 | 첫 단계 F와 해당 Stock–Yogo 기준 | 편향 또는 크기 왜곡 기준, 도구 수 |
| 내생변수 여러 개, 통상 선형 모형 | Cragg–Donald 최소 고윳값 통계량 | 내생변수 수와 등분산·독립 오차 가정 |
| 내생변수 하나, 이분산·시계열·군집 오차 | effective F 등 설계 맞춤 진단 | 공분산 추정, 군집 수, 해당 임계값 |
| 약한 관련성 아래 계수 추론 | Anderson–Rubin 검정 역산 | 도구 외생성, 검정 설정, 신뢰집합 모양 |
이 표는 모든 연구에 하나의 통계를 지정하는 처방이 아닙니다. 현재 설계가 어떤 행에 더 가까운지와 그 설정이 진단의 근거와 얼마나 일치하는지 확인하는 점검표입니다.
Anderson–Rubin 추론은 약한 관련성에서도 유효할 수 있습니다
내생 설명변수가 하나일 때 후보 계수 \(\beta_0\)를 정하고 그 값만큼 조정한 결과 \(Y-X\beta_0\)를 만듭니다. 이를 포함 통제변수에 회귀한 뒤 제외 도구의 공동 설명력을 검정합니다. 귀무가설과 도구 외생성이 성립하면 이는 \(\beta=\beta_0\)에 대한 Anderson–Rubin 검정입니다.
이 검정은 추정한 첫 단계 계수로 나누지 않으므로 해당 계수가 큰 값이라는 가정에 의존하지 않고 유효할 수 있습니다. 원래 Anderson–Rubin 구성은 모형의 분포 가정을 사용합니다. 실제 분석에서는 공분산 추정량과 기준 분포도 표본 설계에 맞아야 합니다. 통계량에 “강건”이라는 이름이 붙어도 군집 수가 적거나 시계열 의존성이 있는 문제를 무시할 수는 없습니다.
후보 계수 전반에 걸쳐 검정을 역산하면 신뢰집합이 나옵니다. 식별 정보가 약하면 신뢰집합이 넓거나, 여러 구간으로 나뉘거나, 무한할 수 있습니다. 이는 소프트웨어 오류라기보다 식별 정보가 제한적이라는 결과입니다. Anderson–Rubin 검정의 검정력이 낮을 수도 있습니다. GMM 과식별 검정 안내는 다른 질문을 다루므로 약한 IV에 강건한 계수 추론으로 대체하면 안 됩니다.
검정 역산의 해석은 후보값을 하나씩 고정한 뒤 귀무가설을 기각하지 않은 값들의 집합을 만드는 것입니다. 이 집합을 점추정치 주변의 대칭 구간으로 바꾸면 검정이 실제로 제공한 정보를 바꾸게 됩니다. 결과를 표나 그림으로 그대로 보여주는 편이 더 투명합니다.
원 논문은 Anderson과 Rubin(1949)입니다.
부분 F 통계량 계산 예시
가상의 첫 단계 표본이 \(n=200\), 절편을 포함한 통제변수가 \(k=3\), 제외 도구가 \(q=2\), 부분 \(R^2_p=0.04\)라고 하겠습니다. 통상 등분산 공식을 사용하면 잔차 자유도는 \(200-3-2=195\)입니다.
\[ F = \frac{0.04/2}{(1-0.04)/195} = \frac{0.02}{0.96/195} = 4.0625. \]
이 산수는 주어진 입력값과 가정 아래 통상적인 공동검정 통계량이 4.0625라는 뜻입니다. 이 값 하나가 도구의 무효성을 증명하거나, Stock–Yogo의 기준별 결론을 정하거나, 이분산·군집 설정에서도 같은 결과라고 말해 주지는 않습니다. 강건 분석에는 설계에 맞는 통계량과 보정 기준이 필요합니다.
도구의 단위를 상수배로 바꾸면 첫 단계 적합값과 제외 도구가 설명하는 공간은 바뀌지 않으므로 통상적인 F 자체는 달라지지 않습니다. 단위를 바꿔 F를 높이려는 계산은 의미가 없습니다. 반대로 도구의 측정 정의나 표본을 바꾸면 다른 회귀가 되므로 결과도 달라질 수 있습니다.
같은 두 도구를 퍼지 회귀불연속설계에 쓴다면 첫 단계 불연속은 설계별 관련성 분석의 일부입니다. 위 F 계산은 회귀불연속 가정, 대역폭 선택, 해당 설계에 맞는 추론을 대체하지 않습니다.
진단 결과와 식별 논증을 따로 보고합니다
내생 설명변수, 제외 도구, 포함 통제변수, 표본, 첫 단계 계수, 부분 \(R^2\), 사용한 강도 통계량을 밝히세요. 내생 설명변수가 여럿이면 공동 통계량과 가정을, 강건 설정이면 공분산 추정과 임계값 계산 방법을 보고하고 “F = …”만 적지 않습니다.
통계량이 약한 식별을 시사한다면 목표 계수에 대한 약한 IV 강건 검정이나 신뢰집합을 제시합니다. 신뢰집합이 유계인지, 여러 조각인지 설명하고 그 모양이 실질적 결론에 주는 영향을 씁니다. 요약하기 편하다는 이유로 정보가 부족한 신뢰집합을 통상적인 Wald 구간으로 바꾸면 안 됩니다.
마지막으로 제도·경제 자료를 이용해 도구의 독립성과 배제 경로를 논증합니다. 관련성 진단, 균형 점검, 위약 결과, 과식별 검정은 문제를 드러낼 수 있지만 모든 가정을 증명하지는 않습니다. 차분의 차분 설계는 다른 식별 가정을 사용하므로 더 강한 첫 단계가 그 설계를 대체하지 않습니다.
재현 가능한 보고에는 표본 기간, 결측 관측 처리, 도구의 변형과 통제변수 집합도 포함합니다. 표본이나 통제가 달라지면 같은 F라는 표현도 서로 다른 공동가설과 자유도를 나타낼 수 있습니다.
도구가 무엇으로 측정됐는지, 어느 시점에 배정되거나 관측됐는지, 단위와 변환을 어떻게 정했는지도 기록하세요. 결과변수와 설명변수의 관측 시점이 도구의 발생 전후와 맞지 않으면 첫 단계의 의미 자체가 달라질 수 있습니다.
통제변수는 왜 포함했는지 설명하고, 처치나 도구 발생 뒤에 결정되는 변수를 무심코 추가하지 마세요. 사후변수를 조건화하면 표본의 비교 관계나 추정 대상이 달라질 수 있어, 단순히 통제를 더한 사양을 더 신뢰할 수 있다고 말할 수 없습니다.
제외 도구가 여럿이면 도구들 사이의 높은 상관도 보고 해석에 반영해야 합니다. 각각의 도구가 내생변수와 연결돼 있어도 서로 비슷한 변동만 제공하면 식별에 필요한 독립적인 정보가 충분하지 않을 수 있습니다.
첫 단계 표에는 각 도구의 계수와 표준오차, 공동 제한 개수, 자유도, 표본 수를 함께 둡니다. 독자는 요약 통계량이 어떤 회귀와 표본에서 계산됐는지 확인할 수 있어야 합니다.
강건 임계값을 제시할 때는 어떤 약함의 기준을 선택했는지와 그 기준이 표본 설계에 왜 맞는지도 씁니다. 수치를 논문 표에서 가져왔다면 그 표의 가정과 현재 자료의 공분산 처리 차이가 있는지 밝혀야 합니다.
시계열 자료에서는 표본이 길어 보여도 독립 관측치 수가 같은 것은 아닙니다. 충격이 시간에 따라 지속되거나 군집별로 함께 움직일 수 있으므로, 어떤 의존 구조를 반영했는지와 그 선택의 근거를 기록해야 합니다.
군집 표준오차를 사용할 때는 군집 개수와 처치 또는 도구 배정이 이뤄지는 수준을 밝히세요. 군집 수가 적다면 보통의 점근 근사에 의존하는 추론이 부정확할 수 있으며, 강도 진단도 해당 표본 구조에 맞아야 합니다.
또한 여러 사양 중 가장 큰 첫 단계 통계량만 골라 보고하면 결과가 선택된 경로를 숨길 수 있습니다. 주요 사양과 사전에 정한 민감도 분석을 함께 제시하고, 사양별 결과가 달라지는 이유를 설명해야 합니다.
자주 묻는 질문
Q1첫 단계 F가 10보다 크면 도구가 유효하다는 뜻인가요?
아닙니다. 특정 보정 가정 아래 관련성을 진단하는 값일 뿐입니다. 독립성이나 배제제약을 증명하지 않습니다.
Q2부분 R제곱과 첫 단계 F 통계량은 같은 값인가요?
아닙니다. 부분 R제곱은 추가 적합도를 나타냅니다. 통상 F는 표본 크기, 제한 개수, 잔차 자유도도 반영합니다.
Q3강건 F를 Stock–Yogo 임계값과 직접 비교해도 되나요?
통계량과 가정이 그 보정 기준과 일치할 때만 가능합니다. 강건 통계량에는 다른 임계값과 해석이 필요한 경우가 많습니다.
Q4도구가 약해 보이면 무엇을 보고해야 하나요?
설계에 맞는 진단과 약한 IV에 강건한 검정 또는 신뢰집합을 보고하고, 신뢰집합이 넓거나 분리됐거나 무한한지 밝혀야 합니다.
출처와 더 읽을 자료
내용 정정 제보
이 아티클 링크를 담은 이메일 초안을 준비합니다. 직접 보내야 Mark에 제보가 접수됩니다
QUICK CHECK
글을 다 읽었다면, 3문항으로 확인해보세요
Question 01
통상적인 첫 단계 F 검정은 무엇을 평가합니까?
정답을 고르면 바로 설명을 볼 수 있어요