OLS 회귀계수와 가정
최소제곱법의 목적함수, 조건부 계수 해석, 잔차, 외생성, 다중공선성, 등분산성과 금융 회귀를 올바르게 읽는 기준을 설명합니다
Mark 작성 · 하단에 공식 출처 표기
한눈에 답하기
보통최소제곱법은 실제값과 선형 예측값 사이 잔차의 제곱합을 가장 작게 만드는 계수를 고릅니다. 한 계수는 다른 포함 변수를 고정했을 때 해당 설명변수 한 단위 차이와 결과의 평균적 선형 차이를 뜻합니다. 이 숫자가 인과효과가 되려면 오차의 조건부 평균이 0이라는 외생성 등 추가 가정이 필요하며, 높은 R²나 작은 잔차만으로는 그 가정을 확인할 수 없습니다
OLS는 제곱 잔차를 최소화합니다
모형 y=Xβ+u에서 OLS는 관측값과 적합값 Xβ의 차이를 제곱해 더한 목적함수가 가장 작은 β를 선택합니다
설계행렬의 열이 완전한 선형종속이 아니면 해는 보통 β̂=(X′X)⁻¹X′y로 표현됩니다
제곱은 큰 오차에 더 큰 벌점을 주므로 계산은 간결하지만 이상치와 자료 오류에 민감할 수 있습니다
계수는 조건부 선형 비교입니다
βj는 나머지 포함 변수를 같은 값으로 둘 때 xj 한 단위 차이에 대응하는 y의 적합값 차이입니다
Frisch–Waugh–Lovell 결과에 따르면 y와 xj에서 다른 통제변수의 선형 부분을 각각 제거한 뒤 남은 두 잔여분을 회귀해도 같은 계수를 얻습니다
따라서 계수의 의미는 통제변수 집합, 함수형태, 단위와 표본에 의존하며 단순한 두 변수 상관과 같지 않습니다
선형성은 계수에 관한 조건입니다
선형회귀는 매개변수에 선형이어야 한다는 뜻이며 로그, 제곱항, 구간별 항이나 상호작용을 설명변수로 둘 수 있습니다
상호작용이 있으면 한 변수의 한계관계가 다른 변수 값에 따라 달라지므로 주효과 하나만 독립적으로 읽으면 안 됩니다
범위를 벗어난 외삽은 적합된 함수형태를 데이터가 없는 구간까지 연장하므로 표본 안의 좋은 적합보다 훨씬 강한 가정입니다
가정마다 보장하는 것이 다릅니다
오차의 조건부 평균이 0이면 포함된 설명변수로 체계적으로 예측되는 누락요인이 없다는 뜻이며 일관성이나 인과해석의 핵심입니다
등분산성은 모든 설명변수 값에서 오차분산이 같다는 조건으로, OLS 계수의 비편향성보다 고전적 표준오차 공식과 효율성에 관련됩니다
오차의 정규성은 OLS 계산에 필요하지 않지만 작은 표본의 정확한 t와 F 추론에는 역할을 할 수 있습니다
잔차는 보이지 않는 오차가 아닙니다
잔차 e=y−Xβ̂는 같은 표본에서 추정한 적합값과 관측값의 차이이고, 모집단 오차 u를 직접 관측한 값은 아닙니다
절편을 포함한 OLS 잔차는 표본에서 설명변수와 직교하도록 만들어지므로 잔차 상관이 0인 것은 외생성의 독립 증거가 아닙니다
잔차도표는 비선형성, 분산 변화, 군집, 시차 의존과 이상치를 찾는 진단 도구지만 올바른 모형을 증명하지 않습니다
금융자료는 기본 가정을 자주 압박합니다
수익률은 변동성 군집과 꼬리위험을 보이고 겹치는 보유기간 수익률은 구성상 자기상관을 만들 수 있습니다
기업 패널에는 같은 기업 안의 지속성과 같은 날짜의 공통 충격이 함께 존재해 독립 관측 가정이 깨질 수 있습니다
시계열 수준변수의 추세, 생존편향, 동시적 가격발견과 측정오차는 유의한 계수를 경제적 기제로 오해하게 만들 수 있습니다
계수와 불확실성을 함께 보고합니다
추정대상, 표본, 단위, 변환, 통제변수, 고정효과, 결측 처리와 표준오차 방식을 먼저 밝힙니다
계수에는 표준오차나 신뢰구간을 붙이고 경제적 크기를 현실적 변화량으로 환산하며 이상치와 대안 규격에 대한 민감도를 확인합니다
R², 부호와 유의성보다 식별가정이 설득력 있는지, 시간과 표본 밖에서도 관계가 유지되는지를 별도로 평가해야 합니다
자주 묻는 질문
OLS 회귀계수는 무엇을 뜻하나요?
다른 포함 변수를 고정했을 때 한 설명변수의 한 단위 차이와 연결된 결과의 평균적 선형 차이를 뜻합니다
선형회귀에는 곡선 관계를 넣을 수 없나요?
넣을 수 있습니다. 매개변수에 선형이면 로그, 제곱항과 상호작용을 설명변수로 사용할 수 있습니다
다중공선성은 계수를 편향시키나요?
완전하지 않은 다중공선성은 그 자체로 편향을 만들기보다 계수의 표준오차와 표본 민감도를 키웁니다
강건 표준오차를 쓰면 OLS 가정 문제가 해결되나요?
아닙니다. 일부 분산 가정을 완화할 뿐 내생성, 잘못된 함수형태나 표본선택으로 생긴 계수 편향은 고치지 않습니다