MIDAS 회귀란? 혼합 빈도 데이터와 변동성 예측
MIDAS 회귀가 일별·주별 금융 데이터를 가중 시차로 결합하는 방법, 변동성 예측을 구성하는 과정, 혼합 빈도 모형의 한계를 설명합니다.
이 글에서 다루는 내용MIDAS는 관측 주기가 서로 다를 때 쓰입니다
짧은 요약
MIDAS(혼합 데이터 표본추출) 회귀는 모든 시계열을 억지로 한 빈도로 바꾸지 않고, 서로 다른 주기로 관측된 데이터를 연결합니다. 소수의 추정 모수로 고빈도 관측값의 과거에 가중치를 부여해 저빈도 금융 변수의 예측에 활용할 수 있습니다. 가중치가 나타내는 것은 정한 모형 안의 예측 패턴이며, 인과관계나 수익을 보장하는 거래 우위가 아닙니다.
MIDAS는 관측 주기가 서로 다를 때 쓰입니다
금융·경제 데이터는 하나의 공통된 시계에 맞춰 발표되지 않습니다. 예를 들어 변동성 목표값은 주별로 만들지만 후보 설명변수는 일별 수익률이나 장중 실현변동성일 수 있습니다. 거시경제 지표는 분기별인데 자산 가격은 거래일마다 관측되기도 합니다. 일반적인 회귀는 종속변수와 설명변수가 같은 빈도로 정렬된 행을 전제로 하므로, 익숙한 회귀식을 추정하기 전에 분석자가 이 서로 다른 달력을 어떻게 처리할지 결정해야 합니다.
한 방법은 일별 입력값을 주간 평균이나 합계로 바꾸는 것입니다. 간단하지만 매일 같은 가중치를 주는 선택을 강제할 수 있고, 주중 어느 시점에 움직임이 있었는지 사라질 수 있습니다. 다른 방법은 분기별 값을 여러 일별 행에 반복해서 넣거나 보간하는 것입니다. 값을 반복하면 천천히 변하는 지표가 마치 새 관측치를 많이 제공하는 것처럼 보일 수 있습니다. 보간은 실제로 관측하지 않은 매끄러운 경로를 만들어 낼 수 있습니다. 어느 방법도 새로운 정보를 만들어 주지는 않습니다.
MIDAS는 이 빈도 차이를 직접 연결하는 방법을 제공합니다. 종속변수는 자연스러운 저빈도 그대로 두고, 더 높은 빈도의 설명변수에 구조화된 시차항을 포함합니다. MIDAS라는 이름은 혼합 데이터 표본추출을 뜻하며, 특정 변동성 모형 하나를 지칭하지 않습니다. 변동성 예측뿐 아니라 종속변수보다 더 촘촘하게 관측되는 설명변수를 다루는 여러 분석에 적용됩니다. 핵심 질문은 최근 고빈도 이력 중 어느 정도를 사용할지, 그리고 그 시차 가중치를 어떻게 제한할지입니다.
가중 시차로 많은 관측치를 간결한 예측변수로 요약합니다
주별 다음 기간 실현분산처럼 주기가 낮은 목표를 \(y_{t+1}\)이라 하고, 주 \(t\)의 마지막 거래일을 예측 시점으로 둡니다. 그 시점보다 \(j\)거래일 앞서 관측한 일별 설명변수는 \(x_{t-j}\)로 씁니다. 단순한 MIDAS 회귀식은 \(y_{t+1}=a+b\sum_{j=1}^{K}w_j(\theta)x_{t-j}+u_{t+1}\)입니다. 여기서 \(K\)는 일별 시차 개수, \(w_j(\theta)\)는 소수의 모수로 정하는 가중치, \(u_{t+1}\)은 예측오차입니다.
가중치는 흔히 \(\sum_{j=1}^{K}w_j(\theta)=1\)이 되도록 정규화합니다. 그러면 가중합을 이력의 가중 요약으로 읽기 쉽고, 계수 \(b\)가 그 요약과 목표변수의 관계 크기를 조절합니다. 이 정규화가 일별 관측치들이 서로 독립적이거나 똑같이 유익하다는 뜻은 아닙니다. 시차 가중치의 모양을 표현하는 편리한 모수화입니다.
설명변수 \(x\)에는 일별 제곱수익률, 절댓값 수익률, 장중 수익률로 계산한 실현분산 또는 예측 시점에 이용할 수 있는 다른 변수를 넣을 수 있습니다. 목표 \(y\)는 미래 주간 분산, 월간 거시 지표 또는 더 낮은 빈도의 다른 변수일 수 있습니다. 목표의 정의에 따라 계수가 뜻하는 바가 달라집니다. 실현분산 대용치의 모형이 잠재적 순간분산이나 옵션 내재분산, 가격수익률까지 자동으로 모형화하는 것은 아닙니다.
MIDAS는 추정량 하나를 뜻하지 않고 회귀식의 틀을 가리킵니다. 응답변수를 수준, 로그 또는 연결함수를 사용해 모형화할 수 있고, 실제 추정은 정한 가중치 함수와 오차 가정에 따라 달라집니다. 비음수 분산 대용치를 선형회귀하면 제약을 두거나 목표를 변환하지 않는 한 음의 적합값이 나올 수 있습니다. 혼합 빈도 모형의 편의성이 목표변수의 범위나 단위를 확인할 필요까지 없애 주지는 않습니다.
가중치 함수는 유연성과 안정성 사이에서 절충합니다
제약 없는 분포시차 회귀는 일별 입력 \(K\)개마다 계수를 따로 추정합니다. 주별 목표 관측치에 비해 \(K\)가 크면 추정치가 불안정하고 서로 강하게 상관될 수 있습니다. MIDAS는 시차 계수를 저차원 함수로 정의합니다. 예를 들어 설명용 지수 Almon 가중치 함수는 \(w_j(\theta)=\frac{\exp(\theta_1j+\theta_2j^2)}{\sum_{\ell=1}^{K}\exp(\theta_1\ell+\theta_2\ell^2)}\)로 쓸 수 있습니다. 정규화된 베타 다항식 가중치도 흔히 사용됩니다.
이런 함수는 최근 거래일에 더 큰 비중을 두거나, 가중치를 완만하게 줄이거나, 시차창 중간 부분에 상대적으로 큰 비중을 주는 모양을 표현할 수 있습니다. 추정된 계수가 각 날짜의 중요성을 조건 없이 말해 주는 것은 아닙니다. 실제 반응은 정한 모수 함수의 모양을 따릅니다. 데이터가 짧게 지속되는 관계를 보여도 장기 감쇠를 강제하는 가중치 함수를 쓰면 그 제약이 추정치에 들어갑니다. 반대로 일별 계수를 너무 많이 추정하면 안정적인 동학보다 잡음을 따라갈 수 있습니다.
가중치 제약은 모형 가정입니다. 0 이상이고 합이 1인 가중치는 분산 예측을 가중 평균처럼 해석하기 쉽게 하지만, 시차별 양·음 효과가 서로 상쇄되는 구조를 허용하지 않습니다. 봉우리나 기울기 변화를 표현하는 유연한 함수는 더 많은 모수를 필요로 할 수 있으며, 표본이 짧으면 약하게 식별될 수 있습니다. 합리적인 소수의 가중치 형태를 비교하고, 허용한 시차 범위를 밝히며, 함수 선택에 따라 예측이 크게 바뀌는지 점검해야 합니다.
모든 자료에 맞는 \(K\)는 없습니다. 긴 시차창은 지속적인 정보를 잡을 수 있지만 더 많은 모수를 추가하거나 긴 모양을 강제할 수 있습니다. 짧은 창은 느린 변화를 놓칠 수 있습니다. 정보기준이나 검증용 표본으로 창을 고를 때에도 미래 평가 목표를 사용하지 않아야 합니다. 표본 안 적합도가 높다는 사실만으로 시차창이 반복 가능한 패턴을 포착했다고 결론 내릴 수는 없습니다.

예측 시점에 각 값이 알려졌는지 확인합니다
빈도 이름만 맞춘다고 유효한 예측 설계가 되는 것은 아닙니다. 다음 주 5거래일 동안의 분산을 주말 전에 예측한다고 해 보겠습니다. 예측 시점이 금요일 장 마감 직후라면 금요일까지 끝난 일별 자료는 입력에 포함할 수 있지만, 다음 주의 장중 수익률로 계산한 실현분산은 쓸 수 없습니다. 주별·월별 발표 통계는 그 값이 설명하는 기간이 끝난 뒤에도 발표가 늦어질 수 있습니다. 과거 시점의 예측에는 당시 실제로 이용 가능했던 값을 사용해야 하며, 나중에 수정되거나 뒤늦게 공개된 현재 데이터베이스 값으로 과거 입력을 채우면 안 됩니다.
추정 전에 예측 시점 표를 작성하세요. 언제 예측하는지, 설명변수별 허용 가능한 가장 늦은 시각은 언제인지, 목표기간은 언제인지, 목표값은 언제 관측 가능해지는지를 적습니다. 금융수익률은 종가 대 종가인지, 야간 구간을 포함하는지, 어느 거래소 세션을 하루로 정의하는지 밝혀야 합니다. 휴일이나 결측 봉이 일별 시차 개수를 어떻게 바꾸는지도 정해야 합니다. 거래일 다섯 번과 달력일 일주일은 같은 시간 간격이 아닙니다.
통계 발표 달력에는 빈 곳이 생깁니다. 특정 날짜에 한 설명변수는 새 일별 값이 있지만 다른 월별 시계열은 아직 발표되지 않았을 수 있습니다. 모형이 예측 시점에 알 수 있는 낡은 정보로 처리한다면 직전 월별 값을 유지하는 방식이 타당할 수 있습니다. 하지만 아직 공개되지 않은 값을 이후 발표치로 채우는 것은 타당하지 않습니다. 수정된 데이터는 더 미묘한 미래정보 누출을 만들 수 있습니다. 현재 데이터베이스의 거시계열이 실시간 예측자가 당시 볼 수 없던 사후 수정값을 담을 수 있기 때문입니다.
시장이 비동기적으로 닫히는 경우에도 정렬 문제가 생깁니다. 일별 주식 종가와 암호화폐 종가는 UTC 기준 서로 다른 구간을 가리킬 수 있습니다. 장중 변동성 측정에 예측 시각 이후 완료된 봉이 들어갈 수도 있습니다. 시간대 변환, 서머타임, 거래소 휴장, 봉 구성 방식은 모두 정보집합을 정의하는 일부입니다. 같은 날짜로 표기된 행이 같은 정보 마감 시각을 공유한다고 가정하지 말고 처리 방식을 적어 두세요.
가상의 예제로 일별 입력을 주별 예측으로 바꿉니다
목표는 다음 주 실현분산이고 예측은 금요일 장 마감에 한다고 하겠습니다. 모형은 방금 끝난 주의 일별 실현분산 다섯 개를 사용합니다. 가장 최근 값부터 과거 순서로 추정 가중치가 \(0.40,0.25,0.16,0.11,0.08\)이라고 합시다. 합은 1입니다. 해당 일별 입력은 수익률 제곱 단위로 \(0.0004,0.0001,0.0009,0.0004,0.0001\)입니다.
가중 과거값은 \(0.40(0.0004)+0.25(0.0001)+0.16(0.0009)+0.11(0.0004)+0.08(0.0001)=0.000381\)입니다. 이 가상 모형의 절편을 \(a=0.00012\), 기울기를 \(b=0.80\)이라고 두면 다음 주 분산 예측은 \(0.00012+0.80(0.000381)=0.0004248\)입니다. 표준편차 요약이 필요하다면 제곱근은 약 \(0.02061\), 즉 선택한 목표 정의 아래 주간 약 \(2.06\%\)입니다.
이 계산은 일별 설명변수를 미래 주별 목표에 연결하는 방법을 보여 주며, 수치와 추정 계수는 모두 가상입니다. 특정 날짜가 다음 주 분산을 일으켰다거나 자산 가격이 오르거나 내릴 가능성이 높다는 의미가 아닙니다. 최근 날짜에 부여한 가중치는 표본과 제약을 조건으로 해당 예측 모형이 관측 입력들을 어떻게 결합하는지를 말합니다. 인과반응의 추정치가 아닙니다.
예제는 단위도 확인하게 합니다. 일별 실현분산과 주별 실현분산은 모두 수익률 분산이지만 서로 다른 누적 기간을 가리킵니다. 기울기 \(b\), 절편, 목표 구성은 해당 기간 정의에 맞춰 추정한 것입니다. 일별 입력을 단순히 주별 분산으로 이름만 바꾸어서는 안 됩니다. 목표가 주별 분산 로그라면 예측값 단위는 로그 단위이며, 조건부 로그 분산의 평균을 지수화한 값이 조건부 분산의 평균과 일반적으로 같지 않습니다. 수준으로 되돌릴 때는 어떤 예측대상을 원하는지 명시하고, 필요한 경우 재변환 보정을 고려해야 합니다.
추정 방법은 목표와 시차 제약에 달려 있습니다
가중치가 고정되어 있으면 절편과 기울기에 대한 회귀는 선형입니다. 가중치가 미지의 비선형 모수 \(\theta\)에 따라 달라지면 비선형 최소제곱이나 관련 우도 기반 방법을 사용하는 경우가 많습니다. 추정 과정에서 가중치 모양 모수와 회귀계수를 함께 찾거나, 후보 가중치마다 선형 회귀계수를 먼저 최적화하는 프로파일 절차를 쓸 수 있습니다. 초기값, 모수 범위, 수렴 기준, 국소 최적해 수가 결과에 영향을 줄 수 있으므로 수렴 실패나 경계해를 숨기지 말아야 합니다.
목표 \(y\)가 비음수 변동성 측정값이면 일반 선형식이 표본 밖에서 음의 예측치를 낼 수 있습니다. 수준 예측이 비음수가 되도록 계수를 제한하거나, 양수값을 내는 연결함수를 쓰거나, 목표의 로그를 모형화할 수 있습니다. 방법을 바꾸면 추정대상과 예측 해석도 달라집니다. 로그 목표 모형에서 조건부 평균 로그 분산의 예측을 얻었다고 해서 조건부 분산의 평균까지 자동으로 얻는 것은 아닙니다. 오차분포와 재변환이 중요합니다.
표본 불확실성은 목표변수 구성에도 좌우됩니다. 장중 수익률로 만든 주별 실현분산은 측정오차가 있고, 미시구조 잡음, 표본 간격, 점프, 결측 관측의 영향을 받을 수 있습니다. 목표의 주간 구간이 겹치면 인접 예측 시점의 오차가 같은 수익률을 공유합니다. 그러면 예측오차가 독립이라는 가정 아래의 표준오차나 비교 검정이 적합하지 않을 수 있습니다. 예측 기간과 오차 의존성에 맞는 추론을 사용하고 목표의 측정 절차를 보고해야 합니다.
모수의 안정성도 문제입니다. 추정된 가중치 곡선은 추정표본 전체를 평균한 결과이므로 시장 구조가 달라졌다면 현재 국면을 잘 설명하지 못할 수 있습니다. 확장창은 더 많은 과거를 쓰지만 옛 동학을 계속 포함합니다. 이동창은 더 빠르게 적응하지만 관측치가 줄고 추정 잡음이 커집니다. 갱신 규칙을 사전에 정하고 시간순 평가에서 고정 기준 모형과 비교하세요.
MIDAS와 GARCH-MIDAS는 같은 모형이 아닙니다
MIDAS라는 용어는 서로 다른 빈도의 관측을 가중 시차로 결합하는 방법을 가리킵니다. MIDAS 회귀는 과거 일별·장중 측정치에서 미래 실현변동성 목표를 바로 예측할 수 있습니다. GARCH에서 사용하는 1기 조건부 분산 재귀식을 반드시 포함해야 하는 것은 아닙니다.
GARCH-MIDAS는 별도의 모형 계열입니다. 보통 저빈도 변수로 움직이는 느린 장기 변동성 성분과 재귀적으로 움직이는 단기 조건부분산 성분을 결합합니다. 두 성분에는 각자의 모수화와 가정이 있습니다. GARCH-MIDAS라는 이름을 쓴 논문이나 소프트웨어에서는 정확한 식을 확인해야 합니다. MIDAS 가중치가 장기 성분을 결정하고 GARCH 재귀식이 단기 충격을 다룰 수 있습니다. 이름만으로 목표가 무엇인지, 잠재분산인지 실현변동성인지, 양수 제약을 어떻게 처리하는지 알 수 없습니다.
초기 금융 MIDAS 변동성 연구는 간결한 예측 틀에서 서로 다른 설명변수, 빈도, 시차 길이를 비교했습니다. 이후 방법론 연구는 혼합 빈도 회귀의 추정·검정 성질과 기존 시간집계 방식과의 비교를 다룹니다. 이런 연구는 작동 원리를 뒷받침하지만, MIDAS가 항상 GARCH보다 잘 맞는다거나 고빈도 설명변수가 언제나 예측력을 높인다는 주장을 보장하지 않습니다. 결과는 자산, 표본, 목표, 설명변수, 예측 기간, 평가 설계에 달려 있습니다.
모형은 답하려는 질문에 맞춰 선택하세요. 일별 이력으로 미래 실현변동성 측정값을 예측하려면 직접 MIDAS 회귀를 후보에 둘 수 있습니다. 재귀적 조건부분산을 모형화하려면 적절한 GARCH 사양과 비교하세요. 분기별 거시 발표와 일별 금융 목표를 결합하려면 발표 시점별 자료 관리가 필요할 수 있습니다. 비슷한 이름을 가진 모형도 서로 다른 질문에 답할 수 있으므로 성능을 비교하기 전에 예측 시점, 목표 정의, 정보집합을 먼저 맞춰야 합니다.
측정오차와 모형 선택이 가중치 곡선을 압도할 수 있습니다
고빈도 자료는 시간 정보를 더 촘촘하게 제공하지만 측정 잡음도 키울 수 있습니다. 지나치게 짧은 봉에는 매수·매도 호가 왕복, 가격 단위의 불연속, 오래된 호가, 비동시 거래, 피드 오류가 담길 수 있습니다. 더 짧은 간격의 제곱수익률을 계속 합산한다고 더 나은 실현분산 측정치가 보장되지는 않습니다. 예측 성능을 확인하기 전에 표본 간격과 정제 규칙을 정하고 합리적인 대안에서 결과가 얼마나 바뀌는지 확인하세요.
학습 가능한 정보의 양을 제한하는 것은 겉으로 보이는 일별 입력 행 수가 아니라 저빈도 목표 관측치 수입니다. 일별 입력이 10년 쌓여도 주별 목표와 연결하면 결측치와 평가용 구간을 제외하기 전 약 500개의 주간 결과만 있습니다. 매일 별도 계수를 추정하는 방법보다 매끄러운 MIDAS 가중치 함수가 모수를 줄여 주지만, 표본이 짧거나 설명변수가 매우 지속적이거나 여러 시차가 비슷하면 함수 모양도 약하게 식별될 수 있습니다.
여러 분석 선택지를 시도하고 가장 좋은 것만 보고하면 선택편향이 생깁니다. 고빈도 측정치, 시차 길이, 가중치 함수, 변환, 시장, 예측 기간, 평가 손실을 여러 개 시험한 뒤 최고 결과만 고를 수 있습니다. 같은 목표로 모수와 모형을 골라 평가하는 표본 내 적합도는 특히 취약합니다. 시도한 모형군을 보존하고, 주 평가 지표를 정하며, 이후의 시간순 검증표본이나 선택 과정을 고려하는 비교법을 사용하세요. 같은 날짜의 예측을 여러 개 비교한다면 의존성과 다중비교를 반영해야 하며 각각을 독립적인 확인처럼 세면 안 됩니다.
추정된 가중치 곡선은 인과적 설명이 아닙니다. 고빈도 입력이 뉴스, 유동성 또는 시장 활동을 대리할 수 있고, 관측하지 못한 요인이 설명변수와 미래 변동성 모두를 움직일 수 있습니다. 예측력 주장은 일관된 시점 정렬과 표본 밖 증거로 뒷받침해야 합니다. 인과 해석에는 MIDAS 시차식만으로는 제공되지 않는 별도의 식별 설계와 가정이 필요합니다.
예측치는 수익성 있는 거래 결정을 알려주지 않습니다
변동성 예측은 위험예산, 헤지 규모 또는 시나리오 범위에 참고할 수 있지만 수익률의 부호나 포지션 방향을 정하지 않습니다. 주간 표준편차 예측 \(2.06\%\)는 약속된 가격 움직임도, 최대손실도, 옵션 내재변동성 호가도 아닙니다. 적합한 표본과 모형 아래 선택한 산포 측정값에 관한 예측일 뿐 실제 수익률은 훨씬 크거나 작을 수 있습니다.
전략을 평가한다면 신호 시각, 주문 시각, 상품, 노출 규칙, 청산 조건을 테스트 전에 정하세요. 과거 각 예측 시점에서 그 당시 이용할 수 있었던 정보만으로 MIDAS 모수를 다시 추정해야 합니다. 사전에 정한 기준 모형과 목표에 맞는 손실함수로 예측치를 비교한 뒤, 스프레드, 수수료, 펀딩, 차입, 시장충격, 회전율을 포함해 손익을 별도로 시뮬레이션하세요. 변동성 예측 오차가 통계적으로 개선돼도 비용 차감 후 수익이 좋아지지 않을 수 있습니다.
보고서에는 목표변수와 측정 절차, 설명변수 정의와 단위, 저빈도·고빈도, 예측 시점, 시차 수, 가중치 함수와 제약, 추정창과 갱신 일정, 결측치·자료 빈티지 처리, 손실함수, 기준 모형, 시간순 테스트 날짜를 포함하세요. 가중치 선택에 따라 결과가 크게 바뀐다면 예측 불확실성이나 민감도도 보여 주세요. 배경 개념은 실현변동성 가이드, 변동성 군집과 GARCH 가이드, 예측 정확도 비교 가이드에서 이어서 볼 수 있습니다.
주요 1차 연구 자료는 Ghysels, Santa-Clara, Valkanov의 MIDAS 변동성 예측 연구, Ghysels, Sinko, Valkanov의 방법론 검토와 확장, Andreou, Ghysels, Kourtellos의 혼합 빈도 회귀모형 분석입니다. 해당 실증 결과는 논문에서 분석한 표본과 설계에 한정됩니다. 현재 시장이나 다른 자산군에서 같은 성능을 보장하지 않습니다.
자주 묻는 질문
Q1MIDAS는 모든 자료를 한 빈도로 평균한다는 뜻인가요?
아닙니다. MIDAS 회귀는 목표변수를 정한 빈도로 유지하고, 더 높은 빈도의 설명변수에 구조화된 가중 시차를 사용합니다. 모든 시계열을 행 단위의 하나의 달력에 보간할 필요가 없습니다.
Q2MIDAS 회귀와 GARCH-MIDAS는 같은가요?
다릅니다. MIDAS는 혼합 빈도 가중시차 틀입니다. GARCH-MIDAS는 MIDAS 방식의 장기 성분과 단기 GARCH 분산 재귀식을 결합합니다. 정확한 목표와 성분은 모형식을 확인해야 합니다.
Q3MIDAS 변동성 예측이 더 정확하면 거래 신호로 써도 되나요?
그 결과만으로는 부족합니다. 변동성 예측은 선택한 산포 측정값을 설명합니다. 거래전략에는 별도의 방향 또는 위험 규칙, 현실적인 체결비용, 시간순 비용 차감 평가가 필요합니다.
출처와 더 읽을 자료
내용 정정 제보
이 아티클 링크를 담은 이메일 초안을 준비합니다. 직접 보내야 Mark에 제보가 접수됩니다
QUICK CHECK
글을 다 읽었다면, 3문항으로 확인해보세요
Question 01
MIDAS 가중치 함수의 주된 역할은 무엇인가요?
정답을 고르면 바로 설명을 볼 수 있어요