Two-Scale 실현변동성: 미시구조 잡음이 있는 고빈도 자료의 분산 추정
서로 다른 간격의 가격 표본으로 독립 미시구조 잡음의 편향을 줄이는 two-scale 실현변동성의 원리와 가상 계산, 가정과 한계를 설명합니다
이 글에서 다루는 내용고빈도 관측을 늘릴수록 분산 추정이 나빠질 수 있는 이유
짧은 요약
Two-scale 실현변동성(TSRV)은 모든 관측치를 쓰는 촘촘한 추정치와 여러 개의 성긴 표본 격자에서 얻은 추정치를 결합합니다. 가산형 독립 잡음이라는 명시된 모형 아래에서는 촘촘한 격자의 값으로 성긴 격자의 잡음 편향을 추정해 빼는 방식입니다. 이 방법의 목표는 적분분산입니다. 잡음이 섞인 관측가격을 참가격으로 바꾸거나 다음 수익률을 예측하지는 않습니다.
고빈도 관측을 늘릴수록 분산 추정이 나빠질 수 있는 이유
실현분산은 흔히 수익률을 제곱해 더하는 방식으로 계산합니다. 관측 로그가격이 효율가격을 오차 없이 따라간다면 관측을 촘촘히 할수록 가격 경로를 더 자세히 포착할 수 있습니다. 하지만 실제 체결가격과 호가에는 bid–ask bounce, 가격 단위의 이산성, 지연, 그 밖의 시장 미시구조 효과도 섞여 있습니다. 아주 짧은 간격에서는 이런 효과가 두 관측 사이 효율가격의 움직임보다 클 수 있습니다.
그러면 관측 빈도를 높였다는 이유만으로 세션의 기초 적분분산이 변하지 않았는데도 단순 실현분산이 커질 수 있습니다. 이는 자산의 경제적 변동성이 반드시 증가했다는 뜻이 아닙니다. 잡음이 든 가격 차이를 제곱해 여러 번 합산한 결과일 수 있습니다. 일반적인 제곱 수익률의 합은 실현변동성 계산 안내에서 설명합니다. 이 글은 고빈도 편향의 한 원인을 보정하는 구체적인 방법을 다룹니다.
Zhang, Mykland, Aït-Sahalia가 두 표본 간격을 다룬 원 논문에서 제안한 two-scale 실현변동성은 서로 다른 두 해상도를 다른 목적으로 씁니다. 성긴 격자는 잡음이 섞인 증가분의 수를 줄입니다. 시작점을 달리한 성긴 격자들을 평균하면 하나의 임의적인 시작점에 의존하는 정도를 낮출 수 있습니다. 전체 촘촘한 격자는 빼줄 잡음 편향의 크기를 추정하는 데 사용합니다. 다만 이 논리는 가정과 유한 표본 선택에 의존하므로 결과는 불확실성을 지닌 추정량이지, 참 경로를 잡음 없이 복원한 관측값이 아닙니다.
효율 로그가격과 관측 잡음을 구분합니다
\(X_t\)를 잠재 효율 로그가격이라고 하고, 분석 구간에서 국소 분산율이 \(\sigma_t^2\)인 연속 과정으로 모형화하겠습니다. 관심 대상은 그 적분분산입니다.
\[ IV_T=\int_0^T\sigma_t^2\,dt. \]
관측 시점 \(t_i\)의 기록 로그가격을 다음처럼 둡니다.
\[ Y_{t_i}=X_{t_i}+\epsilon_{t_i}, \]
여기서 \(\epsilon_{t_i}\)는 관측 잡음입니다. 고전적 유도는 잡음이 평균 0이고, 관측 시점마다 서로 독립이며, 효율가격 과정과 독립이고, 분산 \(\omega^2\)가 일정하다는 기본 모형을 사용합니다. 또한 규칙적인 표본 격자와 구간 내 효율가격의 적절한 연속과정을 가정합니다. 이는 모형의 조건이지 모든 거래소 자료를 보편적으로 묘사하는 사실은 아닙니다.
관측 증가분은 \(\Delta Y_i=\Delta X_i+\epsilon_i-\epsilon_{i-1}\)입니다. 한 시점의 가격 오차는 인접한 두 수익률에 서로 반대 부호로 들어갑니다. 따라서 잡음이 있는 가격에서 계산한 수익률은 독립적인 측정 오차처럼 움직이지 않습니다. 잡음이 없을 때 제곱 증가분의 합이 경로 변동을 추정하는 이유는 금융에서 이차변동과 실현분산 안내에서 이어서 볼 수 있습니다.
여기서 목표는 정해진 시간 구간의 분산입니다. bid–ask spread 추정치, 예측값, 실현 거래비용과는 다른 양입니다. 체결가격의 다른 질문을 다룬다면 Roll bid–ask spread 추정량을 참고하세요. 여러 미시구조 방법이 고빈도 가격을 사용하더라도 추정하는 대상이 다르므로 처음에 목표를 구분해야 합니다.
모든 관측값을 합친 실현분산이 잡음에 지배되는 과정
촘촘한 격자의 수익률이 \(n\)개라면 전체 실현분산을 다음처럼 씁니다.
\[ RV_{\mathrm{all}}=\sum_{i=1}^{n}(Y_{t_i}-Y_{t_{i-1}})^2. \]
기본 모형에서 관측 수익률에 들어가는 잡음 성분은 \(\eta_i=\epsilon_i-\epsilon_{i-1}\)입니다. 그 분산은 \(\operatorname{Var}(\eta_i)=2\omega^2\)입니다. 독립성 가정 아래 기댓값이 0이 되는 교차항은 제외하면, 촘촘한 격자 합의 기댓값은 대략 다음과 같습니다.
\[ E[RV_{\mathrm{all}}]\approx IV_T+2n\omega^2. \]
첫 항은 원하는 적분분산이고, 둘째 항은 촘촘한 수익률마다 더해지는 잡음 기여분입니다. 표본 간격을 줄여 \(n\)이 늘면 잡음 항이 지배적일 수 있습니다. 이것이 잡음을 고려하지 않을 때 “가능한 한 자주 표본화하라”는 규칙이 안전하지 않은 핵심 이유입니다. Aït-Sahalia, Mykland, Zhang은 미시구조 잡음이 있을 때의 표본 빈도 문제를 분석하며 유한한 최적 표본 빈도가 생길 수 있음을 보였습니다.
이 근사는 모형 아래의 기댓값을 말합니다. 특정 표본에는 효율가격 증가분과 잡음 증가분 사이의 교차항도 무작위로 들어가므로 실제 계산값이 기댓값과 같을 필요는 없습니다. 장중 잡음 분산이 변하거나, 오차가 시계열적으로 의존하거나, 표본 간격이 불규칙하면 간단한 \(2n\omega^2\)가 편향을 나타내지 못할 수 있습니다. 그런 상황에서도 익숙한 공식을 적용하면 정밀해 보이지만 잘못된 보정 대상을 겨냥하는 숫자가 나올 수 있습니다.
하나의 임의 격자 대신 시작점을 바꾼 성긴 격자들을 평균합니다
정수 간격 \(K>1\)을 고릅니다. 각 오프셋 \(k=0,\ldots,K-1\)에 대해 관측 로그가격을 \(K\)개마다 하나씩 취하는 성긴 표본 실현분산을 계산합니다.
\[ RV_{K,k}=\sum_j\left(Y_{t_{k+jK}}-Y_{t_{k+(j-1)K}}\right)^2. \]
각 성긴 증가분은 더 긴 구간을 포함하지만, 격자는 대략 동일한 관측 구간 전체를 아우릅니다. 이용 가능한 오프셋을 평균합니다.
\[ \overline{RV}_K=\frac{1}{K}\sum_{k=0}^{K-1}RV_{K,k}. \]
오프셋이 중요합니다. 성긴 격자 하나만 쓰면 큰 움직임 직전이나 직후에 시작했는지에 따라 결과가 민감할 수 있습니다. 시작점을 옮긴 격자를 평균하면 이런 의존성이 줄어듭니다. 그렇다고 \(K\)개의 독립 자료가 생기는 것은 아닙니다. 각 격자는 같은 관측값을 다시 사용하므로 통계적으로 서로 의존합니다.
관측 잡음이 독립이고 분산이 일정하다면, 성긴 수익률 양 끝의 두 잡음값은 서로 다른 관측 시점에서 왔으므로 그 차이의 분산은 여전히 \(2\omega^2\)입니다. 다만 성긴 수익률은 촘촘한 수익률보다 적습니다. 따라서 평균 성긴 추정치에는 누적 잡음 편향이 덜 들어갑니다. 성긴 증가분은 구간 전체를 가로지르므로 신호 성분은 대략 같은 적분분산을 유지합니다.
이 글의 삽화는 개념도입니다. 들쭉날쭉한 관측 경로와 더 매끄러운 잠재 경로 주변에 놓인 여러 간격의 표본을 비교하며, 시장 자료나 실제 추정 결과를 나타내지 않습니다. 고가·저가를 이용한 추정량은 OHLC 범위 기반 변동성 추정량 안내에서 다룹니다.
<!-- learn:illustration --> <!-- Text-free concept: a jagged observed price path and shifted sparse sampling grids around a smoother latent path. Conceptual; no market data or estimator output. -->

촘촘한 실현분산을 비율에 맞춰 빼고 유한 표본을 정규화합니다
\(\bar n\)을 오프셋 격자마다 성긴 수익률이 평균적으로 몇 개인지 나타내는 수로 두고, \(\lambda=\bar n/n\)으로 정의합니다. 기본 모형 아래 평균 성긴 격자의 잡음 편향은 대략 \(2\bar n\omega^2\)입니다. 촘촘한 격자의 잡음 편향은 대략 \(2n\omega^2\)이므로, \(\lambda RV_{\mathrm{all}}\)에는 약 \(2\bar n\omega^2\)가 들어갑니다. 이를 빼면 주요 잡음 항이 상쇄됩니다.
\[ TSRV_{\mathrm{raw}}=\overline{RV}_K-\lambda RV_{\mathrm{all}}. \]
이 원시 차분은 각 실현분산 항에 포함된 신호의 일부도 함께 뺍니다. 흔히 쓰는 유한 표본 정규화는 다음과 같습니다.
\[ \widehat{IV}_{TSRV}=\frac{\overline{RV}_K-\lambda RV_{\mathrm{all}}}{1-\lambda}. \]
분모는 단순한 기댓값 계산에서 신호 계수를 복원합니다. 구현에 따라 끝점 처리와 표기법이 달라질 수 있으므로 \(n\)의 정의, 오프셋 집합, \(\bar n\)의 산식을 문서화해야 합니다. 이 보정이 표본오차를 없애거나 잘못 지정한 잡음 모형을 바로잡지는 않습니다. 고전적 점근 설정에서는 표본이 커질수록 \(\lambda\)가 작아지지만, 짧은 구간에서는 유한 표본 보정이 여전히 중요할 수 있습니다.
\(\overline{RV}_K<\lambda RV_{\mathrm{all}}\)이면 추정치가 음수가 될 수 있습니다. 이는 물리적 변동성이 음수라는 뜻이 아니라 유한 표본의 잡음 차감액이 성긴 추정치를 넘어섰다는 의미입니다. 후속 화면에서 0으로 바꾸는 편이 편리할 수는 있지만, 그 순간 추정량이 바뀌고 절단 규칙이 추가됩니다. 분석에서는 원래 값을 보존하고 선택한 척도와 가정을 점검하며, 이후 절단 규칙을 썼다면 명시해야 합니다.
가상의 수익률 6개로 계산을 단계별로 확인합니다
가상 로그가격 관측치 7개에서 다음의 촘촘한 수익률 6개가 나왔다고 합시다. 단위는 bp입니다: \([1,1,-1,-1,1,1]\) bp. 계산을 보여주려고 만든 작은 수열일 뿐 실제 거래소 자료가 아닙니다. 전체 촘촘한 실현분산은 다음과 같습니다.
\[ RV_{\mathrm{all}}=1^2+1^2+(-1)^2+(-1)^2+1^2+1^2=6\,\mathrm{bp}^2. \]
\(K=2\)로 둡니다. 첫 번째 오프셋은 이웃한 촘촘한 수익률을 묶어 성긴 수익률 \([2,-2,2]\) bp를 만들고, 제곱합은 \(4+4+4=12\,\mathrm{bp}^2\)입니다. 이동한 두 번째 오프셋에서는 \([0,0]\) bp가 나오므로 제곱합은 0입니다. 두 격자 추정치를 평균하면 \(\overline{RV}_K=(12+0)/2=6\,\mathrm{bp}^2\)입니다.
촘촘한 수익률은 6개이고, 두 오프셋의 성긴 수익률 수가 각각 3개와 2개이므로 평균 개수는 \(\bar n=(3+2)/2=2.5\)입니다. 따라서 \(\lambda=2.5/6=5/12\)이고,
\[ \widehat{IV}_{TSRV}=\frac{6-(5/12)6}{1-5/12}=\frac{3.5}{7/12}=6\,\mathrm{bp}^2. \]
분산 추정치는 \(6\,\mathrm{bp}^2=6\times10^{-8}\)의 십진 수익률 제곱 단위입니다. 제곱근은 이 가상 구간 기준 약 \(2.45\) bp이며 연율화하지 않았습니다. 작은 예시에서 촘촘한 RV와 값이 같다고 해서 TSRV가 항상 같다는 뜻은 아닙니다. 다른 가격 경로에서는 더 크거나 작거나, 심지어 음수 추정치가 나올 수 있습니다.
이 계산은 모형의 한계도 보여줍니다. 잠재 경로와 잡음이 따로 관측되지 않았으므로, 이 표본만으로 (6\,\mathrm{bp}^2)가 실제 적분분산과 같다고 확인할 수 없습니다. 합계, 척도, 단위는 검산할 수 있지만 숨은 분해를 예시만으로 알아낼 수는 없습니다. 고빈도 잡음 보정의 다른 계열인 realized-kernel 방법도 실증 문헌에서 다루지만, 각 추정량에는 자체적인 가정과 구현 선택이 있습니다.
두 표본 간격이 추정하는 양과 K 선택
간격 \(K\)는 성긴 수익률의 개수와 평균·잡음 보정 사이의 균형을 조절합니다. \(K\)가 너무 작으면 짧은 증가분이 많이 남아 잡음에 민감할 수 있습니다. 반대로 너무 크면 성긴 수익률이 몇 개 남지 않아 성긴 추정치가 불안정하고 유한 구간 효과가 커질 수 있습니다. 오프셋 평균은 격자 정렬 문제를 완화하지만 짧거나 품질이 낮은 표본에 없는 정보를 만들어주지는 않습니다.
원 논문의 점근 분석에서 최적 성긴 간격은 표본 크기가 커질수록 증가합니다. 해당 논문의 표기와 기본 조건에서는 \(n^{2/3}\) 차수입니다. 이것은 이론적 증가율이지, 보편적으로 몇 초나 몇 개 관측값을 사용하라는 지시가 아닙니다. 최적값은 잡음과 신호의 비율 및 가정에 달려 있고, 후속 연구와 실무 구현에서는 다른 조율 규칙과 끝점 관례를 쓸 수 있습니다. 표본 간격, \(K\), 오프셋, 세션 경계, 유한 표본 정규화를 기록해야 다른 분석자가 재현할 수 있습니다.
방어 가능한 분석은 미리 정한 합리적인 \(K\) 후보들에서 민감도를 비교하고, 가장 보기 좋은 결과를 주는 설정을 사후에 고르는 대신 그 차이를 보여줄 수 있습니다. 추정값이 크게 달라진다면 불안정성 자체가 결과의 일부입니다. 척도는 분석 자료 설계와 사전에 문서화한 규칙에 따라 선택해야 하며, 원하는 변동성 수치를 찾은 다음 조정하면 안 됩니다. 더 성긴 실현분산이나 잡음 강건 대안을 함께 비교할 수 있지만 각 수치는 서로 다른 측정량으로 구분해 표기해야 합니다.
고전적인 TSRV의 가정이 맞지 않는 경우
고전적 보정은 특정한 잡음 구조를 전제로 유도됩니다. Bid–ask bounce 등 미시구조 효과는 시계열적으로 의존하거나, 장중에 바뀌거나, 유동성에 따라 달라지거나, 효율가격 증가분과 상관될 수 있습니다. Hansen과 Lunde는 실현분산과 미시구조 잡음에 관한 연구에서 상호작용에 시간 의존성과 효율가격 변화와의 상관도 포함될 수 있음을 보입니다. Aït-Sahalia, Mykland, Zhang은 나중에 종속 미시구조 잡음을 위한 two-scale 방법을 개발했습니다. 이 확장은 수정 추정량과 원래의 독립 잡음 공식을 구분해야 한다는 뜻이지, 원식을 모든 의존성에 적용해도 된다는 뜻이 아닙니다.
그 밖의 실무 문제에는 불규칙한 관측 시각, 여러 자산의 비동기 표본, 오래된 호가, 가격 단위의 이산성, 점프, 잘못 입력된 체결, 시가·종가 효과, 결측 관측이 있습니다. 이런 문제는 촘촘한 격자의 보정항과 성긴 격자에 포함되는 수익률 모두에 영향을 줄 수 있습니다. 점프가 관심 대상인 이차변동에 포함되는지, 별도로 분리해야 하는지는 연구 질문에 달렸습니다. TSRV만으로 이 모형 선택을 결정할 수 없습니다. 관측치를 필터링하면 격자도 바뀌므로 그 과정 역시 기록해야 합니다.
잡음에 강건하다는 표현은 모든 데이터 문제에서 면역이라는 뜻이 아닙니다. 잠재 분산의 측정치라고 해석하기 전에 입력이 체결가격, 호가, 중간가격 중 무엇인지 정하고, 수익률 변환과 시간 기준을 쓰며, 관측 간격이 같은지 확인하고, 정제 및 거래 세션 규칙과 \(K\)에 대한 민감도를 점검해야 합니다. 잡음 과정이 기본 가정을 위반하면 해당 상황을 다루도록 설계된 방법을 사용하고 그 방법의 가정을 설명하세요. 음수 추정치를 음의 변동성이라고 부르거나 조용히 양수로 바꾸면 안 됩니다.
예측치처럼 제시하지 않고 추정량을 보고합니다
투명한 보고에는 목표 시간 구간, 입력 가격열, 표본 간격, 촘촘한 수익률 수, 성긴 간격 \(K\), 오프셋 집합, 끝점 규칙, 잡음 가정, 정규화, 단위, 절단 여부가 들어갑니다. 원시 차분과 정규화된 추정치를 모두 제시하고, 사전에 정한 척도 후보에 따른 민감도 범위를 함께 보일 수 있습니다. 이런 정보가 있어야 계산을 검증할 수 있고 분산 추정치가 호가, 미래 예측 또는 수익성 있는 거래 규칙의 증거로 오해되는 것을 막을 수 있습니다.
적분분산은 관측한 구간에서 측정한 값입니다. 이를 연율화하려면 시간 관례를 밝혀야 하며, 연율화 과정이 장중 패턴, 야간 구간, 거래 공백을 가리지 않게 해야 합니다. 제곱근을 취하면 해당 구간의 변동성 단위로 표현될 뿐 예측 기간이 새로 생기는 것은 아닙니다. 과거 실현 측정값은 모형의 입력 중 하나일 수 있지만, 예측 성능은 추정량 설정을 선택하는 데 사용하지 않은 자료에서 별도로 평가해야 합니다.
TSRV의 핵심 기여는 방법론에 있습니다. 명시적인 가산 잡음 모형 아래 두 표본 간격을 이용해, 단순 고빈도 실현분산을 비일치적으로 만드는 선도 잡음 편향을 줄입니다. 모든 가격 움직임의 원인을 밝혀주거나 모형 위험을 없애거나 다음 변동성이 얼마일지 말해주지는 않습니다. 숫자를 보고할 때 이 범위를 함께 밝혀야 합니다.
자주 묻는 질문
Q1TSRV는 모든 관측값을 사용하나요?
촘촘한 격자 실현분산에는 모든 관측값을 사용하고, 시작점이 다른 성긴 격자에도 관측값을 재사용합니다. 성긴 격자 하나하나는 표본 빈도가 낮습니다. 두 구성요소를 결합하는 방법이지 촘촘한 관측값을 버리거나 각 격자를 독립 표본으로 만드는 방법은 아닙니다.
Q2Two-scale 실현변동성은 변동성 예측치인가요?
아닙니다. 일반적인 목표는 관측 구간의 적분분산입니다. 제곱근을 취하면 그 구간에서의 변동성 단위로 표현되지만, 이후 기간을 예측하려면 별도 모형과 표본 외 평가가 필요합니다.
Q3음수 TSRV 추정치를 0으로 바꾸면 되나요?
변경 사실과 규칙을 밝히지 않은 채 바꾸면 안 됩니다. 비율 조정 촘촘한 격자 보정항이 성긴 추정치보다 클 때 유한 표본 값이 음수가 될 수 있습니다. 0으로 자르면 추정량이 달라지고 평균과 추론에도 영향을 줄 수 있으므로 원래 값을 보고하고 이후 처리 규칙을 별도로 밝혀야 합니다.
Q4원래 TSRV 공식은 모든 미시구조 잡음을 처리하나요?
아닙니다. 고전적 유도는 관측 오차가 서로 독립인 경우 등을 포함한 기본 잡음 모형을 사용합니다. 잡음이 시간에 따라 변하거나 시계열적으로 의존하거나, 불규칙 표본이거나, 잡음과 효율가격 변화가 의존한다면 다른 추정량이나 수정된 방법이 필요할 수 있습니다.
출처와 더 읽을 자료
내용 정정 제보
이 아티클 링크를 담은 이메일 초안을 준비합니다. 직접 보내야 Mark에 제보가 접수됩니다
QUICK CHECK
글을 다 읽었다면, 3문항으로 확인해보세요
Question 01
표본 간격을 매우 짧게 할 때 단순 실현분산이 커질 수 있는 이유는 무엇인가요?
정답을 고르면 바로 설명을 볼 수 있어요