허스트 지수와 R/S 분석: 장기기억 추정과 퀀트 트레이딩의 한계
R/S 분석으로 허스트 지수를 추정하는 절차와 가상 수치 예제를 살펴보고, 지속성이 수익성 있는 매매 신호를 뜻하지 않는 이유를 설명합니다.
이 글에서 다루는 내용허스트 지수는 다음 가격이 아니라 스케일 변화를 설명합니다
짧은 요약
허스트 지수는 관측 구간이 길어질 때 R/S 같은 통계량이 얼마나 커지는지 요약합니다. 특정한 스케일 모형 아래에서는 0.5보다 큰 값이 지속성을, 작은 값이 반지속성을 시사할 수 있습니다. 추정치 하나만으로 가격 예측 가능성이나 전략 수익성을 입증할 수 없고, 관측된 패턴이 실제 장기기억이라고 단정할 수도 없습니다.
허스트 지수는 다음 가격이 아니라 스케일 변화를 설명합니다
허스트 지수 \(H\)는 시간 구간과 그 구간에서 측정한 변동 크기의 관계를 나타내는 기울기입니다. R/S 분석에서는 누적 편차의 범위를 자료의 표준편차로 나눕니다. 블록 길이 \(n\)에 따른 평균 비율이 대략 \(n^H\)에 비례하면, 로그-로그 관계의 기울기로 \(H\)를 추정합니다. 이 계수는 매수·매도 지표로 만들어진 것이 아닙니다. H. E. Hurst가 강의 흐름이 변할 때 저수지가 필요한 저장량을 연구하면서 사용한 범위 계산에서 나왔습니다. 원 논문인 「저수지의 장기 저장 용량」은 연간 유량에서 평균을 뺀 값들을 누적해 범위를 구하는 방법을 설명합니다.
‘지속성’, ‘반지속성’, ‘무작위적’이라는 해석은 어떤 시계열에 어떤 스케일 가정을 적용하는지에 따라 달라집니다. 정상 증가분을 다루는 흔한 기준 모형에서는 \(H=0.5\)가 시간 제곱근에 따른 변동 크기를 나타냅니다. 이 기준에서 \(H>0.5\)는 같은 방향의 증가분이 지속되는 관계와, \(H<0.5\)는 반대 방향으로 되돌리는 관계와 부합합니다. 이는 분석한 시계열의 여러 시간 구간에 걸친 의존성에 관한 설명입니다. 다음 수익률의 부호가 어느 쪽일지 알려주는 확률은 아닙니다.
입력 자료를 무엇으로 두느냐에 따라 질문 자체가 바뀝니다. 원수익률, 절대수익률, 제곱수익률, 가격 수준, 누적수익률에 적용한 결과는 서로 바꾸어 해석할 수 없습니다. 수익률의 방향 의존성은 약해도 절대수익률에는 변동성 군집이 남을 수 있습니다. 추세가 있거나 적분된 가격 수준에서 나타난 스케일링은 정상 수익률의 장기기억과 다른 원인일 수 있습니다. \(H\)를 보고할 때는 변수, 관측 빈도, 사용한 스케일 범위를 함께 밝혀야 합니다.
R/S 분석은 각 블록을 스케일 통계량으로 바꿉니다
길이가 \(n\)인 블록의 관측값을 \(x_1,\ldots,x_n\), 블록 평균을 \(\bar{x}_n\)이라고 하겠습니다. 각 값에서 평균을 뺀 뒤 차례로 더해 누적 경로를 만듭니다.
\[ Y_{k,n}=\sum_{t=1}^{k}(x_t-\bar{x}_n), \qquad k=1,\ldots,n. \]
중심화한 관측값의 합은 블록 끝에서 0이 되지만, 그 전에 누적 경로가 오르내릴 수 있습니다. 경로의 최댓값에서 최솟값을 빼면 범위 \(R_n\)을 얻습니다.
\[ R_n=\max_{1\leq k\leq n}Y_{k,n}-\min_{1\leq k\leq n}Y_{k,n}. \]
표준편차의 계산 관례도 정해야 합니다. 여기서는 분모로 \(n\)을 사용합니다.
\[ S_n=\sqrt{\frac{1}{n}\sum_{t=1}^{n}(x_t-\bar{x}_n)^2}, \qquad Q_n=\frac{R_n}{S_n}. \]
\(Q_n\)은 누적 범위를 블록 안의 일반적인 변동 크기 단위로 나타냅니다. 모든 관측값이 같은 블록은 \(S_n=0\)이라 비율을 정의할 수 없습니다. 이를 임의로 0 기여도로 처리해서는 안 됩니다. 실제 분석에서는 정한 길이마다 연속 블록을 만들고 계산 가능한 블록의 비율을 평균한 다음, 여러 블록 길이에 같은 절차를 적용합니다. Mandelbrot와 Wallis는 1969년 논문에서 다양한 비정규분포와 의존 구조를 모의해 R/S의 성질을 살폈습니다. 그 연구로 R/S가 스케일을 보는 방법으로 널리 쓰였지만, 모든 모형 오류에 영향을 받지 않는 절차가 된 것은 아닙니다.
선택한 구간에서 평균 블록 통계량이 \(\overline{Q}_n\approx Cn^H\)로 움직인다면 양변에 로그를 취해 다음처럼 나타낼 수 있습니다.
\[ \log \overline{Q}_n=\log C+H\log n+\varepsilon_n. \]
\(\log n\)에 대한 \(\log\overline{Q}_n\)의 회귀 기울기가 \(H\)의 추정치입니다. 좁거나 결과를 본 뒤 고른 구간에서 직선처럼 보인다는 사실만으로는 근거가 약합니다. 실제로 스케일이 안정적이지 않은 짧은 표본도 몇 점만 그리면 직선처럼 보일 수 있고, 같은 자료의 구간별 기울기가 서로 다를 수도 있습니다.

가상 자료로 범위와 표준편차를 계산합니다
가상 수익률 여덟 개를 임의의 베이시스포인트 단위로 \(3,1,0,-1,2,0,-2,-3\)이라고 하겠습니다. 전체 평균은 0입니다. 블록 길이별로 겹치지 않는 연속 블록을 만들고 각 블록의 \(R_n/S_n\)을 구한 뒤 평균합니다. 여기서는 분모 \(n\)을 쓰는 모표준편차 방식으로 계산합니다. 표본 표준편차를 선택하면 숫자는 조금 달라집니다.
\(n=2\)에서는 네 쌍의 범위 대 표준편차가 모두 1이므로 평균도 1입니다. \(n=4\)에서는 두 블록의 \((R,S)\)가 약 \((2.500,1.479)\), \((3.500,1.920)\)입니다. 각 비율은 약 1.690, 1.823이며 평균은 1.756입니다. \(n=8\)에서는 중심화 누적 경로가 \(3,4,4,3,5,5,3,0\)입니다. 범위는 5, 표준편차는 \(\sqrt{3.5}\approx1.871\), R/S는 약 2.673입니다.
| 블록 길이 \(n\) | 평균 R/S |
|---|---|
| 2 | 1.000 |
| 4 | 1.756 |
| 8 | 2.673 |
세 점의 로그 스케일 간격이 같으므로 최소제곱 기울기는 양 끝 점으로 구한 기울기와 같습니다.
\[ \widehat{H}=\frac{\log(2.673)-\log(1.000)}{\log(8)-\log(2)}\approx0.709. \]
이 값은 직접 계산을 확인할 수 있는 여덟 개의 가상 수치에서 나온 예시일 뿐, 장기기억이 있다고 믿을 만한 증거는 아닙니다. 관측값 하나에도 추정치가 크게 달라질 수 있고, 스케일은 세 개뿐이며, 불확실성 구간도 없습니다. 관측 수를 늘려도 구조 변화가 들어 있거나 결과에 맞춰 스케일을 골랐다면 문제가 자동으로 사라지지 않습니다.
<!-- 삽화 위치: 이 절 뒤. 중심화한 관측값이 짧은 블록과 긴 블록의 누적 범위로 만들어지는 개념을 글자 없이 표현합니다. 축·라벨·수치 주장은 넣지 않습니다. -->
0.5 근처의 추정치는 모형과 불확실성 안에서 읽습니다
분산이 유한하고 단기 의존성만 있는 정상 시계열에서는 여러 장기 스케일 결과가 \(0.5\)에 가까운 지수로 이어집니다. 분수 가우스 잡음과 같은 모형에서 \(H>0.5\)는 양의 장기 의존성과 부합합니다. 한 번 양의 편차가 나오면 기준 모형보다 같은 방향의 편차가 이어질 가능성이 높고 상관관계가 느리게 감소하는 상황을 뜻할 수 있습니다. \(H<0.5\)는 반지속성, 즉 되돌림이나 반대 부호의 의존성이 스케일 관계에 더 강하게 나타나는 상황과 관련됩니다.
다만 ‘해당 모형 아래에서’라는 전제가 중요합니다. 보통의 R/S 기울기는 추정치이지, 하나로 정해진 경제적 원인을 검정하는 값이 아닙니다. 작은 표본 편향은 결과를 \(0.5\)에서 멀어지게 할 수 있으며, 겹치는 블록, 표준편차 분모 관례, 회귀에 넣은 양 끝 스케일, 자기상관도 추정에 영향을 줍니다. 신뢰구간이 \(0.5\)를 포함한다고 독립성이 입증되는 것은 아니고, 포함하지 않는다고 안정적인 장기기억 모형이 자료를 만들었다고 입증되는 것도 아닙니다.
\(H=0.7\)을 ‘추세가 이어질 확률이 70%’, ‘수익률이 70일간 지속’, ‘승률 70%’로 바꾸어 읽지 마세요. \(H\)는 확률이나 보유 기간을 뜻하는 값이 아니라 추정한 스케일 관계의 지수입니다. 의존성을 주장하려면 적용한 모형과 불확실성을 살피고 단기 상관관계, 조건부 이분산성, 결정론적 추세, 국면 변화 같은 대안과 비교해야 합니다.
단기 자기상관과 변동성 군집도 지속성처럼 보일 수 있습니다
고전적 R/S 통계량은 진짜 장기기억만을 구분하지 않습니다. 단기 AR 패턴만 있어도 같은 부호의 편차가 가까이 모여 누적 범위가 커질 수 있습니다. Lo는 단기 시계열 상관이 고전적 통계량을 위쪽으로 치우치게 해, 단기 의존 과정이 지속적으로 보일 수 있다고 보였습니다. Lo의 수정 R/S는 단기 의존성을 반영해 장기기억을 검정하도록 제안됐습니다. 그가 살펴본 주가지수 수익률에서는 단기 자기상관을 고려한 뒤 장기기억의 증거가 사라졌지만, 이는 해당 표본과 검정의 결과이지 모든 자산이나 이후 시기에 대한 결론은 아닙니다. 자세한 내용은 Lo의 1991년 논문을 참고하세요.
변동성 군집은 별도의 오해를 만듭니다. 수익률 부호는 양·음으로 번갈아도 수익률 크기가 한동안 크게 유지될 수 있습니다. 원수익률에 적용한 R/S는 부호가 있는 누적 편차를 묻지만, 절대수익률이나 제곱수익률에 적용하면 움직임 크기의 지속성을 묻습니다. \(|r_t|\)에서 높은 지수가 나와도 이는 위험 크기의 군집을 설명할 수 있을 뿐 가격 방향의 예측을 뜻하지 않습니다. 조건부 분산 의존성 진단은 ARCH LM 검정 안내에서 살펴볼 수 있습니다. 기간 간 수익률 의존성을 요약하는 또 다른 통계량은 분산비 안내에서 설명합니다.
두꺼운 꼬리와 이상치도 영향을 줍니다. Mandelbrot와 Wallis는 여러 비정규 모의 자료에서 R/S의 유용한 강건성을 관찰했지만, 한 번의 극단값이나 변동성 국면 변화, 잘못된 평균식까지 무해하다는 뜻은 아닙니다. 불편한 관측치를 익숙한 지수가 나올 때까지 제거하기보다 원자료와 정당화 가능한 대안 처리의 결과를 함께 보고해야 합니다.
추세와 단절, 스케일 선택은 장기기억을 흉내 낼 수 있습니다
각 블록에서 평균을 빼면 일정한 수준 차이는 조정되지만, 모든 추세나 변화를 제거하지는 않습니다. 완만한 추세, 한 번의 수준 이동, 표본 구성 변경, 변동성 단절은 누적 경로에 긴 편차를 만들 수 있습니다. 그러면 안정적인 장기기억 구조가 없어도 로그-로그 관계가 거듭제곱 법칙처럼 보일 수 있습니다. 구조적 단절이나 회귀선 변화를 묻는 문제는 별도이며 단절 시계열 회귀 안내에서 다룹니다.
스케일 선택은 모형의 일부입니다. 너무 짧은 블록은 국소 잡음과 미시구조에 민감하고, 너무 긴 블록은 계산에 쓸 수 있는 구간을 몇 개 남기지 못합니다. 겹치는 창을 쓰면 계산한 비율 수는 늘지만 독립적인 정보 조각이 같은 수만큼 생기는 것은 아닙니다. 짧은 스케일과 긴 스케일에서 기울기가 달라 보이는 교차점은 역학 변화, 단절, 계절성 또는 추정 잡음을 가리킬 수 있습니다. 설명 없이 한 개의 \(H\)로 뭉뚱그리지 마세요.
Lo의 수정 R/S는 분모에 장기분산 추정치를 사용합니다
Lo의 방법은 중심 누적 편차의 범위는 유지하면서, 보통의 블록 표준편차 대신 짧은 시차 자기공분산을 포함하는 장기분산 추정치로 분모를 바꿉니다. 흔히 쓰는 표기는 다음과 같습니다.
\[ Q_n^{\mathrm{Lo}}(q)=\frac{R_n}{\widehat{\sigma}_n(q)},\qquad \widehat{\sigma}_n^2(q)=\widehat{\gamma}_0+ 2\sum_{j=1}^{q}\left(1-\frac{j}{q+1}\right)\widehat{\gamma}_j. \]
\(\widehat{\gamma}_j\)는 \(j\)시차 표본 자기공분산이고, \(q\)는 잘라낼 시차를 정하는 대역폭입니다. 삼각 가중치는 최대 시차에 가까운 자기공분산에 더 작은 가중치를 줍니다. 수정 통계량은 그에 맞는 귀무분포와 비교해야 합니다. 고전적 R/S에서 단순히 더 나은 분모로 나눈 값이 아니며, 자동으로 보정된 허스트 지수로 읽을 수 없습니다.
대역폭은 어떤 단기 상관을 분산 추정에 넣을지 결정합니다. \(q\)가 너무 작으면 관련 단기 의존성을 충분히 반영하지 못할 수 있고, 너무 크면 추정치가 불안정해지거나 구분하려던 장기 패턴까지 흡수할 수 있습니다. 대역폭 선택 규칙, 관측 빈도, 검정통계량과 귀무가설, p값을 보고하고 사전에 정한 범위에서 민감도를 확인하세요. Lo의 연구가 보여준 핵심은 이 구분이 중요하다는 것입니다. 고전 R/S는 단기 의존에도 반응할 수 있고 수정 검정은 단기 약한 의존을 허용하는 더 넓은 귀무가설을 다룹니다.
DFA와 주파수 영역 추정은 서로 다른 방식으로 자료를 변환합니다
Detrended fluctuation analysis(DFA)는 먼저 평균을 뺀 관측값의 누적 경로를 만듭니다. 이 경로를 여러 길이의 구간으로 나누고, 각 구간에 저차 다항 추세를 맞춘 뒤 추세 주변 잔차의 제곱평균제곱근 변동 \(F(s)\)을 계산합니다. \(\log F(s)\)를 \(\log s\)에 회귀하면 스케일 기울기를 얻습니다. 구간별 다항 적합은 일부 다항 추세의 영향을 줄이지만, 차수와 구간 길이, 시계열 유형 선택은 여전히 중요합니다. DFA도 구조 변화, 변동성 변화, 결과를 보고 고른 스케일 구간에서 자유롭지 않습니다.
주파수 영역 방법은 주기도에서 낮은 주파수의 거동을 추정합니다. 특정 정상 장기기억 모형에서 0에 가까운 주파수의 파워가 \(f(\lambda)\propto|\lambda|^{-\beta}\)로 움직이면, 분수 잡음 형태의 수익률 과정에서 \(H=(\beta+1)/2\) 관계가 성립합니다. 낮은 주파수 대역을 어디까지 회귀에 포함하느냐에 따라 반영하는 관측치가 달라집니다. 계절 피크, 구조적 단절, 적은 수의 저주파 관측점이 기울기를 좌우할 수 있습니다. 가격 수준과 정상 증가분 중 어떤 자료에 적용했는지에 따라 주파수 매개변수와 \(H\)의 관계도 달라집니다.
이 방법들은 서로 다른 유한표본 특성을 가진 대안 추정량이지, 기본적으로 독립된 세 차례의 확인 절차는 아닙니다. Weron의 유한표본 비교 연구(DOI 10.1016/S0378-4371(02)00961-5)는 가우스 백색잡음 모의 자료에서 R/S, DFA, 주기도 회귀를 비교해 추정치와 신뢰구간이 방법 및 표본 길이에 따라 달라짐을 보였습니다. 이 결과가 DFA가 모든 금융자료에서 항상 우월하다는 뜻은 아닙니다. 실제 자료 생성 조건과 추정 절차에 맞춰 추론을 보정해야 한다는 점을 보여줍니다.
트레이딩 가설에는 비용을 뺀 표본 외 증거가 필요합니다
추정 지수는 과거 스케일 패턴을 묘사하거나 명확한 연구 가설을 만드는 데 쓸 수 있습니다. 하지만 진입·청산 규칙이나 예측 시점, 포지션 크기, 위험 한도를 정해주지 않습니다. 관측한 관계가 알려진 뒤에도 유지될 이유도 자동으로 제공하지 않습니다. 과거 \(H\) 추정치가 수익률을 예측하는지 알아보려면 예측 기간과 의사결정 시점을 미리 고정하고, 매 시점에 실제로 알 수 있었던 정보만 사용해야 합니다.
여러 관측 기간, 블록 크기, 자산, 수익률 변환, 추세 제거 차수와 임계값을 돌려 가장 높은 \(H\)만 고르면 다중 탐색입니다. 최종 후보는 그 자료에서 이미 선택의 이점을 얻었습니다. 실제로 시험한 후보군을 연구 기록에 포함하고, 보지 않은 자료나 시간 순서를 지키는 평가를 사용해 탐색의 영향을 고려하세요. 백테스트 과적합 확률 안내와 White의 Reality Check 안내는 이와 관련한 선택 문제를 설명합니다.
통계적 관계가 거래 후 순수익 우위와 같은 말은 아닙니다. 매수·매도 스프레드, 수수료, 슬리피지, 시장충격, 펀딩 또는 금융비용, 대차료, 회전율을 반영해 전략을 평가해야 합니다. 변동성의 지속성은 방향 예측력을 높이지 않고 위험과 낙폭만 키울 수 있습니다. 추정 불확실성을 보고하고 단기 의존 및 단절 대안과 비교하며, 최종 검증 전에 규칙을 고정하세요. 과거 진단 결과와 전략 성과는 구분해야 합니다.
재표본화도 의존성 구조에 맞게 설계해야 합니다. 수익률을 하나씩 독립 추출하는 iid 부트스트랩은 시간 순서를 깨뜨립니다. 블록 부트스트랩은 선택한 길이의 구간 안에서 인접 움직임을 유지하지만, 블록이 짧으면 느린 의존성을 놓칠 수 있고 길면 서로 구분되는 자료 조각이 줄어듭니다. 어느 쪽도 구조적 단절을 없애주지는 않습니다. 여러 스케일·기간·자산 중 자료에 맞는 대상을 골랐다면, 탐색을 반영한 불확실성을 구할 때 각 재표본에서도 그 선택 절차를 반복해야 합니다. 최종 선택된 지수 하나만 재표본하면 탐색으로 생긴 불확실성이 빠집니다.
자주 묻는 질문
Q1허스트 지수가 0.5보다 크면 무슨 뜻인가요?
흔한 정상 증가분 스케일 모형 아래에서 분석한 구간의 지속적 의존성과 부합할 수 있습니다. 다음 가격이 오를 확률이나 전략 승률을 뜻하지 않으며, 수익성 있는 신호를 증명하지도 않습니다.
Q2R/S 분석과 Lo의 수정 R/S 검정은 같은 방법인가요?
아닙니다. 고전 R/S는 누적 편차 범위를 블록 표준편차로 나눕니다. Lo의 수정 통계량은 단기 자기공분산을 가중해 포함한 장기분산 추정치를 사용하고 단기 의존성을 허용하는 귀무가설 아래 검정합니다.
Q3허스트 지수로 매매 전략을 고를 수 있나요?
연구 가설을 세우는 데 참고할 수 있지만, 지수만으로 진입·청산이나 포지션 크기를 정할 수는 없습니다. 사전에 고정한 규칙, 불확실성 및 대안 모형 검토, 표본 외 평가와 현실적인 체결 비용이 필요합니다.
출처와 더 읽을 자료
내용 정정 제보
이 아티클 링크를 담은 이메일 초안을 준비합니다. 직접 보내야 Mark에 제보가 접수됩니다
QUICK CHECK
글을 다 읽었다면, 3문항으로 확인해보세요
Question 01
로그 R/S와 로그 블록 길이의 관계에서 기울기가 추정하는 것은 무엇인가요?
정답을 고르면 바로 설명을 볼 수 있어요