정보기반 거래 확률(PIN): 공식, 계산 예시와 해석의 한계
매수·매도 체결 도착 횟수로 정보기반 거래를 추정하는 PIN 모형을 알아봅니다. 기본 공식과 계산 예시, 가정과 추정 한계를 설명합니다.
이 글에서 다루는 내용PIN은 정보기반으로 발생한 주문 흐름의 모형상 비중을 추정합니다
짧은 요약
정보기반 거래 확률(PIN)은 매수 주도와 매도 주도 체결이 발생한 횟수의 불균형을 이용하는 시장 미시구조 추정치입니다. 혼합 모형으로 정보에 따른 거래와 일반적인 유동성 수요를 구분하지만, 강한 가정과 신중한 최대우도 추정이 필요합니다. 특정 정보 보유자를 찾아내거나 다음 가격 움직임을 예측하지 않으며, 수익성 있는 신호를 입증하는 값도 아닙니다.
PIN은 정보기반으로 발생한 주문 흐름의 모형상 비중을 추정합니다
체결이 이루어지면 매수자와 매도자가 모두 있지만, 각자가 왜 거래했는지는 대개 관측되지 않습니다. 매수자는 사적 정보를 반영했을 수도 있고, 포트폴리오 비중을 조절하거나 현금 수요를 맞추거나 벤치마크에 맞추어 주문했을 수도 있습니다. PIN은 여러 기간에 걸쳐 매수 주도와 매도 주도 체결이 발생한 횟수를 이용해, 모형이 사적 정보에 따른 거래로 설명하는 주문 흐름의 비중을 추정합니다.
Easley, Kiefer, O’Hara, Paperman은 정보기반 거래와 유동성을 연구하는 구조적 접근을 제안했습니다. 이 모형에서 하루의 매수·매도 주문 횟수는 관측할 수 없는 정보 상태에서 발생한 결과입니다. 사적 정보가 없을 때는 정보가 없는 매수자와 매도자가 주문을 냅니다. 호재나 악재가 도착하면, 정보 보유 거래자가 신호 방향에 맞추어 추가 주문을 냅니다. 여러 날의 매수·매도 횟수에서 나타나는 비대칭을 이용해 숨은 상태의 확률과 주문 도착률을 추정합니다(Easley 외, 1996).
따라서 PIN은 특정 표본과 지정된 모형에 대한 추정치입니다. 개별 체결에 붙이는 표식이나 사적 정보를 보유한 사람의 직접적인 수가 아니며, 다음 거래가 정보기반일 확률도 아닙니다. 같은 정의와 가정 아래에서 추정값이 더 높다면, 적합된 모형이 더 낮은 추정값보다 예상 주문 도착 중 더 많은 부분을 정보 보유 거래자 성분에 배정했다는 뜻입니다.
모형은 정보가 도착했는지를 관측되지 않는 상태로 취급합니다
고전적인 PIN 모형은 각 거래 기간을 세 가지 숨은 상태 중 하나로 봅니다. 확률 1 − α로 정보 사건이 발생하지 않습니다. 확률 αδ로 호재가 발생하고 확률 α(1 − δ)로 악재가 발생합니다. α는 정보 사건이 발생할 확률이고, δ는 정보 사건이 발생했을 때 호재일 조건부 확률입니다.
정보가 없는 매수·매도 주문은 각각 기간당 기대 도착률 ε을 가집니다. 정보 사건이 발생하면 정보 보유 주문의 기대 도착률 μ가 더해집니다. 호재일에는 매수 주문, 악재일에는 매도 주문이 늘어나는 구조입니다. 가장 단순한 모형에서는 각 상태가 주어진 조건에서 매수와 매도의 횟수가 서로 독립인 포아송 확률변수라고 가정합니다. 실제 정보 상태나 거래자 유형을 관측하지 않기 때문에, 모형은 관측된 횟수의 패턴으로 모수를 추론합니다.
이는 모든 시장이 반드시 그렇다는 설명이 아니라 모형을 계산 가능하고 해석 가능하게 만드는 가정입니다. 주문 횟수의 군집, 상관된 유동성 수요, 서로 다른 발표 일정, 체결 방향 오분류, 거래소 분산이 모형에 반영되지 않으면 정보기반 주문 흐름으로 잘못 설명될 수 있습니다.
PIN 공식은 정보기반 주문과 정보가 없는 주문의 기대 횟수를 비교합니다
매수와 매도 주문이 균형을 이루는 고전적 모형에서 기간당 정보기반 주문의 기대 횟수는 αμ입니다. 정보가 없는 매수 주문의 기대 횟수는 ε, 매도의 기대 횟수도 ε이므로 둘을 합치면 2ε입니다. 따라서 PIN은 정보기반 주문 성분을 전체 기대 주문 횟수로 나눈 값입니다.
PIN = αμ / (αμ + 2ε)
정보 사건이 발생했을 때 호재일 확률인 δ는 정보 보유자의 주문이 어느 쪽으로 나오는지에 영향을 주지만, 이 전체 비중을 계산하면 식에서 상쇄됩니다. 매수와 매도 도착률을 더 유연하게 하거나 다른 주문 생성 과정을 허용하는 확장 모형도 있습니다. 고전식과 확장 모형의 공식·해석을 설명 없이 섞어서는 안 됩니다.
가상의 한 기간에 α = 0.20, 정보 사건이 있는 날 정보기반 주문의 기대 횟수 μ = 12, 각 방향의 정보가 없는 주문 도착률 ε = 40이라고 가정하겠습니다. 정보기반 주문은 0.20 × 12 = 2.4회가 기대됩니다. 정보가 없는 주문은 매수 40회와 매도 40회를 더해 80회입니다. 모형상 비중은 2.4 / (2.4 + 80) = 0.0291, 약 2.9%입니다.
이 예는 공식에 값을 넣는 방법만 보여줍니다. 관측한 체결 중 정확히 2.9%가 정보기반이었다거나, 특정 체결이 정보기반일 객관적 확률이 2.9%라거나, 누군가 미공개 정보를 가졌다는 뜻이 아닙니다. 예시의 도착률과 사건 확률은 가정한 값입니다. 실제 분석에서는 자료로 추정하고 표본 기간과 모형을 밝혀야 합니다.
PIN은 분자뿐 아니라 분모의 영향을 받습니다. α와 μ를 그대로 두고 정보가 없는 매수·매도 도착률만 각각 40에서 60으로 높이면 값은 2.4 / (2.4 + 120), 약 2.0%로 내려갑니다. 정보기반 주문의 기대 횟수는 바뀌지 않았지만, 정보가 없는 주문이 늘어 전체에서 차지하는 몫이 작아진 것입니다. 따라서 PIN 하락을 정보 도착 위험의 감소로 곧바로 읽어서는 안 됩니다. 추정 기간과 시장의 기본 거래량이 달라지면 무엇이 움직였는지 모수별로 살펴봐야 합니다.

최대우도법으로 매수·매도 횟수에서 숨은 모수를 추정합니다
각 기간 t에서 Bₜ는 매수 주도 체결 횟수, Sₜ는 매도 주도 체결 횟수라고 하겠습니다. 고전 모형에서 관측된 횟수의 가능도는 세 상태가 섞인 형태입니다. 정보가 없는 상태의 가중치는 1 − α이고 매수와 매도의 포아송 도착률은 모두 ε입니다. 호재 상태의 가중치는 αδ이며 매수 도착률은 ε + μ, 매도는 ε입니다. 악재 상태는 가중치가 α(1 − δ)이고 매수 도착률은 ε, 매도는 ε + μ입니다. 각 상태에서 해당하는 포아송 확률을 곱한 다음 상태 세 개의 값을 더하면 그 기간의 가능도를 얻습니다.
추정량은 표본 전체 기간의 로그 가능도 합을 가장 크게 하는 α, δ, μ, ε을 찾습니다. 추정된 모수로 PIN을 계산합니다. 단 하루의 매수·매도 횟수만으로는 혼합 구조에 관한 정보가 적기 때문에, 연구자는 분기 같은 기간의 자료를 모아 추정하는 경우가 많습니다. 이때 PIN은 해당 기간의 추정치입니다. 창을 길게 잡으면 횟수가 안정될 수 있지만 서로 다른 시장 상태를 평균내게 됩니다.
하루별 매수 횟수에서 매도 횟수를 뺀 뒤 평균을 내는 방식으로 PIN을 계산하지는 않습니다. 순매수 횟수만으로는 호재 상태인지, 매수·매도 양쪽에서 유동성 수요가 함께 늘어난 상태인지 구별할 수 없습니다. 최대우도법은 각 날짜의 매수와 매도 횟수가 세 가지 숨은 상태 중 어느 상태에서 나왔을 가능성이 큰지 전체 표본에서 함께 평가합니다. 추정 기간이 지나치게 짧으면 이 혼합을 식별하기 어렵고, 반대로 너무 길면 서로 다른 거래 환경을 하나의 고정된 도착률로 설명해야 합니다.
최적화는 단순한 계산 절차에 그치지 않습니다. 가능도에 여러 국소 최대점이 있을 수 있고, 추정 모수가 경계에 걸릴 수 있으며, 체결 횟수가 클 때 계산 구현에서 부동소수점 언더플로 또는 오버플로가 발생할 수도 있습니다. Yan과 Zhang은 경계해가 PIN 추정값에 상당한 편향을 일으킬 수 있음을 보이고 이를 개선하는 방법을 제안했습니다(Yan·Zhang, 2012). 안정적인 가능도 계산, 타당한 여러 초기값, 모형과 일치하는 모수 제약, 최적해 재현 여부를 보여주는 진단이 필요합니다.
체결 방향과 표본 정의도 추정값을 바꿉니다
고전 모형에는 매수 주도와 매도 주도 횟수가 필요합니다. 데이터 피드에 공격자 방향 필드가 없다면 호가 규칙, 틱 테스트, Lee–Ready 방식으로 체결 방향을 분류할 수 있습니다. 오분류된 체결은 Bₜ와 Sₜ 사이에 관측치를 옮겨 가능도를 바꿉니다. 따라서 분류 방법, 중간값 및 미분류 체결 처리, 거래소 범위와 시각 정렬을 추정 기록에 남겨야 합니다. 체결 방향 분류 안내는 호가와 자료 피드에 따라 추정 부호가 달라질 수 있는 이유를 설명합니다.
연구자는 기간, 금융상품, 포함할 체결 조건, 경매·정정·장외 보고 및 체결이 없는 기간의 처리 방식도 정해야 합니다. 거래소 여러 곳의 자료를 합치면 한 곳만 분석했을 때와 다른 횟수 과정이 생길 수 있습니다. 기간을 하루에서 장중 구간으로 바꾸면 도착률의 의미도 바뀌고 안정적인 추정에 필요한 관측치가 부족해질 수 있습니다. 자료 구축, 추정창, 추정기, 모형 버전이 충분히 일치해야 자산이나 시점 간 PIN을 비교할 수 있습니다.
어려운 관측치를 조용히 빼거나 원하는 범위로 보이는 추정값만 선택해 보고해서는 안 됩니다. 원래 횟수를 보존하고 제외 기준, 모수값과 경계해 발생 여부를 기록하세요. 합리적인 체결 분류 방식과 기간 설정을 바꾸어 결과를 비교할 수도 있습니다. 값이 크게 움직인다면 그 민감도도 결과의 일부이며 숨길 잡음이 아닙니다.
PIN과 다른 유동성 지표는 측정 대상이 다릅니다
공시 또는 유효 매수·매도 스프레드는 거래 가격의 양보 폭이나 체결 비용을 측정합니다. PIN은 구조 모형에서 예상 주문 도착 중 정보 보유 성분으로 귀속되는 몫을 추정합니다. 넓은 스프레드는 역선택 위험, 재고 비용, 수수료 또는 경쟁 정도와 관련될 수 있지만 그 자체가 PIN 값은 아닙니다. Roll 스프레드 추정법은 별도의 가정 아래 수익률 자기공분산으로 스프레드를 추정합니다.
오더 플로우 불균형은 매수·매도 활동의 차이를 요약하고 지정가 주문 추가와 취소를 함께 반영하기도 합니다. 이는 선택한 구간에서 관측되는 값인 반면 PIN은 반복된 체결 횟수에서 숨은 뉴스 과정을 가능도로 추론합니다. 유동성 수요나 나누어 집행한 주문도 비슷한 방향성 불균형을 만들 수 있으므로 불균형이 정보기반 거래의 증거는 아닙니다. 오더 플로우 불균형은 다른 지표의 구성 방식을 설명합니다.
VPIN도 더 자주 계산한 PIN 정도로 볼 수 없습니다. 거래량을 기준으로 나눈 구간에서 불균형을 계산하는 별도의 거래량 시계 지표이며 체결 방향 분류와 표본화 방식이 다릅니다. Andersen과 Bondarenko는 자신들이 검증한 환경에서 VPIN이 독성 주문 흐름을 안정적으로 측정하거나 시장 혼란을 알린다는 주장에 이의를 제기했습니다(Andersen·Bondarenko, 2014). 이름이 비슷하다는 이유로 지표의 구성과 근거를 같게 취급해서는 안 됩니다.
추정값에는 적합도와 안정성 점검이 필요합니다
PIN 값이 추정되었다고 해서 체결 횟수 모형이 자료에 잘 맞는다는 뜻은 아닙니다. Gan, Wei, Johnstone은 PIN 모형의 경험적 적합도를 검정하고, 분석한 분포와 의존 구조에서 구조적 한계를 보고했습니다(Gan 외, 2017). 이 결과는 실제 표본의 적합도를 확인해야 한다는 근거이지 모든 응용이 잘못됐다는 주장은 아닙니다.
매수·매도 횟수의 분포와 상관, 체결이 없는 기간의 빈도, 모형이 예측하는 횟수 확률, 최적화 수렴 여부와 경계해 발생 여부를 진단할 수 있습니다. 시뮬레이션 또는 적합된 횟수 분포를 관측 자료와 비교하고, 인접한 추정창에서도 모수가 타당한지 확인하세요. 표준오차나 신뢰구간은 사용한 추정법을 반영해야 합니다. 점 추정치 하나만 보면 표본 변동과 모형 선택에서 오는 불확실성을 놓칩니다.
인접 기간의 PIN이 안정적이어도 모형이 올바르다고 증명할 수는 없습니다. 반대로 값이 변한다면 정보 도착, 정보가 없는 거래 수요, 자료 범위가 실제로 바뀌었을 수도 있고 모형이 잘못 맞았을 수도 있습니다. 시장 의미를 부여하기 전에 점검에서 확인한 내용과 한계를 함께 제시해야 합니다.
기간과 적합 과정을 밝혀야 PIN 추정값을 재현할 수 있습니다
측정 기록이 없으면 PIN 수치의 의미를 판단하기 어렵습니다. 종목이나 분석 대상, 거래소 범위, 표본 날짜, 관측 구간과 시간대, 포함한 체결 조건, 매수·매도 주도 방향을 분류한 절차를 명시하세요. 고전적인 세 상태 모형인지 확장형인지 밝히고 적합한 α, δ, μ, ε를 PIN과 함께 보고해야 합니다.
추정 창, 우도 함수 구현, 최적화 방법과 초기값 전략도 설명하세요. 수렴 여부, 경계해, 불확실성 추정치, 적합도를 점검한 방법을 보고합니다. 경매 체결, 정정 체결, 거래가 없는 구간, 방향을 분류할 수 없는 체결을 제외하거나 별도로 처리했다면 그 방식도 밝혀야 합니다. 이런 정보가 있어야 독자는 견고한 패턴과 특정 자료 처리나 최적화 선택에 좌우된 결과를 구분할 수 있습니다.
관측 구간은 특히 중요합니다. α는 구간당 정보 사건 확률이고 μ와 ε는 구간당 주문 도착률입니다. 일별 횟수를 시간별 횟수로 바꾸면 단위와 기저가 되는 사건 과정도 달라집니다. PIN 공식의 모양이 같더라도 서로 다른 구간 길이에서 추정된 모수는 바로 비교할 수 없습니다. 자산이나 날짜를 비교하기 전에 구간 정의와 체결 구성을 맞추세요. 적합된 도착률의 변화는 곧바로 정보기반 거래의 변화라고 단정하지 말고 추가로 검토할 근거로 다뤄야 합니다.
PIN만으로 매매 신호를 만들 수는 없습니다
PIN은 시장 미시구조를 측정하기 위해 개발되었으며 진입·청산 규칙이 아닙니다. 가격이 어느 방향으로 움직일지, 얼마나 움직일지, 신호가 이미 호가에 반영되었는지, 표시 가격에서 체결될 수 있는지 알려주지 않습니다. 초기 자산 가격 연구는 과거 NYSE 횡단면에서 추정한 PIN과 기대수익률의 관계를 분석했습니다. 특정 표본의 결과는 현재 시장의 예측이나 보편적인 위험 프리미엄이 아닙니다(Easley, Hvidkjaer, O’Hara, 2002).
PIN을 설명변수로 사용한다면 체결 방향을 분류한 방식, 추정 기간, 창, 적합된 모수, 불확실성, 모형 적합도 점검과 민감도 분석을 함께 보고하세요. 매매 전략에 반영하려면 선택에 쓰지 않은 자료에서 전체 규칙을 검증하고 스프레드, 수수료, 슬리피지, 시장 충격과 수용 가능 규모를 고려한 뒤 기준 전략과 비교해야 합니다. Implementation shortfall는 의사결정 가격과 실제 체결 비용을 비교하는 한 가지 방법입니다. 통계적으로 흥미로운 추정치도 예측에 쓰이지 않거나 거래 비용을 뺀 뒤 가치가 없을 수 있습니다.
자주 묻는 질문
Q1PIN은 다음 거래가 정보기반일 확률인가요?
아닙니다. 고전 PIN 공식은 정보기반 주문 도착의 기대 횟수를 전체 기대 횟수로 나눈 표본 단위 모형 추정치입니다. 관측된 각 체결이나 앞으로 발생할 체결에 객관적인 확률을 붙이지 않습니다.
Q2PIN이 높으면 해당 주식이 시장보다 더 오르나요?
아닙니다. PIN은 특정 모형 아래에서 정보 관련 주문 흐름을 추정합니다. 과거 표본에서 보고된 수익률 관계를 현재의 독립된 예측으로 보거나 거래 비용 차감 후 수익이 입증됐다고 해석할 수 없습니다.
Q3PIN과 VPIN은 어떻게 다른가요?
고전 PIN은 시간 구간에서 매수·매도 도착 횟수를 모수 혼합 모형에 적합합니다. VPIN은 거래량 구간과 거래량 시계의 불균형을 이용합니다. 구성과 가정, 해석이 다르며 VPIN의 예측 성능에 관한 주장은 논쟁이 있었습니다.
Q4같은 종목의 PIN 추정값이 연구마다 다른 이유는 무엇인가요?
체결 방향 규칙, 거래소 범위, 기간 길이, 표본 창, 모형 변형, 최적화 초기값이나 알고리즘이 다를 수 있습니다. 경계해와 자료 오류도 적합에 영향을 줍니다. 선택 사항을 맞추고 기록한 뒤 추정값을 비교해야 합니다.
출처와 더 읽을 자료
내용 정정 제보
이 아티클 링크를 담은 이메일 초안을 준비합니다. 직접 보내야 Mark에 제보가 접수됩니다
QUICK CHECK
글을 다 읽었다면, 3문항으로 확인해보세요
Question 01
균형을 가정한 고전 PIN 모형에서 ε는 무엇을 뜻하나요?
정답을 고르면 바로 설명을 볼 수 있어요
옵션 용어 사전
콜·풋과 옵션 체인부터 IV, 그릭스, 미결제약정, 맥스 페인까지 핵심 옵션 용어를 정확하게 설명합니다
옵션 용어 사전 보기