주성분분석(PCA)이란 무엇인가
주성분분석의 중심화와 표준화, 공분산 행렬, 주성분 점수와 적재량, 설명분산 및 금융 활용의 한계를 설명합니다.
Mark 작성 · 하단에 공식 출처 표기
한눈에 답하기
주성분분석(PCA)은 서로 상관된 여러 변수를 정보가 많이 남는 소수의 직교 축으로 바꾸는 차원축소 방법입니다. 첫 번째 주성분은 표본분산을 가장 크게 설명하고, 다음 성분은 앞선 축과 직교하면서 남은 분산을 최대한 설명합니다. 결과는 예측변수나 위험요약에 유용하지만 경제적 요인을 자동으로 발견하지는 않습니다. 입력 단위, 표본기간, 공분산 추정법과 성분 수 선택에 따라 축이 달라지므로 점수·적재량·설명분산과 표본 밖 안정성을 함께 봐야 합니다.
먼저 데이터의 기준점을 맞춥니다
PCA는 각 변수에서 평균을 빼 중심화한 자료에 적용합니다. 그렇지 않으면 평균 수준이 변동방향처럼 결과를 지배할 수 있습니다.
가격 수준보다 수익률처럼 의미 있는 변환을 먼저 정해야 합니다. 비정상적인 수준 자료의 큰 추세는 유용한 공통위험으로 오인될 수 있습니다.
결측치, 이상치, 빈도와 표본기간도 공분산을 바꿉니다. PCA 이전의 데이터 설계가 계산 이후의 이름 붙이기보다 중요합니다.
공분산과 상관행렬은 다른 질문입니다
공분산 행렬 PCA는 원래 단위를 보존하므로 변동성이 큰 변수가 더 큰 영향력을 가질 수 있습니다.
표준화 뒤 상관행렬을 쓰면 각 변수의 분산을 1로 맞춥니다. 단위 차이는 줄지만 경제적으로 중요한 규모 정보도 사라질 수 있습니다.
어느 행렬이 옳은지는 목적에 달려 있습니다. 통화별 금리변화처럼 단위가 비슷한 자료와 서로 다른 지표 묶음은 같은 선택을 요구하지 않습니다.
주성분은 분산을 최대화하는 방향입니다
첫 주성분은 모든 가능한 단위 방향 가운데 투영된 자료의 표본분산이 가장 큰 축입니다.
두 번째 이후 성분은 앞선 성분과 직교한다는 제약 아래 남은 분산을 순서대로 가장 크게 담습니다.
직교성은 표본 안에서 점수들이 상관되지 않게 합니다. 실제 경제 충격들이 독립이라는 뜻은 아닙니다.
점수와 적재량은 역할이 다릅니다
적재량은 원변수를 주성분으로 조합하는 가중치입니다. 각 축이 어떤 변수와 같은 방향 또는 반대 방향인지 보여줍니다.
점수는 각 시점의 관측값을 그 축에 투영한 좌표입니다. 적재량이 방향이라면 점수는 시간에 따라 움직이는 위치입니다.
고유벡터의 부호는 뒤집어도 같은 축입니다. 부호 변화만으로 경제적 관계가 반전됐다고 해석하면 안 됩니다.
설명분산은 정보량의 완전한 기준이 아닙니다
각 성분의 고유값은 그 방향의 표본분산이며, 전체 고유값 합으로 나누면 설명분산 비율이 됩니다.
스크리 도표나 누적 설명분산은 성분 수를 고르는 출발점입니다. 80% 같은 고정 기준이 모든 목적에 최적인 것은 아닙니다.
작은 분산 방향에도 예측력이나 헤지 제약이 숨어 있을 수 있습니다. 분산을 많이 설명하는 축이 수익을 잘 예측한다는 보장은 없습니다.
성분 수는 표본 밖에서 결정합니다
너무 적은 성분은 중요한 구조를 버리고, 너무 많은 성분은 표본 잡음까지 보존합니다.
재구성 오차, 예측 목적의 교차검증, 고유값 간격, 부트스트랩 안정성을 목적에 맞게 함께 비교할 수 있습니다.
롤링 표본에서 적재량과 설명분산을 다시 추정해야 합니다. 전체 표본으로 만든 축을 과거 예측에 쓰면 미래정보가 섞입니다.
금융에서는 공통 움직임을 요약합니다
수익률곡선 변화는 수준·기울기·곡률과 비슷한 축으로, 주식수익률은 시장 전체와 집단별 공통방향으로 압축될 수 있습니다.
포트폴리오에서는 첫 몇 축에 위험이 얼마나 집중됐는지 보고 명목 종목 수와 실질 분산효과의 차이를 점검할 수 있습니다.
그러나 통계적 축에 ‘성장’이나 ‘유동성’ 같은 이름을 붙이려면 외부 변수, 경제 논리와 다른 표본에서의 검증이 필요합니다.
재현 가능한 선택을 함께 보고합니다
변수 정의, 변환, 통화와 단위, 중심화·표준화, 결측치와 이상치 처리, 추정기간을 공개합니다.
행렬 종류, 고유값, 설명분산, 적재량, 점수 계산법과 성분 수 기준을 제시해야 결과를 다시 만들 수 있습니다.
표본 밖 성능과 롤링 안정성도 보여줍니다. PCA는 현실의 고정된 진실이 아니라 특정 자료에서 추정한 좌표계입니다.
자주 묻는 질문
PCA와 요인분석은 같은가요?
아닙니다. PCA는 전체 분산을 재표현하고, 공통요인모형은 공통분산과 고유분산을 구분하는 확률모형입니다.
변수는 항상 표준화해야 하나요?
아닙니다. 단위 차이를 제거할 목적이면 유용하지만 경제적으로 중요한 변동성 규모도 함께 제거됩니다.
주성분 적재량의 부호가 바뀌면 구조가 변한 것인가요?
반드시 그렇지 않습니다. 한 고유벡터와 그 음수는 같은 축이므로 먼저 부호 정렬을 해야 합니다.
설명분산이 높은 성분이 좋은 거래신호인가요?
아닙니다. 설명분산은 동시 변동의 크기이며 미래수익 예측력은 별도로 표본 밖에서 검증해야 합니다.