금융의 Hamilton–Jacobi–Bellman 방정식 이해하기
동적계획법이 HJB 방정식을 만들고 확률제어, 포트폴리오 선택, 검증정리, 제약조건과 수치 정책으로 이어지는 원리를 설명합니다
Mark 작성 · 하단에 공식 출처 표기
한눈에 답하기
Hamilton–Jacobi–Bellman 방정식은 연속시간 제어문제의 국소 최적조건입니다. 지금과 이후에 최적으로 행동해 얻는 가치는 순간 보상과 미래 가치에 작용하는 제어된 생성원을 매 순간 최적화하는 비선형 후방 방정식을 만족해야 합니다
가치함수가 제어문제를 요약합니다
상태과정 X는 소비, 포트폴리오 비중, 재고 또는 주문 속도 같은 제어 a의 영향을 받습니다
가치 V(t,x)는 시각 t의 상태 x에서 허용되는 정책으로 달성할 수 있는 미래 목적함수의 최댓값입니다
레버리지, 정보, 적분가능성과 시장 제약이 비교 가능한 제어를 정하므로 허용가능성의 정의가 먼저 필요합니다
동적계획 원리가 재귀구조를 만듭니다
Bellman 원리는 최적 계획이 첫 짧은 구간 뒤 도달한 상태에서도 남은 기간에 대해 최적이어야 한다고 말합니다
따라서 오늘의 가치는 즉시 보상과 짧은 시간 뒤 최적으로 이어갈 가치의 합을 가장 크게 한 값입니다
이 재귀식을 시간에 대해 전개하고 제어된 생성원을 적용하면 연속시간 HJB 방정식이 나옵니다
HJB는 매 순간 행동을 최적화합니다
유한 기간의 한 형태는 ∂_tV + sup_a{r(t,x,a) + L^aV} = 0이며 끝에는 종결조건이 붙습니다
r은 순간 보상이고 L^a는 행동 a를 국소적으로 유지했을 때 상태과정의 생성원입니다
각 고정 제어의 방정식이 선형이어도 최댓값 연산이 들어가므로 전체 HJB는 비선형이 됩니다
포트폴리오 선택이 대표적인 금융 예입니다
Merton 문제에서는 소비와 위험·무위험 자산 배분에 따라 투자자의 부가 변합니다
HJB는 현재 소비 효용과 각 선택이 미래 부 가치의 드리프트와 분산을 바꾸는 효과를 함께 비교합니다
특정 효용과 고정된 투자기회에서는 닫힌 해가 나오지만 기회가 확률적으로 변하거나 제약이 있으면 상태차원이 늘어납니다
후보 해에는 검증이 더 필요합니다
HJB 안의 일차조건을 풀어 얻은 정책은 후보일 뿐 자동으로 허용 가능한 최적해가 되지는 않습니다
검증정리는 매끄러움, 경계·종결조건, 적분가능성과 후보 정책이 실제로 상계를 달성하는지 확인합니다
가치함수가 매끄럽지 않으면 고전적 미분 대신 점성해 이론으로 동적계획의 의미를 보존합니다
제약조건은 정책과 방정식을 함께 바꿉니다
포지션 한도, 거래비용, 무거래 영역, 낙폭 제한과 시장충격은 모서리해나 추가 상태변수를 만들 수 있습니다
충격제어는 준변분부등식으로 이어질 수 있고 모형 불확실성은 불리한 동학에 대한 두 번째 최적화를 더합니다
무제약 일차조건의 해를 단순히 허용 범위로 잘라 쓰기보다 제약된 제어문제 자체를 다시 확인해야 합니다
수치해에는 정책 진단이 필요합니다
유한차분, 정책반복, 반라그랑주 기법과 근사 동적계획은 상태·제어 구조에 따라 다른 장단점을 가집니다
신뢰할 결과라면 단조성, 안정성, 경계 민감도, 격자 수렴과 복원한 정책의 허용가능성을 점검해야 합니다
HJB 결과는 목적함수와 모형에 조건부이므로 잘못된 선호나 동학에서 최적인 정책은 견고한 매매규칙이 아닙니다
자주 묻는 질문
HJB 방정식은 무엇을 뜻하나요?
지금 허용되는 어떤 행동을 고른 뒤 최적으로 이어가도 가치함수보다 더 좋은 결과를 만들 수 없다는 조건입니다
HJB 방정식은 왜 비선형인가요?
제어에 대해 최댓값이나 최솟값을 취하며 최선의 국소 생성원과 보상이 미지의 가치함수 미분값에 의존하기 때문입니다
금융에서는 HJB를 어디에 사용하나요?
포트폴리오·소비 선택, 최적 주문집행, 시장조성, 거래비용이 있는 헤징과 강건제어 등에 사용합니다
HJB를 풀면 전략의 최적성이 증명되나요?
아닙니다. 후보 가치와 정책이 허용가능성, 매끄러움, 경계조건과 적분가능성을 만족한다는 검증이 필요합니다