Принцип максимума Понтрягина и HJB: объяснение
Сравните сопряженные переменные и максимизацию гамильтониана с функциями стоимости и динамическим программированием в детерминированном и стохастическом финансовом управлении
Короткий ответ
Принцип максимума Понтрягина использует гамильтониан и обратную сопряженную переменную для получения необходимых условий вдоль оптимальной траектории. HJB характеризует стоимость во всех состояниях через динамическое программирование; гладкие решения связывают оба взгляда
Сначала формулируется задача управления
Состояние X развивается под управлением u, а целевая функция объединяет текущие вознаграждения, конечную стоимость и, возможно, риск или ограничения
Допустимые управления должны задавать информацию, интегрируемость, пределы состояния и то, используют ли решения обратную связь или являются разомкнутыми
Изменение цели или множества допустимых управлений меняет и условия принципа максимума, и уравнение HJB
Гамильтониан оценивает локальные последствия
Управляющий гамильтониан объединяет текущую цель с произведением сопряженной переменной на управляемый дрейф состояния
Знаковые соглашения определяют, максимизируется или минимизируется гамильтониан, поэтому соглашение нужно указать вместе с целевой функцией
Здесь гамильтониан — объект теории управления, его не следует путать с энергией в механике или рыночной ценой
Состояние и сопряженная переменная образуют прямую и обратную систему
Уравнение состояния движется вперед от начального условия под кандидатным управлением
Уравнение для сопряженной переменной движется назад от конечного условия и измеряет предельную ценность возмущения состояния
Кандидатное управление оптимизирует гамильтониан поточечно и связано с обеими траекториями и активными ограничениями
Принцип обычно дает необходимую проверку
Траектория, нарушающая условие максимума, не может быть оптимальной при выполнении предпосылок теоремы
Траектория, которая ему удовлетворяет, не обязательно глобально оптимальна: невыпуклые цели могут давать локальные экстремумы или несколько кандидатов
Вогнутость, выпуклость, условия трансверсальности и квалификация ограничений в специальных задачах могут превратить кандидатные условия в достаточные
Стохастическое управление добавляет случайность сопряженной части
При диффузионном риске сопряженная переменная становится обратным стохастическим процессом, а гамильтониан включает воздействие случайных шоков
Если управление входит в невыпуклый коэффициент диффузии, общий стохастический принцип максимума может потребовать сопряженных членов второго порядка
Исключение этих членов по аналогии с детерминированной формулой может привести к неверному условию первого порядка
HJB описывает каждое состояние, а не одну траекторию
HJB — нелинейное уравнение для функции стоимости по времени и пространству состояний, построенное на рекурсии Беллмана
Понтрягин следует за кандидатным оптимумом через уравнения состояния и сопряженной переменной, часто сводя задачу с PDE к краевой системе
Если стоимость гладкая, сопряженная переменная часто совпадает с градиентом стоимости вдоль оптимальной траектории с учетом знаковых соглашений и гладкости
В финансах оба подхода требуют осторожности
Выбор портфеля, оптимальное исполнение, маркет-мейкинг, управление запасами и хеджирование с издержками можно формулировать обоими способами
HJB поддерживает политики с обратной связью по состояниям, а принцип максимума может быть удобен в больших размерностях или при траекторных ограничениях
Всегда проверяйте допустимость, граничные условия, условия второго порядка и устойчивость к ошибкам в модели и целевой функции
Частые вопросы
Достаточен ли принцип максимума Понтрягина для оптимальности?
Обычно он дает необходимые условия; дополнительные выпуклость, вогнутость и гладкость могут сделать их достаточными в отдельных задачах
Чем Понтрягин отличается от HJB?
Понтрягин изучает состояние и сопряженную переменную вдоль кандидатной траектории, а HJB решает задачу оптимальной стоимости во всем пространстве состояний
Что такое сопряженная переменная?
Это сопряженная переменная, измеряющая предельное влияние изменения состояния на цель вдоль кандидатного оптимума
Где принцип максимума используется в финансах?
Он встречается в управлении портфелем, исполнении, маркет-мейкинге, хеджировании, выборе потребления и задачах с ограничениями состояния или траектории