Wszystkie przewodniki po opcjach
Ciągłe decyzje stają się równaniem15 min czytania

Równanie Hamiltona–Jacobiego–Bellemana w finansach — wyjaśnienie

Zrozum, jak programowanie dynamiczne tworzy równanie HJB dla sterowania stochastycznego, wyboru portfela, weryfikacji, ograniczeń i numerycznego projektowania polityki

Przygotowane przez Mark · Źródła pierwotne poniżej

Bezpośrednia odpowiedź

Równanie Hamiltona–Jacobiego–Bellemana jest lokalnym warunkiem optymalności dla sterowania w czasie ciągłym. Sprawia, że optymalne działanie bieżące i przyszłe spełniają nieliniowe równanie wsteczne dotyczące nagrody i sterowanego generatora wartości

Funkcja wartości podsumowuje problem sterowania

Niech X będzie procesem stanu zależnym od sterowania a, takiego jak konsumpcja, waga portfela, zapas albo szybkość realizacji

Wartość V(t,x) to najlepszy oczekiwany przyszły cel możliwy do osiągnięcia ze stanu x w czasie t przy wszystkich dopuszczalnych politykach

Zdefiniowanie dopuszczalności jest kluczowe, ponieważ dźwignia, informacja, całkowalność i ograniczenia rynku określają, które sterowania można porównywać

Programowanie dynamiczne dostarcza rekurencji

Zasada Bellmana mówi, że optymalny plan pozostaje optymalny po pierwszym krótkim przedziale, warunkowo względem osiągniętego wtedy stanu

Dzisiejsza wartość równa się więc najlepszej natychmiastowej nagrodzie plus optymalnie kontynuowana wartość po małym kroku

Rozwinięcie tej rekurencji w czasie i użycie sterowanego generatora prowadzi do równania HJB w czasie ciągłym

Równanie HJB optymalizuje lokalnie

Częstą postacią przy skończonym horyzoncie jest ∂_tV + sup_a{r(t,x,a) + L^aV} = 0 z warunkiem końcowym

Tutaj r jest bieżącą nagrodą, a L^a generatorem stanu, gdy działanie a jest lokalnie utrzymywane

Supremum sprawia, że równanie jest nieliniowe, nawet gdy każde równanie przy ustalonym sterowaniu jest liniowe

Wybór portfela jest klasycznym przykładem

W problemie Mertona majątek zmienia się wraz z konsumpcją i alokacją do aktywów ryzykownych oraz wolnych od ryzyka

HJB równoważy bieżącą użyteczność konsumpcji z tym, jak każdy wybór zmienia dryf i wariancję przyszłej wartości majątku

Specjalna użyteczność i stałe możliwości inwestycyjne mogą dawać rozwiązania zamknięte, ale możliwości stochastyczne albo ograniczenia zwykle dodają wymiary stanu

Rozwiązanie kandydujące nadal wymaga weryfikacji

Rozwiązanie warunków pierwszego rzędu wewnątrz HJB tworzy politykę kandydującą, a nie automatycznie dopuszczalne optimum

Twierdzenie weryfikacyjne sprawdza regularność, warunki brzegowe i końcowe, całkowalność oraz osiągnięcie granicy przez kandydata

Gdy wartość nie jest gładka, metody rozwiązań lepkościowych zastępują klasyczne pochodne, zachowując znaczenie programowania dynamicznego

Ograniczenia zmieniają politykę i równanie

Limity pozycji, koszty transakcji, strefy no-trade, reguły obsunięcia i wpływ rynkowy mogą tworzyć narożniki albo dodatkowe zmienne stanu

Działania impulsowe mogą prowadzić do quasi-wariacyjnych nierówności, a niejednoznaczność modelu może dodać drugą optymalizację względem niekorzystnej dynamiki

Nieograniczonego rozwiązania pierwszego rzędu nie należy nigdy mechanicznie przycinać bez sprawdzenia ograniczonego problemu sterowania

Rozwiązania numeryczne potrzebują diagnostyki polityki

Różnice skończone, iteracja polityki, schematy semi-Lagrange'a i przybliżone programowanie dynamiczne atakują różne struktury stanu i sterowania

Wiarygodny wynik sprawdza monotoniczność, stabilność, wrażliwość brzegową, zbieżność siatki i to, czy odzyskana polityka jest dopuszczalna

Wynik HJB jest warunkowy względem celu i modelu; optymalna polityka dla błędnych preferencji albo dynamiki nie jest odporną regułą tradingową

Częste pytania

Co przedstawia równanie HJB?

Przedstawia warunek, że żadne dopuszczalne działanie natychmiastowe, po którym następuje optymalna kontynuacja, nie może poprawić funkcji wartości

Dlaczego równanie HJB jest nieliniowe?

Bierze supremum albo infimum po sterowaniach, więc najlepszy lokalny generator i nagroda zależą od pochodnych nieznanej wartości

Jak HJB jest używane w finansach?

Używa się go przy wyborze portfela i konsumpcji, optymalnej realizacji, market makingu, hedgingu z kosztami i sterowaniu odpornym

Czy rozwiązanie HJB dowodzi, że strategia jest optymalna?

Nie. Argument weryfikacyjny musi wykazać, że kandydacka wartość i polityka spełniają warunki dopuszczalności, regularności, brzegowe i całkowalności

Źródła i dalsza lektura

Szybki test

Przeczytano? Sprawdź się w 3 pytaniach

1 / 3

Pytanie 01

Które stwierdzenie najlepiej pasuje do tego poradnika — Funkcja wartości podsumowuje problem sterowania?

Wybierz odpowiedź, aby zobaczyć wyjaśnienie

Słownik opcji