Łączna ocena VaR i ES: metoda Fisslera–Ziegela
Dowiedz się, dlaczego Value at Risk i Expected Shortfall wymagają łącznej reguły oceny, jak porównywać prognozy metodą Fisslera–Ziegela i czym różni się ona od testów wyjątków VaR.
W tym przewodnikuZacznij od pary prognoz i konwencji ogona
Krótkie podsumowanie
VaR jest kwantylem i można oceniać go samodzielnie za pomocą straty kwantylowej. Expected Shortfall (ES) ma inną właściwość: w szerokich klasach rozkładów nie jest elicytowalny jako niezależna prognoza punktowa. Fissler i Ziegel pokazują, że przy odpowiednich warunkach VaR i ES można oceniać łącznie za pomocą ściśle zgodnego wyniku. Umożliwia to porównanie par prognoz, ale niski wynik nie dowodzi poprawności modelu ryzyka.
Zacznij od pary prognoz i konwencji ogona
Niech L_t oznacza stratę, więc większa wartość jest gorsza, a c poziom ufności, na przykład 97,5%. Warunkowy kwantyl straty v(c,t) jest najmniejszym x, dla którego F(L_t ≤ x | informacja dostępna do t−1) osiąga c. Dla górnego ogona strat ES wynosi e(c,t) = 1/(1−c) razy całka z v(u,t) od c do 1, o ile średnia w ogonie jest skończona. Przy rozkładzie ciągłym odpowiada to średniej stracie powyżej progu VaR. Jeśli w progu występuje masa punktowa, definicja całkowa uwzględnia tylko potrzebną część tej masy.
Wynik musi odpowiadać konwencji użytej w prognozach. Część prac definiuje VaR i ES dla dolnego ogona stóp zwrotu, często jako wartości ujemne, a prawdopodobieństwo ogona oznacza przez α = 1−c. Dla dodatnich strat używa się górnego ogona, a ES jest nie mniejszy niż VaR. Pomieszanie konwencji zwrotu i straty może odwrócić nierówności i wskaźniki wyjątków. Zapisz znak, poziom ufności, horyzont i informację dostępną przed wynikiem.
Dlaczego VaR i ES nie mają takiego samego wyniku samodzielnego
Kwantyl można oceniać ściśle zgodną stratą typu pinball. Dla straty L i kwantyla c oznaczonego przez v jedną z ocen VaR jest S_VaR(v,L) = (I{L ≤ v}−c)(v−L). Przy standardowych warunkach kwantylowych wartość oczekiwana jest minimalna dla docelowego kwantyla. Dzięki temu VaR można oceniać samodzielnie na podstawie prognoz i późniejszych wyników.
Dla ES nie istnieje analogiczny ściśle zgodny wynik, który samodzielnie elicytuje ES w szerokich klasach rozkładów strat stosowanych w zarządzaniu ryzykiem. Zakres tego stwierdzenia jest konkretny: chodzi o niezależną prognozę punktową, której oczekiwany wynik ma jednoznaczne minimum przy ES. Nie oznacza to, że ES jest bezużyteczny ani że nie da się go porównywać lub testować.
Fissler i Ziegel pokazują kluczową różnicę: ES samodzielnie nie jest w tym sensie elicytowalny, ale para (VaR, ES) jest elicytowalna łącznie przy łagodnych warunkach regularności i momentów. Ich artykuł analizuje warunki dla ściśle zgodnych wyników (Fissler i Ziegel, 2016). Łączna elicytowalność oznacza, że jedna funkcja punktacji przyjmuje obie prognozy oraz zaobserwowany wynik. Dodanie dowolnych dwóch strat nie tworzy prawidłowego wyniku ES.
Co ocenia wynik Fisslera–Ziegela
Oznaczmy dopuszczalny wynik łączny dla poziomu c przez S_c(v,e;L). Ścisła zgodność oznacza, że oczekiwany wynik przy rozkładzie docelowym jest minimalny dla prawidłowej pary: (VaR_c, ES_c) = arg min po (v,e) z E[S_c(v,e;L)]. Przy właściwych warunkach minimum jest jednoznaczne. Wynik łączy informację o przekroczeniu progu VaR z rozmiarem zrealizowanej straty w ogonie i prognozą ES. Dla dodatnich strat ES nie powinien być mniejszy niż VaR.
Fissler i Ziegel opisują klasę wyników, a nie jedną obowiązkową formułę. Patton, Ziegel i Chen wykorzystują ten wynik do dynamicznego wspólnego modelowania VaR i ES oraz porównywania prognoz (Patton, Ziegel i Chen, 2019). Często stosowany wariant FZ0 jest zapisany dla dolnego ogona stóp zwrotu: Y = −L, α = 1−c i ujemne prognozy e ≤ v < 0: S_FZ0(Y,v,e;α) = −I{Y ≤ v}(v−Y)/(αe) + v/e + ln(−e) − 1. Ta formuła zależy od konwencji stóp zwrotu i podanych znaków. Nie należy stosować jej bez zmian do dodatnich strat ani zakładać, że jest najlepsza dla każdego zbioru danych. Opisz wybraną regułę i sprawdź jej założenia.
Jak czytać średnie i różnice wyników
Dla modelu m oblicz S_c(v_hat(m,t),e_hat(m,t);L_t) dla każdej pary prognoza–wynik, a następnie uśrednij T obserwacji. Przy tym samym dopuszczalnym wyniku, celu, datach i konwencjach niższa średnia oznacza lepszy wynik względny według tej reguły. Wartość nie jest prawdopodobieństwem, kwotą VaR ani prognozą straty pieniężnej; jej skala zależy od wyniku.
Dla porównania parowanego oblicz d_t = S_A,t − S_B,t. Ujemna średnia przemawia za A według wybranego wyniku. Obie prognozy ocenia się względem tej samej realizacji, więc różnica parowana jest bardziej informacyjna niż dwa niezależnie zaokrąglone średnie wyniki. Może jednak być niepewna, gdy obserwacji z ogona jest niewiele.
<!-- learn:illustration -->
Porównuj te same momenty prognozy, portfel lub zmienną docelową, horyzont, poziom ufności i wersję danych. Prognozy muszą być zapisane przed poznaniem wyników. Jeśli horyzonty się pokrywają albo różnice wyników są zależne w czasie, oszacowanie niepewności powinno to uwzględnić. Podaj odpowiedni błąd standardowy lub przedział; mała surowa różnica nie oznacza automatycznie wiarygodnej przewagi.

Dlaczego dwa wyniki samodzielne nie wystarczą
Może się wydawać naturalne, by dodać do straty pinball VaR bezwzględną różnicę prognozy ES od wartości referencyjnej. Sama wartość referencyjna może być jednak nieodpowiednia, a wartość oczekiwana drugiego składnika nie musi być minimalna przy prawdziwym ES. Dowolnie ważona suma nie gwarantuje łącznej zgodności. Wynik FZ jest skonstruowany tak, aby wspólnie oceniać parę VaR–ES.
Klasa Fisslera–Ziegela obejmuje wiele wyników o różnych skalach i akcentach. Średnich z różnych funkcji nie można bezpośrednio porównywać. Patton, Ziegel i Chen opisują FZ0 i jego własności skali przy dodatkowych założeniach o znakach; nie oznacza to uniwersalnej przewagi FZ0. Wybierz i opisz regułę przed obejrzeniem rankingu.
Para prognoz także musi być spójna. Pozornie rozsądna prognoza ES może wypaść słabo, jeśli przeczy towarzyszącej jej prognozie VaR. Z kolei dobry wynik łączny nie dowodzi, że cały rozkład warunkowy jest prawidłowy. Oceniana jest wskazana funkcja VaR–ES w ramach wybranego wyniku i projektu badania.
Te same wyjątki VaR mogą ukrywać różne straty w ogonie
Wskaźnik wyjątku VaR jest binarny: I_t = 1, gdy L_t przekracza prognozowany VaR, w przeciwnym razie 0. Dwa modele mogą mieć te same daty i liczbę wyjątków, choć wielkość strat poza progiem znacznie się różni. Cztery przekroczenia nie mówią, czy wszystkie były niewielkie, czy jedno sięgnęło daleko w ogon. Sam licznik pomija właśnie tę skalę, którą ma opisywać ES.
Wynik łączny wykorzystuje prognozy VaR i ES razem z zaobserwowaną stratą, dlatego wielkość strat ogonowych może mieć znaczenie poza samą liczbą wyjątków. Dokładny wpływ każdej obserwacji zależy od wybranej funkcji. Nie wskazuj zwycięzcy na podstawie jednego ekstremalnego zdarzenia: oblicz wynik w całej wspólnej próbie i sprawdź wrażliwość.
Porównanie prognoz za pomocą wyniku i test kalibracji VaR odpowiadają na różne pytania. Pierwsze szereguje pary według ustalonej reguły. Test wyjątków VaR bada częstość lub wzorce czasowe przekroczeń. Ranking nie jest pełnym potwierdzeniem kalibracji.
Testy wyjątków i backtesty ES odpowiadają na inne pytania
Testy Kupieca porównują liczbę wyjątków VaR z docelową częstością; rozszerzenia Christoffersena badają też zależność lub grupowanie. Każdy wynik redukują do wyjątku albo jego braku, więc nie mierzą wielkości straty ponad VaR ani bezpośrednio nie oceniają prognozy ES. Przewodnik VaR i Expected Shortfall wyjaśnia, jakie odmienne informacje zawierają te miary.
Acerbi i Szekely proponują nieparametryczne backtesty ES i wskazują, że elicytowalność ma znaczenie przy wyborze modelu, lecz nie jest warunkiem testowania miary ryzyka (Acerbi i Szekely, 2014). Bayer i Dimitriadis rozwijają regresyjne backtesty ES oparte na wspólnej strukturze VaR–ES; warianty mają własne założenia i wymagania dotyczące kowariancji (Bayer i Dimitriadis, 2022). Ranking punktacji nie zastępuje dedykowanego backtestu, a brak odrzucenia nie dowodzi poprawności pary prognoz.
Zaplanuj wnioskowanie sparowane i unikaj selekcji po fakcie
Ciąg różnic wyników d_t jest szeregiem czasowym. Dla niepokrywających się prognoz jednokrokowych i odpowiednich założeń o zależności można rozważyć test sparowany średniej różnicy. Przy zależności szeregowej lub nakładających się horyzontach niepewność trzeba oszacować metodą uwzględniającą te zależności, na przykład wariancją długookresową albo odpowiednim bootstrapem blokowym. Podaj metodę i jej parametry, a nie tylko wartość p.
Ustal wynik, poziom ogona, horyzont, okres oceny i zestaw modeli przed analizą rezultatów. Wypróbowanie wielu wyników, okien, portfeli i wariantów, a następnie pokazanie tylko najlepszego, tworzy problem selekcji. Jeśli to możliwe, zachowaj późniejszy okres testowy, którego nie użyto do wyboru modelu, i opisz przeszukiwanie. Zwykłe błędy standardowe automatycznie nie korygują tej selekcji.
Przedstaw średnie i sparowaną różnicę wraz z niepewnością, definicję wyniku, znaki i konwencje, wspólne daty poza próbą oraz liczbę obserwacji z ogona. Jeśli ranking zmienia się przy rozsądnych wyborach wyniku lub okresu, pokaż tę wrażliwość.
Ograniczenia i praktyczna lista kontrolna
Przy wysokich poziomach ufności obserwacji z ogona jest niewiele, dlatego ranking może być niestabilny nawet w długim szeregu. Heteroskedastyczność warunkowa, zmiany reżimu, nakładające się zwroty, niepewność estymacji, błędy danych i zmiany portfela również wpływają na różnice wyników. Łączna elicytowalność nie rozwiązuje tych problemów; dostarcza uzasadnionej klasy wyników pod warunkami matematycznymi.
Sprawdź, czy zrealizowana strata odnosi się do tego samego portfela, horyzontu, metody wyceny i znaku co prognoza. VaR i ES muszą dotyczyć tej samej probabilistyki ogona. Upewnij się, że prognozy były ex ante, a wynik spełnia wymagane warunki dotyczące rozkładu, momentów i znaków. Podaj długość próby, obserwacje ogonowe, wzór wyniku, metodę niepewności oraz przeszukiwanie modeli i wyników. Wniosek pozostaje ograniczony do tego projektu.
Niższy wynik łączny jest dowodem lepszej względnej jakości prognoz według określonej reguły. Nie dowodzi, że model obejmuje każde zdarzenie ogonowe, że jego oszacowania są bezpieczne ani że przyszłość będzie podobna do próby. To materiał o metodach statystycznych, a nie porada inwestycyjna.
Częste pytania
Q1Czy mogę porównać prognozy ES za pomocą błędu bezwzględnego?
Nie jako uniwersalnego zamiennika ściśle zgodnego wyniku. W porównaniu prognoz punktowych ES zwykle ocenia się razem z VaR; do kalibracji można użyć dedykowanego backtestu ES.
Q2Czy wynik łączny mówi, czy model ryzyka jest skalibrowany?
Porównuje względną jakość według wybranego wyniku. Kalibracja i błędna specyfikacja modelu to różne pytania wymagające odpowiednich testów i diagnostyki.
Q3Czy dwa modele mogą mieć te same wyjątki VaR, ale różne wyniki łączne?
Tak. Wskaźniki mogą być takie same, choć różnią się wielkości strat ponad VaR lub prognozy ES. Dokładny wpływ zależy od wyniku.
Q4Czy niski wynik oznacza, że model jest bezpieczny?
Nie. Rezultat zależy od próby, wyniku i założeń. Mało danych ogonowych, zmiana reżimu, selekcja modelu lub błędy danych mogą go zmienić. To nie jest porada inwestycyjna.
Źródła i dalsza lektura
Zgłoś problem
Przygotujemy e-mail z linkiem do tego artykułu. Mark otrzyma zgłoszenie dopiero po jego wysłaniu
Szybki test
Przeczytano? Sprawdź się w 3 pytaniach
Pytanie 01
Dlaczego Expected Shortfall często ocenia się razem z VaR?
Wybierz odpowiedź, aby zobaczyć wyjaśnienie
Słownik opcji
The average loss from a chosen VaR quantile through the worst tail under a precise convention; it measures severity beyond the threshold rather than only its location.
Czytaj szczegółowy przewodnikAssignmentThe process that requires an option writer to fulfill the contract after an exercise notice is allocated; it can create or remove an underlying position.
Czytaj szczegółowy przewodnikBid-ask spreadThe gap between the best displayed bid and ask, which is a practical trading cost and a signal of how uncertain an immediate fill may be.
Czytaj szczegółowy przewodnik