Skip to content
Wszystkie przewodniki po opcjach
Sprawdź częstotliwość i czas przekroczeń VaR12 min czytania

Backtesting VaR: testy Kupieca i Christoffersena wyjaśnione

Dowiedz się, jak test POF Kupieca i testy pokrycia warunkowego Christoffersena oceniają przekroczenia VaR, jak czytać przykład 250 dni oraz dlaczego brak odrzucenia nie dowodzi trafności.

W tym przewodnikuCo sprawdza backtest VaR?

Krótkie podsumowanie

Backtest VaR porównuje prognozowany próg straty ze stratą, która wystąpiła później. Test Kupieca sprawdza, czy liczba przekroczeń jest zgodna z zakładanym poziomem. Testy Christoffersena badają też, czy przekroczenia występują niezależnie, czy grupują się w czasie. Sprawdzają różne cechy prognozy; żaden z nich nie dowodzi, że model ryzyka jest poprawny.

Co sprawdza backtest VaR?

Value at Risk (VaR) to próg straty powiązany z określonym poziomem ufności i horyzontem. Jeśli jednodniowy VaR na poziomie 99% wynosi 10 000 USD, model przypisuje 1% prawdopodobieństwa jednodniowej stracie większej niż 10 000 USD, przy uwzględnieniu zadeklarowanych informacji i założeń. VaR nie jest maksymalnym limitem straty i nie określa, jak duża może być strata po przekroczeniu tego progu.

Backtest zamienia serię prognoz i wyników w ciąg wskaźników przekroczeń. Przy dziennym VaR 99% dobrze skalibrowany model powinien generować przekroczenia w około 1% porównywalnych obserwacji w długiej serii. To stwierdzenie ma dwa elementy: długookresowa częstotliwość powinna być zbliżona do celu, a przekroczenia nie powinny pojawiać się w układzie sprzecznym z warunkowymi prognozami ryzyka modelu. Test proportion-of-failures (POF) Kupieca skupia się na pierwszym elemencie. Testy niezależności i pokrycia warunkowego Christoffersena uwzględniają także kolejność przekroczeń.

To rozróżnienie ma praktyczne znaczenie. Model może mieć cztery przekroczenia w ciągu roku i wszystkie mogą wystąpić podczas jednego burzliwego tygodnia. W innym modelu te same cztery przekroczenia mogą być rozłożone w ciągu roku. Test oparty wyłącznie na liczbie widzi w obu przypadkach cztery; test uwzględniający czas widzi różne sekwencje. Poniższe testy pomagają opisać te cechy, ale nie zastępują przeglądu pozycji, danych rynkowych, założeń ani dotkliwości strat. Osobny przewodnik o GARCH i klastrowaniu zmienności wyjaśnia, jak modele GARCH reprezentują klastrowanie; model wariancji i backtest odpowiadają na różne pytania.

Zdefiniuj przekroczenie przed jego policzeniem

Stosuj jedną konwencję znaków. Niech Lₜ oznacza zrealizowaną stratę w dniu t, a VaRₜ|ₜ₋₁ jednodniowy próg prognozowany na podstawie informacji dostępnych przed dniem t. Zdefiniuj wskaźnik przekroczenia Iₜ = 1, gdy Lₜ > VaRₜ|ₜ₋₁, oraz Iₜ = 0 w przeciwnym razie. W modelu VaR 99% docelowe prawdopodobieństwo przekroczenia wynosi α = 1 − 0.99 = 0.01. Niektóre źródła definiują wskaźnik przez stopy zwrotu albo przez to, czy wynik mieści się w przedziale; konwencje są równoważne po poprawnym przełożeniu znaku i prawdopodobieństwa. Podaj, której definicji używasz.

Prognoza i wynik muszą dotyczyć tego samego portfela, horyzontu, momentu wyceny i definicji straty. Jeśli prognoza powstaje po zamknięciu rynku i dotyczy następnej sesji, porównaj ją ze stratą z tej sesji według spójnej reguły wyceny. Z góry zdecyduj, jak traktować wynik równy granicy VaR, święta, brakujące obserwacje, zamknięcia rynku, korekty intraday i zmiany portfela. Te wybory mogą zmienić sekwencję hitów, szczególnie gdy przekroczenia są rzadkie.

Oddziel dopasowanie modelu od końcowej oceny. Jeśli parametry lub progi ryzyka wybrano po obejrzeniu tego samego okresu, który służy do testu, wartość p nie opisuje już czystej oceny out-of-sample. W przypadku prognoz kroczących zapisuj, kiedy powstała każda prognoza i jakie informacje były wtedy dostępne. Nakładające się prognozy wielodniowe mogą powodować zależność wskaźników przekroczeń. Standardowe testy poniżej nie naprawiają automatycznie niedopasowanych horyzontów, wykorzystania przyszłych danych, zrewidowanych wejść ani procesu selekcji modelu.

Na jakie pytanie odpowiada test POF Kupieca?

Załóż, że istnieje T porównywalnych par prognoza–wynik i x przekroczeń. Zaobserwowana stopa przekroczeń wynosi p̂ = x/T. Test proportion-of-failures Kupieca, nazywany też testem pokrycia bezwarunkowego, porównuje dwie funkcje wiarygodności dwumianowej: jedna ustala prawdopodobieństwo przekroczenia na poziomie docelowym α, druga swobodnie szacuje je jako p̂. Test opisano w artykule Kupieca z 1995 r.; dostępny jest też wpis w archiwum Federal Reserve. Statystyka ilorazu wiarygodności ma postać

LRᵤ꜀ = −2 ln [ (1−α)^(T−x) α^x / ((1−p̂)^(T−x) p̂^x) ].

Pod hipotezą zerową przekroczenia są niezależnymi zdarzeniami Bernoulliego o prawdopodobieństwie α. Przy dostatecznie dużej próbie statystyka ma asymptotycznie rozkład chi-kwadrat z jednym stopniem swobody. Duża wartość prowadzi do odrzucenia określonej częstości przekroczeń. Ponieważ model alternatywny swobodnie szacuje zaobserwowaną stopę, test może odrzucić zarówno wtedy, gdy przekroczeń jest za dużo, jak i gdy jest ich za mało. Model, którego VaR prawie nigdy nie zostaje przekroczony, nie jest automatycznie dobrze skalibrowany; może być zbyt konserwatywny do zamierzonego zastosowania.

Test POF wykorzystuje liczbę x, a nie daty przekroczeń. Zmiana kolejności tych samych wskaźników nie zmienia statystyki. Nie rozróżnia więc czterech przekroczeń rozproszonych w czasie od czterech następujących po sobie. Dwumianowa funkcja wiarygodności zakłada również niezależność wskaźników przekroczeń na potrzeby rozkładu odniesienia. Jeśli chcesz sprawdzić klastrowanie, dodaj test zależności zamiast wyciągać wniosek o klastrowaniu z wyniku POF.

Przykład 250 dni pokazuje, dlaczego wartość p wymaga kontekstu

Rozważ hipotetyczną serię 250 jednodniowych prognoz VaR na poziomie 99%. Docelowa stopa to α = 0.01, więc pod hipotezą zerową oczekiwana liczba przekroczeń wynosi Tα = 250 × 0.01 = 2.5. Załóżmy, że seria zawiera cztery przekroczenia. Zaobserwowana stopa to p̂ = 4/250 = 0.016, czyli 1.6%. Jest wyższa od celu 1%, ale sama różnica nie rozstrzyga, czy test ilorazu wiarygodności odrzuci hipotezę.

Po podstawieniu T = 250, x = 4 i α = 0.01 otrzymujemy LRᵤ꜀ ≈ 0.769. Przy asymptotycznym rozkładzie chi-kwadrat(1) wartość p wynosi około 0.38, a wartość krytyczna na poziomie 5% około 3.84. W tym przybliżeniu przykład nie odrzuca hipotezy pokrycia bezwarunkowego na poziomie 5%. To wyłącznie hipotetyczne obliczenie, a nie wynik empiryczny ani zalecany próg akceptacji.

Dwie logarytmiczne funkcje wiarygodności pokazują, skąd bierze się statystyka. Przy stałej stopie docelowej ℓ₀ = 246 ln(0.99) + 4 ln(0.01) ≈ −20.893. Przy swobodnej stopie zaobserwowanej ℓ₁ = 246 ln(0.984) + 4 ln(0.016) ≈ −20.508. Swobodne dopasowanie jest wyższe o około 0.385 jednostki logarytmu funkcji wiarygodności, więc LRᵤ꜀ = −2(ℓ₀ − ℓ₁) ≈ 0.769. Test mierzy utratę dopasowania względem modelu o stopie docelowej, a nie odległość w złotych.

Brak odrzucenia nie dowodzi, że model jest dobrze skalibrowany. Oczekiwano tylko 2.5 przekroczenia, więc jedno lub dwa dodatkowe zdarzenia wyraźnie zmieniają obserwowaną stopę. Odniesienie do rozkładu chi-kwadrat jest asymptotyczne, a testy rzadkich zdarzeń mogą mieć ograniczoną moc przy takiej próbie. Odczytuj statystykę razem z liczbą oczekiwaną, horyzontem prognozy, konstrukcją testu i wielkością próby. Wartość p nie jest prawdopodobieństwem, że model VaR jest prawdziwy.

Ta sama liczba przekroczeń może ukrywać różny czas ich wystąpienia

Porównaj dwie hipotetyczne sekwencje po 250 dni, każda z czterema przekroczeniami. W sekwencji A występują one w dniach 20, 80, 140 i 220. W sekwencji B są to dni 60, 61, 180 i 181. W obu x = 4 i p̂ = 1.6%, więc statystyka Kupieca jest identyczna. Sekwencja B zawiera jednak dwie pary przekroczeń w kolejnych dniach, a A nie zawiera żadnej.

Schemat poniżej pokazuje, dlaczego warto zachować kolejność hitów, a nie tylko ich łączną liczbę. To ilustracja koncepcyjna, a nie seria danych z 250 dni ani wynik testu. Kolejne przekroczenia mogą wskazywać na model, który nie nadąża za zmianą zmienności, ale kilka punktów nie wystarcza do ustalenia przyczyny. Taki wzorzec może wynikać z błędnej specyfikacji, szoku rynkowego, zmian portfela, nakładających się horyzontów albo konwencji danych i czasu.

Niech nᵢⱼ oznacza liczbę przejść, w których poprzedni wskaźnik miał wartość i, a bieżący j; 0 oznacza brak przekroczenia, 1 oznacza przekroczenie. Poza granicami próby sekwencja A ma n₀₁ = 4 i n₁₁ = 0, a B ma n₀₁ = 2 i n₁₁ = 2. Obie mają po cztery przekroczenia, lecz w B część hitów następuje po wcześniejszym hicie. Tę informację wykorzystuje test niezależności pierwszego rzędu.

Pełna tabela przejść wygląda tak: A: n₀₀ = 241, n₀₁ = 4, n₁₀ = 4, n₁₁ = 0; B: kolejno 243, 2, 2 i 2. Dopasowane prawdopodobieństwo hitu po dniu bez przekroczenia wynosi n₀₁/(n₀₀+n₀₁); po hicie jest to n₁₁/(n₁₀+n₁₁). Dla A otrzymujemy 4/245 ≈ 1.63% oraz 0/4 = 0%. Dla B są to 2/245 ≈ 0.82% oraz 2/4 = 50%. Wartość 50% opiera się na zaledwie czterech hipotetycznych przejściach po hicie, a nie na wiarygodnym oszacowaniu ryzyka modelu na następny dzień.

Beztekstowy schemat koncepcyjny porównuje dwie sekwencje przekroczeń VaR o tej samej długości i tej samej liczbie przekroczeń: jedną rozproszoną, a drugą skupioną w parach kolejnych dni.
Ta sama liczba przekroczeń może wystąpić w różnym układzie czasowym. Schemat pokazuje wyłącznie klastrowanie; nie przedstawia danych rynkowych ani wyniku testu.

Co wnosi test niezależności Christoffersena?

Test niezależności Christoffersena sprawdza, czy prawdopodobieństwo przekroczenia dziś zmienia się zależnie od tego, czy wystąpiło wczoraj. Zapisz π₀ = Pr(Iₜ = 1 | Iₜ₋₁ = 0) oraz π₁ = Pr(Iₜ = 1 | Iₜ₋₁ = 1). Pod hipotezą zerową niezależności π₀ = π₁. W hipotezie alternatywnej oba prawdopodobieństwa przejścia są szacowane osobno na podstawie n₀₀, n₀₁, n₁₀ i n₁₁.

Statystyka ilorazu wiarygodności porównuje oba modele i jest zwykle oceniana względem asymptotycznego rozkładu chi-kwadrat z jednym stopniem swobody. W przeciwieństwie do POF wykorzystuje kolejność wskaźników. Jeśli po przekroczeniach często następują kolejne przekroczenia, π₁ może być większe od π₀. Test dotyczy zależności pierwszego rzędu w tej binarnej sekwencji; nie sprawdza każdej sytuacji, w której przeszłe informacje, zmienność lub stan portfela mogą przewidywać przyszłe straty. Artykuł Christoffersena z 1998 r. przedstawia ocenę warunkowego pokrycia prognoz przedziałowych.

Przy niewielu przekroczeniach oszacowania przejść są szczególnie niestabilne. Sekwencja bez kolejnych hitów może dać graniczne oszacowanie π₁ = 0, ale nie dowodzi to, że drugi hit jest niemożliwy. Oznacza tylko, że w tej próbie się nie pojawił. Oceniaj liczbę przejść i wielkość próby razem ze statystyką. Nie interpretuj rzadkiej tabeli jako precyzyjnego oszacowania ryzyka ogonowego na następny dzień.

Pokrycie warunkowe łączy częstość i niezależność

Test pokrycia warunkowego łączy statystykę częstości Kupieca ze statystyką niezależności Christoffersena: LR꜀꜀ = LRᵤ꜀ + LRᵢₙd. Wspólna hipoteza zerowa mówi, że prawdopodobieństwo przekroczenia wynosi α, a przekroczenia są niezależne w czasie. W standardowym ujęciu dużej próby sumę porównuje się z rozkładem chi-kwadrat o dwóch stopniach swobody.

Raportuj również wyniki składowych testu, a nie tylko test łączny. Odrzucenie pokrycia warunkowego oznacza, że oba warunki razem nie pasują do zaobserwowanej sekwencji przy założeniach testu, ale nie wskazuje przyczyny. Jeśli POF odrzuca, a niezależność nie, wyraźniejszym sygnałem może być łączna liczba. Jeśli test niezależności odrzuca, sprawdź kolejność, nawet gdy łączna liczba jest bliska celowi. Jeśli żaden nie odrzuca, próba nadal może być zbyt krótka, by ujawnić błędną specyfikację.

Interpretacja jest ograniczona. Test sprowadza każdy dzień do wyniku binarnego, więc nie rozróżnia straty przekraczającej VaR o 1 USD od straty przekraczającej go o 1 mln USD. Nie sprawdza też całego rozkładu strat ani nie dowodzi, że Expected Shortfall jest poprawny. O różnicy między pytaniami dotyczącymi ryzyka ogonowego przeczytasz w przewodniku VaR a Expected Shortfall.

Rzadkie przekroczenia utrudniają wnioskowanie z krótkiej próby

Przy VaR 99% próba 250 dni oznacza tylko 2.5 oczekiwanego przekroczenia. Jeśli niezależne hity mają prawdopodobieństwo 1%, oczekiwana liczba przejść hit-po-hicie w 249 sąsiednich parach wynosi około 249 × 0.01² = 0.025. Większość takich prób nie będzie zawierać żadnej pary kolejnych przekroczeń, nawet gdy model jest poprawnie skalibrowany. Ta rzadkość utrudnia precyzyjne szacowanie prawdopodobieństw przejścia i może ograniczać moc testu zależności.

Christoffersen i Pelletier wskazują, że istniejące backtesty VaR mogą mieć stosunkowo niską moc w realistycznych małych próbach. W artykule z 2004 r. analizują testy oparte na czasie trwania, które modelują odstępy między przekroczeniami. Wyniki uzasadniają dodatkową diagnostykę, ale nie dowodzą, że test czasu trwania jest zawsze lepszy ani nie znoszą potrzeby dopasowania testu do prognozy ryzyka i projektu próby. Przy małej liczbie obserwacji opisz ograniczenia zamiast traktować brak odrzucenia jako potwierdzenie poprawności.

Ważny jest również docelowy poziom ryzyka ogonowego. Przy VaR 95% próba 250 dni oznacza 12.5 oczekiwanego przekroczenia, a przy 99.9% tylko 0.25. Ta sama nazwa testu nie oznacza porównywalnej ilości dowodów w różnych projektach. Podaj poziom ufności, horyzont, liczbę obserwacji, docelową i zaobserwowaną liczbę przekroczeń, liczbę przejść oraz informację, czy użyto odniesienia asymptotycznego, czy metody dla skończonej próby.

Kiedy zastosować inną diagnostykę?

Wybierz kolejną diagnostykę, pytając, jakich informacji nie wykorzystały oba testy. Jeśli chcesz sprawdzić, czy przekroczenia da się przewidywać na podstawie opóźnionych hitów, prognoz VaR lub innych zmiennych znanych w chwili prognozy, test dynamic quantile (DQ) Engle’a i Manganelliego sprawdza ograniczenia dotyczące scentrowanych wskaźników przekroczeń i wybranego zestawu instrumentów. Wynik zależy od tych instrumentów i ich dostępności w czasie; test nie obejmuje każdego możliwego błędu warunkowego. Test czasu trwania analizuje natomiast czas oczekiwania między przekroczeniami i rozszerza analizę w inny sposób. Artykuł CAViaR opisuje konstrukcję DQ.

Jeśli problemem jest wielkość straty po przekroczeniu granicy VaR, sama częstość i niezależność nie wystarczą. Sprawdź wysokość przekroczeń i wybierz metodę oceny Expected Shortfall odpowiednią dla prognozy oraz założeń. Jeśli problemem jest wybór najlepszego wyniku po przetestowaniu wielu modeli, backtesting VaR nie rozwiązuje ryzyka selekcji strategii. Zobacz PBO i CSCV — odrębną diagnostykę opartą na rangach.

Przydatny raport określa portfel i konwencję straty, horyzont prognozy, poziom ufności, daty oceny, sposób tworzenia prognoz, definicję przekroczenia, liczbę oczekiwaną i zaobserwowaną, statystykę POF, liczbę przejść, wyniki testów niezależności i pokrycia warunkowego oraz ograniczenia wynikające z małej próby lub nakładających się horyzontów. Dołącz wykresy prognozowanych progów i zrealizowanych strat, a podczas wyboru modelu nie otwieraj późniejszych danych oceny. Dzięki temu dowody historyczne są czytelne, ale pozytywny wynik backtestu nie gwarantuje przyszłej kontroli ryzyka.

Częste pytania

Q1Czy brak odrzucenia w teście Kupieca oznacza, że mój model VaR jest dokładny?

Nie. Oznacza, że przy założeniach testu nie znaleziono wystarczających dowodów przeciw określonej stopie przekroczeń. Krótka próba, szczególnie przy poziomie ufności 99% lub wyższym, może zawierać za mało przekroczeń, by ujawnić problem.

Q2Czy dwa modele, które przechodzą ten sam test Kupieca, mogą mieć różne wzorce przekroczeń?

Tak. Statystyka Kupieca zależy od liczby, nie od kolejności. Test niezależności Christoffersena dodaje informację o tym, czy przekroczenia grupują się w sąsiednich obserwacjach.

Q3Czy te testy mówią, jak duża może być strata po przekroczeniu VaR?

Nie. Używają wskaźnika przekroczenia i nie mierzą jego wielkości. Jeśli ważna jest strata po przekroczeniu granicy VaR, sprawdź straty ogonowe i osobno oceń Expected Shortfall.

Źródła i dalsza lektura

Zgłoś problem

Przygotujemy e-mail z linkiem do tego artykułu. Mark otrzyma zgłoszenie dopiero po jego wysłaniu

Szybki test

Przeczytano? Sprawdź się w 3 pytaniach

Pytanie 1 / 3

Pytanie 01

Jaką cechę wykorzystuje test POF Kupieca?

Wybierz odpowiedź, aby zobaczyć wyjaśnienie

Słownik opcji