Skip to content
Wszystkie przewodniki po opcjach
Ocena prognoz gęstościowych13 min read

Transformacja całkowa prawdopodobieństwa: kalibracja prognoz gęstościowych

Dowiedz się, jak PIT ocenia ciągłe i dyskretne prognozy gęstościowe, co pokazuje histogram i dlaczego sama jednostajność nie wystarcza

W tym przewodnikuDlaczego prognoza gęstościowa wymaga więcej niż błędu punktowego

Krótkie podsumowanie

Prognoza gęstościowa przypisuje prawdopodobieństwa do zakresu możliwych wyników. Transformacja całkowa prawdopodobieństwa (PIT) zamienia każdy zaobserwowany wynik na jego skumulowane prawdopodobieństwo według prognozy. Jednostajne wartości PIT są użyteczną diagnostyką przy określonych założeniach, ale płaski histogram sam nie dowodzi kalibracji warunkowej ani niezależności w czasie.

Dlaczego prognoza gęstościowa wymaga więcej niż błędu punktowego

Prognoza punktowa może przewidywać jutrzejszą stopę zwrotu na poziomie 0,2%. Prognoza gęstościowa przypisuje prawdopodobieństwa całemu zakresowi zwrotów, od zwykłych zmian po zdarzenia skrajne. Oceniamy więc, czy rozkład opublikowany przed poznaniem wyniku jest zgodny z późniejszymi obserwacjami. Przewodnik Mincera–Zarnowitza dotyczy kalibracji liniowej liczbowych prognoz punktowych, czyli innego zagadnienia.

PIT mierzy skumulowane prawdopodobieństwo przypisane przez prognozę wartościom nie większym od wyniku. To ranga probabilistyczna, a nie stopa zwrotu, sygnał transakcyjny czy miara zysku. Przewodnik Diebolda–Mariana porównuje średnie straty prognoz według wybranego wyniku; nie bada tego samego co kalibracja gęstości.

Przekształć prognozę ciągłą za pomocą dystrybuanty

Niech (Y_{t+1}) oznacza wynik po chwili prognozy (t), a (F_{t+1}(y\mid\mathcal I_t)) niech będzie prognozowaną dystrybuantą (CDF), opartą wyłącznie na informacjach dostępnych wtedy w (\mathcal I_t). Dla rozkładu ciągłego obliczamy

Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ)

CDF to prawdopodobieństwo wartości nie większej niż (y). Jeśli prognozowana CDF jest prawdziwym rozkładem warunkowym, twierdzenie PIT daje

Pr(Uₜ₊₁ ≤ u | 𝓘ₜ) = u, for 0 ≤ u ≤ 1

Idealna ciągła prognoza na jeden krok tworzy zatem PIT jednostajne warunkowo względem informacji prognozy. W szeregu, którego informacja obejmuje przeszłość, idealne PIT są także niezależne między chwilami prognozy przy odpowiednich założeniach. Rosenblatt badał tę transformację; Diebold, Gunther i Tay wykorzystali sekwencje PIT do oceny prognoz gęstościowych (1952; 1998).

Przykład do ręcznego sprawdzenia: prognoza (N(0,1)) i wynik (y=1) dają (Phi(1)\approx0.8413). Prognoza przypisała około 84,13% prawdopodobieństwa wartościom do 1. Jedna obserwacja nie przesądza o kalibracji; potrzebny jest szereg.

Losuj transformację dla wyników dyskretnych

Dyskretna CDF ma skoki przy możliwych wynikach. Zwykłe (F(Y)) przyjmuje więc tylko niektóre poziomy i na ogół nie jest jednostajne nawet przy poprawnej prognozie. Losowe PIT wypełnia każdy przedział skoku:

Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ) + Vₜ₊₁ [Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ) − Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ)]

(F(y^-)) jest granicą lewostronną, czyli prawdopodobieństwem wartości ściśle mniejszej od (y); (V) to niezależny los Uniform(0,1) używany wyłącznie do oceny. Dla rozkładu ciągłego skok jest zerowy, a wzór redukuje się do (F(Y)). Brockwell dowodzi tej transformacji dla dowolnych rozkładów, także dyskretnych i mieszanych (2007). Dla uporządkowanych danych zliczeniowych Czado, Gneiting i Held omawiają też PIT bez losowania i wykresy kalibracji marginalnej; dyskretnego (F(Y)) nie należy traktować jak ciągłego rozkładu jednostajnego (2009).

Hipotetyczny przykład Bernoulliego: (P(Y=1)=0.20), (P(Y=0)=0.80). Zwykłe PIT wynosi 0,80 dla (Y=0) i 1,00 dla (Y=1), więc nie jest jednostajne. Po losowaniu (Y=0) daje (0.80V) w ([0,0.80]), a (Y=1) daje (0.80+0.20V) w ([0.80,1]). Po uwzględnieniu prawdopodobieństw zdarzeń łączna gęstość jest jednostajna na ([0,1]). Losowanie służy ocenie, nie jest częścią prognozy.

Oddziel jednostajność marginalną od niezależności i kalibracji warunkowej

Jednostajny rozkład marginalny PIT jest konieczny dla idealnych prognoz ciągłych, ale niewystarczający. Przeciwne błędy w różnych reżimach mogą się skompensować po połączeniu danych i dać płaski histogram. Gneiting, Balabdaoui i Raftery pokazują, że niemal jednostajne PIT może współistnieć z obciążonymi prognozami indywidualnymi (2007).

Ważna jest też kolejność. Szereg może mieć jednostajny histogram, a zarazem zależność szeregową, np. skupiska lub długie serie podobnych wartości. Idealne prognozy warunkowe implikują więcej niż jednostajność po agregacji. Przy nakładających się horyzontach rozkład odniesienia musi uwzględniać to nakładanie; test iid nie zawsze pasuje.

Sprawdź rozkład PIT oraz jego zależność od czasu, opóźnień, zmiennych z chwili prognozy i reżimów ustalonych wcześniej. Wykresy grupowe i testy warunkowe mogą ujawnić ukryte wzorce, lecz liczą się wybór grup i ograniczenia próby. Żaden skończony zestaw testów nie dowodzi kalibracji względem wszystkich możliwych zmiennych warunkujących.

Traktuj histogram PIT jako wskazówkę, nie werdykt

Kształt U często pasuje do prognoz zbyt skupionych lub niedostatecznie rozproszonych; garb w środku często do prognoz zbyt szerokich. Nierównowaga lewo-prawo może wskazywać na błąd położenia. To heurystyki, nie jednoznaczne diagnozy: zależność, mieszanka reżimów, dyskretność, podział na przedziały i mała próba mogą mylić.

Histogram usuwa kolejność obserwacji, więc nie pokazuje początku problemu, skupiania dużych wartości ani źle skalibrowanej podgrupy. Szerokie przedziały mogą ukryć problem, a wąskie wyglądać nieregularnie przez szum próby. Podaj liczbę prognoz, granice przedziałów i — jeśli to możliwe — niepewność. Testy Diebolda–Gunthera–Taya i Berkowitza wymagają założeń dopasowanych do projektu. Berkowitz przekształca wewnętrzne PIT do (Z_t=\Phi^{-1}(U_t)) i bada łączną hipotezę zerową niezależnych standardowych zmiennych normalnych wobec określonej alternatywy dynamicznej, np. AR(1). To nie uniwersalny certyfikat (2001).

<!-- learn:illustration -->

Pozbawiona tekstu krzywa gęstości łączy znaczniki zaobserwowanych wartości z równomiernie rozmieszczonymi punktami na paśmie rozkładu jednostajnego
Koncepcyjna ilustracja przekształcenia zaobserwowanego wyniku za pomocą prognozowanej dystrybuanty; bez danych empirycznych i wyników diagnostycznych.

Uwzględnij estymację i oceniaj poza próbą

Wynik o jednostajności zakłada, że CDF jest prawdziwym prawem warunkowym. W praktyce parametry się estymuje, wybiera rodzinę rozkładów, a progi i cechy mogą być dostrajane. Prognoza (F_{t+1}(\cdot;\hat\theta_t)) jest więc częścią procedury. Dopasowanie modelu na wynikach z okresu oceny, a następnie przedstawienie PIT jako nietkniętego dowodu poza próbą, powoduje wyciek informacji.

W ocenie kroczącej używaj tylko informacji dostępnych w chwili każdej prognozy. Zapisuj okno estymacji, częstotliwość ponownej estymacji, wersję danych i modelu oraz etapy wyboru. Sąsiednie okna często współdzielą obserwacje; nakładające się wyniki dodają zależność.

Rozmiar i moc testu zależą od estymatora, próby i procedury. Histogram PIT nie uwzględnia niepewności parametrów, a podręcznikowe wartości iid nie pasują do każdego projektu estymowanego lub nakładającego się. Przy ważnym wnioskowaniu wybierz odpowiedni test albo symuluj/bootstrapuj hipotezę zerową, powtarzając pełną procedurę estymacji i prognozowania. Jeśli to potrzebne, zachowaj końcową próbę poza wyborem modelu.

Odróżnij kalibrację od ostrości

Kalibracja dotyczy związku prognoz z wynikami: czy zdarzenia z przypisanym prawdopodobieństwem występują z odpowiednią częstością? Ostrość opisuje koncentrację rozkładów prognoz bez oglądania wyników. Gneiting, Balabdaoui i Raftery uznają ostrość za pożądaną przy zachowaniu kalibracji, a nie za jej zamiennik.

Szeroka prognoza może być skalibrowana, lecz mało informacyjna. Wąska może wyglądać precyzyjnie, ale być źle skalibrowana, gdy wyniki często wypadają poza jej masę prawdopodobieństwa. PIT ocenia spójność rozkładu; miary ostrości opisują rozrzut i szerokość. Raportowanie tylko jednej pomija część oceny.

Płaskie zbiorcze PIT może ukryć błędy według reżimu zmienności lub horyzontu. Ważne warunki określ wcześniej. To zagadnienie wiąże się, lecz różni od regresji prognoz punktowych i testu warunkowej zdolności predykcyjnej Giacomini–White, który porównuje straty warunkowo względem wybranych informacji.

Porównuj pełne prognozy właściwymi wynikami na tych samych obserwacjach

PIT jest przede wszystkim diagnostyką, nie samodzielnym rankingiem prognoz gęstościowych. Logarytmiczny wynik i continuous ranked probability score (CRPS) przypisują skalarną stratę każdej parze prognoza–wynik; z definicji oczekiwana strata jest najmniejsza dla prawdziwego rozkładu predykcyjnego. Średnia z jednej próby nie dowodzi poprawności modelu. Przewodnik Model Confidence Set omawia porównanie zbiorów. Użyj wyniku zdefiniowanego dla pełnego rozkładu na tych samych wynikach.

Podaj cel, horyzont, wspólne daty, konwencję straty i benchmark. Logarytmiczny wynik silnie reaguje na bardzo małą gęstość przy obserwacji; CRPS porównuje dystrybuanty z inną wrażliwością. Niepewność różnic wyników powinna uwzględniać zależność szeregową, estymację i wyszukiwanie modeli. Wykresy PIT i wyniki uzupełniają się.

Kalibracja ani lepszy wynik nie dowodzą zyskowności handlu. Twierdzenie o handlu wymaga osobnej reguły decyzji, momentu dostępności informacji, wielkości pozycji, kosztów transakcyjnych i finansowania oraz oceny zwrotów poza próbą. Statystyka oceny prognozy nie jest zwrotem z backtestu.

Stosuj odtwarzalny schemat PIT

Ustal cel, horyzont, czas prognozy, wersję wyniku i to, czy rozkład jest ciągły, dyskretny czy mieszany. Zachowaj każdą CDF albo informacje potrzebne do jej odtworzenia wraz z wynikiem i zbiorem informacji. Dla ciągłych licz (F_t(Y_t)); przy skokach dokumentuj losowe PIT lub diagnostykę dla danych dyskretnych.

Zbadaj rozkład marginalny i kolejność w czasie. Podaj przedziały, liczebność próby, obsługę remisów i ziarno losowe lub procedurę powtórzeń. Dodaj testy niezależności/warunkowe odpowiadające wcześniej określonemu pytaniu i stosuj wnioskowanie właściwe dla ocen kroczących, nakładających się lub estymowanych. Modele porównuj osobno właściwymi wynikami na tych samych odłożonych obserwacjach. Wniosek dotyczy zdefiniowanych prognoz i warunków, a nie gwarancji przyszłej kalibracji ani zysku.

Częste pytania

Q1Czy jednostajne PIT dowodzi poprawności prognozy gęstościowej?

Nie. To konieczny warunek diagnostyczny przy poprawnej prognozie ciągłej, ale jednostajność zbiorcza nie dowodzi niezależności ani kalibracji warunkowej. Sprawdź zależność w czasie i istotne zmienne warunkujące.

Q2Czy stosować losowe PIT dla prognozy dyskretnej?

Tak, jeśli potrzebujesz odniesienia continuous-uniform przy poprawnym rozkładzie dyskretnym. Dodatkowe losowanie rozkłada wynik w skoku CDF. Zapisz metodę i ziarno; rozważ diagnostykę dyskretną, jeśli chcesz uniknąć losowania.

Q3Co oznacza histogram PIT w kształcie U?

Często pasuje do zbyt skupionych prognoz; centralny garb bywa zgodny ze zbyt szerokimi prognozami. To wskazówki, nie jednoznaczne diagnozy; sprawdź zależność, reżimy, próbę i przedziały.

Q4Czy lepszy histogram PIT oznacza lepszy wynik prognozy?

Nie. PIT diagnozuje zachowanie rozkładu, a właściwe wyniki porównują prognozy przy określonej stracie i celu. Raportuj oba na wspólnych wynikach poza próbą i nie utożsamiaj ich z zyskiem z handlu. Badania pierwotne - Rosenblatt, “Remarks on a Multivariate Transformation” (1952) - Diebold, Gunther, and Tay, “Evaluating Density Forecasts with Applications to Financial Risk Management” (1998) - Berkowitz, “Testing Density Forecasts, with Applications to Risk Management” (2001) - Gneiting, Balabdaoui, and Raftery, “Probabilistic Forecasts, Calibration and Sharpness” (2007) - Brockwell, “Universal Residuals: A Multivariate Transformation” (2007) - Czado, Gneiting, and Held, “Predictive Model Assessment for Count Data” (2009)

Źródła i dalsza lektura

Zgłoś problem

Przygotujemy e-mail z linkiem do tego artykułu. Mark otrzyma zgłoszenie dopiero po jego wysłaniu

Szybki test

Przeczytano? Sprawdź się w 3 pytaniach

Pytanie 1 / 3

Pytanie 01

Co wynika z twierdzenia PIT dla poprawnej ciągłej prognozy warunkowej na jeden krok?

Wybierz odpowiedź, aby zobaczyć wyjaśnienie

Słownik opcji