Test Giacomini–White: warunkowa trafność prognoz
Sprawdź, jak test Giacomini–White ocenia, czy trafność prognoz zależy od znanych warunków, jak dobierać instrumenty i czego można dowiedzieć się z wyniku
W tym przewodnikuŚrednia trafność i trafność warunkowa odpowiadają na różne pytania
Krótkie podsumowanie
Schemat Giacomini–White (GW) sprawdza, czy informacje dostępne w chwili tworzenia prognozy wiążą się ze względną stratą dwóch prognoz. Może ujawnić różnice niewidoczne w średnim wyniku, ale wnioski zależą od wcześniej wybranej metody prognozowania, okresu oceny, funkcji straty i zmiennych warunkujących.
Średnia trafność i trafność warunkowa odpowiadają na różne pytania
Załóżmy, że w próbie testowej prognoza A ma niższą średnią stratę niż prognoza B. Średnia może ukrywać przydatny wzorzec: A może sprawdzać się lepiej na spokojnym rynku, a B przy wysokiej zmienności. Jeśli pytanie dotyczy tego, która prognoza była średnio lepsza, odpowiednie jest porównanie bezwarunkowe. Jeśli chcemy ustalić, czy informacje znane w chwili prognozowania pomagają przewidzieć, która metoda będzie lepsza, badamy warunkową zdolność prognostyczną.
Giacomini i White ujmują ten problem jako porównanie metod prognozowania przy określonej funkcji straty i zbiorze informacji. Schemat można zastosować do prognoz punktowych, przedziałowych, probabilistycznych i gęstościowych, o ile strata odpowiada zadaniu. Przedmiotem oceny jest również procedura estymacji, która generuje prognozę. Zatem okno kroczące, stała próba treningowa czy reguła wag nie są nieistotnym szczegółem do zmiany po obejrzeniu wyników, lecz częścią porównywanej metody (Giacomini i White, 2006).
Test warunkowy jest powiązany z testem zmiany strukturalnej, ale nie jest tym samym. Test warunkowy pyta, czy względna strata jest systematycznie związana z wybranymi informacjami. Test zmiany strukturalnej bada, czy parametry lub relacja zmieniły się w nieznanym bądź wskazanym momencie. Przewodnik po teście Diebolda–Mariano omawia bezwarunkowe porównanie średniej straty; pytanie warunkowe wymaga jawnego wskazania informacji, względem których porównujemy prognozy.
Najpierw uzgodnij prognozy, wyniki i moment dostępności informacji
Niech (Y_{t+1}) oznacza cel obserwowany po chwili prognozy (t). Prognozy ŷA,t+1 i ŷB,t+1 muszą dotyczyć tego samego celu, horyzontu i jednostki oraz uwzględniać ten sam moment odcięcia informacji. Dla funkcji straty (L), w której niższa wartość oznacza lepszy wynik, zdefiniuj różnicę strat:
dₜ₊₁ = L(Yₜ₊₁, ŷA,ₜ₊₁) − L(Yₜ₊₁, ŷB,ₜ₊₁)
Przy tej konwencji znaku wartość dodatnia oznacza, że A poniosła większą stratę, więc w danym momencie B wypadła lepiej; wartość ujemna przemawia za A. Utwórz jeden wiersz dla każdej chwili prognozy i oceń obie prognozy względem tej samej realizacji. Zachowaj prognozy dostępne w tamtym czasie oraz wersję danych i modelu. Nie odtwarzaj prognoz historycznych z użyciem zrewidowanych danych wejściowych ani informacji, które pojawiły się później.
Zmienne warunkujące również muszą być znane w chwili prognozy. Przykłady to opóźniony szacunek zmienności, wcześniej ogłoszony wskaźnik zdarzenia, opóźniona różnica strat albo stan rynku wyliczony wyłącznie z wcześniejszych obserwacji. Zmienna zmierzona po chwili (t) nie może bez obciążenia wynikającego z wykorzystania przyszłych informacji wyjaśniać, która prognoza była lepsza w chwili (t+1).
Dobierz miarę do celu prognozy. Błąd kwadratowy jest jedną z możliwości dla prognozy średniej warunkowej, ale nie musi pasować do prognozy zmienności, kwantyla czy gęstości. Jeśli jeden model prognozuje wariancję, a drugi odchylenie standardowe, najpierw przelicz je tak, by prognozowały tę samą wielkość. Test nie naprawi niedopasowania badanego pytania.
W przypadku prognoz zmienności oceniaj obie metody względem tej samej definicji zrealizowanej wariancji i tego samego interwału próbkowania. Jeżeli jedna prognoza dotyczy cen śróddziennych, a druga obejmuje również zwroty nocne, różnica strat może wynikać z innego celu, a nie z jakości prognoz. Ustal sposób uwzględniania ruchów podczas zamknięcia rynku, częstotliwość próbkowania, brakujących obserwacji i miary zrealizowanej, a następnie stosuj te zasady konsekwentnie. Jeśli zrealizowany wskaźnik jest zaszumiony, błąd pomiaru wpływa na obie straty i należy uwzględnić go w interpretacji.
Zapisz warunkową hipotezę zerową i wybierz funkcje testowe
Niech (𝒢ₜ) oznacza informacje wykorzystywane do warunkowania porównania. Idealizowana hipoteza zerowa ma postać:
H₀: E[dₜ₊₁ | 𝒢ₜ] = 0
Oznacza to, że oczekiwana różnica strat wynosi zero przy uwzględnieniu wskazanych informacji. Jednokrokowy test GW przekształca to stwierdzenie warunkowe w zestaw momentów przy użyciu ustalonego wcześniej wektora funkcji testowych (h_t), mierzalnych na podstawie informacji dostępnych w chwili (t):
H₀,ₕ: E[hₜ dₜ₊₁] = 0
Wektor (h_t) może zawierać stałą, która uwzględnia średnią różnicę strat. Pozostałe elementy mogą opisywać stan rynku, opóźnioną stratę względną lub transformację nieliniową wybraną przed analizą wyników. Na przykład jeśli (S_t) jest binarnym wskaźnikiem wysokiej zmienności znanym w chwili (t), przyjęcie (h_t=(1,S_t)') pozwala testować zarówno moment stały, jak i związek różnicy strat z tym stanem.
Skończony zestaw funkcji testowych sprawdza wyłącznie wyznaczone przez nie momenty. Odrzucenie oznacza, że przy założeniach testu co najmniej jeden wybrany moment jest niezgodny z zerem; nie wskazuje modelu najlepszego w każdej sytuacji ani nie dowodzi, że znaczenie ma każda możliwa zmienna stanu. Brak odrzucenia nie dowodzi równej trafności warunkowej. Test wykorzystujący wyłącznie stałą porównuje moment bezwarunkowy, a nie przeszukuje wszystkich możliwych warunków.
Ustal funkcję straty, instrumenty, transformacje, próbę i horyzont prognozy, zanim sprawdzisz, który model wygrywa. Dodawanie wielu wskaźników stanu, progów i opóźnień po obejrzeniu wyników tworzy odrębny problem selekcji. Sam test warunkowy nie koryguje tej selekcji.
Ustal też moment obliczania każdej zmiennej stanu. Jeśli „wysoka zmienność” oznacza górne 20 procent zmienności w całej próbie, przyszłe obserwacje wpływają na próg przypisany do wcześniejszych chwil prognozy. Próg oszacuj wyłącznie z informacji dostępnych do każdej chwili prognozy albo użyj reguły ogłoszonej wcześniej. Dla ciągłej zmiennej stanu określ z wyprzedzeniem jednostki, centrowanie i skalowanie. Kilka niemal identycznych wskaźników może powodować redundantne momenty i utrudniać odwrócenie macierzy kowariancji, dlatego wybierz najmniejszy zestaw o jasnej interpretacji.
Oblicz statystykę Walda i zinterpretuj rozkład odniesienia
Dla (q) funkcji testowych utwórz wektor momentów (g_{t+1}=h_t d_{t+1}). Jego średnia z próby wynosi:
ḡ = (1/n) Σₜ gₜ₊₁
Jednokrokowa statystyka GW ma postać statystyki Walda:
GW = n ḡ′ Ω̂⁻¹ ḡ
(Ω̂) szacuje macierz kowariancji wektora momentów. Przy hipotezie zerowej i warunkach regularności z pierwotnej pracy statystyka ma asymptotyczny rozkład chi-kwadrat o (q) stopniach swobody. Liczba funkcji testowych określa zatem rozkład odniesienia i może wpływać na moc testu. Wiele słabych lub redundantnych instrumentów może destabilizować kowariancję, nie dodając istotnych informacji.
W konfiguracji jednokrokowej hipoteza zerowa implikuje strukturę różnicy martyngałowej wektora momentów, dlatego pierwotny test może wykorzystywać estymator na podstawie drugich momentów próby. Przy innych horyzontach, nakładających się wynikach albo odstępstwach od tej konfiguracji wariancja musi odpowiadać założeniom i strukturze zależności właściwym dla testu. Nie przenoś automatycznie pasma HAC z innego testu; postępuj zgodnie ze specyfikacją wybranej implementacji. Ogólne metody estymacji kowariancji HAC, w tym estymator Neweya i Westa (1987), są narzędziami w zastosowaniach, które ich wymagają, a nie uniwersalną wskazówką dotyczącą pasma w teście GW. Wiarygodność wyniku zależy od estymacji kowariancji i projektu prognoz.
Sprawdź również, czy (Ω̂) można oszacować na podstawie wybranych momentów. Niemal powielające się funkcje testowe, wskaźnik z niewielką liczbą obserwacji w jednym stanie lub zbyt wiele interakcji mogą sprawić, że macierz będzie osobliwa albo niestabilna. Jej odwrotność może wtedy silnie zmieniać się przy drobnej korekcie danych i zniekształcić statystykę testową. Każda funkcja powinna mieć uzasadnienie związane z konkretnym warunkiem lub różnicą jakości prognoz; podaj ich liczbę oraz kowariancję momentów. Usunięcie nieprzydatnej funkcji po obejrzeniu wyniku jest kolejnym etapem selekcji i trzeba je ujawnić.
Wartość p stanowi dowód przeciwko wskazanym ograniczeniom momentów w świetle rozkładu odniesienia i założeń testu. Nie jest prawdopodobieństwem, że prawdziwy model to A lub B, ani szansą na zysk z reguły transakcyjnej. Podaj statystykę, stopnie swobody, wartość p oraz dokładne testowane momenty, by czytelnicy wiedzieli, co oznacza odrzucenie.
<!-- learn:illustration -->

Przykład dwóch stanów pokazuje, co może ukryć średnia
Rozważ osiem hipotetycznych jednokrokowych chwil prognozy. Niech (S_t=0) oznacza spokojny stan, a (S_t=1) stan wysokiej zmienności. Załóżmy, że hipotetyczne różnice strat (d_{t+1}=L_A-L_B) wynoszą −2, −2, −2 i −2 dla czterech spokojnych chwil oraz +2, +2, +2 i +2 dla czterech chwil wysokiej zmienności. Ujemne różnice przemawiają za A, a dodatnie za B.
Średnia ze wszystkich ośmiu chwil wynosi zero, więc ten niewielki przykład nie pokazuje bezwarunkowej różnicy strat. Średnia w spokojnym stanie wynosi −2, a w stanie wysokiej zmienności +2. Względny ranking odwraca się wraz ze stanem rynku. Test z (h_t=(1,S_t)') obejmuje moment stały i moment wysokiej zmienności, które mogą wychwycić ten wzorzec.
Te osiem wartości to przykład dydaktyczny, a nie wystarczająca liczba obserwacji do wiarygodnego wnioskowania. W rzeczywistych danych należy uwzględnić sposób estymacji prognoz, wcześniejsze ustalenie zmiennej stanu, liczbę chwil prognozy oraz zmienność momentów różnicy strat w czasie. Sam wykres z podziałem na stany nie dowodzi, że wzorzec będzie trwały.
Traktuj okno estymacji jako element metody
Pierwotna asymptotyka GW zakłada, że maksymalna długość okna estymacji pozostaje skończona, gdy rośnie liczba prognoz poza próbą. Okna kroczące i stała próba estymacyjna odpowiadają temu podstawowemu założeniu. Długość okna i zależna od danych reguła jego wyboru należą do każdej metody prognozowania, dlatego trzeba je ustalić i opisać.
Ma to znaczenie, gdy modele są ponownie estymowane. Porównanie pomijające niepewność parametrów może nie uwzględniać niepewności wynikającej ze sposobu, w jaki każda metoda uczy się na danych historycznych. GW obsługuje prognozy modeli zagnieżdżonych i niezagnieżdżonych przy spełnieniu wskazanych warunków, ale nie gwarantuje poprawności każdego wariantu okna rozszerzanego ani każdego estymatora. W pierwotnym schemacie jednokrokowym podstawowym założeniem jest skończone okno; standardowe okno rozszerzane wykracza poza to założenie. Jeśli rzeczywista konstrukcja prognozy jest inna, użyj wyniku wyprowadzonego dla takiej konfiguracji.
Test nie wybiera za Ciebie właściwej długości okna. Krótkie okno może reagować na bieżące warunki, ale korzysta z mniejszej liczby obserwacji. Długie lub rozszerzane może stabilizować estymację, lecz uwzględniać nieaktualne zależności. Porównaj te możliwości w zaplanowanej wcześniej ocenie i odnotuj sam wybór okna. Giacomini i Rossi (2010) opracowali odrębne testy ścieżki względnej jakości prognoz w niestabilnych środowiskach. To powiązane pytanie, ale nie ta sama statystyka co podstawowy warunkowy test GW.
Samo odrzucenie warunkowe nie tworzy reguły transakcyjnej, która w czasie rzeczywistym wybiera właściwą prognozę. Instrument może być związany z różnicą strat w próbie oceny, nie dając stabilnej ani wykonalnej reguły przełączania. Jeśli bieżące informacje mają służyć do wyboru prognozy, zdefiniuj regułę na podstawie wcześniejszych obserwacji i oceń ją na późniejszym, nietkniętym zbiorze chwil prognozy, uwzględniając również niepewność estymacji i decyzji.
Odróżnij GW od testów DM, modeli zagnieżdżonych i niestabilności
Test Diebolda–Mariano sprawdza, czy dwie prognozy mają tę samą średnią stratę w próbie oceny. GW pyta, czy wybrane informacje wiążą się ze stratą względną, a porównanie bezwarunkowe traktuje jako szczególne ograniczenie momentu. Jak pokazuje przykład dwóch stanów, średnie wyniki mogą być równe, mimo że względna jakość zależy od warunków.
Jeśli prognozy pochodzą z modeli zagnieżdżonych, a pytanie dotyczy równości MSPE, metoda taka jak korekta Clarka–Westa dotyczy innej hipotezy zerowej i problemu szumu estymacji. Jeśli przeszukano wiele strategii lub prognoz i pytamy, czy którykolwiek kandydat ma przewagę predykcyjną, potrzebna jest procedura dla całej rodziny, taka jak Reality Check White’a lub test SPA Hansena. Test warunkowy dla jednej wybranej pary nie usuwa wcześniejszego, szerszego przeszukiwania.
Jeśli pytanie badawcze dotyczy zmian trafności względnej w czasie, a nie związku z wybranymi instrumentami, lepszy może być test lokalnej niestabilności lub odwróceń. Giacomini i Rossi (2010) analizują takie porównania prognoz. Dobierz metodę do pytania i nie traktuj każdego odrzucenia jako dowodu na strategię zmieniającą reżim.
Gdy porównujesz wiele modeli, procedura dla całej rodziny może odpowiadać na inne pytanie niż parami stosowany test warunkowy. Przewodnik po zbiorze Model Confidence Set wyjaśnia, jak iteracyjne porównanie może pozostawić zbiór modeli nierozróżnialnych na wybranym poziomie. Nie zastępuje to wcześniejszego ustalenia warunków w analizie GW.
Uwzględnij niską moc i wielokrotne testowanie
Testy warunkowe mogą wymagać dużej ilości danych. Podział próby na spokojne i zmienne okresy ogranicza liczbę obserwacji wspierających każde porównanie. Dodawanie funkcji zwiększa liczbę momentów i stopni swobody. Jeżeli kilka warunków jest tylko słabo powiązanych ze stratą względną, test może mieć niską moc nawet przy rzeczywistych różnicach warunkowych.
Dokument roboczy McCrackena z Federal Reserve Bank of St. Louis analizuje istnienie, rozmiar i moc testu GW w prostym przykładzie ze stratą kwadratową. Symulacje wskazują, że w badanych konfiguracjach rozmiar testu może być prawidłowy, lecz jego moc jest zwykle niska (McCracken, 2020). To ostrzeżenie dotyczące interpretacji, nie uniwersalna prognoza liczbowa dla każdego zastosowania. Brak odrzucenia może wynikać z małej ilości informacji lub niskiej mocy; nie dowodzi wymienności prognoz.
Wielokrotne próby z różnymi definicjami stanów, progami, horyzontami, funkcjami strat i datami oceny zwiększają ryzyko przypadkowego odkrycia. Rejestruj wszystkich testowanych kandydatów i oddziel analizę eksploracyjną od wcześniej ustalonej próby potwierdzającej. Jeśli chcesz twierdzić, że jedna strategia z całej rodziny ma zdolność predykcyjną, zastosuj właściwą korektę wielokrotnego testowania lub procedurę uwzględniającą data snooping dla całej rodziny. Więcej instrumentów warunkowych nie musi oznaczać mocniejszych dowodów.
Gdy pozostaje wiele modeli, procedura dla rodziny odpowiada na inne pytanie niż test warunkowy pojedynczej pary. Przewodnik po zbiorze Model Confidence Set opisuje iteracyjne porównanie, które zachowuje zbiór modeli nierozróżnialnych na wybranym poziomie. Nie zwalnia to z wcześniejszego określenia warunków w analizie GW.
Opisz projekt tak, aby inni mogli go odtworzyć
Podaj obie metody prognozowania i sposób ich estymacji, informację, czy modele są zagnieżdżone, cel i horyzont prognozy oraz daty oceny. Dokładnie określ funkcję straty i konwencję znaku dla (d_{t+1}). Opisz każdy element (h_t), sposób jego konstrukcji, moment dostępności oraz to, czy został wybrany przed obejrzeniem wyników.
Zamieść harmonogram chwil prognozy, regułę okna estymacji, wersję danych, zasady wspólnej próby, liczbę prognoz poza próbą, liczbę funkcji testowych, estymator kowariancji, rozkład odniesienia, statystykę, stopnie swobody i wartość p. Wskaż, czy horyzonty się nakładają i jak uwzględniasz zależności. Podaj średnie straty i podsumowanie różnic strat, a nie tylko wynik testu.
Wymień inne instrumenty, progi, okna, funkcje strat i pary prognoz, które sprawdzano. Jeśli te same obserwacje posłużyły do wyboru modelu lub zmiennych warunkujących, a następnie do ich testowania, ujawnij to. Wynik eksploracyjny może być informacyjny, choć nie jest potwierdzający. Przejrzysty opis pozwala ocenić zakres wniosków i zaplanować osobną walidację.
Częste pytania
Q1Czy test Giacomini–White jest tym samym co test Diebolda–Mariano?
Nie. Diebold–Mariano koncentruje się na równości średnich strat. Jednokrokowy schemat GW testuje wybrane momenty warunkowe, a moment bezwarunkowy jest jednym z możliwych ograniczeń.
Q2Czy odrzucenie wskazuje prognozę właściwą dla każdego reżimu rynkowego?
Nie. Oznacza, że przy założeniach testu co najmniej jeden wybrany moment nie jest zgodny z zerem. Wynik zależy od dobranych instrumentów, próby i straty i nie gwarantuje skuteczności w każdym stanie.
Q3Czy mogę dodawać progi zmienności, aż test odrzuci hipotezę?
To tworzy problem przeszukiwania zmiennych warunkujących. W miarę możliwości ustal je wcześniej i opisz wszystkie sprawdzone specyfikacje. Przy szerokim twierdzeniu o zdolności prognostycznej zastosuj osobną próbę potwierdzającą albo odpowiednią korektę dla całej rodziny kandydatów.
Q4Czy warunkowa zdolność prognostyczna oznacza zyskowność strategii handlowej?
Nie. Test porównuje straty prognoz. Twierdzenie o handlu wymaga określenia reguły decyzyjnej oraz osobnej oceny realizacji zleceń, opłat, finansowania, wpływu na rynek i ryzyka. Najważniejsze badania - Giacomini and White, “Tests of Conditional Predictive Ability” (2006) - Giacomini and Rossi, “Forecast Comparisons in Unstable Environments” (2010) - McCracken, “Tests of Conditional Predictive Ability: Existence, Size, and Power” (Federal Reserve Bank of St. Louis Working Paper, 2020) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995) - Newey and West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)
Źródła i dalsza lektura
Zgłoś problem
Przygotujemy e-mail z linkiem do tego artykułu. Mark otrzyma zgłoszenie dopiero po jego wysłaniu
Szybki test
Przeczytano? Sprawdź się w 3 pytaniach
Pytanie 01
Co oznacza dodatnia różnica strat, gdy dₜ₊₁ = L(A) − L(B)?
Wybierz odpowiedź, aby zobaczyć wyjaśnienie