Skip to content
Wszystkie przewodniki po opcjach
Ocena prognoz kierunku13 min czytania

Test Pesaran–Timmermanna: czy prognoza kierunku wnosi dodatkową informację?

Dowiedz się, jak test Pesaran–Timmermanna porównuje trafność kierunku z poziomem bazowym wynikającym z udziału rzeczywistych i prognozowanych wzrostów oraz dlaczego zależność szeregowa zmienia wnioskowanie.

W tym przewodnikuOdsetek trafień 64% może być przeciętny lub użyteczny — zależnie od poziomu bazowego

Krótkie podsumowanie

Test Pesaran–Timmermanna (PT) sprawdza, czy prognozy zawierają informacje o kierunku zmiany wyniku. W przypadku binarnej prognozy wzrost/spadek porównuje zaobserwowany odsetek trafień z poziomem zgodności wynikającym osobno z udziału rzeczywistych wzrostów i prognoz wzrostu. Ten poziom bazowy nie musi wynosić 50%. Standardowy test opiera się też na założeniach dotyczących zależności między momentami sporządzania prognoz, a istotność statystyczna nie dowodzi, że reguła transakcyjna jest rentowna.

Odsetek trafień 64% może być przeciętny lub użyteczny — zależnie od poziomu bazowego

Załóżmy, że rynek rośnie w 60% dni w próbie oceny. Prognozujący wskazuje „wzrost” w 70% tych dni. Nawet gdyby prognozy i wyniki nie były powiązane, często by się zgadzały: w niektóre dni oba wskazywałyby wzrost, a w inne oba spadek. Mechaniczne porównanie odsetka trafień z 50% pomijałoby tę nierównowagę.

Test PT ujmuje to porównanie wprost. Sprawdza, czy kierunek prognozy i kierunek zrealizowany zgadzają się częściej, niż wynikałoby z ich osobnych częstości przy założeniu niezależności. To test informacji o kierunku, a nie miara wielkości stóp zwrotu, momentu zawarcia transakcji czy wartości całej strategii. Pesaran i Timmermann zaproponowali test jakości prognoz oparty na tablicach kontyngencji; w binarnym przypadku 2×2 jest on asymptotycznie równoważny testowi niezależności {source:pesaranTimmermannDirectionalTests1992}.

Umieść każdą sparowaną prognozę w tabeli dwa na dwa

Niech \(Y_t=1\), gdy zrealizowany wynik zostaje sklasyfikowany jako wzrost, oraz \(Y_t=0\), gdy jest klasyfikowany jako spadek. Niech \(Z_t=1\), gdy prognoza wskazuje wzrost, oraz \(Z_t=0\), gdy wskazuje spadek. Każdy wiersz oceny powinien łączyć prognozę sporządzoną w chwili \(t\) z wynikiem dla horyzontu, który ta prognoza miała przewidzieć.

Cztery komórki zliczają pary wzrost/wzrost, wzrost/spadek, spadek/wzrost i spadek/spadek. Jeśli \(n_{11}\) i \(n_{00}\) oznaczają dwie zgodne komórki, a \(n\) jest liczbą użytecznych, sparowanych obserwacji, zaobserwowany odsetek trafień kierunkowych wynosi

\[ \widehat{P}=\frac{n_{11}+n_{00}}{n}. \]

To ujęcie jest binarne. Z góry zdecyduj, jak traktować zerową stopę zwrotu, zerową prognozę lub przedział neutralny. Przykładowo badanie może klasyfikować stopę zwrotu równą lub niższą od zera jako „brak wzrostu”, a prognozę równą progowi lub niższą — tak samo. Można też wykluczyć remisy, ale zmienia to próbę i wymaga konsekwentnego stosowania. Nie licz zgodności zero-zero jako trzeciego rodzaju dopasowania, używając jednocześnie wzoru na poziom bazowy dla dwóch kategorii.

Wyprowadź poziom bazowy niezależności z obu udziałów wzrostów

Niech \(\hat p_y\) oznacza udział zrealizowanych wyników sklasyfikowanych jako wzrost, a \(\hat p_z\) — udział prognoz wskazujących wzrost. Gdyby etykiety rzeczywiste i prognozowane były niezależne, oczekiwany udział zgodności wynosiłby

\[ \widehat{P}^{*}=\hat p_y\hat p_z+(1-\hat p_y)(1-\hat p_z). \]

Pierwszy iloczyn to prawdopodobieństwo zgodności wzrost/wzrost przy niezależności, a drugi to prawdopodobieństwo zgodności spadek/spadek. Poziom bazowy zależy więc od obu udziałów brzegowych i może być wyższy lub niższy niż 50%. Model, który zawsze prognozuje częściej występujący kierunek, może osiągać pozornie przyzwoity odsetek trafień bez dodawania informacji.

Pokazuje to skrajny przypadek. Jeśli klasyfikator zawsze prognozuje „wzrost”, to \(\hat p_z=1\), zaobserwowany odsetek trafień jest równy udziałowi rzeczywistych wzrostów \(\hat p_y\), a poziom bazowy niezależności również wynosi \(\hat p_y\). Nadwyżka zgodności z definicji wynosi zero. Taka stała prognoza może wyglądać na trafną, gdy wzrosty są częste, ale nie rozróżnia dni, w których rynek wzrośnie; oszacowana wariancja może też być zdegenerowana, więc zwykła wartość p testu PT może nie istnieć.

Rozważmy 100 całkowicie hipotetycznych sparowanych dni. Rzeczywisty wynik wskazuje wzrost w 60 dniach, a prognoza — w 70. Załóżmy, że tabela wygląda następująco:

Kierunek zrealizowanyPrognoza wzrostuPrognoza spadkuRazem
Wzrost471360
Spadek231740
Razem7030100

Zgodnych par jest 64, zatem \(\widehat P=0.64\). Poziom bazowy niezależności wynosi \(0.60\times0.70+0.40\times0.30=0.54\). Zaobserwowany odsetek trafień jest o 10 punktów procentowych wyższy od poziomu bazowego. Wymyślone liczby pokazują wyłącznie rachunek; sama różnica nie jest poprawnym oszacowaniem niepewności ani dowodem użyteczności w handlu.

Skaluj różnicę odsetków trafień według jej oszacowanej niepewności

Dla standardowej binarnej statystyki PT zdefiniujmy

\[ \widehat v=\frac{\widehat P^{*}(1-\widehat P^{*})}{n} \]

oraz

\[ \widehat w=\frac{(2\hat p_y-1)^2\hat p_z(1-\hat p_z)+(2\hat p_z-1)^2\hat p_y(1-\hat p_y)}{n}. \]

Wtedy

\[ PT=\frac{\widehat P-\widehat P^{*}}{\sqrt{\widehat v-\widehat w}}. \]

Przy hipotezie zerowej i standardowych założeniach dużej próby statystyka ma asymptotycznie rozkład normalny standardowy. Licznik to nadmiar zgodności względem poziomu bazowego niezależności. Mianownik uwzględnia, że poziom bazowy szacujemy na tej samej próbie, zamiast traktować go jako stały cel równy 50%. Wzór i notację dokumentuje implementacja statsmodels {source:statsmodelsPesaranTimmermannAPI}.

Powyższy zapis to główna asymptotyczna postać wariancji udokumentowana przez statsmodels. Pełniejsza delta-metoda dla wariancji w próbie skończonej z oryginalnego ujęcia dodaje do \(\widehat w\) składnik \(4\hat p_y\hat p_z(1-\hat p_y)(1-\hat p_z)/n^2\). Ten składnik niższego rzędu nie zmienia asymptotyki pierwszego rzędu, ale może przesunąć statystykę w skończonej próbie. Jeśli wyniki zależą od implementacji, podaj użyty wzór i wersję oprogramowania, zamiast porównywać wartości p tak, jakby każdy pakiet stosował identyczne obliczenia w próbie skończonej.

Wzór nie naprawi słabego projektu badania. Bardzo mała próba, niemal stałe prognozy, puste komórki albo zerowa czy nieprawidłowa oszacowana wariancja mogą sprawić, że zwykłe przybliżenie będzie niewiarygodne lub niezdefiniowane. W takich przypadkach nie wymuszaj wartości p z tego wyrażenia; podaj udziały brzegowe i tabelę, a następnie wybierz procedurę wnioskowania odpowiednią do danych i liczebności próby.

Dla powyższej hipotetycznej tabeli składniki według głównej formuły wynoszą \(\widehat v=0.54(0.46)/100=0.002484\) oraz \(\widehat w=[0.2^2(0.7)(0.3)+0.4^2(0.6)(0.4)]/100=0.000468\). Błąd standardowy to \(\sqrt{0.002484-0.000468}\approx0.0449\), zatem \(PT\approx0.10/0.0449=2.23\). Dwustronny rozkład normalny standardowy daje wartość p około 0.026. To obliczenie wymyślonych danych przy użyciu głównej formuły asymptotycznej; pełniejszy składnik dla próby skończonej nieco zmienia wynik, a zależność szeregowa może unieważnić odniesienie do rozkładu normalnego. Nie przedstawiaj tego jako wyniku empirycznego.

Koncepcyjny schemat 2×2 prognozowanych i zrealizowanych kierunków, z parami miedzianych i turkusowych strzałek pokazujących zgodność, rozbieżność oraz różne udziały brzegowe.
Ilustracja przedstawia pary kierunków i zgodność wynikającą z udziałów brzegowych; to schemat koncepcyjny, a nie dane empiryczne.

Odczytuj odrzucenie jako dowód dotyczący kierunku, nie jako werdykt o handlu

Dodatni licznik oznacza, że obserwowane kierunki zgadzają się częściej niż przy poziomie bazowym niezależności; ujemny — że rzadziej. Wcześniej określony test jednostronny może sprawdzać, czy zgodność przekracza poziom bazowy. Test dwustronny sprawdza, czy związek kierunkowy różni się w którąkolwiek stronę. Hipotezę alternatywną i poziom istotności wybierz przed obejrzeniem wyników.

Mała wartość p stanowi dowód przeciwko określonej hipotezie zerowej przy założeniach testu. Nie jest prawdopodobieństwem prawdziwości hipotezy zerowej ani prawdopodobieństwem, że prognoza sprawdzi się w następnym okresie. Nie mówi też, czy stopy zwrotu wystarczyły na pokrycie spreadu, opłat, wpływu na rynek, finansowania lub kosztu pożyczki. Test nie koryguje również prób wielu aktywów, horyzontów, progów, wariantów modelu czy znaków prognozy, po których raportowany jest tylko zwycięzca. Jeśli przeszukiwano strategie kandydujące, przewodnik po teście White’a Reality Check wyjaśnia, dlaczego selekcję należy uwzględnić we wnioskowaniu.

Z kolei brak podstaw do odrzucenia nie dowodzi, że kierunki rzeczywiste i prognozowane są niezależne. Krótka lub niezrównoważona próba może mieć małą moc wykrywania związku. Ujemny licznik PT również nie dowodzi, że prognoza nie zawiera żadnej struktury; może wskazywać na systematyczną niezgodność. Odwrócenie znaku prognozy po obejrzeniu wyniku stanowi nowy wybór modelu i wymaga oceny na nowych danych albo uwzględnienia w pierwotnej procedurze poszukiwania.

Podaj łącznie udział rzeczywistych wzrostów, udział prognozowanych wzrostów, zaobserwowany odsetek trafień, poziom bazowy niezależności, różnicę w punktach procentowych, hipotezę alternatywną i metodę oszacowania niepewności. Sama wartość p bez marginesów tabeli i wielkości efektu utrudnia odróżnienie małej, lecz precyzyjnie oszacowanej poprawy od większej, ale niepewnej.

Zależność szeregowa może zniekształcić podręcznikowy rozkład odniesienia

Zwykłą statystykę PT najczęściej przedstawia się dla szeregowo niezależnych obserwacji kierunkowych. Etykiety finansowe mogą jednak występować seriami. Obserwacje dzienne mogą współdzielić nakładające się cele kilkudniowe, reżimy zmienności mogą się utrzymywać, a prognozy kroczące mogą ponownie wykorzystywać większość tych samych danych estymacyjnych. Wtedy \(n\) par nie oznacza \(n\) niezależnych porcji informacji. Zwykły błąd standardowy może być zbyt mały, powodując zbyt częste odrzucanie hipotezy zerowej.

W późniejszej pracy Pesaran i Timmermann opracowali testy zależności między szeregowo skorelowanymi zmiennymi wielokategorialnymi, wykorzystujące dynamicznie rozszerzone regresje i schemat łańcucha Markowa o skończonym rzędzie {source:pesaranTimmermannSerialCategories2009}. Badania poświęcone prognozom kierunku również wykazują, że konwencjonalne procedury PT oparte na niezależności mogą zbyt często odrzucać hipotezę przy korelacji szeregowej; analizują też odporne na zależność alternatywy, w tym metody bootstrapowe {source:blaskowitzHerwartzDirectionalSerialCorrelation2014}. Właściwa metoda zależy od sposobu tworzenia prognoz, horyzontu i struktury zależności; ogólny przepis na resampling nie jest automatycznie poprawny.

Podaj, czy początki prognoz nakładają się na siebie, jakie są odstępy między nimi i jaka metoda uwzględniająca zależność dostarcza oszacowania niepewności. Jeśli raportujesz statystykę podręcznikową jako opisowy punkt odniesienia, oznacz założenie niezależności. Nie interpretuj nominalnego wyniku 5% tak, jakby rzeczywisty odsetek fałszywych odrzuceń również wynosił 5%, gdy projekt narusza to założenie.

Oprzyj ocenę na prognozach, które można było sporządzić w danym momencie

Dla każdego początku prognozy zachowaj jej dokładną wersję dostępną w tamtym momencie, horyzont, granicę dostępnych informacji, zrealizowany wynik i regułę zamiany każdego z nich na etykietę wzrost/spadek. Przed utworzeniem tabeli uzgodnij znaczniki czasu, instrumenty, definicję ceny lub stopy zwrotu oraz sposób obsługi braków danych. Prognoza oparta na zrewidowanych danych makroekonomicznych lub sygnale dostrojonym w okresie oceny nie jest nienaruszoną prognozą poza próbą.

Ustal próg klasyfikacji przed obejrzeniem wyników z próby holdout. Jeśli model zwraca prawdopodobieństwo, próg zamienia je na kierunek binarny; przeszukiwanie progów na tej samej próbie zmienia pytanie i powoduje błąd selekcji. Rozdziel role zbioru treningowego, walidacyjnego i końcowej oceny. W każdym resamplingu, który ma uwzględniać poszukiwanie modelu, powtórz cały proces selekcji.

Pytanie testu PT różni się od porównania wielkości błędów prognoz. Przewodnik po teście Diebolda–Mariano porównuje sparowane różnice funkcji straty, a przewodnik po teście Giacomini–White’a pyta, czy względna zdolność prognostyczna zmienia się wraz z wcześniej określonymi informacjami. W przypadku zagnieżdżonych modeli prognoz zobacz przewodnik po korekcie Clarka–Westa. Testy te odpowiadają na inne pytania i nie należy ich zamieniać tylko dlatego, że zwracają znane statystyki testowe.

Istotność kierunkowa nie dowodzi rentowności strategii

Test PT sprowadza każdy wynik do jednej etykiety kierunku. Wzrost o jeden tick i duży rajd liczą się tak samo jako wzrost; małe minięcie się z kierunkiem i dotkliwa strata liczą się tak samo jako jeden błąd kierunkowy. Prognoza może zatem zwiększyć odsetek trafień i mimo to przynosić straty, jeśli błędy są większe niż zyski, sygnał pojawia się po ruchu ceny lub koszty transakcyjne pochłaniają przewagę.

Na przykład wyobraźmy sobie 100 hipotetycznych transakcji o tej samej wielkości: 64 trafne kierunki przynoszą średnio po 0,10% zysku, a 36 błędnych kierunków powoduje średnio po 0,25% straty. Prosta suma brutto wynosi \(64(0.10\%)-36(0.25\%)=-2.6\) punktu procentowego przed kosztami, mimo odsetka trafień równego 64%. To celowo uproszczone obliczenie pomija kapitalizację i nie jest dowodem rynkowym; pokazuje, dlaczego sam odsetek trafień nie wyznacza wartości oczekiwanej.

Częste pytania

Q1Czy test Pesaran–Timmermanna porównuje trafność z 50%?

Nie. Porównuje zaobserwowaną zgodność z poziomem bazowym niezależności wyliczonym z osobnych udziałów rzeczywistych i prognozowanych wzrostów. Poziom bazowy może być wyższy lub niższy niż 50%.

Q2Czy przy nakładających się horyzontach prognoz można użyć zwykłej wartości p testu PT?

Nie bez uwzględnienia zależności. Nakładające się cele i trwałe etykiety kierunku mogą zaniżyć standardowe oszacowanie niepewności oparte na niezależności. Użyj metody, której założenia pasują do horyzontu i struktury zależności.

Q3Czy istotny wynik PT oznacza, że strategia transakcyjna jest rentowna?

Nie. Test wykorzystuje etykiety kierunku i nie mierzy wielkości ruchu, cen wejścia i wyjścia, wielkości pozycji, prowizji, poślizgu ani finansowania. Osobno oceń poza próbą stopy zwrotu netto.

Źródła i dalsza lektura

Zgłoś problem

Przygotujemy e-mail z linkiem do tego artykułu. Mark otrzyma zgłoszenie dopiero po jego wysłaniu

Szybki test

Przeczytano? Sprawdź się w 3 pytaniach

Pytanie 1 / 3

Pytanie 01

Jeśli rzeczywiste wyniki rosną w 60% przypadków, a prognozy wskazują wzrost w 70% przypadków, jaki jest poziom bazowy zgodności przy niezależności?

Wybierz odpowiedź, aby zobaczyć wyjaśnienie

Słownik opcji

Jasne definicje najważniejszych pojęć, od call, put i łańcucha opcji po IV, greki, open interest i max pain

Przeglądaj słownik opcji