White Reality Check i Hansen SPA dla reguł tradingowych
Poznaj sposób, w jaki Reality Check i Hansen SPA porównują całą rodzinę reguł technicznych z benchmarkiem, czym różnią się ich rozkłady bootstrap i jak interpretować globalną wartość p.
W tym przewodnikuDlaczego najlepsza reguła wymaga testu całej rodziny
Krótkie podsumowanie
Wybranie po wielu backtestach reguły z najlepszym wynikiem zmienia pytanie statystyczne. Zwykły test zastosowany tylko do zwycięskiej reguły pomija fakt, że została wybrana spośród wielu kandydatów. White Reality Check i Hansen SPA badają całą określoną rodzinę względem benchmarku. SPA standaryzuje różnice i stosuje zależne od danych centrowanie hipotezy zerowej, dzięki któremu wyraźnie słabe alternatywy mają mniejszy wpływ. Żaden z tych testów sam nie wskazuje reguły, która będzie wygrywać w przyszłości.
Dlaczego najlepsza reguła wymaga testu całej rodziny
Jeśli sprawdzasz dwadzieścia ustawień, a potem pokazujesz tylko to o najwyższej historycznej stopie zwrotu, nie testujesz jednej reguły. Wynik odzwierciedla również sam proces poszukiwań: nawet gdy żadna wersja nie ma rzeczywistej przewagi, jedna z nich może przez przypadek wyglądać dobrze w historycznej próbie. Zwykły test t, który traktuje zwycięzcę tak, jakby został ustalony przed obejrzeniem danych, ignoruje ten efekt selekcji.
White opracował Reality Check, aby postawić pytanie o data snooping dla całej rodziny kandydatów. Sullivan, Timmermann i White zastosowali tę metodę do szerokiego zestawu reguł technicznych i pokazali, dlaczego należy ujawnić całą badaną rodzinę. Później Hansen zaproponował test Superior Predictive Ability, czyli SPA, który standaryzuje różnice i jest mniej wrażliwy na słabe lub mało istotne reguły. Źródła pierwotne to White (2000), Sullivan, Timmermann i White (1999) oraz Hansen (2005).
Najpierw określ benchmark i różnicę wyników
Niech $d_{k,t}$ oznacza przewagę reguły $k$ nad benchmarkiem w tym samym momencie $t$. Dla stóp zwrotu można przyjąć $d_{k,t}=R_{k,t}-R_{0,t}$. Dla błędów prognozy odwróć kolejność, na przykład $d_{k,t}=L_{0,t}-L_{k,t}$, aby dodatnia różnica zawsze działała na korzyść kandydata. Testowana wielkość to średnia populacyjna $\mu_k=E[d_{k,t}]$.
Ta definicja przesądza, co oznacza „lepszy”: stopę zwrotu brutto, wynik po kosztach, spadek wartości miary błędu albo inne kryterium ustalone wcześniej. Wszystkie reguły muszą mieć ten sam benchmark, częstotliwość, okres oceny i konwencję znaków. Poniższe wzory dotyczą średniej różnic. Nieliniowej miary, takiej jak wskaźnik Sharpe’a, nie należy po prostu podstawić do tych równań; wymaga ona procedury wnioskowania dopasowanej do tej miary.
Hipoteza zerowa obejmuje wszystkie sprawdzone warianty
Globalna hipoteza zerowa ma postać $H_0:\max_{k=1,\ldots,K}\mu_k\leq0$. Oznacza to, że żadna reguła z badanej rodziny nie ma dodatniej oczekiwanej przewagi nad benchmarkiem. Alternatywa mówi, że przynajmniej jedna reguła ma dodatnią średnią różnicę. To jednostronny test całej rodziny, a nie test równości wszystkich reguł.
Liczba kandydatów powinna odpowiadać rzeczywistym poszukiwaniom, a nie tylko wariantom pokazanym w końcowej tabeli. Jako czysto arytmetyczny przykład przyjmij 12 okien lookback, 4 filtry i 5 ustawień wyjścia z pozycji. Otrzymujesz $12\times4\times5=240$ wariantów. To hipotetyczne wyliczenie, a nie wynik ani prognoza rentowności. Jeśli testowano również inne instrumenty, progi lub modele kosztów, te próby też należą do opisu procesu selekcji.
Reality Check wykorzystuje granicę zerową ze wszystkimi średnimi równymi zero
Przy $n$ wspólnych obserwacjach i średniej z próby $\bar d_k$ statystyka Reality Check użyta tutaj to
$$T_{\mathrm{RC}}=\max_{k=1,\ldots,K}\sqrt{n}\,\bar d_k.$$
Maksimum pokazuje najwyższą zaobserwowaną przewagę względem benchmarku. W tej definicji statystyka nie jest sztucznie obcinana do zera. Aby przybliżyć rozkład pod hipotezą zerową, odejmuje się średnią z próby od każdej serii różnic, a następnie losuje bootstrapowe bloki przy założeniu granicy $\mu_k=0$ dla wszystkich kandydatów. To najmniej korzystna dla alternatywy konfiguracja spośród przypadków dopuszczonych przez hipotezę zerową, ale może obniżać moc testu.
Słaba reguła pozostaje częścią maksimum w każdej replice i może podnosić kwantyle krytyczne. Ostrożne pytanie White’a brzmi: czy największa przewaga z backtestu jest większa od tej, którą można by uzyskać w sytuacji granicznej, gdy każda oczekiwana przewaga wynosi zero? Mała wartość p dostarcza dowodu przeciw globalnej hipotezie zerowej dla określonej rodziny; nie ocenia kandydatów pominiętych w udokumentowanych poszukiwaniach.
SPA standaryzuje wynik i centrowanie uzależnia od danych
SPA dzieli każdą średnią różnicę przez oszacowanie długookresowego rozrzutu, $\hat\omega_k$. Statystyka ma postać
$$T_{\mathrm{SPA}}=\max\left(0,\max_k\frac{\sqrt n\,\bar d_k}{\hat\omega_k}\right).$$
Standaryzacja ułatwia porównanie różnic o różnej zmienności. Zewnętrzne maksimum z zerem należy do statystyki SPA; nie dodaje się go do przedstawionego wcześniej wzoru Reality Check. Estymacja rozrzutu długookresowego powinna uwzględniać zależność czasową serii różnic, dlatego trzeba opisać zastosowane założenie lub metodę.
SPA różni się również sposobem centrowania. Dla każdej reguły wyznacza korektę $\hat\mu_{c,k}$. Gdy średnia standaryzowana jest dostatecznie ujemna — na przykład spada poniżej progu Hansena $-\sqrt{2\log\log n}$ — ta ujemna średnia z próby zostaje zachowana w bootstrapowym rozkładzie pod hipotezą zerową. Kandydatów zgodnych z granicą hipotezy zerowej centruje się natomiast do zera. Dzięki temu reguły wyraźnie słabe w mniejszym stopniu podnoszą kwantyle krytyczne, ale wiarygodne warianty bliskie granicy wciąż są uwzględniane. W raporcie wskaż regułę centrowania i użyty wariant wartości p SPA.

Bootstrap blokowy powinien zachować zależności między regułami
W każdej chwili obserwujesz wektor $(d_{1,t},\ldots,d_{K,t})$, który zawiera różnice wszystkich reguł. W każdej replice należy losować całe wiersze wektorowe w kolejnych blokach czasu. Niezależne losowanie każdej serii albo wybieranie pojedynczych dat niszczy zarówno korelację między kandydatami, jak i zależność czasową różnic. Maksimum policzone na tak zmienionych danych nie odpowiada już temu samemu testowi.
Bootstrap stacjonarny Politis i Romano (1994) losuje bloki o długościach z rozkładu geometrycznego i zadanej długości oczekiwanej. Inne odpowiednie warianty używają stałych, nachodzących na siebie bloków kolejnych obserwacji. Bloki łączy się aż do uzyskania pierwotnej długości próby. Oba testy zakładają, że wspólny proces różnic jest dostatecznie stabilny i słabo zależny. Wybór długości bloku oraz możliwe zmiany strukturalne wpływają na wniosek; bootstrap nie naprawia zmiany reżimu.
Globalna wartość p nie wskazuje zwycięskiej reguły
Istotny wynik Reality Check albo SPA oznacza, że przy przyjętych założeniach dane dostarczają dowodu, iż przynajmniej jedna reguła z udokumentowanej rodziny ma dodatnią średnią przewagę nad benchmarkiem. Globalna wartość p nie jest prawdopodobieństwem prawdziwości hipotezy zerowej ani szansą, że dana reguła zadziała w przyszłości. Nie mówi też, która reguła indywidualnie przewyższa benchmark. Takie przypisanie wymaga dodatkowej analizy uwzględniającej selekcję, najlepiej z wykorzystaniem nowych danych.
W hipotetycznym przykładzie 240 wariantów zwycięzca z próby mógłby być jednym z 240. Sama liczba wariantów nie mówi, czy test odrzuci hipotezę zerową. Znaczenie mają rzeczywiste różnice wyników, liczba obserwacji, wspólna zależność i wybrany bootstrap. Wartość p, mała lub duża, nie koryguje nieujawnionego etapu poszukiwań ani nie gwarantuje, że historyczna relacja utrzyma się w przyszłości.
FDR i przedziały ufności odpowiadają na inne pytania
Przewodnik po testach wielokrotnych i false discovery rate dotyczy zwykle zestawu pojedynczych hipotez i, przy określonych założeniach, kontroluje oczekiwany udział fałszywych odkryć wśród odrzuconych hipotez. Reality Check i SPA badają globalne twierdzenie o maksimum określonej rodziny: czy są dowody, że przynajmniej jeden kandydat przewyższa benchmark? Same nie tworzą skorygowanej listy indywidualnych zwycięzców.
Przedział ufności z bootstrapu blokowego dla jednej, wcześniej określonej strategii również odpowiada na inne pytanie. Przewodnik o przedziałach bootstrap dla zwrotów strategii opisuje niepewność ustalonej średniej lub innej miary. Jeśli strategię wybrano po przetestowaniu wielu wariantów, taki przedział nie koryguje automatycznie obciążenia selekcyjnego. Metodę należy dobrać do pytania badawczego.
Walidacja krzyżowa z purgingiem (purged CV) dotyczy innego problemu: ograniczania czasowego przecieku informacji między obserwacjami treningowymi i testowymi w danych uporządkowanych w czasie. Nie sprawdza, czy maksimum rodziny reguł przewyższa benchmark — to globalne pytanie RC i SPA. Przewodnik po purged CV i embargo wyjaśnia ten podział.
Koszty, historia poszukiwań i zmiany rynku nadal mają znaczenie
Różnice poddawane testowi powinny obejmować koszty istotne dla ocenianych reguł: prowizje, spread bid–ask, poślizg cenowy, wpływ na rynek, finansowanie, pożyczanie papierów i koszt kapitału, jeśli ma zastosowanie. Odjęcie kosztów dopiero po teście może zmienić statystycznie dodatnią przewagę brutto w wynik bez znaczenia ekonomicznego. Na możliwy rezultat wpływają także opóźnienie realizacji, płynność i wielkość pozycji.
Odtwarzalny raport opisuje całą rodzinę, etapy selekcji i filtrowania, daty i źródła danych, benchmark, definicję $d_{k,t}$, koszty, metodę blokową, sposób doboru długości bloku, liczbę replik i wariant wartości p SPA. Zmiany wprowadzane po obejrzeniu wyników rozszerzają poszukiwania i należy je uwzględnić. Jeśli zmiany strukturalne silnie modyfikują rozkład albo wspólna seria nie jest w przybliżeniu stacjonarna i słabo zależna, oba bootstrapy mogą prowadzić do błędnych wniosków. Są to testy historycznego projektu badawczego, nie prognozy, gwarancje ani indywidualne porady inwestycyjne.
Częste pytania
Q1Czy istotny wynik SPA oznacza, że najlepsza reguła jest osobno istotna?
Nie. Test dotyczy maksimum dla całej badanej rodziny. Globalna wartość p nie potwierdza żadnej reguły jako indywidualnego zwycięzcy.
Q2Czy SPA zawsze ma większą moc niż Reality Check?
Nie. W niektórych sytuacjach SPA może być mniej wrażliwy na wiele słabych lub nieistotnych alternatyw i dzięki temu mieć większą moc. Nie oznacza to przewagi w każdym projekcie.
Q3Czy te testy pozwalają przewidzieć przyszłe wyniki?
Nie. Oceniają historyczną, zdefiniowaną rodzinę przy założeniach o wspólnym procesie. Zmiana reżimu, koszty, nowe decyzje selekcyjne i warunki rynkowe mogą zmienić przyszłe wyniki.
Źródła i dalsza lektura
Zgłoś problem
Przygotujemy e-mail z linkiem do tego artykułu. Mark otrzyma zgłoszenie dopiero po jego wysłaniu
Szybki test
Przeczytano? Sprawdź się w 3 pytaniach
Pytanie 01
Co mówi globalna hipoteza zerowa w Reality Check i SPA?
Wybierz odpowiedź, aby zobaczyć wyjaśnienie
Słownik opcji
The probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
Czytaj szczegółowy przewodnikAssignmentThe process that requires an option writer to fulfill the contract after an exercise notice is allocated; it can create or remove an underlying position.
Czytaj szczegółowy przewodnik