Skip to content
Wszystkie przewodniki po opcjach
Dlaczego zwycięzca poszukiwania strategii wymaga testu dla całej rodziny13 min czytania

White’s Reality Check: data snooping w backtestach strategii

Dowiedz się, jak White’s Reality Check porównuje najlepszą strategię z poszukiwań z benchmarkiem, wykorzystując maksimum z bootstrapu uwzględniającego zależności

W tym przewodnikuTest sprawdza, czy zwycięzca poszukiwań pokonuje wybrany benchmark

Krótkie podsumowanie

White’s Reality Check sprawdza, czy najlepszy kandydat z określonego procesu poszukiwań przewyższa wskazany benchmark po uwzględnieniu tego, że został wybrany jako maksimum. Metoda bootstrapuje wspólne, zależne w czasie różnice wyników, a następnie porównuje zaobserwowane maksimum z rozkładem zerowym maksimów bootstrapowych. Niska skorygowana wartość p przemawia przeciw łącznej hipotezie zerowej o braku przewagi w danej rodzinie i względem tego benchmarku; nie prognozuje zyskowności w rzeczywistym handlu.

Test sprawdza, czy zwycięzca poszukiwań pokonuje wybrany benchmark

Badacz może sprawdzić dziesiątki okien średnich kroczących, reguł wybicia, okresów utrzymywania pozycji, rynków i filtrów, a następnie opublikować strategię z najwyższym wynikiem backtestu. Taki zwycięzca nie jest zwykłym pojedynczym kandydatem: proces poszukiwań dał mu wiele okazji, by wyglądać wyjątkowo dobrze. Testowanie go tak, jakby wybrano go przed obejrzeniem danych, pomija etap selekcji.

White’s Reality Check włącza selekcję do testu. Sprawdza, czy którykolwiek kandydat z badanej rodziny ma wyższy oczekiwany wynik niż zdefiniowany benchmark. White formułuje hipotezę zerową jako część wspólną jednostronnych porównań: oczekiwany wynik każdego kandydata względem benchmarku jest nie większy od zera. Hipoteza alternatywna mówi, że co najmniej jeden kandydat ma dodatnią oczekiwaną przewagę. Benchmarkiem może być strategia kup i trzymaj, prosta reguła prognozowania lub inny punkt odniesienia, ale musi odpowiadać pytaniu badawczemu i zostać ustalony przed poznaniem wyniku. Formalny opis znajduje się w oryginalnym artykule White’a.

To pytanie dotyczy całej rodziny, a nie gwarancji dla strategii, która przypadkiem wygrała. Odrzucenie hipotezy zerowej oznacza, że udokumentowana rodzina dostarcza dowodów przewagi przy wybranej statystyce i założeniach. Nie dowodzi, że wszyscy kandydaci są użyteczni, zwycięzca utrzyma pozycję ani jego przewaga przetrwa zmianę reżimu rynkowego.

Przedstaw każdego kandydata jako porównywalną różnicę wyników

Niech d[k,t] oznacza wynik kandydata k minus wynik benchmarku w tym samym okresie t; wyższa wartość ma zawsze być korzystniejsza dla kandydata. Przy porównaniu stóp zwrotu może to być stopa netto kandydata minus stopa netto benchmarku. W przypadku straty prognozy różnicę można zdefiniować odwrotnie: strata benchmarku minus strata kandydata. Znak musi konsekwentnie wskazywać dodatnim wynikiem przewagę kandydata.

Każdy wiersz powinien odnosić się do tego samego przedziału czasu dla wszystkich kandydatów. Używaj jednej waluty, definicji stopy zwrotu, sposobu traktowania finansowania i polityki kosztów. Jeśli wniosek dotyczy wykonalnych wyników strategii, przed obliczeniem d[k,t] odejmij właściwe prowizje, spready, poślizg, finansowanie i koszt pożyczki. Test brutto, z kosztami wspomnianymi dopiero w przypisie, odpowiada na inne pytanie.

Średnia z próby dla kandydata k wynosi d̄[k] = (1/T) Σ_t d[k,t]. Łączna hipoteza zerowa to H0: max_k E[d[k,t]] ≤ 0, a alternatywna — H1: max_k E[d[k,t]] > 0. Benchmark jest wspólny dla rodziny, a wszystkich kandydatów ocenia się według tego samego kryterium. Jeśli kandydaci mają inne brakujące daty lub częstotliwości obserwacji, przed obliczeniem różnic wyznacz uzasadnioną wspólną próbę, zamiast po cichu przyznawać komuś korzystniejsze okno.

Uwzględnij pełną rodzinę kandydatów we wniosku badawczym

Rodzina obejmuje reguły, które mogły wpłynąć na wybór opublikowanego zwycięzcy: testowane okresy wsteczne, progi wejścia, kombinacje sygnałów, uniwersa aktywów, okresy utrzymywania pozycji, ograniczenia portfela i założenia realizacji zleceń. Wliczają się też ręczne warianty wypróbowane i odrzucone po obejrzeniu wyników. W artykule z 2000 r. White używa terminu „specification search” szeroko: problem selekcji wynika z procesu wyboru, a nie tylko z wierszy w końcowej tabeli.

Możliwe są dwa przeciwstawne błędy. Pominięcie eksperymentów, które pomogły wybrać raportowaną strategię, czyni skorygowany test zbyt optymistycznym, bo bootstrap widzi mniejsze poszukiwania niż przeprowadzono. Dodanie po fakcie wielu arbitralnych i niepowiązanych reguł może nadmiernie zwiększyć konserwatyzm testu i obniżyć jego zdolność do wykrywania użytecznego kandydata. Zdefiniuj rodzinę na podstawie rzeczywistego procesu wyboru i zachowaj dziennik badań, który pozwoli zweryfikować jej zakres.

Test nie odtworzy eksperymentów, których nie zapisano. Notatnik zawierający tylko zwycięski zestaw parametrów nie wystarczy. Przechowuj razem rejestr kandydatów, wersję danych, daty oceny, funkcję celu, założenia kosztowe i decyzje selekcyjne. Jeśli rodzina zmieniła się po obejrzeniu rezultatów, opisz co i dlaczego; nie przedstawiaj zakresu ustalonego po fakcie tak, jakby z góry był stały.

Statystyka maksimum przenosi selekcję do rozkładu zerowego

Oblicz średni wynik względny każdego kandydata, a następnie weź największy. Często używana statystyka bez standaryzacji to Vobs = √T × max_k d̄[k]. Maksimum jest kluczowe: odzwierciedla tę samą czynność „wybierz najlepszego”, która wyłoniła pozornego zwycięzcę. Testowanie tylko zwycięskiej kolumny usunęłoby tę czynność z rozkładu odniesienia.

Bootstrap przybliża, jak duże maksimum może powstać wskutek zmienności próby, jeśli prawdziwa jest łączna hipoteza zerowa o braku przewagi. W powtórzeniu b losuje się ponownie wektor różnic wszystkich kandydatów indeksowany w czasie i oblicza statystykę centrowaną, na przykład V*b = √T × max_k(d̄*[k,b] − d̄[k]). Centrowanie umieszcza średnie kandydatów na najmniej korzystnej granicy hipotezy zerowej, gdzie oczekiwane przewagi wynoszą zero; maksimum zachowuje selekcję z całej rodziny. Artykuł White’a opisuje rozkład bootstrapowy maksimum i porównanie go z wartością zaobserwowaną.

Powtórz procedurę wiele razy. Skorygowana wartość p to udział maksimów bootstrapowych co najmniej tak dużych jak Vobs. Przy B losowaniach typowym estymatorem Monte Carlo jest (1 + count{V*b ≥ Vobs})/(B + 1). Implementacje mogą różnić się standaryzacją lub szczegółami estymowanych modeli, dlatego opisz statystykę i sposób centrowania przy hipotezie zerowej. Każde powtórzenie ma ponownie obliczać maksimum całej rodziny, a nie oceniać tylko zaobserwowanego zwycięzcę.

Zachowaj zależności przy ponownym próbkowaniu historii kandydatów

Obserwacje finansowe są uporządkowane w czasie. Niezależne tasowanie może usunąć zależność szeregową, grupowanie zmienności oraz ciągi skorelowanych zysków lub strat. Może również zaburzyć relacje między strategiami reagującymi na te same dni rynkowe. Cechy te wpływają na ogon statystyki maksimum, więc osobne losowanie kandydatów lub pojedynczych dat ze zwracaniem może dać błędny rozkład odniesienia.

White opisuje metody dla danych zależnych, takie jak ruchomy bootstrap blokowy, i analizuje stacjonarny bootstrap Politis i Romano. W tej metodzie wylosowany blok zwykle przechodzi do kolejnej obserwacji czasowej, a po losowym restarcie rozpoczyna się w innym wylosowanym dniu. Długości bloków mają zatem rozkład geometryczny o wybranej średniej. Przy założeniach i ustawieniach metody lepiej zachowuje krótkie sekwencje niż próbkowanie i.i.d. Zobacz artykuł Politis i Romano o stacjonarnym bootstrapie.

Dla rodziny strategii wylosuj wspólną sekwencję indeksów czasu i zastosuj ją do całego wektora wiersza (d[1,t], …, d[K,t]). Pozwala to zachować kolejność w blokach i współczesne zależności między kandydatami. Dobierz długość bloku z uwzględnieniem horyzontu strategii i diagnostyki zależności, a następnie pokaż wrażliwość wyników na rozsądne alternatywy. Jeśli procedura badawcza obejmuje ponowne szacowanie parametrów, ustal, czy ten krok należy do przedmiotu wnioskowania i w razie potrzeby powtarzaj go w każdej replice. Losowanie wyłącznie wcześniej ustalonych wyników może warunkować na części procedury i ją pomijać.

Hipotetyczny przykład bootstrapu zmienia interpretację

Załóżmy, że badacz porównuje trzy strategie z benchmarkiem przez T = 252 dni sesyjne. Średnie dzienne różnice po kosztach wynoszą +2.0, +1.0 i −0.5 punktu bazowego. Średnia zwycięzcy to więc 2.0 punktu bazowego, a zaobserwowana statystyka wynosi √252 × 2.0 bp ≈ 31.75 bp·√dzień sesyjny. Skalowanie jest częścią statystyki testowej; nie jest statystyką t, bo nie dzieli się jej przez oszacowany błąd standardowy.

Załóżmy teraz 9 999 replik stacjonarnego bootstrapu stosujących te same wylosowane daty do wszystkich trzech kandydatów. W tym hipotetycznym wyniku 1 199 maksimów replik osiąga lub przekracza 31.75. Estymator Monte Carlo z poprawką plus jeden wynosi (1 + 1,199)/(9,999 + 1) = 0.12. Osobny test samego zwycięzcy mógłby hipotetycznie dać 0.03, ale pominąłby poszukiwania wśród trzech kandydatów. Wartość p Reality Check obejmuje porównanie rodziny i przy progu 5% nie odrzuca w tym przykładzie łącznej hipotezy zerowej.

Liczby są wymyślone w celu pokazania obliczenia; nie oznaczają zmierzonych wyników rynkowych ani rezultatów z pracy White’a. Wartość p równa 0.12 nie oznacza 12-procentowego prawdopodobieństwa straty strategii. Oznacza, że przy określonym bootstrapie i konstrukcji hipotezy zerowej maksimum co najmniej tak duże nie jest wystarczająco rzadkie, by odrzucić hipotezę na wybranym poziomie. Same średnie z próby nie pokazują też, czy stopa zwrotu ma sens ekonomiczny po uwzględnieniu ryzyka, pojemności i realizacji.

Interpretuj skorygowaną wartość p jako dowód dotyczący określonej rodziny

Niska wartość p Reality Check jest dowodem przeciw twierdzeniu, że żaden element ujętej rodziny nie przewyższa wybranego benchmarku pod względem oczekiwanego wyniku, przy założeniach testu. Łączna hipoteza nie wskazuje automatycznie kandydata z trwałą przewagą. Zwycięzca może być inny w kolejnych próbach, a dowody dotyczące pojedynczej strategii mogą być słabe, nawet po odrzuceniu hipotezy dla całej rodziny.

Wysoka wartość p oznacza brak podstaw do odrzucenia, a nie dowód, że strategie są równoważne benchmarkowi. Powodem może być krótka próba, zaszumione wyniki, bardzo szeroka rodzina, niedokładny pomiar albo niska moc testu. Wartość p nie jest też prawdopodobieństwem prawdziwości hipotezy zerowej. To prawdopodobieństwo ogonowe z rozkładu odniesienia zależnego od zbioru kandydatów, miary wyników, benchmarku, projektu bootstrapu i zaobserwowanych danych.

Pytanie White’a dotyczy wyniku względnego. Reguła może pokonać słaby benchmark, a mimo to przynosić stratę; inna może nie pokonać silnego benchmarku, ale mieć dodatnie stopy zwrotu. Raportuj wyniki bezwzględne i względne wraz z niepewnością, obrotami, obsunięciem kapitału, pojemnością oraz realistycznymi kosztami. Statystyczne dowody przewagi predykcyjnej względem benchmarku i ekonomiczna opłacalność inwestycji to osobne kwestie.

Sprawdź założenia i ograniczenia przed użyciem wyniku

Oryginalna teoria zakłada warunki regularności dla procesu różnic wyników i jego rozkładu granicznego. Ujęcie White’a obejmuje stacjonarne, silnie mieszające się szeregi czasowe; bootstrap zależny wymaga również odpowiedniego ciągu długości bloków. W skończonej próbie zmiany reżimu, załamania strukturalne, długa pamięć, rzadkie skoki i niestabilna zmienność mogą podważyć przybliżenie przez stacjonarne próbkowanie. Bootstrap blokowy zachowuje część lokalnych zależności, ale nie odtwarza nieznanego przyszłego reżimu.

Test dziedziczy również błędy z danych i oceny strategii. Wyciek przyszłych informacji, błąd przeżywalności, zrewidowane dane, nierealistyczne wykonanie, pominięte koszty, niewłaściwe uwzględnienie działań korporacyjnych i benchmark wybrany po zobaczeniu wyników mogą unieważnić różnice. Przy nakładających się okresach utrzymywania pozycji zależność zwrotów może wynikać z samej konstrukcji; jednostka losowania i długość bloku muszą ją odzwierciedlać. Jeśli końcowa miara jest nieliniowa, jak wskaźnik Sharpe’a, oblicz ją ponownie w każdej replice zamiast zakładać, że bootstrap średniego zwrotu testuje ją automatycznie.

Implementacje Reality Check mogą być konserwatywne, zwłaszcza gdy duży zbiór kandydatów zawiera wiele wyraźnie słabych alternatyw. Szeroki rozkład maksimum może utrudnić odrzucenie hipotezy nawet wtedy, gdy istnieje dobry kandydat. Test Superior Predictive Ability Hansena jest pokrewną metodą bootstrapową, która inaczej traktuje słabe alternatywy; nie jest uniwersalnym zamiennikiem, a jej założenia także wymagają sprawdzenia. Dobieraj metody do pytania badawczego i raportuj wrażliwość zamiast wybierać metodę dającą preferowany wynik.

Stosuj go obok walidacji chronologicznej i innych narzędzi selekcji

White’s Reality Check odpowiada na pytanie, czy udokumentowana rodzina poszukiwań zawiera po korekcie selekcji kandydata przewyższającego benchmark. Nie zastępuje chronologicznego zbioru testowego ani walk-forward dla zamrożonej strategii. Sam nie rozwiązuje nakładania etykiet ani wycieku informacji. Różni się też od PBO, które podsumowuje, jak często zwycięzca in-sample zajmuje miejsce poniżej mediany kandydatów w podziałach kombinatorycznych; oryginalny artykuł PBO formalizuje tę diagnozę ryzyka selekcji. Procedury false discovery dotyczą oczekiwanego udziału fałszywych wyników wśród wielu odrzuceń. Deflated Sharpe Ratio koryguje natomiast ocenę istotności opartą na Sharpe’ie o selekcję i nienormalne stopy zwrotu. Zobacz też przewodniki o testach wielokrotnych i wskaźniku fałszywych odkryć w finansach, PBO i CSCV, walidacji walk-forward oraz purged cross-validation i embargo.

Praktyczna kontrola ustala benchmark i definicję wyników, odtwarza faktycznie używaną rodzinę kandydatów, oblicza sparowane różnice dla kolejnych okresów, wybiera i uzasadnia metodę losowania zachowującą zależności oraz raportuje maksimum i bootstrapowe prawdopodobieństwo ogonowe. Następnie sprawdza zamrożony proces wyboru na późniejszych danych chronologicznych i osobno ocenia koszty oraz wykonalność. Zastosowanie przez Sullivana, Timmermanna i White’a do technicznych reguł handlowych pokazuje, dlaczego liczy się cały zbiór reguł: wniosek może się zmienić, gdy test obejmuje pełne poszukiwania, a nie tylko opublikowanego zwycięzcę. Reality Check koryguje konkretny problem selekcji; nie poświadcza, że backtest sprawdzi się w handlu na żywo.

Częste pytania

Q1Co testuje White’s Reality Check?

Testuje, czy najlepszy kandydat z określonej rodziny poszukiwań ma wyższy oczekiwany wynik niż wybrany benchmark, z uwzględnieniem selekcji spośród kandydatów.

Q2Czy niska wartość p Reality Check dowodzi, że strategia będzie zyskowna?

Nie. Przemawia przeciw hipotezie zerowej o braku przewagi rodziny przy wybranym benchmarku, mierze, danych i założeniach bootstrapu. Nie gwarantuje przyszłych stóp zwrotu ani zyskowności netto.

Q3Dlaczego używać bootstrapu blokowego zamiast niezależnego losowania dni?

Bloki mogą zachować część lokalnej zależności szeregowej, a wspólne daty dla kandydatów zachowują ich zależności w tym samym czasie. Projekt bloków nadal musi pasować do danych i pytania badawczego.

Źródła i dalsza lektura

Zgłoś problem

Przygotujemy e-mail z linkiem do tego artykułu. Mark otrzyma zgłoszenie dopiero po jego wysłaniu

Szybki test

Przeczytano? Sprawdź się w 3 pytaniach

Pytanie 1 / 3

Pytanie 01

Co oznacza łączna hipoteza zerowa White’a?

Wybierz odpowiedź, aby zobaczyć wyjaśnienie

Słownik opcji

Jasne definicje najważniejszych pojęć, od call, put i łańcucha opcji po IV, greki, open interest i max pain

Przeglądaj słownik opcji