Skip to content
Wszystkie przewodniki po opcjach
Jak często zwycięzca backtestu spada poniżej mediany grupy14 min czytania

Prawdopodobieństwo przeuczenia backtestu (PBO) i CSCV

Dowiedz się, jak kombinatoryczna symetryczna walidacja krzyżowa szacuje PBO, przekształca rangi OOS w logity i dlaczego nie prognozuje przyszłych strat

W tym przewodnikuPBO mierzy proces wyboru, a nie pojedynczą strategię

Krótkie podsumowanie

Prawdopodobieństwo przeuczenia backtestu (PBO) opisuje, jak często strategia wybrana jako najlepsza w próbie wewnętrznej (IS) zajmuje poza próbą (OOS) miejsce poniżej mediany zbioru kandydatów. Kombinatoryczna symetryczna walidacja krzyżowa (CSCV) szacuje tę częstotliwość, wielokrotnie przeznaczając połowę równych bloków czasu do wyboru, a drugą połowę do oceny. PBO jest diagnozą warunkową względem określonego wyszukiwania, miary i historycznej macierzy wyników. Nie oznacza prawdopodobieństwa straty strategii działającej na żywo.

PBO mierzy proces wyboru, a nie pojedynczą strategię

Zespół badawczy może sprawdzać różne okna historyczne, progi wejścia, okresy utrzymywania pozycji, uniwersa, założenia kosztowe i ograniczenia portfela, a następnie zachować wariant z najwyższym wynikiem backtestu. Wybrany rezultat miał wiele okazji do dopasowania się do cech konkretnej próby. PBO podsumowuje jeden ze skutków takiego wyszukiwania: w określonych podziałach IS/OOS jak często zwycięzca IS spada poniżej mediany OOS tego samego zbioru kandydatów?

Bailey, Borwein, López de Prado i Zhu przedstawili PBO jako ramy oceny ryzyka wyboru strategii oraz zaproponowali CSCV jako jedną z metod szacowania. Definicja dotyczy procedury wyboru spośród testowanych konfiguracji, a nie tylko nadmiernej liczby parametrów pojedynczego równania prognozującego. W każdym podziale IS oznacza część danych służącą do wyboru kandydata; nie musi to być okres, w którym estymowano wszystkie modele składowe. Formalny opis znajduje się w oryginalnym artykule o PBO.

Strategia może mieć wysoki wskaźnik Sharpe’a w całej próbie, a mimo to być jedynie najszczęśliwszym kandydatem ze słabej grupy badawczej. Z drugiej strony procedura wyboru może zwykle wskazywać kandydata powyżej mediany OOS, nawet gdy cała grupa osiąga ujemne stopy zwrotu. PBO porównuje względne rangi w przekazanym zbiorze; samo w sobie nie sprawdza dodatniej wartości oczekiwanej.

PBO odpowiada na inne pytanie niż pozostałe narzędzia walidacji

Chronologiczny holdout lub test walk-forward sprawdza, jak ustalony proces badawczy działał na późniejszych obserwacjach, które nie posłużyły do wcześniejszych decyzji. Purged cross-validation rozwiązuje problem nakładania się przedziałów etykiet treningowych i wyników testowych; embargo może dodać osobny, uzasadniony bufor. Żaden z tych zabiegów samodzielnie nie mierzy, jak często zwycięzca szerokiego wyszukiwania strategii spada poniżej mediany OOS. Zobacz przewodnik po purged cross-validation i embargo.

PBO różni się też od korekty na wielokrotne testowanie. Reality Check White’a stosuje bootstrap, aby sprawdzić, czy najlepsza reguła z rodziny przewyższa benchmark po uwzględnieniu data snooping. Deflated Sharpe Ratio koryguje obliczenie istotności oparte na Sharpe’ie o skutki selekcji i nienormalne rozkłady zwrotów. PBO podsumowuje natomiast rangę OOS kandydata wybranego w IS w kolejnych podziałach. Metody te mają inne statystyki i założenia, więc nie zastępują się automatycznie. Zobacz oryginalną pracę White’a o Reality Check oraz pracę Baileya i López de Prado o Deflated Sharpe Ratio.

Zacznij od kompletnej, zsynchronizowanej macierzy wyników

Niech M będzie macierzą T na N. Każda z N kolumn reprezentuje strategię lub konfigurację, a każdy z T wierszy ten sam przedział obserwacji dla wszystkich kandydatów. Wiersz może zawierać dzienne zwroty po uwzględnieniu właściwych kosztów transakcyjnych. Jeśli strategie handlują z różną częstotliwością, najpierw ustal wspólny indeks czasu i spójnie agreguj wyniki. Porównanie dziennych zwrotów jednej strategii z miesięcznymi sumami innej nie daje sensownej macierzy wiersz po wierszu.

Zbiór kandydatów powinien odzwierciedlać faktyczne możliwości wyboru: warianty odrzucone w przeszukiwaniu siatki, ręczne zmiany wprowadzone po obejrzeniu wyników, alternatywne uniwersa i reguły wpływające na ostateczny wybór. PBO może oceniać tylko przekazanych kandydatów i ich historię wyników. Jeśli po znacznie szerszym wyszukiwaniu zapisano wyłącznie finalistów, szacunek pomija część rzeczywistego procesu.

Dla wszystkich kandydatów stosuj tę samą konwencję zwrotów, walutę, sposób uwzględnienia dźwigni i kryterium wyników. Jeśli wybór opiera się na Sharpe’ie netto, przed jego obliczeniem uwzględnij w każdej kolumnie właściwe prowizje, spready, finansowanie, funding, koszt pożyczki i założenia realizacji zleceń. Miara musi dać się obliczyć również na późniejszych podpróbach. Oryginalna praca wymaga zsynchronizowanych wierszy i miary estymowalnej w każdej podpróbie; przy różnej częstotliwości handlu zaleca wspólny indeks.

CSCV łączy każdą połowę próby z jej dopełnieniem

Wybierz parzystą liczbę S rozłącznych bloków czasu o jednakowej długości i zachowaj kolejność obserwacji wewnątrz każdego bloku. Każdy możliwy wybór S/2 bloków tworzy zbiór in-sample (IS), a pozostałe S/2 tworzą zbiór out-of-sample (OOS). Dla miary zależnej od ścieżki zachowaj pierwotną kolejność wybranych bloków i opisz znaczenie ich łączenia.

Liczba przypisań IS wynosi C(S,S/2). Przy czterech blokach A, B, C i D istnieje sześć przypisań: AB, AC, AD, BC, BD i CD; każde dopełnienie liczy się jako osobne przypisanie. Dla S = 16 mamy C(16,8) = 12 870. To deterministyczne kombinacje tej samej historii, a nie 12 870 niezależnych eksperymentów rynkowych.

„Symetryczna” oznacza, że dopełnienie jest ponownie używane jako zbiór wyboru w innej kombinacji: w jednym podziale AB stanowi IS, a CD OOS, w innym odwrotnie. „Kombinatoryczna” oznacza wyliczenie wszystkich wyborów połowy bloków zamiast losowania jednego podziału. Procedura nie odtwarza chronologicznego przebiegu. Wybrane bloki mogą obejmować wczesne i późne okresy, podczas gdy dopełnienie zawiera środkowe; OOS nie oznacza więc „przyszłości po okresie treningowym”.

Bloki danych w czasie są wielokrotnie dzielone na połowy treningowe i testowe; część zwycięzców z próby uzyskuje poza próbą rangę poniżej środka
Schemat symetrycznych podziałów i rang CSCV; nie przedstawia rzeczywistych danych ani chronologicznej symulacji handlu

Przekształć rangę OOS wybranego kandydata w logit

Dla podziału c zastosuj regułę badawczą do części IS i wybierz najlepszego kandydata n*(c). Następnie oblicz tę samą miarę dla wszystkich N kandydatów na dopełniającym zbiorze OOS. Rangę wybranego kandydata oznacz r(c): 1 oznacza najgorszy wynik, a N najlepszy. Z góry określ sposób traktowania remisów i stosuj go bez zmian.

Przekształć rangę na rangę względną ω(c) = r(c)/(N+1). Mianownik N+1 utrzymuje wynik ściśle między zerem a jedynką także dla skrajnych rang. Logit ma postać λ(c) = ln(ω(c)/(1−ω(c))). Jest ujemny poniżej mediany OOS, równy zero przy medianie i dodatni powyżej niej. Szacowana PBO to udział przypisań CSCV, dla których λ(c) ≤ 0.

Pojedyncza wartość PBO pokazuje, jak często zwycięzca IS osiąga najwyżej medianę OOS. Pełny rozkład logitów dodatkowo wskazuje, czy wybrani kandydaci zwykle pozostają blisko środka, często mocno spadają, czy przeważnie plasują się powyżej mediany. Logit jest przekształconą rangą względną, a nie prawdopodobieństwem dla pojedynczej transakcji na żywo ani skalibrowaną prognozą przyszłych zwrotów.

Hipotetyczny przykład z czterema blokami daje PBO równą 66,7%

Załóżmy, że mamy cztery równe bloki historyczne oraz cztery reguły kandydujące R1–R4. Tabela pokazuje sześć przypisań IS. Kolumna rangi OOS przedstawia pozycję reguły wybranej w IS spośród czterech reguł ocenianych na blokach dopełniających. Wszystkie wartości są hipotetyczne i służą wyłącznie do pokazania rachunku.

Bloki ISZwycięzca ISRanga OOS rRanga względna ω = r/5Logit ln(ω/(1−ω))Mediana lub niżej?
ABR110,20−1,386Tak
ACR340,80+1,386Nie
ADR220,40−0,405Tak
BCR110,20−1,386Tak
BDR430,60+0,405Nie
CDR320,40−0,405Tak

Cztery z sześciu wybranych reguł mają względną rangę OOS nie większą niż jedna druga. Empiryczna PBO wynosi zatem 4/6 ≈ 0,667, czyli około 66,7%. Dla rangi 2 mamy ω = 2/(4+1) = 0,4 oraz λ = ln(0,4/0,6) ≈ −0,405. Ranga 3 daje ω = 0,6 i logit o przeciwnym znaku, około +0,405.

Nie oznacza to 66,7% szansy na stratę w kolejnym miesiącu. W tej hipotetycznej macierzy i przy przyjętej konwencji rang zwycięzca IS cztery razy na sześć znalazł się na poziomie mediany kandydatów OOS lub niżej. Dwa pozostałe zwycięskie warianty również mogły mieć ujemne bezwzględne zwroty OOS, mimo że pokonały swoich rywali.

Traktuj PBO jako warunkową diagnozę z ograniczeniami

PBO zależy od rodziny kandydatów, obserwowanej macierzy wyników, miary wyboru, bloków czasu i zasad rozstrzygania remisów. Nieudokumentowane próby pozostają poza zakresem. „Niezależna od modelu” oznacza, że obliczenie można wykonać z historii wyników bez znajomości równań prognozujących; nie oznacza braku decyzji projektowych, problemów z danymi czy założeń.

CSCV łączy bloki w symetryczne podzbiory o jednakowym rozmiarze, ale OOS zwykle nie stanowi jednego późniejszego okresu chronologicznego. Ponowne łączenie bloków może zaburzać długoterminową zależność, sezonowość lub kolejność reżimów gospodarczych. S określa zarówno liczbę kombinacji, jak i długość okresu w jednym bloku. Wybierz i opisz S z uwzględnieniem istotnych horyzontów oraz struktury strategii. Duża liczba kombinacji nie tworzy tylu niezależnych obserwacji, ponieważ bloki są wielokrotnie wykorzystywane.

Statystyka dziedziczy błędy danych źródłowych. Błąd przeżywalności, zrewidowane dane, cechy niedostępne w danym czasie, nierealistyczne wykonanie zleceń, pominięte koszty lub uniwersum wybrane po fakcie mogą zniekształcić wszystkie historie kandydatów. CSCV automatycznie nie usuwa nakładających się przedziałów etykiet, nie dopasowuje ponownie każdej części potoku modelu w każdym podziale ani nie zapobiega wyciekom z przetwarzania wstępnego. Te kroki trzeba dostosować do pytania badawczego i wdrożyć jawnie. Chronologiczne zabezpieczenia opisuje oficjalna dokumentacja TimeSeriesSplit oraz przewodnik po walidacji z purgingiem.

Miary zależne od ścieżki, takie jak maksymalne obsunięcie, wymagają szczególnej ostrożności: połączenie nieprzylegających bloków zmienia ścieżkę, a przez to miarę. Artykuł o PBO zwraca uwagę, że kolejność ma znaczenie dla niektórych miar, nawet jeśli nie ma go dla wskaźnika Sharpe’a. Przed interpretacją rangi wyjaśnij, jak obsługiwane są kolejność, luki, brakujące obserwacje i kapitalizacja.

Raportuj PBO obok dowodów chronologicznych i pełnej historii wyszukiwania

Przed obliczeniem zachowaj rejestr kandydatów, wszystkie zmiany dokonane po obejrzeniu wyników, macierz wyników, miarę wyboru i regułę remisów. Podaj T, N, S, konstrukcję bloków, C(S,S/2), konwencję rang OOS, szacowaną PBO i rozkład logitów. Dodaj bezwzględne wyniki OOS, koszty, obroty, obsunięcia i liczbę kandydatów stratnych: sama ranga nie pokazuje, czy wszystkie warianty są słabe.

Użyj testu walk-forward lub prawdziwego chronologicznego holdoutu, aby ocenić zamrożony proces badawczy na późniejszych danych. Nie otwieraj końcowego okresu przy wyborze modelu i progów; wielokrotne sprawdzanie zmienia go w kolejny zbiór selekcyjny. Narzędzia szeregów czasowych, takie jak TimeSeriesSplit, tworzą chronologiczne podziały zgodnie z opisanymi założeniami, a PBO mierzy inną cechę rangową przeszukanej grupy.

PBO uzupełnia, ale nie zastępuje, kontrolę nakładania etykiet, analizę wielokrotnego testowania, realistyczne modelowanie realizacji, ocenę prospektywną i monitorowanie na żywo. Zobacz także wielokrotne testowanie i odsetek fałszywych odkryć w finansach oraz korektę wskaźnika Sharpe’a przy autokorelacji szeregowej. Żadna pojedyncza statystyka nie zamienia historycznej rangi w dowód trwałej przewagi.

Częste pytania

Q1Czy PBO oznacza, że strategia ma takie prawdopodobieństwo straty?

Nie. PBO szacuje, jak często kandydat wybrany w IS zajmuje w określonych podziałach miejsce równe medianie OOS lub niższe. Nie jest prawdopodobieństwem przyszłej straty ani skalibrowaną prognozą wyniku na żywo.

Q2Czy CSCV to to samo co test walk-forward?

Nie. CSCV łączy każdą połowę bloków z dopełnieniem, więc część OOS może obejmować bloki wcześniejsze i późniejsze. Walk-forward zachowuje trening przed każdym późniejszym okresem testowym, aby odwzorować chronologiczną ścieżkę wdrożenia.

Q3Czy niska PBO dowodzi, że wybrana strategia ma przewagę?

Nie. Zwycięzca może pokonać słaby zbiór kandydatów, a mimo to przynosić bezwzględną stratę. Oddzielnie oceniaj zwroty netto, niepewność, koszty, wycieki i wyniki na rzeczywiście późniejszych danych.

Źródła i dalsza lektura

Zgłoś problem

Przygotujemy e-mail z linkiem do tego artykułu. Mark otrzyma zgłoszenie dopiero po jego wysłaniu

Szybki test

Przeczytano? Sprawdź się w 3 pytaniach

Pytanie 1 / 3

Pytanie 01

Jakie zdarzenie uwzględnia szacowana PBO?

Wybierz odpowiedź, aby zobaczyć wyjaśnienie

Słownik opcji