Deflated Sharpe Ratio: wielokrotne testowanie i wybór backtestu
Poznaj sposób, w jaki Deflated Sharpe Ratio koryguje ocenę Sharpe’a po wyborze strategii, uwzględniając wielokrotne testowanie i nienormalne zwroty, wraz z hipotetycznym przykładem i jasnymi ograniczeniami.
W tym przewodnikuDSR podnosi próg Sharpe’a po przeszukiwaniu wielu wariantów
Krótkie podsumowanie
Deflated Sharpe Ratio (DSR) odpowiada na pytanie, czy oszacowany Sharpe wybranej strategii przekracza próg uwzględniający zarówno przeszukiwanie alternatyw, jak i kształt rozkładu zwrotów. Wykorzystuje probabilistyczne obliczenie Sharpe’a z progiem skorygowanym o selekcję. DSR to warunkowa diagnoza statystyczna: nie zamienia backtestu w dowód przyszłych zysków i nie naprawia pominiętych prób, nierealistycznych kosztów ani przecieku informacji w szeregu czasowym.
DSR podnosi próg Sharpe’a po przeszukiwaniu wielu wariantów
Badacz może przetestować wiele definicji sygnałów, okresów wstecznych, progów wejścia, uniwersów, horyzontów utrzymywania pozycji i założeń o kosztach, a następnie opublikować wariant z najwyższym wskaźnikiem Sharpe’a. Nawet jeśli żaden kandydat nie ma rzeczywistej umiejętności, oszacowania różnią się z powodu losowości próby. Im szersze przeszukiwanie, tym wyższe bywa maksimum oszacowań. Wybrany wynik różni się więc od oceny pojedynczej strategii ustalonej przed obejrzeniem danych.
Deflated Sharpe Ratio, zaproponowany przez Baileya i Lópeza de Prado, uwzględnia dwa źródła zawyżenia wybranego Sharpe’a: wielokrotne testowanie i nienormalne zwroty. Pierwsze podnosi próg, który wynik musi przekroczyć; drugie zmienia oszacowaną niepewność Sharpe’a. W pierwotnej pracy DSR opisano jako Probabilistic Sharpe Ratio obliczany względem progu skorygowanego o selekcję. Oryginalna praca przedstawia wyprowadzenie i sposób szacowania liczby prób.
Takie ujęcie zapobiega częstemu błędowi interpretacji. DSR nie odejmuje mechanicznie stałej kary od opublikowanego Sharpe’a, aby utworzyć nowy wskaźnik wyników. Szacuje, jak mocno zaobserwowany Sharpe przekracza próg zależny od zakresu poszukiwań, długości próby i momentów zwrotów. Punktowe oszacowanie Sharpe’a może pozostać bez zmian, podczas gdy DSR spada z powodu słabszych dowodów. Znaczenie samego Sharpe’a wyjaśnia też oryginalny opis Sharpe’a.
Najlepsze z wielu zaszumionych oszacowań jest zwykle wyjątkowo wysokie
Załóżmy, że wszystkie testowane reguły mają taki sam prawdziwy Sharpe, ale każde oszacowanie różni się z powodu ograniczonej próby. Wybór największego oszacowania oznacza również wybór korzystnego błędu pomiaru. To klątwa zwycięzcy: na nowych danych wybrane oszacowanie powinno zbliżyć się do typowej wartości całej grupy.
Liczy się liczba prób, ale również stopień różnic między ich wynikami. Jeśli kandydaci generują niemal identyczne zwroty, ich oszacowania Sharpe’a są silnie powiązane i dają mniej niezależnych szans na przypadkowo wysokie maksimum niż taka sama liczba niepowiązanych kandydatów. Liczba wierszy w siatce parametrów nie jest zatem automatycznie liczbą niezależnych prób.
Rejestr poszukiwań może obejmować decyzje spoza formalnej siatki: ręczną zmianę progu, odrzucenie rynku lub korektę założeń o kosztach, która wpłynęła na wybór zachowanego wyniku. DSR obliczony tylko na końcowych kandydatach nie uwzględni eksperymentów, których nie zapisano ani nie podano jako danych wejściowych.
Probabilistic Sharpe Ratio oblicza niepewność próby
Probabilistic Sharpe Ratio (PSR) szacuje, czy Sharpe z próby przekracza wybrany punkt odniesienia, uwzględniając liczbę obserwacji zwrotów oraz oszacowaną skośność i kurtozę. DSR wykorzystuje to samo podstawowe obliczenie, ale wybiera punkt odniesienia odzwierciedlający oczekiwane maksymalne Sharpe’a z przeszukiwania.
Dla jednego z powszechnych przybliżeń PSR obliczenie skorygowane o selekcję wygląda tak:
$$ \mathrm{DSR}=\Phi\!\left( \frac{(\widehat{SR}-SR_0)\sqrt{T-1}} {\sqrt{1-\widehat{\gamma}_3\widehat{SR} +\frac{\widehat{\gamma}_4-1}{4}\widehat{SR}^{\,2}}} \right) $$
Tutaj $\Phi$ to dystrybuanta standardowego rozkładu normalnego, $\widehat{SR}$ to zaobserwowany Sharpe na jedną obserwację zwrotu, $SR_0$ to próg skorygowany o selekcję w tych samych jednostkach, a $T$ to liczba obserwacji. $\widehat{\gamma}_3$ oznacza skośność próby, a $\widehat{\gamma}_4$ kurtozę Pearsona, która dla rozkładu normalnego wynosi 3. Mianownik odzwierciedla wpływ skośności i kurtozy na niepewność oszacowania Sharpe’a.
Wynik zależy od przyjętej konwencji. Używaj nadwyżkowych zwrotów o jednej częstotliwości, obliczaj Sharpe’a i próg w tej samej częstotliwości oraz konsekwentnie definiuj kurtozę. Annualizacja tylko jednej z tych wielkości zmienia porównanie. Powszechnie używany wzór opiera się także na założeniach o zależności obserwacji zwrotów. Zależność szeregową trzeba analizować osobno, zamiast po cichu modyfikować $T$.
Próg oczekiwanego maksimum zależy od zbioru kandydatów
Dla $N$ niezależnych oszacowań Sharpe’a o rozkładzie zbliżonym do normalnego Bailey i López de Prado stosują przybliżenie wartości ekstremalnych dla oczekiwanego maksimum:
$$ SR_0 \approx \mu_{SR}+\sigma_{SR} \left[(1-\gamma_E)\Phi^{-1}\!\left(1-\frac{1}{N}\right) +\gamma_E\Phi^{-1}\!\left(1-\frac{1}{Ne}\right)\right] $$
$\mu_{SR}$ i $\sigma_{SR}$ oznaczają średnią i odchylenie standardowe oszacowań Sharpe’a kandydatów; $\Phi^{-1}$ to funkcja kwantylowa standardowego rozkładu normalnego, $e$ to liczba Eulera, a $\gamma_E \approx 0,5772$ to stała Eulera–Mascheroniego. Wyrażenie szacuje, jak wysoko sam wybór może podnieść najlepsze oszacowanie w ramach przyjętego modelu prób. Nie jest to uniwersalny próg dla każdego przeszukiwania strategii.
Gdy wyniki kandydatów są skorelowane, traktowanie każdej wariacji jako niezależnej może zawyżyć efektywną liczbę prób. Artykuł omawia szacowanie liczby niezależnych prób na podstawie zależności między kandydatami, ale samo to oszacowanie jest kolejnym wyborem modelowym. Korelacja to tylko jedna z form zależności, a jej oszacowanie może być niestabilne przy wielu kandydatach i krótkiej historii zwrotów. Podaj surową liczbę kandydatów, metodę obliczenia liczby efektywnej i wrażliwość na wiarygodne alternatywy.
Hipotetyczne obliczenie rozdziela próg od zaobserwowanego Sharpe’a
Przyjmijmy celowo uproszczone przeszukiwanie 20 niezależnych strategii-kandydatów. Przy hipotezie zerowej załóżmy średnią oszacowań Sharpe’a równą 0 i odchylenie standardowe 0,20 w jednostkach miesięcznych. Przybliżenie oczekiwanego maksimum daje próg selekcji około $SR_0=0,380$ na miesiąc. To założenia do pokazania rachunku, a nie obserwacje rynkowe ani rekomendowany punkt odniesienia.
Załóżmy teraz, że wybrana strategia ma 60 miesięcznych obserwacji nadwyżkowych zwrotów, oszacowany miesięczny Sharpe równy 0,50, skośność próby 0 i kurtozę Pearsona 3. Część PSR porównuje 0,50 z 0,380, a nie z zerem:
$$ z=\frac{(0.50-0.380)\sqrt{59}}{\sqrt{1+((3-1)/4)(0.50)^2}} \approx 0.868,\qquad \mathrm{DSR}=\Phi(z)\approx 0.807 $$
Przy tych uproszczonych założeniach DSR wynosi około 80,7%. Nie oznacza to 80,7% prawdopodobieństwa zysku w przyszłym miesiącu ani nie jest prognozą jego zwrotu. To oszacowany dowód na to, że bazowy Sharpe przekracza wybrany próg selekcji, warunkowo względem modelu i danych wejściowych. Inna liczba prób, oszacowanie zależności, próba lub kształt rozkładu zwrotów mogą zmienić wynik.
Wrażliwość na rozrzut oszacowań wśród prób jest istotna. Jeśli zmieni się wyłącznie założone odchylenie standardowe oszacowań Sharpe’a kandydatów, z 0,20 na 0,10, to samo przeszukiwanie 20 prób daje próg około 0,190 i DSR około 98,8%. Przy odchyleniu 0,30 próg wynosi około 0,570, a DSR około 30,6%. Zaobserwowany Sharpe 0,50, 60 obserwacji, skośność i kurtoza pozostają bez zmian. Ta hipotetyczna analiza pokazuje, dlaczego ważna jest metoda szacowania rozrzutu prób i zależności kandydatów; wartości pozostają w tych samych jednostkach miesięcznych i tym samym uproszczonym modelu.
Skośność i kurtoza zmieniają niepewność, a nie tylko opis
Dwie strategie mogą mieć ten sam Sharpe z próby i tę samą jej długość, a zarazem różne rozkłady zwrotów. Wyraźny lewy ogon, asymetria lub wyjątkowo częste wartości skrajne mogą zmienić niepewność próby ujętą w mianowniku PSR. Korekta wynika z zaobserwowanych momentów; nie zakłada, że każdy rozkład nienormalny jest równie szkodliwy, ani nie gwarantuje, że kilka momentów próby w pełni opisuje zachowanie ogonów.
Obliczenie zależy również od tego, co uznajesz za jedną obserwację. Dane dzienne, tygodniowe i miesięczne dają różne wartości $T$, Sharpe’a, skośności i kurtozy. Nakładające się okresy utrzymywania pozycji mogą sprawić, że sąsiednie wiersze będą zależne. Wygładzone lub nieaktualne wyceny mogą wskazywać mniejszą zmienność niż bazowe ryzyko ekonomiczne. Opisz częstotliwość i konstrukcję próby, zamiast traktować annualizowany Sharpe jako wystarczające wejście.
DSR i inne metody walidacji odpowiadają na różne pytania
PBO wykorzystuje kombinatoryczną symetryczną walidację krzyżową, by sprawdzić, jak często zwycięzca in-sample zajmuje miejsce na poziomie mediany kandydatów lub niższe w uzupełniających się blokach. DSR szacuje, czy wybrany Sharpe przekracza próg skorygowany o przeszukiwanie i nienormalność. Wyniki i założenia resamplingu są różne, więc jedna metoda nie zastępuje drugiej. Zobacz przewodniki po PBO i CSCV oraz wielokrotnym testowaniu w finansach. Bailey i współautorzy formalizują tę diagnozę selekcji w oryginalnej pracy o PBO.
White’s Reality Check wykorzystuje bootstrap, aby sprawdzić, czy najlepsza reguła z grupy kandydatów przewyższa określony punkt odniesienia po uwzględnieniu data snooping. Tu kluczowe jest porównanie z benchmarkiem; DSR używa progu opartego na Sharpe’ie. Chronologiczny walk-forward lub końcowy holdout sprawdza, jak zamrożony proces działa w późniejszych okresach. Metody te się uzupełniają, bo oceniają różne elementy tezy badawczej. White opisuje tę metodę w oryginalnej pracy o Reality Check.
Raportuj przeszukiwanie i założenia razem z DSR
Odtwarzalny raport określa uniwersum kandydatów, wszystkie udokumentowane decyzje wpływające na wybór, surową liczbę prób, metodę szacowania liczby efektywnej, serię zwrotów, długość i częstotliwość próby, definicję Sharpe’a, skośność, konwencję kurtozy oraz próg skorygowany o selekcję. Podaj, czy zwroty są brutto czy netto po spreadzie, prowizjach, wpływie rynkowym, finansowaniu, kosztach pożyczki i innych kosztach. Pokaż łącznie zaobserwowany Sharpe i DSR, aby było widać efekt korekty.
Standardowy wzór zakłada model próby, który może nie pasować do obserwacji z autokorelacją. Praca Lo o statystyce Sharpe’a wyjaśnia, dlaczego agregacja w czasie i zależności wpływają na wnioskowanie. Jeśli zwroty nakładają się lub są autokorelacyjne, użyj procedury wnioskowania uwzględniającej tę strukturę i opisz jej założenia. Pomnożenie miesięcznego Sharpe’a przez $\sqrt{12}$ nie koryguje autokorelacji. W ocenie uwzględniającej kolejność czasu pomocny jest też przewodnik po rosnących i kroczących oknach walk-forward.
DSR nie wykryje nieudokumentowanego przeszukiwania, nie usunie przecieku informacji z przyszłości, nie sprawi, że dane obciążone przeżywalnością staną się reprezentatywne, nie zweryfikuje realizacji transakcji, nie oszacuje pojemności ani nie zagwarantuje stabilności w nowym reżimie. Nie zastępuje uzasadnienia ekonomicznego ani późniejszych dowodów chronologicznych. Traktuj DSR jako jedną udokumentowaną diagnozę w procesie badawczym, a rejestr kandydatów i potok danych zachowaj w postaci umożliwiającej odtworzenie.
Częste pytania
Q1Czy Deflated Sharpe Ratio to wskaźnik Sharpe’a po odjęciu kary?
Nie. DSR jest statystyką o interpretacji probabilistycznej, opartą na wybranym Sharpe’ie, progu skorygowanym o selekcję, długości próby, skośności i kurtozie. Nie zastępuje opublikowanego punktowego oszacowania Sharpe’a wskaźnikiem obniżonym mechanicznie.
Q2Czy każdą kombinację parametrów mam liczyć jako niezależną próbę?
Nie. Podobni kandydaci mogą mieć skorelowane zwroty, więc surowa wielkość siatki może nie odpowiadać efektywnej liczbie niezależnych szans na wybór wysokiego oszacowania. Zachowaj pełny rejestr poszukiwań i ujawnij metodę oraz niepewność oszacowania zależności.
Q3Czy wysoki DSR dowodzi, że strategia handlowa zadziała?
Nie. DSR zależy od grupy kandydatów, danych, konstrukcji zwrotów, założeń dotyczących prób i modelu próby. Nie koryguje pominiętych eksperymentów, błędów realizacji, przecieków, zmian reżimu ani niepewności przyszłości.
Źródła i dalsza lektura
Zgłoś problem
Przygotujemy e-mail z linkiem do tego artykułu. Mark otrzyma zgłoszenie dopiero po jego wysłaniu
Szybki test
Przeczytano? Sprawdź się w 3 pytaniach
Pytanie 01
Co się zmienia, gdy podstawą DSR jest obliczenie Probabilistic Sharpe?
Wybierz odpowiedź, aby zobaczyć wyjaśnienie