Multiple Testwg i Flse Djestcovery Rte w Fwnce
Understi multiple comprjestnas, fmily-wjeste errlub, flse djestcovery rte, Bnaferrnai, Holm, byćnjmwi–Hochbyćrg, dependence, q-wartośćs, fctlub mwwg, bcktest selectina, i reserch governnce
Bezpośrednia odpowiedź
Wielokrotne testowanie pojawia się, gdy razem przeszukuje się wiele hipotez, strategii, czynników, aktywów, horyzontów albo specyfikacji. Nawet poprawne wartości p dla pojedynczych testów generują wtedy zwycięzców wynikających z przypadku. Family-wise error rate kontroluje prawdopodobieństwo co najmniej jednego fałszywego odrzucenia, a false discovery rate kontroluje oczekiwany udział fałszu wśród odrzuceń przy określonych założeniach. Problem określa cała rodzina badawcza, a nie tylko końcowa tabela
Więcej testów tworzy więcej zwycięzców przypadku
Jeśli m niezależnych prawdziwych hipotez zerowych testuje się na poziomie α, prawdopodobieństwo co najmniej jednego fałszywego odrzucenia wynosi 1−(1−α)^m
Przy α=0,05 i m=20 prawdopodobieństwo to wynosi około 64%, mimo że każdy pojedynczy test ma nominalny poziom fałszywego odrzucenia 5%
Zależność zmienia dokładne obliczenie, ale nie uzasadnia udawania, że testowany był tylko zgłoszony zwycięzca
Rodzina definiuje pytanie o błąd
Rodzina testów może obejmować wszystkie czynniki, transformacje, uniwersa, opóźnienia, horyzonty, filtry, wybory modelu i ponowne uruchomienia rozważane dla jednego twierdzenia badawczego
Definiowanie rodziny dopiero po zobaczeniu wyników zaniża wielokrotność i pozwala badaczom rozdzielać powiązane próby, aż korekta stanie się nieszkodliwa
Możliwa do obrony rodzina podąża za procesem decyzyjnym i możliwością selekcji, a nie tylko za wierszami, które przetrwały do publikacji albo dashboardu
FWER i FDR kontrolują różne straty
Family-wise error rate to prawdopodobieństwo dokonania co najmniej jednego fałszywego odrzucenia w obrębie rodziny
False discovery rate to E[V/max(R,1)], gdzie V oznacza liczbę fałszywych odrzuceń, a R łączną liczbę odrzuceń
FWER jest bardziej rygorystyczny, gdy każde fałszywe twierdzenie jest kosztowne; FDR jest często silniejszy, gdy przegląd wielu kandydatów może tolerować kontrolowany udział fałszu
Procedury wymagają własnych założeń
Bonferroni testuje każdą hipotezę na poziomie α/m i kontroluje FWER bez wymogu niezależności, choć może być konserwatywny
Metoda step-down Holma również kontroluje FWER i nigdy nie jest mniej silna niż podstawowa reguła odrzucania Bonferroniego
Benjamini–Hochberg porządkuje wartości p i kontroluje FDR przy niezależności oraz określonych zależnościach dodatnich; inne struktury zależności wymagają uzasadnionych metod
Wartości skorygowane nie są prawdopodobieństwami prawdy a posteriori
Skorygowana wartość p jest najmniejszym rodzinnym poziomem błędu, przy którym hipoteza zostałaby odrzucona w ramach wybranej procedury
Wartość q jest często interpretowana jako oszacowany minimalny próg FDR dla uznania wyniku za odkrycie, zależnie od metody i założeń
Żadna z tych wartości nie jest automatycznie prawdopodobieństwem, że jedna wybrana strategia jest fałszywa; wymaga to innego modelu i stwierdzenia warunkującego
Finanse ukrywają dużą rodzinę adaptacyjną
Mining czynników, reguły techniczne, sygnały opcyjne, dane alternatywne, ograniczenia portfela i założenia dotyczące kosztów tworzą tysiące skorelowanych prób
Opublikowane czynniki są wybierane z wcześniejszych poszukiwań, więc ocenianie nowego czynnika izolowanym statystycznym t bliskim dwóm ignoruje skumulowaną presję odkrywania
Wspólne aktywa i okresy sprawiają, że testy są zależne, a zmiana reżimu oznacza, że korekta za selekcję nie może zagwarantować przyszłych wyników ekonomicznych
Zarządzanie badaniem musi zachować zapis poszukiwań
Zapisuj każdą hipotezę, wersję kodu, uniwersum, wynik, transformację, opóźnienie, koszt i decyzję o zatrzymaniu wraz ze stabilnym identyfikatorem badania
Oddziel odkrywanie, potwierdzanie i monitorowanie na żywo; zamroź reguły potwierdzające i użyj rzeczywiście nietkniętych danych albo oceny prospektywnej
Raportuj dowody surowe i skorygowane, definicję rodziny, założenia dotyczące zależności, wielkości efektów, koszty, stabilność, odrzucone idee i pogorszenie wyników na żywo
Częste pytania
Na czym polega problem wielokrotnego testowania?
Jest to wzrost liczby fałszywych odkryć spowodowany testowaniem i wybieraniem spośród wielu hipotez przy ocenianiu zwycięzców tak, jakby każdy test stał samodzielnie
Jaka jest różnica między FWER a FDR?
FWER kontroluje prawdopodobieństwo co najmniej jednego fałszywego odrzucenia; FDR kontroluje oczekiwaną proporcję fałszu wśród wszystkich odrzuceń
Jak działa Benjamini–Hochberg?
Porządkuje wartości p, porównuje je z progami zależnymi od rangi i odrzuca do największej kwalifikującej się rangi przy określonych założeniach
Czy kontrola FDR czyni strategię handlową wiarygodną?
Nie. Dotyczy błędu selekcji w zdefiniowanej rodzinie testów, a nie zmiany reżimu, kosztów, wycieku informacji, ryzyka modelu ani przyszłej rentowności
Źródła i dalsza lektura
Szybki test
Przeczytano? Sprawdź się w 3 pytaniach
Pytanie 01
Które stwierdzenie najlepiej pasuje do tego przewodnika — Więcej testów tworzy więcej zwycięzców przypadku?
Wybierz odpowiedź, aby zobaczyć wyjaśnienie
Słownik opcji
The process that requires an option writer to fulfill the contract after an exercise notice is allocated; it can create or remove an underlying position.
Czytaj szczegółowy przewodnikBid-ask spreadThe gap between the best displayed bid and ask, which is a practical trading cost and a signal of how uncertain an immediate fill may be.
Czytaj szczegółowy przewodnik0DTEAn option that expires on the current trading day; little time remains for the thesis to work, while gamma and execution risk can change quickly.
Czytaj szczegółowy przewodnik