P-§0¤ §1¤ St§2¤t§8¤tic§3¤l Signific§4¤nce §6¤ F§7¤§5¤nce
Underst§2¤ p-§1¤s, null hypo§6¤ses, test st§7¤t§18¤tics, signific§8¤nce levels, Type I §3¤ Type II err§5¤s, power, effect size, §0¤§9¤l s§13¤pp§14¤g, ¤0¤, §4¤ f§15¤§10¤nci§11¤l §16¤terpret§12¤ti§17¤
Bezpośrednia odpowiedź
P-value to prawdopodobieństwo, przy określonym modelu zerowym i planie analizy, uzyskania statystyki testowej co najmniej tak niezgodnej z tym modelem jak zaobserwowana. Nie jest to prawdopodobieństwo, że hipoteza zerowa jest prawdziwa, prawdopodobieństwo, że wynik wystąpił przez przypadek, ani wielkość i znaczenie ekonomiczne efektu. Istotność statystyczna jest regułą decyzyjną, a nie dowodem
Test zaczyna się przed p-value
Określ hipotezy zerową i alternatywną, statystykę testową, model próbkowania, regułę zatrzymania, kierunek ogona i poziom istotności, zanim zobaczysz wynik
Hipoteza zerowa często oznacza brak efektu lub wartość referencyjną, ale może też być złożona i zawierać parametry uciążliwe wymagające estymacji
Zmiana populacji, horyzontu, zmiennych kontrolnych, reguły wartości odstających lub testu po zobaczeniu danych zmienia eksperyment, którego p-value jest interpretowane
P-value jest warunkowe względem modelu
Przy hipotezie zerowej statystyka testowa ma rozkład referencyjny; p-value mierzy, jak daleko zaobserwowana statystyka sięga w odpowiedni ogon
Mała wartość wskazuje na niezgodność danych z pełnym układem modelu zerowego, a nie na to, które założenie zawiodło ani czy alternatywa jest prawdziwa
Błędnie określona zależność, ciężkie ogony, heteroskedastyczność, błędy danych lub selekcja mogą sprawić, że rozkład referencyjny i p-value będą nieważne
Progi istotności definiują reguły błędu
Ustalony wcześniej poziom α ogranicza prawdopodobieństwo odrzucenia prawdziwej hipotezy zerowej przy założeniach testu, a nie odsetek opublikowanych twierdzeń, które są fałszywe
Błąd I rodzaju to fałszywe odrzucenie; błąd II rodzaju to nieodrzucenie fałszywej hipotezy zerowej, a moc to prawdopodobieństwo odrzucenia przy określonej alternatywie
Brak odrzucenia nie dowodzi braku efektu, szczególnie gdy próba ma niską moc wobec ekonomicznie istotnych alternatyw
Wielkość efektu i niepewność odpowiadają na różne pytania
Duże próby mogą uczynić małe efekty statystycznie istotnymi, podczas gdy zaszumione małe próby mogą nie wykryć efektów wystarczająco dużych, aby miały znaczenie
Obok p-value raportuj oszacowanie efektu, przedział, jednostki, koszty transakcji, pojemność i praktyczny próg
Wyniki tuż powyżej i poniżej 0.05 zwykle dostarczają podobnych dowodów; zamiana tej granicy w ostry przełącznik prawdy odrzuca informacje
Elastyczność badania zniekształca istotność
Opcjonalne zatrzymywanie, testowanie wielu specyfikacji, usuwanie obserwacji, zmiana wyników i publikowanie wyłącznie udanych testów zmieniają zachowanie fałszywych pozytywów
Nominalne p-value jest ważne tylko dla ścieżki analizy, która je wygenerowała, w tym dla uzasadnionych reguł sekwencyjnych lub korekt zadeklarowanych z wyprzedzeniem
Prerejestracja, kompletne dzienniki badania, analiza multiverse, nietknięte zbiory testowe i replikacja ujawniają wrażliwość, ale nie naprawiają błędnego modelu
Zależność finansowa osłabia testy podręcznikowe
Zwroty mogą być autokorelacyjne, zależne przekrojowo, heteroskedastyczne, nakładające się i warunkowane wybraną przetrwałą populacją
Naiwne błędy standardowe iid mogą zawyżać statystyki t, a wielokrotne odkrywanie czynników i backtesting tworzą znacznie większą niejawną rodzinę testów
Używaj błędów standardowych i resamplingu uzasadnionych strukturą szeregu czasowego, a następnie badaj stabilność w różnych reżimach, aktywach, kosztach, opóźnieniach i danych na żywo
Dowody powinny wspierać decyzję
Traktuj p-value jako jeden ciągły sygnał diagnostyczny wśród wielkości efektu, niepewności, wcześniejszych dowodów, mechanizmu, jakości predykcyjnej i kosztów decyzji
Z góry określ, który błąd ma znaczenie: fałszywy sygnał transakcyjny, pominięta ekspozycja na ryzyko, niestabilne zabezpieczenie albo model promowany bez wartości ekonomicznej
Raportuj pełną rodzinę analiz i nieudane replikacje, aby pojedynczy wybrany istotny wynik nie został pomylony z siłą programu badawczego
Częste pytania
Co oznacza p-value równe 0.05?
Przy określonym modelu zerowym wyniki co najmniej tak niezgodne jak zaobserwowana statystyka testowa występują z prawdopodobieństwem 0.05
Czy p poniżej 0.05 dowodzi hipotezy alternatywnej?
Nie. Nie przypisuje prawdopodobieństwa hipotezom ani nie wyklucza błędnej specyfikacji, selekcji, błędów danych lub ekonomicznie błahego efektu
Czy p powyżej 0.05 dowodzi, że nie ma efektu?
Nie. Oznacza, że test nie odrzucił hipotezy przy tym progu i może odzwierciedlać niską moc, szum, nieodpowiedni model albo rzeczywiście mały efekt
Dlaczego finansowe p-values są często zawyżone?
Zależność, wielokrotne poszukiwanie strategii, elastyczne specyfikacje, wybrane próby i nierealistyczne koszty mogą sprawić, że nominalne dowody wyglądają na silniejsze, niż są w rzeczywistości
Źródła i dalsza lektura
Szybki test
Przeczytano? Sprawdź się w 3 pytaniach
Pytanie 01
Które stwierdzenie najlepiej odpowiada temu przewodnikowi — Test zaczyna się przed p-value?
Wybierz odpowiedź, aby zobaczyć wyjaśnienie
Słownik opcji
A call or put whose strike is near the underlying price; it has little intrinsic value and often substantial sensitivity to time and volatility.
Czytaj szczegółowy przewodnikCall optionA contract that gives its holder the right, but not the obligation, to buy the underlying at the strike before or at expiration under the contract terms.
Czytaj szczegółowy przewodnikPut optionA contract that gives its holder the right, but not the obligation, to sell the underlying at the strike before or at expiration under the contract terms.
Czytaj szczegółowy przewodnik