Wszystkie przewodniki po opcjach
Wh§2¤t §3¤ sm§4¤ll p-§0¤ s§5¤ys §1¤ wh§6¤t it never proves15 m§2¤ czyt§0¤ni§1¤

P-§0¤ §1¤ St§2¤t§8¤tic§3¤l Signific§4¤nce §6¤ F§7¤§5¤nce

Underst§2¤ p-§1¤s, null hypo§6¤ses, test st§7¤t§18¤tics, signific§8¤nce levels, Type I §3¤ Type II err§5¤s, power, effect size, §0¤§9¤l s§13¤pp§14¤g, ¤0¤, §4¤ f§15¤§10¤nci§11¤l §16¤terpret§12¤ti§17¤

Przygotowane przez Mark · Źródła pierwotne poniżej

Bezpośrednia odpowiedź

P-value to prawdopodobieństwo, przy określonym modelu zerowym i planie analizy, uzyskania statystyki testowej co najmniej tak niezgodnej z tym modelem jak zaobserwowana. Nie jest to prawdopodobieństwo, że hipoteza zerowa jest prawdziwa, prawdopodobieństwo, że wynik wystąpił przez przypadek, ani wielkość i znaczenie ekonomiczne efektu. Istotność statystyczna jest regułą decyzyjną, a nie dowodem

Test zaczyna się przed p-value

Określ hipotezy zerową i alternatywną, statystykę testową, model próbkowania, regułę zatrzymania, kierunek ogona i poziom istotności, zanim zobaczysz wynik

Hipoteza zerowa często oznacza brak efektu lub wartość referencyjną, ale może też być złożona i zawierać parametry uciążliwe wymagające estymacji

Zmiana populacji, horyzontu, zmiennych kontrolnych, reguły wartości odstających lub testu po zobaczeniu danych zmienia eksperyment, którego p-value jest interpretowane

P-value jest warunkowe względem modelu

Przy hipotezie zerowej statystyka testowa ma rozkład referencyjny; p-value mierzy, jak daleko zaobserwowana statystyka sięga w odpowiedni ogon

Mała wartość wskazuje na niezgodność danych z pełnym układem modelu zerowego, a nie na to, które założenie zawiodło ani czy alternatywa jest prawdziwa

Błędnie określona zależność, ciężkie ogony, heteroskedastyczność, błędy danych lub selekcja mogą sprawić, że rozkład referencyjny i p-value będą nieważne

Progi istotności definiują reguły błędu

Ustalony wcześniej poziom α ogranicza prawdopodobieństwo odrzucenia prawdziwej hipotezy zerowej przy założeniach testu, a nie odsetek opublikowanych twierdzeń, które są fałszywe

Błąd I rodzaju to fałszywe odrzucenie; błąd II rodzaju to nieodrzucenie fałszywej hipotezy zerowej, a moc to prawdopodobieństwo odrzucenia przy określonej alternatywie

Brak odrzucenia nie dowodzi braku efektu, szczególnie gdy próba ma niską moc wobec ekonomicznie istotnych alternatyw

Wielkość efektu i niepewność odpowiadają na różne pytania

Duże próby mogą uczynić małe efekty statystycznie istotnymi, podczas gdy zaszumione małe próby mogą nie wykryć efektów wystarczająco dużych, aby miały znaczenie

Obok p-value raportuj oszacowanie efektu, przedział, jednostki, koszty transakcji, pojemność i praktyczny próg

Wyniki tuż powyżej i poniżej 0.05 zwykle dostarczają podobnych dowodów; zamiana tej granicy w ostry przełącznik prawdy odrzuca informacje

Elastyczność badania zniekształca istotność

Opcjonalne zatrzymywanie, testowanie wielu specyfikacji, usuwanie obserwacji, zmiana wyników i publikowanie wyłącznie udanych testów zmieniają zachowanie fałszywych pozytywów

Nominalne p-value jest ważne tylko dla ścieżki analizy, która je wygenerowała, w tym dla uzasadnionych reguł sekwencyjnych lub korekt zadeklarowanych z wyprzedzeniem

Prerejestracja, kompletne dzienniki badania, analiza multiverse, nietknięte zbiory testowe i replikacja ujawniają wrażliwość, ale nie naprawiają błędnego modelu

Zależność finansowa osłabia testy podręcznikowe

Zwroty mogą być autokorelacyjne, zależne przekrojowo, heteroskedastyczne, nakładające się i warunkowane wybraną przetrwałą populacją

Naiwne błędy standardowe iid mogą zawyżać statystyki t, a wielokrotne odkrywanie czynników i backtesting tworzą znacznie większą niejawną rodzinę testów

Używaj błędów standardowych i resamplingu uzasadnionych strukturą szeregu czasowego, a następnie badaj stabilność w różnych reżimach, aktywach, kosztach, opóźnieniach i danych na żywo

Dowody powinny wspierać decyzję

Traktuj p-value jako jeden ciągły sygnał diagnostyczny wśród wielkości efektu, niepewności, wcześniejszych dowodów, mechanizmu, jakości predykcyjnej i kosztów decyzji

Z góry określ, który błąd ma znaczenie: fałszywy sygnał transakcyjny, pominięta ekspozycja na ryzyko, niestabilne zabezpieczenie albo model promowany bez wartości ekonomicznej

Raportuj pełną rodzinę analiz i nieudane replikacje, aby pojedynczy wybrany istotny wynik nie został pomylony z siłą programu badawczego

Częste pytania

Co oznacza p-value równe 0.05?

Przy określonym modelu zerowym wyniki co najmniej tak niezgodne jak zaobserwowana statystyka testowa występują z prawdopodobieństwem 0.05

Czy p poniżej 0.05 dowodzi hipotezy alternatywnej?

Nie. Nie przypisuje prawdopodobieństwa hipotezom ani nie wyklucza błędnej specyfikacji, selekcji, błędów danych lub ekonomicznie błahego efektu

Czy p powyżej 0.05 dowodzi, że nie ma efektu?

Nie. Oznacza, że test nie odrzucił hipotezy przy tym progu i może odzwierciedlać niską moc, szum, nieodpowiedni model albo rzeczywiście mały efekt

Dlaczego finansowe p-values są często zawyżone?

Zależność, wielokrotne poszukiwanie strategii, elastyczne specyfikacje, wybrane próby i nierealistyczne koszty mogą sprawić, że nominalne dowody wyglądają na silniejsze, niż są w rzeczywistości

Źródła i dalsza lektura

Szybki test

Przeczytano? Sprawdź się w 3 pytaniach

1 / 3

Pytanie 01

Które stwierdzenie najlepiej odpowiada temu przewodnikowi — Test zaczyna się przed p-value?

Wybierz odpowiedź, aby zobaczyć wyjaśnienie

Słownik opcji