Tytuł SEO (48): Kalkulator wartości P-Testy - Z, T, Chi-kwadrat i F Metaopis (154): Oblicz wartość p ze statystyk z, t, chi-kwadrat lub F. Kalkulator wartości p porównuje z alfa i wyjaśnia pięć typowych błędnych odczytów.
Kalkulator wartości p przekształca statystykę testową na wartość p dla testów z, t, chi-kwadrat lub F, z opcją jednostronną lub dwustronną, jeśli test na to pozwala. Wprowadź statystykę, stopnie swobody, gdy jest to wymagane, oraz wybór ogona; kalkulator zwraca wartość p, porównuje ją z wybranym α i zacienia obszar odrzucenia na wykresie powierzchni ogonowej.
Wartość p odpowiada: jeśli hipoteza zerowa byłaby prawdziwa, jak często dane przynajmniej tak ekstremalne pojawiłyby się przypadkiem? Nie odpowiada ona na pytanie, czy wartość zerowa jest prawdziwa. To rozróżnienie napędza poniższą sekcję błędnej interpretacji.
Oblicz wartość p ze statystyki testowej
Wspierane wejścia to z, t z stopniami swobody, chi-kwadrat z stopniami swobody oraz F z stopniami swobody licznika i mianownika. Wprowadź statystykę z wyniku testu; kalkulator odwzorowuje ją na rozkład odniesienia i zwraca prawdopodobieństwo ogona.
Dla z i t ustaw jednostronny lub dwustronny przed odczytaniem liczby, aby odcień odpowiadał hipotezie.
Dla z i t wybierz jednostronny lub dwustronny przed odczytaniem liczby. Testy chi-kwadrat i F są zazwyczaj jednostronne (górny ogon) w formach nauczanych na kursach wprowadzających; interfejs to odzwierciedla.
Wybierz test jednostronny lub dwustronny
Test dwustronny pyta, czy statystyka różni się od wartości zerowej w którymkolwiek kierunku i podwaja mniejszy jednoogonowy obszar dla symetrycznych testów z i t. Test jednostronny dotyczy tylko jednego nazwanego kierunku.
Stosuj dwustronny, chyba że plan badawczy zobowiązał się do określonego kierunku przed zapoznaniem się z danymi; przełączanie po obserwacji znaku zmniejsza p o połowę i zwiększa fałszywie pozytywne wyniki.
Stosuj dwustronny, chyba że plan badawczy zobowiązał się do określonego kierunku przed zapoznaniem się z danymi. Przełączenie na jednostronne po obserwacji znaku zmniejsza wartość p o połowę i zawyża fałszywe pozytywy. Hipotezy kierunkowe należą do protokołu, a nie do post-hoc ratowania 0.06.
Porównaj wartość p z alfa
Alfa to wybrany poziom istotności, często 0.05, a czasem 0.01 lub 0.10. Jeśli p jest mniejsze lub równe alfie, odrzucamy hipotezę zerową; jeśli p jest większe niż alfa, nie odrzucamy jej. Niepowodzenie odrzucenia nie jest tym samym, co udowodnienie prawdziwości zerowej.
Badanie może po prostu nie mieć mocy, dlatego przedziały i rozmiary efektów należą do każdej decyzji binarnej.
- Jeśli p ≤ α, odrzuć hipotezę zerową.
- Jeśli p > α, nie odrzucamy hipotezy zerowej.
"Nie odrzucić" to nie to samo co "udowodnić wartość zerową". Badanie może po prostu nie mieć mocy. Kalkulator podkreśla porównanie, gdy ustawisz α obok wyniku.
Oblicz dwustronną wartość p z równa się 2.0
Dla z równego 2.0 w dwustronnym teście normalnym, jednoogonowy obszar powyżej 2.0 wynosi około 0.0228. Podwojenie tej powierzchni daje dwustronną wartość p około 0.0455. Wobec alfa 0.05 ten wynik odrzuca wartość zerową; wobec alfa 0.01 nie odrzuca. Dane nie zmieniły się między tymi dwoma decyzjami; zmienił się jedynie próg.
1. Obszar jednoogonowy powyżej 2.0 ≈ 0.0228 (dokładniej 0.02275). ⟦UM0⟧. Dwustronny p = ⟦UM1⟧ × 0.02275 ≈ 0.0455. 3. Przeciwko α = 0.05: 0.0455 < 0.05 → odrzuć null.
Przeciwko α = 0.01 ta sama wartość p nie odrzuca. Dane się nie zmieniły; zmienił się próg. Dlatego α musi być ustawione przed patrzeniem na p, a nie negocjowane później.
Przeczytaj wykres obszaru ogonowego
Wykres pokazuje gęstość odniesienia, pionową linię przy statystyce testowej oraz zacieniowane obszary odrzucenia dla wybranego α. Dla dwustronnych α = 0.05 na krzywej normalnej, wartości krytyczne znajdują się w pobliżu ±1.96. Statystyka poza którąkolwiek z tych wartości krytycznych znajduje się w cieniu.
Sprawdź, czy zacienione ogony odpowiadają wybranemu kierunku testowemu. Duży ujemny statystyczny z wybranym tylko odcieniem górnego ogona to błąd konfiguracyjny, a nie dowód przeciwko zerowi. Znaczniki wartości krytycznej przy plus lub minus 1.96 dla dwustronnej alfa 0.05 dają drugą wizualną kontrolę względem numerycznej p.
Jeśli linia statystyki znajduje się wewnątrz niezacieniowanego środka, gdy p jest nadal raportowane, obraz i liczba zgadzają się: nie odrzuca w tym α. Użyj wykresu do sprawdzenia błędów znaków (duże negatywne z z wybranym tylko odcieniem górnego ogonu).
Zrozum, czego nie oznacza wartość p
Pięć błędnych odczytów dominuje wśród opublikowanych błędów, a każde z nich jest błędne z konkretnego powodu, opisanego poniżej. Wartość p to prawdopodobieństwo ogona w modelu zerowym, a nie bezpośrednie prawdopodobieństwo prawdziwości hipotezy, nie rozmiar efektu ani szansa replikacji. Próg 0.05 jest konwencją, a wynik nieistotny nie jest dowodem braku efektu.
1. Wartość p nie jest prawdopodobieństwem, że hipoteza zerowa jest prawdziwa. Jest prawdopodobieństwem danych przynajmniej tak ekstremalnych *gdy* zerowa hipoteza byłaby prawdziwa. To są różne warunkowania. Mylenie ich zamienia prawdopodobieństwo ogona w bezpośredni zakład na hipotezę.
2. Wartość p nie jest rozmiarem efektu. Drobna różnica osiąga p < 0.05 przy wystarczająco dużej próbie. Osobno raportuj średnią różnicę, wskaźnik ryzyka lub efekt standaryzowany; nie traktuj małego p jako "dużego efektu."
3. Wartość p nie jest prawdopodobieństwem replikacji. P 0.03 nie oznacza, że powtarzane badanie ma 97% szans na uzyskanie tego samego wyniku. Replikacja zależy od mocy, rzeczywistego rozmiaru efektu i projektu badania.
4. Próg 0.05 jest konwencją, a nie prawem natury. p = 0.049 i p = 0.051 to niemal identyczne dowody. Podzielenie ich na "istotne" i "nie" dla nawyku dziennika nie tworzy wyraźnej granicy w danych.
5. Nieistotne nie oznacza "brak efektu". Brak osiągnięcia α może oznaczać, że badanie było niewystarczające. Brak dowodów nie jest dowodem braku; sprawdź przedziały ufności i moc przed zgłoszeniem wniosku o nieważność.
Te punkty są zgodne z oświadczeniem Amerykańskiego Towarzystwa Statystycznego 2016 dotyczącym wartości p. Kalkulator nadal porównuje p z α, ponieważ taki przepływ pracy jest wymagany przez prace kursowe i wiele protokołów; powyższa sekcja zapobiega nadmiernemu odczytywaniu liczby tych danych.
Przeczytaj wartość krytyczną dla wybranego alfa
Wartości krytyczne to progi na skali statystycznej, które odpowiadają wybranej zasadzie alfa i ogona. Dla dwustronnego testu normalnego wynoszą one około 1.645 przy 0.10, 1.960 przy 0.05 oraz 2.576 przy 0.01. Odrzuc, gdy absolutne z przekracza wartość krytyczną, która jest równoważna p mniejszej lub równej alfie.
W testach t odcięcie zależy także od stopni swobody.
| α | Krytyczne | z | |
|---|---|---|---|
| 0.10 | 1.645 | ||
| 0.05 | 1.960 | ||
| 0.01 | 2.576 |
Odrzucić, gdy |z| przekracza wartość krytyczną (równoważnie, gdy p ≤ α). Dla testów t wartość krytyczna zależy od df i jest większa niż z dla małych próbek. Kalkulator Przedziałów Ufności używa tych samych wartości krytycznych przy budowie przedziałów.
Raportowanie wartości p bez typowych pułapek
Raportuj dokładne p, gdy oprogramowanie je dostarcza, nie tylko gwiazdkę czy odznakę "p mniej niż 0.05". Połącz ją z rozmiarem efektu lub przedziałem ufności, aby czytelnicy mogli ocenić wielkość. Wstępnie zadeklaruj alfa oraz zasady jednostronne kontra dwustronne w planie analizy, gdy praca zostanie potwierdzona.
Analizy eksploracyjne nadal dają wartości p, ale powinny być oznaczone jako eksploracyjne. Wiele nieskorygowanych testów zawyża szansę na co najmniej jeden fałszywie pozytywny wynik; ten problem nie jest rozwiązywany przez ten kalkulator i nie jest rozwiązywany przez ciche przejście z dwustronnego na jednostronny po zobaczeniu znaku.
Często zadawane pytania
Czym jest wartość p?
Wartość p to prawdopodobieństwo, według hipotezy zerowej, uzyskania statystyki testowej co najmniej tak ekstremalnej jak obserwowana. Mniejsze p oznacza, że dane są mniej zgodne z zerową w tym modelu.
Czym jest alfa?
Alfa (α) to wybrany poziom istotności używany jako odcięcie odrzucenia/nieodrzucenia, zwykle 0.05. Jest to wybór polityki do kontroli błędów, a nie stała odkryta.
Czy powinienem użyć testu jednostronnego czy dwustronnego?
Stosuj dwustronne, chyba że przed zapoznaniem się z danymi określono hipotezę kierunkową. Testy jednostronne łatwiej "przejść" i często są niewłaściwie wykorzystywane po fakcie.
Czy p = 0.049 jest znacząco różniące się od p = 0.051?
Nie. Reprezentują niemal taką samą siłę dowodów. Jasna linia przy 0.05 jest konwencjonalna.
Czy istotna wartość p potwierdza hipotezę badawczą?
Nie. Wskazuje dane nietypowe względem zerowej wartości w wybranym α, biorąc pod uwagę założenia modelu. Możliwe są zakłócenia, błędy i błędne modele.
Czy wynik nieistotny dowodzi brakiem efektu?
Nie. Badanie może nie mieć mocy. Raportuj interwały i rozważ rozmiary efektów, zanim stwierdzisz wniosek nieważny.
Jaką statystykę testową powinienem wprowadzić?
Wprowadź statystykę wygenerowaną przez procedurę: z dla testów normalnych na dużej próbie, t dla testów średnich z szacowanym σ, chi-kwadrat dla wielu testów kategorycznych, F dla wielu testów wariancji. Dopasuj df do tego samego wyniku.
Jak oblicza się dwustronną wartość p z z?
Znajdź obszar jednoogonowy za |z|, a następnie go podwoj. Dla z = 2.0, jednoogonowego ≈ 0.0228 i dwuogonowego ≈ 0.0455.
Czy oprogramowanie może się nieco różnić w kwestii p?
Tak. Algorytmy ogonkowe i zaokrąglenie różnią się na czwartym dziesiętnie. Różnice w pierwszych dwóch przecinkach zwykle oznaczają błędne reszki, błędne df lub niewłaściwą rodzinę rozkładów.
Podsumowanie
Kalkulator wartości p zamienia statystyki z, t, chi-kwadrat lub F na wartości p, porównuje je z α i zacienia obszar odrzucenia. Dwustronne z = 2.0 daje p ≈ 0.0455, które odrzuca przy 0.05, a nie przy 0.01.
Wartość p nie jest prawdopodobieństwem prawdziwości zerowej, nie jest rozmiarem efektu, nie jest prawdopodobieństwem replikacji; 0.05 jest konwencją; a nieistotność nie jest dowodem braku efektu.
Użyj tej strony do oceny istotności; użyj kalkulatora Z-Score, gdy potrzebujesz tylko standaryzowanego wyniku i obszaru krzywej.