Metabeskrivning (154): Beräkna ett p-värde från z-, t-, chi-kvadrat- eller F-statistik. P-värdeskalkylatorn jämför med alfa och förklarar fem vanliga feltolkningar.
P-värdeskalkylatorn omvandlar en teststatistik till ett p-värde för z-, t-, chi-kvadrat- eller F-tester, med ett ensidigt eller tvåsidigt alternativ där testet tillåter det. Ange statistiken, frihetsgrader vid behov och svansvalet; kalkylatorn returnerar p-värdet, jämför det med en vald α och skuggar avvisningsområdet på en svansarea-diagram.
Ett p-värde svarar: om nollhypotesen vore sann, hur ofta skulle data minst detta extrema dyka upp av en slump? Det svarar inte på om nollhypotesen är sann. Den distinktionen driver feltolkningsavsnittet nedan.
Beräkna ett p-värde från en teststatistik
Stödda indata är z, t med frihetsgrader, chi-kvadrat med frihetsgrader och F med tjuvar- och nämnargrader. Mata in statistiken från testutgången; kalkylatorn mappar den till den matchande referensfördelningen och returnerar svansens sannolikhet.
För z och t, sätt ensidigt eller tvåsidigt innan du läser av talet så att nyansen matchar hypotesen.
För z och t, välj ensidigt eller tvåsidigt innan du läser numret. Chi-kvadrat- och F-tester är vanligtvis ensidiga (övre svans) i de former som lärs ut i introduktionskurser; gränssnittet speglar det.
Välj ett ensidigt eller tvåsidigt test
Ett tvåsidigt test frågar om statistiken skiljer sig från nollvärdet i någon riktning och fördubblar den mindre ensvansade ytan för symmetriska z- och t-tester. Ett ensidigt test frågar endast om en namngiven riktning.
Använd tvåsidigt om inte forskningsplanen bestämt sig för en riktning innan datan ser den; byter efter att tecknet halverar p och blåser upp falska positiva.
Använd tvåsidigt om inte forskningsplanen har bestämt sig för en riktning innan datan ses. Att byta till ensidigt efter att ha observerat tecknet halverar p-värdet och blåser upp falska positiva. Riktningshypoteser hör hemma i protokollet, inte i en efterhandsräddning av en 0.06.
Jämför p-värdet med alfa
Alfa är den förutvalda signifikansnivån, ofta 0.05 och ibland 0.01 eller 0.10. Om p är mindre än eller lika med alfa, förkasta nollhypotesen; om p är större än alfa, misslyckas med att förkasta den. Att inte förkasta är inte samma sak som att bevisa att nollhypotesen är sann.
Studien kan helt enkelt sakna kraft, vilket är anledningen till att intervall och effektstorlekar hör hemma bredvid alla binära beslut.
- Om p ≤ α, förkasta nollhypotesen.
- Om p > α, misslyckas du med att förkasta nollhypotesen.
"Misslyckas med att avslå" är inte samma sak som "bevisa noll." Studien kan helt enkelt sakna kraft. Kalkylatorn markerar jämförelsen när du ställer α bredvid resultatet.
Beräkna ett tvåsidigt p-värde från z lika med 2.0
För z är lika med 2.0 i ett tvåsvansat normalt test är en-svans-området ovanför 2.0 ungefär 0.0228. Att dubbla det området ger ett tvåsvansat p-värde på cirka 0.0455. Mot alfa 0.05 avvisar det resultatet nollvärdet; mot alfa 0.01 gör det det inte. Datan ändrades inte mellan dessa två beslut; endast tröskeln gjorde det.
1. En-svansområde ovanför 2.0 ≈ 0.0228 (mer exakt 0.02275). 2. Tvåsvansad p = 2 × 0.02275 ≈ 0.0455. 3. Mot α = 0.05: 0.0455 < 0.05 → förkasta nollan.
Mot α = 0.01 misslyckas samma p-värde med att avvisas. Datan ändrades inte; tröskeln gjorde det. Därför måste α sättas före titten på p, inte förhandlas efteråt.
Läs svansområdets diagram
Diagrammet visar referenstätheten, en vertikal linje vid teststatistiken och skuggade avvisningsområden för den valda α. För tvåsidiga α = 0.05 på en normalkurva ligger kritiska värden nära ±1.96. En statistik bortom något av de kritiska värdena hamnar i skuggan.
Kontrollera att de skuggade svansarna matchar den valda testriktningen. En stor negativ statistik med endast en övre svansskugga vald är ett setupfel, inte bevis mot nollpunkten. De kritiska värdemarkörerna vid plus eller minus 1.96 för tvåsvansad alfa 0.05 ger en andra visuell kontroll mot numeriskt p.
Om statistiklinjen ligger inom det oskuggade centrumet medan p fortfarande rapporteras, stämmer visuella och siffran överens: misslyckas med att avvisa vid den α. Använd diagrammet för att kontrollera teckenfel (ett stort negativt z med endast en övre skugga vald).
Förstå vad ett p-värde inte betyder
Fem felläsningar dominerar publicerade misstag, och varje är fel av en specifik anledning som beskrivs nedan. Ett p-värde är en svanssannolikhet enligt nollmodellen, inte en direkt sannolikhet att en hypotes är sann, inte en effektstorlek och inte en replikationschans. 0.05-gränsen är en konvention, och ett icke-signifikant resultat är inte bevis på ingen effekt.
1. Ett p-värde är inte sannolikheten att nollhypotesen är sann. Det är sannolikheten för data minst så extrema *om* nollhypotesen vore sann. Det är olika betingningar. Att förväxla dem förvandlar en svanssannolikhet till ett direkt vad på hypotesen.
2. Ett p-värde är inte en effektstorlek. En trivial skillnad når p < 0.05 med ett tillräckligt stort urval. Rapportera separat medelskillnad, riskkvot eller standardiserad effekt; behandla inte liten p som "stor effekt."
3. Ett p-värde är inte sannolikheten för replikation. Ett p på 0.03 betyder inte att en upprepad studie har en 97% chans att hitta samma resultat. Replikation beror på styrka, verklig effektstorlek och studiedesign.
4. 0.05-tröskeln är en konvention, inte en naturlag. p = 0.049 och p = 0.051 är nästan identiska bevis. Att dela upp dem i "signifikant" och "inte" för journalvana skapar ingen tydlig linje i datan.
5. Icke-signifikant är inte "ingen effekt." Att inte nå α kan betyda att studien var underdimensionerad. Avsaknad av bevis är inte bevis på frånvaro; kontrollera konfidensintervall och styrka innan du hävdar ett nollresultat.
Dessa punkter stämmer överens med American Statistical Associations 2016-uttalande om p-värden. Kalkylatorn jämför fortfarande p med α eftersom det arbetsflödet är vad kursarbete och många protokoll kräver; avsnittet ovan är det som hindrar att siffran läses för mycket.
Läs det kritiska värdet för en vald alfa
Kritiska värden är gränsvärdena på statistikskalan som matchar en vald alfa- och svansregel. För ett tvåsidigt normaltest är de ungefär 1.645 vid 0.10, 1.960 vid 0.05 och 2.576 vid 0.01. Avvisa när det absoluta z överstiger det kritiska värdet, vilket är ekvivalent med p mindre än eller lika med alfa.
För t-tester beror gränsen också på frihetsgrader.
| α | Kritik | z | |
|---|---|---|---|
| 0.10 | 1.645 | ||
| 0.05 | 1.960 | ||
| 0.01 | 2.576 |
Avvisa när |z| överskrider det kritiska värdet (likaså när p ≤ α). För t tester beror det kritiska värdet på df och är större än z för små prover. Konfidensintervallkalkylatorn använder samma kritiska värden när intervall byggs.
Rapportering av p-värden utan de vanliga fällorna
Rapportera exakt p när programvaran tillhandahåller det, inte bara en stjärna eller en "p mindre än 0.05"-märke. Kombinera det med en effektstorlek eller ett konfidensintervall så att läsarna kan bedöma magnituden. Precommittera alfa- och en- kontra tvåsidiga regler i analysplanen när arbetet är bekräftande.
Utforskande analyser ger fortfarande p-värden, men de bör märkas som exploratoriska. Flera ojusterade tester ökar chansen för minst ett falskt positivt; det problemet löses inte av denna kalkylator, och det löses inte genom att tyst byta från tvåsidigt till ensidigt efter att ha sett tecknet.
Vanliga frågor
Vad är ett p-värde?
Ett p-värde är sannolikheten, enligt nollhypotesen, att erhålla en teststatistik som är minst lika extrem som den observerade. Mindre p innebär att data är mindre kompatibla med nollvärdet enligt den modellen.
Vad är alfa?
Alfa (α) är den förutvalda signifikansnivån som används som en avstängnings-/avvisningsgräns, vanligtvis 0.05. Det är ett policyval för felkontroll, inte en upptäckt konstant.
Bör jag använda ett ensidigt eller tvåsidigt test?
Använd tvåsidigt om inte en riktningshypotes specificerades innan datan sågs. Ensidiga tester är lättare att "klara" och missbrukas ofta i efterhand.
Är p = 0.049 meningsfullt annorlunda än p = 0.051?
Nej. De representerar nästan samma styrka på bevisen. Den tydliga linjen vid 0.05 är konventionell.
Bekräftar ett betydande p-värde forskningshypotesen?
Nej. Det indikerar data som är ovanliga under nollpunkten vid den valda α, givet modellens antaganden. Förväxling, bias och felaktiga modeller är fortfarande möjliga.
Visar ett icke-signifikant resultat ingen effekt?
Nej. Studien kan sakna kraft. Rapportera intervall och överväg effektstorlekar innan du gör en nollslutsats.
Vilken teststatistik ska jag ange i?
Ange statistiken som din procedur producerade: z för storprovsnormala tester, t för medelvärdestester med uppskattad σ, kviktor för många kategoriska tester, F för många varianskvotstester. Matcha df med samma resultat.
Hur beräknas ett tvåsidigt p-värde från z?
Hitta en-svans-området bortom |z|, och fördubbla det sedan. För z = 2.0, en-svansad ≈ 0.0228 och två-svansad ≈ 0.0455.
Kan mjukvara vara lite oense om p?
Ja. Svansalgoritmer och avrundning skiljer sig vid fjärde decimalen. Oenigheter i de två första decimaltalen betyder oftast fel svansar, fel df eller fel fördelningsfamilj.
Sammanfattning
P-värdeskalkylatorn omvandlar z-, t-, k-kvadrat- eller F-statistik till p-värden, jämför dem med α och skuggar avvisningsområdet. En tvåsvansad z = 2.0 ger p ≈ 0.0455, som avvisar vid 0.05 och inte vid 0.01.
Ett p-värde är inte sannolikheten att nollvärdet är sant, inte en effektstorlek, inte en replikationssannolikhet; 0.05 är en konvention; och icke-signifikans är inte bevis på ingen effekt.
Använd denna sida för signifikansbeslutet; använd Z-Score Calculator när du bara behöver det standardiserade poäng- och kurvområdet.