A Calculadora de Valores P converte uma estatística de teste em um valor p para testes z, t, qui-quadrado ou F, com uma opção de uma cauda ou duas caudas quando o teste permite. Insira a estatística, os graus de liberdade quando necessário e a escolha da cauda; a calculadora retorna o valor p, compara-o com uma α escolhida e sombreia a região de rejeição em um gráfico de área de cauda.
Um valor p responde: se a hipótese nula fosse verdadeira, com que frequência dados pelo menos esse extremo apareceriam por acaso? Isso não responde se o valor nulo é verdadeiro. Essa distinção alimenta a seção de má interpretação abaixo.
Calcule um valor-p a partir de uma estatística de teste
As entradas suportadas são z, t com graus de liberdade, qui-quadrado com graus de liberdade e F com graus de liberdade do numerador e do denominador. Insira a estatística a partir da saída do teste; a calculadora a mapeia na distribuição de referência correspondente e retorna a probabilidade da cauda.
Para z e t, defina uma cauda ou duas caudas antes de ler o número para que a cor corresponda à hipótese.
Para z e t, escolha uma cauda ou duas caudas antes de ler o número. Os testes de qui-quadrado e F são tipicamente de um lado só (cauda superior) nas formas ensinadas nos cursos introdutórios; a interface reflete isso.
Escolha um teste de uma cauda ou de duas caudas
Um teste de duas caudas pergunta se a estatística difere do valor nulo em qualquer direção e dobra a área menor de uma cauda para testes simétricos z e t. Um teste de uma cauda pergunta apenas sobre uma direção nomeada.
Use o bi-cauda, a menos que o plano de pesquisa tenha se comprometido com uma direção antes de ver os dados; trocar após observar o sinal divide p pela metade e infla falsos positivos.
Use o sistema de duas caudas, a menos que o plano de pesquisa tenha se comprometido com uma direção antes de ver os dados. Mudar para o de uma cauda após observar o sinal reduz pela metade o valor p e infla os falsos positivos. Hipóteses direcionais pertencem ao protocolo, não a um resgate pós-hoc de um 0.06.
Compare o valor-p com o alfa
Alfa é o nível de significância pré-escolhido, frequentemente 0.05 e às vezes 0.01 ou 0.10. Se p for menor ou igual a alfa, rejeite a hipótese nula; se p for maior que alfa, não rejeite-a. Não rejeitar não é o mesmo que provar a verdadeira nula.
O estudo pode simplesmente não ter potência, por isso intervalos e tamanhos de efeito pertencem a qualquer decisão binária.
- Se p ≤ α, rejeite a hipótese nula.
- Se p > α, não rejeita a hipótese nula.
"Não rejeitar" não é o mesmo que "provar o nulo". O estudo pode simplesmente não ter poder. A calculadora destaca a comparação quando você coloca α ao lado do resultado.
Calcule um valor p bidirecionado a partir de z igual a 2.0
Para z igual a 2.0 em um teste normal de duas caudas, a área de uma cauda acima de 2.0 é cerca de 0.0228. Duplicando essa área, produz um valor p de duas caudas de cerca de 0.0455. Contra alfa 0.05 esse resultado rejeita o nulo; contra alfa 0.01 não muda. Os dados não mudaram entre essas duas decisões; apenas o limiar mudou.
1. Área de uma cauda acima de 2.0 ≈ 0.0228 (mais precisamente 0.02275). 2. P de duas caudas = 2 × 0.02275 ≈ 0.0455. 3. Contra α = 0.05: 0.0455 < 0.05 → rejeitar o nulo.
Contra α = 0.01, o mesmo valor p não é rejeitado. Os dados não mudaram; o limiar mudou. Por isso, α deve ser definido antes da análise em p, não negociado depois.
Leia o gráfico da área da cauda
O gráfico mostra a densidade de referência, uma linha vertical na estatística de teste e regiões sombreadas de rejeição para o α escolhido. Para α de duas caudas = 0.05 em uma curva normal, valores críticos ficam próximos a ±1.96. Uma estatística além de qualquer um dos valores críticos fica na sombra.
Verifique se as caudas sombreadas correspondem à direção selecionada do teste. Uma estatística negativa grande com apenas uma sombra superior selecionada é um erro de configuração, não evidência contra o nulo. Os marcadores de valor crítico em mais ou menos 1.96 para alfa de duas caudas 0.05 fornecem uma segunda verificação visual contra o número p.
Se a linha estatística estiver dentro do centro não sombreado enquanto p ainda está reportada, o visual e o número concordam: não rejeitar nesse α. Use o gráfico para verificar erros de sinal (um z negativo grande com apenas uma sombra na cauda superior selecionada).
Entenda o que um valor-p não significa
Cinco leituras erradas dominam os erros publicados, e cada uma está errada por um motivo específico explicado abaixo. Um valor p é uma probabilidade de cauda no modelo nulo, não uma probabilidade direta de que uma hipótese seja verdadeira, não um tamanho de efeito e nem uma chance de replicação. O corte 0.05 é uma convenção, e um resultado não significativo não é prova de que não há efeito.
1. Um valor-p não é a probabilidade de que a hipótese nula seja verdadeira. É a probabilidade de dados pelo menos tão extremos *se* os nulos fossem verdadeiros. Esses são condicionamentos diferentes. Confundi-los transforma uma probabilidade de cauda em uma aposta direta na hipótese.
2. Um valor p não é tamanho de efeito. Uma diferença trivial atinge p < 0.05 com uma amostra suficientemente grande. Reporte separadamente uma diferença média, razão de risco ou efeito padronizado; não trate p pequeno como "grande efeito".
3. Um valor-p não é a probabilidade de replicação. P de 0.03 não significa que um estudo repetido tenha uma chance de 97% de encontrar o mesmo resultado. A replicação depende de potência, tamanho real do efeito e desenho do estudo.
4. O limiar 0.05 é uma convenção, não uma lei da natureza. p = 0.049 e p = 0.051 são evidências quase idênticas. Dicotomiá-los em "significativo" e "não" para hábito em periódicos não cria uma linha clara nos dados.
5. Não significativo não significa "nenhum efeito." Não alcançar α pode significar que o estudo estava subdimensionado. A ausência de evidência não é evidência de ausência; verifique intervalos de confiança e potência antes de alegar um achado nulo.
Esses pontos estão alinhados com a declaração 2016 da Associação Americana de Estatística sobre valores p. A calculadora ainda compara p com α porque esse fluxo de trabalho é o que o trabalho de curso e muitos protocolos exigem; a seção acima é o que impede que o número seja superlido.
Leia o valor crítico de um alfa escolhido
Valores críticos são os cortes na escala estatística que correspondem a uma regra alfa e cauda escolhidos. Para um teste normal de duas caudas, eles são cerca de 1.645 em 0.10, 1.960 em 0.05 e 2.576 em 0.01. Rejeitar quando o z absoluto excede o valor crítico, que é equivalente a p menor ou igual a alfa.
Para testes t, o corte também depende dos graus de liberdade.
| α | Crítica | z | |
|---|---|---|---|
| 0.10 | 1.645 | ||
| 0.05 | 1.960 | ||
| 0.01 | 2.576 |
Rejeitar quando |z| excede o valor crítico (equivalentemente quando p ≤ α). Para testes t, o valor crítico depende de df e é maior que z para amostras pequenas. O Calculador de Intervalos de Confiança usa os mesmos valores críticos ao construir intervalos.
Reportando valores-p sem as armadilhas usuais
Reporte o p exato quando o software fornecer, não apenas uma estrela ou um selo "p menor que 0.05". Pare-o com um tamanho de efeito ou intervalo de confiança para que os leitores possam avaliar a magnitude. Comprometa-se previamente com alfa e regras de uma versus duas caudas no plano de análise quando o trabalho for confirmatório.
Análises exploratórias ainda produzem valores p, mas devem ser rotulados como exploratórios. Múltiplos testes não ajustados inflam a chance de pelo menos um falso positivo; esse problema não é resolvido por esta calculadora, e não é resolvido mudando silenciosamente de dois lados para um só cauda após ver o sinal.
Perguntas frequentes
O que é um valor-p?
Um valor p é a probabilidade, sob a hipótese nula, de obter uma estatística de teste pelo menos tão extrema quanto a observada. P menor significa que os dados são menos compatíveis com o nulo nesse modelo.
O que é alfa?
Alfa (α) é o nível de significância pré-escolhido usado como corte de rejeição/falha em rejeitar, comumente 0.05. É uma escolha de política para controle de erros, não uma constante descoberta.
Devo usar um teste de uma cauda ou de duas caudas?
Use a de duas caudas, a menos que uma hipótese direcional tenha sido especificada antes de ver os dados. Testes de uma cauda são mais fáceis de "passar" e frequentemente são usados de forma incorreta depois.
p = 0.049 é significativamente diferente de p = 0.051?
Não. Eles representam quase a mesma força de evidência. A linha clara em 0.05 é convencional.
Um valor p significativo comprova a hipótese de pesquisa?
Não. Indica dados incomuns sob o nulo no α escolhido, dadas as suposições do modelo. Modelos de confusão, viés e errados continuam possíveis.
Um resultado não significativo prova não ter efeito?
Não. O estudo pode não ter potência. Relate intervalos e considere os tamanhos dos efeitos antes de alegar uma conclusão nula.
Qual estatística de teste devo inserir?
Insira a estatística que seu procedimento produziu: z para testes normais de amostra grande, t para testes de média com σ estimado, qui-quadrado para muitos testes categóricos, F para muitos testes de razão de variância. Compare df com a mesma saída.
Como um valor-p bidirecionado é calculado a partir de z?
Encontre a área de uma cauda além de |z|, e dobre essa área. Para z = 2.0, uma cauda ≈ 0.0228 e duas caudas ≈ 0.0455.
O software pode discordar um pouco sobre p?
Sim. Algoritmos de cauda e arredondamento diferem na quarta decimal. Desacordos nos dois primeiros decimais geralmente significam caudas erradas, df errado ou a família de distribuições errada.
Resumo
A Calculadora de Valores P transforma estatísticas z, t, qui-quadrado ou F em valores p, compara-os com α e sombreia a região de rejeição. Um z de duas caudas = 2.0 gera p ≈ 0.0455, que rejeita em 0.05 e não em 0.01.
Um p-valor não é a probabilidade de que o nulo seja verdadeiro, nem o tamanho do efeito, nem a probabilidade de replicação; 0.05 é uma convenção; e a não significância não é prova de que não há efeito.
Use esta página para a decisão de significado; use a Calculadora de Pontuação Z quando você precisar apenas da pontuação padronizada e da área da curva.