La Calculadora de Valores P convierte una estadística de prueba en un valor p para pruebas z, t, chi cuadrado o F, con una opción de una o dos colas cuando la prueba lo permita. Introduce la estadística, los grados de libertad cuando sea necesario y la elección de cola; la calculadora devuelve el valor p, lo compara con una α elegida y sombrea la región de rechazo en un gráfico de área de cola.
Un valor p responde: si la hipótesis nula fuera verdadera, ¿con qué frecuencia aparecerían al menos por casualidad los datos, al menos este extremo? No responde si el nulo es verdadero. Esa distinción impulsa la sección de mala interpretación que se encuentra a continuación.
Calcula un valor p a partir de una estadística de prueba
Las entradas soportadas son z, t con grados de libertad, chi-cuadrado con grados de libertad y F con grados de libertad del numerador y denominador. Introduce la estadística desde la salida de la prueba; la calculadora la mapea a la distribución de referencia correspondiente y devuelve la probabilidad de cola.
Para z y t, se coloca en una o dos colas antes de leer el número para que el tono coincida con la hipótesis.
Para z y t, elige una cola o una cola antes de leer el número. Las pruebas de chi cuadrado y F suelen ser unilaterales (cola superior) en las formas que se enseñan en los cursos introductorios; la interfaz refleja eso.
Elige una prueba de una cola o de dos colas
Una prueba de dos colas pregunta si la estadística difiere del valor nulo en cualquiera de las dos direcciones y duplica el área de una cola más pequeña para las pruebas simétricas z y t. Una prueba de una sola cola pregunta sobre una sola dirección con nombre.
Usa el de dos colas a menos que el plan de investigación se comprometa con una dirección antes de ver los datos; cambiar tras observar el signo reduce a la mitad p e infla los falsos positivos.
Utiliza la de dos colas a menos que el plan de investigación haya comprometido una dirección antes de ver los datos. Cambiar a una cola tras observar el signo reduce a la mitad el valor p e infla los falsos positivos. Las hipótesis direccionales pertenecen al protocolo, no a un rescate post-hoc de un 0.06.
Compara el valor p con el alfa
Alfa es el nivel de significancia preelegido, a menudo 0.05 y a veces 0.01 o 0.10. Si p es menor o igual que alfa, rechazar la hipótesis nula; si p es mayor que alfa, no rechazarla. No rechazar no es lo mismo que demostrar la verdad nula.
El estudio puede simplemente carecer de potencia, por eso los intervalos y los tamaños de efecto están al lado de cualquier decisión binaria.
- Si p ≤ α, rechazar la hipótesis nula.
- Si p > α, no rechazar la hipótesis nula.
"No rechazar" no es lo mismo que "demostrar el nulo". El estudio puede simplemente carecer de potencia. La calculadora destaca la comparación una vez que α colocas junto al resultado.
Calcular un valor p bicolar a partir de z es igual a 2.0
Para z es igual a 2.0 en una prueba normal de dos colas, el área de una cola por encima de 2.0 es aproximadamente 0.0228. Duplicar esa área produce un valor p de dos colas de aproximadamente 0.0455. Frente a alfa 0.05 ese resultado rechaza el nulo; contra alfa 0.01 no lo hace. Los datos no cambiaron entre esas dos decisiones; solo el umbral cambió.
1. Área de una sola cola por encima de 2.0 ≈ 0.0228 (más precisamente 0.02275). 2. P de dos colas = 2 × 0.02275 ≈ 0.0455. 3. Contra α = 0.05: 0.0455 < 0.05 → rechazar el nulo.
Frente a α = 0.01 el mismo valor p no se rechaza. Los datos no cambiaron; sí cambió el umbral. Por eso α debe establecerse antes de la mirada en p, no negociarse después.
Lee la gráfica del área de la cola
El gráfico muestra la densidad de referencia, una línea vertical en la estadística de prueba y las regiones de rechazo sombreadas para el α elegido. Para α bicolas = 0.05 en una curva normal, los valores críticos se sitúan cerca de ±1.96. Una estadística superior a cualquiera de los valores críticos queda en la sombra.
Comprueba que las colas sombreadas coincidan con la dirección seleccionada de la prueba. Una estadística negativa grande con solo una sombra superior seleccionada es un error de configuración, no evidencia contra el nulo. Los marcadores de valor crítico en más o menos 1.96 para alfa de dos colas 0.05 ofrecen una segunda comprobación visual contra el número p.
Si la línea estadística se sitúa dentro del centro sin sombrear mientras p sigue reportada, el visual y el número coinciden: no rechazar en ese α. Usa el gráfico para comprobar errores de signo (una z negativa grande con solo una sombra de cola superior seleccionada).
Entiende qué no significa un valor p
Cinco malas interpretaciones dominan los errores publicados, y cada uno es incorrecto por una razón específica que se explica a continuación. Un valor p es una probabilidad de cola bajo el modelo nulo, no una probabilidad directa de que una hipótesis sea verdadera, ni un tamaño de efecto, ni una probabilidad de replicación. El corte 0.05 es una convención, y un resultado no significativo no es prueba de que no hay efecto.
1. Un valor p no es la probabilidad de que la hipótesis nula sea verdadera. Es la probabilidad de que los datos sean al menos tan extremos *si* los nulos fueran verdaderos. Esos son condicionamientos diferentes. Confundirlos convierte una probabilidad de cola en una apuesta directa sobre la hipótesis.
2. Un valor p no es un tamaño de efecto. Una diferencia trivial alcanza p < 0.05 con una muestra suficientemente grande. Por separado, informa de una diferencia media, razón de riesgo o efecto estandarizado; no trates a p pequeña como "efecto grande".
3. Un valor p no es la probabilidad de replicación. Un p de 0.03 no significa que un estudio repetido tenga una probabilidad de 97% de encontrar el mismo resultado. La replicación depende de la potencia, el tamaño real del efecto y el diseño del estudio.
4. El umbral 0.05 es una convención, no una ley de la naturaleza. p = 0.049 y p = 0.051 son pruebas casi idénticas. Dicotomizarlas en "significativo" y "no" para el hábito de la revista no crea una línea clara en los datos.
5. No significativo no significa "ningún efecto". No alcanzar α puede significar que el estudio tenía poca potencia. La ausencia de evidencia no es evidencia de ausencia; comprueba intervalos de confianza y potencia antes de reclamar un hallazgo nulo.
Estos puntos coinciden con la afirmación 2016 de la Asociación Americana de Estadística sobre los valores p. La calculadora sigue comparando p con α porque ese flujo de trabajo es lo que requieren el trabajo de cursos y muchos protocolos; la sección anterior es lo que evita que el número sea sobreleído.
Lee el valor crítico de una alfa elegida
Los valores críticos son los cortes en la escala estadística que coinciden con una regla alfa y de cola elegida. Para una prueba normal de dos colas, son aproximadamente 1.645 en 0.10, 1.960 en 0.05 y 2.576 en 0.01. Rechazar cuando el z absoluto excede el valor crítico, que es equivalente a p menor o igual a alfa.
Para las pruebas de t, el corte también depende de los grados de libertad.
| α | Crítica | z | |
|---|---|---|---|
| 0.10 | 1.645 | ||
| 0.05 | 1.960 | ||
| 0.01 | 2.576 |
Rechazar cuando |z| excede el valor crítico (equivalentemente cuando p ≤ α). Para pruebas t el valor crítico depende de df y es mayor que z para muestras pequeñas. La Calculadora de Intervalos de Confianza utiliza los mismos valores críticos al construir intervalos.
Reportar valores p sin las trampas habituales
Informa del p exacto cuando el software lo proporcione, no solo una estrella o una insignia de "p menor que 0.05". Emparejalo con un tamaño de efecto o un intervalo de confianza para que los lectores puedan juzgar la magnitud. Compromete previamente con alfa y reglas de una contra dos colas en el plan de análisis cuando el trabajo sea confirmatorio.
Los análisis exploratorios siguen produciendo valores p, pero deben etiquetarse como exploratorios. Múltiples pruebas sin ajustar inflan la probabilidad de al menos un falso positivo; ese problema no se resuelve con esta calculadora, y no se resuelve cambiando silenciosamente de dos colas a una cola tras ver el signo.
Preguntas frecuentes
¿Qué es un valor p?
Un valor p es la probabilidad, bajo la hipótesis nula, de obtener una estadística de prueba al menos tan extrema como la observada. P menor significa que los datos son menos compatibles con el nulo bajo ese modelo.
¿Qué es el alfa?
Alfa (α) es el nivel de significancia preelegido usado como corte de rechazo/fallo, comúnmente 0.05. Es una elección de política para el control de errores, no una constante descubierta.
¿Debería usar una prueba de una cola o de dos colas?
Utiliza pruebas de dos colas a menos que se haya especificado una hipótesis direccional antes de ver los datos. Las pruebas de una sola colas son más fáciles de "aprobar" y a menudo se usan mal a posteriori.
¿Es p = 0.049 significativamente diferente de p = 0.051?
No. Representan casi la misma fuerza de evidencia. La línea clara en 0.05 es convencional.
¿Un valor p significativo demuestra la hipótesis de investigación?
No. Indica datos inusuales bajo el nulo en la α elegida, dadas las suposiciones del modelo. Siguen siendo posibles modelos de confusión y sesgo incorrecto.
¿Un resultado no significativo no demuestra que no tiene efecto?
No. El estudio puede carecer de potencia. Informa los intervalos y considera los tamaños de efecto antes de reclamar una conclusión nula.
¿Qué estadística de prueba debería introducir?
Introduce la estadística que ha producido tu procedimiento: z para pruebas normales de muestra grande, t para pruebas medias con σ estimado, chi-cuadrado para muchas pruebas categóricas, F para muchas pruebas de razón de varianza. Empareja df con la misma salida.
¿Cómo se calcula un valor p bilatéral a partir de z?
Encuentra el área de una cola más allá de |z|, y luego duplícala. Para z = 2.0, una cola ≈ 0.0228 y dos colas ≈ 0.0455.
¿Puede el software discrepar ligeramente sobre p?
Sí. Los algoritmos de cola y el redondeo difieren en el cuarto decimal. Los desacuerdos en los dos primeros decimales suelen significar colas erradas, df incorrecto o la familia de distribuciones incorrecta.
Resumen
La calculadora de valores p convierte las estadísticas z, t, chi-cuadrado o F en valores p, las compara con α y sombrea la región de rechazo. Un z de dos colas = 2.0 da lugar a p ≈ 0.0455, que rechaza en 0.05 y no en 0.01.
Un valor p no es la probabilidad de que el nulo sea verdadero, ni el tamaño del efecto, ni la probabilidad de replicación; 0.05 es una convención; y la no significancia no es prueba de que no hay efecto.
Utiliza esta página para la decisión de importancia; utiliza la Calculadora de Puntuación Z cuando solo necesites el área de puntuación estandarizada y curva.