La Calculadora de Desviación Estándar mide hasta qué punto los valores de un conjunto de datos se sitúan respecto a su media, devolviendo ya sea la desviación estándar de la muestra o la desviación estándar de la población, dependiendo de lo que representen los datos. Pega valores separados por comas, espacios o saltos de línea, y la calculadora devuelve el resultado junto con la varianza, la media, la suma de cuadrados y una tabla de pasos que muestra cada desviación utilizada.
La tabla de pasos importa más que el número. La mayoría de la gente que llega aquí necesita reproducir el cálculo a mano para el trabajo académico, y un resultado sin el trabajo no enseña nada.
Calcular la desviación estándar de un conjunto de datos
La desviación estándar responde a una pregunta: ¿qué tan dispersos están estos datos? Una desviación estándar pequeña significa que los valores se agrupan estrechamente alrededor de la media. Una desviación grande significa que se dispersan. Dos conjuntos de datos pueden compartir una media idéntica y describir situaciones completamente diferentes, y la desviación estándar es lo que los separa.
Pega tus valores en el campo de datos. Comas, espacios, tabulaciones y saltos de línea funcionan, así que una columna copiada directamente de una hoja de cálculo no necesita reformateo. La calculadora informa cuántos valores lee justo debajo del campo, comprueba ese cuenta con lo que pegaste antes de leer el resultado, porque un carácter errático es la causa más común de una respuesta incorrecta.
La calculadora ordena los datos, calcula la media y trabaja hacia fuera a partir de ahí. Se muestra cada valor intermedio, así que puedes seguir o verificar un cálculo manual en cualquier paso.
Elige entre muestra y población
Esta elección cambia la respuesta, y es lo único en esta página que merece la pena acertar antes que nada. Las dos fórmulas solo difieren en su denominador, pero en conjuntos de datos pequeños la diferencia es considerable. Usa la desviación estándar poblacional (σ) cuando tus datos incluyan a todos los miembros del grupo que quieres describir.
Las puntuaciones de todos los estudiantes de 24 en una clase, cuando la clase es lo que te importa. Cada medición de un lote completado. El denominador es N, el recuento completo.
Utiliza la desviación estándar (s) de muestra cuando tus datos son un subconjunto extraído de un grupo más grande y quieres estimar la distribución de ese grupo mayor. Una encuesta a votantes 200 que representan un electorado nacional. Treinta componentes medidos que representan una producción directa. El denominador es n − 1.
La muestra es el caso más común en la práctica, por eso esta calculadora la utiliza por defecto. La mayoría de los datos reales son una muestra de algo, y tratar una muestra como una población produce una cifra sistemáticamente demasiado pequeña.
Si trabajas desde un problema de libro de texto, la pregunta casi siempre dice cuál quiere. Busca las palabras "población" o "muestra", o una frase como "todos los" frente a "una selección aleatoria de".
Aplicar la fórmula de desviación estándar
Ambas fórmulas siguen los mismos cinco pasos y solo divergen en el cuarto.
Population: σ = √( Σ(x − x̄)² / N )
Sample: s = √( Σ(x − x̄)² / (n − 1) )
Trabajando en ello:
1. Encuentra la media. Suma cada valor y divide entre el conteo. 2. Encuentra cada desviación. Resta la media de cada valor. Algunos son negativos. 3. Cuadra cada desviación. Esto elimina los negativos y da más peso a valores alejados de la media. El total es la suma de cuadrados. 4. Divide. Por N para una población, por n − 1 para una muestra. El resultado es la varianza. 5. Toma la raíz cuadrada. Esto devuelve la respuesta a las unidades originales.
El paso 3 es donde desaparecen los negativos, y el paso 5 es la razón por la que la raíz cuadrada existe. Al cuadrar las desviaciones, el resultado se obtiene unidades al cuadrado, marcas al cuadrado, centímetros al cuadrado, que no pueden interpretarse directamente. La raíz cuadrada lo devuelve a algo comparable a las mediciones originales.
Calcular la desviación estándar para 2, 4, 4, 4, 5, 5, 7, 9
Este conjunto de ocho valores da una desviación estándar poblacional de exactamente 2 y una desviación estándar de muestra de 2.138. Cada paso inferior puede comprobarse manualmente. 1. Encuentra la media. 2 + 4 + 4 + 4 + 5 + 5 + 7 + 9 = 40 40 ÷ 8 = 5
2. Encuentra cada desviación y cuadrala en cuadrado.
| x | x − x̄ | (x − x̄)² |
|---|---|---|
| 2 | −3 | 9 |
| 4 | −1 | 1 |
| 4 | −1 | 1 |
| 4 | −1 | 1 |
| 5 | 0 | 0 |
| 5 | 0 | 0 |
| 7 | 2 | 4 |
| 9 | 4 | 16 |
| Σ = 0 | Σ = 32 |
3. Divide y luego toma la raíz cuadrada.
Población: 32 ÷ 8 = 4, y √4 = 2 Ejemplo: 32 ÷ 7 = 4.571, y √4.571 = 2.138
Dos cosas a tener en cuenta. La columna de desviaciones suma exactamente cero, y siempre lo hará, es decir, es una propiedad de la media y una comprobación útil de que no has cometido un desliz aritmético. Y las dos respuestas difieren en 6.9% en ocho valores. Esa brecha no es redondeo. Es la corrección descrita en la siguiente sección.
Lee la tabla de pasos de desviación
La tabla de pasos muestra cada valor, su desviación respecto a la media, y esa desviación al cuadrado, con los totales de columnas en la parte inferior. La calculadora lo construye para los datos que introduzcas. Léelo de izquierda a derecha y toda la fórmula es visible.
La columna central muestra qué valores elevan la media y cuáles la bajan, y siempre es cero. La columna derecha muestra qué valores dominan el resultado; en el ejemplo anterior, el valor único de 9 contribuye con 16 del total 32, la mitad de la dispersión de una observación de ocho.
Merece la pena considerar esa última observación, porque explica por qué la desviación estándar es sensible a los valores atípicos. Cuadrar significa que un valor a tres unidades de la media contribuye nueve veces más que un valor a una unidad de distancia. Una observación extrema puede mover sustancialmente el resultado, por eso un diagrama de cajas o una mirada a los datos en bruto debería acompañar cualquier desviación estándar en la que te apoyes.
Para conjuntos de datos superiores a valores de 30, la tabla se colapsa a la primera y última fila con los totales intactos. La tabla completa permanece disponible y se copia como valores separados por tabulación para pegar en una hoja de cálculo o un informe.
Entiende por qué la fórmula muestral se divide por n − 1
Esta es la pregunta más frecuente sobre la desviación estándar, y la respuesta habitual, "corrige el sesgo", no explica nada. Esto es lo que realmente está ocurriendo. Cuando calculas una desviación estándar muestral, no sabes la media de la población. Usas la media muestral en su lugar.
Pero la media muestral se calcula *a partir de esos mismos valores*, lo que significa que está más cerca de ellos que la media real de la población. Es, por construcción, el punto que minimiza la suma de desviaciones cuadráticas para esa muestra en particular.
Así que cada desviación que mides es ligeramente demasiado pequeña. No aleatoriamente demasiado pequeña, sistemáticamente, en una sola dirección, cada vez. Dividir por n da una varianza que subestima consistentemente la varianza poblacional.
Dividir por n − 1 compensa eso. El ajuste se llama corrección de Bessel, y el n − 1 son los grados de libertad: una vez fijada la media, solo n − 1 de las desviaciones pueden variar de forma independiente, porque la última se ve forzada por el requisito de que sumen cero.
El tamaño de la corrección depende enteramente del tamaño de la muestra:
| Tamaño de la muestra | Diferencia entre dividir por n − 1 y n |
|---|---|
| 5 | 25% mayor varianza |
| 10 | 11% |
| 30 | 3.4% |
| 100 | 1.0% |
| 1,000 | 0.1% |
En n = 5 la elección cambia la respuesta de forma significativa. Más allá de unos cientos de valores deja de importar en cualquier sentido práctico. Por eso se practica la distinción en cursos introductorios, donde los ejemplos son pequeños, y por eso los profesionales que trabajan con grandes conjuntos de datos rara vez piensan en ello.
Interpretar un valor de desviación estándar
Una desviación estándar por sí sola significa poco. Se expresa en unidades de los datos originales, por lo que un valor de 12 podría ser enorme o trivial dependiendo de lo que se esté midiendo y cuál sea la media. Hay dos formas de darle contexto.
Compáralo con la media. El coeficiente de variación divide la desviación estándar por la media y expresa el resultado como porcentaje. Una desviación estándar de 12 frente a una media de 500 es un CV de 2.4%, que es ajustado. Frente a una media de 20, es 60%, que es enorme. El CV también permite comparar la distribución entre conjuntos de datos medidos en diferentes unidades, cosa que una desviación estándar bruta no puede.
Utiliza la regla empírica. Para datos que siguen una distribución aproximadamente normal, aproximadamente 68% de los valores se encuentran dentro de una desviación estándar de la media, aproximadamente 95% dentro de dos y aproximadamente 99.7% dentro de tres. Así, una prueba con una media de 70 y una desviación estándar de 8 coloca aproximadamente dos tercios de los estudiantes entre 62 y 78, y una puntuación de 94, tres desviaciones estándar arriba, en la parte superior 0.15%.
La regla empírica solo se cumple para datos aproximadamente normales. En distribuciones fuertemente sesgadas se descompone gravemente, y los datos de ingresos son el ejemplo estándar: la media está por encima de la mediana, la distribución tiene una cola derecha larga, y "dentro de dos desviaciones estándar" deja de describir 95% de cualquier cosa. Comprueba la forma de tus datos con un histograma antes de apoyarte en la regla.
Calcular el error estándar de la media
El error estándar mide la precisión de la media en sí, en lugar de la dispersión de los valores individuales. Responde a otra pregunta: si se extrajera esta muestra de nuevo, ¿cuánto se movería la media?
SE = s / √n
Para el conjunto de ejemplo, SE = 2.138 ÷ √8 = 0.756.
Observa el √n en el denominador. Cuadruplicar el tamaño de la muestra reduce a la mitad el error estándar, que es la razón matemática por la que las muestras más grandes dan estimaciones más fiables y la razón por la que disminuyen los rendimientos. Pasar de 100 a 400 reduce a la mitad la incertidumbre en la media. Pasar de 400 a 800 la mejora solo en 29%.
El error estándar es sobre qué se construyen los intervalos de confianza, y es la cifra a citar al informar de qué tan bien una media muestral fija una media poblacional.
Utilizar la desviación estándar en la práctica
Cuatro lugares donde la medida realiza un trabajo real, y qué señal real indica un cambio. Control de calidad. Una línea de producción se monitoriza según la desviación estándar de una dimensión medida, no solo su media. Un proceso puede mantener una media perfecta mientras la dispersión se ensancha, y la ampliación significa que más piezas quedan fuera de la tolerancia.
Los cuadros de control señalan una desviación estándar creciente antes de que cualquier pieza individual falle la inspección.
Puntuaciones de pruebas y calificación. La desviación estándar convierte una puntuación en bruto en una posición. Un 78 no significa nada hasta que sabes que la media es 65 y la desviación estándar es 7, momento en el que la puntuación está casi dos desviaciones estándar por encima de la media. Este es exactamente el cálculo que realiza una puntuación z.
Riesgo de inversión. La volatilidad es la desviación estándar de los rendimientos. Dos fondos que promedian 8% anual no son inversiones equivalentes si uno tiene una desviación estándar de 3% y el otro 22%, el segundo producirá años que pondrán a prueba los nervios del inversor, y la secuencia de rendimientos importa para cualquiera que obtenga ingresos.
Medición e instrumentación. Mediciones repetidas de la misma cantidad de dispersión, y su desviación estándar, cuantifica la precisión del instrumento. Así es como un laboratorio expresa la incertidumbre y cómo se comparan dos instrumentos que miden lo mismo.
Preguntas frecuentes
¿Qué es la desviación estándar?
La desviación estándar mide a qué distancia suelen estar los valores de un conjunto de datos respecto a su media, expresados en las mismas unidades que los datos originales. Una desviación estándar pequeña significa que los valores se agrupan cerca de la media; una desviación grande significa que se dispersan ampliamente. Se calcula al cuadrado cada desviación respecto a la media, promediando esos cuadrados y tomando la raíz cuadrada.
¿Debería usar la desviación estándar de la muestra o de la población?
Utiliza la desviación estándar poblacional cuando tus datos cubren a todos los miembros del grupo que describes, y divide por N. Usa la desviación estándar de muestra cuando tus datos son un subconjunto que representa un grupo mayor, y divide por n − 1. La muestra es más común en la práctica, ya que la mayoría de los datos reales son una muestra de algo. Las preguntas de libro de texto casi siempre especifican cuál se necesita.
¿Por qué la fórmula muestral se divide por n − 1?
Como la media muestral se calcula a partir de los mismos valores contra los que se miden las desviaciones, se sitúa más cerca de ellas que la media real de la población. Por tanto, cada desviación es sistemáticamente demasiado pequeña, y dividir por n subestimaría consistentemente la varianza poblacional. Dividir por n − 1, conocido como corrección de Bessel, compensa. En n = 10 se produce una diferencia de 11%; en n = 1,000, 0.1%.
¿Qué es una buena desviación estándar?
No existe un valor universalmente bueno, porque la desviación estándar contiene las unidades de los datos. Juzga la media usando el coeficiente de variación: una desviación estándar que es 5% de la media indica datos ajustados, mientras que 50% indica dispersión amplia. Lo que cuenta como aceptable depende enteramente del campo, una tolerancia de fabricación y un conjunto de respuestas a encuestas tienen expectativas muy diferentes.
¿En qué se diferencia la desviación estándar de la varianza?
La varianza es la desviación cuadrática media respecto a la media; la desviación estándar es su raíz cuadrada. La varianza está en unidades al cuadrado, que no pueden interpretarse directamente en función de las mediciones originales, por lo que la raíz cuadrada se toma para devolver la cifra a unidades utilizables. Ambas describen la misma distribución, y la desviación estándar es la que se reporta.
¿Qué dice la regla empírica?
Para datos aproximadamente distribuidos de forma normal, aproximadamente 68% de los valores se sitúan dentro de una desviación estándar de la media, 95% dentro de dos y 99.7% dentro de tres. Un test con una media de 70 y una desviación estándar de 8 sitúa aproximadamente dos tercios de las puntuaciones entre 62 y 78. La regla se descompone en datos fuertemente sesgados, así que primero comprueba la forma de la distribución.
¿Puede la desviación estándar ser negativa?
No. La desviación estándar es la raíz cuadrada de un promedio de valores al cuadrado, por lo que nunca puede ser menor que cero. Solo es igual a cero cuando todos los valores del conjunto de datos son idénticos, lo que significa que no hay dispersión en absoluto. Un resultado negativo indica un error aritmético, normalmente un error de signo en el paso de desviación.
¿Cuál es el error estándar y en qué se diferencia?
La desviación estándar describe la dispersión de valores individuales; el error estándar describe cómo la media muestral estima con precisión la media poblacional. El error estándar es igual a la desviación estándar de la muestra dividida por la raíz cuadrada del tamaño de la muestra, por lo que se reduce a medida que la muestra crece. Los intervalos de confianza se construyen a partir del error estándar, no de la desviación estándar.
¿Cómo calculo la desviación estándar en Excel?
Usa =STDEV.S(range) para una muestra y =STDEV.P(range) para una población. El antiguo =STDEV() se comporta como STDEV.S y se mantiene para compatibilidad. Las funciones de varianza de Excel siguen la misma denominación: VAR.S y VAR.P. Confirma cuál espera tu asignación, ya que ambos devuelven números diferentes en conjuntos de datos pequeños.
Resumen
La Calculadora de Desviación Estándar devuelve la desviación estándar de la muestra o de la población respecto a cualquier conjunto de datos pegado, junto con la varianza, la media, la suma de cuadrados y una tabla completa de desviaciones.
Ambas fórmulas cuadran la desviación de cada valor respecto a la media, suman esos cuadrados, dividen y toman la raíz cuadrada; solo difieren en dividir por n − 1 para una muestra o N para una población.
Elige la muestra cuando los datos representan un grupo mayor, que es el caso habitual, y espera una diferencia significativa entre ambos solo en conjuntos pequeños, 11% en diez valores, 1% en cien. Interpreta el resultado en función de la media usando el coeficiente de variación, o en función de la regla empírica cuando los datos son aproximadamente normales, y recuerda que al cuadrado la medida la medida es sensible a valores atípicos.