표준편차 계산기는 데이터 세트 내 값들이 평균에서 얼마나 떨어져 있는지를 측정하며, 데이터가 무엇을 나타내는지에 따라 표본 표준편차 또는 모집단 표준편차를 반환합니다. 콤마, 공백 또는 줄 바꿨으로 구분된 값을 붙여넣으면, 계산기는 결과를 분산, 평균, 제곱합, 그리고 사용한 모든 편차를 보여주는 단계표를 반환합니다.
단계표가 숫자보다 더 중요합니다. 여기 오는 대부분의 사람들은 과제를 위해 계산을 손으로 재현해야 하며, 작업 없이 결과는 아무것도 가르쳐주지 않습니다.
데이터 세트로부터 표준편차 계산
표준편차는 한 가지 질문에 답합니다: 이 데이터가 얼마나 퍼져 있나요? 표준편차가 작으면 값들이 평균을 중심으로 밀집되어 있습니다. 큰 표준편차는 산산조각납니다. 두 데이터 세트가 동일한 평균을 공유하고 완전히 다른 상황을 설명할 수 있으며, 표준편차가 그들을 구분합니다.
값을 데이터 필드에 붙여넣으세요. 쉼표, 공백, 탭, 줄 바뀐 표시 모두 작동하므로, 스프레드시트에서 바로 복사한 열은 재포맷이 필요 없습니다. 계산기는 필드 바로 아래에 읽은 값 수를 보고하며, 결과를 읽기 전에 붙여넣은 값과 그 수를 확인하세요. 왜냐하면 틀린 답의 가장 흔한 원인은 글자가 빗나간 값이기 때문입니다.
계산기는 데이터를 정렬하고 평균을 계산한 뒤 거기서부터 확장됩니다. 모든 중간 값이 표시되므로, 언제든지 손으로 계산을 따라가거나 검증할 수 있습니다.
표본과 모집단 중 하나를 선택하세요
이 선택은 답을 바꾸며, 이 페이지에서 무엇보다도 제대로 알아야 할 유일한 점입니다. 두 공식은 분모에서만 차이가 있지만, 작은 데이터 세트에서는 그 차이가 상당합니다. 설명하고자 하는 그룹의 모든 구성원을 포함하는 데이터는 모집단 표준편차(σ)를 사용하세요.
한 반에 있는 모든 24 학생들의 시험 점수, 당신이 관심 있는 반일 때. 완성된 배치의 모든 측정값. 분모는 N, 즉 전체 수입니다.
**데이터가 더 큰 집단에서 추출된 부분집합일 때 표본 표준편차를 사용하며, 그 집단의 분포를 추정하고 싶을 때는 참고하세요. 전국 유권자를 대신해 200 유권자를 대상으로 한 설문조사입니다. 생산량을 나타내는 30개의 측정 부품. 분모는 n − 1입니다.
실제로는 표본이 더 흔한 경우이기 때문에 이 계산기는 기본적으로 표본을 사용합니다. 대부분의 실제 데이터는 어떤 것의 표본이며, 표본을 모집단으로 취급하면 체계적으로 너무 작은 수치가 나옵니다.
교과서 문제를 풀고 있다면, 질문은 거의 항상 어떤 문제를 원하는지 말해줍니다. "population"이나 "sample"이라는 단어, 또는 "all of the"와 "a random selection of" 같은 표현을 찾아보세요.
표준편차 공식을 적용하세요
두 공식은 동일한 다섯 단계를 따르며, 네 번째 단계에서만 갈라집니다.
Population: σ = √( Σ(x − x̄)² / N )
Sample: s = √( Σ(x − x̄)² / (n − 1) )
극복하기:
1. 평균을 구해. 모든 값을 더하고 개수로 나누어. 2. 각 편차를 찾아라. 각 값에서 평균을 빼라. 일부는 음수다. 3. 각 편차마다 제곱합니다. 이렇게 하면 음수를 제거하고 평균에서 멀리 떨어진 값에 더 큰 비중을 부여합니다. 합은 제곱의 합입니다. 4. 나누어라. 모집단의 경우 N으로, 표본의 경우 n − 1로 나누어라. 결과는 분산이다. 5. 제곱근을 취합니다. 이것은 원래의 단위로 답을 반환합니다.
3 단계는 음수가 사라지는 지점이고, 5 단계는 제곱근이 존재하는 이유입니다. 편차를 제곱하면 결과를 제곱 단위, 제곱 표, 제곱 센티미터로 변환하여 직접 해석할 수 없습니다. 제곱근은 원래 측정값과 비교 가능한 것으로 되돌려줍니다.
2, 4, 4, 4, 5, 5, 7, 9의 표준편차를 계산합니다
이 8개 값 집합은 모집단 표준편차를 정확히 2, 표본 표준편차를 2.138로 제공합니다. 아래의 모든 단계는 수작업으로 확인할 수 있습니다. **1. 평균을 구합니다. 2 + 4 + 4 + 4 + 5 + 5 + 7 + 9 = 40 40 ÷ 8 = 5
2. 각 편차를 찾아서 제곱해라.
| x | x − x̄ | (x − x̄)² |
|---|---|---|
| 2 | −3 | 9 |
| 4 | −1 | 1 |
| 4 | −1 | 1 |
| 4 | −1 | 1 |
| 5 | 0 | 0 |
| 5 | 0 | 0 |
| 7 | 2 | 4 |
| 9 | 4 | 16 |
| Σ = 0 | Σ = 32 |
⟦숫자0⟧. 나누고 제곱근을 취해.
인구: 32 ÷ 8 = 4, 그리고 √4 = 2 샘플: 32 ÷ 7 = 4.571, 그리고 √4.571 = 2.138
두 가지 주목할 점이 있습니다. 편차 열은 합이 정확히 0이며, 항상 0이 될 것입니다. 이는 평균의 성질이자 산술 오류가 없음을 확인하는 유용한 검사입니다. 두 답변은 8가지 값에서 6.9% 차이가 납니다. 그 격차는 반올림이 아닙니다. 다음 섹션에서 설명하는 수정 사항입니다.
편차 단계 표를 읽어보세요
스텝 테이블에는 모든 값과 평균과의 편차, 그리고 그 편차의 제곱이 나열되어 있고, 하단에는 열 합계가 있습니다. 계산기는 입력한 모든 데이터에 대해 계산서를 만듭니다. 왼쪽에서 오른쪽으로 읽으면 전체 공식이 보입니다.
가운데 열은 어떤 값이 평균을 끌어올리고 어떤 값이 평균을 끌어내는지 보여주며, 항상 합계가 0입니다. 오른쪽 열은 결과에서 어떤 값이 지배적인지를 보여줍니다. 위 예에서 9 단일 값이 32 전체 중 16를 차지하며, 8개 중 하나의 관측값에서 확산의 절반을 차지합니다.
마지막 관측은 곰곰이 생각해볼 가치가 있습니다. 왜냐하면 표준편차가 이상치에 민감하다는 이유를 설명하기 때문입니다. 제곱란 평균에서 3단위 떨어진 값이 1단위 떨어진 값보다 9배 더 큰 기여를 한다는 뜻입니다. 한 번의 극단적인 관측이 결과를 크게 바꿀 수 있기 때문에, 표준편차에 의존하는 박스플롯이나 원시 데이터 분석이 반드시 함께 제공되어야 합니다.
30 이상의 데이터 세트의 경우, 테이블은 합계가 그대로 있는 첫 번째와 마지막 다섯 행으로 축소됩니다. 전체 테이블은 여전히 이용 가능하며, 탭으로 구분된 값으로 복사되어 스프레드시트나 보고서에 붙여넣습니다.
샘플 공식이 n − 1로 나누어지는 이유를 이해하세요
이것이 표준편차에 대해 가장 많이 묻는 질문이며, 보통 "편향을 보정한다"는 답변은 아무것도 설명하지 못합니다. 실제로 일어나는 일은 이렇습니다. 표본 표준편차를 계산할 때, 모집단 평균을 알 수 없습니다. 대신 표본 평균을 사용합니다.
하지만 표본 평균은 *같은 값들에서*로 계산되기 때문에, 실제 모집단 평균보다 그 값에 더 가깝게 나타납니다. 즉, 설계상 이 점은 해당 표본의 제곱 편차 합을 최소화하는 점입니다.
그래서 측정하는 모든 편차는 약간 너무 작습니다. 무작위로, 체계적으로, 한 방향으로, 매번 너무 작지는 않습니다. n으로 나누면 분산이 모집단 분산보다 일관되게 낮게 평가됩니다.
대신 n − 1로 나누면 이를 보정합니다. 이 조정을 베셀 보정이라고 하며, n − 1는 자유도입니다: 평균이 고정되면 편차의 n− 1만이 독립적으로 변할 수 있는데, 이는 마지막 편차는 합이 0이 되어야 한다는 요구에 의해 강제되기 때문입니다.
보정 크기는 전적으로 표본 크기에 따라 달라집니다:
| 표본 크기 | n으로 나누는 차이 − 1와 n의 차이 |
|---|---|
| 5 | 25% 더 큰 분산 |
| 10 | 11% |
| 30 | 3.4% |
| 100 | 1.0% |
| 1,000 | 0.1% |
n = 5 상황에서 선택은 답을 크게 바꿉니다. 몇 백 개의 값을 넘으면 실질적으로 중요하지 않습니다. 그래서 예시가 적은 입문 강의에서 구분이 강조되며, 대규모 데이터 세트를 다루는 실무자들은 거의 이 구분을 고려하지 않습니다.
표준편차 값을 해석합니다
표준편차 자체는 큰 의미가 없습니다. 이는 원본 데이터의 단위로 표현되기 때문에, 12의 값은 측정하는 것과 평균에 따라 엄청나거나 사소할 수 있습니다. 맥락을 부여하는 두 가지 방법이 있습니다.
평균과 비교하세요. 변동계수는 표준편차를 평균으로 나누어 결과를 백분율로 표현합니다. 12의 표준편차와 500의 평균을 비교하면 CV는 2.4%로, 매우 밀접합니다. 20의 평균에 대해서는 60%가 되어 매우 큽니다. CV는 또한 원시 표준편차로는 불가능한 서로 다른 단위로 측정된 데이터 집합 간 분포를 비교할 수 있게 해줍니다.
경험 규칙을 사용하세요. 대략 정규 분포를 따르는 데이터의 경우, 약 68%의 값이 평균의 표준편차 1 편차 이내, 약 95% 이내, 약 99.7% 정도가 3 표준편차 내에 위치합니다. 따라서 평균 70, 표준편차 8 시험은 약 3분의 2 학생이 62와 78 사이에 배치되고, 94(표준편차 세 단계 위)로 상위 0.15% 점수를 받게 됩니다.
경험적 규칙은 대략 정규 데이터에만 적용됩니다. 강하게 왜곡된 분포에서는 심하게 무너지며, 소득 데이터가 표준 예입니다: 평균은 중앙값 위에 위치하고, 분포는 긴 오른쪽 꼬리를 가지며, "두 표준편차 이내"는 어떤 것도 95%를 설명하지 못합니다. 규칙에 의존하기 전에 히스토그램으로 데이터의 형태를 확인하세요.
평균의 표준오차를 계산하세요
표준오차는 개별 값의 분포가 아니라 평균 자체의 정밀도를 측정합니다. 이 표준오차는 다른 질문에 답합니다: 만약 이 표본을 다시 뽑는다면, 평균은 얼마나 움직일까요?
SE = s / √n
예시 집합의 경우, SE = 2.138 ÷ √8 = 0.756.
분모의 √n을 주목하세요. 표본 크기를 네 배로 늘리면 표준오차가 절반으로 줄어들며, 이것이 더 큰 표본이 더 신뢰할 만한 추정치를 제공하는 수학적 이유이며, 결과가 감소하는 이유입니다. 100에서 400 관측값으로 전환하면 평균의 불확실성이 절반으로 줄어듭니다. 400에서 800로 이동하면 표준오차가 29% 정도만 개선됩니다.
표준오차는 신뢰구간이 만들어지는 기준이며, 표본 평균이 모집단 평균과 얼마나 잘 맞는지 보고할 때 인용해야 할 수치입니다.
실제로는 표준편차를 사용하세요
측정이 실제로 작용하는 네 곳, 그리고 그 변화가 실제로 어떤 신호를 보내는지. 품질 관리. 생산 라인은 측정된 치수의 표준편차로 모니터링되며, 단지 평균만이 아니다. 공정은 확산이 넓어지는 동안 완벽한 평균을 유지할 수 있고, 확산이 넓어지면 더 많은 부품이 허용 오차를 벗어나게 된다.
제어 차트는 개별 부품이 검사에 실패하기 전에 점차 표준편차가 증가하는 것을 표시합니다.
시험 점수와 채점. 표준편차는 원시 점수를 순위로 변환합니다. 78는 평균이 65이고 표준편차가 7임을 알기 전까지는 아무 의미가 없습니다. 이 시점에서 점수는 평균보다 거의 두 표준편차나 높습니다. 이것이 바로 z-점수가 수행하는 계산입니다.
투자 위험. 변동성은 수익률의 표준편차입니다. 연평균 8%를 기록하는 두 펀드는 한쪽이 3%, 다른 쪽이 22%라면 동일한 투자가 아닙니다. 두 번째 펀드는 투자자의 용기를 시험하는 해를 만들어내며, 수익의 순서는 수익을 받는 누구에게나 중요합니다.
측정과 계측. 같은 양의 반복 측정과 그 표준편차는 기기의 정밀도를 정량화합니다. 실험실이 불확실성을 어떻게 표시하고, 같은 것을 측정하는 두 기기를 비교하는지에 관한 것입니다.
자주 묻는 질문
표준편차란 무엇인가요?
표준편차는 데이터 세트 내 값들이 원래 데이터와 동일한 단위로 표현된 평균에서 얼마나 떨어져 있는지를 측정합니다. 표준편차가 작으면 값들이 평균에 모이고; 큰 표준편차는 값들이 넓게 흩어진다는 뜻입니다. 이는 평균에서 각 편차를 제곱하고, 그 제곱을 평균한 뒤 제곱근을 취하여 계산합니다.
표본과 모집단 표준편차를 사용해야 할까요?
데이터가 설명하는 그룹의 모든 구성원을 포함할 때는 모집단 표준편차를 사용하고 N으로 나누세요. 데이터가 더 큰 그룹을 나타내는 부분집합일 때는 표본 표준편차를 사용하고, n − 1로 나누세요. 실제로는 표본이 더 흔한데, 실제 데이터는 대부분 샘플이 어떤 것의 샘플이기 때문입니다. 교과서 문제는 거의 항상 어떤 데이터를 원하는지 명확히 합니다.
왜 샘플 공식이 n − 1로 나누어지나요?
표본 평균은 편차를 측정하는 값과 동일한 값에서 계산되기 때문에, 실제 모집단 평균보다 편차에 더 가깝게 나타납니다. 따라서 모든 편차는 체계적으로 너무 작으며, n으로 나누면 모집단 분산을 지속적으로 과소평가하게 됩니다. 베셀 보정이라 알려진 n− 1로 나누는 것은 이를 보상합니다. n = 10 때는 11% 차이를 만듭니다; n = 1, 000, 0.1% 때.
좋은 표준편차란 무엇인가요?
표준편차가 데이터의 단위를 나타내기 때문에 보편적으로 좋은 값은 없습니다. 변동계수를 사용해 평균과 비교해 판단하세요: 표준편차가 평균의 5%는 데이터가 촘촘한 것을 의미하고, 50%는 넓은 산란을 의미합니다. 무엇이 허용 가능한지는 전적으로 분야, 제조 허용오차, 설문 응답 집합에 따라 매우 다릅니다.
표준편차와 분산은 어떻게 다른가요?
분산은 평균과의 평균에서 평균을 곱한 제곱 편차이며; 표준편차는 평균의 제곱근입니다. 분산은 제곱 단위로 표시되어 원래 측정값과 직접 비교할 수 없으므로, 제곱근을 사용해 수치를 사용 가능한 단위로 되돌립니다. 두 경우 모두 동일한 스프레드를 나타내며, 표준편차가 바로 당신이 보고하는 값입니다.
경험적 규칙은 뭐라고 말하고 있나요?
대략 정규분포 데이터의 경우, 약 68%의 값이 평균의 표준편차 1 스탠드편차 이내, 95% 2 이내, 99.7% 3 이내 내에 위치합니다. 평균이 70이고 표준편차가 8인 검정은 점수의 약 3분의 2가 62와 78 사이에 위치합니다. 이 규칙은 매우 왜곡된 데이터에서는 무너지므로, 먼저 분포의 형태를 확인하세요.
표준편차가 음수일 수 있나요?
아니요. 표준편차는 평균의 제곱근이므로 결코 0보다 작아질 수 없습니다. 데이터 세트의 모든 값이 동일할 때만 정확히 0이 되며, 이는 확산이 전혀 없다는 의미입니다. 음성적인 결과는 산술 오류, 보통 편차 단계에서 부호 오류가 발생함을 의미합니다.
표준오차는 무엇이며 어떻게 다른가요?
표준편차는 개별 값들의 분포를 설명하며; 표준오차는 표본 평균이 모집단 평균을 어떻게 정확히 추정하는지를 나타냅니다. 표준오차는 표본 표준편차를 표본 크기의 제곱근으로 나눈 값과 같으므로 표본이 커질수록 신뢰 구간이 줄어듭니다. 신뢰구간은 표준편차가 아닌 표준오차에서 산출됩니다.
엑셀에서 표준편차를 어떻게 계산하나요?
샘플에는 =STDEV.S(range)를, 모집단에는 =STDEV.P(range)를 사용하세요. 이전 =STDEV()는 STDEV.S처럼 동작하며 호환성을 위해 유지됩니다. 엑셀의 분산 함수는 동일한 명명을 따릅니다: VAR.S와 VAR.P. 할당이 기대하는 함수를 확인하세요. 두 함수는 작은 데이터 세트에서 서로 다른 값을 반환합니다.
요약
표준편차 계산기는 붙여넣은 데이터셋의 표본 또는 모집단 표준편차, 분산, 평균, 제곱합, 전체 편차 표를 반환합니다.
두 공식 모두 각 값의 평균에서 벗어난 값을 제곱하고, 그 제곱들을 합한 뒤 나누어 제곱근을 취한다; 샘플의 경우 n − 1, 모집단 기준으로는 N으로 나누는 방식만 다르다.
데이터가 더 큰 그룹을 대표할 때 샘플을 선택하는데, 이는 일반적인 경우이며, 두 데이터 간 의미 있는 차이는 작은 데이터 세트에서만 기대합니다. 11%는 열 개 값, 1%는 100개 값에서 그렇습니다. 결과를 변동 계수를 사용해 평균에 대비하고, 데이터가 대략 정규일 때는 경험적 규칙에 대비하여 해석하며, 제곱은 측정치가 이상치에 민감해지게 만든다는 점을 기억하세요.