メタ記述(155): 任意のデータセットからサンプルまたは母集団の標準偏差を計算してください。標準偏差計算機は偏差表と計算のすべてのステップを表示します。
スキーマ: WebApplication + FAQPage + BreadcrumbList
標準偏差計算機は、データセット内の値が平均からどれだけ離れているかを測定し、データの表現に応じて標本標準偏差または母集団標準偏差を返します。コンマ、スペース、換行で区切られた値を貼り付けると、計算機は分散、平均、平方和、そして使用したすべての偏差を示すステップテーブルとともに結果を返します。
ステップテーブルの方が数字よりも重要です。ここに来るほとんどの人は課題のために計算を手作業で再現しなければならず、作業なしでの結果は何も学べません。
データセットから標準偏差を計算します
標準偏差は一つの疑問に答えます:このデータはどれほど広がっているのか?標準偏差が小さいと、値が平均の周りに密集していることを意味します。大きな標準偏差は散らばることを示します。2つのデータセットが同じ平均を共有し、まったく異なる状況を記述することがあり、標準偏差がそれらを分けています。
値をデータフィールドに貼り付けてください。カンマ、スペース、タブ、改行はすべて機能するため、スプレッドシートからそのままコピーした列はフォーマットの再調整が不要です。電卓はフィールドの直下で読み取った数を報告し、結果を読む前に貼り付けた数と比べて確認します。誤答の最も一般的な原因は文字の抜けです。
計算機はデータをソートし、平均値を計算し、そこから外側に進みます。すべての中間の値が表示されるので、どのステップでも手計算を追ったり検証したりできます。
サンプルと母集団のどちらかを選んでください
この選択は答えを変え、このページで何よりもまず正しいことをする価値のある点です。この二つの公式は分母だけが異なりますが、小規模なデータセットではその差は大きいです。記述したいグループのすべてのメンバーを含むデータには、母集団標準偏差(σ)を使います。
あなたが関心を持つクラスの1つのクラスの24全生徒のテストスコア。完成したバッチのすべての測定値。分母はN、つまり総数です。
**データがより大きなグループから抽出された部分集合であり、その大きなグループの分布を推定したい場合、標本標準偏差を使用してください。全国有権者を代表する200の有権者を対象とした調査です。生産生産量を表す30の測定成分。分母はn − 1です。
実際にはサンプル数がより一般的であるため、この計算機はデフォルトでサンプルを使います。ほとんどの実データは何かのサンプルであり、サンプルを母集団として扱うと、体系的に小さすぎる数値が生成されます。
教科書の問題を題材にしている場合、問題はほとんどの場合どちらを選びたいかを答えます。「population(母集団)」や「サンプル(sample)」という言葉、あるいは「all of the(すべての)」と「a random selection of(ランダムな選択)」のような表現を探してください。
標準偏差の公式を適用します
両方の公式は同じ5つのステップに従い、4番目のステップでのみ分岐します。
Population: σ = √( Σ(x − x̄)² / N )
Sample: s = √( Σ(x − x̄)² / (n − 1) )
乗り越え方:
1。平均を探す。 すべての値を加えてカウントで割る。 2。各偏差を見つけてください。 各値から平均を引いてください。中には負のものもあります。 3。各偏差を二乗する。 これにより負の値を除去し、平均から遠い値により重みが加わる。合計は二乗の和である。 4。割ります。 母集団の場合はN、サンプルの場合はn− 1で割ります。結果が分散となります。 5。平方根を取る。 これにより元の単位元への答えが戻る。
ステップ 3 は負の方が消え、ステップ 5 はそもそも平方根が存在する理由です。偏差を二乗することで結果は二乗単位、二乗マーク、二乗センチメートルに変換され、直接解釈できません。平方根は元の測定値と同等の数値に戻します。
2、4、4、4、5、5、7、9の標準偏差を計算します。
この8つの値集合は、母集団標準偏差を正確に2、標本標準偏差を2.138とします。以下のすべてのステップは手作業で確認可能です。1。平均を求めます。 2 + 4 + 4 + 4 + 5 + 5 + 7 + 9 = 40 40 ÷ 8 = 5
2。各偏差を見つけて二乗させてください。
| x | x − x̄ | (x − x̄)² |
|---|---|---|
| 2 | −3 | 9 |
| 4 | −1 | 1 |
| 4 | −1 | 1 |
| 4 | −1 | 1 |
| 5 | 0 | 0 |
| 5 | 0 | 0 |
| 7 | 2 | 4 |
| 9 | 4 | 16 |
| Σ = 0 | Σ = 32 |
3。割ってから平方根を取る。
人口:32 ÷ 8 = 4、および√4 = 2 サンプル:32 ÷ 7 = 4.571、および√4.571 = 2.138
注意すべき点が2つあります。偏差列の合計は正確にゼロで、常にゼロになります。これは平均の性質であり、算術の誤りを犯していないかの有用なチェックとなります。そして、2つの答えは8つの値で6.9%の差があります。そのギャップは丸めではありません。次のセクションで説明する訂正です。
偏差ステップテーブルを読んでみてください
ステップテーブルにはすべての値、平均からのずれ、そしてそのずれの二乗が記載され、列の合計は下部に示されています。計算機は入力したデータに対して計算を行います。左から右へ読むと、全体の公式が見えます。
中央の列は平均を引き上げ、どの値を下げるかを示し、合計は常にゼロです。右列は結果を支配する値を示しています。上記の例では、9の単一の値が32の合計のうち16を寄与し、8つの観測のうち1つの観測値の半分を占めます。
この最後の観察は、標準偏差が外れ値に敏感になる理由を説明しているので、じっくり考える価値があります。二乗とは、平均から3単位離れた値が、1単位離れた値の9倍の寄与を意味します。極端な観測が結果を大きく変える可能性があるため、標準偏差に寄与する箱プロットや生データの閲覧を必ず付けるべきです。
30を超えるデータセットの場合、テーブルは合計がそのままの1行と最後の5行に折りたたまれます。テーブル全体は引き続き利用可能で、タブで区切られた値としてコピーされ、スプレッドシートやレポートに貼り付けられます。
サンプル公式がn − 1で割られる理由を理解する
これは標準偏差について最もよく聞かれる質問であり、通常の答えである「バイアスを補正する」は何も説明していません。実際に起きていることは以下の通りです。標本標準偏差を計算するとき、母平均はわかりません。代わりに標本平均を使います。
しかし標本平均は*同じ値*から計算されるため、真の母平均よりもそれらに近い位置にあります。構造上、その標本の二乗偏差の和を最小化する点です。
つまり、測定する偏差は少しずつ小さすぎます。ランダムに、ある方向に、毎回小さすぎるわけではありません。nで割ると、母分散を一貫して過小評価する分散が得られます。
代わりに n − 1 で割ることで補正されます。この調整はベッセルの補正と呼ばれ、n − 1 は自由度です。平均が固定されると、偏差のうち n − 1 のみが独立に変化します。なぜなら、最後の偏差は合計がゼロに求められるためです。
補正の大きさはサンプルサイズに完全に依存します:
| サンプルサイズ | n − 1 と n で割ることの違い |
|---|---|
| 5 | 25% より大きな分散 |
| 10 | 11% |
| 30 | 3.4% |
| 100 | 1.0% |
| 1,000 | 0.1% |
n = 5 の時点で、その選択は答えを大きく変えます。数百の値を過ぎると、実用的な意味では意味を失います。だからこそ、例が少ない入門コースで区別が強調され、大規模なデータセットを扱う実務者はほとんどこの区別を考えないのです。
標準偏差の値を解釈します
標準偏差だけではほとんど意味を持ちません。それは元のデータの単位で表されるため、12の値は測定対象や平均によって非常に大きく、あるいは自明なものになることがあります。文脈を与える方法は二つあります。
平均と比較してください。 変異係数は標準偏差を平均で割り、結果をパーセンテージで表します。12の標準偏差と平均500の比率は、CVが2.4%で、非常に厳しいです。平均20に対しては60%であり、非常に大きな数値です。また、CVは異なる単位で測定されたデータセット間のスプレッドを比較でき、生の標準偏差ではできません。
経験的ルールを用いてください。 ほぼ正規分布に従うデータの場合、約 68% の値が平均の標準偏差 1 つ以内に、約 95% が平均の標準偏差 2 以内に、約 99.7% が 3 以内に収まります。したがって、平均が 70、標準偏差が 8 のテストでは、約3分の2の学生が 62 と 78 の間に位置し、3標準偏差上位の 0.15% のスコアとなります。
経験的ルールはおおよそ正規データにのみ当てはまります。強く偏った分布では崩れやすく、所得データが標準的な例です。平均は中央値より上にあり、分布は長い右尾を持ち、「2標準偏差以内」では何も記述できない。ルールに頼る前にヒストグラムでデータの形状を確認してください。
平均の標準誤差を計算します
標準誤差は個々の値の分布ではなく、平均そのものの精度を測るものです。これは別の問いに答えます。つまり、このサンプルを再度抽出した場合、平均はどれほど動くでしょうか?
SE = s / √n
例の集合の場合、SE = 2.138 ÷ √8 = 0.756。
分母の√nに注目してください。サンプルサイズを4倍にすると標準誤差が半分になり、これが大きなサンプルほどより信頼性の高い推定値が得られる数学的理由であり、リターンが減少する理由です。100から400に変えることで平均の不確実性が半減します。400から800に変えると、平均は29%だけ改善されます。
標準誤差とは信頼区間の構成の元であり、標本平均が母平均とどれだけ一致するかを報告する際に引用すべき数値です。
実際の標準偏差の使用
測定が実際に働く4か所があり、その変化が実際にどれほどシグナルを示唆しているかがわかります。品質管理。 生産ラインは測定寸法の標準偏差で監視されており、単に平均値だけでなく。プロセスはスプレッドが広がる間に完璧な平均を保つことができ、スプレッドが広がると許容範囲外に入る部品が増えることになります。
制御チャートは、個々の部品が検査に失敗する前に標準偏差が上昇していることを示します。
テストのスコアと採点。 標準偏差は生のスコアを位置づけに変換します。78は、平均が65で標準偏差が7であるとわかるまでは意味を持ちません。この時点でスコアは平均よりほぼ2標準偏差高くなります。これはまさにzスコアが行う計算です。
投資リスク。 ボラティリティはリターンの標準偏差です。年間平均8%の2つのファンドは、一方が3%、もう一方が22%の標準偏差を持つ場合、同じ投資とは言えません。後者は投資家の神経を試す年を生み出し、収益を得る人にとってリターンの順序は重要です。
測定と計測。 同じ量の繰り返し測定は散乱し、その標準偏差は計測器の精度を定量化します。これは実験室が不確実性を表現する方法であり、同じものを測定する2つの計測器を比較する方法です。
よくある質問
標準偏差とは何ですか?
標準偏差は、データセット内の値が元のデータと同じ単位で表される平均からどれだけ離れているかを示します。標準偏差が小さい場合は、値が平均付近に集まることを意味します。大きな標準偏差は、広く散乱することを意味します。平均からの各偏差を二乗し、それらの二乗を平均し、平方根を取って計算されます。
サンプル標準偏差を使うべきか、それとも母集団標準偏差を使うべきでしょうか?
記述しているグループの全メンバーを対象にデータを含んでいる場合は母集団標準偏差を使い、Nで割ります。データがより大きなグループを表す部分集合の場合は標本標準偏差を使い、n − 1で割ります。実際にはサンプルがより一般的で、ほとんどの実データは何かのサンプルだからです。教科書の問題はほとんどの場合、どのデータが求められるかを明示しています。
なぜサンプル式はn − 1で割るのでしょうか?
標本平均は偏差を測定する値と同じから計算されるため、真の母集団平均よりも偏差に近くなります。したがって、どの偏差も体系的に小さすぎ、nで割ると母集団分散を一貫して過小評価してしまいます。n− 1で割ること、すなわちベッセルの補正が補償します。n = 10のとき、11%の差が生じます。n = 1、000、0.1%のとき。
良い標準偏差とは何でしょうか?
標準偏差がデータの単位を意味するため、普遍的に良い価値は存在しません。変動係数を使って平均と比較して判断してください。平均の5%である標準偏差はデータの狭さを示し、50%は広い散布を示します。何が許容範囲とみなされるかは完全に分野、製造公差、調査結果によって期待値が大きく異なります。
標準偏差は分散とどのように異なるのでしょうか?
分散は平均からの平均二乗偏差です。標準偏差はその平方根です。分散は二乗単位で表され、元の測定値と直接対抗して解釈できないため、平方根を使って数値を実用的な単位に戻します。両者は同じスプレッドを表しており、報告するのは標準偏差です。
経験的ルールは何と言っているのでしょうか?
おおよそ正規分布のデータでは、約 68% の価値が平均の標準偏差 1 つ以内、95% が 2 標準偏差以内、99.7% が3 標準偏差以内に収まる。平均が 70、標準偏差が 8 の検定では、スコアの約3分の2が 62 と 78 の間に位置することになる。このルールは強く偏ったデータでは崩れるため、まず分布の形状を確認してください。
標準偏差は負になり得ますか?
いいえ。標準偏差は二乗値の平均の平方根なので、ゼロ以下になることは決してありません。データセットのすべての値が同一である場合にのみ、標準偏差が正確にゼロに等しいと言えます。つまり、スプレッドが全く存在しないことを意味します。陰の結果は算術エラー、通常は偏差ステップでの符号ミスを示します。
標準誤差とは何で、どのように異なるのでしょうか?
標準偏差は個々の値の分布を表し、標準誤差は標本平均が母平均をどのように正確に推定するかを示します。標準誤差は標本標準偏差を標本サイズの平方根で割ったものに等しく、標本が増えるにつれて縮小します。信頼区間は標準誤差から構成され、標準偏差から作られます。
Excelで標準偏差をどう計算すればいいですか?
サンプルには=STDEV.S(range)、母集団には=STDEV.P(range)を使いましょう。古い=STDEV()はSTDEV.Sのように動作し、互換性のために保持されます。Excelの分散関数も同じ名前に従います:VAR.SとVAR.P。割り当てがどの関数を期待しているかを確認してください。小規模データセットでは異なる数値を返します。
まとめ
標準偏差計算機は、貼り付けたデータセットからサンプルまたは母集団標準偏差、分散、平均、平方和、そして完全な偏差表を返します。
両式とも、各値の平均からのずれを二乗し、その二乗を和にし、割り、平方根を取る。異なるのは、サンプルの場合はn− 1で割る、母集団の場合はNで割る点だけである。
データがより大きなグループを表す場合にサンプルを選び、通常はそうで、2つの意味のある差は小規模なデータセットでのみ期待してください。10の値では 11%、100 の値では 1%。結果を変動係数で平均に対して解釈するか、データがほぼ正規の場合は経験的ルールに反して解釈し、二乗することで測度は外れ値に敏感になることを覚えておいてください。