Tytuł SEO (58): Kalkulator odchylenia standardowego, Sample & Population SD Metaopis (155): Oblicz odchylenie standardowe próby lub populacji z dowolnego zbioru danych. Kalkulator odchyleń standardowych pokazuje tabelę odchyleń oraz każdy etap pracy.
Kalkulator odchylenia standardowego mierzy, jak daleko wartości w zbiorze danych oddalają się od swojej średniej, zwracając albo odchylenie standardowe próby, albo odchylenie standardowe populacji, w zależności od tego, co reprezentują dane. Wkleja wartości rozdzielone przecinkami, spacjami lub podziałami linii, a kalkulator zwraca wynik wraz z wariancją, średnią, sumą kwadratów oraz tabelą krokową pokazującą każde odchylenie, którego zastosował.
Tabela kroków jest ważniejsza niż liczba. Większość osób przyjeżdżających tutaj musi ręcznie odtwarzać obliczenia do pracy zaliczeniowej, a wynik bez pracy niczego nie uczy.
Oblicz odchylenie standardowe z zestawu danych
Odchylenie standardowe odpowiada na jedno pytanie: jak bardzo te dane są rozproszone? Małe odchylenie standardowe oznacza, że wartości skupiają się ściśle wokół średniej. Duże, że się rozpraszają. Dwa zestawy danych mogą mieć identyczną średnią i opisywać zupełnie różne sytuacje, a to odchylenie standardowe je oddziela.
Wklej swoje wartości do pola danych. Przecinki, sprady, tabulatory i podziały wierszy działają, więc kolumna skopiowana prosto z arkusza kalkulacyjnego nie wymaga ponownego formatowania. Kalkulator pokazuje, ile wartości odczytał bezpośrednio pod polem, porównaj tę liczbę z tym, co wkleiłeś, zanim przeczytasz wynik, bo najczęściej błędnym znakiem jest niewłaściwy znak.
Kalkulator następnie sortuje dane, oblicza średnią i dalej pracuje na zewnątrz. Każda wartość pośrednia jest wyświetlana, więc możesz śledzić lub weryfikować ręczne obliczenia na dowolnym etapie.
Wybierz między próbą a populacją
Ten wybór zmienia odpowiedź i jest to jedyna rzecz na tej stronie, którą warto najpierw przeczytać przed wszystkim innym. Oba wzory różnią się jedynie mianownikiem, ale na małych zbiorach danych luka jest znaczna. Użyj odchylenia standardowego populacji (σ), gdy twoje dane obejmują każdego członka grupy, którą chcesz opisać.
Wyniki testów wszystkich 24 uczniów w jednej klasie, gdy klasa jest tym, na czym ci zależy. Każdy pomiar z ukończonej grupy. Mianownik to N, pełna liczba.
Użyj próbnego odchylenia standardowego, gdy Twoje dane są podzbiorem pochodzącym z większej grupy i chcesz oszacować rozkład tej większej grupy. Ankieta wyborców 200 reprezentujących okręg krajowy. Trzydzieści mierzonych składników reprezentujących serię produkcyjną. Mianownik to n − 1.
W praktyce częstszym przypadkiem jest próbka, dlatego ten kalkulator domyślnie ją stosuje. Większość rzeczywistych danych to próbka czegoś, a traktowanie próby jako populacji daje systematycznie zbyt małą liczbę.
Jeśli pracujesz na zadaniu podręcznikowym, pytanie prawie zawsze brzmi, który z nich chce. Szukaj słów "populacja" lub "próbka", albo zwrotu typu "całość" w porównaniu do "losowy wybór".
Zastosowanie wzoru na odchylenie standardowe
Obie formuły podążają za tymi samymi pięcioma krokami i rozchodzą się dopiero na czwartym.
Population: σ = √( Σ(x − x̄)² / N )
Sample: s = √( Σ(x − x̄)² / (n − 1) )
Przepracowanie tego:
1. Znajdź średnią. Dodaj każdą wartość i podziel przez liczbę. 2. Znajdź każde odchylenie. Odejmij średnią od każdej wartości. Niektóre są ujemne. 3. Kwadratuj każde odchylenie. To usuwa ujemne wartości i nadaje większą wagę wartościom dalekim od średniej. Suma to suma kwadratów. 4. Podziel. Przez N dla populacji, przez n − 1 dla próbki. Wynikiem jest wariancja. 5. Weź pierwiastek kwadratowy. To zwraca odpowiedź do oryginalnych jednostek.
Krok 3 to miejsce, gdzie negatywy znikają, a krok 5 to powód, dla którego w ogóle istnieje pierwiastek kwadratowy. Uporządkowanie odchyleń przesuwa wynik do jednostek kwadratowych, kwadratowych znaków, kwadratowych centymetrów, których nie da się bezpośrednio zinterpretować. Pierwiastek kwadratowy przywraca go do czegoś porównywalnego z oryginalnymi pomiarami.
Oblicz odchylenie standardowe dla 2, 4, 4, 4, 5, 5, 7, 9
Ten zbiór ośmiu wartości daje odchylenie standardowe populacji dokładnie 2 oraz przykładowe odchylenie standardowe 2.138. Każdy krok poniżej można sprawdzić ręcznie. 1. Znajdź średnią. 2 + 4 + 4 + 4 + 5 + 5 + 7 + 9 = 40 40 ÷ 8 = 5
⟦UM0⟧. Znajdź każde odchylenie i wyprostuj je.
| x | x − x̄ | (x − x̄)² |
|---|---|---|
| 2 | −3 | 9 |
| 4 | −1 | 1 |
| 4 | −1 | 1 |
| 4 | −1 | 1 |
| 5 | 0 | 0 |
| 5 | 0 | 0 |
| 7 | 2 | 4 |
| 9 | 4 | 16 |
| Σ = 0 | Σ = 32 |
⟦UM0⟧. Podziel, a potem weź pierwiastek kwadratowy.
Populacja: 32 ÷ 8 = 4, oraz √4 = 2 Przykład: 32 ÷ 7 = 4.571, oraz √4.571 = 2.138
Dwie rzeczy do zwrócenia uwagi. Kolumna odchyleń sumuje się dokładnie do zera i zawsze tak będzie, to jest właściwość średniej i przydatny punkt, że nie dokonałeś błędu arytmetycznego. A te dwie odpowiedzi różnią się o 6.9% na ośmiu wartościach. Ta luka nie jest zaokrąglaniem. To korekta opisana w następnej sekcji.
Przeczytaj tabelę kroków odchyleń
Tabela krokowa przedstawia każdą wartość, jej odchylenie od średniej oraz to odchylenie do kwadratu, z sumami kolumn na dole. Kalkulator tworzy ją dla danych, które wpiszesz. Przeczytaj ją od lewej do prawej, a cały wzór jest widoczny.
Kolumna środkowa pokazuje, które wartości podnoszą średnią, a które ją obniżają, i zawsze daje to zera. Prawa kolumna pokazuje, które wartości dominują w wyniku; w powyższym przykładzie pojedyncza wartość 9 przyczynia się do 16 całkowitej wartości 32, czyli połową rozkładu z jednego z ośmiu.
Warto się zastanowić nad tą ostatnią obserwacją, ponieważ wyjaśnia, dlaczego odchylenie standardowe jest wrażliwe na wartości odstającye. Kwadratowanie oznacza, że wartość trzy jednostki względem średniej daje dziewięć razy więcej niż wartość o jedną jednostkę dalej. Jedna skrajna obserwacja może znacząco przesunąć wynik, dlatego wykres pudełkowy lub przegląd surowych danych powinien towarzyszyć każdej odchyleniu standardowemu, na której polegasz.
Dla zbiorów danych powyżej wartości 30 tabela zwalnia się do pierwszych i ostatnich pięciu wierszy, zachowując sumy nienaruszone. Pełna tabela pozostaje dostępna i kopiowana jako wartości rozdzielone tabulatorami do wklejenia do arkusza kalkulacyjnego lub raportu.
Zrozum, dlaczego wzor próbki dzieli się przez n − 1
To najczęściej zadawane pytanie dotyczące odchylenia standardowego, a zwykła odpowiedź "koryguje błędy" niczego nie wyjaśnia. Oto, co się właściwie dzieje. Gdy obliczasz próbne odchylenie standardowe, nie znasz średniej populacji. Zamiast tego używasz średniej próbkowej.
Ale średnia próbna jest obliczana *na podstawie tych samych wartości*, co oznacza, że jest bliżej nich niż rzeczywista średnia populacji. Jest to, z definicji, punkt, który minimalizuje sumę kwadratowych odchyleń dla danej próby.
Każde odchylenie, które mierzysz, jest więc trochę za małe. Nie losowo za małe, systematycznie, w jednym kierunku, za każdym razem. Dzieląc przez n, otrzymujemy wariancję, która konsekwentnie zaniża wariancję populacji.
Dzielenie przez n − 1 kompensuje to zamiast tego. Korekta ta nazywana jest korektą Bessela, a n − 1 to stopnie swobody: gdy średnia zostanie ustalona, tylko n − 1 odchyleń może się zmieniać niezależnie, ponieważ ostatnie jest wymuszone przez wymóg, by suma wyniosła do zera.
Wielkość korekty zależy całkowicie od wielkości próby:
| Wielkość próby | Różnica między dzieleniem przez n − 1 i n |
|---|---|
| 5 | 25% większa wariancja |
| 10 | 11% |
| 30 | 3.4% |
| 100 | 1.0% |
| 1,000 | 0.1% |
Przy n = 5 wybór istotnie zmienia odpowiedź. Po kilkuset wartościach przestaje mieć znaczenie w praktyce. Dlatego to rozróżnienie jest powtarzane na kursach wprowadzających, gdzie przykłady są małe, i dlaczego praktycy pracujący z dużymi zbiorami danych rzadko o tym myślą.
Interpretuj wartość odchylenia standardowego
Samo odchylenie standardowe niewiele znaczy. Wyraża się je w jednostkach oryginalnych danych, więc wartość 12 może być ogromna lub trywialna, w zależności od tego, co jest mierzone i jaka jest średnia. Są dwa sposoby nadania temu kontekstu.
Porównaj to ze średnią. Współczynnik zmienności dzieli odchylenie standardowe przez średnią i wyraża wynik w procentach. Odchylenie standardowe 12 względem średniej 500 to CV 2.4%, co jest ciasne. Wobec średniej 20 jest to 60%, co jest ogromne. CV pozwala także porównać rozkład między zbiorami danych mierzonych w różnych jednostkach, czego surowe odchylenie standardowe nie potrafi.
Użyj reguły empirycznej. Dla danych zgodnych z rozkładem w przybliżeniu, około 68% wartości mieści się w mieściu jednego odchylenia standardowego od średniej, około 95% w granicach dwóch i około 99.7% w trzy. Test ze średnią 70 i odchyleniem standardowym 8 umieszcza około dwóch trzecich uczniów między 62 a 78, a wynik 94, trzy odchylenia standardowe, w górnej 0.15%.
Reguła empiryczna obowiązuje tylko dla danych mniej więcej normalnych. W przypadku silnie skośnych rozkładów jest bardzo zła, a dane dochodowe są standardowym przykładem: średnia jest powyżej mediany, rozkład ma długi prawy ogon, a "w granicach dwóch odchyleń standardowych" przestaje opisywać 95% czegokolwiek. Sprawdź kształt swoich danych za pomocą histogramu przed przyłożeniem się do reguły.
Oblicz błąd standardowy średniej
Błąd standardowy mierzy precyzję samej średniej, a nie rozkład poszczególnych wartości. Odpowiada na inne pytanie: gdyby ta próba została pobrana ponownie, o ile przesunęłaby się średnia?
SE = s / √n
Dla zbioru przykładowego, SE = 2.138 ÷ √8 = 0.756.
Zwróć uwagę na √n w mianowniku. Czterokrotność wielkości próby zmniejsza błąd standardowy o połowę, co jest matematycznym powodem, dla którego większe próbki dają bardziej wiarygodne oszacowania, a także powodem, dla którego zwroty maleją. Przejście od 100 do 400 zmniejsza niepewność średniej o połowę. Przejście z 400 do 800 poprawia ją tylko o 29%.
Błąd standardowy to podstawa, z której zbudowane są przedziały ufności, i jest to liczba, którą należy cytować, gdy opisuje, jak dobrze próbna średnia określa średnią populacji.
W praktyce używaj odchylenia standardowego
Cztery miejsca, w których miara wykonuje realną pracę i co faktycznie oznacza zmiana. Kontrola jakości. Linia produkcyjna jest monitorowana na podstawie odchylenia standardowego mierzonego wymiaru, a nie tylko średniej. Proces może utrzymać idealną średnią, podczas gdy rozkład się rozszerza, a poszerzanie się oznacza więcej części wychodzących poza tolerancję.
Wykresy kontrolne wskazują rosnące odchylenie standardowe, zanim jakakolwiek część nie przejdzie inspekcji.
Wyniki testów i ocenianie. Odchylenie standardowe zamienia surowy wynik na pozycję. 78 nie ma znaczenia, dopóki nie wiesz, że średnia to 65, a odchylenie standardowe to 7, wtedy wynik jest prawie o dwa odchylenia standardowe wyższy od średniej. To dokładnie obliczenie wykonywane przez z-score.
Ryzyko inwestycyjne. Zmienność to odchylenie standardowe zwrotów. Dwa fundusze o średniej 8% rocznie nie są równoważnymi inwestycjami, jeśli jeden ma odchylenie standardowe 3%, a drugi 22%, drugi generuje lata wymagające nerwy inwestora, a sekwencja zwrotów ma znaczenie dla każdego, kto otrzymuje dochód.
Pomiary i instrumentacja. Powtarzane pomiary tej samej wielkości rozpraszają się, a ich odchylenie standardowe ilościowo określa precyzję instrumentu. Tak laboratorium określa niepewność i porównuje się dwa instrumenty mierzące to samo.
Często zadawane pytania
Czym jest odchylenie standardowe?
Odchylenie standardowe mierzy, jak daleko wartości w zbiorze danych zazwyczaj znajdują się od swojej średniej, wyrażonej w tych samych jednostkach co dane oryginalne. Małe odchylenie standardowe oznacza, że wartości skupiają się blisko średniej; duże oznacza, że rozpraszają się szeroko. Oblicza się je przez kwadratowanie każdego odchylenia od średniej, uśrednianie tych kwadratów i pobieranie pierwiastka kwadratowego.
Czy powinienem użyć odchylenia standardowego próby czy populacji?
Użyj odchylenia standardowego populacji, gdy dane obejmują każdego członka opisanej przez Ciebie grupy, i podziel przez N. Użyj próbkowego odchylenia standardowego, gdy dane są podzbiorem reprezentującym większą grupę, i podziel przez n − 1. W praktyce częściej stosuje się próbkę, ponieważ większość rzeczywistych danych to próbka czegoś. Pytania podręcznikowe prawie zawsze określają, co jest pożądane.
Dlaczego wzor próby dzieli się przez n − 1?
Ponieważ średnia próbna jest obliczana z tych samych wartości, do których mierzysz odchylenia, jest bliżej nich niż rzeczywista średnia populacji. Każde odchylenie jest więc systematycznie zbyt małe, a dzielenie przez n konsekwentnie zaniżałoby wariancję populacji. Dzielenie przez n − 1, znane jako korekta Bessela, kompensuje. Przy n = 10 daje to 11% różnicy; przy n = 1,000, 0.1%.
Czym jest dobre odchylenie standardowe?
Nie ma uniwersalnie dobrej wartości, ponieważ odchylenie standardowe niesie jednostki danych. Porównaj to ze średnią za pomocą współczynnika zmienności: odchylenie standardowe wynoszące 5% średniej oznacza ścisłe dane, natomiast 50% oznacza szerokie rozpraszanie. Co jest akceptowalne, zależy całkowicie od dziedziny, tolerancja produkcyjna i zestaw odpowiedzi ankietowych mają zupełnie inne oczekiwania.
Czym różni się odchylenie standardowe od wariancji?
Wariancja to średnie kwadratowe odchylenie od średniej; odchylenie standardowe to pierwiastek kwadratowy. Wariancja jest wyrażona w jednostkach kwadratowych, których nie można bezpośrednio interpretować względem oryginalnych pomiarów, więc pierwszy pierwiastek kwadratowy jest pobierany, aby przywrócić wartość do użytecznych jednostek. Oba opisują ten sam rozkład, a to odchylenie standardowe jest tym, które podajesz.
Co mówi zasada empiryczna?
Dla danych o przybliżonym rozkładzie około 68% wartości mieści się w granicach jednego odchylenia standardowego od średniej, 95% w granicach dwóch, a 99.7% w granicach trzech. Test ze średnią 70 i odchyleniem standardowym 8 umieszcza więc około dwóch trzecich wyników między 62 a 78. Reguła ta załamuje się przy silnie zniekształconych danych, więc najpierw sprawdź kształt rozkładu.
Czy odchylenie standardowe może być ujemne?
Nie. Odchylenie standardowe jest pierwiastkiem kwadratowym ze średniej wartości kwadratowych, więc nigdy nie może być mniejsze niż zero. Równa się dokładnie zeru tylko wtedy, gdy każda wartość w zbiorze danych jest idenyczna, co oznacza, że nie ma żadnego rozrzutu. Wynik negatywny wskazuje na błąd arytmetyczny, zwykle błąd znaku w kroku odchylenia.
Jaki jest błąd standardowy i czym się różni?
Odchylenie standardowe opisuje rozkład wartości indywidualnych; błąd standardowy opisuje, jak dokładnie średnia próby szacuje średnią populacji. Błąd standardowy równa się odchyleniu standardowemu próby podzielonej przez pierwiastek kwadratowy z wielkości próby, więc zmniejsza się wraz ze wzrostem próby. Przedziały ufności są budowane na podstawie błędu standardowego, a nie odchylenia standardowego.
Jak obliczyć odchylenie standardowe w Excelu?
Użyj =STDEV.S(range) dla próbki i =STDEV.P(range) dla populacji. Starsza =STDEV() zachowuje się jak STDEV.S i jest zachowana dla kompatybilności. Funkcje wariancji w Excelu przyjmują tę samą nazwę: VAR.S i VAR.P. Potwierdź, której z nich oczekuje twoje zadanie, ponieważ oba zwracają różne liczby na małych zbiorach danych.
Podsumowanie
Kalkulator Odchylenia Standardowego zwraca albo próbkę, albo odchylenie standardowe populacji z dowolnego wklejonego zbioru danych, wraz z wariancją, średnią, sumą kwadratów oraz pełną tabelą odchyleń.
Obie formuły kwadratują odchylenia każdej wartości od średniej, sumują te kwadraty, dzielą i przyjmują pierwiastek kwadratowy; różnią się jedynie tym, że dzielą przez n − 1 dla próby lub N dla populacji.
Wybierz próbkę, gdy dane reprezentują większą grupę, co jest zwykłym przypadkiem, i spodziewaj się istotnej różnicy między tymi dwoma tylko na małych zbiorach danych, 11% przy dziesięciu wartościach, 1% przy sto. Interpretuj wynik względem średniej za pomocą współczynnika zmienności lub według reguły empirycznej, gdy dane są mniej więcej normalne, i pamiętaj, że kwadratowanie sprawia, że miara jest wrażliwa na wartości odstające (outaries).