Statystyka
1. Dane i szereg statystyczny
Statystyka opisowa zajmuje się zbieraniem, porządkowaniem i podsumowywaniem danych liczbowych. Przykładem takich danych są wyniki klasówki całej klasy albo wzrost każdego ucznia zmierzony w centymetrach. Cały zbiór zebranych danych nazywamy próbą statystyczną, a pojedynczą wartość w tym zbiorze nazywamy obserwacją. Surowe dane, czyli takie w kolejności, w jakiej je zebraliśmy, są trudne do interpretacji, dlatego pierwszym krokiem jest zawsze uporządkowanie ich rosnąco. Uporządkowany w ten sposób zbiór nazywamy szeregiem statystycznym. Uporządkowanie danych jest konieczne przy wyznaczaniu mediany, natomiast średnią i odchylenie standardowe można policzyć niezależnie od kolejności danych.
2. Częstość i szereg rozdzielczy
Gdy w zbiorze danych wiele wartości się powtarza, wygodnie jest policzyć, ile razy każda wartość występuje. Liczbę wystąpień danej wartości nazywamy liczebnością, a jej stosunek do liczby wszystkich danych nazywamy częstością. Częstość można podać jako ułamek albo jako procent. Zestawienie wszystkich różnych wartości razem z ich liczebnościami i częstościami nazywamy szeregiem rozdzielczym. Jeśli w klasie jest 25 uczniów, a ocenę czwórkę dostało 10 z nich, to liczebność czwórki wynosi 10, a jej częstość to 10 przez 25, czyli 0,4, czyli 40 procent.
3. Średnia arytmetyczna i średnia ważona
Średnia arytmetyczna to suma wszystkich wartości podzielona przez ich liczbę. To najczęściej stosowana miara tendencji centralnej, ale ma jedną słabość: jest bardzo wrażliwa na wartości skrajne, zwane odstającymi. Jedna bardzo wysoka lub bardzo niska wartość potrafi znacząco przesunąć średnią, mimo że większość danych skupia się gdzie indziej. Gdy dane są pogrupowane w szereg rozdzielczy, liczymy średnią ważoną: każdą wartość mnożymy przez jej liczebność lub częstość, sumujemy te iloczyny i dzielimy przez łączną liczbę danych. Ten sam mechanizm stoi za liczeniem średniej ważonej ocen w szkole, gdzie oceny z klasówek liczą się z większą wagą niż oceny z odpowiedzi ustnej.
4. Mediana
Mediana to wartość środkowa w uporządkowanym rosnąco zbiorze danych. Dzieli ona zbiór dokładnie na dwie równe części: połowa danych jest od niej mniejsza lub równa, a połowa większa lub równa. Żeby wyznaczyć medianę, dane trzeba najpierw posortować. Gdy liczba danych n jest nieparzysta, mediana to wartość stojąca dokładnie na środkowej pozycji. Gdy n jest parzyste, środkowych pozycji jest dwie, więc medianę liczymy jako średnią arytmetyczną tych dwóch wartości. Największą zaletą mediany jest odporność na wartości odstające: jedna bardzo wysoka pensja w firmie nie zmieni istotnie mediany zarobków, choć potrafi mocno zawyżyć średnią. Dlatego w danych, w których zdarzają się wartości skrajne, mediana lepiej opisuje typową obserwację niż średnia.
5. Dominanta
Dominanta, nazywana też modą, to wartość występująca w zbiorze danych najczęściej. Wyznaczamy ją, licząc liczebność każdej wartości i wskazując tę o największej liczebności. Zbiór danych może mieć jedną dominantę, może być wielomodalny, gdy kilka wartości ma tę samą najwyższą liczebność, albo może w ogóle nie mieć dominanty, gdy wszystkie wartości występują tak samo często. Dominanta jest jedyną z trzech głównych miar tendencji centralnej, którą da się wyznaczyć również dla danych, które nie są liczbami, na przykład dla najczęściej wybieranego koloru samochodu w salonie.
6. Miary rozproszenia: rozstęp, wariancja, odchylenie standardowe
Średnia, mediana i dominanta opisują, gdzie skupia się środek danych, ale nic nie mówią o tym, jak bardzo dane są rozrzucone wokół tego środka. Rozstęp to najprostsza miara rozproszenia: różnica między największą a najmniejszą wartością w zbiorze. Rozstęp jest łatwy do policzenia, ale uwzględnia tylko dwie wartości i pomija wszystkie pozostałe. Dokładniejszą miarą jest wariancja, czyli średnia arytmetyczna kwadratów odchyleń poszczególnych wartości od średniej. Odchylenia podnosimy do kwadratu, żeby wartości dodatnie i ujemne się nie znosiły, a duże odchylenia liczyły się mocniej niż małe. Im większa wariancja, tym dane są bardziej rozrzucone wokół średniej. Ponieważ wariancja ma jednostki podniesione do kwadratu, na przykład centymetry do kwadratu przy danych o wzroście, trudno ją interpretować bezpośrednio. Dlatego liczymy z niej pierwiastek kwadratowy i otrzymujemy odchylenie standardowe, które ma już te same jednostki co dane wejściowe i mówi, o ile przeciętnie pojedyncza wartość odbiega od średniej.
Najważniejsze wzory
Średnia arytmetyczna
Średnia ważona
Mediana przy nieparzystej liczbie danych
Mediana przy parzystej liczbie danych
Wariancja
Odchylenie standardowe
Typowe błędy
Liczenie mediany bez wcześniejszego posortowania danych rosnąco.
Mylenie średniej ważonej ze zwykłą średnią, gdy dane mają różne liczebności lub wagi.
Podawanie wariancji zamiast odchylenia standardowego jako miary rozproszenia w tych samych jednostkach co dane, mimo że wariancja ma jednostki podniesione do kwadratu.
Zaokrąglanie wyników pośrednich zamiast dopiero końcowego wyniku, co kumuluje błąd rachunkowy.
Zakładanie, że dominanta zawsze istnieje i jest jedna, podczas gdy w danych może jej nie być albo może być ich kilka.
Liczenie średniej zwykłej dla danych pogrupowanych w szereg rozdzielczy zamiast średniej ważonej, co daje błędny wynik, gdy liczebności są różne.