Statystyka i prawdopodobieństwo
Średnia, mediana i odchylenie, kombinatoryka i prawdopodobieństwo klasyczne — co naprawdę mówi liczba w raporcie i jak duża jest szansa, że się uda.
Tematy w tym dziale
Po co uczyć się tego działu
Każdy temat tego działu rozwiązuje konkretne sytuacje. Oto po jednej z każdej lekcji:
- Planowanie wyjazdu do pracyDziesięć zmierzonych przejazdów: 25, 26, 26, 27, 28, 28, 29, 30, 31 i 90 minut, bo raz trafił się wypadek na obwodnicy. Średnia to 340 : 10 = 34 minuty, mediana (28 + 28) : 2 = 28 minut. Mediana mówi, ile kosztuje zwykły poranek; średnia rozsmarowuje jedną stłuczkę po dziewięciu pozostałych dniach. Wyjeżdżasz według mediany i trzymasz osobny zapas na dzień, który się nie uda, zamiast codziennie rezerwować sześć minut na zdarzenie, które zdarzyło się raz.
- Wybór firmy kurierskiejDwie firmy dowożą paczkę średnio w 3 dni. Pierwsza: 2, 3, 3, 3, 4 dni — wariancja (1 + 0 + 0 + 0 + 1) : 5 = 0,4, odchylenie 0,63 dnia. Druga: 1, 1, 3, 5, 5 dni — wariancja 16 : 5 = 3,2, odchylenie 1,79 dnia. Prezent, który ma dojść na konkretny dzień, wysyłasz pierwszą, choć cennik i reklama pokazują dla obu tę samą średnią.
- Wykres w gazecieArtykuł o sondażu pokazuje dwa słupki: 42 i 46 procent, oś pionowa zaczyna się od 40. Narysowane wysokości to 2 i 6 jednostek, więc słupek lidera jest trzy razy wyższy. Prawdziwy stosunek to 46 : 42, czyli przewaga o 9,5 procenta wartości — rysunek zawyża ją ponad trzydziestokrotnie. Jedno spojrzenie na liczbę przy dolnym końcu osi rozstrzyga, czy warto ufać temu obrazkowi.
- Siła hasła i PIN-uCzterocyfrowy PIN to 10⁴ = 10 000 możliwości — telefon blokuje się po trzech próbach, ale wykradziona baza takich kodów pada w ułamku sekundy. Hasło z ośmiu małych liter to 26⁸ ≈ 209 miliardów kombinacji, a z ośmiu znaków wybieranych spośród 62 (małe litery, wielkie, cyfry) — 62⁸ ≈ 218 bilionów, czyli ponad tysiąc razy więcej. Każdy dołożony znak mnoży tę liczbę przez rozmiar alfabetu, a nie dodaje do niej.
- Zakład w LottoSześć liczb z 49 to C(49, 6) = 13 983 816 jednakowo możliwych zakładów, więc P(szóstka) = 1 : 13 983 816 ≈ 0,0000072%. Jeden zakład tygodniowo przez 50 lat to 2 600 losowań, a szansa trafienia kiedykolwiek w tym okresie — liczona przez zdarzenie przeciwne, czyli 1 minus prawdopodobieństwo 2 600 nietrafień — wynosi około 0,019%, mniej niż dwie na dziesięć tysięcy. Tej liczby nie ma na kuponie.
- Wynik testu przesiewowegoTest wykrywa chorobę u 99 na 100 chorych i myli się u 2 na 100 zdrowych, a choruje 1 osoba na 100. Wynik dodatni dostaje 0,01 · 0,99 = 0,0099 chorych i 0,99 · 0,02 = 0,0198 zdrowych, czyli razem 2,97 procenta badanych. Prawdopodobieństwo choroby po dodatnim wyniku wynosi 0,0099 / 0,0297, czyli dokładnie jedną trzecią — nie 99 procent. Dlatego dodatni wynik badania przesiewowego zawsze powtarza się testem potwierdzającym.
- Kontrola jakości partii towaruZ partii, w której wadliwe jest 5 procent sztuk, magazynier losuje 10 sztuk do sprawdzenia. Prawdopodobieństwo, że żadna nie okaże się wadliwa, wynosi 0,95 do potęgi dziesiątej, czyli 0,599 — a więc prawie 40 procent takich kontroli wykryje co najmniej jedną wadę. Gdyby wadliwych było 20 procent, próba dziesięciu sztuk przepuściłaby partię już tylko w 11 procentach przypadków, i to jest cała matematyka za doborem liczności próby.
- Los na loteriiLos kosztuje 5 zł. Główna wygrana 1000 zł trafia się z prawdopodobieństwem 1/2000, a pociesznie 50 zł z prawdopodobieństwem 1/200. Wartość oczekiwana wygranej wynosi 1000/2000 + 50/200 = 0,50 + 0,25 = 0,75 zł, więc oczekiwany wynik gracza to 0,75 − 5 = −4,25 zł na każdym losie. Przy stu losach rocznie daje to spodziewaną stratę 425 zł, i żadna seria szczęścia tego nie zmienia — zmienia tylko to, kiedy się to ujawni.
- Nadkomplet w samolocieLinia sprzedaje 210 biletów na 200 miejsc, bo pasażer stawia się na lotnisku z prawdopodobieństwem 0,95. Liczba stawiających się ma rozkład dwumianowy o parametrach E(X) = 210 · 0,95 = 199,5 oraz wariancji 210 · 0,95 · 0,05 = 9,975, czyli odchyleniu standardowym 3,16 pasażera. Średnio zostaje pół wolnego miejsca, ale rozrzut trzech pasażerów oznacza, że nadkomplet zdarza się w kilkudziesięciu procentach lotów — i to jest liczba, którą linia świadomie kupuje.
- Tolerancja produkcyjnaAutomat nasypuje do paczek średnio 500 g produktu z odchyleniem standardowym 2 g. Reguła trzech sigm mówi, że 99,7 procenta paczek mieści się między 494 a 506 g. Jeśli norma dopuszcza odchyłkę 5 g, czyli 2,5 sigmy, to poza tolerancją wypada 1,24 procenta produkcji — przy 20 000 paczek dziennie jest to 248 sztuk do odrzucenia, i to jest liczba, na której opiera się decyzja o przestawieniu maszyny.
- Sondaż z marginesem błęduPracownia bada 1067 osób i podaje poparcie 34 procent „z marginesem błędu 3 punkty procentowe". Ta liczba nie jest zwyczajowa: przy najgorszym możliwym rozrzucie odpowiedzi błąd standardowy wynosi √(0,25/1067) ≈ 0,0153, a margines na poziomie ufności 95 procent to 1,96 · 0,0153 ≈ 0,030, czyli 3,0 punktu. Przedział ufności biegnie więc od 31 do 37 procent — i dopiero on jest wynikiem sondażu.
- Test A/B stronyWariant A konwertuje na poziomie 4,0 procent. Wariant B dostaje 2500 odsłon i konwertuje 120 razy, czyli 4,8 procent. Przy hipotezie „nic się nie zmieniło" błąd standardowy wynosi √(0,04 · 0,96 / 2500) ≈ 0,0039, więc z = (0,048 − 0,040)/0,0039 ≈ 2,04. To przekracza 1,96, więc przy α = 0,05 odrzucamy hipotezę zerową — ale ledwie, i decyzja o wdrożeniu powinna to uwzględniać.
- Cena mieszkania a metrażZ 60 transakcji w jednej dzielnicy wychodzi prosta ŷ = 9,2x + 45, gdzie x to metraż w metrach kwadratowych, a ŷ cena w tysiącach złotych. Mieszkanie 50-metrowe model wycenia na 9,2 · 50 + 45 = 505 tysięcy. Współczynnik determinacji wynosi 0,78, więc metraż wyjaśnia 78 procent zmienności ceny — pozostałe 22 procent to piętro, stan, ekspozycja i to, jak bardzo sprzedającemu się spieszyło.
Wzory działu
Dział: Statystyka i prawdopodobieństwo
Średnia, mediana i dominanta
Średnia arytmetyczna
suma wszystkich danych podzielona przez ich liczbę
Suma ze średniej
stąd wyznaczamy brakującą wartość, gdy średnia jest znana
Mediana — nieparzyście wiele danych
po uporządkowaniu jest to dokładnie środkowa liczba
Mediana — parzyście wiele danych
średnia dwóch środkowych wartości
Dominanta (moda)
liczba, która występuje najczęściej — może jej nie być wcale
Średnia ważona
każda wartość wchodzi tyle razy, ile wynosi jej waga
Wariancja i odchylenie
Rozstęp
najprostsza miara rozproszenia — patrzy tylko na dwie skrajne wartości
Odchylenie od średniej
suma odchyleń zawsze wynosi zero — dlatego samych odchyleń nie da się uśrednić
Wariancja
średnia z kwadratów odchyleń od średniej
Odchylenie standardowe
pierwiastek z wariancji — wraca do jednostek danych
Wzór skrócony
średnia kwadratów minus kwadrat średniej — szybszy w rachunku
Wariancja próbki
dzielnik n − 1, gdy dane są próbką pobraną z większej populacji
Prezentacja danych
Suma liczności
kontrola tabeli: liczności sumują się do liczebności próby
Częstość względna
udział klasy; po przemnożeniu przez 100 — procent
Kąt wycinka koła
całe koło to 360°, więc kąt jest częstością w stopniach
Szerokość klasy histogramu
k — liczba klas; rozstęp z lekcji o wariancji dzielony na równe kawałki
Gęstość liczności
wysokość słupka przy NIERÓWNYCH klasach — nie sama liczność
Pozorny stosunek na uciętej osi
c — początek osi; przy c = 0 wraca zwykłe x_B / x_A
Kombinatoryka
Reguła mnożenia
wybór w kilku niezależnych krokach — liczby możliwości mnożymy
Silnia
iloczyn kolejnych liczb naturalnych; 0! z definicji równa się 1
Permutacje
liczba ustawień wszystkich n elementów w kolejności
Wariacje bez powtórzeń
wybór k z n, kolejność ma znaczenie, bez powtórzeń
Wariacje z powtórzeniami
k razy wybieramy spośród tych samych n możliwości
Kombinacje
wybór k z n, kolejność NIE ma znaczenia
Symetria kombinacji
wybranie k elementów to to samo, co odrzucenie pozostałych n − k
Reguła trójkąta Pascala
każdy wyraz trójkąta jest sumą dwóch stojących nad nim
Dwumian Newtona
współczynniki rozwinięcia to n-ty wiersz trójkąta Pascala
Prawdopodobieństwo klasyczne
Prawdopodobieństwo klasyczne
liczba zdarzeń sprzyjających przez liczbę wszystkich możliwych
Zakres prawdopodobieństwa
nigdy mniej niż 0 i nigdy więcej niż 1
Zdarzenie niemożliwe i pewne
skrajne przypadki definicji, a nie wyniki rachunku
Zdarzenie przeciwne
często łatwiej policzyć „nie A" niż samo A
Zapis procentowy
to samo prawdopodobieństwo wyrażone w procentach
Zdarzenia niezależne
iloczyn prawdopodobieństw — tylko gdy jedno nie wpływa na drugie
Prawdopodobieństwo warunkowe
Prawdopodobieństwo warunkowe
określone tylko dla P(B) > 0
Reguła mnożenia
definicja przemnożona przez P(B)
Wersja licznościowa
gdy zdarzenia elementarne są równo prawdopodobne
Prawdopodobieństwo całkowite
A₁, …, Aₙ rozbijają Ω na rozłączne przypadki
Twierdzenie Bayesa
odwraca warunek: z P(B|A) robi P(A|B)
Niezależność
warunek nie zmienia szans zdarzenia A
Drzewa i schemat Bernoulliego
Mnożenie wzdłuż gałęzi
prawdopodobieństwo jednej ścieżki drzewa
Dodawanie po ścieżkach
zdarzenie to zbiór ścieżek, więc się je sumuje
Suma zdarzeń
część wspólna liczona dwa razy, więc raz odjęta
Zdarzenia rozłączne
nie ma czego odejmować
Schemat Bernoulliego
k sukcesów w n niezależnych próbach
Co najmniej jeden sukces
przez zdarzenie przeciwne, bez sumowania
Zmienna losowa
Zmienna losowa
funkcja przypisująca liczbę wynikowi doświadczenia
Rozkład zmiennej
tabela wartości i ich prawdopodobieństw
Wartość oczekiwana
średnia ważona prawdopodobieństwami
Wariancja zmiennej
średni kwadrat odchylenia od E(X)
Wzór rachunkowy
jeden przebieg tabeli zamiast dwóch
Odchylenie standardowe
w tej samej jednostce co X
Dystrybuanta
niemalejąca, od 0 do 1
Przekształcenie liniowe
przesunięcie nie zmienia rozrzutu
Rozkład dwumianowy i Poissona
Rozkład dwumianowy
wzór wyprowadzony w lekcji o schemacie Bernoulliego
Wartość oczekiwana
liczba prób razy szansa sukcesu
Wariancja
największa przy p = 1/2
Co najmniej jeden sukces
przez zdarzenie przeciwne
Rozkład Poissona
model zdarzeń rzadkich w ustalonym oknie
Parametry Poissona
jedna liczba opisuje cały rozkład
Przejście graniczne
n duże, p małe, iloczyn ustalony
Rozkład normalny
Gęstość rozkładu normalnego
pole pod całą krzywą wynosi 1
Zapis
μ przesuwa krzywą, σ ją rozszerza
Standaryzacja
o ile odchyleń x leży od średniej
Rozkład standardowy
jeden rozkład zamiast nieskończonej rodziny
Reguła jednej sigmy
dwie trzecie populacji
Reguła trzech sigm
poza trzema sigmami leżą 3 przypadki na 1000
Centralne twierdzenie graniczne
średnia z próby dąży do rozkładu normalnego
Przybliżenie dwumianowego
stosowalne, gdy np(1 − p) ≥ 10
Estymacja i przedziały ufności
Estymator punktowy średniej
jedna liczba policzona z próby
Nieobciążoność estymatora
nie myli się systematycznie — myli się losowo
Wariancja z próby
dzielnik n − 1 to poprawka na nieobciążoność
Błąd standardowy średniej
rozrzut samej średniej, nie danych
Przedział ufności dla średniej
z = 1,64 · 1,96 · 2,58 dla 90 · 95 · 99 procent
Margines błędu
połowa szerokości przedziału
Wymagana liczebność próby
ten sam wzór czytany od strony d
Testowanie hipotez
Hipoteza zerowa i alternatywna
H₀ zawsze zawiera równość — to ją da się policzyć
Statystyka testowa dla średniej
o ile błędów standardowych próba odbiega od hipotezy
Reguła decyzyjna (test dwustronny)
z_{α/2} = 1,96 dla α = 0,05
p-wartość
prawdopodobieństwo TAKICH danych przy H₀ — nie H₀ przy danych
Błąd I rodzaju
fałszywy alarm; ustalany z góry
Błąd II rodzaju
przeoczenie realnego efektu
Moc testu
szansa wykrycia efektu, który naprawdę istnieje
Korelacja i regresja
Suma iloczynów odchyleń
dodatnia, gdy odchylenia idą w tę samą stronę
Współczynnik korelacji Pearsona
zawsze między −1 a 1; bez jednostki
Prosta najmniejszych kwadratów
prosta zawsze przechodzi przez punkt (x̄, ȳ)
Wartość dopasowana
predykcja modelu dla danego x
Reszty
to ich kwadraty minimalizuje metoda
Współczynnik determinacji
ułamek zmienności y wyjaśniony przez model
Test na istotność korelacji
rozkład t o n − 2 stopniach swobody
