Estymacja punktowa i przedziałowa
Zbadano tysiąc osób, a wniosek ma dotyczyć trzydziestu milionów. Estymator zamienia próbę w liczbę, błąd standardowy mówi, jak bardzo ta liczba się chwieje, a przedział ufności zamienia jedną wartość w uczciwy zakres — razem z rachunkiem na to, ile obserwacji potrzeba, żeby zakres był dostatecznie wąski.
Zanim zaczniesz
Ten temat opiera się na wcześniejszych zagadnieniach. Zanim zaczniesz, warto przerobić poniższe lekcje — dzięki nim wszystko pójdzie gładko:
- Rozkład normalnyKrzywa dzwonowa opisuje wzrost, błąd pomiaru, wynik egzaminu i wagę paczki — i nie jest to zbieg okoliczności, tylko treść centralnego twierdzenia granicznego. Dwie liczby, μ i σ, wystarczą, żeby powiedzieć o takim rozkładzie wszystko; reguła 68–95–99,7 pozwala go czytać bez tablic.
- Wariancja i odchylenieDwa zbiory mogą mieć identyczną średnią i wyglądać zupełnie inaczej. Rozstęp, wariancja i odchylenie standardowe mierzą to, czego średnia nie widzi: jak bardzo dane są rozrzucone wokół niej.
Gdzie się tego używa
Konkretne sytuacje, w których liczysz dokładnie tak, jak uczy ta lekcja:
- Sondaż z marginesem błęduPracownia bada 1067 osób i podaje poparcie 34 procent „z marginesem błędu 3 punkty procentowe". Ta liczba nie jest zwyczajowa: przy najgorszym możliwym rozrzucie odpowiedzi błąd standardowy wynosi √(0,25/1067) ≈ 0,0153, a margines na poziomie ufności 95 procent to 1,96 · 0,0153 ≈ 0,030, czyli 3,0 punktu. Przedział ufności biegnie więc od 31 do 37 procent — i dopiero on jest wynikiem sondażu.
- Kontrola jakości partiiAutomat ma nasypywać 500 g. Kontroler waży 100 losowych opakowań i dostaje średnią 499,4 g przy odchyleniu 2 g. Błąd standardowy to 2/√100 = 0,2 g, więc przedział 95-procentowy sięga 499,4 ± 1,96 · 0,2, czyli od 499,01 do 499,79 g. Wartość nominalna 500 g leży poza tym przedziałem — automat sypie za mało systematycznie, a nie przypadkiem, i to jest podstawa do zatrzymania linii.
- Wynik pomiaru w laboratoriumLaboratorium podaje stężenie jako 4,20 ± 0,08 mg/l. Ten zapis to przedział ufności: 0,08 jest marginesem błędu przy zadanym poziomie ufności, a nie zakresem, w którym mieszczą się wszystkie pojedyncze pomiary. Przy 16 powtórzeniach i odchyleniu 0,16 mg/l błąd standardowy wynosi 0,04 mg/l, więc 0,08 to dokładnie dwa błędy standardowe, czyli mniej więcej 95 procent ufności.
- Ile pomiarów zrobićChcesz oszacować średni czas dojazdu z dokładnością do jednej minuty przy 95 procentach ufności, a odchylenie standardowe wynosi 5 minut. Wymagana liczba pomiarów to n = (1,96 · 5 / 1)² ≈ 96, czyli około czterech miesięcy codziennych zapisków. Zadowolenie się dokładnością dwóch minut obniża tę liczbę do 24 — czterokrotnie, bo dokładność wchodzi do wzoru w kwadracie.
Wszystkie wzory
Estymator punktowy średniej
jedna liczba policzona z próby
Nieobciążoność estymatora
nie myli się systematycznie — myli się losowo
Wariancja z próby
dzielnik n − 1 to poprawka na nieobciążoność
Błąd standardowy średniej
rozrzut samej średniej, nie danych
Przedział ufności dla średniej
z = 1,64 · 1,96 · 2,58 dla 90 · 95 · 99 procent
Margines błędu
połowa szerokości przedziału
Wymagana liczebność próby
ten sam wzór czytany od strony d
Poprzednia lekcja skończyła się na centralnym twierdzeniu granicznym i wzorze, w którego mianowniku stało . Ta lekcja jest o tym, do czego ten mianownik służy: do wnioskowania o całej populacji na podstawie próby.
Pytanie jest praktyczne. Zbadano tysiąc osób, a wniosek ma dotyczyć trzydziestu milionów. Co dokładnie wolno powiedzieć — i z jaką dokładnością?
Próba, populacja, estymator
Rozróżnienie populacji i próby wprowadziła lekcja o wariancji; tutaj jest ono narzędziem, a nie tematem. Warto tylko utrwalić notację, bo od tego miejsca konsekwentnie rozdzielamy dwa światy:
| wielkość | populacja (nieznana) | próba (policzalna) |
|---|---|---|
| średnia | ||
| odchylenie | ||
| liczebność |
Litery greckie są parametrami — stałymi liczbami, których nie znamy. Litery łacińskie są statystykami — liczbami policzonymi z próby, a więc losowymi: druga próba da inne.
Estymator to przepis na oszacowanie parametru ze statystyki. Naturalnym estymatorem średniej w populacji jest średnia z próby:
Daszek nad literą oznacza „oszacowanie". To jest estymacja punktowa: jedna liczba. I jest z nią zasadniczy kłopot — przy zmiennej ciągłej prawdopodobieństwo, że trafiliśmy dokładnie, wynosi zero. Sama liczba nie mówi więc nic o tym, jak bardzo się mylimy.
Nieobciążoność, czyli po co jest dzielnik n − 1
Estymator jest nieobciążony, jeżeli jego wartość oczekiwana równa się szacowanemu parametrowi:
Nie znaczy to, że trafia — znaczy, że myli się w obie strony po równo, więc uśredniony po wielu próbach trafia. Estymator obciążony myli się systematycznie w jedną stronę i żadna liczba powtórzeń tego nie naprawi.
Średnia z próby jest nieobciążona, bo . Ciekawszy przypadek to wariancja — i tu wraca dzielnik, który lekcja o wariancji podała bez pełnego uzasadnienia:
Powód jest taki. Odchylenia liczymy od , a nie od nieznanego . Ale jest średnią akurat tych punktów, więc leży do nich bliżej niż prawdziwe — suma kwadratów odchyleń od średniej z próby jest najmniejsza z możliwych. Dzieląc przez , dostalibyśmy więc liczbę systematycznie za małą. Poprawka jest dobrana dokładnie tak, żeby
Nazywa się to liczbą stopni swobody: mając , ostatnie odchylenie da się wyliczyć z pozostałych, bo odchylenia sumują się do zera. Niezależnych informacji o rozrzucie jest zatem , a nie .
Błąd standardowy średniej
Skoro jest liczbą losową, ma własny rozkład — i to jest rozkład próbkowy średniej. Centralne twierdzenie graniczne z poprzedniej lekcji mówi o nim wszystko, czego potrzebujemy: jest w przybliżeniu normalny, ma tę samą średnią i odchylenie standardowe
Ta wielkość nazywa się błędem standardowym średniej i trzeba ją odróżniać od odchylenia standardowego:
- mierzy rozrzut danych i nie zależy od tego, ile ich zebrano;
- mierzy rozrzut średniej i maleje wraz z liczebnością próby.
Zdanie „ludzie mają wzrost cm" mówi o odchyleniu. Zdanie „średni wzrost wynosi cm" mówi o błędzie standardowym. To dwa zupełnie różne twierdzenia i pomylenie ich jest najczęstszym błędem całego wnioskowania statystycznego.
Przedział ufności dla średniej
Skoro ma rozkład w przybliżeniu normalny o odchyleniu , to z reguły trzech sigm wiemy, jak daleko od zwykle pada. Odwracając to zdanie, dostajemy przedział ufności:
Współczynnik dobiera się do żądanego poziomu ufności:
| poziom ufności | ile przedziałów chybia | |
|---|---|---|
| na | ||
| na | ||
| na |
Wartość warto rozpoznać: to dokładna wersja „dwóch sigm" z reguły 68–95–99,7. Połowę szerokości przedziału nazywa się marginesem błędu:
Co dokładnie znaczy „95 procent"
To jest miejsce, w którym najłatwiej powiedzieć rzecz nieprawdziwą, więc warto je rozstrzygnąć rysunkiem.
Rysunek pokazuje to, czego zdanie nie potrafi: losowy jest przedział, a nie parametr. Prawdziwa średnia jest stałą liczbą i albo leży w danym przedziale, albo nie leży — nie ma tu żadnego prawdopodobieństwa. Losowa jest próba, a więc i przedział, który z niej zbudowaliśmy.
Poprawne zdanie brzmi: procedura, która wyprodukowała ten przedział, trafia w 95 przypadkach na 100. Do zdania nieprawdziwego wracamy w sekcji o nadużyciach, bo jest to najczęstsze przekłamanie w całej statystyce stosowanej.
Ile obserwacji potrzeba
Wzór na margines błędu czyta się też od tyłu. Jeżeli z góry wiemy, jak wąski przedział nam wystarczy, to
Kluczowy jest kwadrat: dokładność wchodzi do liczebności w drugiej potędze. Przedział dwa razy węższy kosztuje próbę cztery razy większą, dziesięć razy węższy — sto razy większą.
To jest też odpowiedź na pytanie, dlaczego sondaże robi się na próbach rzędu tysiąca osób. Pierwsze trzy punkty procentowe dokładności są tanie; każdy następny kosztuje czterokrotnie więcej niż poprzedni.
Gdzie ta matematyka bywa nadużywana
Cztery nadużycia, każde z nazwą, bo nazwane łatwiej rozpoznać.
1. „Z prawdopodobieństwem 95 procent parametr leży w przedziale"
Najczęstsze przekłamanie w całej statystyce stosowanej i zdanie, które pada nawet w podręcznikach. Jest nieprawdziwe w języku, w którym pracujemy: nie jest zmienną losową, więc zdanie „" nie ma prawdopodobieństwa — jest po prostu prawdziwe albo fałszywe.
Sprostowanie: procent odnosi się do procedury, nie do konkretnego przedziału. Poprawnie: „gdyby badanie powtórzyć wielokrotnie, około 95 procent tak zbudowanych przedziałów pokryłoby ". Interpretacja, w której parametr jest losowy, jest osobnym podejściem — bayesowskim — i wtedy nazywa się to przedziałem wiarygodnym, a nie ufności, i liczy zupełnie inaczej.
2. Margines błędu bez poziomu ufności
„Margines błędu wynosi 3 punkty" nie jest kompletną informacją: przy tej samej próbie margines na poziomie jest o połowę większy niż na . Podanie samej liczby pozwala wybrać poziom ufności po obejrzeniu wyniku.
Sprostowanie: margines błędu podaje się zawsze razem z poziomem ufności, a poziom ustala się przed zebraniem danych.
3. Przedział ufności mylony z zakresem obserwacji
„Przedział ufności dla średniej wzrostu to cm" nie znaczy, że 95 procent ludzi ma wzrost z tego przedziału. Mówi wyłącznie o średniej, a nie o pojedynczej osobie — i dlatego jest tak wąski. Zakres, w którym mieści się 95 procent obserwacji, to zupełnie inna rzecz, liczona z , a nie z , i przy jest dwadzieścia razy szerszy.
Sprostowanie: przedział ufności dotyczy parametru, przedział predykcyjny — przyszłej obserwacji. Mylenie ich to dokładnie mylenie z .
4. Margines błędu jako gwarancja jakości próby
Ten jest najkosztowniejszy. Wzór mierzy wyłącznie błąd losowania — zakłada, że próba jest losowa i że wszyscy wylosowani odpowiedzieli. Nie mierzy ani obciążenia doboru, ani odmów odpowiedzi, ani źle zadanego pytania. Ankieta internetowa z pięćdziesięcioma tysiącami wypełnień ma znikomy margines błędu i może być bezwartościowa, bo wypełniali ją ci, którzy chcieli.
Sprostowanie: margines błędu jest granicą dolną niepewności, a nie górną. Zebranie większej próby zawęża go i nie usuwa ani jednego błędu systematycznego.
Zadania
Pierwszy zestaw idzie w kolejności, w jakiej liczy się takie zadanie. Prompt s/√n podaje odchylenie i liczebność, a prosi o błąd standardowy — czyli o ten jeden krok, który odróżnia rozrzut danych od rozrzutu średniej. Prompt „przedział ufności" podaje , , oraz , a odpowiedzią jest para liczb w nawiasie, od lewego końca: przedział jest uporządkowany, więc wpisany na odwrót nie przechodzi.
Trzeci prompt czyta tę samą zależność w obie strony: raz pyta o margines błędu przy danym , raz o wymaganą liczebność próby przy danym marginesie. Liczebność wychodzi w tych zadaniach całkowita, bo dane są dobrane wstecz od odpowiedzi.
Ćwiczenia
Rozwiąż zestaw zadań — trudność rośnie z każdym kolejnym. Na końcu zobaczysz wynik i listę pomyłek do powtórki.
Drugi zestaw jest autorski i pyta nie o rachunek, tylko o zachowanie przedziału: jak reaguje na zmianę liczebności próby, ile przedziałów chybia przy danym poziomie ufności, ile wynosi obciążenie estymatora nieobciążonego. Generator tego nie losuje, bo to są własności procedury, a nie wyniki pojedynczego zadania.
Ćwiczenia
Rozwiąż zestaw zadań — trudność rośnie z każdym kolejnym. Na końcu zobaczysz wynik i listę pomyłek do powtórki.
Rozstrzygnięcie „czy tak zbudowany przedział w ogóle wolno tu policzyć" nie ma liczby za odpowiedź i zostaje treścią — cztery sytuacje, w których odpowiedź brzmi „nie", masz w sekcji o nadużyciach.
Częste błędy
- Mylenie z — pierwsze mierzy rozrzut danych, drugie rozrzut średniej; pomyłka zawyża przedział -krotnie i jest błędem numer jeden tej lekcji.
- „Z prawdopodobieństwem 95 procent średnia leży w tym przedziale" — losowy jest przedział, nie parametr; procent opisuje procedurę powtarzaną wielokrotnie.
- Mnożenie przez przed podzieleniem przez — kolejność nie zmienia wyniku, ale pominięcie dzielenia zmienia; sprawdź, czy w mianowniku naprawdę stoi pierwiastek.
- Zaokrąglanie wymaganej liczebności w dół — obserwacji znaczy ; zaokrąglenie w dół daje margines większy niż żądany.
- Traktowanie przedziału ufności jak zakresu obserwacji — ten pierwszy dotyczy średniej i przy dużym jest bardzo wąski; zakres, w którym leży 95 procent jednostek, liczy się z .
- Uznawanie małego marginesu błędu za dowód rzetelności badania — margines mierzy tylko błąd losowania i nie widzi ani obciążenia doboru, ani odmów odpowiedzi.
- Używanie przy małej próbie i nieznanym — poniżej mniej więcej trzydziestu obserwacji właściwy jest rozkład t-Studenta o stopniach swobody, którego wartości krytyczne są większe.
Karta wzorów
Temat: Estymacja i przedziały ufności
Estymator punktowy średniej
jedna liczba policzona z próby
Nieobciążoność estymatora
nie myli się systematycznie — myli się losowo
Wariancja z próby
dzielnik n − 1 to poprawka na nieobciążoność
Błąd standardowy średniej
rozrzut samej średniej, nie danych
Przedział ufności dla średniej
z = 1,64 · 1,96 · 2,58 dla 90 · 95 · 99 procent
Margines błędu
połowa szerokości przedziału
Wymagana liczebność próby
ten sam wzór czytany od strony d
