Testy statystyczne
Test χ² (Chi-kwadrat) dopasowania
Omówienie głównych założeń
Wprowadzenie
Test χ² (chi-kwadrat) dopasowania (Chi-Square Goodness of Fit Test) jest nieparametrycznym testem statystycznym służącym do sprawdzenia, czy rozkład obserwowanych danych jest zgodny z oczekiwanym rozkładem teoretycznym.
Test ten pozwala odpowiedzieć na pytanie:
Czy obserwowane częstości występowania poszczególnych kategorii różnią się istotnie od częstości oczekiwanych?
Jest szeroko stosowany w psychologii, socjologii, biologii, marketingu, ekonomii i badaniach społecznych.
Kiedy stosujemy test χ² dopasowania?
Test wykorzystujemy, gdy:
- analizujemy dane jakościowe (kategorie),
- chcemy porównać liczebności obserwowane z oczekiwanymi,
- badana zmienna jest nominalna lub porządkowa,
- obserwacje są niezależne.
Przykład zastosowania
Badacz chce sprawdzić, czy kostka do gry jest uczciwa.
Rzuca kostką 120 razy i uzyskuje wyniki:
| Oczko | Liczebność |
|---|---|
| 1 | 14 |
| 2 | 18 |
| 3 | 24 |
| 4 | 19 |
| 5 | 20 |
| 6 | 25 |
Jeżeli kostka jest uczciwa, każda wartość powinna wystąpić:
$$ \frac{120}{6}=20 $$
razy.
Test χ² pozwala ocenić, czy różnice między wynikami są przypadkowe, czy świadczą o nieuczciwości kostki.
Hipotezy statystyczne
Hipoteza zerowa
$$ H_0 $$
Obserwowany rozkład jest zgodny z rozkładem oczekiwanym.
Hipoteza alternatywna
$$ H_1 $$
Obserwowany rozkład różni się od rozkładu oczekiwanego.
Wzór testu χ²
\chi^2 = \sum \frac{(O_i-E_i)^2}{E_i}
gdzie:
- (O_i) – liczebność obserwowana,
- (E_i) – liczebność oczekiwana,
- (\chi^2) – statystyka testowa.
Obliczenia krok po kroku
Dane:
| Kategoria | Obserwowana (O) | Oczekiwana (E) |
|---|---|---|
| 1 | 14 | 20 |
| 2 | 18 | 20 |
| 3 | 24 | 20 |
| 4 | 19 | 20 |
| 5 | 20 | 20 |
| 6 | 25 | 20 |
Tworzymy dodatkową kolumnę:
$$ \frac{(O-E)^2}{E} $$
| O | E | (O-E)²/E |
|---|---|---|
| 14 | 20 | 1,80 |
| 18 | 20 | 0,20 |
| 24 | 20 | 0,80 |
| 19 | 20 | 0,05 |
| 20 | 20 | 0,00 |
| 25 | 20 | 1,25 |
Suma:
$$ \chi^2 = 4,10 $$
Stopnie swobody
Dla testu dopasowania:
df = k – 1
gdzie:
- (k) – liczba kategorii.
W naszym przykładzie:
$$ df = 6-1 = 5 $$
Interpretacja wyniku
Przy poziomie istotności:
$$ \alpha = 0,05 $$
wartość krytyczna wynosi:
$$ \chi^2_{kryt}=11,07 $$
Porównujemy:
$$ 4,10 < 11,07 $$
Wniosek:
Nie ma podstaw do odrzucenia hipotezy zerowej.
Oznacza to, że kostka może być uznana za uczciwą.
Warunki stosowania testu
Niezależność obserwacji
Każdy przypadek powinien należeć tylko do jednej kategorii.
Minimalne liczebności oczekiwane
Zaleca się:
$$ E_i \ge 5 $$
dla każdej kategorii.
Jeżeli warunek nie jest spełniony, należy:
- połączyć kategorie,
- zastosować test dokładny Fishera (dla małych prób).
Wielkość efektu – współczynnik Cohena w
Poza samym testem warto obliczyć wielkość efektu:
w=\sqrt{\frac{\chi^2}{N}}
Interpretacja:
| w | Siła efektu |
|---|---|
| 0,10 | mała |
| 0,30 | średnia |
| 0,50 | duża |
Test χ² dopasowania a test χ² niezależności
| Cecha | Test dopasowania | Test niezależności |
|---|---|---|
| Liczba zmiennych | 1 | 2 |
| Cel | Porównanie z rozkładem teoretycznym | Badanie związku między zmiennymi |
| Dane | Jedna tabela częstości | Tabela kontyngencji |
Zastosowania praktyczne
Psychologia
- preferencje badanych,
- wybory odpowiedzi w ankietach,
- analiza testów psychologicznych.
Marketing
- preferencje klientów,
- wybór produktów,
- skuteczność kampanii reklamowych.
Edukacja
- wybór kierunków studiów,
- wyniki egzaminów,
- rozkład ocen.
Biologia
- dziedziczenie cech,
- zgodność z prawami Mendla,
- analiza populacji.
Raportowanie wyników (APA)
Przykład:
Test chi-kwadrat dopasowania wykazał brak istotnych różnic między rozkładem obserwowanym a oczekiwanym, χ²(5) = 4,10, p > 0,05.
Zalety testu χ²
✅ Łatwy w interpretacji
✅ Nie wymaga normalności rozkładu
✅ Można stosować do danych jakościowych
✅ Szerokie zastosowanie w badaniach społecznych
Ograniczenia
❌ Wrażliwy na małe liczebności
❌ Nie określa kierunku różnic
❌ Duże próby mogą powodować wykrywanie mało istotnych różnic
❌ Wymaga niezależności obserwacji
Podsumowanie
Test χ² dopasowania jest jednym z najczęściej wykorzystywanych testów nieparametrycznych. Umożliwia ocenę zgodności rozkładu obserwowanych danych z rozkładem oczekiwanym. Znajduje zastosowanie w wielu dziedzinach nauki i praktyki badawczej, szczególnie tam, gdzie analizowane są dane jakościowe przedstawione w postaci liczebności kategorii.
