Zanim wybierzesz test: co musi być już ustalone
Dobór testu jest ostatnim krokiem łańcucha: problem badawczy → pytanie badawcze → hipoteza → zmienne i ich pomiar → test. Jeśli któreś ogniwo jest nieostre, żaden test tego nie naprawi. Hipoteza „media społecznościowe wpływają na studentów” nie wskazuje ani zmiennej zależnej, ani porównywanych grup, więc nie da się do niej przypisać procedury.
Przed analizą warto sprawdzić, czy da się jednoznacznie odpowiedzieć na pytania:
- jaka jest zmienna zależna (wynik, który mierzymy) i jaka niezależna (czynnik, którego rolę sprawdzamy),
- jak dokładnie zmierzono każdą zmienną: jedno pytanie, suma kilku pozycji skali, kategoria, wartość liczbowa,
- kto jest badany i ile razy: różne osoby w grupach czy te same osoby w kilku pomiarach.
Jeśli trudno wskazać zmienną zależną, problem leży zwykle wyżej, na poziomie problemu badawczego. Wtedy lepiej wrócić do jego sformułowania. Pomocne bywa zestawienie przykładów problemów badawczych z różnych kierunków, w którym widać, jak ogólny temat zamienia się w pytanie możliwe do zbadania. Sam przekład pojęć na zmienne opisuje tekst o operacjonalizacji.
Trzy pytania, które zawężają wybór testu
1. Czy hipoteza dotyczy różnic, czy związku?
Hipotezy o różnicach porównują grupy albo pomiary: „Pracownicy zdalni deklarują wyższą satysfakcję z pracy niż pracownicy stacjonarni”. Hipotezy o związku opisują współzmienność dwóch cech: „Im dłuższy staż pracy, tym niższa skłonność do zmiany pracodawcy”. Trzecią grupę stanowią hipotezy predykcyjne, w których kilka zmiennych jednocześnie wyjaśnia wynik. Do nich służą modele regresji.
2. Na jakiej skali zmierzono zmienną zależną?
- Skala nominalna: kategorie bez porządku (kierunek studiów, forma zatrudnienia). Analizuje się liczebności i proporcje.
- Skala porządkowa: kategorie uporządkowane (wykształcenie, pojedyncze pytanie z odpowiedziami od „zdecydowanie nie” do „zdecydowanie tak”). Analizuje się rangi.
- Skala ilościowa (przedziałowa lub ilorazowa): wiek, czas, wynik testu wiedzy, suma punktów z wielopozycyjnego kwestionariusza. Można analizować średnie.
Klasyczny podział skal pomiarowych: Stevens (1946).
3. Ile jest grup i czy pomiary są niezależne?
Dwie grupy różnych osób to układ niezależny. Ta sama osoba zbadana przed szkoleniem i po nim, albo pary dopasowanych osób, to układ zależny (powtarzane pomiary). Pomylenie tych układów jest jednym z najczęstszych błędów w pracach dyplomowych, bo daje błędne błędy standardowe i wartości p.
Tabela doboru testu do hipotezy
| Typ hipotezy | Zmienna zależna | Układ | Test podstawowy | Alternatywa, gdy założenia nie są spełnione |
|---|---|---|---|---|
| Różnica między 2 grupami | ilościowa | niezależny | test t Welcha | test U Manna-Whitneya |
| Różnica między 2 pomiarami | ilościowa | zależny | test t dla prób zależnych | test Wilcoxona (rangowanych znaków) |
| Różnica między 3+ grupami | ilościowa | niezależny | jednoczynnikowa ANOVA (wersja Welcha) + porównania post hoc | test Kruskala-Wallisa + test Dunna |
| Różnica między 3+ pomiarami | ilościowa | zależny | ANOVA z powtarzanym pomiarem | test Friedmana |
| Różnica między grupami | porządkowa | niezależny | test U Manna-Whitneya (2 grupy) / Kruskala-Wallisa (3+) | – |
| Związek dwóch cech | nominalna × nominalna | niezależny | test chi-kwadrat niezależności | dokładny test Fishera przy małych liczebnościach oczekiwanych |
| Zmiana odpowiedzi tak/nie | nominalna (2 kategorie) | zależny | test McNemara | – |
| Związek dwóch cech | ilościowa × ilościowa | – | korelacja Pearsona | korelacja Spearmana |
| Związek dwóch cech | porządkowa × porządkowa lub ilościowa | – | korelacja Spearmana (lub tau Kendalla) | – |
| Przewidywanie wyniku przez kilka zmiennych | ilościowa | – | regresja liniowa | modele odporne, transformacje |
| Przewidywanie wyniku przez kilka zmiennych | dwie kategorie (np. tak/nie) | – | regresja logistyczna | – |
Szczegółowe opisy poszczególnych procedur są w słowniku: test t Studenta, test Manna-Whitneya, test chi-kwadrat i korelacja. Interpretację modelu z wynikiem dwukategorialnym omawia artykuł o regresji logistycznej.
Tabela jest punktem wyjścia, a nie automatem. Ten sam układ danych może wymagać innego modelu, gdy pojawiają się zmienne kontrolne, dane zagnieżdżone (np. uczniowie w klasach) albo wielokrotne pomiary w czasie.
Trzy przykłady: od hipotezy do testu
Zarządzanie. Hipoteza: „Pracownicy zatrudnieni w trybie zdalnym oceniają satysfakcję z pracy wyżej niż pracownicy stacjonarni”. Satysfakcja to suma 10 pozycji skali (wynik ilościowy), grupy są niezależne, porównujemy dwie. Test: t Welcha. Jeśli rozkład wyników jest silnie skośny przy małej próbie, uzupełniająco test U Manna-Whitneya.
Pedagogika. Hipoteza: „Po cyklu zajęć z czytania ze zrozumieniem wyniki uczniów w teście wiedzy są wyższe niż przed zajęciami”. Ci sami uczniowie, dwa pomiary, wynik w punktach. Test: t dla prób zależnych, a przy niewielkiej liczbie uczniów i odstających różnicach test Wilcoxona.
Logistyka. Hipoteza: „Wybór formy dostawy (kurier, paczkomat, odbiór osobisty) zależy od wielkości miejscowości zamieszkania”. Obie zmienne są nominalne. Test: chi-kwadrat niezależności, a przy zbyt małych liczebnościach oczekiwanych w komórkach dokładny test Fishera lub połączenie kategorii, uzasadnione merytorycznie.
Założenia: co sprawdzić, a czego nie przeceniać
Testy parametryczne mają założenia, ale w praktyce prac dyplomowych częściej szkodzi ich mechaniczne sprawdzanie niż ich pominięcie.
- Normalność rozkładu. Test t i ANOVA są dość odporne na umiarkowane odchylenia od normalności, szczególnie przy grupach liczących kilkadziesiąt osób (Fagerland, 2012). Wynika to z centralnego twierdzenia granicznego. Testy normalności (np. Shapiro-Wilka) przy dużych próbach wykrywają odchylenia bez znaczenia praktycznego, a przy małych przeoczają istotne problemy. Lepiej obejrzeć histogram i wykres kwantyl-kwantyl oraz zwrócić uwagę na obserwacje odstające.
- Równość wariancji. Zamiast sprawdzać ją testem Levene'a i dopiero potem wybierać wersję testu, można domyślnie stosować test t Welcha. Przy równych wariancjach daje on niemal ten sam wynik, a przy nierównych chroni przed błędem (Delacre i in., 2017).
- Niezależność obserwacji. To założenie najważniejsze i najrzadziej sprawdzane. Jeśli ta sama osoba wypełniła ankietę dwa razy albo respondenci pochodzą z kilku zespołów o wspólnym kierowniku, zwykły test dla prób niezależnych nie jest właściwy.
Skala Likerta: pojedyncze pytanie czy suma pozycji?
Pojedyncze pytanie z pięcioma odpowiedziami od „zdecydowanie się nie zgadzam” do „zdecydowanie się zgadzam” jest zmienną porządkową. Do porównań takich odpowiedzi naturalnym wyborem są testy rangowe. Inaczej jest z sumą lub średnią kilku pozycji tworzących skalę. Taki wynik ma więcej możliwych wartości i zwykle traktuje się go jak zmienną ilościową, pod warunkiem że skala jest rzetelna. Sprawdzenie rzetelności opisuje tekst o alfie Cronbacha.
W metodologii pracy warto jednym zdaniem uzasadnić przyjęte podejście, np.:
Przykład w R
Poniższe polecenia odpowiadają trzem przykładom z tekstu. Zakładamy ramkę danych dane z odpowiednimi kolumnami.
Trzy hipotezy, trzy testy
R
# Zarządzanie: 2 grupy niezależne, wynik ilościowy (domyślnie test Welcha)
t.test(satysfakcja ~ tryb_pracy, data = dane)
wilcox.test(satysfakcja ~ tryb_pracy, data = dane) # alternatywa rangowa
# Pedagogika: 2 pomiary tych samych uczniów
t.test(dane$wynik_po, dane$wynik_przed, paired = TRUE)
wilcox.test(dane$wynik_po, dane$wynik_przed, paired = TRUE)
# Logistyka: dwie zmienne nominalne
tabela <- table(dane$forma_dostawy, dane$wielkosc_miejscowosci)
chisq.test(tabela)
chisq.test(tabela)$expected # kontrola liczebności oczekiwanych
fisher.test(tabela) # gdy liczebności oczekiwane są zbyt małeBibliografia oprogramowania
W przykładach użyto wyłącznie funkcji z podstawowej instalacji R (pakiet stats). Kod sprawdzono w R 4.5.3 na danych symulowanych.
- R: R Core Team. (2026). R: A language and environment for statistical computing (Version 4.5.3) [Computer software]. R Foundation for Statistical Computing. https://www.R-project.org/
Sam wynik testu to nie wszystko. W raporcie warto podać także wielkość efektu, np. d Cohena, r lub V Craméra, oraz przedział ufności.
Najczęstsze błędy przy doborze testu
- Wybór testu po obejrzeniu wyników. Jeśli najpierw liczy się kilka testów, a potem raportuje ten „istotny”, wartość p traci znaczenie. Plan analizy powinien powstać przed zebraniem danych.
- Wiele testów t zamiast ANOVA. Porównanie trzech grup trzema testami t bez korekty zwiększa ryzyko fałszywie pozytywnego wyniku. Przy wielu porównaniach potrzebna jest korekta (np. Holma).
- Traktowanie pomiarów zależnych jak niezależnych. Typowe przy ankietach „przed i po” bez identyfikatora respondenta. Bez możliwości połączenia odpowiedzi tej samej osoby nie da się przeprowadzić analizy dla prób zależnych.
- Korelacja jako dowód przyczynowości. Współczynnik korelacji opisuje współzmienność. Wnioski przyczynowe wymagają odpowiedniego projektu badania, o czym więcej w tekście o pytaniach badawczych i hipotezach.
- Interpretacja braku istotności jako braku różnicy. Wynik nieistotny przy małej próbie często oznacza po prostu zbyt małą moc testu. Pomaga zaplanowanie liczebności próby przed badaniem.
- Raportowanie samej wartości p. Bez kierunku, wielkości efektu i opisu grup czytelnik nie wie, czy różnica ma znaczenie praktyczne (Wasserstein i Lazar, 2016). Więcej o tym w tekście o interpretacji wartości p.
Checklista przed analizą
- Każda hipoteza ma wskazaną zmienną zależną i niezależną.
- Dla każdej zmiennej jest opisany sposób pomiaru i skala.
- Wiadomo, czy grupy lub pomiary są niezależne, czy zależne.
- Do każdej hipotezy przypisano jeden test podstawowy i ewentualną alternatywę, zanim obejrzano wyniki.
- Zaplanowano korektę przy wielu porównaniach.
- Zaplanowano miary wielkości efektu i sposób raportowania (np. według wytycznych APA).
Najczęstsze pytania
Czy w pracy licencjackiej trzeba sprawdzać normalność rozkładu?
Warto opisać rozkład zmiennych (statystyki opisowe, wykres), ale wybór testu nie powinien zależeć wyłącznie od wyniku testu normalności. Przy większych grupach test t jest odporny na umiarkowane odchylenia, a przy małych i skośnych danych bezpieczniejsza jest alternatywa rangowa.
Co zrobić, gdy promotor wymaga testów nieparametrycznych?
Można je zastosować. Trzeba wtedy pamiętać, że testy rangowe odpowiadają na nieco inne pytanie niż porównanie średnich, a hipotezy i opis wyników powinny być do tego dopasowane.
Czy jedna hipoteza może być sprawdzana kilkoma testami?
Tak, jeśli jeden test jest główny, a pozostałe pełnią rolę analizy wrażliwości. Taki układ trzeba zaplanować i opisać w rozdziale metodologicznym, a nie dobierać testy po obejrzeniu wyników.
Pojęcia potrzebne do tego zagadnienia
Szerzej o doborze testów i ich założeniach piszą Bedyńska i Cypryańska (2012) oraz Field (2018).
Potrzebujesz pomocy w doborze testów i analizie danych?
Pomagam dopasować testy do hipotez, przygotować plan analizy, przeprowadzić obliczenia i opisać wyniki zgodnie z wymaganiami pracy dyplomowej lub publikacji.
Wyceń analizęOferta dla studentówBibliografia i dalsza literatura naukowa (APA 7)
- Bedyńska, S., & Cypryańska, M. (Red.). (2012). Statystyczny drogowskaz 1. Praktyczne wprowadzenie do wnioskowania statystycznego. Wydawnictwo Akademickie Sedno.
- Delacre, M., Lakens, D., & Leys, C. (2017). Why psychologists should by default use Welch’s t-test instead of Student’s t-test. International Review of Social Psychology, 30(1), 92–101. https://doi.org/10.5334/irsp.82
- Fagerland, M. W. (2012). t-tests, non-parametric tests, and large studies—a paradox of statistical practice? BMC Medical Research Methodology, 12, 78. https://doi.org/10.1186/1471-2288-12-78
- Field, A. (2018). Discovering statistics using IBM SPSS Statistics (5th ed.). SAGE.
- Stevens, S. S. (1946). On the theory of scales of measurement. Science, 103(2684), 677–680. https://doi.org/10.1126/science.103.2684.677
- Wasserstein, R. L., & Lazar, N. A. (2016). The ASA statement on p-values: Context, process, and purpose. The American Statistician, 70(2), 129–133. https://doi.org/10.1080/00031305.2016.1154108
Cytowania BibTeX
@book{bedynska2012drogowskaz, editor={Bedy{\'n}ska, Sylwia and Cypry{\'a}nska, Monika}, title={Statystyczny drogowskaz 1. Praktyczne wprowadzenie do wnioskowania statystycznego}, publisher={Wydawnictwo Akademickie Sedno}, year={2012}}@article{delacre2017welch, author={Delacre, Marie and Lakens, Dani{\"e}l and Leys, Christophe}, title={Why psychologists should by default use Welch's t-test instead of Student's t-test}, journal={International Review of Social Psychology}, year={2017}, volume={30}, number={1}, pages={92--101}, doi={10.5334/irsp.82}}@article{fagerland2012ttests, author={Fagerland, Morten W.}, title={t-tests, non-parametric tests, and large studies---a paradox of statistical practice?}, journal={BMC Medical Research Methodology}, year={2012}, volume={12}, pages={78}, doi={10.1186/1471-2288-12-78}}@book{field2018discovering, author={Field, Andy}, title={Discovering Statistics Using IBM SPSS Statistics}, edition={5}, publisher={SAGE}, year={2018}}@article{stevens1946scales, author={Stevens, S. S.}, title={On the theory of scales of measurement}, journal={Science}, year={1946}, volume={103}, number={2684}, pages={677--680}, doi={10.1126/science.103.2684.677}}@article{wasserstein2016asa, author={Wasserstein, Ronald L. and Lazar, Nicole A.}, title={The ASA statement on p-values: Context, process, and purpose}, journal={The American Statistician}, year={2016}, volume={70}, number={2}, pages={129--133}, doi={10.1080/00031305.2016.1154108}}