Statystyka · Psychologia

Statystyka dla psychologów

Statystyka pozwala psychologii mierzyć to, czego nie widać, i oddzielać efekty od przypadku. Ma też wyraźne granice. Oto przewagi i ograniczenia statystyki w psychologii na podstawie klasycznych i współczesnych publikacji metodologicznych.

Strona główna / Blog / Statystyka dla psychologów
W skrócie: statystyka pozwala psychologowi oszacować wielkość efektu i niepewność, łączyć wyniki wielu badań, kontrolować alternatywne wyjaśnienia i budować lepsze narzędzia pomiaru. Ma jednak wyraźne granice. Wyniki grupowe nie opisują wprost pojedynczej osoby, a istotność statystyczna nie mówi o ważności wyniku. Mechaniczne stosowanie testów, małe próby, stronniczość publikacji i ignorowanie założeń prowadzą do fałszywych wniosków. Ten tekst zbiera argumenty po obu stronach na podstawie klasycznych i współczesnych publikacji.

Czym jest statystyka dla psychologa?

Psychologia bada zjawiska, których nie da się zobaczyć bezpośrednio: lęk, inteligencję, motywację, postawy. Obserwujemy tylko odpowiedzi na pytania, zachowania i wyniki testów, a te zawsze zawierają błąd i różnią się między ludźmi. Statystyka jest zestawem narzędzi do wyciągania wniosków z takich niepewnych, zmiennych danych. Obejmuje opis wyników, wnioskowanie o populacji na podstawie próby, modelowanie zależności i ocenę jakości pomiaru.

Już w 1960 roku Jum Nunnally pisał, że rosnąca rola statystyki jest dla psychologii zdrowym objawem. Dzięki niej dyscyplina stoi na pewniejszym gruncie niż w czasach „przedstatystycznych”. W tym samym artykule ostrzegał jednak, że niektóre nawyki, zwłaszcza bezrefleksyjne testowanie hipotezy zerowej, szkodzą badaniom (Nunnally, 1960). To napięcie między ogromną użytecznością a łatwością nadużyć przewija się przez całą historię statystyki w psychologii.

Ten tekst dotyczy więc przewag i ograniczeń statystyki jako narzędzia poznania. O tym, jak statystyka wpływa na konkretne decyzje w diagnozie i terapii, piszę w artykule Po co statystyka jest potrzebna psychologowi?

Jakie przewagi daje psychologowi statystyka?

Przewagi, jakie statystyka daje psychologii, z przykładami z literatury
Co daje statystykaNa czym to polegaŹródło
Oszacowanie wielkości efektu i niepewnościZamiast „jest różnica / nie ma różnicy” — ile wynosi efekt i jak precyzyjnie go znamyNunnally (1960); Wilkinson i in. (1999)
Kumulowanie wiedzyMetaanaliza łączy wiele małych badań i oddziela błąd losowy od rzeczywistych różnicSchmidt (1996); Carter i in. (2019)
Kontrola alternatywnych wyjaśnieńLosowy przydział, zmienne kontrolne, przegląd danych przed analiząWilkinson i in. (1999)
Odkrywanie podgrupAnaliza skupień wyodrębnia typy pacjentów lub odbiorców interwencjiClatworthy i in. (2005)
Lepszy pomiarModele probabilistyczne pozwalają porównywać osoby niezależnie od zestawu zadańRasch (1961)
Odporność na „trudne” daneŚrednie przycięte, bootstrap, ML i wielokrotna imputacja braków danychField i Wilcox (2017); Jeličić i in. (2009)

1. Odpowiada na pytanie „jak duży jest efekt?”, a nie tylko „czy jest”

Najcenniejsza funkcja statystyki to szacowanie. Nunnally (1960) zauważał, że w praktyce badacza interesuje, jak duże są różnice i korelacje, a nie sam fakt, że różnią się od zera. Przedział ufności pokazuje dodatkowo, jak bardzo można ufać oszacowaniu i ile osób trzeba dobadać, by zwiększyć precyzję. Zespół zadaniowy APA zalecił, by zawsze raportować wielkość efektu dla głównych wyników wraz z przedziałem ufności, a przedział ufności przedkładać nad samą decyzję „istotne / nieistotne” (Wilkinson i in., 1999). Szerzej opisuję to w tekście o interpretacji wielkości efektu.

2. Pozwala kumulować wiedzę z wielu badań

Pojedyncze badanie psychologiczne jest zwykle małe i obarczone dużym błędem losowym. Metaanaliza łączy wiele takich badań, oddziela błąd próbkowania od rzeczywistych różnic między badaniami i daje znacznie precyzyjniejszy wynik. Schmidt (1996) pokazał to na danych o trafności testu: z 21 próbek po 68 osób tylko 8 dało wynik istotny, co sugerowało „sprzeczną” literaturę. Metaanaliza tych samych danych odtworzyła prawdziwą korelację 0,22 i wykazała, że całe zróżnicowanie wyników wynikało z błędu losowego. Metaanaliza umożliwia też testowanie moderatorów i planowanie kolejnych badań (Carter i in., 2019). Praktyczny przewodnik znajdziesz w poradniku jak wykonać metaanalizę.

3. Chroni przed alternatywnymi wyjaśnieniami i błędami w danych

Losowy przydział do grup to narzędzie statystyczne, które daje najsilniejsze podstawy do wniosków przyczynowych. Gdy losowanie jest niemożliwe, statystyka pozwala mierzyć i kontrolować zmienne zakłócające (Wilkinson i in., 1999). Równie ważne jest przejrzenie danych przed analizą. W przykładzie z raportu APA wykres rozrzutu danych o około 3000 klientów poradni ujawnił wiek zakodowany jako 99 (kod braku danych) i osoby, które były w związku dłużej, niż żyją. Model statystyczny policzyłby takie dane bez ostrzeżenia.

4. Pomaga odkrywać typy i podgrupy

Psychologia operuje zarówno prawami ogólnymi, jak i opisem konkretnych osób. Analiza skupień łączy te perspektywy, grupując ludzi o podobnym profilu. W psychologii zdrowia pozwala wyodrębnić grupy pacjentów o różnym podejściu do leczenia, wskazać grupy podwyższonego ryzyka i lepiej dopasować interwencje (Clatworthy i in., 2005).

5. Umożliwia lepszy pomiar

Statystyka to nie tylko testy różnic, ale też teoria pomiaru. Georg Rasch (1961) odpowiadał na zarzut, że metody psychometryczne są „grupowe” i nie mówią nic o jednostce. Zaproponował modele, w których porównanie dwóch osób nie zależy od tego, jakie zadania rozwiązywały, a porównanie dwóch zadań — od tego, kto je rozwiązywał. To podstawa współczesnej teorii odpowiedzi na pozycje testowe (IRT), która pozwala oceniać precyzję pomiaru każdej osoby z osobna.

6. Daje narzędzia na „trudne” dane

Dane psychologiczne bywają skośne, mają wartości odstające i braki. Współczesna statystyka ma na to gotowe rozwiązania: średnie przycięte, estymatory M, bootstrap, odporne błędy standardowe oraz metody braków danych, takie jak metoda największej wiarygodności i wielokrotna imputacja (Field i Wilcox, 2017; Jeličić i in., 2009). Field i Wilcox (2017) podkreślają, że takie metody mogą znacząco zwiększyć moc i dać pełniejszy obraz danych, a ich użycie w R często wymaga zmiany jednej funkcji.

7. Nie wymaga perfekcyjnych danych, by być użyteczna

Często słyszy się, że dane porządkowe, np. z kwestionariuszy, „wymagają” testów nieparametrycznych. Zumbo i Zimmerman (1993) sprawdzili to w symulacji z 5000 powtórzeń na każdy warunek. Test t na danych porządkowych zachowywał moc i poziom błędu bardzo zbliżone do wartości dla prawdziwej, ilościowej cechy. Wniosek autorów: o wyborze testu powinien decydować przede wszystkim kształt rozkładu, a nie sama skala pomiaru. Praktyczne zasady doboru testu opisuje poradnik jak dobrać test statystyczny do hipotezy.

Jakie ograniczenia ma statystyka w psychologii?

Ograniczenia i typowe nadużycia statystyki w psychologii
OgraniczeniePrzykład z literaturyCo robić
Wnioski o jednostce z danych grupowychŚrednia grupy nie opisuje procesów psychicznych pojedynczej osoby (Bakan, 1996)Rozdziel wnioski grupowe i indywidualne; stosuj metody dla zmiany indywidualnej
Istotność mylona z ważnościąPrzy N = 700 istotna jest już korelacja r = 0,08 (Nunnally, 1960)Raportuj wielkość efektu i przedział ufności
Zbyt mała mocPrzy mocy 0,37 aż 63% badań nie wykryje prawdziwego efektu (Schmidt, 1996)Planuj liczebność próby przed badaniem
Stronniczość publikacji i p-hacking97% oryginalnych badań istotnych, 36% replikacji (za: Stevens, 2017)Prerejestracja, raport rejestrowany, otwarte dane
Niespełnione założeniaTylko 6,8% z 440 rozkładów było zbliżonych do normalnego (Field i Wilcox, 2017)Analiza wrażliwości z metodą odporną
Braki danych82% badań podłużnych usuwało przypadki z brakami (Jeličić i in., 2009)ML/FIML lub wielokrotna imputacja
Metody, które zawsze „coś” znajdąTylko 27% analiz skupień raportowano w pełni (Clatworthy i in., 2005)Walidacja na nowej próbie, pełny opis decyzji

1. Grupa to nie jednostka

Statystyka opisuje rozkłady w grupach: średnie, odchylenia, korelacje, odsetki. David Bakan (1996) zwracał uwagę, że psychologia powszechnie zakłada, iż z takich zagregowanych miar można odczytać procesy psychiczne pojedynczego człowieka. Jego zdaniem to założenie nie jest oczywiste ani dobrze uzasadnione i bywa przyjmowane bezkrytycznie. Wcześniej podobny zarzut przytaczał Rasch (1961), cytując badaczy, którzy domagali się „statystyki skoncentrowanej na jednostce”. W praktyce oznacza to, że efekt terapii w grupie nie mówi, czy pomogła ona konkretnemu pacjentowi.

2. Istotność statystyczna to nie ważność

Nunnally (1960) zauważył, że w rzeczywistości hipoteza zerowa prawie nigdy nie jest dokładnie prawdziwa. Przy wystarczająco dużej próbie zostanie więc odrzucona, a jej nieodrzucenie zwykle oznacza tylko zbyt małe N. W jego badaniu na 700 osobach istotna była już korelacja 0,08, a niemal wszystkie korelacje okazywały się istotne, także te bez sensu merytorycznego.

Schmidt (1996) opisał trzy rozpowszechnione błędne przekonania o wartości p:

  • że mówi, jak duża jest szansa na powtórzenie wyniku,
  • że mówi, jak duży lub ważny jest efekt,
  • że wynik nieistotny oznacza brak efektu. To przekonanie uznał za najbardziej szkodliwe.

W ankiecie przytaczanej przez Schmidta 60% badaczy i doktorantów błędnie uznało, że p = 0,01 oznacza 99% szans na replikację. Więcej o tym w tekście o interpretacji wartości p.

3. Mała moc i zawyżone efekty

W przykładzie Schmidta (1996) prawdziwy efekt wynosił d = 0,50, a grupy liczyły po 15 osób. Moc testu wynosiła wtedy tylko 0,37, więc 63% takich badań nie wykryłoby istniejącego efektu. Co gorsza, badania, którym „udało się” uzyskać istotność, pokazywały średnio efekt d = 0,89, czyli o 78% większy od prawdziwego. Nunnally (1960) opisywał to samo zjawisko jako „błąd małego N”: badacze zbierają tylko tylu uczestników, ilu potrzeba do osiągnięcia istotności, i zostają z nieprecyzyjnym oszacowaniem. Jak temu zapobiegać, opisuję w tekście o doborze liczebności próby.

4. Kryzys replikacji, p-hacking i stronniczość publikacji

W projekcie replikacyjnym obejmującym 100 badań psychologicznych 97% oryginalnych prac miało wyniki istotne, a w replikacjach — tylko 36%. Te dane przytacza Stevens (2017). Wśród przyczyn kryzysu replikacyjnego wymienia się błędne stosowanie testów istotności, p-hacking, efekt szuflady (niepublikowanie wyników nieistotnych) i małe próby. Stevens (2017) podkreśla też, że traktowanie analiz eksploracyjnych jak konfirmacyjnych jest statystycznie nieuprawnione.

Problem przenosi się na metaanalizy. W symulacji Cartera i in. (2019) przy silnej stronniczości publikacji i braku prawdziwego efektu standardowa metaanaliza wskazywała istotny efekt w co najmniej 98% przypadków, szacując go na około d = 0,33. Żadna z siedmiu metod korekty nie działała dobrze we wszystkich warunkach. Na przykładzie badań nad wyczerpaniem ego autorzy pokazali, że metaanaliza 116 opublikowanych badań dawała d = 0,43, a wielolaboratoryjna replikacja z wcześniejszą rejestracją — zaledwie 0,04. Wniosek: metaanaliza nie naprawi słabej literatury. Pomagają prerejestracja i raporty rejestrowane.

5. Założenia testów rzadko są spełnione

Test t, ANOVA i regresja wymagają m.in. liniowości, niezależności i jednorodności wariancji, a wnioskowanie opiera się na rozkładzie normalnym. Field i Wilcox (2017) przypominają przegląd 440 rozkładów z badań psychologicznych, w którym tylko 6,8% było zbliżonych do normalnego zarówno pod względem symetrii, jak i grubości ogonów. Wbrew popularnym regułom ani „N > 30”, ani równe grupy nie gwarantują poprawności testów. Już niewielki odsetek skrajnych wyników może drastycznie obniżyć moc testu, co pokazuje symulacja w R poniżej. Field i Wilcox odradzają też testowanie założeń testami istotności i usuwanie obserwacji „poza 2,5 SD”.

6. Braki danych traktowane jak niewidzialne

Jeličić i in. (2009) przeanalizowali 100 badań podłużnych z czołowych czasopism psychologii rozwojowej. Spośród 57 badań z brakami danych aż 47 (82%) po prostu usuwało niepełne przypadki. Tylko 7 stosowało metodę największej wiarygodności, a jedno poprawnie wielokrotną imputację. Tymczasem usuwanie przypadków może zniekształcać wyniki i obniża moc, a zalecane metody nie szkodzą nawet wtedy, gdy braków nie ma.

7. Metody, które zawsze coś znajdą

Niektóre techniki dają wynik zawsze, niezależnie od tego, czy w danych jest jakaś struktura. Analiza skupień zawsze wyodrębni grupy, nawet w jednorodnej próbie (Clatworthy i in., 2005). W przeglądzie 59 badań z psychologii zdrowia tylko 27% raportowało wszystkie kluczowe decyzje analityczne. Liczbę skupień często wybierano tak, by rozwiązanie było „najłatwiejsze do interpretacji”. Część autorów (17 badań z ANOVA i 10 z analizą dyskryminacyjną) testowała też różnice między skupieniami na tych samych zmiennych, na podstawie których je utworzono, co jest błędnym kołem.

8. Statystyka nie zastąpi myślenia

Wszystkie powyższe problemy mają wspólne źródło: mechaniczne stosowanie procedur. Raport APA ostrzega przed bezrefleksyjnym używaniem metod, zaleca analizy możliwie najprostsze, a nie najbardziej imponujące, oraz zrozumienie każdego wyniku z programu przed jego raportowaniem. Podsumowuje, że statystyka powinna kierować myśleniem badacza i je dyscyplinować, ale nie może go zastępować (Wilkinson i in., 1999). Nunnally (1960) pisał o „ucieczce w statystykę”, w której elegancja analizy zastępuje dobre pomysły.

Uwaga: ograniczenia statystyki nie są argumentem za jej odrzuceniem. Prawie każda opisana tu krytyka pochodzi od statystyków i metodologów, a rozwiązaniem jest zwykle lepsza statystyka: wielkości efektu, przedziały ufności, analiza mocy, metody odporne i otwarta nauka.
Przykład reprodukowalny

Symulacja w R: kilka skrajnych wyników a moc testu t

Skrypt naśladuje przykład z artykułu Fielda i Wilcoxa (2017). Porównuje dwie grupy po 25 osób, między którymi prawdziwa różnica wynosi 1 SD. W drugim scenariuszu 10% wyników pochodzi z rozkładu o odchyleniu standardowym 10, co odpowiada sytuacji z kilkoma skrajnymi odpowiedziami. Dla każdego scenariusza wykonujemy 2000 symulowanych badań i liczymy, jak często test wykrył różnicę.

Skrypt R

Dane wejściowe: brak; dane są generowane w skrypcie (ziarno losowania 1999). Potrzebny jest pakiet WRS2.

Co odczytać: odsetek wykrytych różnic (moc) w kolumnach t i yuen dla danych normalnych i „zanieczyszczonych”.

R
# Statystyka dla psychologów: test t a metoda odporna przy "zanieczyszczonych" danych
# Symulacja w duchu przykładu z Field i Wilcox (2017): dwie grupy po 25 osób,
# prawdziwa różnica średnich = 1 SD; w wersji zanieczyszczonej 10% wyników ma SD = 10.
library(WRS2)
set.seed(1999)

losuj <- function(n, srednia, zanieczyszczenie) {
  x  <- rnorm(n, srednia, 1)
  ile <- rbinom(1, n, zanieczyszczenie)
  if (ile > 0) x[sample(n, ile)] <- rnorm(ile, srednia, 10)
  x
}

moc <- function(zanieczyszczenie, powtorzenia = 2000) {
  wyniki <- replicate(powtorzenia, {
    dane <- data.frame(grupa = rep(c("A", "B"), each = 25),
                       wynik = c(losuj(25, 0, zanieczyszczenie),
                                 losuj(25, 1, zanieczyszczenie)))
    c(t    = t.test(wynik ~ grupa, data = dane)$p.value < .05,
      yuen = yuen(wynik ~ grupa, data = dane, tr = 0.2)$p.value < .05)
  })
  round(rowMeans(wyniki), 2)
}

rbind(dane_normalne      = moc(0),
      dane_zanieczyszczone = moc(0.10))

Bibliografia oprogramowania

Skrypt uruchomiono w R 4.5.3 z pakietem WRS2; wyniki w tabeli poniżej pochodzą z tego uruchomienia.

  1. R: R Core Team. (2026). R: A language and environment for statistical computing (Version 4.5.3) [Computer software]. R Foundation for Statistical Computing. https://www.R-project.org/
  2. WRS2: Mair, P., & Wilcox, R. (2020). Robust statistical methods in R using the WRS2 package. Behavior Research Methods, 52(2), 464–488. https://doi.org/10.3758/s13428-019-01246-w
Wyniki symulacji: odsetek wykrytych efektów (moc) dla testu t i testu Yuena
DaneTest t StudentaTest Yuena (średnie przycięte 20%)
rozkład normalny0,940,90
10% wyników zanieczyszczonych (SD = 10)0,270,81

Przy danych normalnych oba testy wykrywają efekt podobnie często. Wystarczy jednak 10% skrajnych wyników, by moc testu t spadła z 0,94 do 0,27, choć różnica między grupami pozostała taka sama. Odporny test Yuena zachowuje moc 0,81. To liczby z tej konkretnej symulacji. Field i Wilcox (2017) opisują bardzo podobny spadek: z 0,90 do 0,28. Dlatego autorzy zalecają, by przy każdej analizie klasycznej wykonać analizę wrażliwości z metodą odporną.

Jak mądrze korzystać ze statystyki w psychologii?

Z przeglądanych publikacji wyłania się zestaw praktycznych zasad:

  1. Raportuj wielkość efektu i przedział ufności dla każdego głównego wyniku, a wartość p podawaj dokładnie (Wilkinson i in., 1999; Schmidt, 1996).
  2. Planuj liczebność próby na podstawie realistycznego efektu z wcześniejszych badań, a nie „ile się da zebrać” (Wilkinson i in., 1999).
  3. Rozdziel analizy konfirmacyjne od eksploracyjnych i rozważ prerejestrację (Stevens, 2017; Carter i in., 2019).
  4. Obejrzyj dane przed analizą: wykresy rozkładów, wartości odstające, kody braków danych (Wilkinson i in., 1999).
  5. Nie zakładaj, że założenia są spełnione. Porównaj analizę klasyczną z odporną i opisz ewentualne różnice (Field i Wilcox, 2017).
  6. Stosuj nowoczesne metody braków danych zamiast usuwania przypadków (Jeličić i in., 2009).
  7. Opisuj wszystkie decyzje analityczne, zwłaszcza w metodach, które dają wynik zawsze, jak analiza skupień (Clatworthy i in., 2005).
  8. Odróżniaj wnioski o grupie od wniosków o osobie (Bakan, 1996).
  9. Traktuj pojedyncze badanie jako element większej całości i porównuj wyniki z wcześniejszymi badaniami (Wilkinson i in., 1999; Schmidt, 1996).

Wzór opisu wyniku zgodny z tymi zasadami

Grupa [A] (M = [ ], SD = [ ], n = [ ]) uzyskała wyższe wyniki niż grupa [B] (M = [ ], SD = [ ], n = [ ]); różnica wyniosła [ ] pkt, 95% CI [ ; ], d = [ ], 95% CI [ ; ], t([df]) = [ ], p = [ ]. Ze względu na [skośność / wartości odstające] wykonano analizę wrażliwości testem Yuena dla średnich przyciętych 20%, która [potwierdziła / nie potwierdziła] wynik: [statystyka, p]. Braki danych ([ ]%) uwzględniono metodą [FIML / wielokrotnej imputacji]. Liczebność próby zaplanowano dla efektu d = [ ] przy mocy [ ].

Szczegółowe zasady raportowania opisuje tekst o wytycznych APA dla metodologii i statystyki.

Jak uczyć się statystyki jako psycholog?

Schmidt (1996) uważał, że problemy psychologii z testowaniem istotności biorą się w dużej mierze z nauczania: kursy statystyki uczą procedur testowania, a za mało estymacji, przedziałów ufności i metaanalizy. Już w 1973 roku Zeller, recenzując podręcznik McCalla, wskazywał dwa warunki dobrego wprowadzenia do statystyki: precyzyjne definicje oraz taki sposób wykładu, by początkujący poradził sobie z materiałem, a najlepiej go polubił.

W praktyce warto uczyć się w tej kolejności:

  • rozumienie danych: rozkłady, wykresy, statystyki opisowe;
  • pomiar: rzetelność, trafność, błąd pomiaru;
  • szacowanie: wielkość efektu, przedziały ufności, moc;
  • modele: regresja, ANOVA, modele wielopoziomowe;
  • metody odporne, braki danych, metaanaliza i otwarta nauka.

Na początek polecam tekst o statystyce dla studentów i wprowadzenie do metod statystycznych.

Najczęstsze pytania

Czy psycholog musi znać statystykę?

Tak, choć nie w stopniu matematyka. Psycholog korzysta ze statystyki przy interpretacji testów, ocenie skuteczności terapii i czytaniu badań. Potrzebuje rozumieć wielkość efektu, przedział ufności, błąd pomiaru i ograniczenia wartości p, aby nie wyciągać z liczb wniosków, których one nie uzasadniają.

Dlaczego statystyka w psychologii bywa krytykowana?

Krytyka dotyczy głównie sposobu jej używania: mechanicznego testowania istotności, małych prób, raportowania tylko wyników istotnych, ignorowania braków danych i założeń oraz przenoszenia wniosków z grupy na pojedynczą osobę. Same metody statystyczne są w tych sporach raczej rozwiązaniem niż problemem.

Czy wartość p mówi, jak ważny jest wynik?

Nie. Wartość p zależy w dużym stopniu od liczebności próby. Przy kilkuset osobach nawet bardzo słaby związek bywa istotny, a przy małej próbie ważny efekt może być nieistotny. O znaczeniu wyniku mówią wielkość efektu, jej przedział ufności i kontekst merytoryczny.

Czy na danych z kwestionariuszy wolno stosować testy parametryczne?

Często tak. Badania symulacyjne pokazują, że sama porządkowa natura pomiaru nie przekreśla testów parametrycznych; większe znaczenie mają kształt rozkładu, wartości odstające i nierówne wariancje. Gdy te problemy występują, warto sięgnąć po metody odporne i porównać wyniki.

Liczby z symulacji w R pochodzą z jednego uruchomienia skryptu i będą się nieco różnić przy innym ziarnie losowania.

Potrzebujesz analizy danych z badania psychologicznego?

Pomagam zaplanować badanie i liczebność próby, przeprowadzić analizy z wielkościami efektu, metodami odpornymi i poprawnym ujęciem braków danych oraz opisać wyniki zgodnie ze standardem APA w pracy dyplomowej lub artykule.

Wyceń analizęOferta dla badaczy

Bibliografia i dalsza literatura naukowa (APA 7)

  1. Bakan, D. (1996). The crisis in psychology. Journal of Social Distress and the Homeless, 5(4), 335–342. https://doi.org/10.1007/BF02092909
  2. Carter, E. C., Schönbrodt, F. D., Gervais, W. M., & Hilgard, J. (2019). Correcting for bias in psychology: A comparison of meta-analytic methods. Advances in Methods and Practices in Psychological Science, 2(2), 115–144. https://doi.org/10.1177/2515245919847196
  3. Clatworthy, J., Buick, D., Hankins, M., Weinman, J., & Horne, R. (2005). The use and reporting of cluster analysis in health psychology: A review. British Journal of Health Psychology, 10(3), 329–358. https://doi.org/10.1348/135910705X25697
  4. Field, A. P., & Wilcox, R. R. (2017). Robust statistical methods: A primer for clinical psychology and experimental psychopathology researchers. Behaviour Research and Therapy, 98, 19–38. https://doi.org/10.1016/j.brat.2017.05.013
  5. Jeličić, H., Phelps, E., & Lerner, R. M. (2009). Use of missing data methods in longitudinal studies: The persistence of bad practices in developmental psychology. Developmental Psychology, 45(4), 1195–1199. https://doi.org/10.1037/a0015665
  6. Nunnally, J. (1960). The place of statistics in psychology. Educational and Psychological Measurement, 20(4), 641–650. https://doi.org/10.1177/001316446002000401
  7. Rasch, G. (1961). On general laws and the meaning of measurement in psychology. W J. Neyman (Red.), Proceedings of the Fourth Berkeley Symposium on Mathematical Statistics and Probability: Vol. 4. Contributions to biology and problems of medicine (s. 321–333). University of California Press.
  8. Schmidt, F. L. (1996). Statistical significance testing and cumulative knowledge in psychology: Implications for training of researchers. Psychological Methods, 1(2), 115–129. https://doi.org/10.1037/1082-989X.1.2.115
  9. Stevens, J. R. (2017). Replicability and reproducibility in comparative psychology. Frontiers in Psychology, 8, Artykuł 862. https://doi.org/10.3389/fpsyg.2017.00862
  10. Wilkinson, L., & Task Force on Statistical Inference. (1999). Statistical methods in psychology journals: Guidelines and explanations. American Psychologist, 54(8), 594–604. https://doi.org/10.1037/0003-066X.54.8.594
  11. Zeller, R. A. (1973). [Recenzja książki Fundamental statistics for psychology, R. B. McCall]. Contemporary Sociology, 2(2), 171. https://doi.org/10.2307/2063714
  12. Zumbo, B. D., & Zimmerman, D. W. (1993). Is the selection of statistical methods governed by level of measurement? Canadian Psychology, 34(4), 390–400. https://doi.org/10.1037/h0078865

Cytowania BibTeX

@article{bakan1996crisis, author={Bakan, David}, title={The crisis in psychology}, journal={Journal of Social Distress and the Homeless}, year={1996}, volume={5}, number={4}, pages={335--342}, doi={10.1007/BF02092909}}
@article{carter2019correcting, author={Carter, Evan C. and Sch{\"o}nbrodt, Felix D. and Gervais, Will M. and Hilgard, Joseph}, title={Correcting for bias in psychology: A comparison of meta-analytic methods}, journal={Advances in Methods and Practices in Psychological Science}, year={2019}, volume={2}, number={2}, pages={115--144}, doi={10.1177/2515245919847196}}
@article{clatworthy2005use, author={Clatworthy, Jane and Buick, Deanna and Hankins, Matthew and Weinman, John and Horne, Robert}, title={The use and reporting of cluster analysis in health psychology: A review}, journal={British Journal of Health Psychology}, year={2005}, volume={10}, number={3}, pages={329--358}, doi={10.1348/135910705X25697}}
@article{field2017robust, author={Field, Andy P. and Wilcox, Rand R.}, title={Robust statistical methods: A primer for clinical psychology and experimental psychopathology researchers}, journal={Behaviour Research and Therapy}, year={2017}, volume={98}, pages={19--38}, doi={10.1016/j.brat.2017.05.013}}
@article{jelicic2009use, author={Jeli{\v{c}}i{\'c}, Helena and Phelps, Erin and Lerner, Richard M.}, title={Use of missing data methods in longitudinal studies: The persistence of bad practices in developmental psychology}, journal={Developmental Psychology}, year={2009}, volume={45}, number={4}, pages={1195--1199}, doi={10.1037/a0015665}}
@article{nunnally1960place, author={Nunnally, Jum}, title={The place of statistics in psychology}, journal={Educational and Psychological Measurement}, year={1960}, volume={20}, number={4}, pages={641--650}, doi={10.1177/001316446002000401}}
@inproceedings{rasch1961general, author={Rasch, Georg}, title={On general laws and the meaning of measurement in psychology}, booktitle={Proceedings of the Fourth Berkeley Symposium on Mathematical Statistics and Probability}, volume={4}, editor={Neyman, Jerzy}, pages={321--333}, publisher={University of California Press}, year={1961}}
@article{schmidt1996statistical, author={Schmidt, Frank L.}, title={Statistical significance testing and cumulative knowledge in psychology: Implications for training of researchers}, journal={Psychological Methods}, year={1996}, volume={1}, number={2}, pages={115--129}, doi={10.1037/1082-989X.1.2.115}}
@article{stevens2017replicability, author={Stevens, Jeffrey R.}, title={Replicability and reproducibility in comparative psychology}, journal={Frontiers in Psychology}, year={2017}, volume={8}, pages={862}, doi={10.3389/fpsyg.2017.00862}}
@article{wilkinson1999statistical, author={Wilkinson, Leland and {Task Force on Statistical Inference}}, title={Statistical methods in psychology journals: Guidelines and explanations}, journal={American Psychologist}, year={1999}, volume={54}, number={8}, pages={594--604}, doi={10.1037/0003-066X.54.8.594}}
@article{zeller1973review, author={Zeller, Richard A.}, title={Review of Fundamental Statistics for Psychology, by R. B. McCall}, journal={Contemporary Sociology}, year={1973}, volume={2}, number={2}, pages={171}, doi={10.2307/2063714}}
@article{zumbo1993selection, author={Zumbo, Bruno D. and Zimmerman, Donald W.}, title={Is the selection of statistical methods governed by level of measurement?}, journal={Canadian Psychology}, year={1993}, volume={34}, number={4}, pages={390--400}, doi={10.1037/h0078865}}
R