Słownik metodologiczny · Dobór próby

Populacja – co to jest? Populacja w statystyce i badaniach naukowych

Populacja to wszyscy, o których chcemy wnioskować na podstawie badania. Zobacz, czym różni się od próby, czym są parametry i statystyki, jak zdefiniować populację w pracy i co pokazuje symulacja w R dla populacji skończonej.

W skrócie: populacja to cały zbiór jednostek, o których chcemy wnioskować — np. wszyscy studenci psychologii w Polsce. Ponieważ zwykle nie da się zbadać wszystkich, badamy próbę, a jej wyniki (statystyki) traktujemy jako oszacowania wartości w populacji (parametrów). Dobra definicja populacji określa, kto, gdzie i kiedy do niej należy.

Populacja — co to jest?

W statystyce i metodologii badań populacja (populacja generalna, zbiorowość generalna) to pełny zbiór jednostek, o których chcemy wyciągnąć wnioski. Jednostkami mogą być osoby, ale też klasy szkolne, szpitale, firmy, teksty czy pojedyncze pomiary. Populację wyznaczają kryteria przynależności, np.:

  • dorośli mieszkańcy Polski w 2026 roku;
  • studenci psychologii Uniwersytetu X w roku akademickim 2026/2027;
  • pacjenci po udarze leczeni w szpitalach województwa Y w 2025 roku;
  • wszystkie lekcje matematyki prowadzone w szkołach podstawowych danej gminy w semestrze.

Badanie całej populacji to badanie pełne (spis). Najczęściej jest to niemożliwe lub zbyt kosztowne, dlatego bada się próbę i na jej podstawie szacuje wartości dla populacji. O tym, czy takie wnioskowanie jest uprawnione, decyduje reprezentatywność próby.

Populacja docelowa, dostępna i próba

W praktyce warto odróżniać trzy poziomy:

Populacja docelowa, dostępna i próba na przykładzie badania stresu studentów
PoziomCo to jestPrzykład
Populacja docelowaWszystkie jednostki, na które chcemy uogólnić wnioskiStudenci psychologii w Polsce w roku akademickim 2026/2027
Populacja dostępna (operat)Ta część populacji, do której mamy dostęp i z której losujemyStudenci psychologii trzech uczelni, które udostępniły listy
PróbaOsoby faktycznie zbadane300 studentów wylosowanych z list, z których 240 wypełniło kwestionariusz

Różnica między populacją docelową a dostępną to błąd pokrycia. Jeśli listy udostępniły tylko uczelnie z dużych miast, wyniki dotyczą przede wszystkim studentów z dużych miast, a uogólnienie na całą Polskę wymaga dodatkowego uzasadnienia. Shadish, Cook i Campbell (2002) wiążą ten problem z trafnością zewnętrzną: na ile wyniki można przenieść na inne osoby, miejsca i czasy.

Parametr a statystyka

Liczby opisujące populację to parametry. Liczby policzone w próbie to statystyki, które służą jako oszacowania parametrów (estymacja punktowa). Zwyczajowo parametry oznacza się literami greckimi, a statystyki — łacińskimi:

Parametry populacji i odpowiadające im statystyki z próby
WielkośćParametr populacjiStatystyka z próby (oszacowanie)
LiczebnośćNn
Średniaμ (mi)M lub x̄
Odchylenie standardoweσ (sigma)SD lub s
Proporcja (odsetek)π lub Pp
Korelacjaρ (ro)r
Współczynnik regresjiβb

Statystyka z próby niemal nigdy nie jest dokładnie równa parametrowi. Różnicę między nimi nazywa się błędem próby, a jego wielkość opisuje przedział ufności.

Populacja skończona i nieskończona

Populacja skończona ma określoną liczbę jednostek N, np. 2000 studentów jednej uczelni. Populacja nieskończona lub hipotetyczna to np. wszystkie możliwe powtórzenia eksperymentu albo przyszli pacjenci, którzy otrzymają daną terapię. W eksperymentach psychologicznych wnioskujemy zwykle o takiej właśnie populacji hipotetycznej.

Przy populacji skończonej, gdy próba stanowi jej znaczną część, błąd standardowy średniej jest mniejszy, niż wynika z podstawowego wzoru. Uwzględnia to poprawka na skończoną populację (Cochran, 1977; Kish, 1965; Lohr, 2021):

SE(x̄) = (S / √n) · √(1 − n/N)

Sprawdziłem to w R na populacji N = 2000 studentów z wynikiem skali stresu (μ = 17,99, S = 5,88), losując po 10 000 prób bez zwracania:

Błąd standardowy średniej w populacji skończonej (N = 2000; 10 000 prób dla każdej liczebności)
Liczebność próby nUłamek populacji n/NŚrednia ze średnichRzeczywisty błąd standardowyWzór bez poprawkiWzór z poprawką (FPC)
1005%17,990,5770,5880,573
50025%17,990,2290,2630,228

Przy próbie stanowiącej 5% populacji poprawka zmienia niewiele. Gdy próba to 25% populacji, wzór bez poprawki zawyża błąd standardowy (0,263 zamiast rzeczywistych 0,229), a wzór z poprawką trafia niemal dokładnie (0,228). Średnia ze średnich jest w obu przypadkach praktycznie równa μ, bo losowanie daje oszacowania nieobciążone.

Przykładowa pojedyncza próba 100 studentów dała średnią M = 18,02 (SD = 6,39) i 95% przedział ufności [16,78; 19,26], który obejmuje prawdziwy parametr μ = 17,99.

Jak zdefiniować populację w pracy badawczej?

Dobra definicja populacji odpowiada na pytania:

  1. Kto? Kryteria włączenia (np. wiek 18–25 lat, diagnoza, kierunek studiów) i wyłączenia (np. przyjmowanie określonych leków).
  2. Gdzie? Zasięg geograficzny lub instytucjonalny.
  3. Kiedy? Okres, którego dotyczy badanie.
  4. Jaka jest jednostka analizy? Osoba, para, klasa, szkoła, pomiar.
Populację docelową stanowili [kto: kryteria włączenia i wyłączenia] [gdzie] w [kiedy]. Dostęp do populacji zapewniły [operat / instytucje / kanały rekrutacji], co oznacza, że [opis ewentualnych grup pominiętych]. Jednostką analizy była [osoba / klasa / pomiar]. Wnioski odnoszą się do [populacja], z zastrzeżeniem [ograniczenia uogólniania].

Wytyczne APA dotyczące raportowania badań ilościowych wymagają opisu kryteriów włączenia, sposobu doboru i charakterystyki uczestników (Appelbaum i in., 2018). Jak przedstawić charakterystykę zbadanej grupy, pokazuje poradnik jak opisać charakterystykę próby.

Populacja w badaniach psychologicznych

W psychologii populacja docelowa bywa szersza niż ta, z której faktycznie pochodzą badani. Wiele badań prowadzi się na studentach, a wnioski formułuje się o „ludziach”. Henrich i in. (2010) pokazali, że osoby z zachodnich, wykształconych i zamożnych społeczeństw odbiegają od reszty świata w wielu zadaniach, od percepcji po decyzje moralne. Dlatego w pracy warto jasno napisać, jakiej populacji dotyczą wyniki, i nie rozciągać wniosków poza nią bez uzasadnienia.

Przykład reprodukowalny

Przykład w R

Kod tworzy populację skończoną, porównuje błąd standardowy z prób z wzorami i pokazuje jedną przykładową próbę. Wyniki poniżej to dokładny wydruk z R.

1. Rozkład średnich z prób i poprawka na skończoną populację

Dane wejściowe: brak; populacja jest generowana w skrypcie (ziarno losowania 2026).

Co odczytać: porównaj kolumnę se_empiryczny z wzorami bez poprawki i z poprawką.

R
set.seed(2026)
N <- 2000                                                   # wszyscy studenci psychologii na uczelni
stres <- pmin(40, pmax(0, round(rnorm(N, 18, 6))))           # wynik PSS-10 (0–40)
mu <- mean(stres); S <- sd(stres)                            # parametry populacji
sym <- function(n, R = 10000) {
  m <- replicate(R, mean(sample(stres, n)))                  # losowanie bez zwracania
  c(n = n, ulamek = n / N, srednia_srednich = mean(m), se_empiryczny = sd(m),
    se_bez_fpc = S / sqrt(n), se_z_fpc = S / sqrt(n) * sqrt(1 - n / N))
}
tab <- as.data.frame(rbind(sym(100), sym(500)))
cat("mu =", mu, " S =", S, "\n"); print(tab, digits = 5)
Wynik w R
mu = 17.991  S = 5.879898 
    n ulamek srednia_srednich se_empiryczny se_bez_fpc se_z_fpc
1 100   0.05           17.994       0.57687    0.58799  0.57310
2 500   0.25           17.990       0.22907    0.26296  0.22773

2. Jedna próba i przedział ufności dla średniej populacji

Dane wejściowe: obiekty stres i N z poprzedniego kroku.

Co odczytać: średnią i SD z próby oraz 95% przedział ufności dla μ.

R
set.seed(5)
proba <- sample(stres, 100)                                   # jedna próba 100 studentów
c(srednia = mean(proba), sd = sd(proba))
mean(proba) + c(-1, 1) * qt(.975, 99) * sd(proba) / sqrt(100) * sqrt(1 - 100 / N)   # 95% CI z FPC
Wynik w R
  srednia        sd 
18.020000  6.388089 
[1] 16.78456 19.25544

Bibliografia oprogramowania

Wyniki na tej stronie pochodzą z uruchomienia pokazanego kodu w R 4.5.3. W pracy podaj wersje faktycznie użytych pakietów (sessionInfo()).

  1. R: R Core Team. (2026). R: A language and environment for statistical computing (Version 4.5.3) [Computer software]. R Foundation for Statistical Computing. https://www.R-project.org/

Najczęstsze błędy

  1. Zbyt szeroka definicja populacji, np. „Polacy” przy próbie studentów jednej uczelni.
  2. Mylenie populacji z próbą — np. „populację badaną stanowiło 120 osób” zamiast „próbę stanowiło 120 osób”.
  3. Podawanie statystyk z próby jako faktów o populacji bez przedziału ufności.
  4. Brak kryteriów włączenia i wyłączenia, przez co nie wiadomo, kogo dotyczą wnioski.
  5. Pomijanie różnicy między populacją docelową a dostępną, czyli błędu pokrycia.

Najczęstsze pytania

Co to jest populacja w statystyce?

To pełny zbiór jednostek — osób, obiektów lub zdarzeń — o których chcemy wyciągnąć wnioski. Populację określa się przez kryteria: kto do niej należy, gdzie i kiedy. Jej cechy liczbowe nazywa się parametrami.

Czym różni się populacja od próby?

Populacja to wszyscy, o których chcemy wnioskować, a próba — ta część populacji, którą faktycznie badamy. Wyniki z próby (statystyki) służą do szacowania wartości w populacji (parametrów), a różnica między nimi to błąd próby.

Co to jest populacja generalna?

To inne określenie populacji badanej w całości, używane głównie w polskich podręcznikach statystyki. Podkreśla, że chodzi o całą zbiorowość, z której pobiera się próbę, w przeciwieństwie do próby (zbiorowości próbnej).

Co to jest parametr populacji?

To liczba opisująca populację, np. średnia μ, odchylenie standardowe σ, odsetek π czy korelacja ρ. Parametry zwykle są nieznane i szacuje się je na podstawie statystyk z próby, podając przedział ufności.

Czy populacja musi składać się z ludzi?

Nie. Populację mogą tworzyć klasy szkolne, szpitale, firmy, teksty, sesje terapeutyczne czy pomiary. W eksperymentach mówi się też o populacji hipotetycznej — wszystkich możliwych powtórzeń danego badania.

Powiązane hasła

Poradniki, w których użyjesz tego pojęcia

Potrzebujesz wsparcia w analizie danych?

Wybierz ofertę dopasowaną do pracy dyplomowej albo profesjonalnego projektu naukowego.

Wyceń analizęOferta dla studentów

Bibliografia i dalsza literatura naukowa (APA 7)

  1. Appelbaum, M., Cooper, H., Kline, R. B., Mayo-Wilson, E., Nezu, A. M., & Rao, S. M. (2018). Journal article reporting standards for quantitative research in psychology: The APA Publications and Communications Board task force report. American Psychologist, 73(1), 3–25. https://doi.org/10.1037/amp0000191
  2. Cochran, W. G. (1977). Sampling techniques (3rd ed.). Wiley.
  3. Henrich, J., Heine, S. J., & Norenzayan, A. (2010). The weirdest people in the world? Behavioral and Brain Sciences, 33(2–3), 61–83. https://doi.org/10.1017/S0140525X0999152X
  4. Kish, L. (1965). Survey sampling. Wiley.
  5. Lohr, S. L. (2021). Sampling: Design and analysis (3rd ed.). CRC Press. https://doi.org/10.1201/9780429298899
  6. Shadish, W. R., Cook, T. D., & Campbell, D. T. (2002). Experimental and quasi-experimental designs for generalized causal inference. Houghton Mifflin.

Cytowania BibTeX

@article{appelbaum2018journal, author={Appelbaum, Mark and Cooper, Harris and Kline, Rex B. and Mayo-Wilson, Evan and Nezu, Arthur M. and Rao, Stephen M.}, title={Journal article reporting standards for quantitative research in psychology: The {APA} Publications and Communications Board task force report}, journal={American Psychologist}, year={2018}, volume={73}, number={1}, pages={3--25}, doi={10.1037/amp0000191}}
@book{cochran1977sampling, author={Cochran, William G.}, title={Sampling Techniques}, edition={3}, publisher={Wiley}, address={New York}, year={1977}}
@article{henrich2010weirdest, author={Henrich, Joseph and Heine, Steven J. and Norenzayan, Ara}, title={The weirdest people in the world?}, journal={Behavioral and Brain Sciences}, year={2010}, volume={33}, number={2--3}, pages={61--83}, doi={10.1017/S0140525X0999152X}}
@book{kish1965survey, author={Kish, Leslie}, title={Survey Sampling}, publisher={Wiley}, address={New York}, year={1965}}
@book{lohr2021sampling, author={Lohr, Sharon L.}, title={Sampling: Design and Analysis}, edition={3}, publisher={CRC Press}, year={2021}, doi={10.1201/9780429298899}}
@book{shadish2002experimental, author={Shadish, William R. and Cook, Thomas D. and Campbell, Donald T.}, title={Experimental and Quasi-Experimental Designs for Generalized Causal Inference}, publisher={Houghton Mifflin}, address={Boston}, year={2002}}
R