Co oznacza Regresja liniowa?
Zastosowanie, warunki i dobre praktyki
Najważniejsze zastosowanie: Używaj do modelowania warunkowej średniej zmiennej ilościowej, po sprawdzeniu postaci funkcji, reszt i obserwacji wpływowych.
Regresja liniowa modeluje warunkową średnią Y jako funkcję predyktorów. Przed interpretacją oceniaj liniowość, strukturę reszt, obserwacje wpływowe i sposób kodowania, a obok p podawaj współczynniki w jednostkach, przedziały ufności i miary jakości predykcji.
Jak to się oblicza i co oznaczają symbole?
Ŷ oznacza oczekiwaną wartość wyniku przewidywaną przez model, b₀ wartość dla predyktorów równych zero, a bⱼ zmianę oczekiwanego Y przy wzroście Xⱼ o jednostkę i stałych pozostałych zmiennych. Liniowość dotyczy parametrów i przyjętej postaci funkcji; należy ją sprawdzić na wykresach reszt i zależności cząstkowych.
Jak poprawnie stosować i interpretować hasło „Regresja liniowa”?
W przypadku pojęcia „Regresja liniowa” należy określić zmienną wynikową, skalę predyktorów, kategorię referencyjną oraz dokładne znaczenie współczynnika warunkowego. Dla interpretacji hasła „Regresja liniowa” model powinien odpowiadać pytaniu i zawierać zmienne wybrane na podstawie teorii, a nie wyłącznie automatycznej selekcji. W odniesieniu do hasła „Regresja liniowa” dla predyktorów ciągłych trzeba sprawdzić postać funkcji, natomiast interakcje interpretować przez przewidywane wartości w sensownym zakresie danych.
Ocena pojęcia „Regresja liniowa” obejmuje wykresy reszt, heteroskedastyczność, obserwacje wpływowe, współliniowość i stabilność specyfikacji. Przy ocenie hasła „Regresja liniowa” wysokie R² nie wyklucza obciążenia, a niskie R² nie czyni ważnego współczynnika bezużytecznym. W analizie dotyczącej hasła „Regresja liniowa” w analizie predykcyjnej konieczna jest walidacja poza próbą; w analizie wyjaśniającej ważniejsze są identyfikacja i sens przyczynowy kontroli.
Co trzeba opisać w raporcie?
Raport dotyczący „Regresja liniowa” powinien podać równanie lub listę bloków predyktorów, sposób kodowania, liczebność, estymaty współczynników z przedziałami ufności, R² oraz właściwą diagnostykę. Dla interpretacji hasła „Regresja liniowa” dla modeli porównywanych należy pokazać kryterium porównania i przyrost wyjaśniania, a dla interakcji — efekty proste lub wykres przewidywań.
Zakres raportowania dla hasła „Regresja liniowa”: B/β = …, 95% CI […], p = …; R²/skorygowany R², diagnostyka i N.
Przykład praktyczny i gotowa interpretacja
Sytuacja: Każda dodatkowa godzina snu wiązała się ze spadkiem stresu o 2.1 punktu przy stałym wieku i obciążeniu pracą; wykres reszt nie wskazywał wyraźnej krzywizny.
Jak ją zinterpretować: Współczynnik B opisuje oczekiwaną zmianę Y przy wzroście X o jednostkę i stałych pozostałych predyktorach. Ta interpretacja jest warunkowa, zależy od skali i nie oznacza efektu przyczynowego bez odpowiedniego projektu.
Najczęstsza pułapka i granica interpretacji
Liniowość dotyczy postaci średniej warunkowej; normalność surowych X i Y nie jest jej definicją.
Współczynnik związany z „Regresja liniowa” jest zależny od pozostałych składników modelu i zakresu danych. Przy ocenie hasła „Regresja liniowa” nie powinien być interpretowany przyczynowo bez projektu i założeń identyfikacyjnych, a ekstrapolacja poza obserwowany zakres może być całkowicie nietrafna.
Regresja liniowa i modele hierarchiczne
Blok dotyczy pojedynczego modelu regresji liniowej, jego współczynników, przedziałów i podstawowej diagnostyki.
R
dane <- read.csv("dane.csv")
dane$grupa <- factor(dane$grupa)
m1 <- lm(y ~ x1, data = dane)
m2 <- lm(y ~ x1 + x2 + grupa, data = dane)
summary(m2)
confint(m2)
anova(m1, m2) # przyrost dopasowania dla modeli zagnieżdżonych
# Krzywizna i interakcja są jawnie zapisane w formule.
m3 <- lm(y ~ x1 + I(x1^2) + x2 + x1:x2, data = dane)
summary(m3)Python
import pandas as pd
import statsmodels.formula.api as smf
df = pd.read_csv("dane.csv")
m1 = smf.ols("y ~ x1", data=df).fit()
m2 = smf.ols("y ~ x1 + x2 + C(grupa)", data=df).fit()
print(m2.summary())
print(m2.conf_int())
print(m2.compare_f_test(m1))
m3 = smf.ols("y ~ x1 + I(x1**2) + x2 + x1:x2", data=df).fit()
print(m3.summary())IBM SPSS Statistics — Syntax
REGRESSION
/DEPENDENT=y
/METHOD=ENTER x1
/METHOD=ENTER x2 grupa
/STATISTICS=COEFF OUTS R ANOVA CHANGE CI(95) COLLIN TOL
/RESIDUALS=DURBIN HISTOGRAM(ZRESID) NORMPROB(ZRESID)
/SAVE=PRED ZRESID COOK MAHAL.
* Składnik kwadratowy i interakcję utwórz jawnie.
COMPUTE x1_sq=x1**2.
COMPUTE x1_x2=x1*x2.
EXECUTE.
REGRESSION /DEPENDENT=y /METHOD=ENTER x1 x1_sq x2 x1_x2.Bibliografia oprogramowania i wykorzystanych pakietów
W przykładach użyto: R, Python, IBM SPSS Statistics, pandas, statsmodels. W pracy badawczej podaj również faktycznie użyte wersje, które można odczytać poleceniami sessionInfo() w R oraz pip freeze lub importlib.metadata.version() w Pythonie. Cytuj wyłącznie narzędzia rzeczywiście użyte w końcowej analizie.
- R: R Core Team. (2026). R: A language and environment for statistical computing [Computer software]. R Foundation for Statistical Computing. https://www.R-project.org/
- Python: Van Rossum, G., & Drake, F. L., Jr. (2009). Python 3 reference manual. CreateSpace.
- IBM SPSS Statistics: IBM Corp. (2025). IBM SPSS Statistics for Macintosh (Version 31.0) [Computer software]. IBM Corp.
- pandas: McKinney, W. (2010). Data structures for statistical computing in Python. In S. van der Walt & J. Millman (Eds.), Proceedings of the 9th Python in Science Conference (pp. 56–61). https://doi.org/10.25080/Majora-92bf1922-00a
- statsmodels: Seabold, S., & Perktold, J. (2010). Statsmodels: Econometric and statistical modeling with Python. In S. van der Walt & J. Millman (Eds.), Proceedings of the 9th Python in Science Conference (pp. 92–96). https://doi.org/10.25080/Majora-92bf1922-011
BibTeX dla oprogramowania i pakietów
@manual{r-core-2026,
author = {{R Core Team}},
title = {R: A Language and Environment for Statistical Computing},
organization = {R Foundation for Statistical Computing},
address = {Vienna, Austria},
year = {2026},
url = {https://www.R-project.org/}
}@book{vanrossum2009python,
author = {Van Rossum, Guido and Drake, Fred L., Jr.},
title = {Python 3 Reference Manual},
publisher = {CreateSpace},
year = {2009},
isbn = {978-1-4414-1269-0}
}@software{ibm2025spss,
author = {{IBM Corp.}},
title = {IBM SPSS Statistics for Macintosh},
year = {2025},
version = {31.0},
publisher = {IBM Corp.}
}@inproceedings{mckinney2010pandas,
author = {McKinney, Wes},
title = {Data Structures for Statistical Computing in Python},
booktitle = {Proceedings of the 9th Python in Science Conference},
editor = {van der Walt, Stéfan and Millman, Jarrod},
year = {2010},
pages = {56--61},
doi = {10.25080/Majora-92bf1922-00a}
}@inproceedings{seabold2010statsmodels,
author = {Seabold, Skipper and Perktold, Josef},
title = {Statsmodels: Econometric and Statistical Modeling with Python},
booktitle = {Proceedings of the 9th Python in Science Conference},
year = {2010},
pages = {92--96},
doi = {10.25080/Majora-92bf1922-011}
}Definicje, zalecenia interpretacyjne i sposób raportowania oparto na literaturze metodologicznej wskazanej w bibliografii (Collins et al., 2024).
Powiązane hasła
Poradniki, w których użyjesz tego pojęcia
Wartość p: co naprawdę oznacza i jak ją poprawnie interpretować
Wartość p bez mitów: definicja, interpretacja, typowe błędy oraz sposób raportowania wraz z wielkością efektu i przedziałem ufności.
Czytaj →PoradnikRegresja logistyczna: założenia, interpretacja i raportowanie modelu
Regresja logistyczna w praktyce: założenia, iloraz szans, diagnostyka, kalibracja, AUC oraz zasady rzetelnego raportowania modelu.
Czytaj →PoradnikModelowanie równań strukturalnych (SEM): od teorii do raportu
SEM bez skrótów myślowych: model pomiarowy i strukturalny, CB-SEM a PLS-SEM, dopasowanie, założenia oraz raportowanie wyników.
Czytaj →Potrzebujesz wsparcia w analizie danych?
Wybierz ofertę dopasowaną do pracy dyplomowej albo profesjonalnego projektu naukowego.
Oferta dla badaczyOferta dla studentówBibliografia i dalsza literatura naukowa (APA 7)
- Collins, G. S., Moons, K. G. M., Dhiman, P., Riley, R. D., Beam, A. L., Van Calster, B., Ghassemi, M., Liu, X., Reitsma, J. B., van Smeden, M., Boulesteix, A.-L., Camaradou, J. C., Celi, L. A., Denaxas, S., Denniston, A. K., Glocker, B., Golub, R. M., Harvey, H., Heinze, G., … Logullo, P. (2024). TRIPOD+AI statement: Updated guidance for reporting clinical prediction models. BMJ, 385, e078378. https://doi.org/10.1136/bmj-2023-078378
- Peduzzi, P., Concato, J., Kemper, E., Holford, T. R., & Feinstein, A. R. (1996). A simulation study of the number of events per variable in logistic regression analysis. Journal of Clinical Epidemiology, 49(12), 1373–1379. https://doi.org/10.1016/S0895-4356(96)00236-3
- Lang, T. A., & Altman, D. G. (2015). Basic statistical reporting for articles published in biomedical journals: The SAMPL guidelines. International Journal of Nursing Studies, 52(1), 5–9. https://doi.org/10.1016/j.ijnurstu.2014.09.006
- Lakens, D. (2022). Sample size justification. Collabra: Psychology, 8(1), 33267. https://doi.org/10.1525/collabra.33267
- Appelbaum, M., Cooper, H., Kline, R. B., Mayo-Wilson, E., Nezu, A. M., & Rao, S. M. (2018). Journal article reporting standards for quantitative research in psychology: The APA Publications and Communications Board task force report. American Psychologist, 73(1), 3–25. https://doi.org/10.1037/amp0000191
- Wilkinson, L., & Task Force on Statistical Inference. (1999). Statistical methods in psychology journals: Guidelines and explanations. American Psychologist, 54(8), 594–604. https://doi.org/10.1037/0003-066X.54.8.594
Cytowania BibTeX
@article{collins2024tripod, author={Collins, Gary S. and Moons, Karel G. M. and Dhiman, Paula and Riley, Richard D. and Beam, Andrew L. and Van Calster, Ben and Ghassemi, Marzyeh and Liu, Xiaoxuan and Reitsma, Johannes B. and van Smeden, Maarten and Boulesteix, Anne-Laure and Camaradou, Jennifer Catherine and Celi, Leo Anthony and Denaxas, Spiros and Denniston, Alastair K. and Glocker, Ben and Golub, Robert M. and Harvey, Hugh and Heinze, Georg and Hoffman, Michael M. and Kengne, André Pascal and Lam, Emily and Lee, Naomi and Loder, Elizabeth W. and Maier-Hein, Lena and Mateen, Bilal A. and McCradden, Melissa D. and Oakden-Rayner, Lauren and Ordish, Johan and Parnell, Richard and Rose, Sherri and Singh, Karandeep and Wynants, Laure and Logullo, Patricia}, title={TRIPOD+AI statement: updated guidance for reporting clinical prediction models}, journal={BMJ}, year={2024}, volume={385}, pages={e078378}, doi={10.1136/bmj-2023-078378}}@article{peduzzi1996epv, author={Peduzzi, Peter and Concato, John and Kemper, Elizabeth and Holford, Theodore R. and Feinstein, Alvan R.}, title={A simulation study of the number of events per variable in logistic regression analysis}, journal={Journal of Clinical Epidemiology}, year={1996}, volume={49}, number={12}, pages={1373--1379}, doi={10.1016/S0895-4356(96)00236-3}}@article{lang2015sampl, author={Lang, Thomas A. and Altman, Douglas G.}, title={Basic statistical reporting for articles published in biomedical journals: the SAMPL guidelines}, journal={International Journal of Nursing Studies}, year={2015}, volume={52}, number={1}, pages={5--9}, doi={10.1016/j.ijnurstu.2014.09.006}}@article{lakens2022sample, author={Lakens, Daniël}, title={Sample size justification}, journal={Collabra: Psychology}, year={2022}, volume={8}, number={1}, pages={33267}, doi={10.1525/collabra.33267}}@article{appelbaum2018jars, author={Appelbaum, Mark and Cooper, Harris and Kline, Rex B. and Mayo-Wilson, Evan and Nezu, Arthur M. and Rao, Stephen M.}, title={Journal article reporting standards for quantitative research in psychology}, journal={American Psychologist}, year={2018}, volume={73}, number={1}, pages={3--25}, doi={10.1037/amp0000191}}@article{wilkinson1999statistical, author={Wilkinson, Leland and {Task Force on Statistical Inference}}, title={Statistical methods in psychology journals: Guidelines and explanations}, journal={American Psychologist}, year={1999}, volume={54}, number={8}, pages={594--604}, doi={10.1037/0003-066X.54.8.594}}