Słownik metodologiczny · Regresja

Reszty regresji

Pełne wyjaśnienie, zastosowanie naukowe i praktyczne, przykład, dobre praktyki oraz gotowy zapis wyniku w APA 7.

Strona główna / Słownik / Reszty regresji

Co oznacza Reszty regresji?

Reszty to różnice między obserwowanymi i przewidywanymi wartościami wyniku.

Zastosowanie, warunki i dobre praktyki

Reszta jest różnicą między wynikiem zaobserwowanym a przewidywanym przez model dla tej samej obserwacji. Wykres reszt ujawnia nieliniowość, zmienną wariancję, zależność i punkty niedopasowane, których nie widać w samym R². Mała średnia reszt nie potwierdza poprawności modelu, ponieważ przy wyrazie wolnym wynosi ona z definicji około zera. Diagnostyka powinna łączyć wykres reszt względem wartości przewidywanych z wykresem Q–Q, dźwignią i wpływem, ponieważ każdy z nich ujawnia inny problem.

Najważniejsze zastosowanie: Używaj do diagnostyki postaci modelu, wariancji, obserwacji wpływowych i zależności.

Jak poprawnie stosować i interpretować hasło „Reszty regresji”?

W odniesieniu do hasła „Reszty regresji” reszta jest różnicą między obserwowaną a przewidywaną wartością wyniku. Przy ocenie hasła „Reszty regresji” jej analiza służy do sprawdzenia, gdzie model systematycznie się myli, czy pominięto nieliniowość, heteroskedastyczność albo zależność w czasie. W analizie dotyczącej hasła „Reszty regresji” trzeba rozróżnić reszty surowe, standaryzowane i studentyzowane, ponieważ mają inne skale i zastosowania diagnostyczne.

W analizie dotyczącej hasła „Reszty regresji” najważniejsze są wykresy reszt względem wartości przewidywanych, czasu i kluczowych predyktorów. Dla interpretacji hasła „Reszty regresji” oczekuje się braku systematycznego wzorca wokół zera, lecz pojedynczy test normalności nie rozstrzyga jakości modelu. W odniesieniu do hasła „Reszty regresji” nietypową resztę należy zestawić z dźwignią i wpływem, a zmianę specyfikacji uzasadnić merytorycznie.

Co trzeba opisać w raporcie?

W odniesieniu do hasła „Reszty regresji” raport powinien wskazać rodzaj ocenionych reszt, użyte wykresy lub statystyki oraz stwierdzony wzorzec. Przy ocenie hasła „Reszty regresji”, jeśli zastosowano transformację, składnik nieliniowy, odporne błędy standardowe lub inną korektę, trzeba podać przyczynę i pokazać wpływ decyzji na główne estymaty.

Zakres raportowania dla hasła „Reszty regresji”: Opisz wykresy/diagnostykę i zastosowane korekty.

Przykład praktyczny i gotowa interpretacja

Sytuacja: Wzór krzywizny na wykresie reszt wskazuje brakujący składnik nieliniowy.

Jak ją zinterpretować: Reszta jest różnicą między obserwacją a wartością przewidywaną i ujawnia elementy, których model nie odtworzył. Wzorzec krzywizny, lejka lub zależności czasowej wskazuje odpowiednio błędną funkcję, wariancję albo strukturę błędu.

Najczęstsza pułapka i granica interpretacji

Normalność reszt nie naprawia błędnej postaci funkcji lub pominiętej zależności.

W analizie dotyczącej hasła „Reszty regresji” niewielkie i pozornie losowe reszty nie dowodzą poprawności przyczynowej modelu. Dla interpretacji hasła „Reszty regresji” reszty są warunkowe względem konkretnej specyfikacji; model może dobrze przewidywać w próbie, a źle działać w nowej populacji lub poza obserwowanym zakresem.

Przykład reprodukowalny dla tego hasła

Diagnostyka regresji: VIF, reszty, Cook i Mahalanobis

Przykład skupia się na resztach i obserwacjach wpływowych już oszacowanego modelu liniowego.

Dane wejściowe: Model y ~ x1 + x2 + x3. Analizę punktów wpływowych wykonuj po zdefiniowaniu modelu, a nie jako automatyczne usuwanie rekordów.

Co sprawdzić w wyniku: Sprawdź wzorzec reszt, dźwignię, Cooka, Mahalanobisa, VIF i stabilność wniosków po analizie wrażliwości.

R
dane <- read.csv("dane.csv")
m <- lm(y ~ x1 + x2 + x3, data = dane)

diag <- data.frame(
  przewidywane = fitted(m),
  reszta_std = rstandard(m),
  cook = cooks.distance(m),
  dzwignia = hatvalues(m),
  mahalanobis = mahalanobis(model.matrix(m)[, -1],
                            colMeans(model.matrix(m)[, -1]),
                            cov(model.matrix(m)[, -1]))
)
head(diag[order(diag$cook, decreasing = TRUE), ])

# Statystyka Durbina-Watsona dla kolejno uporządkowanych reszt.
e <- resid(m)
DW <- sum(diff(e)^2) / sum(e^2)
DW

# VIF bez dodatkowego pakietu: 1/(1-R2_j).
X <- model.matrix(m)[, -1, drop = FALSE]
vif <- sapply(seq_len(ncol(X)), function(j) {
  1 / (1 - summary(lm(X[, j] ~ X[, -j, drop = FALSE]))$r.squared)
})
setNames(vif, colnames(X))
Python
import pandas as pd
import statsmodels.api as sm
from statsmodels.stats.stattools import durbin_watson
from statsmodels.stats.outliers_influence import variance_inflation_factor

df = pd.read_csv("dane.csv")[["y", "x1", "x2", "x3"]].dropna()
X = sm.add_constant(df[["x1", "x2", "x3"]])
m = sm.OLS(df["y"], X).fit()
infl = m.get_influence()

diag = infl.summary_frame()[["standard_resid", "cooks_d", "hat_diag"]]
print(diag.sort_values("cooks_d", ascending=False).head())
print("Durbin-Watson =", durbin_watson(m.resid))

vif = pd.Series(
    [variance_inflation_factor(X.values, i) for i in range(1, X.shape[1])],
    index=X.columns[1:], name="VIF"
)
print(vif)
IBM SPSS Statistics — Syntax
REGRESSION
 /DEPENDENT=y
 /METHOD=ENTER x1 x2 x3
 /STATISTICS=COEFF OUTS R ANOVA CI(95) COLLIN TOL
 /RESIDUALS=DURBIN HISTOGRAM(ZRESID) NORMPROB(ZRESID)
 /SCATTERPLOT=(*ZPRED,*ZRESID)
 /SAVE=PRED ZPRED ZRESID COOK LEVER MAHAL.

Bibliografia oprogramowania i wykorzystanych pakietów

W przykładach użyto: R, Python, IBM SPSS Statistics, pandas, statsmodels. W pracy badawczej podaj również faktycznie użyte wersje, które można odczytać poleceniami sessionInfo() w R oraz pip freeze lub importlib.metadata.version() w Pythonie. Cytuj wyłącznie narzędzia rzeczywiście użyte w końcowej analizie.

  1. R: R Core Team. (2026). R: A language and environment for statistical computing [Computer software]. R Foundation for Statistical Computing. https://www.R-project.org/
  2. Python: Van Rossum, G., & Drake, F. L., Jr. (2009). Python 3 reference manual. CreateSpace.
  3. IBM SPSS Statistics: IBM Corp. (2025). IBM SPSS Statistics for Macintosh (Version 31.0) [Computer software]. IBM Corp.
  4. pandas: McKinney, W. (2010). Data structures for statistical computing in Python. In S. van der Walt & J. Millman (Eds.), Proceedings of the 9th Python in Science Conference (pp. 56–61). https://doi.org/10.25080/Majora-92bf1922-00a
  5. statsmodels: Seabold, S., & Perktold, J. (2010). Statsmodels: Econometric and statistical modeling with Python. In S. van der Walt & J. Millman (Eds.), Proceedings of the 9th Python in Science Conference (pp. 92–96). https://doi.org/10.25080/Majora-92bf1922-011
BibTeX dla oprogramowania i pakietów
@manual{r-core-2026,
  author = {{R Core Team}},
  title = {R: A Language and Environment for Statistical Computing},
  organization = {R Foundation for Statistical Computing},
  address = {Vienna, Austria},
  year = {2026},
  url = {https://www.R-project.org/}
}
@book{vanrossum2009python,
  author = {Van Rossum, Guido and Drake, Fred L., Jr.},
  title = {Python 3 Reference Manual},
  publisher = {CreateSpace},
  year = {2009},
  isbn = {978-1-4414-1269-0}
}
@software{ibm2025spss,
  author = {{IBM Corp.}},
  title = {IBM SPSS Statistics for Macintosh},
  year = {2025},
  version = {31.0},
  publisher = {IBM Corp.}
}
@inproceedings{mckinney2010pandas,
  author = {McKinney, Wes},
  title = {Data Structures for Statistical Computing in Python},
  booktitle = {Proceedings of the 9th Python in Science Conference},
  editor = {van der Walt, Stéfan and Millman, Jarrod},
  year = {2010},
  pages = {56--61},
  doi = {10.25080/Majora-92bf1922-00a}
}
@inproceedings{seabold2010statsmodels,
  author = {Seabold, Skipper and Perktold, Josef},
  title = {Statsmodels: Econometric and Statistical Modeling with Python},
  booktitle = {Proceedings of the 9th Python in Science Conference},
  year = {2010},
  pages = {92--96},
  doi = {10.25080/Majora-92bf1922-011}
}

Definicje, zalecenia interpretacyjne i sposób raportowania oparto na literaturze metodologicznej wskazanej w bibliografii (Hu i Bentler, 1999).

Powiązane hasła

Poradniki, w których użyjesz tego pojęcia

Potrzebujesz wsparcia w analizie danych?

Wybierz ofertę dopasowaną do pracy dyplomowej albo profesjonalnego projektu naukowego.

Oferta dla badaczyOferta dla studentów

Bibliografia i dalsza literatura naukowa (APA 7)

  1. Hu, L., & Bentler, P. M. (1999). Cutoff criteria for fit indexes in covariance structure analysis: Conventional criteria versus new alternatives. Structural Equation Modeling, 6(1), 1–55. https://doi.org/10.1080/10705519909540118
  2. Bentler, P. M. (1990). Comparative fit indexes in structural models. Psychological Bulletin, 107(2), 238–246. https://doi.org/10.1037/0033-2909.107.2.238
  3. Appelbaum, M., Cooper, H., Kline, R. B., Mayo-Wilson, E., Nezu, A. M., & Rao, S. M. (2018). Journal article reporting standards for quantitative research in psychology: The APA Publications and Communications Board task force report. American Psychologist, 73(1), 3–25. https://doi.org/10.1037/amp0000191
  4. Lang, T. A., & Altman, D. G. (2015). Basic statistical reporting for articles published in biomedical journals: The SAMPL guidelines. International Journal of Nursing Studies, 52(1), 5–9. https://doi.org/10.1016/j.ijnurstu.2014.09.006
  5. Iacobucci, D. (2010). Structural equations modeling: Fit indices, sample size, and advanced topics. Journal of Consumer Psychology, 20(1), 90–98. https://doi.org/10.1016/j.jcps.2009.09.003
  6. Rosseel, Y. (2012). lavaan: An R package for structural equation modeling. Journal of Statistical Software, 48(2), 1–36. https://doi.org/10.18637/jss.v048.i02

Cytowania BibTeX

@article{hu1999sem, author={Hu, Li-tze and Bentler, Peter M.}, title={Cutoff criteria for fit indexes in covariance structure analysis}, journal={Structural Equation Modeling}, year={1999}, volume={6}, number={1}, pages={1--55}, doi={10.1080/10705519909540118}}
@article{bentler1990cfi, author={Bentler, Peter M.}, title={Comparative fit indexes in structural models}, journal={Psychological Bulletin}, year={1990}, volume={107}, number={2}, pages={238--246}, doi={10.1037/0033-2909.107.2.238}}
@article{appelbaum2018jars, author={Appelbaum, Mark and Cooper, Harris and Kline, Rex B. and Mayo-Wilson, Evan and Nezu, Arthur M. and Rao, Stephen M.}, title={Journal article reporting standards for quantitative research in psychology}, journal={American Psychologist}, year={2018}, volume={73}, number={1}, pages={3--25}, doi={10.1037/amp0000191}}
@article{lang2015sampl, author={Lang, Thomas A. and Altman, Douglas G.}, title={Basic statistical reporting for articles published in biomedical journals: the SAMPL guidelines}, journal={International Journal of Nursing Studies}, year={2015}, volume={52}, number={1}, pages={5--9}, doi={10.1016/j.ijnurstu.2014.09.006}}
@article{iacobucci2010sem, author={Iacobucci, Dawn}, title={Structural Equations Modeling: Fit Indices, Sample Size, and Advanced Topics}, journal={Journal of Consumer Psychology}, year={2010}, volume={20}, number={1}, pages={90--98}, doi={10.1016/j.jcps.2009.09.003}}
@article{rosseel2012lavaan, author={Rosseel, Yves}, title={lavaan: An R Package for Structural Equation Modeling}, journal={Journal of Statistical Software}, year={2012}, volume={48}, number={2}, pages={1--36}, doi={10.18637/jss.v048.i02}}
R