Słownik metodologiczny · Regresja

Odległość Cooka

Pełne wyjaśnienie, zastosowanie naukowe i praktyczne, przykład, dobre praktyki oraz gotowy zapis wyniku w APA 7.

Strona główna / Słownik / Odległość Cooka

Co oznacza Odległość Cooka?

Odległość Cooka mierzy łączny wpływ obserwacji na dopasowane wartości współczynników regresji.

Zastosowanie, warunki i dobre praktyki

Odległość Cooka łączy wielkość reszty z dźwignią, aby ocenić, jak bardzo pojedyncza obserwacja wpływa na zestaw dopasowanych wartości. Popularne progi są wskazówkami do inspekcji, nie regułami usuwania. Należy sprawdzić pochodzenie przypadku, zmianę współczynników i wniosku oraz przedstawić analizę wrażliwości, jeśli obserwacja jest poprawna, lecz wpływowa.

Najważniejsze zastosowanie: Używaj odległości Cooka do oceny łącznego wpływu obserwacji na wszystkie współczynniki dopasowanego modelu regresji.

Jak to się oblicza i co oznaczają symbole?

Dᵢ = Σ(Ŷⱼ − Ŷⱼ(−i))² / (p · MSE)

Porównuje przewidywania modelu z obserwacją i po jej usunięciu. p jest liczbą parametrów, a MSE średnim kwadratem błędu. Duże Dᵢ jest sygnałem do diagnozy, nie automatycznym kryterium usunięcia.

Jak poprawnie stosować i interpretować hasło „Odległość Cooka”?

Odległość Cooka mierzy, jak bardzo łącznie zmieniłyby się dopasowane wartości modelu po usunięciu jednej obserwacji. W odniesieniu do hasła „Odległość Cooka” łączy informację o reszcie i dźwigni, dlatego służy do wykrywania punktów wpływowych, a nie po prostu skrajnych wartości zmiennej. Przy ocenie hasła „Odległość Cooka” próg jest wskazówką do inspekcji, nie automatyczną regułą wyłączenia.

Przy ocenie hasła „Odległość Cooka” dla rekordów z wysoką odległością Cooka trzeba sprawdzić poprawność danych, postać modelu oraz stabilność współczynników po ich pozostawieniu i wyłączeniu. W analizie dotyczącej hasła „Odległość Cooka” warto równolegle obejrzeć dźwignię, reszty studentyzowane i DFBETAS, ponieważ pokazują inne aspekty wpływu. Dla interpretacji hasła „Odległość Cooka” analiza powinna zachować pierwotny model jako punkt odniesienia.

Co trzeba opisać w raporcie?

Dla interpretacji hasła „Odległość Cooka” raport powinien podać użyte kryterium, maksymalną lub zakres wartości, liczbę sprawdzonych rekordów oraz zmianę kluczowych estymat w analizie wrażliwości. W odniesieniu do hasła „Odległość Cooka”, jeżeli obserwację wyłączono, powód powinien wynikać z jakości danych albo z wcześniej ustalonej populacji, a nie z poprawy wartości p.

Zakres raportowania dla hasła „Odległość Cooka”: Podaj kryterium diagnostyczne i analizę wrażliwości.

Przykład praktyczny i gotowa interpretacja

Sytuacja: Obserwacja 47 miała D = 0.32 i po jej usunięciu współczynnik snu zmienił się z −1.9 na −1.2; przypadek sprawdzono, ale nie usunięto automatycznie.

Jak ją zinterpretować: Duża wartość wskazuje, że usunięcie przypadku wyraźnie zmieniłoby dopasowane wartości lub współczynniki. Jest sygnałem diagnostycznym; decyzję podejmuje się po sprawdzeniu danych i porównaniu merytorycznych wniosków.

Najczęstsza pułapka i granica interpretacji

Duża odległość Cooka jest sygnałem do diagnozy, nie automatycznym nakazem usunięcia rekordu.

Przy ocenie hasła „Odległość Cooka” wysoka odległość Cooka nie dowodzi, że rekord jest błędny. W analizie dotyczącej hasła „Odległość Cooka” może ujawnić ważną część populacji, brak nieliniowości lub interakcji w modelu; usunięcie punktu bez zbadania przyczyny może zafałszować zakres wniosku.

Definicje, zalecenia interpretacyjne i sposób raportowania oparto na literaturze metodologicznej wskazanej w bibliografii (Collins et al., 2024).

Powiązane hasła

Poradniki, w których użyjesz tego pojęcia

Potrzebujesz wsparcia w analizie danych?

Wybierz ofertę dopasowaną do pracy dyplomowej albo profesjonalnego projektu naukowego.

Oferta dla badaczyOferta dla studentów

Bibliografia i dalsza literatura naukowa (APA 7)

  1. Collins, G. S., Moons, K. G. M., Dhiman, P., Riley, R. D., Beam, A. L., Van Calster, B., Ghassemi, M., Liu, X., Reitsma, J. B., van Smeden, M., Boulesteix, A.-L., Camaradou, J. C., Celi, L. A., Denaxas, S., Denniston, A. K., Glocker, B., Golub, R. M., Harvey, H., Heinze, G., … Logullo, P. (2024). TRIPOD+AI statement: Updated guidance for reporting clinical prediction models. BMJ, 385, e078378. https://doi.org/10.1136/bmj-2023-078378
  2. Peduzzi, P., Concato, J., Kemper, E., Holford, T. R., & Feinstein, A. R. (1996). A simulation study of the number of events per variable in logistic regression analysis. Journal of Clinical Epidemiology, 49(12), 1373–1379. https://doi.org/10.1016/S0895-4356(96)00236-3
  3. Lang, T. A., & Altman, D. G. (2015). Basic statistical reporting for articles published in biomedical journals: The SAMPL guidelines. International Journal of Nursing Studies, 52(1), 5–9. https://doi.org/10.1016/j.ijnurstu.2014.09.006
  4. Lakens, D. (2022). Sample size justification. Collabra: Psychology, 8(1), 33267. https://doi.org/10.1525/collabra.33267
  5. Appelbaum, M., Cooper, H., Kline, R. B., Mayo-Wilson, E., Nezu, A. M., & Rao, S. M. (2018). Journal article reporting standards for quantitative research in psychology: The APA Publications and Communications Board task force report. American Psychologist, 73(1), 3–25. https://doi.org/10.1037/amp0000191
  6. Wilkinson, L., & Task Force on Statistical Inference. (1999). Statistical methods in psychology journals: Guidelines and explanations. American Psychologist, 54(8), 594–604. https://doi.org/10.1037/0003-066X.54.8.594

Cytowania BibTeX

@article{collins2024tripod, author={Collins, Gary S. and Moons, Karel G. M. and Dhiman, Paula and Riley, Richard D. and Beam, Andrew L. and Van Calster, Ben and Ghassemi, Marzyeh and Liu, Xiaoxuan and Reitsma, Johannes B. and van Smeden, Maarten and Boulesteix, Anne-Laure and Camaradou, Jennifer Catherine and Celi, Leo Anthony and Denaxas, Spiros and Denniston, Alastair K. and Glocker, Ben and Golub, Robert M. and Harvey, Hugh and Heinze, Georg and Hoffman, Michael M. and Kengne, André Pascal and Lam, Emily and Lee, Naomi and Loder, Elizabeth W. and Maier-Hein, Lena and Mateen, Bilal A. and McCradden, Melissa D. and Oakden-Rayner, Lauren and Ordish, Johan and Parnell, Richard and Rose, Sherri and Singh, Karandeep and Wynants, Laure and Logullo, Patricia}, title={TRIPOD+AI statement: updated guidance for reporting clinical prediction models}, journal={BMJ}, year={2024}, volume={385}, pages={e078378}, doi={10.1136/bmj-2023-078378}}
@article{peduzzi1996epv, author={Peduzzi, Peter and Concato, John and Kemper, Elizabeth and Holford, Theodore R. and Feinstein, Alvan R.}, title={A simulation study of the number of events per variable in logistic regression analysis}, journal={Journal of Clinical Epidemiology}, year={1996}, volume={49}, number={12}, pages={1373--1379}, doi={10.1016/S0895-4356(96)00236-3}}
@article{lang2015sampl, author={Lang, Thomas A. and Altman, Douglas G.}, title={Basic statistical reporting for articles published in biomedical journals: the SAMPL guidelines}, journal={International Journal of Nursing Studies}, year={2015}, volume={52}, number={1}, pages={5--9}, doi={10.1016/j.ijnurstu.2014.09.006}}
@article{lakens2022sample, author={Lakens, Daniël}, title={Sample size justification}, journal={Collabra: Psychology}, year={2022}, volume={8}, number={1}, pages={33267}, doi={10.1525/collabra.33267}}
@article{appelbaum2018jars, author={Appelbaum, Mark and Cooper, Harris and Kline, Rex B. and Mayo-Wilson, Evan and Nezu, Arthur M. and Rao, Stephen M.}, title={Journal article reporting standards for quantitative research in psychology}, journal={American Psychologist}, year={2018}, volume={73}, number={1}, pages={3--25}, doi={10.1037/amp0000191}}
@article{wilkinson1999statistical, author={Wilkinson, Leland and {Task Force on Statistical Inference}}, title={Statistical methods in psychology journals: Guidelines and explanations}, journal={American Psychologist}, year={1999}, volume={54}, number={8}, pages={594--604}, doi={10.1037/0003-066X.54.8.594}}
R