Słownik metodologiczny · Regresja

Data mining

Pełne wyjaśnienie, zastosowanie naukowe i praktyczne, przykład, dobre praktyki oraz gotowy zapis wyniku w APA 7.

Strona główna / Słownik / Data mining

Co oznacza Data mining?

Data mining obejmuje eksploracyjne wykrywanie wzorców, segmentów i reguł w dużych zbiorach danych.

Zastosowanie, warunki i dobre praktyki

Eksploracja danych obejmuje wyszukiwanie wzorców, segmentów i reguł bez ograniczania się do jednej wcześniej ustalonej hipotezy. Największym ryzykiem jest potraktowanie wzorca odkrytego w próbie jako już potwierdzonego. Dlatego dane rozdziela się na część uczącą i walidacyjną, kontroluje wyciek informacji oraz sprawdza stabilność wyniku w czasie i w innej populacji.

Najważniejsze zastosowanie: Używaj do generowania hipotez, predykcji i opisu struktur, z walidacją poza próbą uczącą.

Jak poprawnie stosować i interpretować hasło „Data mining”?

W przypadku pojęcia „Data mining” trzeba wyraźnie oddzielić cel analizy, reprezentację danych i kryterium, które algorytm optymalizuje. Przy ocenie hasła „Data mining” metoda eksploracyjna może wykrywać wzorce, ale ich istnienie w próbie nie oznacza automatycznie stabilności ani znaczenia naukowego. W analizie dotyczącej hasła „Data mining” przed analizą należy zaplanować przygotowanie zmiennych, sposób walidacji i regułę wyboru rozwiązania.

Ocena pojęcia „Data mining” powinna korzystać z danych niewykorzystanych do dopasowania, resamplingu albo niezależnej replikacji. Dla interpretacji hasła „Data mining” porównuje się nie tylko dopasowanie, lecz także stabilność, błąd predykcji i interpretowalność. W odniesieniu do hasła „Data mining”, jeśli wybór liczby elementów modelu zależy od kryterium informacyjnego, trzeba sprawdzić rozwiązania sąsiednie i unikać klas lub skupień o pozornej strukturze.

Co trzeba opisać w raporcie?

Opis pojęcia „Data mining” powinien zawierać algorytm, przygotowanie danych, ustawienia, kryterium wyboru i sposób walidacji. Przy ocenie hasła „Data mining” należy podać liczebność części uczącej i testowej, miary jakości oraz wyniki analiz stabilności. W analizie dotyczącej hasła „Data mining” odkryte wzorce powinny zostać przedstawione jako eksploracyjne, dopóki nie przejdą niezależnego sprawdzenia.

Zakres raportowania dla hasła „Data mining”: Opisz źródło danych, preprocessing, podział uczący/testowy, metryki i walidację.

Przykład praktyczny i gotowa interpretacja

Sytuacja: Model segmentuje klientów według zachowań, a stabilność segmentów sprawdza się na nowym okresie.

Jak ją zinterpretować: Odkryty wzorzec jest kandydatem do dalszego sprawdzenia, a nie potwierdzoną prawidłowością. Jego wartość zależy od tego, czy utrzymuje się w zbiorze niewykorzystanym podczas wyszukiwania i czy da się go sensownie wyjaśnić.

Najczęstsza pułapka i granica interpretacji

Wzorzec odkryty i oceniony na tych samych danych zwykle wygląda lepiej niż w nowych danych.

Wynik dotyczący „Data mining” może odtwarzać szum, brakujące dane lub arbitralną skalę zmiennych. Dla interpretacji hasła „Data mining” dobre dopasowanie do danych uczących nie gwarantuje trafnej interpretacji ani użytecznej predykcji poza próbą.

Przykład reprodukowalny dla tego hasła

Data mining: podział danych, skalowanie i klasteryzacja

Kod rozdziela zbiór treningowy i testowy przed uczeniem modelu, aby nie oceniać algorytmu na danych użytych do dopasowania.

Dane wejściowe: x1–x4 są cechami liczbowymi. Podział uczący/testowy ustal przed oceną modelu; klasteryzację sprawdź pod kątem stabilności.

Co sprawdzić w wyniku: Raportuj preprocessing, seed, metrykę, liczbę klastrów/model, walidację poza próbą i analizę stabilności.

R
set.seed(2026)
dane <- na.omit(read.csv("dane.csv")[paste0("x", 1:4)])
idx <- sample(seq_len(nrow(dane)), size = floor(.70*nrow(dane)))
train <- dane[idx, ]; test <- dane[-idx, ]

mu <- sapply(train, mean); s <- sapply(train, sd)
train_z <- scale(train, center = mu, scale = s)
test_z <- scale(test, center = mu, scale = s)

km <- kmeans(train_z, centers = 3, nstart = 50)
table(km$cluster)
km$tot.withinss

# Przypisanie testu do najbliższego centroidu wymaga jawnej funkcji odległości.
Python
import pandas as pd
from sklearn.model_selection import train_test_split
from sklearn.preprocessing import StandardScaler
from sklearn.cluster import KMeans
from sklearn.metrics import silhouette_score

X = pd.read_csv("dane.csv")[["x1", "x2", "x3", "x4"]].dropna()
train, test = train_test_split(X, test_size=.30, random_state=2026)
scaler = StandardScaler().fit(train)
train_z = scaler.transform(train)
test_z = scaler.transform(test)

km = KMeans(n_clusters=3, n_init=50, random_state=2026).fit(train_z)
print("silhouette train =", silhouette_score(train_z, km.labels_))
test_clusters = km.predict(test_z)
IBM SPSS Statistics — Syntax
* Najpierw standaryzuj cechy; zapisz seed i nie oceniaj rozwiązania wyłącznie na danych uczących.
DESCRIPTIVES VARIABLES=x1 x2 x3 x4 /SAVE.

QUICK CLUSTER Zx1 Zx2 Zx3 Zx4
 /CRITERIA=CLUSTER(3) MXITER(100) CONVERGE(0)
 /METHOD=KMEANS(NOUPDATE)
 /PRINT=INITIAL FINAL DISTANCE ANOVA
 /SAVE CLUSTER.

Bibliografia oprogramowania i wykorzystanych pakietów

W przykładach użyto: R, Python, IBM SPSS Statistics, pandas, scikit-learn. W pracy badawczej podaj również faktycznie użyte wersje, które można odczytać poleceniami sessionInfo() w R oraz pip freeze lub importlib.metadata.version() w Pythonie. Cytuj wyłącznie narzędzia rzeczywiście użyte w końcowej analizie.

  1. R: R Core Team. (2026). R: A language and environment for statistical computing [Computer software]. R Foundation for Statistical Computing. https://www.R-project.org/
  2. Python: Van Rossum, G., & Drake, F. L., Jr. (2009). Python 3 reference manual. CreateSpace.
  3. IBM SPSS Statistics: IBM Corp. (2025). IBM SPSS Statistics for Macintosh (Version 31.0) [Computer software]. IBM Corp.
  4. pandas: McKinney, W. (2010). Data structures for statistical computing in Python. In S. van der Walt & J. Millman (Eds.), Proceedings of the 9th Python in Science Conference (pp. 56–61). https://doi.org/10.25080/Majora-92bf1922-00a
  5. scikit-learn: Pedregosa, F., Varoquaux, G., Gramfort, A., Michel, V., Thirion, B., Grisel, O., Blondel, M., Prettenhofer, P., Weiss, R., Dubourg, V., VanderPlas, J., Passos, A., Cournapeau, D., Brucher, M., Perrot, M., & Duchesnay, É. (2011). Scikit-learn: Machine learning in Python. Journal of Machine Learning Research, 12, 2825–2830.
BibTeX dla oprogramowania i pakietów
@manual{r-core-2026,
  author = {{R Core Team}},
  title = {R: A Language and Environment for Statistical Computing},
  organization = {R Foundation for Statistical Computing},
  address = {Vienna, Austria},
  year = {2026},
  url = {https://www.R-project.org/}
}
@book{vanrossum2009python,
  author = {Van Rossum, Guido and Drake, Fred L., Jr.},
  title = {Python 3 Reference Manual},
  publisher = {CreateSpace},
  year = {2009},
  isbn = {978-1-4414-1269-0}
}
@software{ibm2025spss,
  author = {{IBM Corp.}},
  title = {IBM SPSS Statistics for Macintosh},
  year = {2025},
  version = {31.0},
  publisher = {IBM Corp.}
}
@inproceedings{mckinney2010pandas,
  author = {McKinney, Wes},
  title = {Data Structures for Statistical Computing in Python},
  booktitle = {Proceedings of the 9th Python in Science Conference},
  editor = {van der Walt, Stéfan and Millman, Jarrod},
  year = {2010},
  pages = {56--61},
  doi = {10.25080/Majora-92bf1922-00a}
}
@article{pedregosa2011scikitlearn,
  author = {Pedregosa, Fabian and Varoquaux, Gaël and Gramfort, Alexandre and Michel, Vincent and Thirion, Bertrand and Grisel, Olivier and others},
  title = {Scikit-learn: Machine Learning in Python},
  journal = {Journal of Machine Learning Research},
  year = {2011},
  volume = {12},
  pages = {2825--2830}
}

Definicje, zalecenia interpretacyjne i sposób raportowania oparto na literaturze metodologicznej wskazanej w bibliografii (Collins et al., 2024).

Powiązane hasła

Poradniki, w których użyjesz tego pojęcia

Potrzebujesz wsparcia w analizie danych?

Wybierz ofertę dopasowaną do pracy dyplomowej albo profesjonalnego projektu naukowego.

Oferta dla badaczyOferta dla studentów

Bibliografia i dalsza literatura naukowa (APA 7)

  1. Collins, G. S., Moons, K. G. M., Dhiman, P., Riley, R. D., Beam, A. L., Van Calster, B., Ghassemi, M., Liu, X., Reitsma, J. B., van Smeden, M., Boulesteix, A.-L., Camaradou, J. C., Celi, L. A., Denaxas, S., Denniston, A. K., Glocker, B., Golub, R. M., Harvey, H., Heinze, G., … Logullo, P. (2024). TRIPOD+AI statement: Updated guidance for reporting clinical prediction models. BMJ, 385, e078378. https://doi.org/10.1136/bmj-2023-078378
  2. Peduzzi, P., Concato, J., Kemper, E., Holford, T. R., & Feinstein, A. R. (1996). A simulation study of the number of events per variable in logistic regression analysis. Journal of Clinical Epidemiology, 49(12), 1373–1379. https://doi.org/10.1016/S0895-4356(96)00236-3
  3. Lang, T. A., & Altman, D. G. (2015). Basic statistical reporting for articles published in biomedical journals: The SAMPL guidelines. International Journal of Nursing Studies, 52(1), 5–9. https://doi.org/10.1016/j.ijnurstu.2014.09.006
  4. Lakens, D. (2022). Sample size justification. Collabra: Psychology, 8(1), 33267. https://doi.org/10.1525/collabra.33267
  5. Appelbaum, M., Cooper, H., Kline, R. B., Mayo-Wilson, E., Nezu, A. M., & Rao, S. M. (2018). Journal article reporting standards for quantitative research in psychology: The APA Publications and Communications Board task force report. American Psychologist, 73(1), 3–25. https://doi.org/10.1037/amp0000191
  6. Wilkinson, L., & Task Force on Statistical Inference. (1999). Statistical methods in psychology journals: Guidelines and explanations. American Psychologist, 54(8), 594–604. https://doi.org/10.1037/0003-066X.54.8.594

Cytowania BibTeX

@article{collins2024tripod, author={Collins, Gary S. and Moons, Karel G. M. and Dhiman, Paula and Riley, Richard D. and Beam, Andrew L. and Van Calster, Ben and Ghassemi, Marzyeh and Liu, Xiaoxuan and Reitsma, Johannes B. and van Smeden, Maarten and Boulesteix, Anne-Laure and Camaradou, Jennifer Catherine and Celi, Leo Anthony and Denaxas, Spiros and Denniston, Alastair K. and Glocker, Ben and Golub, Robert M. and Harvey, Hugh and Heinze, Georg and Hoffman, Michael M. and Kengne, André Pascal and Lam, Emily and Lee, Naomi and Loder, Elizabeth W. and Maier-Hein, Lena and Mateen, Bilal A. and McCradden, Melissa D. and Oakden-Rayner, Lauren and Ordish, Johan and Parnell, Richard and Rose, Sherri and Singh, Karandeep and Wynants, Laure and Logullo, Patricia}, title={TRIPOD+AI statement: updated guidance for reporting clinical prediction models}, journal={BMJ}, year={2024}, volume={385}, pages={e078378}, doi={10.1136/bmj-2023-078378}}
@article{peduzzi1996epv, author={Peduzzi, Peter and Concato, John and Kemper, Elizabeth and Holford, Theodore R. and Feinstein, Alvan R.}, title={A simulation study of the number of events per variable in logistic regression analysis}, journal={Journal of Clinical Epidemiology}, year={1996}, volume={49}, number={12}, pages={1373--1379}, doi={10.1016/S0895-4356(96)00236-3}}
@article{lang2015sampl, author={Lang, Thomas A. and Altman, Douglas G.}, title={Basic statistical reporting for articles published in biomedical journals: the SAMPL guidelines}, journal={International Journal of Nursing Studies}, year={2015}, volume={52}, number={1}, pages={5--9}, doi={10.1016/j.ijnurstu.2014.09.006}}
@article{lakens2022sample, author={Lakens, Daniël}, title={Sample size justification}, journal={Collabra: Psychology}, year={2022}, volume={8}, number={1}, pages={33267}, doi={10.1525/collabra.33267}}
@article{appelbaum2018jars, author={Appelbaum, Mark and Cooper, Harris and Kline, Rex B. and Mayo-Wilson, Evan and Nezu, Arthur M. and Rao, Stephen M.}, title={Journal article reporting standards for quantitative research in psychology}, journal={American Psychologist}, year={2018}, volume={73}, number={1}, pages={3--25}, doi={10.1037/amp0000191}}
@article{wilkinson1999statistical, author={Wilkinson, Leland and {Task Force on Statistical Inference}}, title={Statistical methods in psychology journals: Guidelines and explanations}, journal={American Psychologist}, year={1999}, volume={54}, number={8}, pages={594--604}, doi={10.1037/0003-066X.54.8.594}}
R