- Czym jest IRT i czym różni się od klasycznej teorii testów (ten wpis)
- IRT w R krok po kroku: pakiet mirt
- Dobre pozycje testowe i liczebność próby w IRT
Czym jest teoria reagowania na pozycje testowe (IRT)?
Teoria reagowania na pozycje testowe — po angielsku item response theory, w skrócie IRT — to rodzina modeli statystycznych, które łączą nieobserwowany poziom cechy osoby z właściwościami pozycji testowych i na tej podstawie przewidują prawdopodobieństwo określonej odpowiedzi (Toland, 2014). Jednostką analizy nie jest wynik całego testu, lecz odpowiedź na pojedynczą pozycję (Lalot i in., 2025). Korzenie podejścia sięgają prac Guttmana, Lorda i Rascha (Lalot i in., 2025), a szerokie zastosowanie IRT zyskała od lat 70. XX wieku, m.in. w testach typu SAT (Yang i Kao, 2014). W polskiej literaturze spotkasz też nazwę „teoria odpowiedzi na pozycje testowe” — chodzi o to samo podejście, które jest dziś fundamentem nowoczesnej psychometrii.
Poziom cechy oznacza się grecką literą θ (theta). Zwykle ma on rozkład standardowy ze średnią 0 i odchyleniem standardowym 1, więc θ = 1 oznacza osobę o jedno odchylenie standardowe powyżej średniej, a większość wyników mieści się między −3 a 3 (Toland, 2014; Cook i Wind, 2024). W testach wiedzy θ nazywa się zdolnością, w kwestionariuszach — natężeniem cechy, np. objawów depresji czy postawy; w badaniach zdrowia preferuje się określenie „cecha latentna” (Yang i Kao, 2014).
Krzywa charakterystyczna pozycji: parametry a, b i c
Sercem IRT jest krzywa charakterystyczna pozycji (item characteristic curve, ICC): zależność prawdopodobieństwa odpowiedzi „poprawnej” lub „twierdzącej” od poziomu θ. Zwykle ma kształt litery S i rośnie monotonicznie (Toland, 2014). W modelu dwuparametrycznym (2PL) opisują ją dwa parametry (Schroeders i Gnambs, 2025):
- Trudność b (położenie) — poziom θ, przy którym prawdopodobieństwo odpowiedzi wynosi 0,5. Im wyższe b, tym trudniejsza pozycja albo tym wyższe natężenie cechy potrzebne do jej zaakceptowania. Kierunek jest odwrotny niż w klasycznym wskaźniku trudności p, gdzie wyższa wartość oznacza zadanie łatwiejsze (Toland, 2014).
- Dyskryminacja a (nachylenie) — jak szybko rośnie prawdopodobieństwo w okolicy b. Pełni rolę podobną do korelacji pozycji z wynikiem ogólnym albo ładunku czynnikowego, ale nie jest ograniczona do przedziału od −1 do 1 (Toland, 2014).
- Pseudozgadywanie c — dolna asymptota w modelu trójparametrycznym (3PL), przydatna w zadaniach wielokrotnego wyboru, które można rozwiązać przypadkiem (Lalor i in., 2016; Yang i Kao, 2014).
W starszej literaturze i w części programów wzór zawiera stałą D = 1,7, która zbliża krzywą logistyczną do normalnej ogiwy (Immekus i in., 2019; Yang i Kao, 2014). Pakiet R mirt w aktualnych wersjach podaje parametry bez tej stałej, dlatego porównując wyniki z różnych źródeł, zawsze sprawdzaj, w jakiej metryce podano dyskryminacje.
Modele IRT: Rasch, 2PL, 3PL, GRM i inne
| Model | Parametry pozycji | Typ odpowiedzi | Typowe zastosowanie |
|---|---|---|---|
| Model Rascha (1PL) | b; wspólna dyskryminacja | dychotomiczne | gdy liczy się prostota i obiektywność specyficzna; suma punktów jest statystyką dostateczną dla θ |
| 2PL | a, b | dychotomiczne | testy i kwestionariusze tak/nie; standard w badaniach zdrowia |
| 3PL | a, b, c | dychotomiczne | testy wielokrotnego wyboru |
| Model odpowiedzi stopniowanych (GRM) | a oraz k − 1 progów b | porządkowe | najczęściej stosowany dla skal Likerta |
| Model częściowego zaliczenia (PCM) i uogólniony PCM (GPCM) | progi przejść między kategoriami; w GPCM także a | porządkowe | zadania punktowane częściowo; tradycja Rascha |
| Modele wielowymiarowe, bifaktorowe i testletowe | kilka cech lub efekt wspólnego bodźca | dowolne | gdy jedna cecha nie wystarcza albo pozycje dotyczą wspólnego tekstu |
Na podstawie: Schroeders i Gnambs (2025), Zein i Akhtar (2025), Yang i Kao (2014), Lalor i in. (2016), Cook i Wind (2024), Immekus i in. (2019), Xiong i in. (2026).
W GRM każda pozycja ma jedną dyskryminację i k − 1 progów: b1 to poziom θ, przy którym z prawdopodobieństwem 0,5 osoba wybierze kategorię drugą lub wyższą, b2 — trzecią lub wyższą i tak dalej (Schroeders i Gnambs, 2025; Bean i Bowen, 2021):
P(X = k) = P(X ≥ k) − P(X ≥ k + 1)
Wybór modelu jest decyzją zarówno teoretyczną, jak i empiryczną. Modele porównuje się testem ilorazu wiarygodności oraz kryteriami AIC i BIC (Toland, 2014; Immekus i in., 2019). Uwaga na BIC przy małej liczbie respondentów: w analizie (preprincie, przed recenzją) odpowiedzi 192 modeli językowych na pytania o bezpieczeństwo BIC wskazywał model Rascha dla 7 z 8 zestawów zadań, choć test ilorazu wiarygodności odrzucał go we wszystkich, a dyskryminacje różniły się w obrębie zestawu około dziesięciokrotnie (Fonseca Rivera i in., 2026).
Informacja testu, błąd standardowy i rzetelność warunkowa
Najważniejsza praktyczna różnica między IRT a klasycznym podejściem dotyczy precyzji. Każda pozycja ma funkcję informacji, która pokazuje, jak dokładnie mierzy na różnych poziomach θ. W modelu 2PL (Fonseca Rivera i in., 2026):
Informacja pozycji jest największa w okolicy jej trudności b, a jej wysokość rośnie z kwadratem dyskryminacji. Informacje pozycji sumują się w funkcję informacji testu, a błąd standardowy oceny θ jest odwrotnością pierwiastka z informacji (Toland, 2014):
Drugi wzór to rzetelność warunkowa przy standardowym rozkładzie θ, stosowana m.in. przez Schroedersa i Gnambsa (2025) oraz Xionga i współpracowników (2026). Programy, które do informacji testu dodają wkład rozkładu a priori (np. IRTPRO), zapisują ją jako 1 − 1 / I (Toland, 2014). Daje to czytelne punkty odniesienia:
| Informacja testu I(θ) | Błąd standardowy SE(θ) | Rzetelność warunkowa |
|---|---|---|
| 4 | 0,50 | 0,80 |
| 9 | 0,33 | 0,90 |
| 19 | 0,23 | 0,95 |
Obliczenia według wzorów powyżej.
Klasyczna alfa Cronbacha jest jedną liczbą dla wszystkich osób. IRT pokazuje, dla kogo test mierzy dobrze, a dla kogo słabo. Dobrze to widać na krótkim teście LSAT7 (5 zadań, 1000 osób), dostępnym w pakiecie mirt:
IRT a klasyczna teoria testów (KTT): w czym IRT jest lepsza?
Klasyczna teoria testów (KTT, classical test theory) rozkłada wynik obserwowany na wynik prawdziwy i błąd (X = T + E) i ocenia rzetelność jednym współczynnikiem (Cook i Wind, 2024). Jest prosta i w wielu badaniach wystarczająca, ale ma ograniczenia, na które IRT odpowiada bezpośrednio:
| Kwestia | Klasyczna teoria testów | IRT |
|---|---|---|
| Jednostka analizy | wynik całego testu | odpowiedź na pozycję |
| Precyzja pomiaru | jeden błąd pomiaru dla wszystkich osób | błąd standardowy dla każdego poziomu θ i każdej osoby |
| Parametry pozycji | trudność p i korelacja rit zależne od badanej próby | przy dobrym dopasowaniu niezależne od rozkładu cechy w próbie |
| Wynik osoby | suma lub średnia punktów | θ ważone parametrami pozycji, porównywalne przy różnych zestawach pozycji |
| Skala | porządkowa suma punktów | wspólna skala logitowa dla osób i pozycji |
| Porównania grup i wersji | ograniczone | DIF, zrównywanie wersji, banki zadań, testy adaptacyjne |
Na podstawie: Toland (2014), Immekus i in. (2019), Cook i Wind (2024), Schroeders i Gnambs (2025).
Różnicę w ocenie osób widać na prostym przykładzie. W teście LSAT7 dwie osoby z tym samym wynikiem 3 punktów dostają w modelu 2PL różne oceny θ: −0,13, jeśli rozwiązały trzy pierwsze zadania, i −0,70, jeśli rozwiązały zadania 2, 4 i 5. Model waży bowiem poprawne odpowiedzi dyskryminacją zadań (obliczenia własne w pakiecie mirt). Lalor i współpracownicy (2016) pokazali to samo przy ocenie systemów przetwarzania języka: wysoka trafność odpowiedzi nie zawsze oznacza wysoki wynik θ.
IRT nie jest jednak zawsze lepszym wyborem. Wymaga większych prób, spełnienia założeń i bardziej złożonych obliczeń (Lalot i in., 2025; Immekus i in., 2019), a o wyborze metody powinno decydować pytanie badawcze (Zein i Akhtar, 2025). W prostych analizach korelacyjnych wyniki θ i średnie punktów potrafią korelować na poziomie 0,98–0,99 i dawać niemal identyczne wnioski (Lalot i in., 2025). IRT wnosi najwięcej przy budowie i skracaniu narzędzi, ocenie pojedynczych pozycji, porównaniach grup oraz testach adaptacyjnych. Mimo to wciąż jest rzadko stosowana: w 39 badaniach pomiarowych opublikowanych w latach 2013–2017 w czasopismach z psychologii edukacyjnej CFA pojawiła się w 90% z nich, a IRT — tylko w 5% (Immekus i in., 2019).
IRT a konfirmacyjna analiza czynnikowa (CFA)
IRT i konfirmacyjna analiza czynnikowa to bliscy krewni. Ładunki czynnikowe odpowiadają dyskryminacjom, progi CFA — położeniom b, a wyniki czynnikowe — ocenom θ (Bean i Bowen, 2021). Dla jednowymiarowego modelu z pozycjami porządkowymi parametry można wprost przeliczać (Takane i de Leeuw, 1987):
W tym wzorze λ to standaryzowany ładunek, a τ to próg z kategorialnej CFA. Na skali Science z pakietu mirt dyskryminacje przeliczone z ładunków CFA (np. 2,10 dla najlepszej pozycji) niemal pokrywają się z oszacowaniami IRT (2,29) — krok po kroku pokazuję to w poradniku IRT w R. Oba podejścia akcentują jednak co innego. CFA lepiej odpowiada na pytania o strukturę: liczbę czynników, ładunki krzyżowe, skorelowane błędy czy modele bifaktorowe. IRT — na pytania o pozycje i wyniki osób: krzywe kategorii, informację, precyzję warunkową i DIF (Bean i Bowen, 2021). Dlatego najlepiej stosować oba podejścia razem: najpierw ustalić strukturę w CFA, a potem ocenić pozycje w IRT (Bean i Bowen, 2021; Lalot i in., 2025). Więcej o analizie czynnikowej przeczytasz w poradniku EFA i CFA.
Założenia IRT i jak je sprawdzić
- Jednowymiarowość — odpowiedzi wyjaśnia jedna dominująca cecha. Sprawdza się ją analizą czynnikową lub analizą równoległą (Zein i Akhtar, 2025; Toland, 2014). Gdy wymiarów jest kilka, stosuje się modele wielowymiarowe albo bifaktorowe (Immekus i in., 2019).
- Lokalna niezależność — przy ustalonym θ odpowiedzi na różne pozycje są niezależne. Jej naruszenie zawyża dyskryminacje i informację oraz zaniża błędy standardowe (Toland, 2014). Typowe źródła to niemal identyczne pozycje i pozycje odwrócone (Yang i Kao, 2014) albo pytania do wspólnego tekstu (Xiong i in., 2026). Wskaźnik Q3 powyżej około |0,2| sygnalizuje problem (Zein i Akhtar, 2025).
- Monotoniczność — wyższy poziom cechy oznacza większe prawdopodobieństwo wyższych odpowiedzi (Cook i Wind, 2024).
- Niezmienniczość — parametry pozycji nie zależą od tego, kogo zbadano, a oceny osób — od tego, których pozycji użyto. Jej naruszenie ujawnia się jako zróżnicowane funkcjonowanie pozycji, czyli DIF (Cook i Wind, 2024; Yang i Kao, 2014).
Gdzie stosuje się IRT?
- Budowa i skracanie skal — wybór pozycji dostarczających najwięcej informacji w docelowym zakresie cechy (Lalot i in., 2025; Godard i in., 2026).
- Testy adaptacyjne (CAT) i banki zadań — każdy badany dostaje inne pozycje, a wyniki pozostają porównywalne (Cook i Wind, 2024). W ocenie bezpieczeństwa modeli AI (preprint) około 10 zadań dobieranych adaptacyjnie odtwarzało wyniki pełnych zestawów z błędem mniejszym o 18–34% niż 10 zadań losowych (Fonseca Rivera i in., 2026).
- Zrównywanie wersji testu i pomiar zmiany w czasie na wspólnej skali (Xiong i in., 2026; Immekus i in., 2019).
- Sprawiedliwość pomiaru — analiza DIF między płciami, kulturami czy grupami wiekowymi (Bean i Bowen, 2021; Schroeders i Gnambs, 2025).
- Ocena istniejących narzędzi — popularne skale aktywnego i pasywnego korzystania z mediów społecznościowych okazały się dostarczać zbyt mało informacji na całym zakresie cechy (Godard i in., 2026).
- Poza psychologią — ocena modeli językowych i zbiorów danych w przetwarzaniu języka naturalnego (Lalor i in., 2016, 2024) oraz modele, w których wymiary wyznacza teoria, a nie same dane, np. w naukach politycznych (Morucci i in., 2025).
Jak wygląda analiza w praktyce, pokazuję w poradniku IRT w R krok po kroku. Kryteria dobrych pozycji i sposób wyliczenia próby opisuję we wpisie dobre pozycje testowe i liczebność próby w IRT.
Najczęstsze pytania
Czym różni się IRT od klasycznej teorii testów?
Klasyczna teoria testów ocenia test jako całość i podaje jeden błąd pomiaru dla wszystkich osób. IRT modeluje każdą pozycję osobno i pokazuje precyzję pomiaru dla każdego poziomu mierzonej cechy.
Czy IRT można stosować do skali Likerta?
Tak. Do pozycji porządkowych stosuje się najczęściej model odpowiedzi stopniowanych (GRM) albo uogólniony model częściowego zaliczenia (GPCM).
Ile osób potrzeba do analizy IRT?
Nie ma uniwersalnej reguły — wymagana liczebność zależy od modelu, liczby i trudności pozycji, schematu badania oraz celu analizy. Najlepiej zaplanować ją symulacją Monte Carlo dopasowaną do konkretnego narzędzia.
W jakim programie wykonać analizę IRT?
Najpopularniejszym bezpłatnym narzędziem jest pakiet R mirt. Stosuje się też pakiety TAM, eRm i tirt, a spośród programów komercyjnych m.in. IRTPRO, flexMIRT i Mplus.
Pojęcia powiązane z tematem
Potrzebujesz analizy IRT lub walidacji skali?
Przeprowadzam analizy IRT i CFA testów oraz kwestionariuszy: kalibrację pozycji, ocenę dopasowania, informacji i rzetelności warunkowej, analizę DIF, skracanie narzędzi i planowanie liczebności próby. Pomagam też opisać wyniki tak, by spełniały standardy publikacyjne.
Zapytaj o analizę IRTOferta dla badaczyBibliografia i dalsza literatura naukowa (APA 7)
- Bean, G. J., & Bowen, N. K. (2021). Item response theory and confirmatory factor analysis: Complementary approaches for scale development. Journal of Evidence-Based Social Work, 18(6), 597–618. https://doi.org/10.1080/26408066.2021.1906813
- Chalmers, R. P. (2012). mirt: A multidimensional item response theory package for the R environment. Journal of Statistical Software, 48(6), 1–29. https://doi.org/10.18637/jss.v048.i06
- Cook, R. M., & Wind, S. A. (2024). Item response theory: A modern measurement approach to reliability and precision for counseling researchers. Measurement and Evaluation in Counseling and Development, 57(2), 116–135. https://doi.org/10.1080/07481756.2023.2301284
- Fonseca Rivera, J., Shah, N., Africa, D. D., & Voudouris, K. (2026). Item response theory for AI safety (arXiv:2608.05086) [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2608.05086
- Godard, R., Draper, Z. A., Holtzman, S., & O’Connor, B. P. (2026). (De)construction on the road ahead: Item response theory and psychometric analysis of self-report measures of active and passive social media use. Current Psychology, 45(5), Article 498. https://doi.org/10.1007/s12144-026-09064-y
- Immekus, J. C., Snyder, K. E., & Ralston, P. A. (2019). Multidimensional item response theory for factor structure assessment in educational psychology research. Frontiers in Education, 4, Article 45. https://doi.org/10.3389/feduc.2019.00045
- Lalor, J. P., Rodriguez, P., Sedoc, J., & Hernandez-Orallo, J. (2024). Item response theory for natural language processing. In Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics: Tutorial Abstracts (pp. 9–13). Association for Computational Linguistics. https://doi.org/10.18653/v1/2024.eacl-tutorials.2
- Lalor, J. P., Wu, H., & Yu, H. (2016). Building an evaluation scale using item response theory. In Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing (pp. 648–657). Association for Computational Linguistics. https://doi.org/10.18653/v1/D16-1062
- Lalot, F., Räikkönen, J., & Ahvenharju, S. (2025). An item response theory approach to measurement in environmental psychology: A practical example with environmental risk perception. Journal of Environmental Psychology, 101, Article 102520. https://doi.org/10.1016/j.jenvp.2025.102520
- Morucci, M., Foster, M. J., Webster, K., Lee, S. J., & Siegel, D. A. (2025). Measurement that matches theory: Theory-driven identification in item response theory models. American Political Science Review, 119(2), 727–745. https://doi.org/10.1017/S000305542400039X
- Schroeders, U., & Gnambs, T. (2025). Sample-size planning in item-response theory: A tutorial. Advances in Methods and Practices in Psychological Science, 8(1), 1–13. https://doi.org/10.1177/25152459251314798
- Takane, Y., & de Leeuw, J. (1987). On the relationship between item response theory and factor analysis of discretized variables. Psychometrika, 52(3), 393–408. https://doi.org/10.1007/BF02294363
- Toland, M. D. (2014). Practical guide to conducting an item response theory analysis. The Journal of Early Adolescence, 34(1), 120–151. https://doi.org/10.1177/0272431613511332
- Xiong, J., Tang, C., Tan, Y., & Liu, Q. (2026). Tirt R package: A tutorial on item response and testlet response theory modeling. Measurement: Interdisciplinary Research and Perspectives. Advance online publication. https://doi.org/10.1080/15366367.2026.2726362
- Yang, F. M., & Kao, S. T. (2014). Item response theory for measurement validity. Shanghai Archives of Psychiatry, 26(3), 171–177. https://doi.org/10.3969/j.issn.1002-0829.2014.03.010
- Zein, R. A., & Akhtar, H. (2025). Getting started with the graded response model: An introduction and tutorial in R. International Journal of Psychology, 60(1), Article e13265. https://doi.org/10.1002/ijop.13265
Cytowania BibTeX
@article{bean2021irtcfa, author={Bean, Gerald J. and Bowen, Natasha K.}, title={Item response theory and confirmatory factor analysis: Complementary approaches for scale development}, journal={Journal of Evidence-Based Social Work}, year={2021}, volume={18}, number={6}, pages={597--618}, doi={10.1080/26408066.2021.1906813}}@article{chalmers2012mirt, author={Chalmers, R. Philip}, title={mirt: A multidimensional item response theory package for the R environment}, journal={Journal of Statistical Software}, year={2012}, volume={48}, number={6}, pages={1--29}, doi={10.18637/jss.v048.i06}}@article{cook2024irt, author={Cook, Ryan M. and Wind, Stefanie A.}, title={Item response theory: A modern measurement approach to reliability and precision for counseling researchers}, journal={Measurement and Evaluation in Counseling and Development}, year={2024}, volume={57}, number={2}, pages={116--135}, doi={10.1080/07481756.2023.2301284}}@misc{fonsecarivera2026aisafety, author={Fonseca Rivera, Joshua and Shah, Neil and Africa, David Demitri and Voudouris, Konstantinos}, title={Item response theory for AI safety}, year={2026}, eprint={2608.05086}, archivePrefix={arXiv}, doi={10.48550/arXiv.2608.05086}}@article{godard2026socialmedia, author={Godard, Rebecca and Draper, Zakary A. and Holtzman, Susan and O'Connor, Brian P.}, title={(De)construction on the road ahead: Item response theory and psychometric analysis of self-report measures of active and passive social media use}, journal={Current Psychology}, year={2026}, volume={45}, number={5}, pages={498}, doi={10.1007/s12144-026-09064-y}}@article{immekus2019mirt, author={Immekus, Jason C. and Snyder, Kate E. and Ralston, Patricia A.}, title={Multidimensional item response theory for factor structure assessment in educational psychology research}, journal={Frontiers in Education}, year={2019}, volume={4}, pages={45}, doi={10.3389/feduc.2019.00045}}@inproceedings{lalor2024irtnlp, author={Lalor, John P. and Rodriguez, Pedro and Sedoc, Jo{\~a}o and Hernandez-Orallo, Jose}, title={Item response theory for natural language processing}, booktitle={Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics: Tutorial Abstracts}, year={2024}, pages={9--13}, doi={10.18653/v1/2024.eacl-tutorials.2}}@inproceedings{lalor2016scale, author={Lalor, John P. and Wu, Hao and Yu, Hong}, title={Building an evaluation scale using item response theory}, booktitle={Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing}, year={2016}, pages={648--657}, doi={10.18653/v1/D16-1062}}@article{lalot2025environmental, author={Lalot, Fanny and R{\"a}ikk{\"o}nen, Juulia and Ahvenharju, Sanna}, title={An item response theory approach to measurement in environmental psychology: A practical example with environmental risk perception}, journal={Journal of Environmental Psychology}, year={2025}, volume={101}, pages={102520}, doi={10.1016/j.jenvp.2025.102520}}@article{morucci2025theory, author={Morucci, Marco and Foster, Margaret J. and Webster, Kaitlyn and Lee, So Jin and Siegel, David A.}, title={Measurement that matches theory: Theory-driven identification in item response theory models}, journal={American Political Science Review}, year={2025}, volume={119}, number={2}, pages={727--745}, doi={10.1017/S000305542400039X}}@article{schroeders2025samplesize, author={Schroeders, Ulrich and Gnambs, Timo}, title={Sample-size planning in item-response theory: A tutorial}, journal={Advances in Methods and Practices in Psychological Science}, year={2025}, volume={8}, number={1}, pages={1--13}, doi={10.1177/25152459251314798}}@article{takane1987relationship, author={Takane, Yoshio and de Leeuw, Jan}, title={On the relationship between item response theory and factor analysis of discretized variables}, journal={Psychometrika}, year={1987}, volume={52}, number={3}, pages={393--408}, doi={10.1007/BF02294363}}@article{toland2014practical, author={Toland, Michael D.}, title={Practical guide to conducting an item response theory analysis}, journal={The Journal of Early Adolescence}, year={2014}, volume={34}, number={1}, pages={120--151}, doi={10.1177/0272431613511332}}@article{xiong2026tirt, author={Xiong, Jiawei and Tang, Cheng and Tan, Yanyan and Liu, Qidi}, title={Tirt R package: A tutorial on item response and testlet response theory modeling}, journal={Measurement: Interdisciplinary Research and Perspectives}, year={2026}, note={Advance online publication}, doi={10.1080/15366367.2026.2726362}}@article{yang2014validity, author={Yang, Frances M. and Kao, Solon T.}, title={Item response theory for measurement validity}, journal={Shanghai Archives of Psychiatry}, year={2014}, volume={26}, number={3}, pages={171--177}, doi={10.3969/j.issn.1002-0829.2014.03.010}}@article{zein2025grm, author={Zein, Rizqy Amelia and Akhtar, Hanif}, title={Getting started with the graded response model: An introduction and tutorial in R}, journal={International Journal of Psychology}, year={2025}, volume={60}, number={1}, pages={e13265}, doi={10.1002/ijop.13265}}