- Czym jest IRT i czym różni się od klasycznej teorii testów
- IRT w R krok po kroku: pakiet mirt
- Dobre pozycje testowe i liczebność próby w IRT (ten wpis)
Jak wygląda dobra pozycja testowa w IRT?
| Kryterium | Dobra pozycja | Sygnał ostrzegawczy |
|---|---|---|
| Dyskryminacja a | co najmniej umiarkowana (od 0,65); rozsądny zakres to 0,5–3,0 | poniżej 0,35; wartość ujemna (zwykle błąd kodowania); powyżej 4 — pozycja „nadwrażliwa” |
| Położenie b | w zakresie cechy, który chcesz mierzyć, zwykle od −2 do 2 | progi poza ±3; kategoria wybierana przez mniej niż 1% osób |
| Kategorie odpowiedzi | każda ma własny przedział θ, w którym jest najbardziej prawdopodobna | nakładające się kategorie; zbyt wiele kategorii |
| Dopasowanie | nieistotne S-X² (α = 0,01), RMSEA pozycji ≤ 0,05 | istotne S-X²; płaska lub niemonotoniczna krzywa empiryczna |
| Zależność lokalna | Q3 poniżej około |0,2| | niemal identyczne treści; pytania do wspólnego tekstu |
| Niezmienniczość | brak DIF między grupami | różne parametry w grupach o tym samym poziomie cechy |
| Informacja | wysoka w docelowym zakresie θ | płaska, bliska zera na całej skali |
Na podstawie: Zein i Akhtar (2025), Toland (2014), Lalot i in. (2025), Yang i Kao (2014), Immekus i in. (2019), Godard i in. (2026), Lalor i in. (2016), Bean i Bowen (2021).
Najważniejsze jest to, że jakość pozycji zależy od celu. W skali braku pozytywnego afektu pozycja o umiarkowanej dyskryminacji (a = 1,29, „miałem dużo energii”) obejmuje szeroki zakres cechy i nadaje się do przesiewu w populacji ogólnej. Pozycje o bardzo wysokiej dyskryminacji (a = 4,00 i 5,35, „byłem szczęśliwy”, „cieszyłem się życiem”) precyzyjnie różnicują osoby o podwyższonym nasileniu objawów, np. w poradni (Yang i Kao, 2014). Podobnie pozycja mało informatywna dla większości osób może być bezcenna przy pomiarze grup o bardzo wysokim natężeniu cechy (Lalot i in., 2025).
Przykłady dobrych i słabych pozycji z badań
| Pozycja (tłumaczenie) | Wyniki IRT | Ocena |
|---|---|---|
| „Czuję, że nikt mnie nie słucha” — skala izolacji społecznej dzieci | a = 2,52, b = 0,03 i 1,57, najlepsze dopasowanie (p = 0,54) | bardzo dobra |
| „Znajduję kilka rozwiązań problemu” — skala ogólnej samoskuteczności | a = 1,61, b = −0,85 i 1,48, najwięcej informacji w skali | dobra |
| „Chcę uciec z domu” — skala izolacji społecznej dzieci | 69% odpowiedzi „nigdy”, b = 0,78 i 2,29, najgorsze dopasowanie | mierzy tylko bardzo wysoką izolację |
| „Czytam lub oglądam swój feed” — skala korzystania z mediów społecznościowych | ładunki 0,29–0,41, 42% odpowiedzi w najwyższej kategorii, znikoma informacja | słaba |
| „Byłem szczęśliwy” — odwrócona pozycja skali depresji CES-D | najsłabsze dopasowanie w skali (outfit 1,24); autorzy łączą to z odwróconym brzmieniem | problematyczna |
| Para zdań do oceny wnioskowania w języku naturalnym | płaska krzywa charakterystyczna (brak różnicowania) lub niemonotoniczna | usunięta ze skali |
Źródła kolejnych wierszy: Bean i Bowen (2021); Toland (2014; dane symulowane w celach dydaktycznych); Bean i Bowen (2021); Godard i in. (2026); Cook i Wind (2024; dane symulowane na podstawie parametrów z badania klinicznego); Lalor i in. (2016). Brzmienie pozycji podano w polskim tłumaczeniu.
Z tych przykładów wynikają praktyczne zasady pisania pozycji:
- unikaj sformułowań, które można rozumieć na dwa sposoby — niejednoznaczne pozycje obniżały informację skal mediów społecznościowych (Godard i in., 2026);
- nie powielaj niemal identycznych treści, bo tworzą zależność lokalną i sztucznie zawyżają rzetelność (Yang i Kao, 2014);
- uważaj na pozycje odwrócone — mogą tworzyć dodatkowy wymiar i gorzej pasować do modelu (Yang i Kao, 2014; Cook i Wind, 2024);
- dobierz liczbę kategorii odpowiedzi do danych: 7 kategorii okazało się za dużo, 5 wystarczało (Godard i in., 2026), a kategorie rzadkie łączy się z sąsiednimi (Immekus i in., 2019);
- celuj w niepokryty zakres cechy — zamiast wydłużać skalę, dodaj pozycje dla poziomów θ, które mierzysz słabo (Bean i Bowen, 2021);
- testuj pozycje w pilotażu i wywiadach poznawczych, zanim trafią do badania właściwego (Immekus i in., 2019).
Ile osób potrzeba do analizy IRT?
W podręcznikach często pojawiają się reguły „co najmniej 250 lub 500 osób” albo „10 lub 20 osób na parametr” (za: Schroeders i Gnambs, 2025). Immekus i współpracownicy (2019) podają, że modele 1PL i 2PL z 20–30 pozycjami mogą wymagać 200–1000 osób, a pozycje wielokategorialne — więcej. Lalor i współpracownicy (2016) zbierali po około 1000 odpowiedzi na pozycję.
Schroeders i Gnambs (2025) przekonują jednak, że takie reguły rzadko są praktyczne. Przy informacjach a priori może wystarczyć 100 osób, a modele z parametrem zgadywania lub mieszaniny klas mogą nie być stabilne nawet przy 2000. Wymagana liczebność zależy od:
- rodzaju pozycji;
- modelu IRT;
- metody estymacji;
- wymiarowości;
- rozkładu cechy w populacji;
- liczby i jednorodności pozycji;
- schematu badania, w tym braków danych i pokrycia pozycji.
Przy małej liczbie respondentów pomagają rozkłady a priori na parametry. Bez nich pozycje, które idealnie rozdzielają badanych, prowadzą do rozbieżnych oszacowań (Fonseca Rivera i in., 2026).
Planowanie liczebności próby metodą symulacji Monte Carlo
Zamiast reguły kciuka można zasymulować planowane badanie: wygenerować wiele zbiorów danych z założonymi parametrami, skalibrować na nich model i sprawdzić, przy jakiej liczebności oszacowania osiągają wymaganą dokładność. Schroeders i Gnambs (2025) porządkują to w 10 decyzjach w 4 krokach:
- Generowanie danych: liczba i rozkład czynników, liczba pozycji i ich parametry, typ pozycji.
- Schemat testu i braki danych: wzorzec braków (np. schemat z pozycjami łączącymi wersje) i ich odsetek.
- Model i parametr docelowy: model IRT, program i metoda estymacji, parametry, których precyzja ma znaczenie.
- Ustawienia symulacji: liczba replikacji i siatka badanych liczebności.
Kryterium dokładności wybiera się do pytania badawczego. Może to być MSE trudności pozycji poniżej 0,05, błąd standardowy korelacji cechy z kryterium nie większy niż 0,05 albo RMSE rzetelności warunkowej nie większe niż 0,01. Liczbę replikacji R wyznacza się z odchylenia standardowego σ miary dokładności (z krótkiej symulacji pilotażowej) i dopuszczalnego błędu δ (Schroeders i Gnambs, 2025):
Na przykład przy σ = 0,5 i δ = 0,05 potrzeba około 385 replikacji. W przykładach autorów:
- zadanie łączące dwie wersje testu, o średniej trudności, osiągało MSE < 0,05 już przy 150 osobach, a łatwe zadanie (86% poprawnych), na które odpowiadała połowa próby, potrzebowało ponad 600 osób;
- dla 30 zadań 2PL błąd standardowy korelacji cechy z kryterium spadał do 0,05 przy około 500 osobach;
- w schemacie łączącym trzy kwestionariusze depresji najkrótszy z nich (9 pozycji) wymagał największej próby, by osiągnąć zakładaną precyzję rzetelności warunkowej — łącznie około 900 osób (Schroeders i Gnambs, 2025).
Przykład: symulacja dla testu i kwestionariusza
Przeprowadziłem symulację dla dwóch typowych narzędzi, po 300 replikacji dla każdej z 7 liczebności (od 100 do 1000 osób), z kryterium MSE trudności poniżej 0,05:
- Test: 20 zadań 0/1, model 2PL, dyskryminacje od 0,8 do 2,0, trudności równomiernie od −2,5 do 2,5.
- Kwestionariusz: 10 pozycji z 5 kategoriami, model GRM, dyskryminacje od 0,9 do 2,2, progi od około −2,6 do 2,4.
| N | Test 2PL: mediana MSE(b) | Test 2PL: % b z MSE < 0,05 | Kwestionariusz GRM: mediana MSE(b) | Kwestionariusz GRM: % b z MSE < 0,05 |
|---|---|---|---|---|
| 100 | 0,400 | 10% | 0,080 | 33% |
| 200 | 0,111 | 35% | 0,034 | 73% |
| 300 | 0,068 | 45% | 0,023 | 83% |
| 500 | 0,041 | 60% | 0,014 | 95% |
| 750 | 0,021 | 80% | 0,009 | 98% |
| 1000 | 0,015 | 80% | 0,007 | 100% |
Skąd ta różnica? Kluczowe są zadania skrajne. Zadanie o trudności −2,5 rozwiązuje około 96% osób, a zadanie o trudności 2,5 — tylko 8%. Ich trudność szacuje się więc na podstawie garstki nietypowych odpowiedzi:
Wniosek praktyczny: liczebność wyznaczają najtrudniejsze do oszacowania parametry, które są dla Ciebie ważne. Jeśli najłatwiejsze i najtrudniejsze zadania mają tylko „domknąć” skalę, możesz zaakceptować mniejszą precyzję ich trudności. Jeśli jednak na ich podstawie ustalasz punkty odcięcia albo budujesz test adaptacyjny, zaplanuj większą próbę. Przy N = 100 w około 15% replikacji testu 2PL model nie osiągał zbieżności albo któreś zadanie nie miało zmienności — to kolejny argument przeciwko bardzo małym próbom. Kod symulacji znajdziesz niżej i łatwo go dopasujesz do własnych parametrów.
Przeliczenia statystyczne w IRT
Raportując i porównując wyniki IRT, często trzeba przeliczać parametry między parametryzacjami i skalami:
| Przeliczenie | Wzór | Źródło |
|---|---|---|
| Parametryzacja z wyrazem wolnym (mirt) ↔ trudność | d = −a · b, b = −d / a | Schroeders i Gnambs (2025); Chalmers (2012) |
| Metryka normalna ↔ logistyczna | alogistyczne ≈ 1,702 · anormalne | Immekus i in. (2019); Chalmers (2012) |
| Ładunek CFA → dyskryminacja | a = 1,702 · λ / √(1 − λ²) | Takane i de Leeuw (1987) |
| Dyskryminacja → ładunek CFA | λ = (a / 1,702) / √(1 + (a / 1,702)²) | Takane i de Leeuw (1987) |
| Próg CFA → trudność | b = τ / λ | Takane i de Leeuw (1987) |
| Informacja → błąd standardowy | SE(θ) = 1 / √I(θ) | Toland (2014) |
| Informacja → rzetelność warunkowa | I(θ) / [I(θ) + 1]; gdy informacja zawiera wkład rozkładu a priori: 1 − 1 / I(θ) | Schroeders i Gnambs (2025); Toland (2014) |
| θ → wynik T i centyl | T = 50 + 10 · θ; centyl = Φ(θ) | np. θ = 1,54 to około 94. centyl (Lalor i in., 2016) |
Dwa przeliczenia wymagają dłuższego komentarza:
- Suma punktów → θ. W praktyce często potrzebna jest tabela przeliczeń wyniku sumarycznego na θ. W pakiecie mirt daje ją metoda EAPsum; dla testu LSAT7 0 punktów to θ = −1,87, 3 punkty to −0,41, a 5 punktów to 0,73 (szczegóły w poradniku IRT w R).
- Zrównywanie wersji testu. Parametry dwóch kalibracji przenosi się na wspólną skalę przez zadania wspólne (kotwiczące). W metodzie Mean–Sigma stałe A = SD(bbazowe) / SD(bnowe) i B = M(bbazowe) − A · M(bnowe) przekształcają trudności (b* = A · b + B) i dyskryminacje (a* = a / A). Metoda Stocking–Lord dopasowuje całe charakterystyki testu i bywa odporniejsza (por. Xiong i in., 2026).
Lista kontrolna przed kalibracją IRT
- Określ, dla jakiego zakresu cechy narzędzie ma mierzyć najdokładniej.
- Zaplanuj pozycje pokrywające ten zakres i sprawdź je w pilotażu.
- Wybierz model zgodny z formatem odpowiedzi (Rasch, 2PL, 3PL, GRM, GPCM).
- Zaplanuj liczebność symulacją, z realistycznymi parametrami i schematem braków danych.
- Po zebraniu danych sprawdź liczebności kategorii, wymiarowość, dopasowanie, Q3 i DIF.
- Oceń informację testu w docelowym zakresie θ i dopiero wtedy decyduj o usuwaniu lub dodawaniu pozycji.
Kod R: symulacja liczebności próby
Szablon odtwarza scenariusz testu 2PL z tego wpisu (R 4.5.3, mirt 1.47). Podmień parametry a i b na wartości z pilotażu lub literatury, a w funkcji replikacji — model i parametr docelowy. Czas obliczeń: około minuty na 4 rdzeniach.
Symulacja Monte Carlo dla modelu 2PL
R
library(mirt)
library(parallel)
RNGkind("L'Ecuyer-CMRG")
set.seed(2026)
# 1. Założone parametry zadań: z pilotażu, literatury lub banku zadań
a <- c(1.91, 1.07, 1.36, 1.73, 0.88, 1.02, 1.50, 0.97, 1.82, 2.00,
0.84, 1.12, 1.18, 1.43, 0.92, 1.65, 1.30, 1.57, 0.80, 1.23)
b <- seq(-2.5, 2.5, length.out = 20)
# 2. Jedna replikacja: symulacja odpowiedzi -> kalibracja 2PL -> błąd kwadratowy b
replikacja <- function(N) {
dane <- simdata(a = a, d = matrix(-a * b), N = N, itemtype = "dich")
if (any(apply(dane, 2, var) == 0)) return(NULL) # zadanie bez zmienności
m <- mirt(dane, 1, itemtype = "2PL", verbose = FALSE)
if (!extract.mirt(m, "converged")) return(NULL)
(coef(m, IRTpars = TRUE, simplify = TRUE)$items[, "b"] - b)^2
}
# 3. Siatka liczebności i 300 replikacji na wariant
# (na Windows ustaw mc.cores = 1)
wyniki <- t(sapply(c(200, 300, 500, 750, 1000), function(N) {
bledy <- do.call(rbind, mclapply(1:300, function(i) replikacja(N), mc.cores = 4))
mse_b <- colMeans(bledy)
c(N = N, replikacje = nrow(bledy), mse_mediana = median(mse_b),
mse_max = max(mse_b), procent_ok = mean(mse_b < 0.05) * 100)
}))
round(wyniki, 3)
# 4. Liczba replikacji potrzebna do zadanej dokładności (Schroeders i Gnambs, 2025)
sigma <- 0.5; delta <- 0.05
ceiling((qnorm(0.975) * sigma / delta)^2)Bibliografia oprogramowania i wykorzystanych pakietów
W przykładzie użyto: R, mirt (pakiet parallel jest częścią R).
- R: R Core Team. (2026). R: A language and environment for statistical computing (Version 4.5.3) [Computer software]. R Foundation for Statistical Computing. https://www.R-project.org/
- mirt (wersja 1.47): Chalmers, R. P. (2012). mirt: A multidimensional item response theory package for the R environment. Journal of Statistical Software, 48(6), 1–29. https://doi.org/10.18637/jss.v048.i06
Najczęstsze pytania
Czy 200 osób wystarczy do analizy IRT?
Czasem tak, czasem nie. Dla pozycji o średniej trudności i dobrze dobranego modelu może wystarczyć, ale pozycje bardzo łatwe lub bardzo trudne, modele z parametrem zgadywania i analizy w podgrupach wymagają znacznie większych prób. Bezpieczniej zaplanować liczebność symulacją.
Jak sprawdzić, czy pozycja testowa jest dobra?
Dobra pozycja ma co najmniej umiarkowaną dyskryminację, położenie w zakresie cechy, który chcesz mierzyć, dobrze działające kategorie odpowiedzi, poprawne dopasowanie, brak zależności lokalnej i brak DIF, a przede wszystkim dostarcza informacji tam, gdzie jest potrzebna.
Czym jest MSE w planowaniu liczebności próby?
MSE to średni kwadrat różnicy między oszacowanym a prawdziwym parametrem w symulacji. Łączy obciążenie i zmienność oszacowań; w planowaniu próby dla IRT często przyjmuje się, że MSE trudności pozycji powinno być niższe niż 0,05.
Pojęcia powiązane z tematem
Planujesz test lub kwestionariusz analizowany w IRT?
Przygotuję symulację liczebności próby dopasowaną do Twojego narzędzia i schematu badania, ocenię pozycje z pilotażu, skalibruję bank zadań i przeliczę wyniki na skale standardowe. Otrzymasz raport z kodem R, który możesz dołączyć do wniosku grantowego, prerejestracji lub pracy.
Zaplanuj badanie IRTOferta dla badaczyBibliografia i dalsza literatura naukowa (APA 7)
- Bean, G. J., & Bowen, N. K. (2021). Item response theory and confirmatory factor analysis: Complementary approaches for scale development. Journal of Evidence-Based Social Work, 18(6), 597–618. https://doi.org/10.1080/26408066.2021.1906813
- Chalmers, R. P. (2012). mirt: A multidimensional item response theory package for the R environment. Journal of Statistical Software, 48(6), 1–29. https://doi.org/10.18637/jss.v048.i06
- Cook, R. M., & Wind, S. A. (2024). Item response theory: A modern measurement approach to reliability and precision for counseling researchers. Measurement and Evaluation in Counseling and Development, 57(2), 116–135. https://doi.org/10.1080/07481756.2023.2301284
- Fonseca Rivera, J., Shah, N., Africa, D. D., & Voudouris, K. (2026). Item response theory for AI safety (arXiv:2608.05086) [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2608.05086
- Godard, R., Draper, Z. A., Holtzman, S., & O’Connor, B. P. (2026). (De)construction on the road ahead: Item response theory and psychometric analysis of self-report measures of active and passive social media use. Current Psychology, 45(5), Article 498. https://doi.org/10.1007/s12144-026-09064-y
- Immekus, J. C., Snyder, K. E., & Ralston, P. A. (2019). Multidimensional item response theory for factor structure assessment in educational psychology research. Frontiers in Education, 4, Article 45. https://doi.org/10.3389/feduc.2019.00045
- Lalor, J. P., Wu, H., & Yu, H. (2016). Building an evaluation scale using item response theory. In Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing (pp. 648–657). Association for Computational Linguistics. https://doi.org/10.18653/v1/D16-1062
- Lalot, F., Räikkönen, J., & Ahvenharju, S. (2025). An item response theory approach to measurement in environmental psychology: A practical example with environmental risk perception. Journal of Environmental Psychology, 101, Article 102520. https://doi.org/10.1016/j.jenvp.2025.102520
- Schroeders, U., & Gnambs, T. (2025). Sample-size planning in item-response theory: A tutorial. Advances in Methods and Practices in Psychological Science, 8(1), 1–13. https://doi.org/10.1177/25152459251314798
- Takane, Y., & de Leeuw, J. (1987). On the relationship between item response theory and factor analysis of discretized variables. Psychometrika, 52(3), 393–408. https://doi.org/10.1007/BF02294363
- Toland, M. D. (2014). Practical guide to conducting an item response theory analysis. The Journal of Early Adolescence, 34(1), 120–151. https://doi.org/10.1177/0272431613511332
- Xiong, J., Tang, C., Tan, Y., & Liu, Q. (2026). Tirt R package: A tutorial on item response and testlet response theory modeling. Measurement: Interdisciplinary Research and Perspectives. Advance online publication. https://doi.org/10.1080/15366367.2026.2726362
- Yang, F. M., & Kao, S. T. (2014). Item response theory for measurement validity. Shanghai Archives of Psychiatry, 26(3), 171–177. https://doi.org/10.3969/j.issn.1002-0829.2014.03.010
- Zein, R. A., & Akhtar, H. (2025). Getting started with the graded response model: An introduction and tutorial in R. International Journal of Psychology, 60(1), Article e13265. https://doi.org/10.1002/ijop.13265
Kategorie dyskryminacji Bakera przytoczono za Zein i Akhtar (2025); reguły kciuka dotyczące liczebności próby — za Schroedersem i Gnambsem (2025).
Cytowania BibTeX
@article{bean2021irtcfa, author={Bean, Gerald J. and Bowen, Natasha K.}, title={Item response theory and confirmatory factor analysis: Complementary approaches for scale development}, journal={Journal of Evidence-Based Social Work}, year={2021}, volume={18}, number={6}, pages={597--618}, doi={10.1080/26408066.2021.1906813}}@article{chalmers2012mirt, author={Chalmers, R. Philip}, title={mirt: A multidimensional item response theory package for the R environment}, journal={Journal of Statistical Software}, year={2012}, volume={48}, number={6}, pages={1--29}, doi={10.18637/jss.v048.i06}}@article{cook2024irt, author={Cook, Ryan M. and Wind, Stefanie A.}, title={Item response theory: A modern measurement approach to reliability and precision for counseling researchers}, journal={Measurement and Evaluation in Counseling and Development}, year={2024}, volume={57}, number={2}, pages={116--135}, doi={10.1080/07481756.2023.2301284}}@misc{fonsecarivera2026aisafety, author={Fonseca Rivera, Joshua and Shah, Neil and Africa, David Demitri and Voudouris, Konstantinos}, title={Item response theory for AI safety}, year={2026}, eprint={2608.05086}, archivePrefix={arXiv}, doi={10.48550/arXiv.2608.05086}}@article{godard2026socialmedia, author={Godard, Rebecca and Draper, Zakary A. and Holtzman, Susan and O'Connor, Brian P.}, title={(De)construction on the road ahead: Item response theory and psychometric analysis of self-report measures of active and passive social media use}, journal={Current Psychology}, year={2026}, volume={45}, number={5}, pages={498}, doi={10.1007/s12144-026-09064-y}}@article{immekus2019mirt, author={Immekus, Jason C. and Snyder, Kate E. and Ralston, Patricia A.}, title={Multidimensional item response theory for factor structure assessment in educational psychology research}, journal={Frontiers in Education}, year={2019}, volume={4}, pages={45}, doi={10.3389/feduc.2019.00045}}@inproceedings{lalor2016scale, author={Lalor, John P. and Wu, Hao and Yu, Hong}, title={Building an evaluation scale using item response theory}, booktitle={Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing}, year={2016}, pages={648--657}, doi={10.18653/v1/D16-1062}}@article{lalot2025environmental, author={Lalot, Fanny and R{\"a}ikk{\"o}nen, Juulia and Ahvenharju, Sanna}, title={An item response theory approach to measurement in environmental psychology: A practical example with environmental risk perception}, journal={Journal of Environmental Psychology}, year={2025}, volume={101}, pages={102520}, doi={10.1016/j.jenvp.2025.102520}}@article{schroeders2025samplesize, author={Schroeders, Ulrich and Gnambs, Timo}, title={Sample-size planning in item-response theory: A tutorial}, journal={Advances in Methods and Practices in Psychological Science}, year={2025}, volume={8}, number={1}, pages={1--13}, doi={10.1177/25152459251314798}}@article{takane1987relationship, author={Takane, Yoshio and de Leeuw, Jan}, title={On the relationship between item response theory and factor analysis of discretized variables}, journal={Psychometrika}, year={1987}, volume={52}, number={3}, pages={393--408}, doi={10.1007/BF02294363}}@article{toland2014practical, author={Toland, Michael D.}, title={Practical guide to conducting an item response theory analysis}, journal={The Journal of Early Adolescence}, year={2014}, volume={34}, number={1}, pages={120--151}, doi={10.1177/0272431613511332}}@article{xiong2026tirt, author={Xiong, Jiawei and Tang, Cheng and Tan, Yanyan and Liu, Qidi}, title={Tirt R package: A tutorial on item response and testlet response theory modeling}, journal={Measurement: Interdisciplinary Research and Perspectives}, year={2026}, note={Advance online publication}, doi={10.1080/15366367.2026.2726362}}@article{yang2014validity, author={Yang, Frances M. and Kao, Solon T.}, title={Item response theory for measurement validity}, journal={Shanghai Archives of Psychiatry}, year={2014}, volume={26}, number={3}, pages={171--177}, doi={10.3969/j.issn.1002-0829.2014.03.010}}@article{zein2025grm, author={Zein, Rizqy Amelia and Akhtar, Hanif}, title={Getting started with the graded response model: An introduction and tutorial in R}, journal={International Journal of Psychology}, year={2025}, volume={60}, number={1}, pages={e13265}, doi={10.1002/ijop.13265}}