Psychometria · Cykl o IRT

Dobre pozycje testowe i liczebność próby w IRT: kryteria, symulacja i przeliczenia

Kryteria dobrej pozycji w teorii reagowania na pozycje testowe, przykłady dobrych i słabych pozycji z badań, planowanie liczebności próby symulacją Monte Carlo w R oraz najważniejsze przeliczenia parametrów i wyników.

Strona główna / Blog / Dobre pozycje i liczebność próby w IRT
W skrócie: dobra pozycja w IRT to nie tylko wysoka dyskryminacja, ale przede wszystkim informacja w tym zakresie cechy, który chcesz mierzyć. Liczebności próby nie da się rzetelnie ustalić regułą kciuka — zależy od modelu, trudności pozycji, schematu badania i celu analizy. Najlepiej zaplanować ją symulacją Monte Carlo. W naszej symulacji 500 osób wystarczyło dla 95% progów kwestionariusza GRM, ale tylko dla 60% trudności zadań testu 2PL, bo zadania skrajne wymagają ponad 1000 osób.
Cykl o IRT — teoria reagowania na pozycje testowe:
  1. Czym jest IRT i czym różni się od klasycznej teorii testów
  2. IRT w R krok po kroku: pakiet mirt
  3. Dobre pozycje testowe i liczebność próby w IRT (ten wpis)

Jak wygląda dobra pozycja testowa w IRT?

Kryteria dobrej pozycji testowej w IRT
KryteriumDobra pozycjaSygnał ostrzegawczy
Dyskryminacja aco najmniej umiarkowana (od 0,65); rozsądny zakres to 0,5–3,0poniżej 0,35; wartość ujemna (zwykle błąd kodowania); powyżej 4 — pozycja „nadwrażliwa”
Położenie bw zakresie cechy, który chcesz mierzyć, zwykle od −2 do 2progi poza ±3; kategoria wybierana przez mniej niż 1% osób
Kategorie odpowiedzikażda ma własny przedział θ, w którym jest najbardziej prawdopodobnanakładające się kategorie; zbyt wiele kategorii
Dopasowanienieistotne S-X² (α = 0,01), RMSEA pozycji ≤ 0,05istotne S-X²; płaska lub niemonotoniczna krzywa empiryczna
Zależność lokalnaQ3 poniżej około |0,2|niemal identyczne treści; pytania do wspólnego tekstu
Niezmienniczośćbrak DIF między grupamiróżne parametry w grupach o tym samym poziomie cechy
Informacjawysoka w docelowym zakresie θpłaska, bliska zera na całej skali

Na podstawie: Zein i Akhtar (2025), Toland (2014), Lalot i in. (2025), Yang i Kao (2014), Immekus i in. (2019), Godard i in. (2026), Lalor i in. (2016), Bean i Bowen (2021).

Najważniejsze jest to, że jakość pozycji zależy od celu. W skali braku pozytywnego afektu pozycja o umiarkowanej dyskryminacji (a = 1,29, „miałem dużo energii”) obejmuje szeroki zakres cechy i nadaje się do przesiewu w populacji ogólnej. Pozycje o bardzo wysokiej dyskryminacji (a = 4,00 i 5,35, „byłem szczęśliwy”, „cieszyłem się życiem”) precyzyjnie różnicują osoby o podwyższonym nasileniu objawów, np. w poradni (Yang i Kao, 2014). Podobnie pozycja mało informatywna dla większości osób może być bezcenna przy pomiarze grup o bardzo wysokim natężeniu cechy (Lalot i in., 2025).

Przykłady dobrych i słabych pozycji z badań

Przykłady dobrych i słabych pozycji testowych z opublikowanych analiz IRT
Pozycja (tłumaczenie)Wyniki IRTOcena
„Czuję, że nikt mnie nie słucha” — skala izolacji społecznej dziecia = 2,52, b = 0,03 i 1,57, najlepsze dopasowanie (p = 0,54)bardzo dobra
„Znajduję kilka rozwiązań problemu” — skala ogólnej samoskutecznościa = 1,61, b = −0,85 i 1,48, najwięcej informacji w skalidobra
„Chcę uciec z domu” — skala izolacji społecznej dzieci69% odpowiedzi „nigdy”, b = 0,78 i 2,29, najgorsze dopasowaniemierzy tylko bardzo wysoką izolację
„Czytam lub oglądam swój feed” — skala korzystania z mediów społecznościowychładunki 0,29–0,41, 42% odpowiedzi w najwyższej kategorii, znikoma informacjasłaba
„Byłem szczęśliwy” — odwrócona pozycja skali depresji CES-Dnajsłabsze dopasowanie w skali (outfit 1,24); autorzy łączą to z odwróconym brzmieniemproblematyczna
Para zdań do oceny wnioskowania w języku naturalnympłaska krzywa charakterystyczna (brak różnicowania) lub niemonotonicznausunięta ze skali

Źródła kolejnych wierszy: Bean i Bowen (2021); Toland (2014; dane symulowane w celach dydaktycznych); Bean i Bowen (2021); Godard i in. (2026); Cook i Wind (2024; dane symulowane na podstawie parametrów z badania klinicznego); Lalor i in. (2016). Brzmienie pozycji podano w polskim tłumaczeniu.

Z tych przykładów wynikają praktyczne zasady pisania pozycji:

  • unikaj sformułowań, które można rozumieć na dwa sposoby — niejednoznaczne pozycje obniżały informację skal mediów społecznościowych (Godard i in., 2026);
  • nie powielaj niemal identycznych treści, bo tworzą zależność lokalną i sztucznie zawyżają rzetelność (Yang i Kao, 2014);
  • uważaj na pozycje odwrócone — mogą tworzyć dodatkowy wymiar i gorzej pasować do modelu (Yang i Kao, 2014; Cook i Wind, 2024);
  • dobierz liczbę kategorii odpowiedzi do danych: 7 kategorii okazało się za dużo, 5 wystarczało (Godard i in., 2026), a kategorie rzadkie łączy się z sąsiednimi (Immekus i in., 2019);
  • celuj w niepokryty zakres cechy — zamiast wydłużać skalę, dodaj pozycje dla poziomów θ, które mierzysz słabo (Bean i Bowen, 2021);
  • testuj pozycje w pilotażu i wywiadach poznawczych, zanim trafią do badania właściwego (Immekus i in., 2019).

Ile osób potrzeba do analizy IRT?

W podręcznikach często pojawiają się reguły „co najmniej 250 lub 500 osób” albo „10 lub 20 osób na parametr” (za: Schroeders i Gnambs, 2025). Immekus i współpracownicy (2019) podają, że modele 1PL i 2PL z 20–30 pozycjami mogą wymagać 200–1000 osób, a pozycje wielokategorialne — więcej. Lalor i współpracownicy (2016) zbierali po około 1000 odpowiedzi na pozycję.

Schroeders i Gnambs (2025) przekonują jednak, że takie reguły rzadko są praktyczne. Przy informacjach a priori może wystarczyć 100 osób, a modele z parametrem zgadywania lub mieszaniny klas mogą nie być stabilne nawet przy 2000. Wymagana liczebność zależy od:

  1. rodzaju pozycji;
  2. modelu IRT;
  3. metody estymacji;
  4. wymiarowości;
  5. rozkładu cechy w populacji;
  6. liczby i jednorodności pozycji;
  7. schematu badania, w tym braków danych i pokrycia pozycji.

Przy małej liczbie respondentów pomagają rozkłady a priori na parametry. Bez nich pozycje, które idealnie rozdzielają badanych, prowadzą do rozbieżnych oszacowań (Fonseca Rivera i in., 2026).

Planowanie liczebności próby metodą symulacji Monte Carlo

Zamiast reguły kciuka można zasymulować planowane badanie: wygenerować wiele zbiorów danych z założonymi parametrami, skalibrować na nich model i sprawdzić, przy jakiej liczebności oszacowania osiągają wymaganą dokładność. Schroeders i Gnambs (2025) porządkują to w 10 decyzjach w 4 krokach:

  1. Generowanie danych: liczba i rozkład czynników, liczba pozycji i ich parametry, typ pozycji.
  2. Schemat testu i braki danych: wzorzec braków (np. schemat z pozycjami łączącymi wersje) i ich odsetek.
  3. Model i parametr docelowy: model IRT, program i metoda estymacji, parametry, których precyzja ma znaczenie.
  4. Ustawienia symulacji: liczba replikacji i siatka badanych liczebności.

Kryterium dokładności wybiera się do pytania badawczego. Może to być MSE trudności pozycji poniżej 0,05, błąd standardowy korelacji cechy z kryterium nie większy niż 0,05 albo RMSE rzetelności warunkowej nie większe niż 0,01. Liczbę replikacji R wyznacza się z odchylenia standardowego σ miary dokładności (z krótkiej symulacji pilotażowej) i dopuszczalnego błędu δ (Schroeders i Gnambs, 2025):

R = (z1−α/2 · σ / δ)²

Na przykład przy σ = 0,5 i δ = 0,05 potrzeba około 385 replikacji. W przykładach autorów:

  • zadanie łączące dwie wersje testu, o średniej trudności, osiągało MSE < 0,05 już przy 150 osobach, a łatwe zadanie (86% poprawnych), na które odpowiadała połowa próby, potrzebowało ponad 600 osób;
  • dla 30 zadań 2PL błąd standardowy korelacji cechy z kryterium spadał do 0,05 przy około 500 osobach;
  • w schemacie łączącym trzy kwestionariusze depresji najkrótszy z nich (9 pozycji) wymagał największej próby, by osiągnąć zakładaną precyzję rzetelności warunkowej — łącznie około 900 osób (Schroeders i Gnambs, 2025).

Przykład: symulacja dla testu i kwestionariusza

Przeprowadziłem symulację dla dwóch typowych narzędzi, po 300 replikacji dla każdej z 7 liczebności (od 100 do 1000 osób), z kryterium MSE trudności poniżej 0,05:

  • Test: 20 zadań 0/1, model 2PL, dyskryminacje od 0,8 do 2,0, trudności równomiernie od −2,5 do 2,5.
  • Kwestionariusz: 10 pozycji z 5 kategoriami, model GRM, dyskryminacje od 0,9 do 2,2, progi od około −2,6 do 2,4.
Odsetek parametrów trudności z MSE poniżej 0,05 w zależności od liczebności próbySymulacja Monte Carlo, 300 replikacji na wariant. Test 20 zadań 2PL: od 10% przy N = 100 do 80% przy N = 1000. Kwestionariusz 10 pozycji GRM: od 33% przy N = 100 do 95% przy N = 500 i 100% przy N = 1000. Test: 20 zadań, model 2PL Kwestionariusz: 10 pozycji × 5 kategorii, GRM 0% 25% 50% 75% 100% 100 200 300 500 750 1 000 Liczebność próby N Parametry b z MSE < 0,05 80% 95%
Rycina 1. Odsetek parametrów trudności, które osiągają MSE < 0,05, w zależności od liczebności próby. W kwestionariuszu GRM 95% progów spełnia kryterium przy 500 osobach, a wszystkie przy 1000. W teście 2PL nawet przy 1000 osobach kryterium spełnia 80% trudności. Symulacja własna (300 replikacji na wariant, pakiet mirt).
Wyniki symulacji liczebności próby
NTest 2PL: mediana MSE(b)Test 2PL: % b z MSE < 0,05Kwestionariusz GRM: mediana MSE(b)Kwestionariusz GRM: % b z MSE < 0,05
1000,40010%0,08033%
2000,11135%0,03473%
3000,06845%0,02383%
5000,04160%0,01495%
7500,02180%0,00998%
10000,01580%0,007100%

Skąd ta różnica? Kluczowe są zadania skrajne. Zadanie o trudności −2,5 rozwiązuje około 96% osób, a zadanie o trudności 2,5 — tylko 8%. Ich trudność szacuje się więc na podstawie garstki nietypowych odpowiedzi:

Błąd oszacowania trudności zadań w zależności od ich trudnościMSE parametru b dla 20 zadań testu przy N = 500 i N = 1000. Zadania o trudności bliskiej zera mają MSE około 0,003–0,016, a zadania skrajne (b = ±2,5) około 0,05–0,17. N = 500 N = 1000 0,00 0,05 0,10 0,15 −2,5 −1,5 −0,5 0,5 1,5 2,5 Prawdziwa trudność zadania b MSE oszacowania b kryterium MSE < 0,05
Rycina 2. Błąd oszacowania trudności poszczególnych zadań testu 2PL. Zadania o trudności bliskiej zera osiągają MSE 0,006–0,017 przy 500 osobach i 0,003–0,009 przy 1000, a cztery zadania skrajne pozostają powyżej 0,05 nawet przy 1000 osobach (MSE 0,054–0,098). Symulacja własna, pakiet mirt.

Wniosek praktyczny: liczebność wyznaczają najtrudniejsze do oszacowania parametry, które są dla Ciebie ważne. Jeśli najłatwiejsze i najtrudniejsze zadania mają tylko „domknąć” skalę, możesz zaakceptować mniejszą precyzję ich trudności. Jeśli jednak na ich podstawie ustalasz punkty odcięcia albo budujesz test adaptacyjny, zaplanuj większą próbę. Przy N = 100 w około 15% replikacji testu 2PL model nie osiągał zbieżności albo któreś zadanie nie miało zmienności — to kolejny argument przeciwko bardzo małym próbom. Kod symulacji znajdziesz niżej i łatwo go dopasujesz do własnych parametrów.

Przeliczenia statystyczne w IRT

Raportując i porównując wyniki IRT, często trzeba przeliczać parametry między parametryzacjami i skalami:

Najczęstsze przeliczenia w IRT
PrzeliczenieWzórŹródło
Parametryzacja z wyrazem wolnym (mirt) ↔ trudnośćd = −a · b,   b = −d / aSchroeders i Gnambs (2025); Chalmers (2012)
Metryka normalna ↔ logistycznaalogistyczne ≈ 1,702 · anormalneImmekus i in. (2019); Chalmers (2012)
Ładunek CFA → dyskryminacjaa = 1,702 · λ / √(1 − λ²)Takane i de Leeuw (1987)
Dyskryminacja → ładunek CFAλ = (a / 1,702) / √(1 + (a / 1,702)²)Takane i de Leeuw (1987)
Próg CFA → trudnośćb = τ / λTakane i de Leeuw (1987)
Informacja → błąd standardowySE(θ) = 1 / √I(θ)Toland (2014)
Informacja → rzetelność warunkowaI(θ) / [I(θ) + 1]; gdy informacja zawiera wkład rozkładu a priori: 1 − 1 / I(θ)Schroeders i Gnambs (2025); Toland (2014)
θ → wynik T i centylT = 50 + 10 · θ; centyl = Φ(θ)np. θ = 1,54 to około 94. centyl (Lalor i in., 2016)

Dwa przeliczenia wymagają dłuższego komentarza:

  • Suma punktów → θ. W praktyce często potrzebna jest tabela przeliczeń wyniku sumarycznego na θ. W pakiecie mirt daje ją metoda EAPsum; dla testu LSAT7 0 punktów to θ = −1,87, 3 punkty to −0,41, a 5 punktów to 0,73 (szczegóły w poradniku IRT w R).
  • Zrównywanie wersji testu. Parametry dwóch kalibracji przenosi się na wspólną skalę przez zadania wspólne (kotwiczące). W metodzie Mean–Sigma stałe A = SD(bbazowe) / SD(bnowe) i B = M(bbazowe) − A · M(bnowe) przekształcają trudności (b* = A · b + B) i dyskryminacje (a* = a / A). Metoda Stocking–Lord dopasowuje całe charakterystyki testu i bywa odporniejsza (por. Xiong i in., 2026).

Lista kontrolna przed kalibracją IRT

  1. Określ, dla jakiego zakresu cechy narzędzie ma mierzyć najdokładniej.
  2. Zaplanuj pozycje pokrywające ten zakres i sprawdź je w pilotażu.
  3. Wybierz model zgodny z formatem odpowiedzi (Rasch, 2PL, 3PL, GRM, GPCM).
  4. Zaplanuj liczebność symulacją, z realistycznymi parametrami i schematem braków danych.
  5. Po zebraniu danych sprawdź liczebności kategorii, wymiarowość, dopasowanie, Q3 i DIF.
  6. Oceń informację testu w docelowym zakresie θ i dopiero wtedy decyduj o usuwaniu lub dodawaniu pozycji.
Przykład reprodukowalny

Kod R: symulacja liczebności próby

Szablon odtwarza scenariusz testu 2PL z tego wpisu (R 4.5.3, mirt 1.47). Podmień parametry a i b na wartości z pilotażu lub literatury, a w funkcji replikacji — model i parametr docelowy. Czas obliczeń: około minuty na 4 rdzeniach.

Symulacja Monte Carlo dla modelu 2PL

Dane wejściowe: założone dyskryminacje a i trudności b zadań.

Co odczytać: medianę i maksimum MSE trudności oraz odsetek zadań spełniających kryterium MSE < 0,05 dla każdej liczebności.

R
library(mirt)
library(parallel)
RNGkind("L'Ecuyer-CMRG")
set.seed(2026)

# 1. Założone parametry zadań: z pilotażu, literatury lub banku zadań
a <- c(1.91, 1.07, 1.36, 1.73, 0.88, 1.02, 1.50, 0.97, 1.82, 2.00,
       0.84, 1.12, 1.18, 1.43, 0.92, 1.65, 1.30, 1.57, 0.80, 1.23)
b <- seq(-2.5, 2.5, length.out = 20)

# 2. Jedna replikacja: symulacja odpowiedzi -> kalibracja 2PL -> błąd kwadratowy b
replikacja <- function(N) {
  dane <- simdata(a = a, d = matrix(-a * b), N = N, itemtype = "dich")
  if (any(apply(dane, 2, var) == 0)) return(NULL)        # zadanie bez zmienności
  m <- mirt(dane, 1, itemtype = "2PL", verbose = FALSE)
  if (!extract.mirt(m, "converged")) return(NULL)
  (coef(m, IRTpars = TRUE, simplify = TRUE)$items[, "b"] - b)^2
}

# 3. Siatka liczebności i 300 replikacji na wariant
# (na Windows ustaw mc.cores = 1)
wyniki <- t(sapply(c(200, 300, 500, 750, 1000), function(N) {
  bledy <- do.call(rbind, mclapply(1:300, function(i) replikacja(N), mc.cores = 4))
  mse_b <- colMeans(bledy)
  c(N = N, replikacje = nrow(bledy), mse_mediana = median(mse_b),
    mse_max = max(mse_b), procent_ok = mean(mse_b < 0.05) * 100)
}))
round(wyniki, 3)

# 4. Liczba replikacji potrzebna do zadanej dokładności (Schroeders i Gnambs, 2025)
sigma <- 0.5; delta <- 0.05
ceiling((qnorm(0.975) * sigma / delta)^2)

Bibliografia oprogramowania i wykorzystanych pakietów

W przykładzie użyto: R, mirt (pakiet parallel jest częścią R).

  1. R: R Core Team. (2026). R: A language and environment for statistical computing (Version 4.5.3) [Computer software]. R Foundation for Statistical Computing. https://www.R-project.org/
  2. mirt (wersja 1.47): Chalmers, R. P. (2012). mirt: A multidimensional item response theory package for the R environment. Journal of Statistical Software, 48(6), 1–29. https://doi.org/10.18637/jss.v048.i06

Najczęstsze pytania

Czy 200 osób wystarczy do analizy IRT?

Czasem tak, czasem nie. Dla pozycji o średniej trudności i dobrze dobranego modelu może wystarczyć, ale pozycje bardzo łatwe lub bardzo trudne, modele z parametrem zgadywania i analizy w podgrupach wymagają znacznie większych prób. Bezpieczniej zaplanować liczebność symulacją.

Jak sprawdzić, czy pozycja testowa jest dobra?

Dobra pozycja ma co najmniej umiarkowaną dyskryminację, położenie w zakresie cechy, który chcesz mierzyć, dobrze działające kategorie odpowiedzi, poprawne dopasowanie, brak zależności lokalnej i brak DIF, a przede wszystkim dostarcza informacji tam, gdzie jest potrzebna.

Czym jest MSE w planowaniu liczebności próby?

MSE to średni kwadrat różnicy między oszacowanym a prawdziwym parametrem w symulacji. Łączy obciążenie i zmienność oszacowań; w planowaniu próby dla IRT często przyjmuje się, że MSE trudności pozycji powinno być niższe niż 0,05.

Planujesz test lub kwestionariusz analizowany w IRT?

Przygotuję symulację liczebności próby dopasowaną do Twojego narzędzia i schematu badania, ocenię pozycje z pilotażu, skalibruję bank zadań i przeliczę wyniki na skale standardowe. Otrzymasz raport z kodem R, który możesz dołączyć do wniosku grantowego, prerejestracji lub pracy.

Zaplanuj badanie IRTOferta dla badaczy

Bibliografia i dalsza literatura naukowa (APA 7)

  1. Bean, G. J., & Bowen, N. K. (2021). Item response theory and confirmatory factor analysis: Complementary approaches for scale development. Journal of Evidence-Based Social Work, 18(6), 597–618. https://doi.org/10.1080/26408066.2021.1906813
  2. Chalmers, R. P. (2012). mirt: A multidimensional item response theory package for the R environment. Journal of Statistical Software, 48(6), 1–29. https://doi.org/10.18637/jss.v048.i06
  3. Cook, R. M., & Wind, S. A. (2024). Item response theory: A modern measurement approach to reliability and precision for counseling researchers. Measurement and Evaluation in Counseling and Development, 57(2), 116–135. https://doi.org/10.1080/07481756.2023.2301284
  4. Fonseca Rivera, J., Shah, N., Africa, D. D., & Voudouris, K. (2026). Item response theory for AI safety (arXiv:2608.05086) [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2608.05086
  5. Godard, R., Draper, Z. A., Holtzman, S., & O’Connor, B. P. (2026). (De)construction on the road ahead: Item response theory and psychometric analysis of self-report measures of active and passive social media use. Current Psychology, 45(5), Article 498. https://doi.org/10.1007/s12144-026-09064-y
  6. Immekus, J. C., Snyder, K. E., & Ralston, P. A. (2019). Multidimensional item response theory for factor structure assessment in educational psychology research. Frontiers in Education, 4, Article 45. https://doi.org/10.3389/feduc.2019.00045
  7. Lalor, J. P., Wu, H., & Yu, H. (2016). Building an evaluation scale using item response theory. In Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing (pp. 648–657). Association for Computational Linguistics. https://doi.org/10.18653/v1/D16-1062
  8. Lalot, F., Räikkönen, J., & Ahvenharju, S. (2025). An item response theory approach to measurement in environmental psychology: A practical example with environmental risk perception. Journal of Environmental Psychology, 101, Article 102520. https://doi.org/10.1016/j.jenvp.2025.102520
  9. Schroeders, U., & Gnambs, T. (2025). Sample-size planning in item-response theory: A tutorial. Advances in Methods and Practices in Psychological Science, 8(1), 1–13. https://doi.org/10.1177/25152459251314798
  10. Takane, Y., & de Leeuw, J. (1987). On the relationship between item response theory and factor analysis of discretized variables. Psychometrika, 52(3), 393–408. https://doi.org/10.1007/BF02294363
  11. Toland, M. D. (2014). Practical guide to conducting an item response theory analysis. The Journal of Early Adolescence, 34(1), 120–151. https://doi.org/10.1177/0272431613511332
  12. Xiong, J., Tang, C., Tan, Y., & Liu, Q. (2026). Tirt R package: A tutorial on item response and testlet response theory modeling. Measurement: Interdisciplinary Research and Perspectives. Advance online publication. https://doi.org/10.1080/15366367.2026.2726362
  13. Yang, F. M., & Kao, S. T. (2014). Item response theory for measurement validity. Shanghai Archives of Psychiatry, 26(3), 171–177. https://doi.org/10.3969/j.issn.1002-0829.2014.03.010
  14. Zein, R. A., & Akhtar, H. (2025). Getting started with the graded response model: An introduction and tutorial in R. International Journal of Psychology, 60(1), Article e13265. https://doi.org/10.1002/ijop.13265

Kategorie dyskryminacji Bakera przytoczono za Zein i Akhtar (2025); reguły kciuka dotyczące liczebności próby — za Schroedersem i Gnambsem (2025).

Cytowania BibTeX

@article{bean2021irtcfa, author={Bean, Gerald J. and Bowen, Natasha K.}, title={Item response theory and confirmatory factor analysis: Complementary approaches for scale development}, journal={Journal of Evidence-Based Social Work}, year={2021}, volume={18}, number={6}, pages={597--618}, doi={10.1080/26408066.2021.1906813}}
@article{chalmers2012mirt, author={Chalmers, R. Philip}, title={mirt: A multidimensional item response theory package for the R environment}, journal={Journal of Statistical Software}, year={2012}, volume={48}, number={6}, pages={1--29}, doi={10.18637/jss.v048.i06}}
@article{cook2024irt, author={Cook, Ryan M. and Wind, Stefanie A.}, title={Item response theory: A modern measurement approach to reliability and precision for counseling researchers}, journal={Measurement and Evaluation in Counseling and Development}, year={2024}, volume={57}, number={2}, pages={116--135}, doi={10.1080/07481756.2023.2301284}}
@misc{fonsecarivera2026aisafety, author={Fonseca Rivera, Joshua and Shah, Neil and Africa, David Demitri and Voudouris, Konstantinos}, title={Item response theory for AI safety}, year={2026}, eprint={2608.05086}, archivePrefix={arXiv}, doi={10.48550/arXiv.2608.05086}}
@article{godard2026socialmedia, author={Godard, Rebecca and Draper, Zakary A. and Holtzman, Susan and O'Connor, Brian P.}, title={(De)construction on the road ahead: Item response theory and psychometric analysis of self-report measures of active and passive social media use}, journal={Current Psychology}, year={2026}, volume={45}, number={5}, pages={498}, doi={10.1007/s12144-026-09064-y}}
@article{immekus2019mirt, author={Immekus, Jason C. and Snyder, Kate E. and Ralston, Patricia A.}, title={Multidimensional item response theory for factor structure assessment in educational psychology research}, journal={Frontiers in Education}, year={2019}, volume={4}, pages={45}, doi={10.3389/feduc.2019.00045}}
@inproceedings{lalor2016scale, author={Lalor, John P. and Wu, Hao and Yu, Hong}, title={Building an evaluation scale using item response theory}, booktitle={Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing}, year={2016}, pages={648--657}, doi={10.18653/v1/D16-1062}}
@article{lalot2025environmental, author={Lalot, Fanny and R{\"a}ikk{\"o}nen, Juulia and Ahvenharju, Sanna}, title={An item response theory approach to measurement in environmental psychology: A practical example with environmental risk perception}, journal={Journal of Environmental Psychology}, year={2025}, volume={101}, pages={102520}, doi={10.1016/j.jenvp.2025.102520}}
@article{schroeders2025samplesize, author={Schroeders, Ulrich and Gnambs, Timo}, title={Sample-size planning in item-response theory: A tutorial}, journal={Advances in Methods and Practices in Psychological Science}, year={2025}, volume={8}, number={1}, pages={1--13}, doi={10.1177/25152459251314798}}
@article{takane1987relationship, author={Takane, Yoshio and de Leeuw, Jan}, title={On the relationship between item response theory and factor analysis of discretized variables}, journal={Psychometrika}, year={1987}, volume={52}, number={3}, pages={393--408}, doi={10.1007/BF02294363}}
@article{toland2014practical, author={Toland, Michael D.}, title={Practical guide to conducting an item response theory analysis}, journal={The Journal of Early Adolescence}, year={2014}, volume={34}, number={1}, pages={120--151}, doi={10.1177/0272431613511332}}
@article{xiong2026tirt, author={Xiong, Jiawei and Tang, Cheng and Tan, Yanyan and Liu, Qidi}, title={Tirt R package: A tutorial on item response and testlet response theory modeling}, journal={Measurement: Interdisciplinary Research and Perspectives}, year={2026}, note={Advance online publication}, doi={10.1080/15366367.2026.2726362}}
@article{yang2014validity, author={Yang, Frances M. and Kao, Solon T.}, title={Item response theory for measurement validity}, journal={Shanghai Archives of Psychiatry}, year={2014}, volume={26}, number={3}, pages={171--177}, doi={10.3969/j.issn.1002-0829.2014.03.010}}
@article{zein2025grm, author={Zein, Rizqy Amelia and Akhtar, Hanif}, title={Getting started with the graded response model: An introduction and tutorial in R}, journal={International Journal of Psychology}, year={2025}, volume={60}, number={1}, pages={e13265}, doi={10.1002/ijop.13265}}
R