Psychometria · Cykl o IRT

Teoria reagowania na pozycje testowe (IRT): czym jest i czym różni się od klasycznej teorii testów

Na czym polega item response theory, jakie są modele IRT, co mówią parametry a, b i c, czym jest informacja testu i w jakich sytuacjach IRT daje więcej niż klasyczna teoria testów i CFA.

Strona główna / Blog / Teoria reagowania na pozycje testowe (IRT)
W skrócie: teoria reagowania na pozycje testowe (IRT, item response theory) opisuje prawdopodobieństwo konkretnej odpowiedzi na każdą pozycję jako funkcję poziomu mierzonej cechy θ oraz parametrów pozycji — przede wszystkim dyskryminacji a i trudności b. Dzięki temu widać precyzję pomiaru osobno dla każdego poziomu cechy, a pozycje i osoby trafiają na wspólną skalę. To realna przewaga nad klasyczną teorią testów przy budowie, skracaniu i porównywaniu narzędzi — okupiona większą próbą i mocniejszymi założeniami.
Cykl o IRT — teoria reagowania na pozycje testowe:
  1. Czym jest IRT i czym różni się od klasycznej teorii testów (ten wpis)
  2. IRT w R krok po kroku: pakiet mirt
  3. Dobre pozycje testowe i liczebność próby w IRT

Czym jest teoria reagowania na pozycje testowe (IRT)?

Teoria reagowania na pozycje testowe — po angielsku item response theory, w skrócie IRT — to rodzina modeli statystycznych, które łączą nieobserwowany poziom cechy osoby z właściwościami pozycji testowych i na tej podstawie przewidują prawdopodobieństwo określonej odpowiedzi (Toland, 2014). Jednostką analizy nie jest wynik całego testu, lecz odpowiedź na pojedynczą pozycję (Lalot i in., 2025). Korzenie podejścia sięgają prac Guttmana, Lorda i Rascha (Lalot i in., 2025), a szerokie zastosowanie IRT zyskała od lat 70. XX wieku, m.in. w testach typu SAT (Yang i Kao, 2014). W polskiej literaturze spotkasz też nazwę „teoria odpowiedzi na pozycje testowe” — chodzi o to samo podejście, które jest dziś fundamentem nowoczesnej psychometrii.

Poziom cechy oznacza się grecką literą θ (theta). Zwykle ma on rozkład standardowy ze średnią 0 i odchyleniem standardowym 1, więc θ = 1 oznacza osobę o jedno odchylenie standardowe powyżej średniej, a większość wyników mieści się między −3 a 3 (Toland, 2014; Cook i Wind, 2024). W testach wiedzy θ nazywa się zdolnością, w kwestionariuszach — natężeniem cechy, np. objawów depresji czy postawy; w badaniach zdrowia preferuje się określenie „cecha latentna” (Yang i Kao, 2014).

Krzywa charakterystyczna pozycji: parametry a, b i c

Sercem IRT jest krzywa charakterystyczna pozycji (item characteristic curve, ICC): zależność prawdopodobieństwa odpowiedzi „poprawnej” lub „twierdzącej” od poziomu θ. Zwykle ma kształt litery S i rośnie monotonicznie (Toland, 2014). W modelu dwuparametrycznym (2PL) opisują ją dwa parametry (Schroeders i Gnambs, 2025):

P(X = 1 | θ) = 1 / (1 + exp[−a(θ − b)])
  • Trudność b (położenie) — poziom θ, przy którym prawdopodobieństwo odpowiedzi wynosi 0,5. Im wyższe b, tym trudniejsza pozycja albo tym wyższe natężenie cechy potrzebne do jej zaakceptowania. Kierunek jest odwrotny niż w klasycznym wskaźniku trudności p, gdzie wyższa wartość oznacza zadanie łatwiejsze (Toland, 2014).
  • Dyskryminacja a (nachylenie) — jak szybko rośnie prawdopodobieństwo w okolicy b. Pełni rolę podobną do korelacji pozycji z wynikiem ogólnym albo ładunku czynnikowego, ale nie jest ograniczona do przedziału od −1 do 1 (Toland, 2014).
  • Pseudozgadywanie c — dolna asymptota w modelu trójparametrycznym (3PL), przydatna w zadaniach wielokrotnego wyboru, które można rozwiązać przypadkiem (Lalor i in., 2016; Yang i Kao, 2014).
Krzywe charakterystyczne trzech pozycjiPrawdopodobieństwo odpowiedzi w zależności od poziomu cechy theta dla pozycji A (a=1,25; b=0,5), B (a=0,63; b=−0,5) i C z parametrem zgadywania (a=1,5; b=0; c=0,2). A: a = 1,25, b = 0,5 B: a = 0,63, b = −0,5 C: a = 1,5, b = 0, c = 0,2 0,00 0,25 0,50 0,75 1,00 −3 −2 −1 0 1 2 3 Poziom cechy θ Prawdopodobieństwo odpowiedzi P = 0,5 A B C
Rycina 1. Krzywe charakterystyczne trzech przykładowych pozycji. Pozycja A (a = 1,25; b = 0,5) silnie różnicuje osoby o przeciętnym i nieco wyższym poziomie cechy, B (a = 0,63; b = −0,5) jest łatwiejsza, ale słabiej różnicuje, a C ma dolną asymptotę c = 0,2, jak zadanie z czterema odpowiedziami do wyboru. Parametry pozycji A i B za: Immekus i in. (2019).

W starszej literaturze i w części programów wzór zawiera stałą D = 1,7, która zbliża krzywą logistyczną do normalnej ogiwy (Immekus i in., 2019; Yang i Kao, 2014). Pakiet R mirt w aktualnych wersjach podaje parametry bez tej stałej, dlatego porównując wyniki z różnych źródeł, zawsze sprawdzaj, w jakiej metryce podano dyskryminacje.

Modele IRT: Rasch, 2PL, 3PL, GRM i inne

Najczęściej stosowane modele IRT
ModelParametry pozycjiTyp odpowiedziTypowe zastosowanie
Model Rascha (1PL)b; wspólna dyskryminacjadychotomicznegdy liczy się prostota i obiektywność specyficzna; suma punktów jest statystyką dostateczną dla θ
2PLa, bdychotomicznetesty i kwestionariusze tak/nie; standard w badaniach zdrowia
3PLa, b, cdychotomicznetesty wielokrotnego wyboru
Model odpowiedzi stopniowanych (GRM)a oraz k − 1 progów bporządkowenajczęściej stosowany dla skal Likerta
Model częściowego zaliczenia (PCM) i uogólniony PCM (GPCM)progi przejść między kategoriami; w GPCM także aporządkowezadania punktowane częściowo; tradycja Rascha
Modele wielowymiarowe, bifaktorowe i testletowekilka cech lub efekt wspólnego bodźcadowolnegdy jedna cecha nie wystarcza albo pozycje dotyczą wspólnego tekstu

Na podstawie: Schroeders i Gnambs (2025), Zein i Akhtar (2025), Yang i Kao (2014), Lalor i in. (2016), Cook i Wind (2024), Immekus i in. (2019), Xiong i in. (2026).

W GRM każda pozycja ma jedną dyskryminację i k − 1 progów: b1 to poziom θ, przy którym z prawdopodobieństwem 0,5 osoba wybierze kategorię drugą lub wyższą, b2 — trzecią lub wyższą i tak dalej (Schroeders i Gnambs, 2025; Bean i Bowen, 2021):

P(X ≥ k | θ) = 1 / (1 + exp[−a(θ − bk)])
P(X = k) = P(X ≥ k) − P(X ≥ k + 1)

Wybór modelu jest decyzją zarówno teoretyczną, jak i empiryczną. Modele porównuje się testem ilorazu wiarygodności oraz kryteriami AIC i BIC (Toland, 2014; Immekus i in., 2019). Uwaga na BIC przy małej liczbie respondentów: w analizie (preprincie, przed recenzją) odpowiedzi 192 modeli językowych na pytania o bezpieczeństwo BIC wskazywał model Rascha dla 7 z 8 zestawów zadań, choć test ilorazu wiarygodności odrzucał go we wszystkich, a dyskryminacje różniły się w obrębie zestawu około dziesięciokrotnie (Fonseca Rivera i in., 2026).

Informacja testu, błąd standardowy i rzetelność warunkowa

Najważniejsza praktyczna różnica między IRT a klasycznym podejściem dotyczy precyzji. Każda pozycja ma funkcję informacji, która pokazuje, jak dokładnie mierzy na różnych poziomach θ. W modelu 2PL (Fonseca Rivera i in., 2026):

I(θ) = a² · P(θ) · [1 − P(θ)]

Informacja pozycji jest największa w okolicy jej trudności b, a jej wysokość rośnie z kwadratem dyskryminacji. Informacje pozycji sumują się w funkcję informacji testu, a błąd standardowy oceny θ jest odwrotnością pierwiastka z informacji (Toland, 2014):

SE(θ) = 1 / √I(θ),   rel(θ) = I(θ) / [I(θ) + 1]

Drugi wzór to rzetelność warunkowa przy standardowym rozkładzie θ, stosowana m.in. przez Schroedersa i Gnambsa (2025) oraz Xionga i współpracowników (2026). Programy, które do informacji testu dodają wkład rozkładu a priori (np. IRTPRO), zapisują ją jako 1 − 1 / I (Toland, 2014). Daje to czytelne punkty odniesienia:

Informacja testu, błąd standardowy i rzetelność warunkowa
Informacja testu I(θ)Błąd standardowy SE(θ)Rzetelność warunkowa
40,500,80
90,330,90
190,230,95

Obliczenia według wzorów powyżej.

Klasyczna alfa Cronbacha jest jedną liczbą dla wszystkich osób. IRT pokazuje, dla kogo test mierzy dobrze, a dla kogo słabo. Dobrze to widać na krótkim teście LSAT7 (5 zadań, 1000 osób), dostępnym w pakiecie mirt:

Rzetelność warunkowa IRT a alfa Cronbacha w teście LSAT7Dla testu LSAT7 (5 zadań, model 2PL, N = 1000) rzetelność warunkowa zmienia się od 0,59 przy theta = −1 do 0,15 przy theta = 2. Alfa Cronbacha wynosi 0,45 dla wszystkich osób. Rzetelność warunkowa przekracza alfę tylko dla theta od −2,4 do 0,1. IRT: rzetelność warunkowa I(θ) / [I(θ) + 1] KTT: alfa Cronbacha = 0,45 0,00 0,25 0,50 0,75 1,00 −3 −2 −1 0 1 2 3 Poziom cechy θ Rzetelność maksimum 0,59 przy θ ≈ −1 0,15 przy θ = 2
Rycina 2. Rzetelność warunkowa testu LSAT7 w modelu 2PL na tle alfy Cronbacha (0,45). Test mierzy najdokładniej osoby o zdolności nieco poniżej średniej (maksimum 0,59 przy θ ≈ −1), a rzetelność warunkowa przekracza alfę tylko dla θ od −2,4 do 0,1. Dla osób o wysokiej zdolności test jest praktycznie bezużyteczny (0,15 przy θ = 2), bo wszystkie zadania są łatwe. Obliczenia własne w pakiecie mirt (Chalmers, 2012).

IRT a klasyczna teoria testów (KTT): w czym IRT jest lepsza?

Klasyczna teoria testów (KTT, classical test theory) rozkłada wynik obserwowany na wynik prawdziwy i błąd (X = T + E) i ocenia rzetelność jednym współczynnikiem (Cook i Wind, 2024). Jest prosta i w wielu badaniach wystarczająca, ale ma ograniczenia, na które IRT odpowiada bezpośrednio:

Porównanie klasycznej teorii testów i IRT
KwestiaKlasyczna teoria testówIRT
Jednostka analizywynik całego testuodpowiedź na pozycję
Precyzja pomiarujeden błąd pomiaru dla wszystkich osóbbłąd standardowy dla każdego poziomu θ i każdej osoby
Parametry pozycjitrudność p i korelacja rit zależne od badanej próbyprzy dobrym dopasowaniu niezależne od rozkładu cechy w próbie
Wynik osobysuma lub średnia punktówθ ważone parametrami pozycji, porównywalne przy różnych zestawach pozycji
Skalaporządkowa suma punktówwspólna skala logitowa dla osób i pozycji
Porównania grup i wersjiograniczoneDIF, zrównywanie wersji, banki zadań, testy adaptacyjne

Na podstawie: Toland (2014), Immekus i in. (2019), Cook i Wind (2024), Schroeders i Gnambs (2025).

Różnicę w ocenie osób widać na prostym przykładzie. W teście LSAT7 dwie osoby z tym samym wynikiem 3 punktów dostają w modelu 2PL różne oceny θ: −0,13, jeśli rozwiązały trzy pierwsze zadania, i −0,70, jeśli rozwiązały zadania 2, 4 i 5. Model waży bowiem poprawne odpowiedzi dyskryminacją zadań (obliczenia własne w pakiecie mirt). Lalor i współpracownicy (2016) pokazali to samo przy ocenie systemów przetwarzania języka: wysoka trafność odpowiedzi nie zawsze oznacza wysoki wynik θ.

IRT nie jest jednak zawsze lepszym wyborem. Wymaga większych prób, spełnienia założeń i bardziej złożonych obliczeń (Lalot i in., 2025; Immekus i in., 2019), a o wyborze metody powinno decydować pytanie badawcze (Zein i Akhtar, 2025). W prostych analizach korelacyjnych wyniki θ i średnie punktów potrafią korelować na poziomie 0,98–0,99 i dawać niemal identyczne wnioski (Lalot i in., 2025). IRT wnosi najwięcej przy budowie i skracaniu narzędzi, ocenie pojedynczych pozycji, porównaniach grup oraz testach adaptacyjnych. Mimo to wciąż jest rzadko stosowana: w 39 badaniach pomiarowych opublikowanych w latach 2013–2017 w czasopismach z psychologii edukacyjnej CFA pojawiła się w 90% z nich, a IRT — tylko w 5% (Immekus i in., 2019).

IRT a konfirmacyjna analiza czynnikowa (CFA)

IRT i konfirmacyjna analiza czynnikowa to bliscy krewni. Ładunki czynnikowe odpowiadają dyskryminacjom, progi CFA — położeniom b, a wyniki czynnikowe — ocenom θ (Bean i Bowen, 2021). Dla jednowymiarowego modelu z pozycjami porządkowymi parametry można wprost przeliczać (Takane i de Leeuw, 1987):

a = 1,702 · λ / √(1 − λ²),   b = τ / λ

W tym wzorze λ to standaryzowany ładunek, a τ to próg z kategorialnej CFA. Na skali Science z pakietu mirt dyskryminacje przeliczone z ładunków CFA (np. 2,10 dla najlepszej pozycji) niemal pokrywają się z oszacowaniami IRT (2,29) — krok po kroku pokazuję to w poradniku IRT w R. Oba podejścia akcentują jednak co innego. CFA lepiej odpowiada na pytania o strukturę: liczbę czynników, ładunki krzyżowe, skorelowane błędy czy modele bifaktorowe. IRT — na pytania o pozycje i wyniki osób: krzywe kategorii, informację, precyzję warunkową i DIF (Bean i Bowen, 2021). Dlatego najlepiej stosować oba podejścia razem: najpierw ustalić strukturę w CFA, a potem ocenić pozycje w IRT (Bean i Bowen, 2021; Lalot i in., 2025). Więcej o analizie czynnikowej przeczytasz w poradniku EFA i CFA.

Założenia IRT i jak je sprawdzić

  • Jednowymiarowość — odpowiedzi wyjaśnia jedna dominująca cecha. Sprawdza się ją analizą czynnikową lub analizą równoległą (Zein i Akhtar, 2025; Toland, 2014). Gdy wymiarów jest kilka, stosuje się modele wielowymiarowe albo bifaktorowe (Immekus i in., 2019).
  • Lokalna niezależność — przy ustalonym θ odpowiedzi na różne pozycje są niezależne. Jej naruszenie zawyża dyskryminacje i informację oraz zaniża błędy standardowe (Toland, 2014). Typowe źródła to niemal identyczne pozycje i pozycje odwrócone (Yang i Kao, 2014) albo pytania do wspólnego tekstu (Xiong i in., 2026). Wskaźnik Q3 powyżej około |0,2| sygnalizuje problem (Zein i Akhtar, 2025).
  • Monotoniczność — wyższy poziom cechy oznacza większe prawdopodobieństwo wyższych odpowiedzi (Cook i Wind, 2024).
  • Niezmienniczość — parametry pozycji nie zależą od tego, kogo zbadano, a oceny osób — od tego, których pozycji użyto. Jej naruszenie ujawnia się jako zróżnicowane funkcjonowanie pozycji, czyli DIF (Cook i Wind, 2024; Yang i Kao, 2014).

Gdzie stosuje się IRT?

  • Budowa i skracanie skal — wybór pozycji dostarczających najwięcej informacji w docelowym zakresie cechy (Lalot i in., 2025; Godard i in., 2026).
  • Testy adaptacyjne (CAT) i banki zadań — każdy badany dostaje inne pozycje, a wyniki pozostają porównywalne (Cook i Wind, 2024). W ocenie bezpieczeństwa modeli AI (preprint) około 10 zadań dobieranych adaptacyjnie odtwarzało wyniki pełnych zestawów z błędem mniejszym o 18–34% niż 10 zadań losowych (Fonseca Rivera i in., 2026).
  • Zrównywanie wersji testu i pomiar zmiany w czasie na wspólnej skali (Xiong i in., 2026; Immekus i in., 2019).
  • Sprawiedliwość pomiaru — analiza DIF między płciami, kulturami czy grupami wiekowymi (Bean i Bowen, 2021; Schroeders i Gnambs, 2025).
  • Ocena istniejących narzędzi — popularne skale aktywnego i pasywnego korzystania z mediów społecznościowych okazały się dostarczać zbyt mało informacji na całym zakresie cechy (Godard i in., 2026).
  • Poza psychologią — ocena modeli językowych i zbiorów danych w przetwarzaniu języka naturalnego (Lalor i in., 2016, 2024) oraz modele, w których wymiary wyznacza teoria, a nie same dane, np. w naukach politycznych (Morucci i in., 2025).

Jak wygląda analiza w praktyce, pokazuję w poradniku IRT w R krok po kroku. Kryteria dobrych pozycji i sposób wyliczenia próby opisuję we wpisie dobre pozycje testowe i liczebność próby w IRT.

Najczęstsze pytania

Czym różni się IRT od klasycznej teorii testów?

Klasyczna teoria testów ocenia test jako całość i podaje jeden błąd pomiaru dla wszystkich osób. IRT modeluje każdą pozycję osobno i pokazuje precyzję pomiaru dla każdego poziomu mierzonej cechy.

Czy IRT można stosować do skali Likerta?

Tak. Do pozycji porządkowych stosuje się najczęściej model odpowiedzi stopniowanych (GRM) albo uogólniony model częściowego zaliczenia (GPCM).

Ile osób potrzeba do analizy IRT?

Nie ma uniwersalnej reguły — wymagana liczebność zależy od modelu, liczby i trudności pozycji, schematu badania oraz celu analizy. Najlepiej zaplanować ją symulacją Monte Carlo dopasowaną do konkretnego narzędzia.

W jakim programie wykonać analizę IRT?

Najpopularniejszym bezpłatnym narzędziem jest pakiet R mirt. Stosuje się też pakiety TAM, eRm i tirt, a spośród programów komercyjnych m.in. IRTPRO, flexMIRT i Mplus.

Potrzebujesz analizy IRT lub walidacji skali?

Przeprowadzam analizy IRT i CFA testów oraz kwestionariuszy: kalibrację pozycji, ocenę dopasowania, informacji i rzetelności warunkowej, analizę DIF, skracanie narzędzi i planowanie liczebności próby. Pomagam też opisać wyniki tak, by spełniały standardy publikacyjne.

Zapytaj o analizę IRTOferta dla badaczy

Bibliografia i dalsza literatura naukowa (APA 7)

  1. Bean, G. J., & Bowen, N. K. (2021). Item response theory and confirmatory factor analysis: Complementary approaches for scale development. Journal of Evidence-Based Social Work, 18(6), 597–618. https://doi.org/10.1080/26408066.2021.1906813
  2. Chalmers, R. P. (2012). mirt: A multidimensional item response theory package for the R environment. Journal of Statistical Software, 48(6), 1–29. https://doi.org/10.18637/jss.v048.i06
  3. Cook, R. M., & Wind, S. A. (2024). Item response theory: A modern measurement approach to reliability and precision for counseling researchers. Measurement and Evaluation in Counseling and Development, 57(2), 116–135. https://doi.org/10.1080/07481756.2023.2301284
  4. Fonseca Rivera, J., Shah, N., Africa, D. D., & Voudouris, K. (2026). Item response theory for AI safety (arXiv:2608.05086) [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2608.05086
  5. Godard, R., Draper, Z. A., Holtzman, S., & O’Connor, B. P. (2026). (De)construction on the road ahead: Item response theory and psychometric analysis of self-report measures of active and passive social media use. Current Psychology, 45(5), Article 498. https://doi.org/10.1007/s12144-026-09064-y
  6. Immekus, J. C., Snyder, K. E., & Ralston, P. A. (2019). Multidimensional item response theory for factor structure assessment in educational psychology research. Frontiers in Education, 4, Article 45. https://doi.org/10.3389/feduc.2019.00045
  7. Lalor, J. P., Rodriguez, P., Sedoc, J., & Hernandez-Orallo, J. (2024). Item response theory for natural language processing. In Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics: Tutorial Abstracts (pp. 9–13). Association for Computational Linguistics. https://doi.org/10.18653/v1/2024.eacl-tutorials.2
  8. Lalor, J. P., Wu, H., & Yu, H. (2016). Building an evaluation scale using item response theory. In Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing (pp. 648–657). Association for Computational Linguistics. https://doi.org/10.18653/v1/D16-1062
  9. Lalot, F., Räikkönen, J., & Ahvenharju, S. (2025). An item response theory approach to measurement in environmental psychology: A practical example with environmental risk perception. Journal of Environmental Psychology, 101, Article 102520. https://doi.org/10.1016/j.jenvp.2025.102520
  10. Morucci, M., Foster, M. J., Webster, K., Lee, S. J., & Siegel, D. A. (2025). Measurement that matches theory: Theory-driven identification in item response theory models. American Political Science Review, 119(2), 727–745. https://doi.org/10.1017/S000305542400039X
  11. Schroeders, U., & Gnambs, T. (2025). Sample-size planning in item-response theory: A tutorial. Advances in Methods and Practices in Psychological Science, 8(1), 1–13. https://doi.org/10.1177/25152459251314798
  12. Takane, Y., & de Leeuw, J. (1987). On the relationship between item response theory and factor analysis of discretized variables. Psychometrika, 52(3), 393–408. https://doi.org/10.1007/BF02294363
  13. Toland, M. D. (2014). Practical guide to conducting an item response theory analysis. The Journal of Early Adolescence, 34(1), 120–151. https://doi.org/10.1177/0272431613511332
  14. Xiong, J., Tang, C., Tan, Y., & Liu, Q. (2026). Tirt R package: A tutorial on item response and testlet response theory modeling. Measurement: Interdisciplinary Research and Perspectives. Advance online publication. https://doi.org/10.1080/15366367.2026.2726362
  15. Yang, F. M., & Kao, S. T. (2014). Item response theory for measurement validity. Shanghai Archives of Psychiatry, 26(3), 171–177. https://doi.org/10.3969/j.issn.1002-0829.2014.03.010
  16. Zein, R. A., & Akhtar, H. (2025). Getting started with the graded response model: An introduction and tutorial in R. International Journal of Psychology, 60(1), Article e13265. https://doi.org/10.1002/ijop.13265

Cytowania BibTeX

@article{bean2021irtcfa, author={Bean, Gerald J. and Bowen, Natasha K.}, title={Item response theory and confirmatory factor analysis: Complementary approaches for scale development}, journal={Journal of Evidence-Based Social Work}, year={2021}, volume={18}, number={6}, pages={597--618}, doi={10.1080/26408066.2021.1906813}}
@article{chalmers2012mirt, author={Chalmers, R. Philip}, title={mirt: A multidimensional item response theory package for the R environment}, journal={Journal of Statistical Software}, year={2012}, volume={48}, number={6}, pages={1--29}, doi={10.18637/jss.v048.i06}}
@article{cook2024irt, author={Cook, Ryan M. and Wind, Stefanie A.}, title={Item response theory: A modern measurement approach to reliability and precision for counseling researchers}, journal={Measurement and Evaluation in Counseling and Development}, year={2024}, volume={57}, number={2}, pages={116--135}, doi={10.1080/07481756.2023.2301284}}
@misc{fonsecarivera2026aisafety, author={Fonseca Rivera, Joshua and Shah, Neil and Africa, David Demitri and Voudouris, Konstantinos}, title={Item response theory for AI safety}, year={2026}, eprint={2608.05086}, archivePrefix={arXiv}, doi={10.48550/arXiv.2608.05086}}
@article{godard2026socialmedia, author={Godard, Rebecca and Draper, Zakary A. and Holtzman, Susan and O'Connor, Brian P.}, title={(De)construction on the road ahead: Item response theory and psychometric analysis of self-report measures of active and passive social media use}, journal={Current Psychology}, year={2026}, volume={45}, number={5}, pages={498}, doi={10.1007/s12144-026-09064-y}}
@article{immekus2019mirt, author={Immekus, Jason C. and Snyder, Kate E. and Ralston, Patricia A.}, title={Multidimensional item response theory for factor structure assessment in educational psychology research}, journal={Frontiers in Education}, year={2019}, volume={4}, pages={45}, doi={10.3389/feduc.2019.00045}}
@inproceedings{lalor2024irtnlp, author={Lalor, John P. and Rodriguez, Pedro and Sedoc, Jo{\~a}o and Hernandez-Orallo, Jose}, title={Item response theory for natural language processing}, booktitle={Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics: Tutorial Abstracts}, year={2024}, pages={9--13}, doi={10.18653/v1/2024.eacl-tutorials.2}}
@inproceedings{lalor2016scale, author={Lalor, John P. and Wu, Hao and Yu, Hong}, title={Building an evaluation scale using item response theory}, booktitle={Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing}, year={2016}, pages={648--657}, doi={10.18653/v1/D16-1062}}
@article{lalot2025environmental, author={Lalot, Fanny and R{\"a}ikk{\"o}nen, Juulia and Ahvenharju, Sanna}, title={An item response theory approach to measurement in environmental psychology: A practical example with environmental risk perception}, journal={Journal of Environmental Psychology}, year={2025}, volume={101}, pages={102520}, doi={10.1016/j.jenvp.2025.102520}}
@article{morucci2025theory, author={Morucci, Marco and Foster, Margaret J. and Webster, Kaitlyn and Lee, So Jin and Siegel, David A.}, title={Measurement that matches theory: Theory-driven identification in item response theory models}, journal={American Political Science Review}, year={2025}, volume={119}, number={2}, pages={727--745}, doi={10.1017/S000305542400039X}}
@article{schroeders2025samplesize, author={Schroeders, Ulrich and Gnambs, Timo}, title={Sample-size planning in item-response theory: A tutorial}, journal={Advances in Methods and Practices in Psychological Science}, year={2025}, volume={8}, number={1}, pages={1--13}, doi={10.1177/25152459251314798}}
@article{takane1987relationship, author={Takane, Yoshio and de Leeuw, Jan}, title={On the relationship between item response theory and factor analysis of discretized variables}, journal={Psychometrika}, year={1987}, volume={52}, number={3}, pages={393--408}, doi={10.1007/BF02294363}}
@article{toland2014practical, author={Toland, Michael D.}, title={Practical guide to conducting an item response theory analysis}, journal={The Journal of Early Adolescence}, year={2014}, volume={34}, number={1}, pages={120--151}, doi={10.1177/0272431613511332}}
@article{xiong2026tirt, author={Xiong, Jiawei and Tang, Cheng and Tan, Yanyan and Liu, Qidi}, title={Tirt R package: A tutorial on item response and testlet response theory modeling}, journal={Measurement: Interdisciplinary Research and Perspectives}, year={2026}, note={Advance online publication}, doi={10.1080/15366367.2026.2726362}}
@article{yang2014validity, author={Yang, Frances M. and Kao, Solon T.}, title={Item response theory for measurement validity}, journal={Shanghai Archives of Psychiatry}, year={2014}, volume={26}, number={3}, pages={171--177}, doi={10.3969/j.issn.1002-0829.2014.03.010}}
@article{zein2025grm, author={Zein, Rizqy Amelia and Akhtar, Hanif}, title={Getting started with the graded response model: An introduction and tutorial in R}, journal={International Journal of Psychology}, year={2025}, volume={60}, number={1}, pages={e13265}, doi={10.1002/ijop.13265}}
R