Metaanaliza, przegląd systematyczny i umbrella review — czym się różnią?
Przegląd systematyczny to ustrukturyzowane, kompletne i powtarzalne wyszukanie oraz ocena badań odpowiadających na precyzyjnie sformułowane pytanie. Metaanaliza (pisana też jako meta-analiza) jest jego częścią statystyczną: łączy wyniki włączonych badań w jedno oszacowanie i sprawdza, na ile się od siebie różnią (Dagher i Khan, 2025). Viechtbauer (2010) ujmuje to krótko — metaanaliza to przegląd systematyczny wsparty metodami statystycznymi. Umbrella review idzie o poziom wyżej: jednostką analizy nie jest pojedyncze badanie, lecz cały przegląd systematyczny lub metaanaliza (Belbasis i in., 2022).
Przeglądów przybywa tak szybko, że na to samo pytanie powstaje czasem kilka metaanaliz w ciągu roku — z rozbieżnymi wnioskami (Choi i Kang, 2022). Dlatego tak duże znaczenie mają przejrzyste metody, ponowna analiza danych i standardy raportowania.
| Cecha | Przegląd systematyczny | Metaanaliza | Umbrella review |
|---|---|---|---|
| Jednostka analizy | badania pierwotne | wielkości efektu z badań pierwotnych | przeglądy systematyczne i metaanalizy |
| Główny wynik | synteza ilościowa lub opisowa | efekt łączny, heterogeniczność, moderatory | ocena siły dowodów dla wielu pytań lub czynników |
| Ocena jakości | RoB 2, ROBINS-I, QUADAS-2 | jak w przeglądzie + błąd publikacji | AMSTAR 2, ROBIS, GRADE |
| Standard raportowania | PRISMA 2020 | PRISMA 2020 | PRIOR |
Źródła zestawienia: Dagher i Khan (2025), Page i in. (2021), Abdellatif i in. (2025).
Wielkość efektu (siła efektu) — wspólna waluta metaanalizy
Metaanaliza nie łączy wartości p, lecz wielkości efektu: liczby opisujące kierunek i siłę zjawiska w porównywalnej skali (Viechtbauer, 2010). Wybór miary zależy od planu badań i od tego, jakie dane raportują autorzy — inne indeksy stosuje się do porównań grup, inne do związków między zmiennymi, a jeszcze inne do zdarzeń dychotomicznych czy częstości (Viechtbauer, 2010; Spittal, 2026). O interpretacji samych wartości piszę więcej w poradniku wielkość efektu poza wartością p i w haśle siła efektu.
| Miara | Kiedy | Na co uważać |
|---|---|---|
| Różnica średnich (MD) | wszystkie badania używają tej samej skali | wynik zostaje w jednostkach oryginalnych |
| Standaryzowana różnica średnich: d Cohena, g Hedgesa | ten sam konstrukt mierzony różnymi narzędziami | g koryguje dodatnie obciążenie d w małych próbach |
| Korelacja r i transformacja z Fishera | związki między zmiennymi | analizę prowadzi się na z, a wynik przelicza z powrotem na r |
| Iloraz szans (OR), ryzyko względne (RR) | wyniki dychotomiczne | analizuje się logarytmy; wybór zależy od planu badania |
| Różnica ryzyka (RD), iloraz częstości | zdarzenia, dane z osobolatami | RD analizuje się w skali oryginalnej, ilorazy — w logarytmicznej |
Na podstawie: Dagher i Khan (2025), Viechtbauer (2010), Spittal (2026).
W przeglądzie 178 metaanaliz wielopoziomowych najczęściej łączoną miarą była korelacja Pearsona (52 analizy), a następnie g Hedgesa (37) i d Cohena (31) (Fernández-Castilla i in., 2020). Dla dwóch grup standaryzowaną różnicę średnich i jej wariancję liczy się tak (Pastor i Lazowski, 2018; Borenstein i in., 2009):
SDpooled = √{[(n1 − 1)SD1² + (n2 − 1)SD2²] / (n1 + n2 − 2)}
Var(d) = (n1 + n2) / (n1n2) + d² / [2(n1 + n2)]
g = J · d, J = 1 − 3 / (4df − 1), df = n1 + n2 − 2
Korelację przed uśrednieniem przekształca się do skali z Fishera, która lepiej spełnia założenie normalności (Viechtbauer, 2010; Borenstein i in., 2009):
Dwie zasady praktyczne. Po pierwsze, kierunek efektu musi być zakodowany jednakowo we wszystkich badaniach, a skale odwrócone trzeba odwrócić przed obliczeniami (Dagher i Khan, 2025). Po drugie, jeśli wszystkie badania używają tej samej skali, warto zostać przy jednostkach oryginalnych — standaryzacja odrzuca część informacji (McShane i Böckenholt, 2023).
Przeliczanie danych do metaanalizy: gdy każde badanie raportuje inaczej
To najbardziej czasochłonny etap. Jedno badanie podaje średnie i odchylenia standardowe, drugie medianę i rozstęp, trzecie tylko statystykę t albo przedział ufności ilorazu szans. Zanim cokolwiek połączysz, każdy wynik trzeba sprowadzić do tej samej miary i oszacować jego błąd standardowy. Gdy błędów standardowych brakuje, badania są często wykluczane, co samo w sobie może zniekształcić wynik metaanalizy (Spittal, 2026).
| Co podaje badanie | Co trzeba uzyskać | Przeliczenie |
|---|---|---|
| Iloraz (OR, RR, iloraz częstości) z 95% CI | błąd standardowy logarytmu | SE = [ln(oszacowanie) − ln(dolna granica)] / 1,96 |
| Częstość z 95% CI | liczba zdarzeń A i osobolata T | A = (1 / SE[ln R])², T = A / R |
| Statystyka t dla dwóch grup | d | d = t · √(1/n1 + 1/n2) |
| Korelacja r | d | d = 2r / √(1 − r²) |
| d | r | r = d / √(d² + a), a = (n1 + n2)² / (n1n2) |
| ln(OR) | d | d = ln(OR) · √3 / π |
| Mediana i rozstęp lub IQR | średnia i SD | metody szacowania, np. Wan i in. (2014) |
| Zero zdarzeń w tabeli 2 × 2 | OR lub RR | korekta ciągłości 0,5 dla komórek |
Źródła wzorów: Spittal (2026) dla ilorazów i częstości; Borenstein i in. (2009) dla przeliczeń między d, r i ln(OR); Wan i in. (2014), za: Dagher i Khan (2025); korekta zer: Schwarzer (2007), Viechtbauer (2010). Przy każdym przeliczeniu przelicza się także wariancję.
Przeliczenia mają swoje pułapki:
- Nie łącz różnych miar efektu w jednej analizie, np. ilorazów częstości z ilorazami szans — OR przybliża iloraz częstości tylko przy rzadkich zdarzeniach (Spittal, 2026).
- Oszacowania skorygowane, np. z modeli regresji, łącz tylko wtedy, gdy badania kontrolowały podobne zmienne (Spittal, 2026).
- Wyniki z różnych punktów pomiaru, np. tuż po interwencji i w obserwacji odroczonej, analizuj osobno (Polanin i in., 2017).
- Brakujące dane najpierw spróbuj uzyskać od autorów badań, choć odsetek odpowiedzi bywa niski (Forero i in., 2019).
- Wszystkie obliczenia dokumentuj w załączniku, tak aby recenzent mógł je odtworzyć (Spittal, 2026).
Model efektów stałych czy losowych? Heterogeniczność bez mitów
Model efektów stałych pozwala wnioskować wyłącznie o włączonych badaniach. Model efektów losowych traktuje badania jak próbę z populacji możliwych badań, których prawdziwe efekty się różnią. Wybór należy podjąć przed analizą — na podstawie celu wnioskowania, a nie wyniku testu heterogeniczności (Viechtbauer, 2010; Pastor i Lazowski, 2018). Ponieważ badania rzadko są funkcjonalnie identyczne, domyślnym wyborem jest zwykle model efektów losowych (Pastor i Lazowski, 2018).
Stawka jest wysoka. W symulacji Van den Noortgate’a i Onghena (2003) model efektów stałych przy rzeczywistej heterogeniczności wielokrotnie przekraczał nominalny poziom błędów I rodzaju, a w jednym z warunków jego błąd standardowy był ponad dwukrotnie mniejszy od faktycznej zmienności oszacowań.
Estymatory i korekta Knappa–Hartunga
Wariancję między badaniami (τ²) najczęściej szacuje się metodą REML, która jest w przybliżeniu nieobciążona i efektywna (Viechtbauer, 2010). Przy wyniku dychotomicznym zalecany bywa też estymator Paule–Mandela (Balduzzi i in., 2019). Przy małej liczbie badań warto dodać korektę Knappa–Hartunga — w symulacji Viechtbauera (2010) obniżyła ona odsetek błędów I rodzaju z około 9% do 6%. Ponieważ wybór estymatora może zmienić wynik, dobrą praktyką jest analiza wrażliwości z kilkoma estymatorami (Pastor i Lazowski, 2018).
Jak raportować heterogeniczność?
Statystyka Q testuje, czy wyniki różnią się bardziej, niż wynikałoby to z błędu losowego — i ma większą moc niż test ilorazu wiarygodności czy test Walda (Van den Noortgate i Onghena, 2003). Sam test to jednak za mało. Raportuj:
- τ² i τ — wariancję i odchylenie standardowe prawdziwych efektów;
- I² — odsetek zmienności wynikający z heterogeniczności, a nie z błędu losowego;
- przedział predykcji — zakres, w którym prawdopodobnie znajdzie się prawdziwy efekt w nowym badaniu.
95% PI = μ̂ ± tk−2 · √(τ̂² + SE²(μ̂))
W pierwszym wzorze v oznacza typową wariancję próbkowania badań; oba wzory przytaczają Pastor i Lazowski (2018). Przedział predykcji bywa najbardziej pouczający. W samouczku Balduzziego i współpracowników (2019) łączne ryzyko względne wyniosło 2,15 (95% CI: 1,51–3,06), lecz 95% przedział predykcji (0,81–5,67) obejmował 1 — w kolejnym badaniu wynik mógłby więc wypaść na korzyść placebo.
I² bywa nadinterpretowane. Zależy od wielkości prób w badaniach pierwotnych: przy tym samym τ² rośnie, gdy badania są większe (Cheung, 2019). Popularne progi traktuj orientacyjnie — Dagher i Khan (2025) celowo podają nakładające się przedziały: 0–40% (minimalna), 30–60% (umiarkowana), 50–90% (znaczna) i 75–100% (bardzo duża). Szacunki heterogeniczności są nieprecyzyjne, zwłaszcza przy kilku badaniach, dlatego warto podawać ich przedziały ufności (Viechtbauer, 2010). W przykładzie Pastora i Lazowskiego (2018) przedział predykcji policzony dla dolnej i górnej granicy przedziału ufności τ wahał się od [−0,10; 0,28] do [−0,79; 0,97].
Moderatory i metaregresja
Źródła heterogeniczności bada się metaregresją lub analizą podgrup. Lepiej dopasować jeden model z moderatorem niż osobne modele dla podgrup, bo τ² szacuje się wtedy na pełnym zbiorze badań (Viechtbauer, 2010; Van den Noortgate i Onghena, 2003). Odsetek wyjaśnionej heterogeniczności (R²) oblicza się ze spadku τ² po dodaniu moderatorów (Pastor i Lazowski, 2018), a wiarygodność efektów podgrup pomaga ocenić narzędzie ICEMAN (Dagher i Khan, 2025).
Metaanaliza wielopoziomowa (trójpoziomowa): gdy jedno badanie daje kilka efektów
Każda metaanaliza efektów losowych jest formalnie modelem dwupoziomowym: uczestnicy są zagnieżdżeni w badaniach (Van den Noortgate i Onghena, 2003; Pastor i Lazowski, 2018). Problem zaczyna się, gdy jedno badanie dostarcza kilku wielkości efektu — dla kilku miar tego samego konstruktu, kilku grup eksperymentalnych porównywanych z jedną kontrolną albo kilku punktów pomiaru. Takie efekty nie są niezależne, a traktowanie ich jak niezależnych zaniża błędy standardowe i zwiększa ryzyko fałszywie istotnych wyników (Cheung, 2019; Fernández-Castilla i in., 2020).
Metaanaliza trójpoziomowa rozwiązuje ten problem, dodając poziom dla efektów zagnieżdżonych w badaniach (Cheung, 2019):
Poziom 1 to wariancja próbkowania eij, znana z badania. Poziom 2 opisuje zróżnicowanie efektów w obrębie jednego badania (τ²(2)), a poziom 3 — zróżnicowanie między badaniami (τ²(3)). Model uwzględnia zależność bez znajomości korelacji między efektami, pozwala oszacować heterogeniczność i I² osobno dla każdego poziomu oraz testować moderatory na poziomie efektu i badania (Cheung, 2019). W ponownej analizie danych o związku rozwiązywania złożonych problemów z inteligencją I² wyniosło 0,45 na poziomie efektów i 0,51 na poziomie badań — informacja niedostępna w zwykłym modelu (Cheung, 2019).
Alternatywy: uśrednianie, wybór efektu, model wielowymiarowy i RVE
| Strategia | Zaleta | Ograniczenie |
|---|---|---|
| Uśrednienie efektów w badaniu | prostota | wymaga założenia korelacji; traci informację i uniemożliwia testowanie moderatorów wewnątrz badań |
| Wybór jednego efektu na badanie | prostota | nieefektywny; reguła wyboru może wprowadzić obciążenie |
| Metaanaliza wielowymiarowa | wykorzystuje kowariancje między wynikami | wymaga korelacji między wynikami, rzadko raportowanych |
| Odporna estymacja wariancji (RVE) | nie wymaga znajomości struktury zależności | daje tylko łączną heterogeniczność; niewiarygodna przy df < 4 |
| Model trójpoziomowy | heterogeniczność i moderatory na każdym poziomie | wymaga poprawnej specyfikacji poziomów |
Na podstawie: Cheung (2019), Polanin i in. (2017), Fernández-Castilla i in. (2020).
W symulacjach zarówno model trójpoziomowy, jak i RVE sprawdzają się bardzo dobrze, a ich połączenie — model wielopoziomowy z odpornymi błędami standardowymi — uchodzi za obiecujący kompromis (Cheung, 2019; Fernández-Castilla i in., 2020).
Metaanaliza wielopoziomowa w liczbach
Przegląd 178 metaanaliz wielopoziomowych pokazał, że 162 z nich stosowało model trójpoziomowy, najczęściej w pakiecie R metafor (82 analizy), a liczba takich publikacji gwałtownie rośnie od 2016 roku. W naukach behawioralnych i społecznych przy d Cohena na różnice między badaniami przypadało typowo około 61% całkowitej zmienności, a na różnice między efektami w obrębie badań — około 17% (Fernández-Castilla i in., 2020). Z tego samego przeglądu płyną trzy praktyczne wnioski:
- najpierw rozpoznaj strukturę danych — czasem potrzebny jest czwarty poziom (np. próby w badaniach albo kraje) lub model z efektami skrzyżowanymi;
- czynnik traktuj jako losowy dopiero przy wystarczającej liczbie kategorii — reguła kciuka mówi o co najmniej 20; przy pięciu krajach lepiej użyć moderatora;
- przy mniej niż 10 jednostkach najwyższego poziomu modele wielopoziomowe mogą zawyżać odsetek błędów I rodzaju.
Rozwinięciem są modele wielopoziomowe wielowymiarowe, które jednocześnie uwzględniają kilka zmiennych zależnych i warunków eksperymentalnych (McShane i Böckenholt, 2023), oraz metaanalityczne modelowanie równań strukturalnych (MASEM). MASEM testuje całe modele teoretyczne na zbiorczych macierzach korelacji i zwykle wymaga co najmniej 30–40 badań (Jak i in., 2021; Raeisi-Vanani i in., 2022). Warto w nim korygować korelacje o nierzetelność pomiaru — bez tej korekty efekty pośrednie bywały zaniżone nawet o około połowę (Gnambs i Sengewald, 2023).
Błąd publikacji i analizy wrażliwości
Mniejsze badania często pokazują inne — zwykle większe — efekty niż duże. Przyczyną może być błąd publikacji (efekt szuflady), ale też prawdziwa heterogeniczność, dlatego mówi się ogólnie o efektach małych badań (Schwarzer, 2007; Balduzzi i in., 2019). Standardowe narzędzia to:
- wykres lejkowy (funnel plot), także w wersji z konturami istotności, która pomaga odróżnić błąd publikacji od innych przyczyn asymetrii (Balduzzi i in., 2019);
- test Eggera i test rang Begga i Mazumdara; dla logarytmów OR i RR stosuje się zmodyfikowane testy, bo wariancja zależy tam od samego oszacowania (Schwarzer, 2007);
- metoda trim-and-fill — traktuj ją jako analizę wrażliwości, a nie „poprawiony” wynik (Viechtbauer, 2010);
- test nadmiaru istotnych wyników (excess significance), stosowany m.in. w umbrella review (Belbasis i in., 2022).
Testy asymetrii mają małą moc i stosuje się je dopiero przy co najmniej 10 badaniach (Balduzzi i in., 2019). Ten sam samouczek dobrze pokazuje, jak wrażliwy bywa wynik: po dodaniu przez trim-and-fill dziewięciu „brakujących” badań łączne ryzyko względne spadło z 2,15 do 1,40 (95% CI: 0,83–2,38), choć autorzy zaznaczają, że asymetrię mogła wyjaśniać także heterogeniczność kliniczna (Balduzzi i in., 2019). Odporność wniosku sprawdzają też analizy wpływu: pomijanie po jednym badaniu (leave-one-out), statystyki wpływu i analiza kumulatywna (Viechtbauer, 2010). Pewność dowodów podsumowuje GRADE, który uwzględnia ryzyko błędu, niespójność, pośredniość, nieprecyzyjność i błąd publikacji (Dagher i Khan, 2025).
Umbrella review (przegląd parasolowy): synteza metaanaliz
Umbrella review — nazywany też przeglądem przeglądów, overview of reviews lub metaprzeglądem — to systematyczne zebranie i ocena wszystkich przeglądów systematycznych i metaanaliz na dany, szeroko zdefiniowany temat (Belbasis i in., 2022; Abdellatif i in., 2025). Rośnie lawinowo: tylko w 2020 roku opublikowano ponad 300 nowych umbrella review (Gosling i in., 2023).
Kiedy go wybrać? Jeśli na dany temat nie ma metaanaliz albo jest ich niewiele, potrzebna jest nowa metaanaliza; jeśli istniejące są przestarzałe — ich aktualizacja. Umbrella review ma sens, gdy istnieje kilka aktualnych przeglądów z metaanalizą (Belbasis i in., 2022). Typowe zastosowania to ocena wszystkich interwencji dla danej choroby oraz przeglądy czynników ryzyka: jednego czynnika dla wielu wyników albo wielu czynników dla jednego wyniku.
Jak przeprowadzić umbrella review?
- Pytanie i kryteria — PICO, a dla czynników ryzyka: populacja, ekspozycja i wynik; szersze niż w pojedynczej metaanalizie, ale precyzyjnie zdefiniowane (Belbasis i in., 2022).
- Wyszukiwanie — filtr na przeglądy systematyczne i metaanalizy połączony operatorem AND z hasłami tematycznymi; oprócz baz ogólnych przeszukaj repozytoria przeglądów, np. Cochrane Database of Systematic Reviews i Epistemonikos (Abdellatif i in., 2025).
- Selekcja i ekstrakcja przez co najmniej dwie niezależne osoby; z każdej metaanalizy wyodrębnia się dane poszczególnych badań: liczebność, liczbę zdarzeń i oszacowanie efektu z 95% CI (Belbasis i in., 2022).
- Kontrola pokrywania się przeglądów — opisana niżej.
- Ocena jakości przeglądów — AMSTAR 2 (16 domen) lub ROBIS, a pewność dowodów — GRADE (Abdellatif i in., 2025).
- Ponowna analiza każdej metaanalizy na danych z poziomu badań, jednolitymi metodami — z heterogenicznością, przedziałem predykcji i testami błędów, bo opublikowane metaanalizy często stosują nieodpowiednie modele (Belbasis i in., 2022).
- Ocena siły dowodów i analizy wrażliwości, np. tylko na badaniach prospektywnych.
- Interpretacja z uwzględnieniem zakłócania, odwrotnej przyczynowości i innych błędów (Belbasis i in., 2022).
Pokrywanie się przeglądów i wskaźnik CCA
Gdy kilka przeglądów zawiera te same badania pierwotne, łatwo policzyć dowody podwójnie. Nakładanie się wykrywa się macierzą cytowań: wiersze to badania pierwotne, kolumny to przeglądy (Abdellatif i in., 2025). Jego stopień podsumowuje skorygowany obszar pokrycia (corrected covered area, CCA; Pieper i in., 2014):
N to łączna liczba wystąpień badań we wszystkich przeglądach, r — liczba unikalnych badań pierwotnych, a c — liczba przeglądów. Wartość do 5% oznacza niewielkie pokrywanie się, 6–10% umiarkowane, 11–15% wysokie, a powyżej 15% bardzo wysokie (Pieper i in., 2014). Przy silnym pokrywaniu się zwykle wybiera się przegląd najnowszy, obejmujący najwięcej badań lub o najwyższej jakości (Belbasis i in., 2022; Gosling i in., 2023).
Jak ocenić wiarygodność dowodów? Klasy I–IV
W umbrella review czynników ryzyka bierze się pod uwagę liczbę przypadków, poziom istotności, heterogeniczność, przedział predykcji, efekty małych badań i nadmiar istotnych wyników (Belbasis i in., 2022). Najczęściej stosowana klasyfikacja wygląda tak (Fusar-Poli i Radua, 2018):
| Klasa | Kryteria |
|---|---|
| I — dowody przekonujące | ponad 1000 przypadków, p < 10−6, I² < 50%, 95% przedział predykcji nie obejmuje braku efektu, brak efektów małych badań i nadmiaru istotności |
| II — wysoce sugestywne | ponad 1000 przypadków, p < 10−6, największe badanie istotne statystycznie |
| III — sugestywne | ponad 1000 przypadków, p < 10−3 |
| IV — słabe | p < 0,05 |
| NS — nieistotne | p > 0,05 |
Ta stratyfikacja potrafi radykalnie zmienić obraz literatury: w przeglądzie czynników ryzyka cukrzycy typu 2 spośród 142 związków 116 było istotnych przy p < 0,05, ale tylko 11 spełniło kryteria silnych dowodów (Belbasis i in., 2022). Pakiet R metaumbrella automatyzuje cały proces — przelicza różne formaty danych na wspólną miarę, ponownie wykonuje metaanalizy, liczy test Eggera, test nadmiaru istotności i przedział predykcji, a następnie przypisuje klasy według kryteriów Ioannidisa, algorytmu inspirowanego GRADE albo własnych progów (Gosling i in., 2023). Wyniki raportuje się według PRIOR, podając dla każdej metaanalizy m.in. liczbę badań i uczestników, miarę i model, efekt łączny z 95% CI i przedziałem predykcji, heterogeniczność, wynik największego badania oraz testy błędów (Belbasis i in., 2022; Abdellatif i in., 2025).
PRISMA 2020 — standard raportowania przeglądu i metaanalizy
PRISMA 2020 zastąpiła wytyczne z 2009 roku i jest dziś podstawowym standardem raportowania przeglądów systematycznych — z metaanalizą lub bez niej (Page i in., 2021). Składa się z listy 27 pozycji pogrupowanych w 7 sekcji, osobnej 12-punktowej listy dla streszczenia oraz szablonów diagramu przepływu dla nowych i aktualizowanych przeglądów. PRISMA mówi, co raportować, a nie jak przeprowadzić przegląd, i nie służy do oceny jego jakości (Page i in., 2021).
Co zmieniło się względem PRISMA 2009?
- osobna lista kontrolna dla streszczenia;
- pełne strategie wyszukiwania dla wszystkich baz, rejestrów i stron internetowych;
- szczegóły procesu selekcji: liczba osób, niezależność ocen, narzędzia automatyzacji;
- metody syntezy rozbite na sześć podpunktów (13a–f), a jej wyniki — na cztery (20a–d);
- nowe pozycje o pewności dowodów (15 i 22) oraz lista wykluczonych badań, które były bliskie spełnienia kryteriów (16b);
- rejestracja i protokół w nowej sekcji „Inne informacje”, wraz ze zmianami (24a–c), a także konflikt interesów (26) i dostępność danych, kodu oraz materiałów (27).
Pozycje PRISMA 2020 kluczowe dla metaanalizy
| Pozycja | Co trzeba opisać |
|---|---|
| 10a | definicje wyników i to, czy zbierano wszystkie zgodne wyniki (miary, punkty czasowe, analizy) |
| 12 | miary efektu dla każdego wyniku, np. RR lub MD |
| 13b | przygotowanie danych: uzupełnianie brakujących statystyk i przeliczenia |
| 13d | model, metody wykrywania i oceny heterogeniczności, oprogramowanie |
| 13e–f | badanie przyczyn heterogeniczności oraz analizy wrażliwości |
| 14 | ocena ryzyka błędu wynikającego z brakujących wyników (błędu raportowania) |
| 15 i 22 | ocena pewności dowodów, np. według GRADE |
| 20b | efekt łączny z przedziałem ufności i miary heterogeniczności |
| 24a–c | rejestr i numer rejestracji (lub informacja o jej braku), dostęp do protokołu, zmiany |
| 27 | dostępność formularzy, wyodrębnionych danych, danych do analiz i kodu |
Diagram przepływu ma trzy kolumny: poprzednie badania (przy aktualizacji przeglądu), nowe badania z baz i rejestrów oraz nowe badania z innych źródeł, takich jak strony internetowe, organizacje czy wyszukiwanie cytowań. Osobno raportuje się rekordy usunięte przed selekcją — duplikaty, rekordy odrzucone przez narzędzia automatyzacji i z innych powodów — a na etapie pełnych tekstów podaje się przyczyny wykluczeń (Page i in., 2021). Najprościej od początku prowadzić arkusz z każdą decyzją selekcyjną (Forero i in., 2019).
Protokół przeglądu opisuje się według PRISMA-P i rejestruje przed rozpoczęciem pracy, np. w PROSPERO (Page i in., 2021; Dagher i Khan, 2025). Dla szczególnych przeglądów istnieją rozszerzenia — m.in. dla metaanalizy sieciowej, danych indywidualnych uczestników i przeglądów zakresu — a strategie wyszukiwania opisuje PRISMA-S (Page i in., 2021). O opisie metod według standardu APA piszę więcej w poradniku wytyczne APA dla metodologii i statystyki.
Metaanaliza w R: kod krok po kroku
Poniższe przepisy korzystają z pakietów metafor i metaumbrella. Przed uruchomieniem sprawdź kierunek kodowania efektów, strukturę zależności między nimi oraz wersje pakietów — nazwy części argumentów zmieniały się między wydaniami.
1. Wielkość efektu, przeliczenia i model efektów losowych
R
library(metafor)
dane <- read.csv("badania.csv") # m1, sd1, n1, m2, sd2, n2, badanie
# Przeliczenia (Borenstein i in., 2009; Spittal, 2026)
d_z_r <- function(r) 2 * r / sqrt(1 - r^2)
d_z_lnor <- function(lnor) lnor * sqrt(3) / pi
se_ln_z_ci <- function(oszac, dolna) (log(oszac) - log(dolna)) / 1.96
# g Hedgesa: measure = "SMD" zawiera korektę małej próby
dane <- escalc(measure = "SMD", m1i = m1, sd1i = sd1, n1i = n1,
m2i = m2, sd2i = sd2, n2i = n2, data = dane)
# Model efektów losowych: REML i korekta Knappa-Hartunga
model <- rma(yi, vi, data = dane, method = "REML", test = "knha")
summary(model) # efekt łączny, Q, tau^2, I^2
confint(model) # przedziały ufności dla tau^2 i I^2
predict(model) # 95% przedział predykcji (pi.lb, pi.ub)
forest(model, slab = dane$badanie)
# Efekty małych badań i wrażliwość
funnel(model)
regtest(model) # test Eggera: sensowny od ok. 10 badań
trimfill(rma(yi, vi, data = dane, method = "REML")) # tylko analiza wrażliwości
leave1out(model)2. Metaanaliza trójpoziomowa i odporne błędy standardowe
R
library(metafor)
dane$id_efektu <- seq_len(nrow(dane))
model3 <- rma.mv(yi, vi, random = ~ 1 | id_badania/id_efektu,
data = dane, method = "REML", test = "t")
summary(model3)
# Czy poziom efektów jest potrzebny? Porównanie z modelem dwupoziomowym
model2 <- rma.mv(yi, vi, random = ~ 1 | id_badania,
data = dane, method = "REML", test = "t")
anova(model3, model2)
# Odporne błędy standardowe (RVE) dla modelu wielopoziomowego
# (wymaga zainstalowanego pakietu clubSandwich)
robust(model3, cluster = dane$id_badania, clubSandwich = TRUE)
# I^2 na poziomie badań i efektów (por. Cheung, 2019)
W <- diag(1 / dane$vi)
X <- model.matrix(model3)
P <- W - W %*% X %*% solve(t(X) %*% W %*% X) %*% t(X) %*% W
v_typowa <- (model3$k - model3$p) / sum(diag(P))
round(100 * model3$sigma2 / (sum(model3$sigma2) + v_typowa), 1)3. Umbrella review w pakiecie metaumbrella
R
library(metaumbrella)
# Dane: jeden wiersz na badanie, kolumny zgodne z winietą format-dataset
view.errors.umbrella(dane_umb) # kontrola błędów w danych
umb <- umbrella(dane_umb, mult.level = TRUE) # ponowne metaanalizy
evid <- add.evidence(umb, criteria = "Ioannidis")
summary(evid)
forest(evid)Bibliografia oprogramowania i wykorzystanych pakietów
W przykładach użyto: R, metafor, metaumbrella. W pracy badawczej podaj faktycznie użyte wersje, które odczytasz poleceniem sessionInfo(), i cytuj wyłącznie narzędzia rzeczywiście użyte w końcowej analizie.
- R: R Core Team. (2026). R: A language and environment for statistical computing [Computer software]. R Foundation for Statistical Computing. https://www.R-project.org/
- metafor: Viechtbauer, W. (2010). Conducting meta-analyses in R with the metafor package. Journal of Statistical Software, 36(3), 1–48. https://doi.org/10.18637/jss.v036.i03
- metaumbrella: Gosling, C. J., Solanes, A., Fusar-Poli, P., & Radua, J. (2023). metaumbrella: The first comprehensive suite to perform data analysis in umbrella reviews with stratification of the evidence. BMJ Mental Health, 26(1), Article e300534. https://doi.org/10.1136/bmjment-2022-300534
Jak przeprowadzić metaanalizę krok po kroku — krótki poradnik
Poniższa lista łączy zalecenia z przewodników Daghera i Khana (2025), Forero i współpracowników (2019) oraz PRISMA 2020 (Page i in., 2021). Bardziej podstawowe wprowadzenie znajdziesz w poradniku metaanaliza: jak rzetelnie połączyć wyniki wielu badań.
- Sprawdź, czy metaanaliza ma sens. Sformułuj pytanie w schemacie PICO i upewnij się, że nie istnieje już aktualna metaanaliza — wtedy rozważ jej aktualizację lub umbrella review (Forero i in., 2019; Belbasis i in., 2022).
- Napisz i zarejestruj protokół. Ustal z góry kryteria włączenia, wyniki, miary efektu i plan analizy; zarejestruj go, np. w PROSPERO (Forero i in., 2019; Dagher i Khan, 2025).
- Przeszukaj literaturę w kilku bazach. Zwykle w co najmniej trzech, z rejestrami i bibliografiami przeglądów; zapisz pełne strategie wyszukiwania i daty (Dagher i Khan, 2025; Page i in., 2021).
- Selekcjonuj badania w parach. Dwie niezależne osoby, pilotaż na próbce rekordów, zgodność oceniana współczynnikiem kappa Cohena i zapisane powody wykluczeń (Dagher i Khan, 2025).
- Wyodrębniaj dane w duplikacie. Z formularzem przetestowanym na kilku badaniach; zapisuj narzędzie pomiaru, kierunek skali i punkty czasowe (Dagher i Khan, 2025).
- Policz i przelicz wielkości efektu. Sprowadź wyniki do wspólnej miary z błędami standardowymi, a każde przeliczenie udokumentuj (Spittal, 2026).
- Oceń ryzyko błędu. RoB 2 dla badań randomizowanych, ROBINS-I dla nierandomizowanych, QUADAS-2 dla badań diagnostycznych (Dagher i Khan, 2025).
- Dopasuj model. Model efektów losowych z REML i korektą Knappa–Hartunga; przy zależnych efektach — model trójpoziomowy lub RVE. Raportuj τ², I² i przedział predykcji, a moderatory badaj metaregresją.
- Sprawdź odporność wyników. Wykres lejkowy, test Eggera od 10 badań, trim-and-fill jako analiza wrażliwości, leave-one-out i ocena pewności dowodów według GRADE (Balduzzi i in., 2019; Dagher i Khan, 2025).
- Raportuj zgodnie z PRISMA 2020 i udostępnij dane oraz kod. Dołącz tabelę charakterystyk badań, wykres leśny, dane i skrypty analizy (Forero i in., 2019; Page i in., 2021).
Najczęstsze pytania o metaanalizę
Ile badań potrzeba do metaanalizy?
Nie ma jednego progu. Przy kilku badaniach szacunek wariancji między badaniami jest bardzo niepewny, a błędy standardowe w modelu efektów losowych bywają nietrafne (Van den Noortgate i Onghena, 2003). Testy asymetrii wykresu lejkowego stosuje się od 10 badań (Balduzzi i in., 2019), modele wielopoziomowe wymagają ostrożności przy mniej niż 10 badaniach (Fernández-Castilla i in., 2020), a MASEM — zwykle co najmniej 30 (Jak i in., 2021).
Czy można łączyć iloraz szans z ryzykiem względnym?
Nie należy łączyć różnych miar efektu w jednej analizie. Najpierw trzeba je sprowadzić do wspólnej miary, a iloraz szans przybliża iloraz częstości tylko przy rzadkich zdarzeniach (Spittal, 2026).
Kiedy wybrać umbrella review zamiast nowej metaanalizy?
Gdy na dany temat istnieje kilka aktualnych przeglądów systematycznych z metaanalizą. Jeśli ich brakuje, potrzebna jest nowa metaanaliza, a jeśli są przestarzałe — ich aktualizacja (Belbasis i in., 2022).
Czym metaanaliza wielopoziomowa różni się od zwykłej?
Dodaje poziom dla efektów zagnieżdżonych w badaniach. Dzięki temu uwzględnia ich zależność i pozwala oszacować heterogeniczność osobno w obrębie badań i między nimi (Cheung, 2019).
Pojęcia powiązane z tematem
Potrzebujesz pomocy w metaanalizie lub przeliczeniu danych?
Pomagam badaczom, doktorantom i zespołom na każdym etapie syntezy badań: od ekstrakcji i przeliczenia danych na wspólną miarę efektu, przez model efektów losowych, metaanalizę wielopoziomową, metaregresję i analizę błędu publikacji, po umbrella review z ponowną analizą metaanaliz oraz raport zgodny z PRISMA 2020 — z wykresami, tabelami i opisem metod gotowym do publikacji. Mam własne doświadczenie publikacyjne w tej dziedzinie, m.in. metaanalizę w International Journal of Advertising (IF 6,7).
Wyceń swoją metaanalizęOferta dla badaczyMoje publikacjeBibliografia i dalsza literatura naukowa (APA 7)
- Abdellatif, M., Dadam, M. N., Vu, N. T., Nam, N. H., Hoan, N. Q., Taoube, Z., Tran, P., & Huy, N. T. (2025). A step-by-step guide for conducting an umbrella review. Tropical Medicine and Health, 53(1), Article 134. https://doi.org/10.1186/s41182-025-00764-y
- Balduzzi, S., Rücker, G., & Schwarzer, G. (2019). How to perform a meta-analysis with R: A practical tutorial. Evidence-Based Mental Health, 22(4), 153–160. https://doi.org/10.1136/ebmental-2019-300117
- Belbasis, L., Bellou, V., & Ioannidis, J. P. A. (2022). Conducting umbrella reviews. BMJ Medicine, 1(1), Article e000071. https://doi.org/10.1136/bmjmed-2021-000071
- Borenstein, M., Hedges, L. V., Higgins, J. P. T., & Rothstein, H. R. (2009). Introduction to meta-analysis. John Wiley & Sons. https://doi.org/10.1002/9780470743386
- Cheung, M. W.-L. (2019). A guide to conducting a meta-analysis with non-independent effect sizes. Neuropsychology Review, 29(4), 387–396. https://doi.org/10.1007/s11065-019-09415-6
- Choi, G. J., & Kang, H. (2022). The umbrella review: A useful strategy in the rain of evidence. The Korean Journal of Pain, 35(2), 127–128. https://doi.org/10.3344/kjp.2022.35.2.127
- Dagher, D., & Khan, M. (2025). Writing a systematic review and meta-analysis: A step-by-step guide. Sports Health, 17(5), 885–890. https://doi.org/10.1177/19417381251364686
- Fernández-Castilla, B., Jamshidi, L., Declercq, L., Beretvas, S. N., Onghena, P., & Van den Noortgate, W. (2020). The application of meta-analytic (multi-level) models with multiple random effects: A systematic review. Behavior Research Methods, 52(5), 2031–2052. https://doi.org/10.3758/s13428-020-01373-9
- Forero, D. A., Lopez-Leon, S., González-Giraldo, Y., & Bagos, P. G. (2019). Ten simple rules for carrying out and writing meta-analyses. PLOS Computational Biology, 15(5), Article e1006922. https://doi.org/10.1371/journal.pcbi.1006922
- Fusar-Poli, P., & Radua, J. (2018). Ten simple rules for conducting umbrella reviews. Evidence-Based Mental Health, 21(3), 95–100. https://doi.org/10.1136/ebmental-2018-300014
- Gnambs, T., & Sengewald, M.-A. (2023). Meta-analytic structural equation modeling with fallible measurements. Zeitschrift für Psychologie, 231(1), 39–52. https://doi.org/10.1027/2151-2604/a000511
- Gosling, C. J., Solanes, A., Fusar-Poli, P., & Radua, J. (2023). metaumbrella: The first comprehensive suite to perform data analysis in umbrella reviews with stratification of the evidence. BMJ Mental Health, 26(1), Article e300534. https://doi.org/10.1136/bmjment-2022-300534
- Jak, S., Li, H., Kolbe, L., de Jonge, H., & Cheung, M. W.-L. (2021). Meta-analytic structural equation modeling made easy: A tutorial and web application for one-stage MASEM. Research Synthesis Methods, 12(5), 590–606. https://doi.org/10.1002/jrsm.1498
- McShane, B. B., & Böckenholt, U. (2023). Multilevel multivariate meta-analysis made easy: An introduction to MLMVmeta. Behavior Research Methods, 55(5), 2367–2386. https://doi.org/10.3758/s13428-022-01892-7
- Page, M. J., McKenzie, J. E., Bossuyt, P. M., Boutron, I., Hoffmann, T. C., Mulrow, C. D., Shamseer, L., Tetzlaff, J. M., Akl, E. A., Brennan, S. E., Chou, R., Glanville, J., Grimshaw, J. M., Hróbjartsson, A., Lalu, M. M., Li, T., Loder, E. W., Mayo-Wilson, E., McDonald, S., … Moher, D. (2021). The PRISMA 2020 statement: An updated guideline for reporting systematic reviews. BMJ, 372, n71. https://doi.org/10.1136/bmj.n71
- Pastor, D. A., & Lazowski, R. A. (2018). On the multilevel nature of meta-analysis: A tutorial, comparison of software programs, and discussion of analytic choices. Multivariate Behavioral Research, 53(1), 74–89. https://doi.org/10.1080/00273171.2017.1365684
- Pieper, D., Antoine, S.-L., Mathes, T., Neugebauer, E. A. M., & Eikermann, M. (2014). Systematic review finds overlapping reviews were not mentioned in every other overview. Journal of Clinical Epidemiology, 67(4), 368–375. https://doi.org/10.1016/j.jclinepi.2013.11.007
- Polanin, J. R., Hennessy, E. A., & Tanner-Smith, E. E. (2017). A review of meta-analysis packages in R. Journal of Educational and Behavioral Statistics, 42(2), 206–242. https://doi.org/10.3102/1076998616674315
- Raeisi-Vanani, A., Plonsky, L., Wang, W., Lee, K., & Peng, P. (2022). Applying meta-analytic structural equation modeling to second language research: An introduction. Research Methods in Applied Linguistics, 1(3), Article 100018. https://doi.org/10.1016/j.rmal.2022.100018
- Schwarzer, G. (2007). meta: An R package for meta-analysis. R News, 7(3), 40–45.
- Spittal, M. (2026). Preparing for a meta-analysis of rates: Extracting effect sizes and standard errors from studies of count outcomes with person-time denominators. Injury Prevention, 32(1), 176–179. https://doi.org/10.1136/ip-2024-045610
- Van den Noortgate, W., & Onghena, P. (2003). Multilevel meta-analysis: A comparison with traditional meta-analytical procedures. Educational and Psychological Measurement, 63(5), 765–790. https://doi.org/10.1177/0013164402251027
- Viechtbauer, W. (2010). Conducting meta-analyses in R with the metafor package. Journal of Statistical Software, 36(3), 1–48. https://doi.org/10.18637/jss.v036.i03
Metodę szacowania średniej i SD z mediany (Wan i in., 2014) przytoczono za Dagherem i Khanem (2025).
Cytowania BibTeX
@article{abdellatif2025umbrella, author={Abdellatif, Mohammed and Dadam, Mohammad Najm and Vu, Nguyen Tuan and Nam, Nguyen Hai and Hoan, Nguyen Quoc and Taoube, Zahraa and Tran, Phillip and Huy, Nguyen Tien}, title={A step-by-step guide for conducting an umbrella review}, journal={Tropical Medicine and Health}, year={2025}, volume={53}, number={1}, pages={134}, doi={10.1186/s41182-025-00764-y}}@article{balduzzi2019meta, author={Balduzzi, Sara and R{\"u}cker, Gerta and Schwarzer, Guido}, title={How to perform a meta-analysis with R: a practical tutorial}, journal={Evidence-Based Mental Health}, year={2019}, volume={22}, number={4}, pages={153--160}, doi={10.1136/ebmental-2019-300117}}@article{belbasis2022umbrella, author={Belbasis, Lazaros and Bellou, Vanesa and Ioannidis, John P. A.}, title={Conducting umbrella reviews}, journal={BMJ Medicine}, year={2022}, volume={1}, number={1}, pages={e000071}, doi={10.1136/bmjmed-2021-000071}}@book{borenstein2009introduction, author={Borenstein, Michael and Hedges, Larry V. and Higgins, Julian P. T. and Rothstein, Hannah R.}, title={Introduction to Meta-Analysis}, publisher={John Wiley \& Sons}, year={2009}, doi={10.1002/9780470743386}}@article{cheung2019nonindependent, author={Cheung, Mike W.-L.}, title={A guide to conducting a meta-analysis with non-independent effect sizes}, journal={Neuropsychology Review}, year={2019}, volume={29}, number={4}, pages={387--396}, doi={10.1007/s11065-019-09415-6}}@article{choi2022umbrella, author={Choi, Geun Joo and Kang, Hyun}, title={The umbrella review: a useful strategy in the rain of evidence}, journal={The Korean Journal of Pain}, year={2022}, volume={35}, number={2}, pages={127--128}, doi={10.3344/kjp.2022.35.2.127}}@article{dagher2025writing, author={Dagher, Danielle and Khan, Moin}, title={Writing a systematic review and meta-analysis: A step-by-step guide}, journal={Sports Health}, year={2025}, volume={17}, number={5}, pages={885--890}, doi={10.1177/19417381251364686}}@article{fernandezcastilla2020multilevel, author={Fern{\'a}ndez-Castilla, Bel{\'e}n and Jamshidi, Laleh and Declercq, Lies and Beretvas, S. Natasha and Onghena, Patrick and Van den Noortgate, Wim}, title={The application of meta-analytic (multi-level) models with multiple random effects: A systematic review}, journal={Behavior Research Methods}, year={2020}, volume={52}, number={5}, pages={2031--2052}, doi={10.3758/s13428-020-01373-9}}@article{forero2019rules, author={Forero, Diego A. and Lopez-Leon, Sandra and Gonz{\'a}lez-Giraldo, Yeimy and Bagos, Pantelis G.}, title={Ten simple rules for carrying out and writing meta-analyses}, journal={PLOS Computational Biology}, year={2019}, volume={15}, number={5}, pages={e1006922}, doi={10.1371/journal.pcbi.1006922}}@article{fusarpoli2018umbrella, author={Fusar-Poli, Paolo and Radua, Joaquim}, title={Ten simple rules for conducting umbrella reviews}, journal={Evidence-Based Mental Health}, year={2018}, volume={21}, number={3}, pages={95--100}, doi={10.1136/ebmental-2018-300014}}@article{gnambs2023masem, author={Gnambs, Timo and Sengewald, Marie-Ann}, title={Meta-analytic structural equation modeling with fallible measurements}, journal={Zeitschrift f{\"u}r Psychologie}, year={2023}, volume={231}, number={1}, pages={39--52}, doi={10.1027/2151-2604/a000511}}@article{gosling2023metaumbrella, author={Gosling, Corentin J. and Solanes, Aleix and Fusar-Poli, Paolo and Radua, Joaquim}, title={metaumbrella: the first comprehensive suite to perform data analysis in umbrella reviews with stratification of the evidence}, journal={BMJ Mental Health}, year={2023}, volume={26}, number={1}, pages={e300534}, doi={10.1136/bmjment-2022-300534}}@article{jak2021masem, author={Jak, Suzanne and Li, Hongli and Kolbe, Laura and de Jonge, Hannelies and Cheung, Mike W.-L.}, title={Meta-analytic structural equation modeling made easy: A tutorial and web application for one-stage MASEM}, journal={Research Synthesis Methods}, year={2021}, volume={12}, number={5}, pages={590--606}, doi={10.1002/jrsm.1498}}@article{mcshane2023mlmvmeta, author={McShane, Blakeley B. and B{\"o}ckenholt, Ulf}, title={Multilevel multivariate meta-analysis made easy: An introduction to MLMVmeta}, journal={Behavior Research Methods}, year={2023}, volume={55}, number={5}, pages={2367--2386}, doi={10.3758/s13428-022-01892-7}}@article{page2021prisma, author={Page, Matthew J. and McKenzie, Joanne E. and Bossuyt, Patrick M. and Boutron, Isabelle and Hoffmann, Tammy C. and Mulrow, Cynthia D. and others}, title={The PRISMA 2020 statement: an updated guideline for reporting systematic reviews}, journal={BMJ}, year={2021}, volume={372}, pages={n71}, doi={10.1136/bmj.n71}}@article{pastor2018multilevel, author={Pastor, Dena A. and Lazowski, Rory A.}, title={On the multilevel nature of meta-analysis: A tutorial, comparison of software programs, and discussion of analytic choices}, journal={Multivariate Behavioral Research}, year={2018}, volume={53}, number={1}, pages={74--89}, doi={10.1080/00273171.2017.1365684}}@article{pieper2014overlap, author={Pieper, Dawid and Antoine, Sunya-Lee and Mathes, Tim and Neugebauer, Edmund A. M. and Eikermann, Michaela}, title={Systematic review finds overlapping reviews were not mentioned in every other overview}, journal={Journal of Clinical Epidemiology}, year={2014}, volume={67}, number={4}, pages={368--375}, doi={10.1016/j.jclinepi.2013.11.007}}@article{polanin2017packages, author={Polanin, Joshua R. and Hennessy, Emily A. and Tanner-Smith, Emily E.}, title={A review of meta-analysis packages in R}, journal={Journal of Educational and Behavioral Statistics}, year={2017}, volume={42}, number={2}, pages={206--242}, doi={10.3102/1076998616674315}}@article{raeisivanani2022masem, author={Raeisi-Vanani, Amin and Plonsky, Luke and Wang, Wei and Lee, Kejin and Peng, Peng}, title={Applying meta-analytic structural equation modeling to second language research: An introduction}, journal={Research Methods in Applied Linguistics}, year={2022}, volume={1}, number={3}, pages={100018}, doi={10.1016/j.rmal.2022.100018}}@article{schwarzer2007meta, author={Schwarzer, Guido}, title={meta: An R package for meta-analysis}, journal={R News}, year={2007}, volume={7}, number={3}, pages={40--45}}@article{spittal2026rates, author={Spittal, Matthew}, title={Preparing for a meta-analysis of rates: extracting effect sizes and standard errors from studies of count outcomes with person-time denominators}, journal={Injury Prevention}, year={2026}, volume={32}, number={1}, pages={176--179}, doi={10.1136/ip-2024-045610}}@article{vandennoortgate2003multilevel, author={Van den Noortgate, Wim and Onghena, Patrick}, title={Multilevel meta-analysis: A comparison with traditional meta-analytical procedures}, journal={Educational and Psychological Measurement}, year={2003}, volume={63}, number={5}, pages={765--790}, doi={10.1177/0013164402251027}}@article{viechtbauer2010metafor, author={Viechtbauer, Wolfgang}, title={Conducting meta-analyses in R with the metafor package}, journal={Journal of Statistical Software}, year={2010}, volume={36}, number={3}, pages={1--48}, doi={10.18637/jss.v036.i03}}