Metode ekstrakcije podataka za sistematski pregled (polu)automatizacije: Ažuriranje živog sistematskog pregleda.
F1000Research
Sažetak istraživanja
Pozadina Pouzdana i upotrebljiva (polu) automatizacija ekstrakcije podataka može podržati polje sistematskog pregleda smanjenjem radnog opterećenja potrebnog za prikupljanje informacija o vođenju i rezultatima uključenih studija. Ovaj živi sistematski pregled ispituje objavljene pristupe za izdvajanje podataka iz izvještaja o kliničkim studijama.
Metode Sistematski i kontinuirano pretražujemo PubMed, ACL Anthology, arXiv, OpenAlex preko EPPI-Reviewer-a i dblp baze podataka bibliografije računarskih nauka. Pregled punog teksta i ekstrakcija podataka provode se korištenjem mješavine open-source i komercijalnih alata. Ovo ažuriranje pregleda uživo uključuje publikacije do avgusta 2024. i OpenAlex sadržaj do septembra 2024.
Rezultati 117 publikacija uključeno je u ovu recenziju. Od toga je 30 (26%) koristilo pune tekstove, dok su ostali koristili naslove i sažetke. Ukupno 112 (96%) publikacija razvilo je klasifikatore za randomizirana kontrolirana ispitivanja. Izdvojeno je preko 30 entiteta, pri čemu su najčešće izdvajani PICO (populacija, intervencija, komparator, ishod). Podaci su dostupni iz 53 (45%), a šifra iz 49 (42%) publikacija. Devet (8%) implementiralo je javno dostupne alate.
Zaključci Ovaj živi sistematski pregled predstavlja pregled (polu)automatizovane literature za ekstrakciju podataka od interesa za različite vrste pregleda literature. Identifikovali smo široku bazu dokaza publikacija koje opisuju ekstrakciju podataka za interventne preglede i mali broj publikacija koje izdvajaju druge vrste studija. Između ažuriranja pregleda, veliki jezički modeli su se pojavili kao novi alat za ekstrakciju podataka. Dok su olakšavali pristup automatizovanom izdvajanju, oni su pokazali trend smanjenja kvaliteta izveštavanja o rezultatima, posebno kvantitativnih rezultata kao što su opoziv i niža reproduktivnost rezultata. U poređenju sa prethodnim ažuriranjem, trendovi kao što je prelazak na ekstrakciju relacija i deljenje koda i skupova podataka ostali su slični.
Prikaži originalni naslov i sažetak na engleskom
Data extraction methods for systematic review (semi)automation: Update of a living systematic review.
Background The reliable and usable (semi) automation of data extraction can support the field of systematic review by reducing the workload required to gather information about the conduct and results of the included studies. This living systematic review examines published approaches for data extraction from reports of clinical studies.
Methods We systematically and continually search PubMed, ACL Anthology, arXiv, OpenAlex via EPPI-Reviewer, and the dblp computer science bibliography databases. Full text screening and data extraction are conducted using a mix of open-source and commercial tools. This living review update includes publications up to August 2024 and OpenAlex content up to September 2024.
Results 117 publications are included in this review. Of these, 30 (26%) used full texts while the rest used titles and abstracts. A total of 112 (96%) publications developed classifiers for randomised controlled trials. Over 30 entities were extracted, with PICOs (population, intervention, comparator, outcome) being the most frequently extracted. Data are available from 53 (45%), and code from 49 (42%) publications. Nine (8%) implemented publicly available tools.
Conclusions This living systematic review presents an overview of (semi)automated data-extraction literature of interest to different types of literature review. We identified a broad evidence base of publications describing data extraction for interventional reviews and a small number of publications extracting other study types. Between review updates, large language models emerged as a new tool for data extraction. While facilitating access to automated extraction, they showed a trend of decreasing quality of results reporting, especially quantitative results such as recall and lower reproducibility of results. Compared with the previous update, trends such as transition to relation extraction and sharing of code and datasets stayed similar.
Izvorni podaci
- DOI
- 10.12688/f1000research.51117.3
- PMID
- 34408850
- PMCID
- PMC8361807
- Provjereno
- 2026-07-26
Naslov i sažetak prevedeni su automatski i prijevod može sadržavati netačnosti ili neprecizne stručne izraze. Za sve detalje, citiranje i medicinsko tumačenje pregledajte originalnu englesku verziju članka. Ne donosite zdravstvene odluke samo na osnovu ovog prijevoda.
Pregledaj originalni članak na engleskom