Učinak ChatGPT-3.5 i GPT-4 na nacionalnim ispitima za licenciranje za medicinu, farmaciju, stomatologiju i njegu: sistematski pregled i meta-analiza.
BMC medical education
Sažetak istraživanja
Pozadina ChatGPT, nedavno razvijeni chatbot sa umjetnom inteligencijom (AI), pokazao je poboljšane performanse u pregledima u medicinskom polju. Međutim, do sada nedostaje opća procjena potencijala ChatGPT modela (ChatGPT-3.5 i GPT-4) u raznim nacionalnim zdravstvenim pregledima. Ova studija imala je za cilj da pruži sveobuhvatnu procjenu učinka ChatGPT modela u nacionalnim ispitima za licenciranje za medicinska, farmacija, stomatologija i medicinska sestra putem meta-analize.
Metode Slijedeći PRISMA protokol, članci sa punim tekstom iz MEDLINE/PubMed-a, EMBASE, ERIC-a, Cochrane biblioteke, Web of Science i ključnih časopisa pregledani su od trenutka uvođenja ChatGPT-a do 27. februara 2024. Studije su bile prihvatljive ako su ocjenjivale performanse Chahat.GPT-3 modela (Chahat. GPT-4); u vezi sa nacionalnim ispitima za licenciranje u oblastima medicine, farmacije, stomatologije ili medicinske sestre; uključivala pitanja sa višestrukim izborom; i pružio podatke koji su omogućili izračunavanje veličine efekta. Dva recenzenta su nezavisno završila ekstrakciju podataka, kodiranje i procenu kvaliteta. Za procjenu kvaliteta odabranih članaka korišteni su JBI alati za kritičnu procjenu. Ukupna veličina efekta i 95% intervali povjerenja [CI] su izračunati korištenjem modela slučajnih efekata.
Rezultati Ukupno 23 studije su uzete u obzir za ovaj pregled, koje su ocjenjivale tačnost četiri vrste nacionalnih ispita za licenciranje. Odabrani su članci iz oblasti medicine (n = 17), farmacije (n = 3), sestrinstva (n = 2) i stomatologije (n = 1). Oni su prijavili različite nivoe tačnosti, u rasponu od 36 do 77% za ChatGPT-3.5 i 64,4-100% za GPT-4. Ukupna veličina efekta za postotak tačnosti bila je 70,1% (95% CI, 65-74,8%), što je bilo statistički značajno (p
Zaključci Ova studija baca svjetlo na tačnost ChatGPT modela u četiri nacionalna pregleda za izdavanje zdravstvenih licenci u različitim zemljama i pruža praktičnu osnovu i teorijsku podršku za buduća istraživanja koja su potrebna za daljnja medicinska istraživanja i šira istraživanja u zdravstvu. raznolik raspon pitanja, zajedno s naprednijim verzijama AI chatbotova.
Prikaži originalni naslov i sažetak na engleskom
Performance of ChatGPT-3.5 and GPT-4 in national licensing examinations for medicine, pharmacy, dentistry, and nursing: a systematic review and meta-analysis.
Background ChatGPT, a recently developed artificial intelligence (AI) chatbot, has demonstrated improved performance in examinations in the medical field. However, thus far, an overall evaluation of the potential of ChatGPT models (ChatGPT-3.5 and GPT-4) in a variety of national health licensing examinations is lacking. This study aimed to provide a comprehensive assessment of the ChatGPT models' performance in national licensing examinations for medical, pharmacy, dentistry, and nursing research through a meta-analysis.
Methods Following the PRISMA protocol, full-text articles from MEDLINE/PubMed, EMBASE, ERIC, Cochrane Library, Web of Science, and key journals were reviewed from the time of ChatGPT's introduction to February 27, 2024. Studies were eligible if they evaluated the performance of a ChatGPT model (ChatGPT-3.5 or GPT-4); related to national licensing examinations in the fields of medicine, pharmacy, dentistry, or nursing; involved multiple-choice questions; and provided data that enabled the calculation of effect size. Two reviewers independently completed data extraction, coding, and quality assessment. The JBI Critical Appraisal Tools were used to assess the quality of the selected articles. Overall effect size and 95% confidence intervals [CIs] were calculated using a random-effects model.
Results A total of 23 studies were considered for this review, which evaluated the accuracy of four types of national licensing examinations. The selected articles were in the fields of medicine (n = 17), pharmacy (n = 3), nursing (n = 2), and dentistry (n = 1). They reported varying accuracy levels, ranging from 36 to 77% for ChatGPT-3.5 and 64.4-100% for GPT-4. The overall effect size for the percentage of accuracy was 70.1% (95% CI, 65-74.8%), which was statistically significant (p
Conclusions This study sheds light on the accuracy of ChatGPT models in four national health licensing examinations across various countries and provides a practical basis and theoretical support for future research. Further studies are needed to explore their utilization in medical and health education by including a broader and more diverse range of questions, along with more advanced versions of AI chatbots.
Izvorni podaci
- DOI
- 10.1186/s12909-024-05944-8
- PMID
- 39285377
- PMCID
- PMC11406751
- Provjereno
- 2026-07-26
Naslov i sažetak prevedeni su automatski i prijevod može sadržavati netačnosti ili neprecizne stručne izraze. Za sve detalje, citiranje i medicinsko tumačenje pregledajte originalnu englesku verziju članka. Ne donosite zdravstvene odluke samo na osnovu ovog prijevoda.
Pregledaj originalni članak na engleskom