Udruženje dijagnostičkih performansi kliničara sa sistemima za podršku odlučivanju zasnovanim na mašinskom učenju: sistematski pregled.
JAMA network open
Sažetak istraživanja
Važnost Sve veći broj sistema za podršku kliničkom odlučivanju (CDSS) zasnovanih na mašinskom učenju (ML) opisan je u medicinskoj literaturi, ali ovo istraživanje se skoro u potpunosti fokusira na direktno poređenje CDSS-a sa kliničarima (ljudi protiv kompjutera). Malo se zna o rezultatima ovih sistema kada se koriste kao dodatak ljudskom donošenju odluka (ljud protiv čovjeka s kompjuterom).
Ciljevi Sprovođenje sistematskog pregleda kako bi se istražila povezanost između interaktivne upotrebe dijagnostičkih CDSS-ova zasnovanih na ML i učinka kliničara i da se ispita stepen procjene ljudskih faktora CDSS-a. Pregled dokaza Pretraživanje MEDLINE, Embase, PsycINFO i sive literature sprovedeno je za period između 1. januara 2010. i 31. maja 2019. Uključene su recenzirane studije objavljene na engleskom jeziku u kojima se upoređuju performanse humanih kliničara sa i bez interaktivne upotrebe dijagnostičkih CDSS-ova zasnovanih na ML. Sve metrike korištene za procjenu ljudskog učinka smatrane su ishodima. Rizik od pristrasnosti je procijenjen korištenjem Procjene kvaliteta studija dijagnostičke tačnosti (QUADAS-2) i Rizik od pristrasnosti u nerandomiziranim studijama-intervencijama (ROBINS-I). Za glavne ishode napravljeni su narativni sažetci. S obzirom na heterogenost medicinskih stanja, ishoda od interesa i metrike evaluacije, nije izvršena meta-analiza.
Nalazi Ukupno 8112 studija je prvobitno pronađeno, a pregledano je 5154 sažetaka; od toga, 37 studija je ispunilo kriterijume za uključivanje. Prosječni broj kliničara koji su učestvovali bio je 4 (interkvartilni raspon, 3-8). Od 107 rezultata koji su prijavili statističku značajnost, 54 (50%) je povećano upotrebom CDSS-a, 4 (4%) je smanjeno, a 49 (46%) nije pokazalo promjenu ili nejasnu promjenu. U podgrupi studija sprovedenih u reprezentativnim kliničkim okruženjima, nikakva povezanost između upotrebe dijagnostičkih CDSS-a zasnovanih na ML i poboljšanih performansi kliničara nije mogla biti uočena. Interobserver sporazum je bio uobičajeni rezultat čija je promjena bila najjače povezana s korištenjem CDSS-a. Četiri studije (11%) izvijestile su o povratnim informacijama korisnika i, u svim osim u jednom slučaju, kliničari su odlučili da preglase barem neke od preporuka algoritama. Dvadeset osam studija (76%) ocijenjeno je kao imalo visok rizik od pristranosti u najmanje 1 od 4 QUADAS-2 jezgra domena, a 6 studija (16%) se smatralo pod ozbiljnim ili kritičnim rizikom od pristrasnosti koristeći ROBINS-I.
Zaključci i relevantnost Ovaj sistematski pregled pronašao je samo retke dokaze da je upotreba CDSS-a zasnovanih na ML povezana sa poboljšanim dijagnostičkim performansama kliničara. Većina studija imala je mali broj učesnika, bila je pod visokim ili nejasnim rizikom od pristrasnosti i pokazala je malo ili nimalo razmatranja ljudskih faktora. Treba biti oprezan kada se procjenjuje trenutni potencijal ML za poboljšanje dijagnostičkih performansi kod ljudi, a treba provesti sveobuhvatniju evaluaciju prije primjene CDSS-a zasnovanih na ML u kliničkim okruženjima.
Rezultati ističu važnost razmatranja podržanih ljudskih odluka kao krajnjih tačaka, a ne samo samostalnih CDSS izlaza.
Prikaži originalni naslov i sažetak na engleskom
Association of Clinician Diagnostic Performance With Machine Learning-Based Decision Support Systems: A Systematic Review.
Importance An increasing number of machine learning (ML)-based clinical decision support systems (CDSSs) are described in the medical literature, but this research focuses almost entirely on comparing CDSS directly with clinicians (human vs computer). Little is known about the outcomes of these systems when used as adjuncts to human decision-making (human vs human with computer).
Objectives To conduct a systematic review to investigate the association between the interactive use of ML-based diagnostic CDSSs and clinician performance and to examine the extent of the CDSSs' human factors evaluation. Evidence review A search of MEDLINE, Embase, PsycINFO, and grey literature was conducted for the period between January 1, 2010, and May 31, 2019. Peer-reviewed studies published in English comparing human clinician performance with and without interactive use of an ML-based diagnostic CDSSs were included. All metrics used to assess human performance were considered as outcomes. The risk of bias was assessed using Quality Assessment of Diagnostic Accuracy Studies (QUADAS-2) and Risk of Bias in Non-Randomised Studies-Intervention (ROBINS-I). Narrative summaries were produced for the main outcomes. Given the heterogeneity of medical conditions, outcomes of interest, and evaluation metrics, no meta-analysis was performed.
Findings A total of 8112 studies were initially retrieved and 5154 abstracts were screened; of these, 37 studies met the inclusion criteria. The median number of participating clinicians was 4 (interquartile range, 3-8). Of the 107 results that reported statistical significance, 54 (50%) were increased by the use of CDSSs, 4 (4%) were decreased, and 49 (46%) showed no change or an unclear change. In the subgroup of studies carried out in representative clinical settings, no association between the use of ML-based diagnostic CDSSs and improved clinician performance could be observed. Interobserver agreement was the commonly reported outcome whose change was the most strongly associated with CDSS use. Four studies (11%) reported on user feedback, and, in all but 1 case, clinicians decided to override at least some of the algorithms' recommendations. Twenty-eight studies (76%) were rated as having a high risk of bias in at least 1 of the 4 QUADAS-2 core domains, and 6 studies (16%) were considered to be at serious or critical risk of bias using ROBINS-I.
Conclusions and relevance This systematic review found only sparse evidence that the use of ML-based CDSSs is associated with improved clinician diagnostic performance. Most studies had a low number of participants, were at high or unclear risk of bias, and showed little or no consideration for human factors. Caution should be exercised when estimating the current potential of ML to improve human diagnostic performance, and more comprehensive evaluation should be conducted before deploying ML-based CDSSs in clinical settings. The results highlight the importance of considering supported human decisions as end points rather than merely the stand-alone CDSSs outputs.
Izvorni podaci
- DOI
- 10.1001/jamanetworkopen.2021.1276
- PMID
- 33704476
- PMCID
- PMC7953308
- Provjereno
- 2026-07-26
Naslov i sažetak prevedeni su automatski i prijevod može sadržavati netačnosti ili neprecizne stručne izraze. Za sve detalje, citiranje i medicinsko tumačenje pregledajte originalnu englesku verziju članka. Ne donosite zdravstvene odluke samo na osnovu ovog prijevoda.
Pregledaj originalni članak na engleskom