AMIE de la Google depășește medicii în gestionarea simulată a bolilor
Într-un studiu virtual realizat în condiții de orb, AMIE, sistemul dezvoltat de Google, a egalat performanța medicilor de familie și s-a dovedit superior acestora în mai multe măsuri de raționament în gestionarea bolilor.
Un nou studiu realizat de Google, publicat ca un articol accelerat în revista Nature, explorează valoarea clinică potențială a unui sistem de inteligență artificială bazat pe modele de limbaj mare, denumit Articulate Medical Intelligence Explorer (AMIE), în gestionarea bolilor pe parcursul mai multor vizite simulate.
Modelele de inteligență artificială bazate pe limbaj mare (LLM) arată un potențial tot mai mare în domeniul clinic, nu doar pentru diagnosticarea precisă, ci și pentru colectarea istoricului medical prin conversații într-un stil natural și empatic, care ajută la construirea unor relații de încredere cu pacienții.
Deși au fost dezvoltate mai multe modele AI pentru raționamentul diagnostic, capacitățile acestora în gestionarea bolilor pe termen lung, cum ar fi monitorizarea progresiei bolii și răspunsul la terapie în cadrul mai multor vizite clinice, rămân în mare parte neexplorate.
O echipă de cercetători de la Google DeepMind și Google Research din California a evaluat capacitățile sistemului AMIE, care a arătat o performanță similară cu cea a medicilor în sarcinile de diagnosticare conversațională, în contextul gestionării bolilor pe parcursul timpului.
Pentru a îmbunătăți raționamentul de management, echipa a dezvoltat un sistem agentic bazat pe LLM, care include un agent de dialog empatic pentru conversații textuale cu pacienții și un agent de raționament în management care efectuează inferențe extinse și corelează informațiile cu cele mai recente ghiduri clinice și formulare de medicamente.
Versiunea de gestionare a bolilor a AMIE a folosit capacitățile de lungă durată ale modelului Gemini pentru a urmări datele pacientului pe parcursul vizitelor de urmărire.
Pentru a evalua raționamentul privind medicamentele, echipa a dezvoltat RxQA, un set de întrebări cu alegere multiplă derivat din două formulare naționale de medicamente (OpenFDA și British National Formulary), validat de farmaciști certificați.
Echipa a realizat apoi un studiu randomizat, orb, utilizând o examinare clinică structurată obiectivă pentru a compara capacitățile de raționament în gestionarea bolilor pe parcursul mai multor vizite ale AMIE cu cele ale 21 de medici de familie, pe baza a 100 de scenarii de caz create pentru a reflecta Ghidul NICE din Marea Britanie și cele mai bune practici BMJ.
Analiza comparativă a arătat că AMIE nu a fost inferioară medicilor în ceea ce privește raționamentul general în management și a obținut scoruri semnificativ mai mari decât medicii în ceea ce privește adecvarea planului general și recomandările de tratament în toate cele trei vizite.
Pe lângă precizia tratamentelor, AMIE a avut o precizie semnificativ mai mare în recomandarea investigațiilor comparativ cu medicii în toate cele trei vizite.
În ceea ce privește utilizarea ghidurilor clinice, atât AMIE, cât și medicii au obținut scoruri similare de înalte în selectarea ghidurilor aplicabile. AMIE a obținut scoruri semnificativ mai mari în recomandarea tratamentelor și investigațiilor care se aliniază cu ghidurile și în fundamentarea explicită a recomandărilor în referințele ghidurilor.
Pentru a compara acuratețea raționamentului privind medicamentele, echipa de cercetare a utilizat benchmark-uri de dificultate mai mică și mai mare (RxQA) și un mediu „open-book” și „closed-book”. În mediu „open-book”, atât AMIE, cât și medicii au avut acces la informații relevante. În mediu „closed-book”, nici medicii, nici AMIE nu au avut acces la resurse externe de cunoștințe.
Analiza comparativă a arătat că accesul la informații externe despre medicamente a fost benefic atât pentru medici, cât și pentru AMIE. Cu toate acestea, AMIE a depășit medicii la întrebările de dificultate mai mare în ambele medii, „open-book” și „closed-book”.
Studiul subliniază potențialul sistemului de cercetare AI bazat pe LLM, AMIE, ca un instrument promițător pentru gestionarea bolilor pe termen lung. Rezultatele arată că AMIE poate performa la o calitate similară sau, în unele cazuri, mai bună decât medicii în diverse provocări de raționament în gestionarea bolilor.
La nivel global, sistemele de sănătate se confruntă cu o fragmentare crescută a îngrijirii, ceea ce înseamnă că îngrijirea unui pacient este distribuită între mai mulți medici, setări sau sisteme care împărtășesc puține sau deloc informații între ele. Această fragmentare a îngrijirii este asociată cu o morbiditate agravată pentru pacienții cu boli cronice. Pe baza constatărilor actuale, echipa de cercetare de la Google sugerează că AMIE ar putea servi într-o bună zi ca un punct de continuitate în sistemele de sănătate altfel fragmentate, fie independent, fie în colaborare cu medicii.
Echipa consideră, de asemenea, că, cu teste clinice riguroase, astfel de sisteme pot răspunde nevoilor clinice nesatisfăcute cauzate de penuria globală și inegalitățile în disponibilitatea medicilor, epuizarea acestora și populațiile de pacienți din ce în ce mai complexe.
Cu toate acestea, studiul a fost realizat în cadrul unor consultații simulate, prin chat text, cu actori pacienți instruiți și autorii afirmă că AMIE nu este pregătit pentru utilizare clinică. Scenariile au fost construite pentru evaluare, mixul de cazuri nu a fost reprezentativ pentru îngrijirea primară obișnuită, iar studiul nu a testat efectele asupra rezultatelor pacienților.
Capacitățile observate ale AMIE reflectă avansul rapid al LLM-urilor în conversațiile clinice și raționament. Îmbunătățirea rapidă a LLM-urilor de vârf poate ajuta la atenuarea limitărilor actuale, cum ar fi confabulările (generarea de răspunsuri false, înșelătoare sau complet fabricate), care altfel constituie riscuri considerabile în medicina clinică.
În concluzie, studiul demonstrează evoluția sistemului de cercetare AMIE de la AI conversațional diagnostic la un sistem de raționament în gestionarea bolilor pe parcursul mai multor vizite. Deși modelul a fost testat folosind măsuri globale de raționament în management, cercetătorii subliniază că acesta ar trebui considerat un prim pas în măsurarea raționamentului în management și evidențiază necesitatea unor lucrări viitoare pentru a explora urmele de raționament ale sistemelor AI medicale într-o manieră cuprinzătoare și cantitativă.