Inteligența artificială a concurat cu medicii în consultații simulate, rezultatele fiind remarcabile
Un sistem de inteligență artificială, alimentat de Gemini, a demonstrat performanțe remarcabile, egalând sau depășind medicii în consultări simulate video, evidențiind în același timp importanța conexiunii umane și a percepției subtile.
Un studiu recent publicat pe serverul arXiv a utilizat AMIE, un sistem multi-agent bazat pe Gemini, care integrează percepția audio-vizuală în timp real, dialogul cu latență redusă și raționamentul clinic. Cercetătorii au descris performanța AI ca fiind la nivel de expert în consultațiile clinice simulate video în timp real.
Consultațiile video sunt modalitatea dominantă de îngrijire clinică la distanță, permițând medicilor să observe indicii nonverbale, să efectueze examinări fizice limitate și să stabilească o relație cu pacienții. Spre deosebire de acestea, majoritatea demonstrațiilor de AI medical s-au concentrat pe interfețe de mesagerie instantanee, care excelează în raționamente structurate, dar nu reușesc să capteze complexitatea interacțiunilor live cu pacienții.
Studiile timpurii au arătat că extinderea AI medical la modalități audio-vizuale este fezabilă, deschizând calea pentru o îngrijire la distanță mai naturală și mai eficientă. Cu toate acestea, există provocări substanțiale, inclusiv necesitatea unei percepții audio-vizuale precise și în timp real, adaptabilitatea la diverse prezentări ale pacienților, gestionarea dialogului cu latență redusă și integrarea raționamentului clinic sofisticat. Obținerea unei performanțe la nivel de clinician în aceste domenii rămâne un obiectiv deschis și critic pentru agenții clinici AI de generația următoare.
AMIE a fost dezvoltat de cercetătorii Google ca un sistem multi-agent pentru consultații clinice video în timp real, integrând trei agenți specializați: Agentul Talker (pentru răspunsuri rapide și fluente ale pacienților), Agentul Planner (pentru gestionarea obiectivelor clinice) și Agentul Perception (pentru interpretarea datelor audio-vizuale). Acești agenți, construiți pe Gemini 3 Flash și 3.1 Pro, colaborează asincron pentru a genera un dialog clinic adecvat și cu latență redusă.
Dezvoltarea a fost ghidată de un cadru de evaluare automatizat, incluzând teste țintite pe un singur turn și conversații simulate pe mai multe turnuri pentru a evalua performanța clinică și conversațională de la cap la cap. Taxonomia de evaluare acoperă o gamă largă de indicii audio-vizuale clinice și manevre fizice relevante pentru telemedicină, distincția fiind făcută între fezabilitatea virtuală și posibilitatea de acțiune a actorilor pacienți. Evaluările folosesc rubrici specifice scenariului și evaluatori automați bazați pe modele de limbaj mari (LLM).
În evaluarea clinică, un studiu randomizat multi-arm al examenului obiectiv structurat clinic (OSCE) a comparat AMIE (în configurații video și text) cu 10 medici de îngrijire primară certificați în SUA (PCPs) în 100 de scenarii simulate cu pacienți. Consultațiile au fost efectuate cu 15 actori standardizați profesioniști și au fost evaluate utilizând rubrici generale și specifice cazului de către un panel de 20 de evaluatori clinici PCP.
Criteriile de evaluare au inclus acuratețea diagnostică, raționamentul clinic, managementul, comunicarea și acuitatea perceptuală. Datele calitative suplimentare din partea actorilor pacienți și evaluatorilor au evaluat în continuare experiența utilizatorului.
AMIE a depășit sau s-a comparat favorabil cu PCP-urile în consultațiile simulate video în timp real. Evaluatorii clinici au evaluat AMIE Video ca fiind egal sau mai bun decât PCP-urile în toate cele cinci domenii clinice specifice cazului, acordându-i un scor general mai mare: 83% față de 68%. Actorii pacienți au preferat AMIE Video pentru evaluarea și explicarea condițiilor, deși nu au fost diferențe semnificative în empatie sau abordarea îngrijorărilor. AMIE Video a realizat o acuratețe diagnostică mai mare, cu diagnosticul diferențial cel mai bine clasat corespunzând diagnosticului de referință predefinit în 91% din scenarii, comparativ cu 77% pentru PCP-uri. Această diferență s-a redus și nu a fost semnificativă din punct de vedere statistic atunci când au fost considerate primele trei diagnostice diferențiale (98% față de 90%).
AMIE a excelat și în raționamentul clinic, obținând 90% față de 76%, și în planificarea tratamentului, cu 79% comparativ cu 67%. Scorurile pentru întrebările anamnestice au fost, de asemenea, mai mari pentru AMIE, iar utilizarea video în direct și îndrumarea pentru examinările fizice asistate de pacienți a fost semnificativ mai puternică decât cea a PCP-urilor. AMIE s-a dovedit a fi deosebit de eficientă în valorificarea video-ului pentru observații live și ghidarea examenelor. Scorurile de comunicare au favorizat AMIE, deși actorii pacienți au arătat o preferință nesemnificativă pentru PCP-uri în construirea raportului și a parteneriatului.
În comparația dintre interfețele video și cele de chat text, actorii pacienți au evaluat versiunea video semnificativ mai bine în ceea ce privește eficiența comunicării, ușurința de utilizare și înțelegerea preocupărilor. Video-ul a adus cele mai mari îmbunătățiri în percepție și abilitățile de examinare. Performanțele de diagnosticare și management au fost similare în ambele modalități, în timp ce evaluările individuale ale comportamentului agenților din partea actorilor pacienți au fost, de asemenea, în mare parte similare, deși au favorizat în general varianta video.
Informațiile calitative au indicat că consultațiile video au permis demonstrarea directă a simptomelor și exprimarea constantă a empatiei, iar AMIE a fost descrisă ca fiind temeinică și negrăbită. Totuși, PCP-urile au fost preferate pentru cursul natural al conversației. Au fost notate unele limitări pentru AMIE Video, inclusiv ocazionale pierderi ale indicilor vizuale și provocări tehnice.
Evaluările automate au arătat că utilizarea agenților specializați, în special a celor Perception și Planner, a îmbunătățit semnificativ performanța AMIE. Sistemul complet a depășit versiunea exclusiv Talker în general în scenariile clinice pe un singur turn și pe mai multe turnuri, excelează în evaluările vizuale și în raționamentul clinic. În simulările automate pe mai multe turnuri, totuși, constatările examenului vizual au fost transmise prin indicații verbale în loc de video continuu în direct.
Deși AMIE a obținut rezultate puternice în majoritatea domeniilor fizice, a avut dificultăți în sarcini perceptuale subtile, cum ar fi detectarea nystagmusului, tremorului sau interpretarea stării de spirit. Designul asincron al agenților a permis o performanță mai bună în evaluările automate, reducând latența medie a turnurilor de la 21,4 la 2,6 secunde comparativ cu arhitectura secvențială anterioară.
După fiecare întâlnire live, AMIE și medicii au completat, de asemenea, chestionare structurale post-întâlnire referitoare la diagnosticele diferențiale și management. Pentru acest pas mai puțin constrâns de latență, AMIE a utilizat mai multe schițe și sinteze pentru a îmbunătăți calitatea recomandărilor sale.
Abordarea asincronă și multi-agent