Inteligența artificială generativă are limitări în raționamentul diagnostic, în ciuda preciziei

eWell
eWell

Inteligența artificială generativă are limitări în raționamentul diagnostic, în ciuda preciziei

Un nou studiu realizat de cercetătorii de la Mass General Brigham, parte a incubatorului MESH, arată că modelele de inteligență artificială generativă continuă să aibă deficiențe în ceea ce privește capacitățile de raționament clinic.

Cercetătorii au solicitat 21 de modele mari de limbaj (LLM) să simuleze rolul de medic în diverse scenarii clinice. Rezultatele au arătat că aceste modele întâmpină dificultăți semnificative în navigarea procesului diagnostic și în formularea unei liste testabile de diagnostice diferențiale. Deși toate modelele au ajuns la un diagnostic corect în peste 90% din cazuri, atunci când au fost furnizate toate informațiile relevante, ele au avut performanțe slabe la pașii anteriori, care implică raționamentul, conform studiului publicat în JAMA Network Open.

Chiar și cu îmbunătățiri continue, modelele de limbaj mari disponibile nu sunt pregătite pentru o utilizare clinică nesupravegheată. Diagnosticele diferențiale sunt esențiale în raționamentul clinic și constituie „arta medicinei”, pe care inteligența artificială nu o poate reproduce în prezent. Promisiunea AI-ului în medicina clinică rămâne în potențialul său de a completa, nu de a înlocui, raționamentul medicului, cu condiția ca toate datele relevante să fie disponibile – lucru care nu este întotdeauna asigurat.

Această cercetare reprezintă o continuare a studiului anterior condus de grupul MESH, în care s-a evaluat capacitatea ChatGPT 3.5 de a diagnostica corect o serie de vignetă clinice.

În noul studiu, cercetătorii au dezvoltat o măsură nouă și mai holistică pentru evaluarea LLM-urilor, numită PrIME-LLM, care analizează competența unui model în diferitele etape ale raționamentului clinic – de la formularea potențialelor diagnostice, la realizarea testelor adecvate, stabilirea unui diagnostic final și gestionarea tratamentului. Când modelele au performanțe bune într-un domeniu, dar slabe în altul, acest dezechilibru este reflectat în scorul PrIME-LLM, spre deosebire de evaluarea medie a competenței, care poate masca zonele de slăbiciune.

Studiul a comparat 21 de LLM-uri de uz general, inclusiv cele mai recente modele de ChatGPT, DeepSeek, Claude, Gemini și Grok la momentul trimiterii. Modelele au fost testate pentru abilitatea de a lucra prin 29 de cazuri clinice publicate. Pentru a simula desfășurarea cazurilor clinice, cercetătorii au oferit modelelor informații treptat, începând cu detalii de bază, cum ar fi vârsta, sexul și simptomele pacientului, apoi adăugând constatările examenului fizic și rezultatele de laborator. Performanța LLM-urilor a fost evaluată de studenți la medicină, iar aceste evaluări au fost folosite pentru a calcula scorurile generale PrIME-LLM ale modelelor.

Asemenea studiului anterior, cercetătorii au constatat că LLM-urile sunt eficiente în a produce diagnostice finale corecte. Totuși, toate modelele au eșuat în a oferi un diagnostic diferențial adecvat în peste 80% din cazuri. În practică, un diagnostic diferențial este esențial, dar în acest studiu, modelele au primit mai multe informații pentru a putea avansa la următoarea etapă a evaluării clinice, chiar și în condițiile în care au eșuat la pasul diagnosticării diferențiale.

„Evaluând LLM-urile într-o manieră etapizată, trecem dincolo de a le trata ca pe niște candidați la teste și le punem în situația unui medic”, a declarat Arya Rao, autor principal și cercetător MESH. „Aceste modele sunt excelente în a numi un diagnostic final odată ce datele sunt complete, dar întâmpină dificultăți la începutul deschis al unui caz, când informațiile sunt limitate.”

Majoritatea LLM-urilor au arătat o acuratețe îmbunătățită atunci când au fost furnizate rezultate de laborator și imagistică, pe lângă text. Modelele lansate mai recent au depășit în general modelele mai vechi, demonstrând o îmbunătățire incrementală a LLM-urilor. Scorurile PrIME-LLM ale modelelor au variat de la 64% pentru Gemini 1.5 Flash la 78% pentru Grok 4 și GPT-5.

Conform lui Succi, PrIME-LLM reprezintă o modalitate standardizată de a evalua competența clinică a AI-ului, care ar putea fi utilizată de dezvoltatorii de AI și de liderii spitalelor pentru a stabili benchmark-uri pentru noile tehnologii pe măsură ce acestea sunt lansate.

„Vrem să ajutăm la separarea hype-ului de realitate în ceea ce privește aceste instrumente în domeniul sănătății”, a afirmat el. „Rezultatele noastre întăresc ideea că modelele mari de limbaj în domeniul sănătății continuă să necesite un „uman în circuit” și o supraveghere foarte atentă.”

Distribuie acest articol
Niciun comentariu

Lasă un răspuns

Adresa ta de email nu va fi publicată. Câmpurile obligatorii sunt marcate cu *