Chatbot-urile AI oferă răspunsuri la întrebările de sănătate cu o acuratețe moderată
Chatbot-urile alimentate de inteligența artificială (AI) răspund la întrebări frecvente legate de sănătate cu o acuratețe de aproximativ 76,2%, ceea ce ridică semne de întrebare cu privire la încrederea în aceste aplicații în interacțiunile cu pacienții, conform unui nou studiu realizat de cercetători de la Penn State.
Cercetătorii au dorit să înțeleagă modul în care utilizatorii obișnuiți folosesc AI pentru probleme de sănătate și cât de precise sunt răspunsurile pe care le oferă la întrebările medicale. Au descoperit că, în domeniul sănătății, în special în zone specializate precum neurologia și dermatologia, instrumentele AI ar putea fi mai utile în mâinile medicilor pregătiți decât în cele ale pacienților. Echipa își va prezenta concluziile la conferința Association for Computing Machinery Fairness, Accountability and Transparency (FAccT) din Montreal, Canada, în perioada 25-28 iunie 2026.
„Lucrările noastre se concentrează explicit pe scenariile de sănătate pe care utilizatorul mediu de internet le-ar putea adresa AI-ului, o perspectivă care nu a fost acoperită în cercetările anterioare privind modelele mari de limbaj (LLMs) și sănătate. Ne-am întrebat cât de precis este LLM-ul în răspunsurile la întrebările legate de simptome, așa cum am folosit istoric Google, și cât de dăunătoare ar putea fi aceste răspunsuri”, a declarat Amulya Yadav.
Pentru a evalua acuratețea sau potențialul dăunător al răspunsurilor LLM legate de sănătate, cercetătorii au organizat o competiție AI numită Diagnostica-thon la Penn State. Un total de 34 de participanți – formatori, personal și studenți la licență și masterat – au trimis 212 sugestii și răspunsuri generate de AI la probleme de sănătate reale și imaginare, scrise din perspectivele pacienților și medicilor. Participanții au avut posibilitatea de a alege unul dintre cele patru LLM-uri pentru a participa la concurs: ChatGPT-4o, ChatGPT-3.5, Gemini-1.5 Pro și Llama3-8b.
„Unul dintre punctele forte ale studiului nostru este că încercăm să replicăm utilizarea reală a LLM-urilor, cerând participanților să aleagă LLM-ul dorit și să-l folosească așa cum ar face-o într-o zi obișnuită”, a declarat Bonam Mingole. „Această cercetare participativă este esențială pentru a înțelege cum folosește publicul AI în viața de zi cu zi.”
Cercetătorii au solicitat apoi nouă medici certificați să evalueze acuratețea răspunsurilor generate de AI și potențialul lor dăunător, folosind o scală de șase puncte, de la foarte mic la foarte mare. Comitetul competiției a acordat premii celor mai bune opt sugestii care au generat cele mai precise informații medicale și un premiu pentru sugestia care a generat cel mai probabil răspuns dăunător.
Rezultatele au arătat că, în general, 76,2% din răspunsurile generate de LLM au fost precise. Specialitățile precum obstetrică-ginecologie și otorinolaringologie au obținut cele mai bune performanțe LLM, cu scoruri de validitate ridicate și scoruri de dăunare scăzute. În schimb, medicina internă, neurologia și dermatologia au avut cele mai slabe performanțe, cu scoruri de validitate scăzute și scoruri de dăunare mai mari. Cercetătorii au adăugat că sugestiile foarte specifice și cele între 60 și 250 de caractere au condus la rezultate LLM mai precise.
Ulterior, cercetătorii au luat modelul de bază al fiecărui LLM și l-au antrenat pe manuale medicale, ghiduri clinice și articole de cercetare revizuite de colegi incluse în curriculum-ul unei școli medicale, pentru a verifica dacă un antrenament suplimentar ar putea îmbunătăți scorurile de validitate ale răspunsurilor și ar putea reduce scorurile de dăunare. Au solicitat unui grup format din șapte profesioniști medicali și stagiari – un medic certificat, doi rezidenți de medicină internă din anul doi, doi studenți la medicină din anul patru și doi studenți din anul trei – să evalueze răspunsurile LLM de bază și răspunsurile provenite de la LLM-urile augmentate și să determine care erau mai adecvate din punct de vedere clinic. Panelul a preferat răspunsurile de la modelele Gemini și Llama în comparație cu modelele augmentate, fără a observa o preferință semnificativă pentru modelele ChatGPT.
„Intrăm într-o nouă eră a asistenței medicale, iar AI este o parte semnificativă a acesteia”, a declarat Jennifer Kraschnewski. „Există o oportunitate reală pentru transformarea sistemului de sănătate, pentru a integra aceste noi instrumente astfel încât clinicianii să le poată folosi pentru a îmbunătăți îngrijirea pacienților.”
Cercetătorii au subliniat, de asemenea, că, în ciuda scorurilor de validitate ale LLM-urilor, ratele de eroare ale AI-ului depășesc 20%, aproximativ dublu față de rata de eroare a medicilor umani. Acele erori, au menționat ei, ar putea fi potențial dăunătoare pentru pacienți.
„Nu cred că AI-ul va înlocui medicii umani, dar cred că există o mare oportunitate de a ajuta la îmbunătățirea abilităților medicilor de azi într-un mod care nu a fost realizat niciodată până acum”, a spus Kraschnewski, sugerând că LLM-urile actuale ar putea fi instrumente mai bune pentru profesioniștii medicali decât pentru pacienți.
În general, studiul evidențiază impactul potențial benefic și dăunător pe care AI-ul îl poate avea asupra unui aspect esențial din viața tuturor, conform cercetătorilor.
„Îi place sau nu, oamenii vor continua să folosească AI pentru diagnosticarea problemelor de sănătate”, a afirmat S. Shyam Sundar. „Prin înțelegerea tiparelor lor de utilizare și testarea validității performanței AI, proiectul nostru contribuie la avansarea alfabetizării cu privire la cele mai bune și cele mai proaste utilizări ale AI-ului pentru sfaturi medicale.”