Un nou studiu arată că inteligența artificială ignoră aspectele umane ale îngrijirii sănătății mintale

eWell
eWell

Un nou studiu arată că inteligența artificială nu reușește să abordeze aspectele umane ale îngrijirii sănătății mintale

Un nou standard în domeniul sănătății mintale arată că cele mai avansate modele de inteligență artificială (IA) pot părea convingătoare, dar nu reușesc să ofere insight-uri emoționale profunde, diagnostice precise și judecăți clinice reale atunci când acestea sunt cele mai importante.

Un studiu recent publicat în revista npj Mental Health Research a detaliat dezvoltarea „PsyEval”, un nou instrument cuprinzător destinat evaluării performanței modelurilor de limbaj mare (LLMs) în domeniul subiectiv și contextual al sănătății mintale umane.

Benchmark-ul a fost folosit pentru a evalua unsprezece LLM-uri avansate pe trei dimensiuni principale: 1. Înțelegerea cunoștințelor, 2. Diagnostic și evaluare, și 3. Suport emoțional. Rezultatele PsyEval au arătat că, deși unele modele de limbaj mare pot imita fluența umană și pot demonstra o memorie factuală puternică, acestea nu dispun de insight-uri emoționale mai profunde și de nuanțele clinice necesare pentru a funcționa eficient în scenarii complexe de sănătate mintală.

Studiul a evidențiat un „gap de empatie” între LLM-uri și consilierii umani, în ciuda unei sensibilități ridicate la solicitările primite. În plus, s-a observat că refuzurile legate de siguranță pot reduce scorurile de clasificare diagnostică ale unor modele mari de bază, în timp ce modelele mai puțin rezervate pot clasifica pacienții mai agresiv, riscând supradiagnosticarea.

Boala mintală reprezintă una dintre cele mai grave probleme cronice ale societății contemporane, datele Organizației Mondiale a Sănătății indicând că depresia afectează 3,8% din populația globală. Rata tratamentului rămâne extrem de scăzută, atingând 13,7% în țările cu venituri mici, 22,0% în cele cu venituri medii superioare și 36,8% în țările cu venituri mari. Aceste cifre ar putea fi subestimate din cauza stigmatizării sociale și a lipsei de conștientizare publică.

În acest context, cercetătorii au început să exploreze inteligența artificială și LLM-urile ca instrumente potențiale pentru aplicații în domeniul sănătății mintale. Deși aplicațiile timpurii în analiza sentimentelor păreau promițătoare, evaluarea sistemelor a fost provocatoare.

Evaluarea psychiatrică se bazează pe interpretarea indiciilor verbale subtile, ambigue și subiective, precum și pe stabilirea unei relații terapeutice puternice între cei care caută ajutor și profesioniștii în sănătate mintală. Din păcate, nu exista un cadru unificat pentru a testa dacă IA poate echilibra în mod sigur cunoștințele și performanța diagnostică cu comunicarea empatică.

Studiul de față a avut ca scop abordarea acestei lacune de evaluare prin dezvoltarea PsyEval, un set de sarcini conceput pentru a apropia elementele cheie ale consultațiilor psihiatrice reale pe cele trei dimensiuni menționate. Benchmark-ul a inclus seturi de date separate pentru evaluarea cunoștințelor, clasificarea diagnostică și sarcinile de suport emoțional.

În primul rând, setul de date pentru „sarcinile de cunoștințe” a inclus 5.531 de întrebări cu răspunsuri multiple extrase din examenele de licență medicală din Statele Unite și China pentru a testa faptele medicale esențiale și scenariile de răspuns la crize. Setul de date pentru „sarcinile de diagnostic” a fost compus din 1.000 de exemple de teste la nivel de utilizator, derivate din postări selectate de pe rețelele sociale pentru a evalua clasificarea condițiilor unice și detectarea comorbidității. De asemenea, au fost utilizate 1.339 de dialoguri clinice pentru evaluarea riscurilor de depresie și sinucidere.

În cele din urmă, 1.000 de întrebări ale utilizatorilor de pe platforma PsyQA din China și 939 de interacțiuni de consiliere în limba engleză din Counsel-Chat au fost incluse pentru evaluarea suportului emoțional. Cercetătorii au aplicat PsyEval pentru a compara unsprezece LLM-uri generale și specificate pe sarcini legate de sănătatea mintală, inclusiv GPT-4, Qwen2.5-72B și SoulChat, utilizând trei strategii de sugestii: 1. Comandă formală, 2. Raționare pas cu pas, și 3. Simularea scenariilor.

Răspunsurile de suport emoțional au fost evaluate prin metrici automate și un proces hibrid de votare între umani și IA, implicând annotatori umani și DeepSeek-V3.

Rezultatele au arătat că modelele mai mari, de tip general, au avut o performanță mai bună pe sarcinile de cunoștințe factuale, deși performanța a depins puternic de alinierea lingvistică. De exemplu, Qwen2.5-72B a obținut o acuratețe de 91,0% pe setul de date MCMLE-mental în limba chineză, iar GPT-4-turbo a condus sarcinile în limba engleză cu aproximativ 76,0% acuratețe.

Cu toate acestea, performanța modelului a scăzut în cazul întrebărilor urgente legate de scenarii psihiatrice. De exemplu, pe setul de date de răspuns la criza USMLE, acuratețea lui GPT-4-turbo a scăzut la aproximativ 73,0%. Studiul a identificat un fenomen de „scalare inversă” în acuratețea clasificării diagnostice brute a modelului. Modele mai mici, precum LLaMa-3-8B, au obținut acuratețe aproape perfectă în clasificarea unor condiții precum ADHD (100,0%) și anxietate (96,0%), depășind semnificativ GPT-4, care a obținut aproximativ 25% pentru ADHD.

Autorii au ipotezat că aceste discrepanțe reflectă un compromis între siguranța utilității și acuratețea benchmark-ului. Modelele mari de bază pot impune restricții care le descurajează să diagnosticheze pacienți sau să practice medicina, ceea ce duce la refuzuri sau răspunsuri ambigue considerate răspunsuri greșite în PsyEval. Pe de altă parte, modelele mai mici pot atribui etichete diagnostice mai ușor, crescând riscul de supradiagnosticare.

Atunci când s-a comparat performanța în suportul emoțional a LLM-urilor cu cea a consilierilor umani, studiul a arătat că, deși unele modele de vârf au egalat sau au depășit consilierii în fluența și coerența limbajului, oamenii au obținut un „scor de explorare” de 1,85 pe PsyQA și 1,93 pe Counsel-Chat, depășind constant modelele de IA evaluate în ceea ce privește întrebările de aprofundare a preocupărilor mai profunde.

În cele din urmă, stilul sugestiilor a influențat semnificativ performanța LLM-urilor. Sugestiile de simulare a scenariilor, care instruiau modelele să adopte o persoană de profesionist în sănătate mintală, au generat în general cele mai mari scoruri de empatie, în timp ce sugestiile pas cu pas au dus adesea la răspunsuri mai mecanice.

PsyEval demonstrează că mai multe LLM-uri mari au obținut o acuratețe ridicată pe întrebările de cunoștințe medicale selectate, deși studiul nu a comparat direct cunoștințele sau performan

Distribuie acest articol
Niciun comentariu

Lasă un răspuns

Adresa ta de email nu va fi publicată. Câmpurile obligatorii sunt marcate cu *