Experții umani rămân esențiali pentru verificarea rezultatelor AI în domeniul clinic

eWell
eWell

Experții umani rămân esențiali pentru verificarea rezultatelor AI în domeniul clinic

Sistemele de inteligență artificială (AI) au furnizat evaluări consistente și cu costuri reduse, dar clinicienii locali au identificat preocupări importante pe care evaluatorii automatizați le-au trecut cu vederea.

Un studiu recent publicat în jurnalul npj Digital Medicine a examinat beneficiile și limitările cadrelor de evaluare automate „LLM-as-a-judge”. Acesta a comparat performanța acestor cadre cu evaluările clinicienilor locali asupra răspunsurilor de suport decizional clinic generate de AI și umani în Rwanda, pentru a evalua fiabilitatea acestora în evaluarea rezultatelor AI în medii cu resurse limitate.

Datasetul studiului a inclus 524 de perechi de întrebări și răspunsuri selectate dintr-un set mai mare de întrebări trimise de lucrătorii comunitari din Rwanda, simulând cereri de suport decizional clinic. Analizele au arătat că, deși evaluatorii AI au demonstrat o consistență internă ridicată, chiar și cel mai performant model a corespuns evaluărilor locale pe doar 4 din cele 11 criterii de evaluare.

Critic, toți evaluatorii AI examinați nu au corespuns evaluărilor clinicienilor la criteriul „Potencial de prejudiciu demografic”. Practic, toate evaluările AI au fost perfecte, în timp ce clinicienii locali au identificat prejudicii demografice potențiale în unele cazuri. Prin urmare, autorii conchid că, deși evaluarea automată oferă o reducere de 75 de ori a costurilor de evaluare, aceasta poate fi utilă pentru screening-ul inițial, dar nu este justificată pentru înlocuirea completă a experților medicali umani.

Utilizarea instrumentelor de inteligență artificială generativă în medii medicale cu resurse limitate poate oferi oportunități pentru suportul decizional clinic. Totuși, având în vedere că modelele lingvistice mari (LLM) generează rezultate probabilistice, validarea unui algoritm înainte de desfășurare nu garantează siguranța durabilă, deoarece o reacție sigură într-un moment nu garantează că o reacție viitoare va fi la fel de sigură.

În mod tradițional, profesioniștii medicali seniori efectuează aceste evaluări de calitate. Totuși, o bază tot mai mare de dovezi sugerează că supravegherea umană este limitată de costuri și variabilitate semnificativă între clinicieni. În acest studiu, evaluarea umană a costat aproximativ 9,17 dolari per întrebare.

Pentru a aborda aceste limite de scalabilitate, dezvoltatorii și factorii de decizie se îndreaptă din ce în ce mai mult spre paradigme „LLM-as-a-judge”, în care modelele secundare evaluează rezultatele clinice primare. Din păcate, deși studiile preliminare sugerează că evaluatorii AI ar putea aproxima judecata medicilor, nu s-a stabilit încă dacă aceste modele pot evalua cu acuratețe evaluările clinicienilor locali și pot gestiona contextul lingvistic și cultural din țările cu venituri mici și medii.

Studiul a avut ca scop abordarea acestei lacune de cunoaștere prin evaluarea răspunsurilor de suport decizional clinic adaptate pentru contextul asistenței medicale de primă linie din Rwanda. Eșantionul experimental a inclus 524 de perechi întrebare-răspuns (416 în engleză și 108 în kinyarwanda) derivate din întrebările trimise de lucrătorii comunitari din Rwanda.

Fiecare pereche de răspunsuri a fost evaluată sistematic pe baza a 11 criterii clinice cheie, inclusiv alinierea la consensul medical, validitatea raționamentului, potențialul de vătămare, acuratețea în contextul local și prejudiciul demografic. Evaluările studiului au fost efectuate independent pe două brațe:

Pana umană a fost formată din șase medici generaliști rwandeni experimentați, care au lucrat în două grupuri de câte trei. Doi clinicieni au evaluat fiecare răspuns și au discutat evaluările care diferau cu mai mult de un punct cu un clinician supraveghetor.

Evaluatorii și juriile AI, care au inclus cinci LLM-uri de top, și anume GPT-5, Gemini-2.5-Pro, Claude-4.1-Opus, MedGemma-20B și GPT-OSS-70B, au fost provocați printr-un rubric de evaluare comun cu patru exemple de few-shot, alături de combinații de ansamblu cântărite („juriile AI”) concepute pentru a echilibra prejudiciile individuale ale modelului.

Analizele statistice au comparat evaluările AI cu cele ale clinicianilor locali pe cele 11 criterii și au testat dacă diferențele erau suficient de mici pentru a fi practic semnificative.

Analizele statistice ale studiului au arătat că evaluatorii AI au produs evaluări mai consistente decât perechile de clinicieni, dar această consistență nu a implicat că judecățile lor corespundeau în mod fiabil evaluărilor clinicienilor locali.

Rezultatele studiului au relevat că niciun LLM nu a atins o echivalență globală pe toate cele 11 criterii. Claude-4.1-Opus a realizat cea mai bună paritate, dar a corespuns evaluărilor locale pe doar patru criterii. În schimb, Gemini-2.5-Pro a tendințat să ofere evaluări mai favorabile decât clinicienii, în timp ce GPT-5 a tendințat să evalueze răspunsurile mai sever.

În plus, fiecare evaluator și juriu AI a eșuat în a corespunde clinicianilor la metricul „Potential for Demographic Bias”, evaluând practic toate răspunsurile ca fiind impecabile, în timp ce clinicienii locali au identificat prejudicii potențiale în unele răspunsuri. Această slăbiciune comună nu s-a extins la măsura separată a contextului local.

Cele mai bine performante juriu AI cântărit a corespuns clinicianilor pe cinci din cele 11 criterii, o îmbunătățire modestă față de Claude-4.1-Opus. Evaluatorii AI au arătat o tendință mai mare decât clinicienii de a favoriza răspunsurile mai lungi. În schimb, clinicienii umani au arătat prejudiciu de grup în favoarea răspunsurilor scrise de oameni.

De asemenea, trecerea limbii de evaluare din engleză în kinyarwanda a degradat acordul AI cu evaluările clinicianilor pentru mai multe modele, în special MedGemma. Cu toate acestea, GPT-OSS a avut o îmbunătățire în kinyarwanda, iar combinarea statistică a scorurilor modelului în juriile AI a redus în mare măsură aceste diferențe legate de limbă. Din punct de vedere economic, evaluarea AI a fost estimată să coste până la 0,12 dolari per răspuns, comparativ cu 9,17 dolari pentru evaluarea umană, rezultând o reducere de 75 de ori a costurilor.

Studiul demonstrează că, deși evaluarea automată prin AI oferă scalabilitate și eficiență în ceea ce privește costurile pentru screening-ul inițial, înlocuirea experților medicali umani nu este încă justificată. Evaluatorii LLM actuali prezintă lacune critice, în special în ceea ce privește detectarea prejudiciilor demografice și procesarea nuanțelor limbilor subreprezentate, cum ar fi kinyarwanda.

Autorii concluzionează că juriile AI ar putea fi potrivite pentru a exclude sistemele evident inadecvate, chiar și atunci când unele imprecizii sunt acceptabile. Totuși, până când evaluatorii automatizați pot naviga în mod fiabil echitatea localizată și contextul regional, eliminarea completă a experților medicali umani nu este susținută.</

Distribuie acest articol
Niciun comentariu

Lasă un răspuns

Adresa ta de email nu va fi publicată. Câmpurile obligatorii sunt marcate cu *