Modelele de limbaj mari au performanțe nesatisfăcătoare în sarcinile administrative din spitale
Un studiu recent arată că modelele de limbaj mari (LLMs), utilizate cu întrebări simple, au rezultate slabe în sarcinile cotidiene de analiză a datelor pe care administratorii de spitale se bazează pentru a urmări pacienții și a aloca resurse.
Studiul a fost publicat în această săptămână în jurnalul cu acces deschis PLOS Digital Health de Eyal Klang de la Icahn School of Medicine, Mount Sinai, New York, și colaboratorii săi.
Spitalele se bazează pe datele structurate din dosarele electronice de sănătate (EHR) pentru a monitoriza numărul de pacienți și resursele, precum și pentru a genera rapoarte administrative. Aceste sarcini sunt în prezent îndeplinite de analiști de date folosind limbaje de programare, ceea ce poate crea întârzieri atunci când personalul are nevoie de răspunsuri rapide. Instrumentele AI cunoscute sub numele de modele de limbaj mari, precum GPT-4 și Llama, au fost propuse pentru a simplifica acest proces.
În noul studiu, cercetătorii au evaluat nouă LLM-uri de top în două sarcini administrative de bază: numărarea pacienților care îndeplinesc o anumită condiție și filtrarea înregistrărilor pe baza mai multor criterii, folosind date extrase din 50.000 de vizite reale la departamentul de urgență din sistemul de sănătate Mount Sinai.
Cercetătorii au constatat că întrebările simple – cum ar fi „câți pacienți din acest tabel au fost admiși?” – au generat rezultate uniform slabe în toate modelele. Raționamentul „chain-of-thought”, în care modelul este solicitat să arate pașii înainte de a oferi un răspuns, a oferit doar îmbunătățiri modeste, care s-au degradat brusc pe măsură ce dimensiunea tabelului a crescut. Chiar și GPT-4, modelul cu cele mai bune performanțe, a văzut acuratețea scăzând de la aproximativ 95% pe seturile de date cele mai mici la sub 60% pe cele mai mari, în condițiile de raționament „chain-of-thought”.
O abordare bazată pe instrumente – în care modelele erau solicitate să genereze cod care era apoi executat – a îmbunătățit substanțial acuratețea pentru cele mai capabile modele, GPT-4 și Qwen-2.5-72B atingând performanțe aproape perfecte. Totuși, modelele DeepSeek distilate, optimizate pentru viteză și eficiență, s-au confruntat cu dificultăți chiar și cu această abordare. Un model, Llama-3.1-8B, nu a reușit să producă ieșiri utilizabile în majoritatea încercărilor și a fost exclus din analiza ulterioară.
„Descoperirile noastre indică faptul că, fără utilizarea unei strategii bazate pe instrumente, LLM-urile actuale nu sunt adecvate pentru utilizare autonomă chiar și în sarcinile administrative minim complexe în mediile clinice”, afirmă Benjamin Glicksberg. „Sarcinile cu date structurate în fluxurile de lucru clinice vor necesita abordări agentice care să combine LLM-urile cu execuția de cod pentru a asigura acuratețea și consistența.”