Un nou instrument identifică prejudecăți ascunse în datele de formare medicală
Cercetătorii au dezvoltat un instrument care descoperă probleme ascunse în seturile masive de date utilizate pentru antrenarea inteligenței artificiale în domeniul medical.
Acest instrument analizează datele de formare pentru a găsi modele subtile care ar putea conduce modelele AI la concluzii eronate, punând în pericol îngrijirea pacientului. Obiectivul acestui demers este de a ajuta cercetătorii și reglementatorii să facă inteligența artificială mai fiabilă și de încredere pentru utilizarea clinică în lumea reală.
Modelele care stau la baza medicinei de precizie învață să deducă rezultatele clinice din datele pe care sunt antrenate. În multe cazuri, acest lucru funcționează excelent, dar poate duce și la eșecuri interesante care nu sunt imediat evidente. Instrumentul dezvoltat oferă o înțelegere clară a elementelor de metadate care prezintă cele mai mari riscuri pentru model de a dezvolta un bias.
Mathias Unberath a declarat: „Modelele iau aceleași scurtături”, făcând referire la inteligența artificială antrenată să prezică cu acuratețe sexul unei persoane doar prin observarea ochilor acestora. S-a constatat că modelul se baza pe prezența rimelului, mai degrabă decât pe caracteristici biologice.
„Antrenăm modelele pentru a fi cele mai predictive, dar nu avem control asupra a ceea ce modelul folosește pentru a face predicția.”
Proiectul a fost o colaborare între Johns Hopkins și Administrația pentru Alimente și Medicamente din SUA, fiind recent publicat în npj Digital Medicine.
Fenomenul „Clever Hans” se referă la un cal pe nume Hans, care, la începutul anilor 1900, a devenit celebru pentru abilitățile sale matematice, răspunzând corect la întrebări prin bătăi cu copita. S-a descoperit că Hans nu făcea matematică, ci era foarte bun în a citi limbajul corporal al stăpânului său, care îi dezvăluia cum ar trebui să reacționeze.
Modelele AI medicale pot fi foarte asemănătoare cu Hans, a explicat Unberath, ajungând la concluzii prin interpretarea semnalelor greșite.
Instrumentul echipei detectează potențialul unor astfel de asocieri defectuoase. Spre deosebire de alte metode care se bazează pe performanța unui model AI, noul instrument, denumit Generalized Attribute Utility and Detectability-Induced Bias Testing (G-AUDIT), examinează datele de formare în sine pentru a găsi semne că un model ar putea învăța din indicii neintenționate, mai degrabă decât din semnale clinice semnificative.
„Ceea ce este cel mai interesant este că acesta reprezintă o schimbare în modul în care facem munca”, a spus coautorul Mitchell Pavlak. „Nu verificăm munca noastră după ce s-a întâmplat. Analizăm datele pentru a determina ce este probabil să fie o problemă.”
G-AUDIT identifică și evaluează atributele din datele care ar putea conduce AI-ul să emită concluzii potențial incorecte.
Cercetătorii l-au testat pe o gamă variată de date medicale, inclusiv imagini, texte și fișiere tabelare. Instrumentul a dezvăluit defecte ascunse în colectarea datelor, condițiile de imagistică și alte elemente care ar putea duce la concluzii greșite despre sănătatea unui pacient.
De exemplu, un set de date despre cancerul de piele conținea imagini dintr-o clinică de cancer care deservia o populație cu risc ridicat și imagini dintr-o clinică generală de dermatologie care trata mai puține cazuri de cancer. Datorită variațiilor calității sistemelor de imagistică ale clinicilor, un AI antrenat pe acest set de date ar putea deduce greșit că calitatea camerei este un predictor important pentru cancer. Sau chiar că prezența riglelor în imagini prezice cancerul, deoarece clinica de cancer tindea să includă rigle în imagini pentru a urmări dimensiunea leziunilor în timp.
„Imaginați-vă că luați acest algoritm în lume cu o cameră de smartphone”, a spus Unberath. „Nu există riglă. Calitatea camerei este complet irelevantă. Dar modelul a învățat să asocieze „riglă” și „cameră”. Ați creat o disparitate în sănătate.”
Echipa intenționează să continue dezvoltarea și extinderea instrumentului, care ar putea fi adaptat pentru utilizare dincolo de domeniul sănătății.
„Mesajul principal este că, în prezent, oamenii auditează modelele, dar nu știu cu adevărat ce să auditeze. Noi schimbăm asta”, a afirmat Unberath. „Dacă auditezi doar lucrurile care îți vin în minte, probabil că ratezi multe aspecte care ar putea duce la corelații spurie.”