Cercetătorii dezvoltă un cadru open source pentru cercetarea AI în domeniul sănătății
Un grup de cercetători de la Universitatea Columbia a creat un cadru open-source destinat să optimizeze și să accelereze cercetarea în domeniul inteligenței artificiale folosind datele de sănătate, abordând provocările de lungă durată legate de standardizarea datelor, reproducibilitate și colaborarea între instituții.
Cadrul, denumit MEDS, introduce un format standardizat de date și un ecosistem tot mai vast de instrumente interoperabile, menite să susțină dezvoltarea și evaluarea modelelor de învățare automată pe baza datelor clinice.
Un studiu care descrie acest cadru a fost publicat în NEJM AI.
Cercetătorii afirmă că MEDS ar putea ajuta la reducerea barierelor tehnice care încetinesc în prezent cercetarea AI în domeniul sănătății și care fac dificilă reproducerea constatărilor sau compararea modelelor între studii și instituții.
MEDS simplifică procesul de uniformizare a diferitelor surse de date din dosarele electronice de sănătate (EHR), astfel încât codul să poată gestiona datele indiferent de spitalul, clinica sau sistemul software EHR din care provin. MEDS permite partajarea codului necesar pentru antrenarea modelelor pe diverse site-uri de îngrijire, fără a necesita partajarea datelor sensibile ale pacienților și, adesea, fără a fi nevoie să se armonizeze complet datele într-o vocabularie clinică consistentă. Această infrastructură va permite cercetătorilor să dedice mai puțin timp reconstruirii canalelor de date și mai mult timp răspunsului la întrebări clinice semnificative.
Matthew McDermott, doctor în științe biomedicale, liderul studiului.
Standardizarea datelor de sănătate pentru cercetarea AI clinică
Datele din dosarele electronice de sănătate sunt adesea stocate în formate specifice fiecărei instituții, ceea ce necesită o prelucrare extensivă înainte de a putea fi utilizate pentru dezvoltarea AI. Autorii studiului subliniază că aceste inconsistențe pot crea o duplicare semnificativă a eforturilor, pot limita colaborarea și pot împiedica reproducibilitatea.
MEDS abordează aceste probleme prin furnizarea unui standard ușor și extensibil pentru reprezentarea datelor clinice longitudinale în fluxurile de lucru de învățare automată. Cadrul include, de asemenea, instrumente open-source care sprijină transformarea datelor, prelucrarea, evaluarea și dezvoltarea modelelor.
Autorii subliniază că MEDS a fost conceput special pentru aplicațiile AI și învățare automată, completând, dar fără a înlocui, standardele existente de date clinice.
Cadrul vizează o gamă largă de utilizări în cercetarea biomedicală AI, inclusiv modelarea predictivă, învățarea prin reprezentare, modelarea multimodală și studii de evaluare la scară largă. Deoarece ecosistemul este open source, cercetătorii din mediul academic, din domeniul sănătății și din industrie pot contribui cu instrumente și extensii.
„Mari succese în AI au fost întotdeauna conduse de comunitate, care s-a unit pentru a colabora, adesea într-o manieră descentralizată și open-source, asupra instrumentelor, părților de model și, în cele din urmă, ecosistemelor care ne permit să construim modele mai mari care să se scaleze la seturi de date masive”, a declarat McDermott. „Aceste rezultate impresionante obținute cu MEDS reflectă doar beneficiile pe care le obții atunci când comunitatea poate împărtăși instrumente sau abstractiza părțile comune ale canalelor lor de date într-o bibliotecă comună și să le folosească în datele tuturor.”
Studiul subliniază, de asemenea, importanța reproducibilității și transparenței în dezvoltarea AI pentru sănătate, pe măsură ce modelele de învățare automată avansează către implementarea clinică.
Cercetătorii speră că MEDS va încuraja colaborarea mai largă între instituții și va accelera inovația în AI-ul clinic, promovând în același timp o știință mai transparentă și reproducibilă. Până în prezent, MEDS a fost adoptat de 21 de instituții din 12 țări.