Lipsa datelor despre strămoși în atlasele de celule unice afectează medicina echitabilă

eWell
eWell

Lipsa datelor despre strămoși în atlasele de celule unice afectează medicina echitabilă

Atlasele de celule unice, utilizate tot mai mult pentru a cartografia corpul uman și ca date de antrenament pentru modele de inteligență artificială, ar putea să nu reflecte echitabil populațiile mondiale, conform unui studiu condus de cercetători de la Icahn School of Medicine de la Mount Sinai.

Analiza a relevat o suprarportare constantă a persoanelor de origine europeană, în timp ce indivizii asiatici și latino erau subreprezentanți, iar un număr semnificativ de probe nu aveau nicio informație despre origine. Rezultatele au fost publicate pe 20 iulie în revista Cell Genomics.

Tehnologiile de celule unice permit oamenilor de știință să profileze biologia celulă cu celulă, descoperind tipuri rare de celule și modificări legate de boli, pe care metodele mai vechi nu le pot identifica. Eforturi internaționale ample au utilizat aceste instrumente pentru a construi hărți de referință, seturi extinse de date menite să servească drept referințe universale pentru cercetare și medicină. Totuși, cercetătorii afirmă că structura demografică a acestor resurse nu a fost examinată sistematic, ridicând întrebarea dacă hărțile reflectă întreaga umanitate sau doar o parte din ea.

Echipa a revizuit peste 13.500 de probe din trei resurse majore de celule unice: Human Cell Atlas, Human Tumor Atlas Network și PsychAD Consortium. Aceștia au curățat informațiile raportate privind originile, rasa și etnia indivizilor, comparând fiecare set de date cu datele populației globale, datele privind incidența cancerului din SUA și datele de referință specifice bolilor, examinând modele în funcție de țesuturi, tipuri de cancer și categorii de boli ale creierului.

Aceste atlase devin hărțile de referință pentru biologie și medicină și sunt folosite din ce în ce mai mult pentru a antrena modelele AI care vor modela cercetarea și îngrijirea viitoare. „Am vrut să punem o întrebare simplă, dar importantă: aceste hărți reprezintă corect oameni din diferite populații sau unele grupuri sunt lăsate deoparte? Ceea ce am descoperit este că unele dintre cele mai importante seturi de date nu sunt la fel de reprezentative pe cât ar trebui”, afirmă Kuan-lin Huang.

Discrepanțele au fost consistente în toate cele trei resurse. În cadrul Human Cell Atlas, aproape 70% din probe nu aveau deloc informații despre origine. Dintre cele care aveau, indivizii de origine europeană erau suprareprezentați de aproximativ șase ori în comparație cu așteptările globale, în timp ce indivizii asiatici, africani și latino erau subreprezentanți. În studiu, „latino” se referă la etnia raportată în datele disponibile, mai degrabă decât la o singură origine genetică, iar subreprezentarea sa subliniază necesitatea ca seturile de date de celule unice să reflecte mai bine comunitățile pe care intenționează să le servească.

Probele tumorale din Human Tumor Atlas Network erau de aproximativ 69% europene, iar setul de date PsychAD despre creier era aproape două treimi europene. De asemenea, mai multe tipuri de cancer au arătat diferențe pe baza sexului, care depășeau ceea ce ar prezice incidența bolii.

Cercetătorii subliniază că suprarportarea europeană din Human Cell Atlas s-a menținut chiar și în cele mai conservatoare ipoteze privind datele lipsă, ceea ce înseamnă că nu poate fi explicată doar prin înregistrări incomplete.

„Cea mai surprinzătoare constatare a fost cât de multă informație despre origine era pur și simplu lipsă din unele dintre aceste studii costisitoare”, spune Huang. „Aceste lacune pot fi transmise în modelele AI antrenate pe seturile de date, adesea fără ca utilizatorii modelelor AI să realizeze acest lucru, motiv pentru care este atât de important să construim diversitate și informații demografice complete în studiile de celule unice încă de la început.”

Autorii subliniază că problema este una de corectitudine și fiabilitate. Dacă cercetările viitoare, instrumentele AI, biomarkerii sau tratamentele sunt construite pe seturi de date care nu reprezintă pe toată lumea, beneficiile acestor progrese s-ar putea să nu ajungă la toată lumea în mod egal. Problema reflectă o problemă de lungă durată în genomica umană, unde studiile efectuate în cea mai mare parte pe persoane de origine europeană au generat scoruri de risc care se transferă prost către alte populații.

Studiul este printre primele verificări sistematice a cine este reprezentat în principalele atlase de celule unice. În loc să se întrebe doar cât de mari sau detaliate sunt seturile de date, cercetătorii s-au întrebat dacă acestea sunt corecte și generalizabile între populații. Echipa oferă, de asemenea, o listă de verificare practică, specifică domeniului, pe care grupurile de cercetare o pot folosi atunci când proiectează studii viitoare. Lista de verificare acoperă modul de planificare a recrutării, înregistrarea informațiilor demografice, echilibrarea probelor și raportarea dacă modelele AI funcționează la fel de bine între grupuri de origine și sexe.

„O concluzie importantă este că reprezentarea contează. Dacă acestea vor fi hărți de referință ale biologiei umane, ar trebui să reflecte diversitatea umanității”, afirmă Huang. „Aceste resurse sunt deja foarte valoroase și am dorit să ne asigurăm că domeniul poate să le îmbunătățească pentru a servi mai multe persoane în mod echitabil, ceea ce, în cele din urmă, înseamnă știință mai fiabilă și medicină de precizie mai echitabilă.”

Analiza a fost realizată de o echipă de cercetători studenți, coautori principali fiind Catrina Yang, Kavitharini Saravanan și Aryan Saharan, care au colaborat cu Huang la Icahn School of Medicine.

Autorii recunosc că studiul s-a bazat pe informațiile demografice raportate în seturile de date publice, mai degrabă decât pe măsurarea directă a originii genetice, și că categoriile largi de origine nu pot captura întreaga complexitate a identității. Deoarece lucrarea s-a concentrat pe trei consorții publice majore, rezultatele pot să nu reflecte fiecare set de date de celule unice din domeniu. Ca pas următor, echipa intenționează să extindă acest tip de audit la seturi de date suplimentare, să urmărească dacă reprezentarea se îmbunătățește în timp și să evalueze dacă modelele AI antrenate pe date de celule unice funcționează diferit între populații.

Distribuie acest articol
Niciun comentariu

Lasă un răspuns

Adresa ta de email nu va fi publicată. Câmpurile obligatorii sunt marcate cu *