Seturile de date nesigure afectează modelele de predicție clinică
O investigație asupra a două seturi de date de sănătate utilizate pe scară largă relevă probleme grave de proveniență a datelor și de fiabilitate, stârnind îngrijorări legate de modelele de predicție clinică construite pe baza acestora și determinând apeluri pentru standarde mai stricte în cercetare.
Un nou studiu publicat în BMC Medicine a realizat analize exploratorii pentru a examina calitatea datelor și raportarea în două seturi mari de date publice privind accidentele vasculare cerebrale și diabetul, utilizate frecvent în modelele de predicție clinică.
Până în 2024, cercetătorii estimau că au fost publicate aproximativ 250.000 de modele de predicție clinică, menite să ajute medicii în diagnosticarea bolilor, estimarea prognosticului și orientarea deciziilor de tratament. Fiabilitatea acestor modele depinde atât de metodele analitice robuste, cât și de calitatea superioară a datelor de bază.
Pentru a îmbunătăți transparența, în 2015 au fost introduse liniile directoare TRIPOD (Transparent Reporting of a multivariable prediction model for Individual Prognosis or Diagnosis), oferind un cadru pentru raportarea cercetărilor privind modelele de predicție. Actualizarea TRIPOD+AI din 2024 a extins aceste recomandări pentru a include atât modelele de regresie tradiționale, cât și pe cele bazate pe învățarea automată, punând un accent și mai mare pe documentarea provenienței datelor, adică pe metadatele care înregistrează sursa, modul de colectare și încrederea în date.
Disponibilitatea în creștere a seturilor mari de date de sănătate colectate în mod rutinier a accelerat dezvoltarea modelelor de predicție clinică. Totuși, aceasta a alimentat și ceea ce cercetătorii numesc „cercetare rapidă”: studii rapide și formulaice care prioritizează volumul de publicații în detrimentul avansurilor științifice semnificative. Autorii susțin că această abordare poate crește riscul de rezultate false și poate irosi resursele valoroase de cercetare.
Îngrijorările legate de calitatea datelor au determinat deja unele publicații și reviste să își înăsprească politicile editoriale, în urma utilizării necorespunzătoare a seturilor de date frecvent utilizate, cum ar fi Global Burden of Disease și National Health and Nutrition Examination Survey. Alte exemple, precum liniile celulare de cancer neverificabile, care au dus la retrageri de articole, au evidențiat și mai mult consecințele provenienței slabe a datelor.
Deși inițiative precum principiile FAIR (Findable, Accessible, Interoperable and Reusable) încurajează o mai bună gestionare a datelor, adoptarea acestora rămâne inconsistentă. De asemenea, deși repositoarele precum Kaggle fac seturile de date larg accesibile, acestea nu cer utilizatorilor să furnizeze informații detaliate despre proveniență. Autorii argumentează că, fără standarde mai stricte pentru verificarea provenienței datelor, seturile de date nesigure pot continua să circule în literatura științifică, subminând astfel medicina bazată pe dovezi.
Studiul a evaluat proveniența folosind standardele TRIPOD+AI. Au fost selectate două seturi populare de date de sănătate disponibile public, cu o proveniență probabil slabă, datorită numărului mare de descărcări și relevanței lor pentru cercetarea modelelor de predicție clinică. Un set de date s-a concentrat pe accidentele vasculare cerebrale, iar celălalt pe diabet, ambele fiind accesate de pe Kaggle pe 27 august 2025. Studiul a avut ca scop evidențierea problemelor de proveniență a datelor în modelele de predicție clinică utilizând aceste seturi de date.
Fiecare set de date a fost evaluat folosind nouă criterii de proveniență TRIPOD+AI, iar analizele exploratorii au fost efectuate pentru a evalua autenticitatea, inclusiv verificări pentru date simulate, corelații neașteptate între variabile, distribuții anormale și rânduri duplicate. De asemenea, au fost revizuite discuțiile publice de pe Kaggle despre proveniența datelor, iar îngrijorările au fost aduse în atenția Kaggle.
Google Scholar a fost căutat pentru a identifica articolele revizuite de colegi care au folosit aceste seturi de date pentru dezvoltarea sau validarea modelului, iar textele integrale au fost examinate pentru includere. Excluderile au inclus lucrări non-revizuite și articole în alte limbi decât engleza. Autorii au menționat că această strategie de căutare a subestimat probabil utilizarea acestor seturi de date, deoarece studiile care nu includeau linkuri directe către Kaggle nu ar fi fost capturate.
Au fost documentate inconsistențe în raportare, împreună cu verificări pentru divulgarea originii setului de date și revizuiri ale declarațiilor referitoare la aprobarea etică și utilizarea clinică potențială. Adoptarea politicii a fost examinată prin intermediul Altmetric și Overton. Afilierea autorilor pe țări a fost analizată, iar volumul de cercetare în timp a fost reprezentat folosind OpenAlex.
O evaluare a două seturi de date de sănătate populare de pe Kaggle pentru cercetarea modelului de predicție clinică a relevat probleme majore legate de proveniența și autenticitatea datelor. Din cele 653 de rezultate de cercetare identificate, 125 de articole publicate au dezvoltat sau validat modele de predicție clinică folosind aceste seturi de date.
Evaluarea utilizând cele nouă criterii TRIPOD+AI a relevat deficiențe grave în ambele seturi de date: niciunul nu a furnizat informații despre când, unde, de ce sau cum au fost colectate datele, iar autenticitatea nu a putut fi verificată independent. Ambele seturi de date au eșuat la toate cele nouă criterii de evaluare a provenienței TRIPOD+AI.
Setul de date privind accidentele vasculare cerebrale includea 5.110 cazuri, care conțineau ID-uri de pacienți neregulate, distribuții improbabile ale glucozei în sânge și vârste, și o cantitate nerealist de mică de date lipsă. Similar, setul de date privind diabetul cuprindea 100.000 de cazuri care conțineau valori repetitive și nenaturale, corelații artificiale și multe intrări duplicate. Împreună, aceste constatări indică faptul că ambele seturi de date sunt probabil sintetice, fabricate sau altfel nesigure și, prin urmare, nepotrivite pentru cercetare sau aplicații clinice.
Articolele incluse au provenit din 32 de țări. Cu toate acestea, raportarea privind aprobarea etică a fost rară, iar majoritatea articolelor nu au oferit suficiente informații despre proveniența datelor. Numai un număr mic a descris sursele de date, iar majoritatea nu au îndeplinit standardele de transparență de bază.
Cu toate acestea, aceste seturi de date au fost citate pe scară largă și folosite frecvent pentru a face recomandări în domeniul îngrijirii clinice. Dintre cele 125 de studii, trei modele au arătat dovezi de utilizare potențială în practică, unul a fost citat într-un brevet pentru un dispozitiv medical, iar 86 de articole de revizuire au făcut referire la aceste modele.
Unele articole au descris utilizarea reală sau potențială în medii clinice, iar 11 studii au dezvoltat instrumente de predicție bazate pe web sau aplicații cu interfețe grafice, dintre care două erau accesibile publicului. Niciunul dintre studii nu a fost menționat în documentele de politică.
Numărul publicațiilor