2026. augusztus 5., szerda · Kutatás

Nem egyenlő eséllyel fenyegeti a betegeket az orvosi AI-modellek adatszivárgása

A Nature-ben megjelent szakértői elemzés szerint az orvosi AI-fejlesztés eddigi alapfeltevése – hogy az anonimizált betegadatokból nem lehet visszakövetkeztetni az egyénekre – gyakran nem igaz. A cikk Knolle és szerzőtársai Nature-ben publikált kutatására hivatkozik, amely kimutatta, hogy erős gépi tanulási modellek esetén bizonyos betegcsoportok tagságára vonatkozó információ kikövethető a modellből, és ez a kockázat nem egyenletesen oszlik el a populációkon belül. Zhang és Ghassemi, az MIT kutatói ezt az eredményt kommentálva hangsúlyozzák, hogy az adatmegosztás és az orvosi AI-fejlesztés közötti implicit „alku” – amely a de-identifikáció biztonságára épül – felülvizsgálatra szorul. Az elemzés szerint a probléma különösen sürgető, mert eltérő mértékben veszélyezteti a különböző alcsoportokat, ami új etikai és adatvédelmi kérdéseket vet fel az egészségügyi AI-rendszerek tervezésénél.

Miért fontos?

A kutatás megkérdőjelezi azt az alapfeltevést, amelyre az orvosi AI-fejlesztéshez szükséges betegadat-megosztás jogi és etikai gyakorlata épül.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. augusztus 5., szerda napi AI összefoglaló része.

Kapcsolódó hírek

Új teszt mutatja: az AI-modellek elbuknak gyógyszerbiztonsági döntéseknél

Kutatók MedPIC-Bench néven 467 kérdésből álló tesztet mutattak be, amely azt vizsgálja, hogy a nyelvi modellek valóban figyelembe veszik-e a beteg egyéni adatait egy gyógyszerbiztonsági szabály alkalmazásakor, nem csak egy rögzített gyógyszer-kockázat párost idéznek fel. A szerzők állítása szerint 28 orvosi célú, általános és zárt modellt teszteltek: amikor a beteg adatait megváltoztatták, az átlagos pontosság 63,6%-ról 45,1%-ra esett. A modellek jól kezelik, ha egy beteg-jellemző közvetlenül ismert ellenjavallatra utal, de nehezen boldogulnak, ha az adatok éppen kizárnak egy figyelmeztetést. A nem lektorált preprint szerint a modellek indoklása gyakran felismeri a megváltozott adatot, mégis a korábbi ítéletet tartják meg, és ez a hiba az orvosi célú modelleknél is fennáll, sőt átlagosan rosszabbul teljesítenek, mint az általánosak.

Multimodális nyelvi modell automatizálja a gyomortükrözés diagnosztikáját és leletezését

A Nature Communications-ben közölt, korai hozzáférésű tanulmány szerint kínai kutatók orvosi szaktudással megerősített multimodális nagy nyelvi modellt (MLLM-EDR) fejlesztettek gyomortükrözési képek automatikus diagnosztizálására és leletgenerálásra. A több központból származó adathalmaz 4461 beteg 203 838 endoszkópos képét tartalmazta. A szerzők szerint a modell 0,882-es átlagos diagnosztikus pontosságot ért el tizenkilenc betegségre, felülmúlva a korábbi AI-modelleket (0,720) és a kevésbé tapasztalt endoszkóposokat (0,784). A generált leletek minőségét a tapasztalt endoszkóposokéval egyenértékűnek találták, a leletezési idő pedig hét percről mintegy 13,5 másodpercre csökkent.

ScientistTwo: önállóan kutató és publikáló AI-rendszer preprintje

Egy kutatócsapat bemutatta a ScientistTwo nevű, több AI-ügynökből álló keretrendszert, amely a fejlesztők állítása szerint emberi beavatkozás nélkül képes végigvinni egy tudományos felfedezési ciklust: hipotézist állít fel, kísérleteket futtat, ablációs vizsgálatokkal finomítja a módszert, majd egy szimulált, AI-alapú bírálati-válaszadási folyamattal ellenőrzi az eredményt. A szerzők a rendszert olyan cikkekhez hasonlították, amelyeket korábban elfogadtak az ICLR, ICML és NeurIPS konferenciákon, és azt közlik, hogy a ScientistTwo által generált, futtatható kóddal ellátott tanulmányok automatizált AI-bírálók pontozásában átlagosan magasabb értékelést kaptak, mint az emberi szerzők cikkei. Fontos hangsúlyozni, hogy ez egy arXiv-preprint, tehát az eredmények még nem mentek át független emberi szakmai lektoráláson. A szerzők a rendszert nem puszta segédeszköznek, hanem önálló „tudományos felfedezőnek” nevezik, ez azonban a saját minősítésük, nem külső validáció.

Új benchmark: LLM-ek megbízhatatlanok autós hangparancsok engedélyezésénél

Kutatók egy 202 forgatókönyvből álló benchmarkot dolgoztak ki, amely azt méri, mennyire biztonságosan döntenek a nagy nyelvi modellek (LLM) autós hangasszisztensek parancsainak kezeléséről – végrehajtás, elutasítás, visszaigazolás vagy manuális vezérlés között. A nem lektorált arXiv-preprint szerint a Gemini 3.1 Pro Preview érte el a legjobb, 89,1%-os egyezést a referenciadöntésekkel, míg a Llama 3.2 3B csak 40,1%-ot; a három API-alapú modell 83,2-89,1% között teljesített, szignifikáns különbség nélkül. Még a legjobb modellek is 2-3 hamis végrehajtást produkáltak a 161 nem-végrehajtási esetből, és a visszaigazolási döntéseknél tartós hibák maradtak. A szerzők szerint a strukturált LLM-döntések önmagukban nem elégségesek, független érvényesítési rétegre van szükség a valós autós beépítéshez.