2026. augusztus 5., szerda · Kutatás

Nem egyenlő eséllyel fenyegeti a betegeket az orvosi AI-modellek adatszivárgása

A Nature-ben megjelent szakértői elemzés szerint az orvosi AI-fejlesztés eddigi alapfeltevése – hogy az anonimizált betegadatokból nem lehet visszakövetkeztetni az egyénekre – gyakran nem igaz. A cikk Knolle és szerzőtársai Nature-ben publikált kutatására hivatkozik, amely kimutatta, hogy erős gépi tanulási modellek esetén bizonyos betegcsoportok tagságára vonatkozó információ kikövethető a modellből, és ez a kockázat nem egyenletesen oszlik el a populációkon belül. Zhang és Ghassemi, az MIT kutatói ezt az eredményt kommentálva hangsúlyozzák, hogy az adatmegosztás és az orvosi AI-fejlesztés közötti implicit „alku” – amely a de-identifikáció biztonságára épül – felülvizsgálatra szorul. Az elemzés szerint a probléma különösen sürgető, mert eltérő mértékben veszélyezteti a különböző alcsoportokat, ami új etikai és adatvédelmi kérdéseket vet fel az egészségügyi AI-rendszerek tervezésénél.

Miért fontos?

A kutatás megkérdőjelezi azt az alapfeltevést, amelyre az orvosi AI-fejlesztéshez szükséges betegadat-megosztás jogi és etikai gyakorlata épül.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. augusztus 5., szerda napi AI összefoglaló része.

Kapcsolódó hírek

Multimodális nyelvi modell automatizálja a gyomortükrözés diagnosztikáját és leletezését

A Nature Communications-ben közölt, korai hozzáférésű tanulmány szerint kínai kutatók orvosi szaktudással megerősített multimodális nagy nyelvi modellt (MLLM-EDR) fejlesztettek gyomortükrözési képek automatikus diagnosztizálására és leletgenerálásra. A több központból származó adathalmaz 4461 beteg 203 838 endoszkópos képét tartalmazta. A szerzők szerint a modell 0,882-es átlagos diagnosztikus pontosságot ért el tizenkilenc betegségre, felülmúlva a korábbi AI-modelleket (0,720) és a kevésbé tapasztalt endoszkóposokat (0,784). A generált leletek minőségét a tapasztalt endoszkóposokéval egyenértékűnek találták, a leletezési idő pedig hét percről mintegy 13,5 másodpercre csökkent.

Új rendszerezés az AI-ügynökök hibáinak eredetéhez

Kutatók egy nem lektorált arXiv-tanulmányban olyan osztályozási rendszert mutatnak be, amely az AI-ügynökök hibáit nem a végeredmény, hanem az interakció szintjén azonosítja. A szerzők szerint a jelenlegi értékelések gyakran csak a látható hibát rögzítik, anélkül hogy elárulnák, a modell utótanítására, a vezérlőprogram javítására, a környezet átalakítására vagy a benchmark hibájára van szükség. A taxonómia 41 hibatípust rendel hozzá a rendszer komponensei (modell, harness, felhasználó, eszközök, memória, környezet) közötti kapcsolatokhoz, jelezve a javítás oldalát. A módszert nyilvános benchmarkokból és rögzített ügynök-interakciókból vett példákon tesztelték, és négy modellt bíráló szerepben alkalmazva a legjobb egyezés az emberi címkézéssel Cohen-kappa 0,76 volt.

MirrorCraft: rejtett szabályváltozásokkal teszteli az AI-ügynököket Minecraftban

Egy nem lektorált arXiv-tanulmány bemutatja a MirrorCraft nevű páros benchmarkot, amely nagy nyelvi modell alapú ügynökök teljesítményét méri Minecraftban rejtett szabálymódosítások mellett. Minden Vanilla világhoz egy Mirror pár tartozik, amelyben egy datapack csak a szerveroldali szabályokat (recept, drop, egyéb mechanika) változtatja meg, a terep, a spawn, az erőforrások és a célok változatlanok maradnak. A szerzők öt biomot, hat szabálykészletet, három progressziós célt és hat ügynökkonfigurációt vizsgáltak közös Mineflayer-felületen, a hatást pedig a Rule Intervention Effect mutatóval mérték. Az eredmények szerint a rejtett szabályváltozások hatása szabálykészletenként erősen eltér, a ReAct-konfiguráció érte el a legjobb pontszámot leírás nélkül, míg a pontos szabályok megadása csak mérsékelt javulást hozott.

Microsoft nyílt keretrendszert adott ki ügynök-AI kutatáshoz

A Microsoft Research bemutatta az Orchard nevű nyílt forráskódú keretrendszert, amelynek célja az ügynök-alapú AI-kutatás skálázhatóbbá és olcsóbbá tétele. A rendszer magja az Orchard Env, egy Kubernetes-alapú, újrahasználható környezet, amely szoftverfejlesztő, webnavigáló és személyi asszisztens ügynökök betanítására és kiértékelésére is alkalmas, akár valós futtatási keretek, például Codex, OpenClaw vagy ZeroClaw belsejében. A cég állítása szerint az Orchard-SWE mindössze 3 milliárd aktív paraméterrel 69,7%-ot ér el a SWE-bench Verified teszten, rerangolással pedig 73,0%-ot, ami közelíti a több mint tízszer nagyobb élvonalbeli modellek eredményeit. A Microsoft a tanítóadatokat és a kiértékelési módszereket is elérhetővé tette a kutatóközösség számára.