2026. augusztus 6., csütörtök · Kutatás
Új teszt mutatja: az AI-modellek elbuknak gyógyszerbiztonsági döntéseknél
Kutatók MedPIC-Bench néven 467 kérdésből álló tesztet mutattak be, amely azt vizsgálja, hogy a nyelvi modellek valóban figyelembe veszik-e a beteg egyéni adatait egy gyógyszerbiztonsági szabály alkalmazásakor, nem csak egy rögzített gyógyszer-kockázat párost idéznek fel. A szerzők állítása szerint 28 orvosi célú, általános és zárt modellt teszteltek: amikor a beteg adatait megváltoztatták, az átlagos pontosság 63,6%-ról 45,1%-ra esett. A modellek jól kezelik, ha egy beteg-jellemző közvetlenül ismert ellenjavallatra utal, de nehezen boldogulnak, ha az adatok éppen kizárnak egy figyelmeztetést. A nem lektorált preprint szerint a modellek indoklása gyakran felismeri a megváltozott adatot, mégis a korábbi ítéletet tartják meg, és ez a hiba az orvosi célú modelleknél is fennáll, sőt átlagosan rosszabbul teljesítenek, mint az általánosak.
Miért fontos?
A mérés konkrét adatokkal jelzi, hogy az orvosi AI-modellek gyakran nem alkalmazzák helyesen a beteg-specifikus feltételeket, ami valós klinikai kockázatot jelenthet.
Források
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 6., csütörtök napi AI összefoglaló része.