2026. július 20., hétfő · Kutatás
Az AI-chatbotok veszélyesen magabiztosak a röntgendiagnózisban, még akkor is, ha tévednek
A RadLE 2.0 nevű benchmark 200 radiológiai eseten 16 mesterségesintelligencia-modellt tesztelt, és az eredményeket tapasztalt radiológusok teljesítményéhez hasonlította. Az Ashoka Egyetem CRASH Lab csapata által fejlesztett teszt nemcsak a diagnózis pontosságát, hanem a modell magabiztossági szintjét és a bizonytalanság beismerésének képességét is méri. A humán szakértők 988,7 pontot értek el a maximális 2000-ből, míg a legjobb AI-modell 758-at. A tanulmány szerint egyetlen modell sem győzött minden kategóriában: az Anthropic Claude Fable 5 a megbízhatóságban, a Google Gemini 3 Pro a nyers találati arányban, a Meta Muse Spark 1.1 pedig a saját korlátainak felismerésében teljesített a legjobban. A pontozás bünteti a magabiztos tévedést, mivel az orvoslásban egy hamisan határozott diagnózis sokkal veszélyesebb, mint a bizonytalanság őszinte bevallása.
Miért fontos?
A teszt rámutat, hogy az AI-modellek túlzott magabiztossága a radiológiában közvetlen betegbiztonsági kockázatot jelent.
Források
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. július 20., hétfő napi AI összefoglaló része.