2026. július 25., szombat · Kutatás

32 mesterséges intelligencia alapmodell összehasonlítása a digitális patológiában – átfogó benchmark a Nature Communicationsben

A Nature Communicationsben megjelent (még szerkesztés előtti) tanulmány 32 mesterséges intelligencia alapmodellt hasonlít össze a számítógépes patológia területén. A kutatók négy kategóriát vizsgáltak: általános látásmodellek, általános látás-nyelvi modellek, patológia-specifikus látásmodellek és patológia-specifikus látás-nyelvi modellek. A TCGA, CPTAC és további külső adathalmazokon végzett tesztek szerint a patológia-specifikus látásmodellek következetesen a legjobban teljesítők közé tartoznak, és felülmúlják a patológia-specifikus látás-nyelvi modelleket. A szerzők rámutatnak, hogy a modellméret és az előtanító adathalmaz nagysága nem jósolja meg megbízhatóan a végső teljesítményt, míg a késői döntési szintű együttes alkalmazás javítja az összesített eredményeket. Az eredmények nyilvánosan elérhetők a PathBench felületen.

Miért fontos?

Az eddigi legnagyobb szisztematikus összehasonlítás rávilágít, hogy a patológiai AI-modellek közötti teljesítménykülönbségek gyakran kicsik és feladatfüggők.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 25., szombat napi AI összefoglaló része.

Kapcsolódó hírek

EAGLE: mélytanulási keretrendszer 99%-kal gyorsabb patológiai képelemzésre

A Nature Communications-ben megjelent tanulmány bemutatja az EAGLE nevű mélytanulási keretrendszert, amely a patológusok munkamódszerét utánozva szelektíven elemzi a szövettani metszeti képek informatív régióit a redundáns csempék ezreinek feldolgozása helyett. A szerzők szerint az EAGLE 43 feladaton, kilenc ráktípuson keresztül felülmúlta a jelenlegi aggregációs módszereket, egyes esetekben akár 23%-kal jobb osztályozási teljesítménnyel. A rendszer egyetlen metszetet 2,27 másodperc alatt dolgoz fel, ami a kutatók állítása szerint több mint 99%-os számítási idő csökkenést jelent. Az EAGLE auditálható munkafolyamatot kínál, mivel azonosíthatók a predikciók alapjául szolgáló csempék, csökkentve a nagy teljesítményű infrastruktúra iránti igényt.

DFAH-Bench: az AI-ügynökök pénzügyi döntéshozatalának viselkedési instabilitását mérő új benchmark

A DFAH-Bench nevű, nem lektorált kutatásban bemutatott benchmark-keretrendszer az AI-ügynökök viselkedési stabilitását méri pénzügyi feladatokban – nem csupán a végső döntést, hanem az odavezető eszközhasználati útvonalat is vizsgálja. A szerzők 8127 visszajátszási epizódot elemeztek 10 modellen és 3 feladaton: az élvonalbeli modellek 95%-os döntésegyezés mellett csupán 77%-ban követték ugyanazt az eszközútvonalat, ami 18 százalékpontos rejtett eltérést jelent. Három viselkedési profilt azonosítottak: mintaillesztőket, stabil végrehajtókat és trajektória-divergenseket, amelyek eltérő utakon jutnak azonos következtetésre.

AISE-Bench: új benchmark az akadémiai tudásgráfokon végzett többlépéses információkeresés értékelésére

Az AISE-Bench egy 1133 kérdés-válasz párból álló, valós felhasználói szándékokra épülő benchmark, amely akadémiai tudásgráfokon teszteli a nagy nyelvi modellek eszközhasználó ágensként való működését. A még nem lektorált kutatás szerint a rendszer teljes munkafolyamatot fed le: lekérdezés-tervezés, API-hívások végrehajtása, paraméterek kitöltése, hivatkozásokkal alátámasztott válaszok generálása és átfogó kiértékelés. A szerzők 14 módszert hasonlítottak össze, és azt találták, hogy még a legjobban teljesítő megközelítés (a Gemini-3-Pro-val működő PLAY2PROMPT) is csak közepes eredményt ért el, különösen az API-tervezés és -végrehajtás terén küzdött nehézségekkel. Az AISE-Bench célja, hogy megbízható tesztágyat biztosítson a többlépéses, nyomon követhető érvelést igénylő LLM-ágensek fejlesztéséhez és összehasonlításához. A kód és az adatok nyilvánosan elérhetők.

CANN Bench: nyílt benchmark AI által generált operátorkernelekhez Huawei Ascend NPU-n

Kutatók bemutatták a CANN Bench nevű nyílt benchmarkot, amely AI-ágensek által írt, alacsony szintű operátorkerneleket értékel Huawei Ascend NPU hardveren. A nem lektorált preprint szerint a benchmark 53 operátort és 1060 tesztesetet tartalmaz négy nehézségi szinten – egyszerű primitívektől a FlashAttention kernelekig –, FP16, BF16, FP32 és INT8 formátumokban. Az értékelés három dimenzió – fordíthatóság, funkcionális helyesség és teljesítmény – súlyozott pontszámán alapul, valós NPU-hardveren mért analitikus teljesítménykorláthoz viszonyítva. A szerzők szerint a módszer ellenáll a jutalom-manipulációnak, és hosszú távú közösségi fejlesztésre tervezett, pótolva a CUDA-centrikus benchmarkok hiányosságait.