2026. július 25., szombat · Kutatás

CANN Bench: nyílt benchmark AI által generált operátorkernelekhez Huawei Ascend NPU-n

Kutatók bemutatták a CANN Bench nevű nyílt benchmarkot, amely AI-ágensek által írt, alacsony szintű operátorkerneleket értékel Huawei Ascend NPU hardveren. A nem lektorált preprint szerint a benchmark 53 operátort és 1060 tesztesetet tartalmaz négy nehézségi szinten – egyszerű primitívektől a FlashAttention kernelekig –, FP16, BF16, FP32 és INT8 formátumokban. Az értékelés három dimenzió – fordíthatóság, funkcionális helyesség és teljesítmény – súlyozott pontszámán alapul, valós NPU-hardveren mért analitikus teljesítménykorláthoz viszonyítva. A szerzők szerint a módszer ellenáll a jutalom-manipulációnak, és hosszú távú közösségi fejlesztésre tervezett, pótolva a CUDA-centrikus benchmarkok hiányosságait.

Miért fontos?

Az első nyílt, többdimenziós benchmark AI-generált kernelekhez nem CUDA alapú NPU-hardveren, ami szélesíti a hardverökoszisztémák összehasonlíthatóságát.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 25., szombat napi AI összefoglaló része.

Kapcsolódó hírek

AISE-Bench: új benchmark az akadémiai tudásgráfokon végzett többlépéses információkeresés értékelésére

Az AISE-Bench egy 1133 kérdés-válasz párból álló, valós felhasználói szándékokra épülő benchmark, amely akadémiai tudásgráfokon teszteli a nagy nyelvi modellek eszközhasználó ágensként való működését. A még nem lektorált kutatás szerint a rendszer teljes munkafolyamatot fed le: lekérdezés-tervezés, API-hívások végrehajtása, paraméterek kitöltése, hivatkozásokkal alátámasztott válaszok generálása és átfogó kiértékelés. A szerzők 14 módszert hasonlítottak össze, és azt találták, hogy még a legjobban teljesítő megközelítés (a Gemini-3-Pro-val működő PLAY2PROMPT) is csak közepes eredményt ért el, különösen az API-tervezés és -végrehajtás terén küzdött nehézségekkel. Az AISE-Bench célja, hogy megbízható tesztágyat biztosítson a többlépéses, nyomon követhető érvelést igénylő LLM-ágensek fejlesztéséhez és összehasonlításához. A kód és az adatok nyilvánosan elérhetők.

Incognita: új keretrendszer társas környezetben működő AI-ágensek értékelésére

Kutatók egy Incognita nevű, Concordia-alapú keretrendszert mutattak be, amely elkülönítve értékeli a generatív AI-ágensek társas interakcióját és megalapozott cselekvés-végrehajtását. A rendszer társasan elosztott feladatkörnyezeteket definiál, ahol a tudás szerepkörök szerint elkülönített résztvevők között oszlik meg. Három modellt teszteltek 18 feladaton, 540 próbán: a sikerarány 0-ról 8,9, illetve 17,2 százalékra nőtt, a korai befejezés aránya 100-ról 58 százalékra csökkent. Az erősebb modellek több rejtett tudást tártak fel, de a megbízhatóság alacsony maradt. A nem lektorált tanulmány szerint e környezetek már a megbízható siker előtt feltárják az ágensviselkedés mintázatait.

Kutatók feltárták a multimodális nagy nyelvi modellek értékelésének hiányosságait

Egy új, az arXiv-on megjelent preprint (arXiv:2606.26348v1) szerint a multimodális nagy nyelvi modellek (MLLM-ek) értékelése nem tartott lépést e rendszerek gyors fejlődésével. A szerzők áttekintik a jelenlegi benchmark-taxonómiát, és rámutatnak több konkrét hiányosságra: a térbeli-időbeli koherencia, a fizikai világ megértése, valamint a modalitások közötti valódi információintegráció mérése jelenleg alig kap figyelmet. A tanulmány szerint a legtöbb létező benchmark elszigetelt feladatokra korlátozódik, és keveset árul el arról, hogy a modell ténylegesen képes-e több modalitás – szöveg, kép, hang, videó – együttes feldolgozására. Fontos hangsúlyozni, hogy a kutatás preprint formában jelent meg, így lektorált eredményként nem kezelhető.

DFAH-Bench: az AI-ügynökök pénzügyi döntéshozatalának viselkedési instabilitását mérő új benchmark

A DFAH-Bench nevű, nem lektorált kutatásban bemutatott benchmark-keretrendszer az AI-ügynökök viselkedési stabilitását méri pénzügyi feladatokban – nem csupán a végső döntést, hanem az odavezető eszközhasználati útvonalat is vizsgálja. A szerzők 8127 visszajátszási epizódot elemeztek 10 modellen és 3 feladaton: az élvonalbeli modellek 95%-os döntésegyezés mellett csupán 77%-ban követték ugyanazt az eszközútvonalat, ami 18 százalékpontos rejtett eltérést jelent. Három viselkedési profilt azonosítottak: mintaillesztőket, stabil végrehajtókat és trajektória-divergenseket, amelyek eltérő utakon jutnak azonos következtetésre.