2026. július 25., szombat · Kutatás
AISE-Bench: új benchmark az akadémiai tudásgráfokon végzett többlépéses információkeresés értékelésére
Az AISE-Bench egy 1133 kérdés-válasz párból álló, valós felhasználói szándékokra épülő benchmark, amely akadémiai tudásgráfokon teszteli a nagy nyelvi modellek eszközhasználó ágensként való működését. A még nem lektorált kutatás szerint a rendszer teljes munkafolyamatot fed le: lekérdezés-tervezés, API-hívások végrehajtása, paraméterek kitöltése, hivatkozásokkal alátámasztott válaszok generálása és átfogó kiértékelés. A szerzők 14 módszert hasonlítottak össze, és azt találták, hogy még a legjobban teljesítő megközelítés (a Gemini-3-Pro-val működő PLAY2PROMPT) is csak közepes eredményt ért el, különösen az API-tervezés és -végrehajtás terén küzdött nehézségekkel. Az AISE-Bench célja, hogy megbízható tesztágyat biztosítson a többlépéses, nyomon követhető érvelést igénylő LLM-ágensek fejlesztéséhez és összehasonlításához. A kód és az adatok nyilvánosan elérhetők.
Miért fontos?
A benchmark rávilágít, hogy a legerősebb nyelvi modellek is komoly korlátokba ütköznek a többlépéses akadémiai információkeresésben.
Források
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. július 25., szombat napi AI összefoglaló része.