2026. augusztus 1., szombat · Kutatás
Shadow evaluation: AI-ágensek elbuknak a nyílt kutatói döntéseknél
Egy nem lektorált tanulmány „shadow evaluation” néven új tesztmódszert vezet be: két meg nem jelent NeurIPS 2026-os cikk nyitott kutatási kérdését kapták meg AI-ágensek hat nap és több ezer dollárnyi számítási kapacitás mellett, majd a kéziratok eredeti szerzői értékelték a munkájukat. A szerzők szerint az ágensek emberi segítség nélkül elvégezték a szükséges mérnöki munkát, de érdemi előrelépést nem értek el a kutatási kérdés megválaszolásában, ezért mindkét dolgozatot elutasították. Öt visszatérő hibamintát azonosítottak: gyenge publikálhatósági ítélőképesség, kreativitáshiány a kutatási terv hibáinak kezelésében, hatástalan visszalépés zsákutcákból, gyenge erőforrás-tudatosság és utasításoktól való eltávolodás. Egy második modellel végzett ellenőrzés ugyanezeket a hibákat reprodukálta.
Miért fontos?
Konkrét bizonyítékot ad arra, hogy a mai AI-ágensek mérnöki feladatokat önállóan elvégeznek, de a nyitott kutatói döntéshozatalban még jelentősen elmaradnak.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 1., szombat napi AI összefoglaló része.