2026. augusztus 1., szombat · Kutatás

Shadow evaluation: AI-ágensek elbuknak a nyílt kutatói döntéseknél

Egy nem lektorált tanulmány „shadow evaluation” néven új tesztmódszert vezet be: két meg nem jelent NeurIPS 2026-os cikk nyitott kutatási kérdését kapták meg AI-ágensek hat nap és több ezer dollárnyi számítási kapacitás mellett, majd a kéziratok eredeti szerzői értékelték a munkájukat. A szerzők szerint az ágensek emberi segítség nélkül elvégezték a szükséges mérnöki munkát, de érdemi előrelépést nem értek el a kutatási kérdés megválaszolásában, ezért mindkét dolgozatot elutasították. Öt visszatérő hibamintát azonosítottak: gyenge publikálhatósági ítélőképesség, kreativitáshiány a kutatási terv hibáinak kezelésében, hatástalan visszalépés zsákutcákból, gyenge erőforrás-tudatosság és utasításoktól való eltávolodás. Egy második modellel végzett ellenőrzés ugyanezeket a hibákat reprodukálta.

Miért fontos?

Konkrét bizonyítékot ad arra, hogy a mai AI-ágensek mérnöki feladatokat önállóan elvégeznek, de a nyitott kutatói döntéshozatalban még jelentősen elmaradnak.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. augusztus 1., szombat napi AI összefoglaló része.

Kapcsolódó hírek

Mesterséges intelligencia mint társkutató: új keretrendszer az orvosbiológiai kutatások felgyorsítására

A Nature Medicine szerkesztőségi cikke szerint az új technológiák olyan ütemben állítanak elő orvosbiológiai adatokat, amely meghaladja az emberi elemzőkapacitást, miközben számos kutatási munkafolyamat ismétlődő és töredezett. Ez kutatási szűk keresztmetszetet hoz létre, amelynek feloldásában a mesterséges intelligenciára épülő ágensek segíthetnek. A cikk két kapcsolódó tanulmányra is hivatkozik: az egyik a rákpatológiában alkalmazható autonóm tudományos felfedezés ágens-keretrendszerét mutatja be, a másik pedig hematológiai rosszindulatú megbetegedéseknél nyújtott klinikai döntéstámogatásra fejlesztett MI-ágenssel foglalkozik. A szerkesztőségi írás tehát azt a gondolatot járja körül, hogy az MI-ágensek társkutatóként képesek lehetnek az orvosbiológiai kutatás tempójának növelésére azáltal, hogy átvállalják az adatelemzés és a munkafolyamatok egy részét.

Manipulált adatkészletekkel félrevezethetők az MI-ágensek – kutatók mutatták ki a veszélyt

Kutatók öt vitatott társadalmi témában – köztük bevándorlás, munkahelyi diszkrimináció és önvezető autók biztonsága – nyilvános adatkészleteket módosítottak úgy, hogy a statisztikai trendek irányát és erősségét megváltoztassák, majd a manipulált változatokat privát tárolókba töltötték fel. Az Anthropic, az OpenAI és a Google MI-ágenseinek hozzáférést adtak mind az eredeti, mind a hamisított adatokhoz, és kérdéseket tettek fel nekik. Az eredmények szerint az ágensek az esetek mintegy felében a manipulált adatok alapján vontak le következtetést, vagyis a csalók által kívánt téves válaszra jutottak. A tanulmány még nem esett át szakmai lektoráláson. A szerzők szerint a kutatóknak különösen gondosan kell ellenőrizniük az MI-ágensek által felhasznált adatkészletek eredetét és megbízhatóságát.

Incognita: új keretrendszer társas környezetben működő AI-ágensek értékelésére

Kutatók egy Incognita nevű, Concordia-alapú keretrendszert mutattak be, amely elkülönítve értékeli a generatív AI-ágensek társas interakcióját és megalapozott cselekvés-végrehajtását. A rendszer társasan elosztott feladatkörnyezeteket definiál, ahol a tudás szerepkörök szerint elkülönített résztvevők között oszlik meg. Három modellt teszteltek 18 feladaton, 540 próbán: a sikerarány 0-ról 8,9, illetve 17,2 százalékra nőtt, a korai befejezés aránya 100-ról 58 százalékra csökkent. Az erősebb modellek több rejtett tudást tártak fel, de a megbízhatóság alacsony maradt. A nem lektorált tanulmány szerint e környezetek már a megbízható siker előtt feltárják az ágensviselkedés mintázatait.