2026. augusztus 15., szombat · Kutatás
Új tanulmány cáfolja az önálló AI-kutatás ígéretét
A Princeton Egyetem és a brit AI Security Institute kutatói egy „Shadow Evaluation” nevű módszerrel tesztelték, képesek-e a mai AI-ügynökök önállóan végigvinni egy kutatási folyamatot. A kísérletben a Claude Opus 4.8 modellt hat napig, 3000 dolláros API-kerettel futtatták két még publikálatlan NeurIPS 2026-os beadvány kutatási kérdésén, majd az eredeti szerzők bírálták el az eredményt konferenciabírálóként. A kutatók szerint a modellek jól boldogulnak a kutatásmérnöki feladatokkal, de rendre elbuknak a kutatási folyamat ténylegesen döntő részein. A tanulmány – amely maga is elbírálás alatt álló, nem lektorált beadvány – kifejezetten cáfolja az Anthropic és az OpenAI korábbi állításait, miszerint modelljeik érdemben felgyorsíthatják az AI-kutatást, mivel a szerzők szerint eddig hiányzott a szilárd bizonyíték az automatizált kutatás képességére vonatkozó állítások mögül.
Miért fontos?
A kísérlet konkrét, ellenőrizhető módszerrel teszteli és cáfolja az AI-cégek autonóm kutatási képességekről szóló állításait.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 15., szombat napi AI összefoglaló része.