Benchmark-tolmács · AI-ügynökök
ARC-AGI-3
Ismeretlen, interaktív játékszerű környezetekben méri, hogy egy AI-ügynök képes-e felfedezni a szabályokat, alkalmazkodni és célt elérni.
Más néven: ARC AGI 3, ARC-AGI-3 benchmark
Mit mér valójában?
A pontszám mögötti képesség
Az ügynök előzetes utasítás nélkül lép be ismeretlen, körökre osztott környezetekbe. Cselekednie, a visszajelzésekből szabályt és célt felismernie, majd új szintekre alkalmaznia kell a tanult stratégiát.
A teszt az aktív felfedezést, az online alkalmazkodást, a tervezést és a korlátozott interakciós keretben végzett döntéshozatalt együttesen méri.
Mit nem mér?
Amit ebből a számból nem tudunk
Nem általános intelligencia-bizonyítvány, és nem méri közvetlenül az irodai automatizálást, a webböngészést, a kódolást, a kommunikációt vagy a valós világ biztonságos kezelését. A játékszerű környezetek és az emberi szoftveres munkafolyamatok között nagy az átvitel bizonytalansága.
Az eredmény erősen függ a gondolkodási kerettől, a próbálkozások számától, a költségtől és az agent köré épített vezérléstől.
Mennyire friss?
Folyamatosan frissül
2026-ban indult, ezért jelenleg friss frontier-mérce. Az értékelési környezetek és szabályok a verseny során bővülhetnek, így minden pontszámhoz hozzá kell tenni a dátumot, a splitet, a modellváltozatot és a gondolkodási beállítást.
Megjelenés: 2026. már. 25. Adat-időmetszet: 2026-os verseny; Public Demo és elkülönített Semi-Private értékelés
Lehet-e adatszivárgás?
Alacsony kockázat
A publikus demók természetesen megismerhetők, de az ellenőrzött eredmények elkülönített környezeteket és hivatalos tesztelési eljárást használhatnak. Ez mérsékli a közvetlen tanítóadat-szivárgást; a publikus és a semi-private pontszámot azonban tilos összekeverni.
Jelent-e bármit a hétköznapokban?
Csak közvetett jel
Jelezheti, hogy egy ügynök mennyire rugalmas új helyzetekben, ami hosszabb távon fontos a valós automatizáláshoz. A mai hétköznapi feladatok eredményességét azonban csak közvetetten jósolja; az email-, böngésző-, kód- vagy fájlkezelő agenteket saját munkafolyamaton kell mérni.