Benchmark-tolmács · AI-ügynökök

ARC-AGI-3

Ismeretlen, interaktív játékszerű környezetekben méri, hogy egy AI-ügynök képes-e felfedezni a szabályokat, alkalmazkodni és célt elérni.

Más néven: ARC AGI 3, ARC-AGI-3 benchmark

Pontszám olvasata A környezetek szintjein elért normalizált teljesítmény; magasabb jobb. A Public Demo és a Semi-Private eredmény, valamint a gondolkodási és költségkeret külön kezelendő.
Frissesség Folyamatosan frissül
Adatszivárgás Alacsony kockázat
Hétköznapi jelentőség Csak közvetett jel
01

Mit mér valójában?

A pontszám mögötti képesség

Az ügynök előzetes utasítás nélkül lép be ismeretlen, körökre osztott környezetekbe. Cselekednie, a visszajelzésekből szabályt és célt felismernie, majd új szintekre alkalmaznia kell a tanult stratégiát.

A teszt az aktív felfedezést, az online alkalmazkodást, a tervezést és a korlátozott interakciós keretben végzett döntéshozatalt együttesen méri.

02

Mit nem mér?

Amit ebből a számból nem tudunk

Nem általános intelligencia-bizonyítvány, és nem méri közvetlenül az irodai automatizálást, a webböngészést, a kódolást, a kommunikációt vagy a valós világ biztonságos kezelését. A játékszerű környezetek és az emberi szoftveres munkafolyamatok között nagy az átvitel bizonytalansága.

Az eredmény erősen függ a gondolkodási kerettől, a próbálkozások számától, a költségtől és az agent köré épített vezérléstől.

03

Mennyire friss?

Folyamatosan frissül

2026-ban indult, ezért jelenleg friss frontier-mérce. Az értékelési környezetek és szabályok a verseny során bővülhetnek, így minden pontszámhoz hozzá kell tenni a dátumot, a splitet, a modellváltozatot és a gondolkodási beállítást.

Megjelenés: 2026. már. 25. Adat-időmetszet: 2026-os verseny; Public Demo és elkülönített Semi-Private értékelés

04

Lehet-e adatszivárgás?

Alacsony kockázat

A publikus demók természetesen megismerhetők, de az ellenőrzött eredmények elkülönített környezeteket és hivatalos tesztelési eljárást használhatnak. Ez mérsékli a közvetlen tanítóadat-szivárgást; a publikus és a semi-private pontszámot azonban tilos összekeverni.

05

Jelent-e bármit a hétköznapokban?

Csak közvetett jel

Jelezheti, hogy egy ügynök mennyire rugalmas új helyzetekben, ami hosszabb távon fontos a valós automatizáláshoz. A mai hétköznapi feladatok eredményességét azonban csak közvetetten jósolja; az email-, böngésző-, kód- vagy fájlkezelő agenteket saját munkafolyamaton kell mérni.

← Vissza a Benchmark-tolmácshoz