2026. július 27., hétfő · Modellek
Anthropic Opus 5 modellje elsöprő fölénnyel vezeti az ARC-AGI-3 rangsort
Az ARC Prize mérése szerint az Anthropic Claude Opus 5 modellje 30,2 százalékot ért el az ARC-AGI-3 benchmarkon, közel négyszerese az OpenAI GPT-5.6 Sol (Max) korábbi, 7,8 százalékos csúcsának. A teszt azt vizsgálja, mennyire képes egy modell ismeretlen, játékszerű környezetekben önállóan felismerni a szabályokat és lépésről lépésre tervezni, nem pedig betanult tudásra hagyatkozni. Az ARC Prize elemzése szerint az előny valódi, erősebb logikai következtetésből fakad, és a modell öt korábban megoldatlan környezetet is megoldott, négyet emberi szint felett, miközben olyan viselkedést mutatott, mint a feladatok algebrai jelölésmódra alakítása és önálló egyenletalkotás. Az ARC-AGI-2 és ARC-AGI-1 tesztjein 90,4, illetve 97,5 százalékot ért el, ami megegyezik a korábbi csúcsokkal, bár az ARC Prize szerint valamivel magasabb költség mellett.
Miért fontos?
Egy független, elismert benchmarkon mért, ellenőrizhető ugrás jelzi a modellek önálló, ismeretlen környezetben végzett tervezési és következtetési képességének fejlődését.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. július 27., hétfő napi AI összefoglaló része.