2026. július 27., hétfő · Modellek

Anthropic Opus 5 modellje elsöprő fölénnyel vezeti az ARC-AGI-3 rangsort

Az ARC Prize mérése szerint az Anthropic Claude Opus 5 modellje 30,2 százalékot ért el az ARC-AGI-3 benchmarkon, közel négyszerese az OpenAI GPT-5.6 Sol (Max) korábbi, 7,8 százalékos csúcsának. A teszt azt vizsgálja, mennyire képes egy modell ismeretlen, játékszerű környezetekben önállóan felismerni a szabályokat és lépésről lépésre tervezni, nem pedig betanult tudásra hagyatkozni. Az ARC Prize elemzése szerint az előny valódi, erősebb logikai következtetésből fakad, és a modell öt korábban megoldatlan környezetet is megoldott, négyet emberi szint felett, miközben olyan viselkedést mutatott, mint a feladatok algebrai jelölésmódra alakítása és önálló egyenletalkotás. Az ARC-AGI-2 és ARC-AGI-1 tesztjein 90,4, illetve 97,5 százalékot ért el, ami megegyezik a korábbi csúcsokkal, bár az ARC Prize szerint valamivel magasabb költség mellett.

Miért fontos?

Egy független, elismert benchmarkon mért, ellenőrizhető ugrás jelzi a modellek önálló, ismeretlen környezetben végzett tervezési és következtetési képességének fejlődését.

Benchmark-tolmács

Mit mond a hírben szereplő pontszám?

ARC-AGI-3

Ismeretlen, interaktív játékszerű környezetekben méri, hogy egy AI-ügynök képes-e felfedezni a szabályokat, alkalmazkodni és célt elérni.

Pontszám
A környezetek szintjein elért normalizált teljesítmény; magasabb jobb. A Public Demo és a Semi-Private eredmény, valamint a gondolkodási és költségkeret külön kezelendő.
Frissesség
Folyamatosan frissül
Szivárgás
Alacsony kockázat
Hétköznapi jel
Csak közvetett jel
Az öt szempont részletesen

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 27., hétfő napi AI összefoglaló része.

Kapcsolódó hírek

Meta bemutatta a Muse nevű személyes AI-ügynököt

Meta bejelentette a Muse nevű személyes AI-ügynököt, amely a vállalat állítása szerint önállóan tud feladatokat elvégezni, például e-mailt küldeni, utazást foglalni vagy vásárlást intézni a Link by Stripe fizetési rendszeren keresztül. A Muse a cég Muse Spark nevű modelljére épül, és egy dedikált Muse Secure VM nevű virtuális gépen fut, amely a felhasználó adatait is tárolja. A termék kezdetben az Egyesült Államokban érhető el iOS-en, Androidon, a muse.ai oldalon és WhatsAppon keresztül, AI-szemüvegre később kerül. A TechCrunch szerint a bevezetés alig két héttel egy 18 milliárd dolláros többállami perbeli megegyezés után történt, ami felveti a bizalom kérdését, mivel a Muse email-, naptár-, fizetési és egyéb személyes adatokhoz kér hozzáférést. A Verge megjegyzi, hogy a Muse hasonló funkciókat kínál, mint az OpenAI, az Anthropic, a Microsoft és a Google versengő ügynökei.

Meta bemutatta a Muse Voice Transcribe valós idejű hangmodellt

A Meta Superintelligence Labs kiadta a Muse Voice Transcribe nevű valós idejű hangmodellt, amely beszédfelismerést, mondathatár-felismerést és akár 20 beszélő megkülönböztetését végzi külön rendszerek nélkül, egyetlen modellben. A modell a bejövő hangot 80 milliszekundumos darabokra bontja, és szavanként dinamikusan állítja a várakozási időt: nehezebb szavaknál tovább hallgat a pontosabb eredményért, a Meta állítása szerint ezt megerősítéses tanulással érték el. A cég szerint a rendszer több mint 70 nyelvet támogat, 25-öt mélyebben teszteltek, és nyelvek közötti váltást is kezel. A Meta 0,18 dolláros óradíjat közöl, ami állítása szerint olcsóbb, mint az OpenAI vagy az ElevenLabs megoldásai. A cikk szerint a független Artificial Analysis értékelés megerősítette a Meta pontossági állításait angol nyelven, bár a teljes független validáció részletei a forrásból nem derülnek ki.

Google WeatherNext 3: fizikai szimuláció helyett élő műholdadatokból tanuló időjárás-modell

A Google Research és a DeepMind bemutatta a WeatherNext 3 nevű AI-modellt, amely a vállalat közlése szerint nem hagyományos fizikai szimulációkra épül, hanem közvetlenül valós idejű geostacionárius műholdadatokból tanul. A Google szerint az elődje, a WeatherNext 2 numerikus előrejelzési adatokon tanult, amelyek hatórás késéssel érkeztek, ami hibákat okozott a gyorsan változó csapadék- és hőmérsékleti adatoknál. Az új modell a cég állítása szerint óránként friss előrejelzést ad, akár öt kilométeres felbontásban, ötszörös élességgel, és akár 50 százalékkal pontosabb csapadék-előrejelzést kínál. A Google szerint elsősorban Latin-Amerika, Afrika és az Ázsiai-csendes-óceáni térség profitálhat, mivel ezeket eddig kevésbé szolgálták ki a drága regionális modellek. A modell a Google Search, a Térkép és a Gemini szolgáltatásokban már elérhető.

OpenAI kiadta a GPT-6 Astrát: döcögős indulás, vegyes benchmarkeredmények

Az OpenAI csütörtökön elindította GPT-6 Astra modelljét, „generációs ugrásnak” nevezve, de a bevezetés akadozott: sok fizető Plus és Pro előfizető órákig nem fért hozzá, mert a cég először vállalati ügyfeleket szolgált ki. Sam Altman elnézést kért a „kaotikus” indulásért, és napi egy visszaállítást ígért kártalanításként, amíg a hozzáférés hiányzik. Az OpenAI rendszerkártyája szerint Astra kevesebbet hallucinál elődjénél, a közvetlen prompt-injekciók 99,99 százalékát blokkolja, de tartós, többfordulós támadásokkal még mindig kb. minden harmadik alkalommal kicsikarható belőle problémás válasz, a dokumentumba rejtett indirekt injekciók sikerességi aránya pedig 27-ről 8,5 százalékra csökkent. Az Epoch AI és az Artificial Analysis mérőrendszerei ellentmondó eredményre jutottak Astra teljesítményéről, miközben az ARC-AGI-3 teszten a modell először dolgozott hatékonyabban az átlagembernél.