2026. július 13., hétfő · Kutatás

Strukturált memóriával győzték le a Slay the Spire 2-t az AI-ágensek, miután a frontier modellek rendre kudarcot vallottak

Az Alaya Lab és a Shanghai Jiao Tong University kutatói által fejlesztett AgenticSTS nevű rendszer a Slay the Spire 2 kártyajátékban ért el győzelmeket, miközben korábbi AGI-Eval teszteken egyetlen frontier modell sem tudott nyerni öt különböző beállítás egyikében sem. A kulcs a The Decoder beszámolója szerint az, hogy az ágens nem a folyamatosan növekvő csevegésnaplóból dolgozik, hanem minden döntést öt elkülönített memóriasávból épít újra: fix protokoll, állapotleírás, szabálykeresés, korábbi futások összefoglalói és szituációfüggő stratégiák. Az emberi játékosok a legkönnyebb nehézségi szinten 16 százalékos arányban nyernek a fejlesztők adatai szerint. A kutatás nem lektorált, de arra mutat rá, hogy a kontextuskezelés architektúrája fontosabb lehet, mint maga a nyelvi modell kapacitása.

Miért fontos?

A megközelítés azt mutatja, hogy a kontextusablak strukturálása radikálisan javíthatja az AI-ágensek döntéshozatalát hosszú, többlépéses feladatokban.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 13., hétfő napi AI összefoglaló része; a hír kanonikus helye ott, a napi kártyán van.

Kapcsolódó hírek

Anthropic: egyelőre nincs bizonyíték AI okozta tömeges munkahely-vesztésre

Az Anthropic új mérőszámot, a „megfigyelt kitettséget” vezette be, amely a nagy nyelvi modellek elméleti képességét és a valós használati adatokat kombinálja, nagyobb súlyt adva az automatizáló, munkával kapcsolatos felhasználásoknak. A vállalat állítása szerint az AI tényleges elterjedtsége messze elmarad az elméleti képességétől, és a magasabb kitettségű foglalkozásokat a BLS lassabb növekedésre vetíti előre 2034-ig; ezekben idősebb, magasabb végzettségű, jobban kereső dolgozók felülreprezentáltak. Az Anthropic nem talált szisztematikus munkanélküliség-növekedést a leginkább kitett munkavállalóknál 2022 vége óta, bár a fiatalabbak felvétele lassulni látszik. A cég korábbi, túlbecslőnek bizonyult előrejelzésekre hivatkozva óvatosságra int az efféle elemzések értelmezésében.

4 bites modell verte a saját 16 bites eredetijét egy Hugging Face-kutatásban

Egy Hugging Face-kutatócsapat a Quantization-Aware Healing (QAH) módszert mutatta be egy tanulmányban, amely szerint egy GPT-OSS 120B modellből 60 milliárd paraméterre tömörített, majd MXFP4 formátumban 4 bitre kvantált változat 9 benchmarkból 7-en jobban teljesített, mint az eredeti, teljes pontosságú (bfloat16) modell. A vállalat állítása szerint ez megfordítja a szokásos viszonyt a 4 bites és a 16 bites modellek pontossága között, miközben a tömörített modell kisebb és olcsóbb futtatni. A tanulmány rámutat, hogy a bevett gyógyító eljárás, a kvantálás-tudatos tanítás (QAT) drága és instabillá válhat, ha a tanítás túl sokáig folytatódik az optimális pont után. Fontos hangsúlyozni, hogy ez egy friss, nem lektorált kutatási eredmény, amelyet a Hugging Face saját blogján tett közzé, így független megerősítésre még vár.

Átfogó szakirodalmi áttekintés a terminálban működő AI-ügynökökről

Egy kutatói csoport arXiv-on közzétett, még nem lektorált szakcikke szisztematikusan összegzi a parancssori környezetben (terminálban) működő nagy nyelvi modell alapú AI-ügynökökkel kapcsolatos kutatásokat. A szerzők állítása szerint ezeket a rendszereket eddig szétszórtan tárgyalta a szoftverfejlesztési, eszközhasználati és számítógép-kezelési szakirodalom, ezért egy egységes, hét dimenziós kompetenciaprofilt javasolnak a modell, a felület, a futtatókörnyezet és a végrehajtási folyamat összekapcsolására. A cikk szerint a jelenlegi benchmarkok főleg a végeredményt mérik, míg a folyamat minőségét, a hibából való felépülést és az irányíthatóságot egyenetlenül vizsgálják. A szerzők ezért a rendszer- és futtatási körülmények részletes dokumentálását, valamint visszajátszható nyomkövetési adatok használatát javasolják az értékelések megbízhatóbbá tételéhez.

Új módszer mobilos AI-ügynökök teljesítményének és biztonságának értékelésére

Kutatók CRATE néven új, kétlépcsős értékelési keretrendszert mutattak be nyelvi utasításokkal irányított mobilalkalmazás-ügynökök automatikus minősítésére. A módszer lényege, hogy a teljes műveletsort egyben elemző korábbi megoldásokkal szemben lépésenként vizsgálja a releváns vizuális jeleket és az egyes akciók által kiváltott állapotváltozásokat, majd ezeket az eredményeket trajektóriaszinten összesíti. A szerzők állítása szerint – a cikk egy nem lektorált arXiv-preprintben jelent meg – a Qwen2.5-VL-72B-Instruct modellel futtatott CRATE 0,833-as F1-értéket ért el az AndroidWorld benchmarkon, ami 20 százalékkal jobb, mint a SPA-Bench módszeré. A biztonsági kockázatok értékelésére kiterjesztett CRATE-S változat a MobileRisk adathalmazon 0,697-es F1-értéket mutatott. A kutatók szerint az eredmények erős egyezést mutatnak a benchmarkok referenciaértékeivel, a kód nyilvánosan elérhető.