2026. október 6., kedd · Kutatás

LLM-ügynökök finomítják az emberi gondolkodás kognitív modelljeit

Kutatók új hibrid rendszert mutatnak be, amely a kognitív algoritmusok felfedezését programfinomítási feladatként kezeli: a korábban kézzel megalkotott, valószínűségi programként megfogalmazott kognitív modelleket LLM-ügynökök vizsgálják felül. Az ügynökök azonosítják, hol tér el a modell az emberi viselkedéstől, kutatói korlátok között kódszintű módosításokat javasolnak, majd ellenőrzik a strukturális hűséget, miközben egy valószínűségi következtető modul számítja ki a rejtett változókat és az adatok valószínűségét. A nem lektorált, arXiv-on közzétett tanulmány szerint a módszert egy problémamegoldási feladatban tesztelték, ahol a felülvizsgált modellek következetesen jobban illeszkedtek az emberi viselkedésre, mint az eredeti modellek, és néhány visszatérő, érdemi viselkedési változatosságot magyarázó innovációt is azonosítottak. A szerzők szerint ez a hibrid megközelítés ötvözi az emberi szakértelem interpretálhatóságát az LLM-ek rugalmasságával és skálázhatóságával.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

A módszer jelentősége, hogy a kutatói korlátok közé szorított, kódszintű módosítás megőrzi az emberi kontrollt az LLM-generálás felett, ami ellenőrizhető automatizált utat nyithat a kognitív modellépítésben.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. október 6., kedd napi AI összefoglaló része.

Kapcsolódó hírek

Új módszer gyorsítja a szerszámhasználó AI-ügynökök válaszidejét

Kutatók egy nem lektorált arXiv-preprintben mutatják be a Speculative Macro Commit (SMC) nevű futásidejű technikát, amely a szerszámhasználó nagy nyelvi modell alapú ügynökök soros végrehajtási késleltetését csökkenti. A rendszer két modellt kombinál: egy nagy, hiteles Qwen3.5-27B INT4 aktor-modellt, amely a hivatalos cselekvéssort adja, és egy gyorsabb Qwen3.5-4B spekulatív modellt, amely előre kipróbál cselekvéslánc-mintákat egy elkülönített környezet-másolaton. A szerzők állítása szerint a τ²-Bench telekommunikációs alteszten 10,23, az AppWorld teszten pedig 44,9 százalékkal csökkent a válaszidő a soros végrehajtáshoz képest, miközben a pontosság gyakorlatilag megmaradt. Az eredmények a szerzők saját méréseiből származnak, független megerősítés egyelőre nincs.

MirrorCraft: rejtett szabályváltozásokkal teszteli az AI-ügynököket Minecraftban

Egy nem lektorált arXiv-tanulmány bemutatja a MirrorCraft nevű páros benchmarkot, amely nagy nyelvi modell alapú ügynökök teljesítményét méri Minecraftban rejtett szabálymódosítások mellett. Minden Vanilla világhoz egy Mirror pár tartozik, amelyben egy datapack csak a szerveroldali szabályokat (recept, drop, egyéb mechanika) változtatja meg, a terep, a spawn, az erőforrások és a célok változatlanok maradnak. A szerzők öt biomot, hat szabálykészletet, három progressziós célt és hat ügynökkonfigurációt vizsgáltak közös Mineflayer-felületen, a hatást pedig a Rule Intervention Effect mutatóval mérték. Az eredmények szerint a rejtett szabályváltozások hatása szabálykészletenként erősen eltér, a ReAct-konfiguráció érte el a legjobb pontszámot leírás nélkül, míg a pontos szabályok megadása csak mérsékelt javulást hozott.

Kutatás: a kereskedelmi LLM-routerek nem múlják felül a véletlen választást

Hat kereskedelmi LLM-router tesztje 14 beállításban, nyolc feladatkategóriát lefedő benchmarkon azt mutatja, hogy egyikük sem múlja felül azt a módszert, amely két gondosan kiválasztott modell közül azonos költség mellett véletlenszerűen választ – áll egy nem lektorált kutatási anyagban (preprint). Némelyik router emellett több mint 10 százalékponttal gyengébben is teljesített, mint e kétmodelles véletlen alapvonal. A szerzők ezt négy visszatérő mintázatra vezetik vissza: a nehézség figyelmen kívül hagyására, a hosszúság szerinti téves rangsorolásra, a szemantikai illesztésre és a modellkészlet nem optimális összeállítására. A tanulmány egy alternatív értékelési módszert és egy egyszerű kétmodelles routert is javasol, amely elkerüli e négy hibát, ám a javulás a véletlenszerű routinghoz képest csekély marad, mert egy jól megválasztott modellpáros már eleve keveset enged javítani.

NASA és IBM nyílt forráskódú alapmodellt épített a Hold kutatására

A NASA és az IBM Research, egyetemi partnerekkel együttműködve, kiadta a NASA-IBM Lunar Foundation Modelt, amelyet a két szervezet az első nyílt forráskódú alapmodellek egyikeként mutat be a holdkutatás számára. A modellt a SomBench nevű adathalmazon tanították be a semmiből, amely a vállalatok állítása szerint a valaha összeállított legnagyobb, egymáshoz illesztett, többmodalitású holdi adatgyűjtemény. A legtöbb adat a Lunar Reconnaissance Orbiter 17 éves megfigyeléseiből származik, kiegészítve a GRAIL, a Lunar Prospector és a japán Kaguya/SELENE szonda méréseivel. A fejlesztők szerint a modell különösen jól teljesít a sarki jégkészletek előrejelzésében és a kráterek felismerésében, mivel címkézett adat kevés, de nyers megfigyelés bőven áll rendelkezésre.