2026. július 23., csütörtök · Kutatás

Szemantikus kooperatív játékok: új módszer az ágensek hozzájárulásának mérésére többágenses LLM-rendszerekben

Kutatók egy új keretrendszert javasolnak, amely LLM-alapú többágenses rendszerekben méri az egyes ágensek hozzájárulását a végső kimenethez. A még nem lektorált tanulmány bevezeti a szemantikus Shapley-értéket (SSV) és a SLIC algoritmust, amely egyetlen futtatásból, az ágensek ismételt újrahívása nélkül építi fel a szemantikus hipergráfot és számítja ki az attribúciós értékeket. A szerzők szerint klasszikus feltételek mellett az SSV visszavezethető a hagyományos Shapley-értékre, a SLIC pedig egy orvosi benchmarkon 93,3%-kal csökkentette a számítási költséget a Monte Carlo Shapley-alapvonalhoz képest, nagyfokú konzisztencia mellett. Összetettebb munkafolyamatokban a módszer feltárhatja, hol tér el a szemantikus hozzájárulás és a hibák hatása.

Miért fontos?

A módszer lényegesen olcsóbbá és átláthatóbbá teheti a többágenses LLM-rendszerek attribúcióját, ami skálázhatósági szempontból kulcskérdés.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 23., csütörtök napi AI összefoglaló része.

Kapcsolódó hírek

RELIC: adatvédelmet megőrző, kombinálható készségek többágenses tervezéshez

A RELIC keretrendszer a többágenses tervezés egy kevéssé vizsgált problémájára kínál megoldást: hogyan fejleszthetik az ágensek saját képességeiket úgy, hogy belső megvalósításuk titkos marad. A korábbi megközelítések központi optimalizálást vagy megosztott házirendeket feltételeztek, ami adatvédelmi szempontból problémás. A még nem lektorált kutatásban bemutatott rendszerben minden ágens nagy nyelvi modell vezérelte kereséssel finomítja készségeit, míg egy megbízható vezénylő kizárólag csapatszintű teljesítmény alapján értékeli a frissítéseket. A sikeres viselkedéseket nem kódként osztják meg, hanem hordozható elvekké alakítják, amelyeket más ágensek saját felületükön alkalmazhatnak. A szerzők szerint ez szétválasztja az összehangolást a megvalósítás megosztásától.

Orvosi mesterséges intelligencia biztonságosságát torzítja az értékelő személye – hiányzó információ mellett

Egy nem lektorált kutatás négy nagy nyelvi modell (Claude Opus 4.8, GPT-5.5, Grok 4.3 és Gemini 3.5 Flash) orvosi biztonságosságát vizsgálta nyílt végű klinikai beszélgetésekben, ahol szándékosan hiányos információt kaptak a modellek. A szerzők szerint az értékelő megválasztása érdemben befolyásolja az eredményt: a négy LLM-bíró közötti egyezés csak közepes (Fleiss-kappa 0,65), és kimutatható pozitív torzítás, ha egy modellt saját szolgáltatójának bírája értékel. Az LLM-bírák ráadásul szignifikánsan engedékenyebbek voltak, mint a vakított klinikai szakértők: 66–84%-ban ismerték el a megfelelő bizonytalanságot, szemben a klinikus 52%-ával. A kutatók hangsúlyozzák, hogy a biztonsági rés nem tudáshiányból, hanem a kalibrációból ered, amit egy zárt végű MedQA-teszttel is alátámasztanak. A csoport a teljes tesztkeretrendszert, promptokat és annotációs protokollt nyilvánosan elérhetővé tette.

Szelektív tényellenőrzési keretrendszer: a rendszer tartózkodhat, ha gyenge a bizonyíték

Kutatók egy Evidence Chain Evaluation (ECE) nevű szelektív tényellenőrzési keretrendszert mutattak be egy még nem lektorált tanulmányban. A rendszer lényege, hogy az igaz/hamis döntés helyett bizonytalan verdiktet is adhat, ha a rendelkezésre álló bizonyítékok gyengék, szórványosak vagy ellentmondásosak. A módszer webes keresést, tudományos keresést és végrehajtható ellenőrzéseket kombinál, majd strukturált verdiktet ad konfidenciaértékkel és forrásszintű metaadatokkal. A szerzők szerint az ECE-Bench teszthalmazon 91,6 százalékos standard pontosságot és 97,8 százalékos szelektív pontosságot ért el, miközben 95-ből 6 esetet halasztott el – ezek többsége alacsony megbízhatóságú bizonyítéki környezetbe esett. A kutatók hangsúlyozzák, hogy a tartózkodás biztonságorientált mechanizmusként működik az episztemikusan gyenge bizonyítékok kezelésére.