2026. július 10., péntek · Kutatás

Intézményi red-teaming: a telepítési szabályok okságilag befolyásolják a multiágens AI-biztonságot

Kutatók nem lektorált tanulmányban új módszertant mutatnak be, amellyel multiágens AI-rendszerek telepítési szabályainak biztonsági hatása vizsgálható: az ágenseket és célokat rögzítve egyetlen szabályt változtatnak, majd az eltérést a szabálynak tulajdonítják. Az IABench-CA benchmarkot 228 kontextusban, öt szabállyal és hét modellpopulációval tesztelték (33 924 játszma). Eredményeik szerint egyetlen szabályváltoztatás 22–58 százalékpontos eltérést okozott a halálos kimenetelekben, miközben univerzálisan biztonságos alapbeállítás nem létezik. Az identitásalapú célzás minden populációnál szelekciós szempontból nem biztonságos; a GPT-5.1 populáción végzett anonimizálási kísérlet szerint a veszteségviselő megnevezése 22%-ról 81%-ra emelte a célzott eliminációt.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

A kutatás rámutat, hogy a multiágens AI-biztonságot nem csak a modellek, hanem a telepítési szabályok is okságilag alakítják.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 10., péntek napi AI összefoglaló része.

Kapcsolódó hírek

Többszintű ágens keretrendszer automatikusan generál nehéz teszteseteket multimodális AI-biztonsági modellek megerősítéséhez

Egy nem lektorált kutatási munka olyan automatizált, többágenses red-teaming keretrendszert mutat be, amely emberi beavatkozás nélkül képes nehéz, határeseti példákat szintetizálni multimodális nagy nyelvi modellek (MLLM-ek) tartalombiztonsági feladataihoz. A rendszer egy magas szintű tervező ágensből, egy képgenerátorból és egy többszintű LLM-értékelő bizottságból áll, amelyek iteratívan állítanak elő új hipotéziseket és mutálják a korábbi kísérleteket. A szerzők állítása szerint az így előállított adversariális példák tesztelési idejű visszakereséssel kontextusba ágyazva jelentősen javítják a célmodell robusztusságát: egy nyilvános képbiztonsági benchmarkon a hamis negatív arányt 41,2%-ról 24,5%-ra csökkentették, mindezt emberi címkézés nélkül. A megközelítés a hagyományos aktív tanulás és manuális annotáció skálázhatósági korlátait célozza meg.

Egyetlen üzenettel feltörhető volt egy teljes AWS AI-ügynök-flotta

A Zenity Labs biztonsági kutatói sebezhetőség-láncot találtak Amazon Bedrock AgentCore platformján, amelyet „AgentCorruption” néven neveztek el. A kutatók szerint elég volt egyetlen chatüzenetet küldeni egy nyilvánosan elérhető AI-ügynöknek ahhoz, hogy átvegyék az irányítást az adott AWS-fiók és régió összes AgentCore-ügynöke felett. A probléma gyökere, hogy az ügynökök nem voltak megfelelően elszigetelve, és felszólításra kiadták az AWS belső metaadat-szolgáltatásától (169.254.169.254) kapott ideiglenes hitelesítő adataikat, amelyekkel a kutatók állítása szerint forráskódhoz, jelszavakhoz, privát beszélgetésekhez és más ügynökök memóriájához is hozzáfértek. Az ellopott hitelesítő adatok a kutatók szerint saját gépükről is működtek. Az AWS részlegesen javította a hibát a metaadat-hozzáférés szigorításával és az alapértelmezett végrehajtási szerepkör korlátozásával, a Zenity emellett szigorúbb, minimális jogosultságú szerepkörök manuális beállítását javasolja a vállalatoknak.

EPOCH: bizonyítékvezérelt keresés AI-kutatási ágenseknek

Egy kutatócsoport az EPOCH nevű architektúrát mutatja be, amely AI-kutatási ágensek számára próbálja garantálni, hogy a programok, matematikai konstrukciók és bizonyítások keresése során ne keveredjenek össze a törékeny, de ígéretesnek tűnő jelöltek a valóban megbízható felfedezésekkel. A rendszer explicit feladat-szerződéseket, tipizált memóriát, aktív cáfolási mechanizmusokat, befogadási ellenőrzéseket és független visszajátszást kombinál. A fejlesztők állítása szerint – ez egy nem lektorált, arXiv-on közzétett preprint eredménye – az EPOCH az AlgoTune benchmarkon 0,65-ös átlagos normalizált pontszámot ért el a legerősebb alapmodell 0,53-as eredményével szemben, a belső Math14 tesztcsomagon pedig 0,57-es átlagpontszámot hozott, emellett tíz felfedezési feladat közül többnél konkrét, bizonyítással alátámasztott előrelépést ért el.

OpenAI 722 matematikai kéziratot tett közzé – a szakma etikai aggályokat fogalmaz meg

Az OpenAI kedden 722 kéziratot hozott nyilvánosságra, amelyek 372 eredménycsaládba rendeződnek, és algebra, elméleti számítástechnika, valamint matematikai logika területén oldanak meg régi nyitott kérdéseket. Az eredmények egy egyelőre nyilvánosságra nem hozott modellből származnak; az AGMAI elitmatematikusokból álló tanácsadó csoport közlése alapján az átlagos eredmény hozzávetőleg háromórányi ChatGPT Pro gondolkodásnak felelt meg. Az AGMAI korábban arra is felszólította az AI-laboratóriumokat, hogy ne kezeljék marketingeszközként az ilyen felfedezéseket, és hozzák nyilvánosságra a modell nevét, a promptokat és a számítási költségeket. A princetoni Institute for Advanced Study aggodalmát fejezte ki amiatt, hogy az AI olyan matematikai érveket is előállíthat, amelyeket a promptot adó ember nem képes megérteni vagy ellenőrizni; az OpenAI bejelentette, hogy együttműködik az intézettel, ám nem jelezte, hogy leállítaná jelenlegi gyakorlatát.