2026. szeptember 8., kedd · Eszközök

AI-ügynökök tesztelése: a demótól a termelésig

Zhou Yu, a Columbia Egyetem professzora és az Arklex AI alapítója egy InfoQ-előadásban azt állította, hogy a mai AI-ügynökök mintegy 95%-a megreked a demó fázisban, és nem jut el a valós termelési használatig. Állítása szerint ennek oka a megbízhatósági és megfelelőségi problémák, amelyeket szimulációalapú teszteléssel lehet kezelni. A bemutatott módszer szintetikus felhasználói profilokat, úgynevezett trajectory entropy metrikát és automatizált CI/CD folyamatokat alkalmaz a többfordulós, eszközhasználatot is végző párbeszéd-alapú ügynökök kiértékelésére, még a telepítés előtt felderítve a hibás eseteket. Az előadó szerint ezt a megközelítést saját kutatócsoportjában és az Arklex AI-nál alkalmazzák, célként az önmagukat tanuló munkafolyamatok skálázását nevezve meg termelési környezetben.

Miért fontos?

Az előadó gyakorlati tapasztalatból mutat be konkrét módszertant arra, hogy miért buknak el az AI-ügynökök a valós bevezetésnél, és hogyan tesztelhetők megbízhatóbban.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. szeptember 8., kedd napi AI összefoglaló része.

Kapcsolódó hírek

Adobe a Premiere-be építi a generatív AI-videóeszközöket

Az Adobe új Generative Media nevű eszközzel bővíti a Premiere Pro videószerkesztő szoftverét, amely lehetővé teszi videó, hangeffekt, zene és környezeti hang generálását közvetlenül az idővonalon, anélkül hogy a szerkesztőnek külső alkalmazásba vagy böngészőbe kellene váltania. A cég állítása szerint az eszköz felismeri a projekt kontextusát, és a hiányzó B-roll vagy hanganyag helyére illesztve teljesen szerkeszthető klipeket hoz létre. A generátorok mögött több modell is választható az idővonalról: az Adobe Firefly mellett a Google Veo, a Runway, a Luma és a Kling is elérhető. Emellett a Premiere béta AI-hangeszközöket kap, amelyek szétválasztják az egymásra beszélő hangokat és automatikusan halkítják a zenét beszéd alatt, az After Effectsbe pedig egy AI Assistant kerül, amely természetes nyelvű parancsokkal szervezi át a projekteket és javítja a technikai hibákat.

Google nyílt forráskódúvá tette a Mantis AI-sebezhetőségvizsgáló keretrendszert

A Google nyílt forráskódúként közzétette a Mantis nevű AI-ügynök keretrendszert, amely a vállalat állítása szerint automatizálja a szoftveres sebezhetőségek azonosítását, validálását, reprodukálását és javítását. A Google szerint a hagyományos AI-alapú kódvizsgálat gyakran hallucinált hibákat produkál, és a valós találatok aránya 7 százalék alatt marad, ezért a Mantis kritikus- és felülvizsgáló-ügynököket, valamint homokozó (sandbox) környezetben végzett reprodukciót kombinál a megbízhatóbb eredmény érdekében. A cég közlése szerint a rendszer a fájlokat hierarchikus fastruktúrába foglalja, ami 85 százalékkal csökkenti a tokenfelhasználást a szerkezeti kontextus megőrzése mellett. A Mantis moduláris felépítésű, több mint 15 eszközt tartalmaz, stratéga- és kutatóügynökökkel egészül ki, és több különböző AI-modell kombinálását is támogatja a különböző feldolgozási fázisokban.

Figma: AI-ügynökök gyorsítják a biztonsági riasztások kivizsgálását

A Figma mérnökcsapata saját beszámolója szerint AI-ügynököket épített biztonsági csapata számára, amelyek riasztásokat vizsgálnak ki, korábbi incidenseket keresnek vissza, rendszereket ellenőriznek, és kódjavításokat is előkészítenek. A rendszer Panther SIEM-re épül, az AWS, Okta, GitHub, GCP és osquery mellett száznál több forrást kérdez le, emellett AWS Bedrock Knowledge Bases, Amazon Kendra, Tines és Snowflake-alapú eszközöket is használ. A Figma állítása szerint ez mintegy 70 százalékkal csökkentette az összetett riasztások megoldási idejét, és 20 százalékkal kevesebb ügyeleti riasztást eredményezett. A cikk szerint a rendszer memóriája – korábbi esetek, viselkedési útmutatók, megtanult adatbázis-struktúrák – kulcsszerepet játszott, miközben emberi felülvizsgálat és beépített korlátok, például az alapból piszkozatként létrejövő kódjavaslatok, biztosítják a biztonságot.

Cenzúramentesített AI-modelleket árul kereskedelmi szolgáltatásként az Abliteration.ai

Az amerikai Abliteration.ai állítása szerint eltávolítja a betanított elutasítási mechanizmusokat nyílt súlyú modellekből, például a Z.AI GLM-5.3-ból, majd a módosított változatokhoz fizetős API-n keresztül ad hozzáférést. A cég szerint ez nem prompt-alapú kijátszás, hanem a modellsúlyok átalakítása, amely elnyomja a visszautasítást kiváltó aktivációs mintázatokat, miközben a kódolási és kiberbiztonsági képességek nagyrészt megmaradnak. A vállalat saját, nem független tesztjei szerint a módosított GLM-5.3 84,5 százalékot ért el a CyberGym benchmarkon, de más modellek egyes mérőszámokban jobban teljesítettek, és a cég maga is elismeri, hogy az összehasonlítások eltérő teszt-környezetből származnak. A szolgáltatás célja állítólag red teaming és sebezhetőség-elemzés, de a könnyű hozzáférés a visszaélés kockázatát is növelheti.