2026. augusztus 28., péntek · Eszközök

OpenAI tesztel egy „mindig futó” Codex-ügynök módot

A WIRED által megvizsgált Codex-kódbázisban felfedezett „Persistent mode” nevű beállítás szerint az ügynök a jelenlegi, perceken-órákon belül leálló módokkal szemben „alvó állapotig” futna tovább. A funkcióhoz tartozó „proaktivitás” elem alapján a rendszer a kérés megválaszolása után önállóan újabb feladatokat generálna, munkameneteken átívelve dolgozna, és a felhasználóról szerzett korábbi információk alapján döntene, akár kéretlen üzenetet is küldve. Az OpenAI szóvivője megerősítette a lapnak, hogy a funkciót tesztelik, de azonnali bevezetést nem terveznek; a cég vezetője a nyílt Codex-repót „közös játszótérnek” nevezte. A fejlesztés az OpenAI, az Anthropic és a Meta versenyébe illik a szélesebb közönséget megcélzó, önállóan dolgozó AI-ügynökök terén.

Miért fontos?

A tartósan futó, önállóan új feladatokat generáló ügynökök tesztelése azt jelzi, hogy az OpenAI a felügyelt, rövid AI-műveletek helyett a hosszabb, önálló működés felé mozdul, ami újabb felügyeleti kérdéseket vet fel.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. augusztus 28., péntek napi AI összefoglaló része.

Kapcsolódó hírek

DeepSeek megnyitotta AI-ügynök keretrendszerét, a Harnesst

A DeepSeek nyílt forráskódúvá tette a DeepSeek Harness (dsh) nevű futtatókörnyezetet, amely MIT licenc alatt, fejlesztői előzetes verzióként érhető el autonóm AI-ügynökök építéséhez. A cég bejelentése és a GitHub-tárhely szerint a rendszer a Cordis meta-keretrendszerre épül, mikrokernel-architektúrát alkalmaz, így a modellillesztők, eszközregiszterek, sandbox-környezetek és felhasználói felületek egymástól független, cserélhető modulokként működnek, és deklaratív YAML vagy JSON konfigurációval válthatók a mag logika módosítása nélkül. Egy folyamatos eseménynaplózó alrendszer minden üzenetet, eszközhívást és tokenmetrikát rögzít visszajátszás és hibakeresés céljából. A 0.1-es előzetes verzió négy alapkonfigurációt kínál: Standard, Code, Minimal és Creator módot.

NVIDIA nyílt eszközzel méri, mennyit javítanak az AI-ügynökökön a beépített skillek

Az NVIDIA saját közlése szerint nyílt forráskódú SkillEvaluator eszközt épített, amely három lépésben – statikus ellenőrzés, megkülönböztethetőségi elemzés és élő feladatvégrehajtás izolált környezetben – méri, hogy az úgynevezett verified skillek mennyit javítanak az AI-ügynökök teljesítményén. A vállalat állítása szerint több mint 300 hitelesített skillt teszteltek 30-nál több NVIDIA terméken, két ügynök-keretrendszerben, és a skillek használatával átlagosan 31 pontos javulást mértek a helyesség, felfedezhetőség, hatékonyság és eredményesség terén, a biztonsági kategóriát kihagyva pedig 39 pontosat. Az NVIDIA szerint a javulást inkább a termékdomén és az értékelési módszertan befolyásolja, mint az ügynök-keretrendszer. Az eredmények kizárólag a vállalat saját méréséből származnak, független validálásról a közlemény nem szól.

Cloudflare nyomkövetést vezet be az AI-ügynökök hibakereséséhez

A Cloudflare elindította az agent tracing funkciót, a Cloudflare Agents platform első elemét, amely egy irányítópulton gyűjti össze a telepített ügynökök munkameneteit. A vállalat szerint a cél, hogy láthatóvá váljon az az ügynöki viselkedés, amelyet a hagyományos telemetria elrejt: egy ügynök HTTP 200-as választ adhat úgy is, hogy rossz eszközt választott vagy felesleges token-pazarló ismétlésbe kezdett. Az új nyomkövetés a meglévő Workers-szintű span-eket (fetch-hívások, KV- és D1-műveletek) egészíti ki ügynökhívásokkal, modellhívásokkal, eszközfuttatással és jóváhagyási lépésekkel, modell- és tokenhasználati metaadatokkal. A dokumentáció szerint a rendszer nem méri az emberi jóváhagyásra várakozás valós idejét, csak a Worker-hívások közötti életciklus-eseményeket. A funkció bétaidőszakban ingyenes, 2026. október 1-től a Workers Observability árazás alá kerül.

Cloudflare ügynök-nyomkövetést vezet be Workers platformjára

A Cloudflare elindította az agent tracing funkciót, a Cloudflare Agents műszerfal első elemét, amely egy helyen gyűjti össze a telepített AI-ügynökök munkameneteit. A cég szerint egy ügynök HTTP 200-as választ adhat úgy is, hogy közben rossz eszközt választott vagy felesleges tokeneket égetett el egy ismétlődő ciklusban, amit a hagyományos infrastruktúra-nyomkövetés nem mutat meg. Az új rendszer az ügynökhívásokhoz, modellhívásokhoz, eszközfuttatásokhoz és jóváhagyásokhoz is spanokat rendel, így az alügynökök munkája beágyazódik a szülő-ügynök folyamatába. A dokumentáció szerint a jóváhagyási span csak a Worker-hívásokon belüli eseményeket méri, az emberi jóváhagyásra várakozás tényleges idejét nem. A funkció a béta alatt ingyenes, 2026. október 1-től a Workers Observability díjszabása alá kerül.