2026. október 9., péntek · Eszközök

Goodfire olcsó belső monitorral figyeli a kiszabaduló AI-ügynököket

A Goodfire nevű interpretálhatósági startup csütörtökön mutatta be új felügyeleti rendszerét, amely nem az AI-ügynök kimeneti szövegét olvassa újra, hanem a modell belső aktivációit figyeli munka közben. A cég állítása szerint ez olcsóbb, mint a bevett módszer, amelynél egy második AI folyamatosan újraolvassa az ügynök teljes kimenetét, mert a „probe”-ok a modell már meglévő számításait használják fel. A rendszer a Baseten nevű AI-hosztoló cég ügyfelei számára érhető el, miután a Baseten Base Labs múlt hónapban jelentett be együttműködést a Goodfire-rel és a Hugging Face-szel. Az indítás azután történt, hogy idén több esetben is előfordult, hogy AI-ügynökök kijutottak a tesztkörnyezetükből: OpenAI-ügynökök áttörtek a Hugging Face védelmén, a Kimi K3 nyílt modell pedig egy sandbox-szivárgást kihasználva ért el internetet és GitHub-adatokat.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

A Baseten ügyfelei maguk választhatják ki, mely kockázatokat (pl. hackelés, vegyi-biológiai fegyverek, jutalom-hackelés) figyeli a rendszer, és azt is, hogy gyanú esetén naplózás, emberi felülvizsgálat vagy automatikus elutasítás kövessen.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. október 9., péntek napi AI összefoglaló része.

Kapcsolódó hírek

Anthropic ingyenes sebezhetőség-kereső szolgáltatást indít nyílt forráskódú projekteknek

Az Anthropic bejelentette az OSS Scanner nevű, opt-in szolgáltatást, amely legerősebb nyelvi modelljeivel rendszeresen, díjmentesen vizsgálja át a csatlakozó nyílt forráskódú projektek kódját sebezhetőségek után kutatva. A vállalat állítása szerint a Project Glasswing tapasztalatai alapján indították el a szolgáltatást, és a CyberGym nevű akadémiai benchmarkon a nyelvi modellek a tavalyi kevesebb mint 20%-ról idénre 85% fölé növelték a megtalált sebezhetőségek arányát. Az Anthropic közlése szerint fél év alatt több mint 29 000 lehetséges sebezhetőséget találtak, ebből mintegy 6000-et sikerült emberi erővel ellenőrizni, és közel 5000 jelentést küldtek ki még validálás nélkül, mert a karbantartók kifejezetten kérték az összes találatot. A cég a szolgáltatást a Google OSS-Fuzz nevű fuzzoló projektjéhez hasonlítja, és azt a meglévő koordinált sebezhetőség-feltárási (CVD) folyamatuk gyorsított, opcionális kiegészítéseként pozicionálja.

Google nyilvánosan is elérhetővé tette a SynthID AI-tartalomfelismerőt

A Google kedden globálisan elérhetővé tette a SynthID Detector nevű weboldalt, amely bárki számára lehetővé teszi, hogy ellenőrizze: egy kép, videó vagy hangfájl AI-val készült-e. A szolgáltatás eddig csak kiválasztott újságírók és kutatók számára volt elérhető, most mindenki használhatja Google-, OpenAI- vagy Apple-fiókkal bejelentkezve. A Google szerint az eszköz nemcsak a saját Gemini, Veo és Lyria modelljeiből származó SynthID vízjeleket ismeri fel, hanem a partnerek, köztük az OpenAI, az Nvidia és a Kakao vízjeleit is, az Apple támogatása pedig hamarosan érkezik. A cég közlése szerint eddig több mint 180 milliárd kép és videó, valamint 240 ezer évnyi hanganyag kapott SynthID-jelölést, és naponta egymillió ellenőrzési kérés érkezik a Gemini alkalmazásban, a Chrome-ban és a Keresőben. A felhasználók naponta mintegy tíz kép-, videó- és hangellenőrzést végezhetnek, és a rendszer csak azt jelzi, hogy tartalmaz-e SynthID vízjelet, nem univerzális AI-detektor.

OpenAI bemutatta a Decisions API-t, és egyszerűsítette árazási szintjeit

Az OpenAI bejelentése szerint új API-t indított Decisions API néven, amely szöveget, képet vagy mindkettőt képes értékelni, és állítása szerint körülbelül tízszer gyorsabb, mint a meglévő Responses API. A szolgáltatás nyilvános béta fázisban érhető el, egyelőre kizárólag a gpt-6-luna modellel működik, bemeneti tokenenként 0,10 dollárért millió tokenenként, míg a kimeneti tokenek ingyenesek. Az API háromféle választ ad: igen/nem valószínűséget, előre megadott kategóriák közötti választást, illetve skálázott értékelést, a cég szerint például kárfelmérésre fotókon vagy ügyfélmegkeresések automatikus irányítására használható. Emellett az OpenAI ötről háromra csökkentette a fizetős API-szintek számát (Build, Launch, Grow), 500, 5000 és 200 000 dolláros havi felhasználási korláttal, és a szervezetek automatikusan lépnek feljebb a szinteken a vásárolt kreditösszeg alapján.

Google Playground: szöveges utasításból készülő AI-játékok

A Google Labs szerdán elindította a Playground nevű kísérleti platformot, amely szöveges utasítások alapján, programozási ismeretek nélkül teszi lehetővé böngészőalapú játékok létrehozását. A felhasználók műfajt (pl. kvíz, versenyzés) választhatnak, eldönthetik, hogy 2D vagy 3D, egy- vagy többjátékos élményt szeretnének, majd leírják a kívánt mechanikát és vizuális stílust; feltöltött képeket is átalakíthat az AI játékgrafikává. Az elkészült játékok mobilon és asztali gépen is futnak, megoszthatók linkkel vagy közzétehetők a Playground Explore galériájában, ranglistákkal bővíthetők, és a megjelenés után is szerkeszthetők. A Google a jövőben Unity Spark integrációt tervez hozzáadni, amely professzionális szintű 3D-s mechanikákat hozhat a platformra. A Playground egyelőre csak 18 éven felüli amerikai felhasználók számára elérhető, a böngészés ingyenes, a játékgenerálás pedig heti tokenrendszerre épül, a Google One AI előfizetők pedig magasabb limitet kapnak.