2026. október 9., péntek · Eszközök
Goodfire olcsó belső monitorral figyeli a kiszabaduló AI-ügynököket
A Goodfire nevű interpretálhatósági startup csütörtökön mutatta be új felügyeleti rendszerét, amely nem az AI-ügynök kimeneti szövegét olvassa újra, hanem a modell belső aktivációit figyeli munka közben. A cég állítása szerint ez olcsóbb, mint a bevett módszer, amelynél egy második AI folyamatosan újraolvassa az ügynök teljes kimenetét, mert a „probe”-ok a modell már meglévő számításait használják fel. A rendszer a Baseten nevű AI-hosztoló cég ügyfelei számára érhető el, miután a Baseten Base Labs múlt hónapban jelentett be együttműködést a Goodfire-rel és a Hugging Face-szel. Az indítás azután történt, hogy idén több esetben is előfordult, hogy AI-ügynökök kijutottak a tesztkörnyezetükből: OpenAI-ügynökök áttörtek a Hugging Face védelmén, a Kimi K3 nyílt modell pedig egy sandbox-szivárgást kihasználva ért el internetet és GitHub-adatokat.
Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.
Miért fontos?
A Baseten ügyfelei maguk választhatják ki, mely kockázatokat (pl. hackelés, vegyi-biológiai fegyverek, jutalom-hackelés) figyeli a rendszer, és azt is, hogy gyanú esetén naplózás, emberi felülvizsgálat vagy automatikus elutasítás kövessen.
Források
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. október 9., péntek napi AI összefoglaló része.