2026. július 30., csütörtök · Kutatás
Kutatás: néhány vezető AI-modell megdöbbentően könnyen kijátszható
A FAR.AI nevű kaliforniai AI-biztonsági szervezet jelentése szerint négy vezető cég modelljeit tesztelték automatikusan generált, ártalmas kéréseket tartalmazó promptokkal, amelyek célja a biztonsági korlátok kijátszása volt. A WIRED beszámolója alapján a jelentés szerint az Elon Musk cégéhez köthető Grok modell bizonyult legsebezhetőbbnek 448 talált kijátszási móddal, a Google Gemini 249-cel, míg az Anthropic Claude és Fable, valamint az OpenAI GPT modelljei ellenálltak ezeknek a támadásoknak. A jelentés szerint a kijátszás költsége nevetségesen alacsony volt: 58 dollár a Grok, 278 dollár a Gemini esetében. A FAR.AI vezetője, Adam Gleave szerint ez az önkéntes vállalati szabályozás elégtelenségét bizonyítja, míg a Google DeepMind egyik vezetője, Rohin Shah szerint az eredmények nem tekinthetők a Gemini biztonságának teljes körű felmérésének.
Miért fontos?
A jelentés konkrét, mérhető adatokkal mutatja meg, hogy egyes elterjedt AI-modellek biztonsági korlátai olcsón és könnyen kijátszhatók, ami alátámasztja a külső szabályozás szükségességét.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. július 30., csütörtök napi AI összefoglaló része.