2026. július 26., vasárnap · Modellek
Anthropic szerint az Opus 5 gyakorlatilag védett a prompt injection ellen
Az Anthropic saját rendszerkártyája szerint az Opus 5 modell böngészőügynökként futtatva 129 tesztforgatókönyv mindegyikében kivédte a prompt injection típusú támadásokat, azaz nulla százalékos sikerarányt mértek. Ez a nulla százalék csak akkor érvényes, ha az Auto Mode nevű kettős védelmi réteg is aktív: az egyik szűrő a bejövő adatokban keres rejtett utasításokat, a másik pedig a veszélyes műveleteket blokkolja végrehajtás előtt. Auto Mode nélkül az Opus 5 sikerrátája 3,7 százalék, míg a kisebb Sonnet 5 modellé 0,93 százalék. A Gray Swan biztonsági cég független tesztje szerint az általános prompt injection sikeraránya 15 kísérlet után 5,5 százalékról (Opus 4.8) 2,0 százalékra csökkent az új modellnél. Az OpenAI decemberben elismerte, hogy a prompt injection problémáját talán soha nem lehet teljesen megoldani, ami rávilágít az Anthropic állításának tétjére.
Miért fontos?
A prompt injection az AI-ügynökök egyik legsúlyosabb biztonsági kockázata, így egy gyártói mérés szerinti drasztikus javulás fontos, de független megerősítésre szoruló fejlemény.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. július 26., vasárnap napi AI összefoglaló része.