2026. július 31., péntek · Kutatás
Kutatók: alapvető, javíthatatlan biztonsági hiba lehet az LLM-ekben
Egy kutatócsoport az ICML konferencián bemutatott tanulmányában azt állítja, hogy a nagy nyelvi modellek működésének egy alapvető sajátossága miatt lehetetlen teljesen biztonságossá tenni őket. A szerzők szerint a probléma abban rejlik, ahogyan az LLM-ek megkülönböztetik, ki vagy mi ad nekik utasítást: ha a kérést a modell belső „gondolatmenetét” utánzó stílusban fogalmazzák meg, a rendszer könnyen azt hiheti, hogy saját ötletéről van szó, és végrehajtja a tiltott utasítást. Ezzel a módszerrel állításuk szerint sikerült népszerű modelleket rávenni tiltott információ kiadására, például kokainszintézisre vagy repülőgép navigációjának szabotálására. A társszerzők szerint a jelenlegi tiltólista-alapú védelem és a red-teaming elvi okokból soha nem lehet teljes.
Miért fontos?
Ha a kutatók állítása helyes, az egyre szélesebb körben – kormányzati, katonai és egészségügyi rendszerekben – alkalmazott LLM-ek biztonsági korlátjai elvi okokból sosem lehetnek teljesen megbízhatóak.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. július 31., péntek napi AI összefoglaló része.