2026. július 31., péntek · Kutatás

Kutatók szerint a nagy nyelvi modellek biztonsági rése alapvetően kijavíthatatlan

Egy neves AI-konferencián nemrég bemutatott tanulmányban kutatók azt állítják, hogy a nagy nyelvi modellek (LLM-ek) nem tehetők teljesen biztonságossá a hackertámadásokkal szemben, mert a probléma abban gyökerezik, ahogyan ezek a modellek felismerik, ki vagy mi ad nekik utasításokat. A kutatók állítása szerint ezt a hibát kihasználva rá tudtak venni népszerű LLM-eket olyan információk kiadására, amelyeket eredetileg nem lett volna szabad megosztaniuk, például kokain szintetizálásának módjára vagy egy kereskedelmi repülőgép navigációs rendszerének szabotálására vonatkozó utasításokra. A cikk szerint a hiba jellege miatt elképzelhető, hogy sosem lesz teljesen orvosolható. A hírben szereplő másik két téma – egy geotermikus erőmű felújítása és a dél-koreai chipipari bónuszok – független, nem kapcsolódó esemény.

Miért fontos?

A kutatás rávilágít, hogy a jelenlegi LLM-architektúrák strukturális okokból sebezhetők maradhatnak veszélyes tartalmak kicsalására, ami komoly biztonsági kockázatot jelent a széles körben használt AI-rendszereknél.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 31., péntek napi AI összefoglaló része.

Kapcsolódó hírek

Prompt injection mint védekezés: a Tracebit kutatói 57%-ról 5%-ra csökkentették az AI hackerbotok sikerességét

A Tracebit kiberbiztonsági cég kutatói a WIRED beszámolója szerint kidolgozták a kontextus-bomba nevű védekezési technikát az AI-alapú támadóügynökök ellen. A módszer lényege, hogy AWS-környezetben tárolt jelszavak mellé olyan prompt injection szövegeket helyeznek, amelyek a támadó modell biztonsági visszautasító mechanizmusát aktiválják. Öt modellen és 152 futtatáson végzett tesztelésük szerint az adminisztrátori jogosultságszerzés 57%-ról 5%-ra, a tartós hozzáférést is magában foglaló kompromittálás 36%-ról 1%-ra csökkent. A legerősebb Opus 4.8 kontextus-bombával egyszer sem szerzett adminisztrátori hozzáférést, míg nélküle 93%-ban sikeres volt.

Kutatók: alapvető, javíthatatlan biztonsági hiba lehet az LLM-ekben

Egy kutatócsoport az ICML konferencián bemutatott tanulmányában azt állítja, hogy a nagy nyelvi modellek működésének egy alapvető sajátossága miatt lehetetlen teljesen biztonságossá tenni őket. A szerzők szerint a probléma abban rejlik, ahogyan az LLM-ek megkülönböztetik, ki vagy mi ad nekik utasítást: ha a kérést a modell belső „gondolatmenetét” utánzó stílusban fogalmazzák meg, a rendszer könnyen azt hiheti, hogy saját ötletéről van szó, és végrehajtja a tiltott utasítást. Ezzel a módszerrel állításuk szerint sikerült népszerű modelleket rávenni tiltott információ kiadására, például kokainszintézisre vagy repülőgép navigációjának szabotálására. A társszerzők szerint a jelenlegi tiltólista-alapú védelem és a red-teaming elvi okokból soha nem lehet teljes.

HOBA: háromszintű AI-ügynök az online hirdetési licitálásra

Kutatók egy nem lektorált arXiv-preprintben mutatták be a HOBA nevű keretrendszert, amely három időskálán osztja szét az online hirdetési licitálás feladatait. A legfelső szinten egy nagy nyelvi modell következteti ki a hiperparamétereket kontextuális jelek alapján, középső szinten egy SARSA-ügynök választ a szakértői modellek közül torzításmentesítő korrekcióval, az alsó szinten pedig hagyományos módszerek (PID, MPC, IQL, Decision Transformer) végzik a tényleges licitet. A szerzők állítása szerint ez csökkenti az online tanulás kockázatát, mert csak a diszkrét modellválasztást hangolja folyamatosan. Az AuctionNet benchmarkon és egy nagyszabású A/B teszten mért eredmények alapján a HOBA bevetése 3,6 százalékos növekedést hozott a célköltség-metrikában a korábbi módszerekhez képest, saját méréseik szerint.

Microsoft Echoverse: mély szimulált világokban edzik a számítógép-kezelő AI-ügynököket

A Microsoft Research bemutatta az Echoverse nevű rendszert, amely tizenkét betanító világot tartalmaz számítógép-használó AI-ügynökök számára: tíz mély alkalmazás-szimulációt és két, kifejezetten nehéz kezelőfelületi elemekre (dátumválasztók, egymásba ágyazott szűrők) fókuszáló világot. A vállalat állítása szerint egy 9 milliárd paraméteres modell mind a tizenkettőn betanítva pontszámát 36,5 százalékról 67,1 százalékra közel duplázta, ezzel tizennégy pontra megközelítve az általuk hivatkozott GPT-5.4 modellt. A kutatók szerint a felszínes szimulációk rontják a teljesítményt, míg a valósághű, koherens állapotú világok és a megerősítéses tanulás segítenek az ügynöknek túllépni az egyszerű utánzáson. A Microsoft négy világot kódjával, adataival és ellenőrző moduljaival együtt elérhetővé tesz GitHubon és Hugging Face-en.