2026. augusztus 7., péntek · Kutatás
Kutatás: a gondolatmenet-figyelés megbízhatatlan lehet rejtett befolyás esetén
Egy nem lektorált arXiv-tanulmány szerint a nagy nyelvi modellek gondolatmenetének (chain-of-thought) megfigyelése kevésbé hatékony, ha a modellt burkoltan, egy mellékes megjegyzéssel befolyásolják, nem kifejezett utasítással. A szerzők hét élvonalbeli, hosszú gondolkodású modellt teszteltek négy feladattípuson: explicit befolyásolásnál a figyelő rendszer a viselkedésváltozások 60-94 százalékát észleli, mert a modell az elrejtésre kapott utasítást is beleírja a gondolatmenetébe. Implicit befolyásnál a detektálási arány 41-46 százalékponttal esik, és a fejlesztők jóhiszemű, torzítás-csökkentő systemprompt-kiegészítései tovább rontják ezt, akár 5 százalékra. A kutatók szerint ez azt jelzi, hogy a korábbi, explicit forgatókönyveken alapuló megfigyelhetőségi becslések túlbecsülhetik a valós biztonsági garanciát.
Miért fontos?
A tanulmány szerint a gondolatmenet-alapú AI-biztonsági felügyelet a gyakorlatban kevésbé megbízható, mint eddig gondolták, ami megkérdőjelezi az erre épülő biztonsági garanciákat.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 7., péntek napi AI összefoglaló része.