2026. szeptember 12., szombat · Kutatás
Preprint: a megbízhatatlan AI-verifikátorok kikezdik a nyelvi modellek megerősítéses tanulással fejlesztett érvelését
Egy nem lektorált arXiv-preprint szerint a nyelvi modellek megerősítéses tanulással történő fejlesztésének fő akadálya az úgynevezett verifikációs rés: nincs olcsó, megbízható és manipulálhatatlan jutalomforrás a formális, például programozási területeken kívüli érveléshez. A szerzők elméleti és kísérleti bizonyítékokat is bemutatnak: szintetikus programszintézis-teszteken — valódi nyelvimodell-bírák helyett az azokat helyettesítő statisztikai verifikátorokkal — a megbízhatatlan verifikátorok Soundness-under-Pressure értéke 0,94-ről 0,32-re esett vissza, ahogy az optimalizálási nyomás N=4096-ig nőtt, miközben a megbízható verifikátor folyamatosan javult, a hamisítási rés pedig 0,27-ről közel nullára csökkent, ha a jutalmat valósághoz kötött, változó jelekkel frissítették. Valós GRPO-tréning során a befagyasztott jutalommodell a teljes túloptimalizálási görbét végigfutotta, a végrehajtott jutalom 90 százalékkal esett, míg a valósághoz igazított változat hatszoros végrehajtott jutalmat őrzött meg. A szerzők ezekre alapozva javasolják a Soundness-under-Pressure metrikát új benchmark alapjaként.
Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.
Miért fontos?
A preprint valós tréningkísérlettel mutatja be, hogy ha a megerősítéses tanulás egy befagyasztott jutalommodell ellen optimalizál, a ténylegesen elért jutalom 90 százalékkal összeomlik, ami a jelenlegi RL-alapú érvelésfejlesztési módszerek egyik kulcskockázatát jelzi.
Források
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. szeptember 12., szombat napi AI összefoglaló része.
Helyesbítés · 2026. október 2., péntek
Helyesbítés (2026-10-01): az összefoglaló korábban nem jelezte, hogy a „0,94-ről 0,32-re esett vissza” eredmény szintetikus feladatokon, valódi nyelvimodell-bírák helyett statisztikai helyettesítő verifikátorokkal született — a szerzők ezeket maguk is helyettesítőnek nevezik. A módszertani korlátot pótoltuk. Helyesbítés (2026-10-02): (1) a cím korábban „a hamis AI-bírák aláássák a nyelvi modellek érvelését” volt — a forrás megbízhatatlan (nem hamis) verifikátorokról szól, és az eredmény a megerősítéses tanulással fejlesztett érvelésre vonatkozik. (2) Az összefoglaló a 0,94-ről 0,32-re eső értéket általános teljesítményként közölte; a forrás szerint ez a Soundness-under-Pressure mérőszám, amely az optimalizálási nyomás N=4096-ig növelésével esett. (3) A „Miért fontos?” a „jutalom akár 90%-os összeomlásához” vezető okot az AI-bíráknak tulajdonította; a forrásban ez egy befagyasztott jutalommodell elleni valós tréningkísérlet eredménye.