2026. szeptember 12., szombat · Kutatás

Preprint: a megbízhatatlan AI-verifikátorok kikezdik a nyelvi modellek megerősítéses tanulással fejlesztett érvelését

Egy nem lektorált arXiv-preprint szerint a nyelvi modellek megerősítéses tanulással történő fejlesztésének fő akadálya az úgynevezett verifikációs rés: nincs olcsó, megbízható és manipulálhatatlan jutalomforrás a formális, például programozási területeken kívüli érveléshez. A szerzők elméleti és kísérleti bizonyítékokat is bemutatnak: szintetikus programszintézis-teszteken — valódi nyelvimodell-bírák helyett az azokat helyettesítő statisztikai verifikátorokkal — a megbízhatatlan verifikátorok Soundness-under-Pressure értéke 0,94-ről 0,32-re esett vissza, ahogy az optimalizálási nyomás N=4096-ig nőtt, miközben a megbízható verifikátor folyamatosan javult, a hamisítási rés pedig 0,27-ről közel nullára csökkent, ha a jutalmat valósághoz kötött, változó jelekkel frissítették. Valós GRPO-tréning során a befagyasztott jutalommodell a teljes túloptimalizálási görbét végigfutotta, a végrehajtott jutalom 90 százalékkal esett, míg a valósághoz igazított változat hatszoros végrehajtott jutalmat őrzött meg. A szerzők ezekre alapozva javasolják a Soundness-under-Pressure metrikát új benchmark alapjaként.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

A preprint valós tréningkísérlettel mutatja be, hogy ha a megerősítéses tanulás egy befagyasztott jutalommodell ellen optimalizál, a ténylegesen elért jutalom 90 százalékkal összeomlik, ami a jelenlegi RL-alapú érvelésfejlesztési módszerek egyik kulcskockázatát jelzi.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. szeptember 12., szombat napi AI összefoglaló része.

Helyesbítés · 2026. október 2., péntek

Helyesbítés (2026-10-01): az összefoglaló korábban nem jelezte, hogy a „0,94-ről 0,32-re esett vissza” eredmény szintetikus feladatokon, valódi nyelvimodell-bírák helyett statisztikai helyettesítő verifikátorokkal született — a szerzők ezeket maguk is helyettesítőnek nevezik. A módszertani korlátot pótoltuk. Helyesbítés (2026-10-02): (1) a cím korábban „a hamis AI-bírák aláássák a nyelvi modellek érvelését” volt — a forrás megbízhatatlan (nem hamis) verifikátorokról szól, és az eredmény a megerősítéses tanulással fejlesztett érvelésre vonatkozik. (2) Az összefoglaló a 0,94-ről 0,32-re eső értéket általános teljesítményként közölte; a forrás szerint ez a Soundness-under-Pressure mérőszám, amely az optimalizálási nyomás N=4096-ig növelésével esett. (3) A „Miért fontos?” a „jutalom akár 90%-os összeomlásához” vezető okot az AI-bíráknak tulajdonította; a forrásban ez egy befagyasztott jutalommodell elleni valós tréningkísérlet eredménye.

Kapcsolódó hírek

Élő adatbázis gyűjti össze az AI-benchmarkokat

Kutatók a Benchmark Radar nevű rendszert ismertetik egy nem lektorált, arXiv-on közzétett preprintben: ez egy élő adatbázis és keresőmotor, amely LLM-ek, ügynökalapú rendszerek, kódolási, érvelési és biztonsági benchmarkok adatait gyűjti egy helyre. A rendszer 37 forrásból (13 közvetlen kapcsolón és 24 kutatási-mérnöki hírfolyamon keresztül) naponta gyűjt benchmark-cikkeket, kódtárakat és adathalmazokat. A szerzők állítása szerint a katalógus jelenleg 1283 forrásrekordot tartalmaz négy benchmark-gyűjteményből, valamint 12 916 számszerű megfigyelést 790 rekordon. A csapat webes irányítópultot, rangsorolót, telítettségi és trendnézeteket, valamint parancssori felületet is közzétett a katalógus lekérdezéséhez.

Új módszer mobilos AI-ügynökök teljesítményének és biztonságának értékelésére

Kutatók CRATE néven új, kétlépcsős értékelési keretrendszert mutattak be nyelvi utasításokkal irányított mobilalkalmazás-ügynökök automatikus minősítésére. A módszer lényege, hogy a teljes műveletsort egyben elemző korábbi megoldásokkal szemben lépésenként vizsgálja a releváns vizuális jeleket és az egyes akciók által kiváltott állapotváltozásokat, majd ezeket az eredményeket trajektóriaszinten összesíti. A szerzők állítása szerint – a cikk egy nem lektorált arXiv-preprintben jelent meg – a Qwen2.5-VL-72B-Instruct modellel futtatott CRATE 0,833-as F1-értéket ért el az AndroidWorld benchmarkon, ami 20 százalékkal jobb, mint a SPA-Bench módszeré. A biztonsági kockázatok értékelésére kiterjesztett CRATE-S változat a MobileRisk adathalmazon 0,697-es F1-értéket mutatott. A kutatók szerint az eredmények erős egyezést mutatnak a benchmarkok referenciaértékeivel, a kód nyilvánosan elérhető.

Megerősítéses tanulással tanítanak LLM-eket iteratív orvosi diagnózisra

Kutatók egy nem lektorált preprint keretében olyan rendszert mutatnak be, amely a nagy nyelvi modelleket (LLM) passzív válaszadókból aktív, bizonyítékgyűjtő diagnosztikai asszisztensekké alakítja. A megközelítés lényege, hogy az orvosi diagnózist iteratív bizonyítékkeresési feladatként formalizálják, és megerősítéses tanulást (RLVR) alkalmaznak ellenőrizhető jutalmakkal, amelyek a diagnosztikai pontosságot és a vizsgálati konzisztenciát ösztönzik. A szerzők bevezetik a RAGES nevű szimulátort, amely tudásalapú, valósághű klinikai visszajelzéseket generál a modell számára. Az empirikus eredmények szerint a rendszer képes felvenni a versenyt nagyobb és gondolkodásra optimalizált alapmodellekkel is, míg a RAGES a hagyományos LLM-eknél biológiailag plauzibilisebb klinikai válaszokat ad – legalábbis a szerzők állítása szerint.

Megerősítéses tanulás az AI-ágensek finomhangolásában: NVIDIA útmutató és új kutatási keretrendszerek

Az NVIDIA technikai blogján részletes útmutatót tett közzé arról, hogyan alkalmazható a megerősítéses tanulás (RL) – különösen a verifikálható jutalmakkal történő RL (RLVR) és a GRPO módszer – vállalati AI-ágensek domain-specifikus finomhangolására. A cég szerint a Nemotron 3 Super modellt 21 verifikáló környezetben, mintegy 1,2 millió rollout segítségével képezték, a NeMo RL ökoszisztéma pedig nyílt modellekhez kínál skálázható RL-eszközöket. Emellett két nem lektorált kutatási munka is megjelent: a HyPOLE keretrendszer formális logikával (HyperLTL) vezérli a többágenses RL-t részleges megfigyelhetőség mellett, míg egy másik tanulmány elektromos járművek flottáinak intelligens töltését vizsgálja független többágenses RL-megközelítésekkel. Mindhárom forrás azt jelzi, hogy az RL túllépett az általános modellképzésen, és egyre inkább gyakorlati, specializált feladatokban alkalmazzák.