2026. augusztus 16., vasárnap · Kutatás
Evolúciós stratégiák javíthatják az LLM-ek megoldás-lefedettségét
Egy nem lektorált, arXiv-on közzétett kutatás azt állítja, hogy a nagy nyelvi modellek megerősítéses tanulással (RL) történő utótanítása szűkíti a modell kimeneti eloszlását a magas jutalmú válaszok köré, ami csökkenti az úgynevezett pass@k mutatót, vagyis a modell azon képességét, hogy sokféle helyes megoldást találjon egy adott problémára. A szerzők ehelyett evolúciós stratégiákat (ES) javasolnak: ez egy populáció-alapú, gradiens nélküli módszer, amely véletlenszerű súlytér-perturbációkkal optimalizál. A kutatók szerint az ES módszer következetesen magasabb pass@k értéket ér el, mint az RL, szélesebb kimeneti eloszlást és nagyobb megoldás-lefedettséget produkál, ami standard matematikai benchmarkokon jobb eredményekhez vezet. A tanulmány ezt olyan felfedezési feladatoknál (matematika, tudomány) tartja különösen fontosnak, ahol a diverz megoldáshalmaz kritikus.
Miért fontos?
A módszer, ha megerősítést nyer, alternatívát adhat az RL-alapú utótanításhoz olyan feladatoknál, ahol nem egy, hanem sokféle helyes megoldás megtalálása a cél.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 16., vasárnap napi AI összefoglaló része.