AI-fogalom · Kutatás
Megerősítéses tanulás (Reinforcement Learning, RL)
Olyan gépi tanulási módszer, amelyben egy ágens próba és hiba útján, jutalmak és büntetések alapján tanulja meg az optimális viselkedést.
Más néven: Reinforcement Learning, RL, jutalom alapú tanulás, próba-hiba tanulás
A megerősítéses tanulás a gépi tanulás egyik alapparadigmája, amelyben egy úgynevezett ágens egy környezetben cselekedve tanul: minden lépés után visszajelzést kap arról, hogy a választott cselekvés jó vagy rossz irányba vitte-e a célja felé. Ez a visszajelzés egy numerikus jutalom formájában érkezik, és az ágens célja, hogy hosszú távon a lehető legtöbb jutalmat gyűjtse össze. Ellentétben a felügyelt tanulással, itt nincsenek előre megadott helyes válaszok, az ágensnek magának kell felfedeznie, mely stratégiák vezetnek eredményhez.
A módszer alapja a próba és hiba: az ágens különböző cselekvéseket kipróbál, megfigyeli a következményeket, és fokozatosan olyan szabályrendszert (policy-t) épít fel, amely megmondja, adott helyzetben mit érdemes tenni. Ehhez gyakran egyensúlyt kell találnia a felfedezés (új, kockázatos cselekvések kipróbálása) és a kiaknázás (a már bevált stratégiák követése) között. A modern megerősítéses tanulási rendszerek mélytanulási hálózatokat is használnak a bonyolult helyzetek és cselekvési lehetőségek kezelésére, ezt hívják mély megerősítéses tanulásnak.
A módszer jelentősége abban áll, hogy olyan problémákra ad megoldást, ahol nehéz vagy lehetetlen előre megmondani a helyes választ, csak a végeredmény minősége mérhető. Emellett a megerősítéses tanulás fontos szerepet játszik a nagy nyelvi modellek finomhangolásában is: az emberi visszajelzésekből tanuló módszerek (mint az RLHF) segítségével a modellek válaszai jobban igazodnak az emberi elvárásokhoz és preferenciákhoz.