AI-fogalom · Modellek

Emberi visszajelzésen alapuló megerősítéses tanulás (RLHF)

Nyelvi modellek finomhangolási módszere, amely emberi preferenciák alapján tanított jutalommodellel igazítja a modell válaszait az elvárt viselkedéshez.

Más néven: RLHF, Reinforcement Learning from Human Feedback, emberi visszajelzésből tanulás

Az RLHF (Reinforcement Learning from Human Feedback) olyan betanítási eljárás, amelynek során egy már előre betanított nyelvi modell viselkedését emberi értékelők visszajelzései alapján finomítják. A cél, hogy a modell ne csak nyelvtanilag helyes, hanem az emberi elvárásoknak, értékeknek és szándékoknak is megfelelő, hasznos és biztonságos válaszokat adjon.

A módszer jellemzően három lépésben zajlik. Először a modellt hagyományos módon, nagy szövegmennyiségen tanítják be. Ezután emberi értékelők több lehetséges választ hasonlítanak össze és rangsorolnak, ezekből az adatokból egy külön úgynevezett jutalommodellt (reward model) tanítanak, amely megtanulja megbecsülni, mennyire felel meg egy válasz az emberi preferenciáknak. Végül megerősítéses tanulási algoritmussal, jellemzően PPO-val, a nyelvi modellt úgy hangolják, hogy a jutalommodell által adott pontszámot maximalizálja.

Az RLHF jelentősége abban áll, hogy segít áthidalni a szakadékot a puszta szövegelőrejelzésre optimalizált modell és az emberek számára valóban hasznos, biztonságos, instrukciókövető asszisztens között. Ez a technika tette lehetővé, hogy a nagy nyelvi modellek természetes párbeszédre, kérések pontos követésére és nem kívánt vagy káros tartalmak kerülésére legyenek képesek, ezáltal kulcsszerepet játszott a mai chatbot-alapú AI-asszisztensek elterjedésében.

Az eljárásnak korlátai is vannak: az emberi értékelések szubjektívek, drágák és nehezen skálázhatók, ezért az utóbbi években megjelentek alternatív vagy kiegészítő módszerek is, mint a mesterséges intelligencia visszajelzésén alapuló tanulás (RLAIF) vagy a közvetlen preferencia-optimalizálás (DPO), amelyek egyszerűbben vagy olcsóbban próbálják elérni ugyanazt a célt.

← Vissza a fogalomtárhoz