AI-fogalom · Kutatás

Gradiens csökkentés (gradient descent)

Optimalizálási eljárás, amely a hibafüggvény gradiensének irányával ellentétesen lépkedve fokozatosan csökkenti a modell hibáját.

Más néven: Gradient descent, GD, Sztochasztikus gradiens csökkentés, SGD, gradiensmódszer, legmeredekebb lejtő módszere

A gradiens csökkentés egy iteratív matematikai optimalizálási módszer, amelyet arra használnak, hogy egy függvény (jellemzően egy gépi tanulási modell hibafüggvénye vagy veszteségfüggvénye) minimumát megtalálják. A módszer lényege, hogy a függvény adott pontbeli gradiensét, vagyis a legmeredekebb emelkedés irányát kiszámítva, azzal ellentétes irányba lép, hiszen ez vezet a legmeredekebb csökkenéshez. Ezt a lépést sokszor megismételve a modell paraméterei fokozatosan olyan értékek felé mozdulnak, amelyek mellett a hiba minimális.

A gyakorlatban a lépés mérete, az úgynevezett tanulási ráta, kulcsfontosságú: túl nagy érték esetén a folyamat átugorhatja a minimumot vagy divergálhat, túl kicsi érték esetén pedig lassú lesz a konvergencia. Mivel a modern gépi tanulási modellek, például neurális hálózatok paraméterei gyakran milliós vagy milliárdos nagyságrendűek, a gradiens kiszámítása és a paraméterek frissítése hatékony algoritmusokat igényel, ezért terjedt el a sztochasztikus gradiens csökkentés és annak továbbfejlesztett változatai, amelyek a teljes adathalmaz helyett csak egy-egy kisebb adagon (mini-batch) számítják ki a gradienst, így gyorsítva a tanulást.

A gradiens csökkentés a mélytanulás és a legtöbb modern gépi tanulási módszer alapvető építőköve, hiszen ezzel tanítják be a neurális hálózatokat a visszaterjesztés (backpropagation) algoritmusával kombinálva. Jelentősége abban áll, hogy viszonylag egyszerű elvi alapon, számítási szempontból kezelhető módon teszi lehetővé komplex, sok paraméteres modellek optimalizálását, ezáltal a mai AI-rendszerek, köztük a nagy nyelvi modellek tanításának is nélkülözhetetlen eszköze.

← Vissza a fogalomtárhoz