AI-fogalom · Kutatás

Tudásdesztilláció (knowledge distillation)

Eljárás, amellyel egy nagy, komplex modell tudását egy kisebb, hatékonyabb modellbe sűrítik.

Más néven: knowledge distillation, modell desztilláció, tanár-diák modell, teacher-student model

A tudásdesztilláció olyan gépi tanulási technika, amelynek során egy nagyméretű, jól teljesítő úgynevezett tanármodell tudását átadják egy jóval kisebb, egyszerűbb diákmodellnek. A cél az, hogy a diákmodell hasonló pontossággal működjön, mint a tanár, miközben lényegesen kevesebb számítási erőforrást igényel a futtatáshoz.

A módszer lényege, hogy a diákmodellt nemcsak a végleges, kemény címkékre tanítják, hanem a tanármodell kimeneti valószínűség-eloszlásaira is, amelyek gazdagabb információt hordoznak arról, hogy a tanár mennyire bizonytalan az egyes osztályok között. Ezt az eloszlást gyakran egy úgynevezett hőmérsékleti paraméterrel simítják, hogy a finomabb különbségek is jobban látszódjanak, és a diák ezekből is tanulhasson. Így a diákmodell nemcsak azt tanulja meg, mi a helyes válasz, hanem azt is, hogy a tanár milyen mintázatok és összefüggések alapján jutott el hozzá.

A tudásdesztilláció jelentősége abban áll, hogy lehetővé teszi nagy, erőforrás-igényes modellek gyakorlati alkalmazását olyan környezetekben, ahol a memória, a számítási kapacitás vagy az energiafogyasztás korlátozott, például mobileszközökön, beágyazott rendszerekben vagy valós idejű szolgáltatásokban. Emellett gyorsítja az inferenciát és csökkenti az üzemeltetési költségeket anélkül, hogy jelentősen romlana a teljesítmény.

A technikát ma széles körben alkalmazzák nagy nyelvi modellek és képfelismerő rendszerek kisebb, mobilbarát változatainak létrehozására, valamint olyan esetekben, amikor több modellt vonnak össze egyetlen kompaktabb hálózatba.

← Vissza a fogalomtárhoz