AI-fogalom · Kutatás
Kvantálás (Quantization)
Neurális hálók számainak alacsonyabb pontosságú (pl. 8 vagy 4 bites) ábrázolására való átalakítása a memória- és számításigény csökkentésére.
Más néven: Quantization, modellkvantálás, súlykvantálás, INT8 kvantálás, 4-bites kvantálás, post-training quantization
A kvantálás egy olyan optimalizálási technika, amely egy neurális hálózat súlyait és/vagy aktivációit a szokásos 32 vagy 16 bites lebegőpontos számábrázolásról alacsonyabb pontosságú, jellemzően 8 vagy akár 4 bites egész vagy speciális formátumú számokra alakítja át. A cél, hogy a modell kevesebb memóriát foglaljon, gyorsabban fusson, és kevesebb energiát fogyasszon, miközben a pontossága csak minimálisan romlik.
A módszer lényege, hogy a modell paramétereinek értéktartományát leképezik egy szűkebb, diszkrét skálára, majd ezt a leképezést a futtatás során visszafejtik. Ez történhet a betanítás után (post-training quantization), amikor egy már kész modellt alakítanak át, vagy a betanítás közben (quantization-aware training), amikor a hálózat már a kvantálás okozta pontatlansághoz igazodva tanul, így kisebb a teljesítményveszteség. A kvantálás mértéke és módszere (pl. egyenletes vagy nem egyenletes skálázás, csoportonkénti kalibráció) jelentősen befolyásolja, mennyire marad meg a modell eredeti pontossága.
A technika különösen fontos a nagy nyelvi modellek és más mély hálózatok gyakorlati bevetésénél, mivel lehetővé teszi, hogy erőforrás-korlátozott eszközökön, például mobiltelefonokon, beágyazott rendszereken vagy akár egyetlen fogyasztói videokártyán is fussanak olyan modellek, amelyek eredetileg csak nagy szerverfarmokon lettek volna futtathatók. A kvantálás így kulcsszerepet játszik az AI-modellek szélesebb körű, olcsóbb és energiahatékonyabb elterjesztésében, anélkül hogy a felhasználói élmény érdemben romlana.