2026. augusztus 26., szerda · Kutatás
4 bites modell verte a saját 16 bites eredetijét egy Hugging Face-kutatásban
Egy Hugging Face-kutatócsapat a Quantization-Aware Healing (QAH) módszert mutatta be egy tanulmányban, amely szerint egy GPT-OSS 120B modellből 60 milliárd paraméterre tömörített, majd MXFP4 formátumban 4 bitre kvantált változat 9 benchmarkból 7-en jobban teljesített, mint az eredeti, teljes pontosságú (bfloat16) modell. A vállalat állítása szerint ez megfordítja a szokásos viszonyt a 4 bites és a 16 bites modellek pontossága között, miközben a tömörített modell kisebb és olcsóbb futtatni. A tanulmány rámutat, hogy a bevett gyógyító eljárás, a kvantálás-tudatos tanítás (QAT) drága és instabillá válhat, ha a tanítás túl sokáig folytatódik az optimális pont után. Fontos hangsúlyozni, hogy ez egy friss, nem lektorált kutatási eredmény, amelyet a Hugging Face saját blogján tett közzé, így független megerősítésre még vár.
Miért fontos?
Ha a QAH módszer más modelleken is beválik, jelentősen csökkentheti az AI-modellek üzemeltetési költségeit anélkül, hogy pontosságot kellene feláldozni.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 26., szerda napi AI összefoglaló része; a hír kanonikus helye ott, a napi kártyán van.