2026. augusztus 30., vasárnap · Eszközök
FreeToken: MoE-modellek futtatása fogyasztói hardveren dinamikus CPU-GPU ütemezéssel
A Berkeley és az MIT kutatói FreeToken néven nyílt forráskódú inferenciamotort mutattak be, amely a nagy, ritka aktiválású Mixture-of-Experts modellek futtatását teszi lehetővé fogyasztói számítógépeken. A projekt szerzői között szerepel Matei Zaharia és Ion Stoica (Databricks társalapítói), valamint Song Han és Kurt Keutzer is. A cikk szerint a hagyományos megoldások a nem aktív szakértői súlyokat statikusan tárolják RAM-ban, és cache-hiba esetén leállítják a GPU-t a szinkron adatátvitel idejére. A FreeToken ezzel szemben a fejlesztők állítása szerint úgynevezett q* szabályzattal dinamikusan osztja meg a token-számítást CPU és GPU között, a súlyátvitelt pedig teljesen átfedésbe hozza a futó számítással, emellett elasztikus memóriakezelővel és úgynevezett szemantikus horgony-checkpointolással kezeli az ágensi munkafolyamatok gyakran változó kontextusát.
Miért fontos?
Ha a leírt módszer beválik, jelentősen olcsóbbá és elérhetőbbé teheti a nagy MoE-modellek futtatását adatközponti hardver nélkül, otthoni gépeken is.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 30., vasárnap napi AI összefoglaló része.