2026. augusztus 30., vasárnap · Eszközök

FreeToken: MoE-modellek futtatása fogyasztói hardveren dinamikus CPU-GPU ütemezéssel

A Berkeley és az MIT kutatói FreeToken néven nyílt forráskódú inferenciamotort mutattak be, amely a nagy, ritka aktiválású Mixture-of-Experts modellek futtatását teszi lehetővé fogyasztói számítógépeken. A projekt szerzői között szerepel Matei Zaharia és Ion Stoica (Databricks társalapítói), valamint Song Han és Kurt Keutzer is. A cikk szerint a hagyományos megoldások a nem aktív szakértői súlyokat statikusan tárolják RAM-ban, és cache-hiba esetén leállítják a GPU-t a szinkron adatátvitel idejére. A FreeToken ezzel szemben a fejlesztők állítása szerint úgynevezett q* szabályzattal dinamikusan osztja meg a token-számítást CPU és GPU között, a súlyátvitelt pedig teljesen átfedésbe hozza a futó számítással, emellett elasztikus memóriakezelővel és úgynevezett szemantikus horgony-checkpointolással kezeli az ágensi munkafolyamatok gyakran változó kontextusát.

Miért fontos?

Ha a leírt módszer beválik, jelentősen olcsóbbá és elérhetőbbé teheti a nagy MoE-modellek futtatását adatközponti hardver nélkül, otthoni gépeken is.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. augusztus 30., vasárnap napi AI összefoglaló része.

Kapcsolódó hírek

Az Amazon SageMaker Feature Store két új API-val gyorsítja az adatkezelést

Az AWS hivatalos bejelentése szerint az Amazon SageMaker Feature Store két új API-hívást kapott. A BatchWriteRecord egyetlen hívásban akár 25 rekord írását teszi lehetővé több feature-csoportban, részleges sikeresség kezelésével és rekordonkénti élettartam-beállítással, ahelyett hogy a PutRecord-ot kellene egyesével, ismételve hívni. Az AWS szerint ez csökkenti a kapcsolat-terhelést nagy áteresztőképességű pipeline-oknál, például az általuk említett csalásfelismerő rendszerben, amely másodpercenként 10 000 rekordot kezel öt feature-csoportban. A ListRecords API lehetővé teszi a rekordazonosítók lapozott böngészését mind a Standard, mind az In-Memory tárolási szinten, ami eddig hiányzott, és adatvesztés esetén megnehezítette a helyreállítást. A bejegyzés kódpéldákkal és a szükséges IAM-jogosultságokkal mutatja be a két funkció használatát.

Anthropic hardveres szabványt épít AI-ügynökök gépirányításához

Az Anthropic egy Model Hardware Standard (MHS) nevű specifikációt fejleszt, amely a Model Context Protocol mintájára egységes felületet adna AI-ügynököknek laboratóriumi és gyári eszközök, például mikroszkópok és robotkarok eléréséhez. A cég állítása szerint eszközönként egyetlen szabványos meghajtó elég a gyártófüggő egyedi integrációk helyett, ami az összekapcsolás idejét hetekről-hónapokról órákra-percekre csökkentheti. Az Anthropic a specifikációt a HHMI Janelia kutatóintézettel közösen fejlesztette, és előbb kutatási előnézetként adja ki kiválasztott laboroknak és gyártóknak, nyílt forráskódú megjelenést később ígér. A vállalat szerint korai tesztek során az AI önállóan tudott munkafolyamatokat optimalizálni és futtatható szkripteket generálni, de még küzd a fizikai ok-okozati összefüggések megértésével, ezért emberi felügyelet marad szükséges.

Anthropic új szabványt indított: AI-ügynökök vezérelhetnek laboreszközöket

Az Anthropic bejelentette a Model Hardware Standard (MHS) kutatási előnézetét, amely egységes illesztőfelületet ad AI-ügynökök számára fizikai eszközök, például mikroszkópok, folyadékadagolók és robotkarok vezérléséhez. A vállalat állítása szerint a szabvány – amelyet a HHMI Janelia Research Campus kutatóival közösen fejlesztettek – a jelenleg hetekig-hónapokig tartó eszközintegrációt órákra vagy percekre csökkentheti, mivel az eszközök egyszerű „olvasás/írás” parancsokon keresztül kommunikálnak egymással és az AI-modellekkel. Az Ars Technica megerősíti, hogy a rendszer modellfüggetlen, Model Context Protocollal is használható, és a szabványt egyelőre csak szűk kör kapja tesztelésre, nyílt forráskódúvá tétele még nem történt meg.

NVIDIA új eszközzel egyszerűsíti a nyílt AI-modellek C++ integrálását

Az NVIDIA saját közleménye szerint elérhetővé tette a TensorRT Model Connect nevű eszközt, amely nyílt AI-modellek natív C++ alkalmazásokba történő beépítését egyszerűsíti le. A vállalat állítása szerint a folyamat két lépésre bontható: előbb egy Python parancssori eszközzel egy Hugging Face modellazonosítóból telepítési csomag épül, majd ezt egy C++ alkalmazás futásidőben betöltve futtatja, PyTorch vagy Python interpreter nélkül. Az NVIDIA szerint két API-szint áll rendelkezésre: egy feladatszintű szemantikus felület, illetve egy modulszintű, tenzor- és komponensvezérlést lehetővé tevő verzió, továbbá TVM FFI-n keresztül egyéni GPU-kernelek is beépíthetők a pipeline-ba. A cég közlése szerint a fejlesztés AI-alapú kódolóügynökökkel és éjszakai kiadásokkal zajlik, hogy lépést tartson a nyílt modellökoszisztémával.