2026. október 2., péntek · Eszközök
Olmo-core 3: nyílt tréningkeretrendszer billió paraméteres MoE-modellekhez
Az Olmo nyelvi modellcsalád fejlesztői bemutatták az Olmo-core 3 keretrendszert, amely a mixture-of-experts (MoE) architektúrájú modellek tanítását teszi hatékonyabbá és skálázhatóbbá akár billió paraméteres méretig. A fejlesztők állítása szerint egy benchmarkban a szakértői egységek számát 8-ról 128-ra növelték úgy, hogy tokenenként továbbra is csak négy szakértőt aktiváltak, így az aktív paraméterszám tokenenként nagyjából 3,2 milliárdon maradt, miközben a teljes paraméterkapacitás 4,6 milliárdról 47 milliárdra nőtt, a tanítási áteresztőképesség pedig kevesebb mint 5 százalékkal csökkent. Az infrastruktúrát a közlés szerint már egybillió paraméter feletti modelleken is tesztelték. A korábbi, FSDP-alapú megoldást egy DDP-alapú rendszer váltja, amely a szakértőket eltérően kezeli a tanítás során. A keretrendszer a korábbi OlmoE és a dense architektúrájú Olmo 3 után az első, kifejezetten nagy MoE-modellekre tervezett nyílt tréningrendszer a sorozatban.
Miért fontos?
A nyílt forráskódú Olmo-core 3 azáltal, hogy a nagy MoE-modellek tanítását olcsóbbá és kisebb klasztereken is elvégezhetővé teszi, elvben csökkentheti az akadémiai kutatók és kisebb laborok lemaradását a nagy, zárt techcégek billió paraméteres modelljeihez képest.
Források
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. október 2., péntek napi AI összefoglaló része.
Helyesbítés · 2026. október 2., péntek
Helyesbítés (2026-10-02): a címben, az összefoglalóban és a „Miért fontos?” részben „trillió paraméteres” állt. Az angol „trillion” magyarul billió (ezermilliárd), a forrás is „trillion-parameter range”-et ír; a trillió ennek milliószorosa volna.