2026. augusztus 21., péntek · Modellek

Meta bemutatta a Muse Spark 1.2 multimodális képességeit

A Meta AI Research a nyílt súlyú kiadás előtt új értékelési eredményeket és demókat tett közzé a kódolásra fókuszáló Muse Spark 1.2 modellről, amelynek vizuális megértési és következtetési képességeit korábban már előzetesen bemutatták. A vállalat állítása szerint a modell képekből vagy videókból működő weboldalakat és játékokat tud generálni, ahol a helyesség mércéje az, hogy az eredmény megjelenik és a szándékolt módon viselkedik. Ezt egyelőre csak a Meta saját demonstrációi és értékelései támasztják alá, független megerősítés nincs. A cég szerint egy speciális modellváltozat robotvezérlőként működhet egy kétszintű rendszerben, ahol a magas szintű tervező részfeladatokra bontja a célt, ezeket pedig egy alacsony szintű Vision-Language-Action szabályzat hajtja végre.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

A bejelentés megmutatja, milyen irányba fejleszti a Meta a multimodális modelleket kódgenerálás és robotvezérlés terén, bár az állításokat egyelőre csak a vállalat saját tesztjei támasztják alá.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. augusztus 21., péntek napi AI összefoglaló része.

Kapcsolódó hírek

A Meta bemutatta a Muse Spark 1.1 kódolási modellt és a hozzá tartozó fejlesztői API-t

A Meta elérhetővé tette a Muse Spark 1.1 nevű mesterségesintelligencia-modelljét, amelyet a vállalat állítása szerint jelentős előrelépésnek szán az első generációhoz képest: fejlettebb kódolási képességeket, összetett hibák felismerését és javítását, valamint ágens-alapú munkafolyamatok támogatását ígéri. A modell natív multimodális érzékelést kínál képek, videók és dokumentumok kezelésére. Ezzel párhuzamosan a Meta nyilvános előzetes verzióban elindította a Meta Model API-t amerikai fejlesztők számára, amelyhez minden új fiók 20 dollár értékű ingyenes kreditet kap. A lépés a The Verge értékelése szerint a Meta milliárdos AI-befektetéseinek megtérülését célozza, miközben a cég az OpenAI-jal, a Google-lal és az Anthropickal igyekszik felvenni a versenyt.

Mistral bemutatta az 1 billió paraméteres Le Chonk modellt

A francia Mistral AI kedden bemutatta Mistral Large 4-et, becenevén Le Chonk-ot, egy 1 billió paraméteres multimodális modellt. A cég szerint egyelőre csak egy nyilvános, korlátozott hozzáférésű végponton érhető el, a súlyokat biztonsági tesztek után, mintegy három héten belül teszik majd szabadon elérhetővé – közölte Pierre Stock, a Mistral tudományos alelnöke. A vállalat állítása szerint a modellt kizárólag saját számítási kapacitásán, mindössze 4000 Nvidia GPU-val tanították, ami kétszer-háromszor kevesebb, mint amit a kínai versenytársak használnak. Mistral a modellt elsősorban kódolásra, kiberbiztonságra, valamint gyártási, pénzügyi és chiptervezési feladatokra optimalizálta, utóbbi a befektető ASML és Samsung profiljához is illeszkedik. A cég szeptemberben 3,3 milliárd dolláros finanszírozási kört zárt 24 milliárd dolláros értékelésen, ami minden idők legnagyobb európai techcég-tőkebevonása volt.

A Z.ai GLM 5.3 kódoló AI-modellje felkerült az Amazon Bedrockra

Az AWS hivatalos blogbejegyzése szerint a Z.ai (Zhipu AI) GLM 5.3 nevű, nyílt súlyú modellje mostantól elérhető az Amazon Bedrock teljesen menedzselt API-in keresztül, infrastruktúra-üzemeltetés nélkül. A modell egy 753 milliárd paraméteres kevert szakértői (MoE) architektúra, amelyet kódolásra és hosszú távú, ügynöki (agentic) feladatokra optimalizáltak. A Z.ai saját mérései szerint a GLM 5.2-höz képest 50 százalékos javulást ért el belső kódolási benchmarkján, a CyberGym kiberbiztonsági teszten pedig 84,5 pontos, vezető eredményt mutatott fel – ezek azonban a gyártó, nem független fél állításai. A Bedrock-integráció régiók közötti következtetést, prompt-gyorsítótárazást és OpenAI-kompatibilis API-kat kínál, de a hozzáférés egyelőre csak kiválasztott vállalati ügyfeleknek elérhető.

Reka AI kutatási előzetest adott ki a Rho-1 omnimodellből

A Reka AI kutatási előzetesként közzétette a Rho-1 nevű omnimodellt, amely a vállalat állítása szerint 19 milliárd paraméterrel egyetlen neurális hálózatban kezeli a szöveget, a képeket, a videót és a robotvezérlési parancsokat. A cég szerint a rendszer minden modalitást tokenként dolgoz fel egy közös kontextusablakban, külön eszközhívások vagy specializált modellek nélkül, és valós időben generál folyamatos videót, miközben útközben reagál új utasításokra. Ugyanazok a súlyok jelzik előre a kamera képeit, amelyek a robotmozgásokat is irányítják. A szűkös robotikai tréningadatok pótlására a Reka AI egy inverz dinamikai modellt épített, amely hétköznapi internetes videókból von ki vezérlőjeleket. A modellt 320 darab H100-as GPU-n, mintegy három hónap alatt tanították. A vállalat korábban, 2024 áprilisában mutatta be a Reka Core multimodális modellt, amely saját állítása szerint a GPT-4, a Claude 3 és a Gemini Ultra szintjén teljesített benchmarkokon.