2026. október 7., szerda · Modellek

Mistral bemutatta az 1 billió paraméteres Le Chonk modellt

A francia Mistral AI kedden bemutatta Mistral Large 4-et, becenevén Le Chonk-ot, egy 1 billió paraméteres multimodális modellt. A cég szerint egyelőre csak egy nyilvános, korlátozott hozzáférésű végponton érhető el, a súlyokat biztonsági tesztek után, mintegy három héten belül teszik majd szabadon elérhetővé – közölte Pierre Stock, a Mistral tudományos alelnöke. A vállalat állítása szerint a modellt kizárólag saját számítási kapacitásán, mindössze 4000 Nvidia GPU-val tanították, ami kétszer-háromszor kevesebb, mint amit a kínai versenytársak használnak. Mistral a modellt elsősorban kódolásra, kiberbiztonságra, valamint gyártási, pénzügyi és chiptervezési feladatokra optimalizálta, utóbbi a befektető ASML és Samsung profiljához is illeszkedik. A cég szeptemberben 3,3 milliárd dolláros finanszírozási kört zárt 24 milliárd dolláros értékelésen, ami minden idők legnagyobb európai techcég-tőkebevonása volt.

Miért fontos?

Macron francia elnök szerint ez a modell az AI egy „harmadik útja”, miközben a Mistral azzal érvel, hogy ezzel megszűnnek az üzleti indokok a nyílt súlyú modellek elkerülésére.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. október 7., szerda napi AI összefoglaló része.

Kapcsolódó hírek

A Mistral nyílt forráskódú Leanstral 1.5 modellje 100%-ot ért el a miniF2F formális matematikai benchmarkon

A Mistral AI kiadta a Leanstral 1.5-öt, egy Apache 2.0 licencű, nyílt forráskódú modellt, amelyet a Lean 4 programozási nyelvben végzett formális verifikációra terveztek. A Mistral állítása szerint a modell 100%-os eredményt ér el a miniF2F benchmarkon, amely középiskolai szinttől matematikai olimpiai nehézségig terjedő feladatokat tartalmaz, míg a Putnam-versenyek 672 feladatából 587-et old meg. A cég szerint a modell az algebrai FATE-H és FATE-X benchmarkokon is csúcseredményeket produkál, 87, illetve 34 százalékkal. Bár elsősorban matematikai feladatokra képezték ki, a Mistral közlése alapján kódverifikációra is alkalmas: 57 nyílt forráskódú kódtár átvizsgálása során öt korábban ismeretlen hibát talált, köztük egy túlcsordulási hibát a varinteger nevű Rust könyvtárban. A modell a Hugging Face platformon és ingyenes API-n keresztül érhető el.

A Z.ai GLM 5.3 kódoló AI-modellje felkerült az Amazon Bedrockra

Az AWS hivatalos blogbejegyzése szerint a Z.ai (Zhipu AI) GLM 5.3 nevű, nyílt súlyú modellje mostantól elérhető az Amazon Bedrock teljesen menedzselt API-in keresztül, infrastruktúra-üzemeltetés nélkül. A modell egy 753 milliárd paraméteres kevert szakértői (MoE) architektúra, amelyet kódolásra és hosszú távú, ügynöki (agentic) feladatokra optimalizáltak. A Z.ai saját mérései szerint a GLM 5.2-höz képest 50 százalékos javulást ért el belső kódolási benchmarkján, a CyberGym kiberbiztonsági teszten pedig 84,5 pontos, vezető eredményt mutatott fel – ezek azonban a gyártó, nem független fél állításai. A Bedrock-integráció régiók közötti következtetést, prompt-gyorsítótárazást és OpenAI-kompatibilis API-kat kínál, de a hozzáférés egyelőre csak kiválasztott vállalati ügyfeleknek elérhető.

Reka AI kutatási előzetest adott ki a Rho-1 omnimodellből

A Reka AI kutatási előzetesként közzétette a Rho-1 nevű omnimodellt, amely a vállalat állítása szerint 19 milliárd paraméterrel egyetlen neurális hálózatban kezeli a szöveget, a képeket, a videót és a robotvezérlési parancsokat. A cég szerint a rendszer minden modalitást tokenként dolgoz fel egy közös kontextusablakban, külön eszközhívások vagy specializált modellek nélkül, és valós időben generál folyamatos videót, miközben útközben reagál új utasításokra. Ugyanazok a súlyok jelzik előre a kamera képeit, amelyek a robotmozgásokat is irányítják. A szűkös robotikai tréningadatok pótlására a Reka AI egy inverz dinamikai modellt épített, amely hétköznapi internetes videókból von ki vezérlőjeleket. A modellt 320 darab H100-as GPU-n, mintegy három hónap alatt tanították. A vállalat korábban, 2024 áprilisában mutatta be a Reka Core multimodális modellt, amely saját állítása szerint a GPT-4, a Claude 3 és a Gemini Ultra szintjén teljesített benchmarkokon.

Aleph Alpha bemutatta a Kolibri nyílt súlyú nyelvi modellt

Az Aleph Alpha német AI-vállalat kiadta a Kolibri nevű német-angol nyelvi modellt, amely 78 milliárd paraméterrel rendelkezik, ebből mixture-of-experts architektúra miatt tokenenként mintegy 3 milliárd aktív. A cég állítása szerint a Kolibri mindkét nyelven a minőség és üzemeltetési költség Pareto-frontján helyezkedik el, és felülmúlja a hasonló architektúrájú, részben jóval régebbi összehasonlító modelleket. A tanítási adatok 21,3 százaléka német nyelvű volt, ehhez a cég külön német adatfeldolgozó rendszert épített, míg a szintetikus adatok előállításához kínai modelleket is bevetettek. Az Aleph Alpha szerint a modellt elsősorban közigazgatási, légiközlekedési és ipari felhasználásra szánják, az EU AI Act szempontjait figyelembe véve, európai jog alatt fejlesztették, akár egymillió tokenes kontextusablakot is támogat, tanítása 768 darab B200 GPU-n zajlott Németországban és Finnországban. A súlyok Apache 2.0 licenc alatt elérhetők a Hugging Face platformon.