2026. július 7., kedd · Modellek

A Tencent kiadta a Hy3 nyílt forráskódú MI-modellt, amely állítása szerint ötször nagyobb modellekkel is felveszi a versenyt

A Tencent hivatalosan kiadta Hy3 nevű MI-modelljét, amely Mixture-of-Experts (MoE) architektúrát használ: összesen 295 milliárd paraméterrel rendelkezik, de egyszerre csak 21 milliárd aktív, kiegészítve egy 3,8 milliárd paraméteres MTP réteggel, és akár 256 000 token hosszú kontextust is képes kezelni. A Tencent állítása szerint a modell a nálánál két-ötször nagyobb modellek teljesítményét éri el, míg 270 szakértő vak értékelésében 2,67-es pontot kapott a 4-ből, felülmúlva a GLM-5.1-et (2,51). A cég belső tesztjei alapján a hallucinációs arány 12,5 százalékról 5,4 százalékra csökkent. A modell Apache 2.0 licenc alatt érhető el a Hugging Face-en, a ModelScope-on és a GitHubon, FP8-kvantált változatban is, és a Tencent már integrálta saját termékeibe, köztük a WeChat-be és a Yuanbao platformba.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

Egy nagy technológiai cég nyílt licenccel adott ki olyan MoE-modellt, amely alacsony aktív paraméterszámmal kíván versenyezni a jóval nagyobb modellekkel.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 7., kedd napi AI összefoglaló része.

Kapcsolódó hírek

Hunyuan-A13B: nyílt forráskódú MoE-modell 13 milliárd aktív paraméterrel

A Hunyuan-A13B egy Mixture-of-Experts architektúrájú, nyílt forráskódú nagy nyelvi modell, amelynek technikai jelentését a fejlesztők arXiv-preprintként tették közzé, tehát az eredmények egyelőre nem estek át független szakmai lektoráláson. A modell összesen 80 milliárd paramétert tartalmaz, de következtetéskor csak 13 milliárdat aktivál, ami a fejlesztők szerint egyensúlyt teremt a képességek, a számítási hatékonyság és az üzemeltetési költség között. A tanítás egy 20 billió tokenes, szigorúan szűrt korpuszon történt, kiemelt STEM-adatokkal, majd felügyelt finomhangolás és nagyszabású megerősítéses tanulás egészítette ki. A modell kettős, gyors és lassú gondolkodási módot kínáló láncolt következtetési (Chain-of-Thought) keretrendszert alkalmaz, amely a feladat bonyolultságához igazítja a következtetés mélységét. A fejlesztők állítása szerint a modell matematikai, tudományos, programozási és ágensfeladatokban is versenyképes, gyakran jóval nagyobb modellek teljesítményét közelítve.

Mistral bemutatta az 1 billió paraméteres Le Chonk modellt

A francia Mistral AI kedden bemutatta Mistral Large 4-et, becenevén Le Chonk-ot, egy 1 billió paraméteres multimodális modellt. A cég szerint egyelőre csak egy nyilvános, korlátozott hozzáférésű végponton érhető el, a súlyokat biztonsági tesztek után, mintegy három héten belül teszik majd szabadon elérhetővé – közölte Pierre Stock, a Mistral tudományos alelnöke. A vállalat állítása szerint a modellt kizárólag saját számítási kapacitásán, mindössze 4000 Nvidia GPU-val tanították, ami kétszer-háromszor kevesebb, mint amit a kínai versenytársak használnak. Mistral a modellt elsősorban kódolásra, kiberbiztonságra, valamint gyártási, pénzügyi és chiptervezési feladatokra optimalizálta, utóbbi a befektető ASML és Samsung profiljához is illeszkedik. A cég szeptemberben 3,3 milliárd dolláros finanszírozási kört zárt 24 milliárd dolláros értékelésen, ami minden idők legnagyobb európai techcég-tőkebevonása volt.

A Z.ai GLM 5.3 kódoló AI-modellje felkerült az Amazon Bedrockra

Az AWS hivatalos blogbejegyzése szerint a Z.ai (Zhipu AI) GLM 5.3 nevű, nyílt súlyú modellje mostantól elérhető az Amazon Bedrock teljesen menedzselt API-in keresztül, infrastruktúra-üzemeltetés nélkül. A modell egy 753 milliárd paraméteres kevert szakértői (MoE) architektúra, amelyet kódolásra és hosszú távú, ügynöki (agentic) feladatokra optimalizáltak. A Z.ai saját mérései szerint a GLM 5.2-höz képest 50 százalékos javulást ért el belső kódolási benchmarkján, a CyberGym kiberbiztonsági teszten pedig 84,5 pontos, vezető eredményt mutatott fel – ezek azonban a gyártó, nem független fél állításai. A Bedrock-integráció régiók közötti következtetést, prompt-gyorsítótárazást és OpenAI-kompatibilis API-kat kínál, de a hozzáférés egyelőre csak kiválasztott vállalati ügyfeleknek elérhető.

Reka AI kutatási előzetest adott ki a Rho-1 omnimodellből

A Reka AI kutatási előzetesként közzétette a Rho-1 nevű omnimodellt, amely a vállalat állítása szerint 19 milliárd paraméterrel egyetlen neurális hálózatban kezeli a szöveget, a képeket, a videót és a robotvezérlési parancsokat. A cég szerint a rendszer minden modalitást tokenként dolgoz fel egy közös kontextusablakban, külön eszközhívások vagy specializált modellek nélkül, és valós időben generál folyamatos videót, miközben útközben reagál új utasításokra. Ugyanazok a súlyok jelzik előre a kamera képeit, amelyek a robotmozgásokat is irányítják. A szűkös robotikai tréningadatok pótlására a Reka AI egy inverz dinamikai modellt épített, amely hétköznapi internetes videókból von ki vezérlőjeleket. A modellt 320 darab H100-as GPU-n, mintegy három hónap alatt tanították. A vállalat korábban, 2024 áprilisában mutatta be a Reka Core multimodális modellt, amely saját állítása szerint a GPT-4, a Claude 3 és a Gemini Ultra szintjén teljesített benchmarkokon.