2026. július 20., hétfő · Modellek

A Moonshot Kimi K3 modellje frontend kódban vezet, de matematikában messze lemarad a nyugati riválisoktól

A Moonshot AI kínai Kimi K3 modellje a Code Arena frontend kód benchmarkján 1679 pontot ért el, ezzel megelőzve a Claude Fable 5-öt (1631) és a GPT-5.6 Sol-t (1618) is – a The Decoder beszámolója szerint ez az első alkalom, hogy kínai modell végzett az élen ezen a teszten. A kép ugyanakkor vegyes: az Epoch AI adatai alapján a Kimi K3 a FrontierMath Tier 4 nehéz matematikai feladatain mindössze 39 százalékos pontosságot ért el, míg az OpenAI és az Anthropic modelljei ugyanezeken a feladatokon egyes esetekben 90 százalék körüli eredményt produkáltak. A két benchmark tehát eltérő területeken mutatja a modell erősségeit és korlátait: a frontend fejlesztésben kiemelkedő, de komplex matematikai problémáknál jelentős a lemaradása.

Miért fontos?

Először végzett kínai modell az élen egy elterjedt frontend kód benchmarkon, miközben a matematikai teszteken a szakadék még mindig nagy.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 20., hétfő napi AI összefoglaló része.

Kapcsolódó hírek

Tudósok értékelik a Kimi K3-at: fordulópontnak tartják a kínai AI-modellt

A Nature cikke szerint kutatók körében komoly visszhangot keltett a Moonshot AI múlt héten bemutatott Kimi K3 modellje. Joel Pearson, az UNSW Sydney kognitív idegtudósa szerint a modell "fordulópontot" jelent, egyesek pedig "Szputnyik-pillanatnak" nevezik. A cég saját tesztjei alapján a K3 kódolásban és táblázatkezelésben felveszi a versenyt amerikai riválisaival. A kereslet miatt a Moonshot AI három nappal a megjelenés után felfüggesztette az új regisztrációkat. Mehwish Nasim, a University of Western Australia AI-kutatója szerint a modell megjelenésének időzítése – az Anthropic Claude Fable 5 és az OpenAI GPT-5.6 debütálása után – azt jelzi, hogy Kína nemcsak élvonalbeli AI-rendszereket kíván építeni, hanem a nemzetközi AI-ökoszisztéma és szabályozás alakításában is részt akar venni.

OpenAI kiadja az Astra modellt, amely önállóan tör fel rendszereket

Az OpenAI szerint a hamarosan érkező Astra az első modellje, amely elérte a cég „kritikus kiberbiztonsági” küszöbét: emberi irányítás nélkül talál és használ ki ismeretlen szoftverhibákat, állításuk szerint hibátlan pontszámot ért el az ExploitBench teszten, egy módosított vizsgálatban pedig két zero-day sebezhetőséget is feltárt – ezt független fél nem erősítette meg. A The Information egy meg nem nevezett forrására hivatkozva azt írja, hogy az Astra a jól követhető gondolatlánc helyett egy zártabb, úgynevezett looped transformer architektúrát is használhat, ami nehezebben monitorozható, ez aggodalmat keltett biztonsági kutatóknál, köztük Ryan Greenblattnál. Az OpenAI a kiadás előtt több hetes szünetet tartott, és extra gondolatlánc-monitorozást, illetve egy „misalignment monitor” nevű szűrőt épített be.

World Labs bemutatta az Atlas 3D-világmodellt

A Fei-Fei Li társalapította World Labs bemutatta az Atlas nevű AI-modellt, amely a cég állítása szerint néhány fotóból 3D jeleneteket generál, rekonstruál és szimulál. A vállalat szerint Atlas minden bemenetet – szöveget, képet, videót és 3D-adatot – közös térbeli koordinátarendszerbe helyez, amit „térbeli kontextusnak” neveznek, így megkülönbözteti a hagyományos, síkban gondolkodó nyelvi és videódiffúziós modellektől. A cég közlése szerint a kameramozgást geometriai bemenetként kezeli, ezért a felhasználók pontos nézőpontokat és útvonalakat adhatnak meg szöveges leírás helyett, és akár egyperces, 1440p felbontású videót is generálhat. World Labs azt is állítja, hogy a modell néhány, akár egy-két képből is valósághű jelenetrekonstrukcióra képes speciális eszközök nélkül. Fontos hangsúlyozni, hogy ezek jelenleg kizárólag a fejlesztő cég saját, független ellenőrzés nélküli állításai.

Az AWS elérhetővé tette a Claude Fable 5.1 modellt

Az AWS bejelentése szerint a Claude Fable 5.1 elérhető az Amazon Bedrocken és a Claude Platform on AWS szolgáltatáson keresztül. Az Anthropic állítása szerint a modell a legnehezebb érvelési teszteken – köztük versenymatematikai és tudományos feladatokon – jobban teljesít, mint elődje, a Fable 5, és megbízhatóbb a kódolási, kutatási és vállalati munkafolyamatokban. Mivel az Anthropic „Covered Model” kategóriába sorolta, a modellre kiterjesztett adatmegőrzési (akár 30 napos), biztonsági felülvizsgálati és hozzáférési szabályok vonatkoznak. Az Anthropic emellett bemutatta az „Enterprise Frontier Safeguards” nevű megoldást, amely a vállalatnak lehetőséget ad a legfejlettebb modellek használatára úgy, hogy adataik saját felügyelt felhőinfrastruktúrájukban maradjanak. A közlemény kizárólag az AWS és az Anthropic saját állításait tartalmazza, független teljesítménymérés nem szerepel benne.