2026. július 20., hétfő · Modellek
A Moonshot Kimi K3 modellje frontend kódban vezet, de matematikában messze lemarad a nyugati riválisoktól
A Moonshot AI kínai Kimi K3 modellje a Code Arena frontend kód benchmarkján 1679 pontot ért el, ezzel megelőzve a Claude Fable 5-öt (1631) és a GPT-5.6 Sol-t (1618) is – a The Decoder beszámolója szerint ez az első alkalom, hogy kínai modell végzett az élen ezen a teszten. A kép ugyanakkor vegyes: az Epoch AI adatai alapján a Kimi K3 a FrontierMath Tier 4 nehéz matematikai feladatain mindössze 39 százalékos pontosságot ért el, míg az OpenAI és az Anthropic modelljei ugyanezeken a feladatokon egyes esetekben 90 százalék körüli eredményt produkáltak. A két benchmark tehát eltérő területeken mutatja a modell erősségeit és korlátait: a frontend fejlesztésben kiemelkedő, de komplex matematikai problémáknál jelentős a lemaradása.
Miért fontos?
Először végzett kínai modell az élen egy elterjedt frontend kód benchmarkon, miközben a matematikai teszteken a szakadék még mindig nagy.
Források
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. július 20., hétfő napi AI összefoglaló része.