2026. október 9., péntek · Modellek

Nemotron modellcsalád arany szintet ért el IOI-n és IMO-n

Az NVIDIA Nemotron fejlesztői blogbejegyzése szerint a Nemotron 3 alapmodellből finomhangolt specialista rendszerek arany-szintű eredményt értek el mind a 2026-os Informatikai Diákolimpián (IOI), mind a 2026-os Nemzetközi Matematikai Diákolimpián (IMO). A csapat felügyelt finomhangolást (SFT), megerősítéses tanulást (RL) és egy iteratív, generáló-értékelő-javító visszacsatolási hurkot (GenCorrect) kombinált. Az IOI-eredmény egy élő, előretekintő futtatásból származik, amely az emberi versenyzőkével azonos idő-, internet- és beküldési korlátok mellett zajlott, de nem hivatalos, felügyelet nélküli benchmarkként, nem szerepelt a hivatalos IOI-ranglistán. Az IMO-proofokat ezzel szemben hivatalos IMO-bírálók pontozták. A vállalati állítás szerint a Nano-CC (30 milliárd össz-, 3 milliárd aktív paraméter) és az Ultra-CC (550 milliárd össz-, 55 milliárd aktív paraméter) modellek 22 ezer kurált feladaton és szintetikus gondolatmeneten tanultak.

Egy forrás Ehhez a hírhez egy forráslink áll rendelkezésre.

Miért fontos?

A GenCorrect nevű generáló-értékelő-javító visszacsatolási hurok önmagában 177 pontot adott a Nano modellnek (291-ről 468-ra) a 438,3-as aranyküszöb átlépéséhez, ami azt mutatja, hogy az inferencia-idejű eljárás legalább akkora hatású lehet, mint maga a tanítás.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. október 9., péntek napi AI összefoglaló része.

Kapcsolódó hírek

Cloudflare nyílt döntési modelleket adott ki AI-ügynökökhöz

Cloudflare a „Birthday Week” rendezvényén bejelentette a Clef nevű nyílt súlyú modellcsaládot, amely 9B és 27B paraméteres változatban érhető el, és nem szöveget generál, hanem előre definiált, típusos kérdésekre ad valószínűségi alapú döntéseket egyetlen előrefuttatásban. A cég saját mérései szerint a kisebb, Clef-Flash (9B) modell médián válaszideje 38,8 ezredmásodperc, míg a 27B-s Clef modellé 209,3 ezredmásodperc. Cloudflare állítása szerint az API kompatibilis a Typesafe AI Jev System One modelljével, ugyanakkor a Clef vizuális bemeneteket (kép, videó) is képes osztályozni, és 64k kontextusablakkal rendelkezik a Jev 32k-jával szemben. A Hacker News közösségében vita bontakozott ki arról, hogy ez valóban új modellkategória-e, vagy csak egy régóta ismert megközelítés újracsomagolása.

Google bemutatta az EmbeddingGemma 2 nyílt, könnyűsúlyú multimodális beágyazó modellt

A Google kiadta az EmbeddingGemma 2 nevű nyílt modellt, amely szöveget, képet, videót, hangot és kódot alakít numerikus vektorokká, hogy hasonló tartalmakat könnyebben lehessen keresni és összehasonlítani. A Google állítása szerint ez a legkompaktabb ilyen típusú modell a maga 740 millió paraméterével, és a multimodális beágyazási benchmarkokon felülmúlja a nála akár kétszer nagyobb versenytárs modelleket is. A modell API-kulcs nélkül, helyben futtatható: egy lekérdezés WebGPU-n keresztül böngészőben 20-70 ezredmásodpercet vesz igénybe, mindössze körülbelül 191 MB memóriát igényel, és akár hatszorosára csökkenti a helyi vektoradatbázisok tárolási igényét. Csak szöveges feladatokhoz egy 270 millió paraméteres, kisebb változat is elegendő. A Gemma 4-hez hasonló kis nyílt modellekkel párosítva offline, szerverre küldött adatok nélkül futó RAG-alkalmazások építhetők; a súlyok elérhetők a Hugging Face-en és a Kaggle-ön.

Elérhető az Anthropic Claude Haiku 5.5 modellje az AWS-en

Az AWS bejelentette, hogy a Claude Haiku 5.5 mostantól elérhető az Amazon Bedrocköz és a Claude Platformon keresztül is. Az Anthropic állítása szerint ez a Claude 5.5 család leggyorsabb és leghatékonyabb tagja, amelyet kifejezetten subagentekhez és nagy volumenű, költségérzékeny feladatokhoz fejlesztettek, és a legtöbb feladatnál mintegy 75 százalékkal olcsóbb, mint a Claude Haiku 4.5. A modell az első Haiku, amely úgynevezett effort control funkciót kapott, így feladatonként állítható a költség és a képesség aránya. A Bedrocköz kapcsolódva a vállalati adatok az AWS infrastruktúráján belül maradnak, és a megszokott AWS-eszközök (IAM, CloudTrail, CloudWatch, Bedrock Guardrails) is használhatók mellette. A gyártó szerint a modell jól teljesít kódolási, eszközhasználati és agentikus feladatokban, valamint ismétlődő böngésző- és asztali műveleteknél is.

Mistral Large 4: billió paraméteres, Európában épített AI-modell kiberbiztonsági éllel

A Mistral AI nyilvános előnézetben elérhetővé tette a Mistral Large 4-et (ML4), egy billió paraméteres, natívan multimodális modellt, amelyet a cég saját európai adatközpontjaiban, 3800 NVIDIA Grace Blackwell GPU-n tanított; a teljes súlyokat október végén adják ki. A Mistral állítása szerint ML4 a legjobb nyílt súlyozású modell az USA-ból vagy Európából, és élen jár kiberbiztonsági, pénzügyi és jogi feladatokban, mert sebezhetőségeket is reprodukál és javít, amit a versenytársak biztonsági szűrői gyakran megtagadnak. A független Artificial Analysis Intelligence Index szerint ML4 38 pontot ért el, ami jelentős ugrás a Mistral Large 3 9 és a Mistral Medium 3.5 14 pontjához képest, de így is messze elmarad a piacvezető Claude Opus 5.5 (Max) 58 pontjától. A teljes súlyok megjelenéséig a cég kiberbiztonsági szakértőkkel, ellenőrzött partnerekkel és állami szervekkel teszteli a modell csökkentett moderációjú, bővített kiberképességű változatát.