2026. augusztus 12., szerda · Modellek

Nvidia bemutatta a gyors, nyílt Nemotron 3.5 Lightning modellt

Az Nvidia kiadta a Nemotron 3.5 Lightning nevű nyílt súlyozású modellt, amely a vállalat közlése szerint 30 milliárd paraméteres Mixture-of-Experts architektúrát használ, de csak 3 milliárd paraméter aktív egyszerre, és az önműködő AI-ügynökök gyors, nagy volumenű végrehajtási feladataira optimalizálták. A modell a Nemotron 3 Nano 30B A3B utódja, megtartva a hibrid Mamba-Transformer felépítést. A független Artificial Analysis benchmarkplatform szerint a Lightning az Intelligence Indexen 24 pontot ér el, ami megegyezik az OpenAI gpt-oss-120b eredményével, negyedannyi paraméterből, és mintegy 670 token/másodperces sebességgel a mért modellek közül a leggyorsabbnak számít. Az Nvidia engedékeny licenc alatt, súlyokkal és tréningreceptekkel együtt adta ki a modellt.

Miért fontos?

Egy kisebb, nyílt modell így sebességben és bizonyos ügynöki feladatokban felveheti a versenyt nagyobb, zárt rendszerekkel, ami olcsóbbá teheti a folyamatosan futó AI-ügynökök üzemeltetését.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. augusztus 12., szerda napi AI összefoglaló része.

Kapcsolódó hírek

Nvidia ingyenes AI-modellje valós időben azonosítja, ki beszél éppen

Az Nvidia kiadta a Nemotron 3 Diarization nevű, mintegy 100 millió paraméteres modellt, amelynek súlyai szabadon elérhetők. A modell akár nyolc beszélőt is meg tud különböztetni egy beszélgetésben, és felismeri, ha többen beszélnek egyszerre; zajos vagy visszhangos környezetben, illetve több résztvevőnél a hibaarány nő. Parakeet nevű beszédfelismerővel párosítva a rendszer beszélőcímkés (pl. „speaker_2”) átiratokat készít, felvételekből és élő hangból egyaránt. A VoiceArena Diarization-Bench mérőszáma szerint a modell jelenleg az élen áll 14,72 százalékos hibaaránnyal, megelőzve a következő legjobb rendszer 19,3 százalékát; a szigorú benchmark az átfedő beszédet és a beszélőváltások apró pontatlanságait is hibaként számolja. Az elődjéhez, a Streaming Sortformerhez képest az új modell átlagosan 41 százalékkal csökkenti a hibaarányt nyolc tesztforgatókönyvben, 1,04 másodperces pufferrel mérve.

NVIDIA bemutatta az Alpamayo 2 Super önvezető AI-modellt

Az NVIDIA hivatalos bejelentése szerint az Alpamayo 2 Super egy 34 milliárd paraméteres, nyíltan elérhető vizuális-nyelvi-cselekvési modell, amely önvezető autók fejlesztését hivatott egységesíteni. A rendszer a 32 milliárd paraméteres Cosmos 3 Super Reasoner nevű okfejtő komponenst és egy 2 milliárd paraméteres, diffúzió-alapú Action Expert modult kapcsolja össze, megerősítő tanulással utótanítva. A vállalat állítása szerint akár hét kamerából 360 fokos érzékelést biztosít, és egyetlen modellből ad jövőbeli pályát, okfejtési láncot, magas szintű cselekvési predikciót, jelenet-alapú kérdésválaszolást és automatikus adatannotálást. Az NVIDIA saját méréseket közölt, amelyek szerint a modell több benchmarkon – köztük pályaelőrejelzésben és LingoQA teszten – felülmúlja a korábbi megoldásokat, ezek az adatok azonban független validálás nélkül a vállalat saját közlésén alapulnak.

NVIDIA nyílt AI-modellje kvantumszámítógépeket kalibrálna

Az NVIDIA saját blogbejegyzése szerint megjelent az Ising Calibration 1.5, egy 31 milliárd paraméteres, nyílt forráskódú vizuális-nyelvi modell, amely kvantumprocesszorok diagnosztikai kimeneteit értelmezi és javaslatot ad a hangolásukra. A vállalat állítása szerint a modell BF16 pontosságnál 11,4 százalékkal kisebb az előző verziónál, és most először NVFP4-kvantált formában is elérhető, ami egyetlen GPU-n vagy NVIDIA DGX Spark eszközön futtatható. Az NVIDIA a QCalEval nevű benchmarkon mért eredmények alapján azt közli, hogy a modell minden nyílt modellnél jobban teljesít, és felveszi a versenyt a vezető zárt rendszerekkel is. A modellt több kubitmodalitás – szupravezető kubitok, kvantumpöttyök, ionok, neutrális atomok – partneradatain tanították, és a teljes csomag, beleértve a súlyokat és az adatkészleteket, OpenMDW licenc alatt válik elérhetővé.

Google bemutatta az EmbeddingGemma 2 nyílt, könnyűsúlyú multimodális beágyazó modellt

A Google kiadta az EmbeddingGemma 2 nevű nyílt modellt, amely szöveget, képet, videót, hangot és kódot alakít numerikus vektorokká, hogy hasonló tartalmakat könnyebben lehessen keresni és összehasonlítani. A Google állítása szerint ez a legkompaktabb ilyen típusú modell a maga 740 millió paraméterével, és a multimodális beágyazási benchmarkokon felülmúlja a nála akár kétszer nagyobb versenytárs modelleket is. A modell API-kulcs nélkül, helyben futtatható: egy lekérdezés WebGPU-n keresztül böngészőben 20-70 ezredmásodpercet vesz igénybe, mindössze körülbelül 191 MB memóriát igényel, és akár hatszorosára csökkenti a helyi vektoradatbázisok tárolási igényét. Csak szöveges feladatokhoz egy 270 millió paraméteres, kisebb változat is elegendő. A Gemma 4-hez hasonló kis nyílt modellekkel párosítva offline, szerverre küldött adatok nélkül futó RAG-alkalmazások építhetők; a súlyok elérhetők a Hugging Face-en és a Kaggle-ön.