2026. szeptember 28., hétfő · Modellek

Nvidia ingyenes AI-modellje valós időben azonosítja, ki beszél éppen

Az Nvidia kiadta a Nemotron 3 Diarization nevű, mintegy 100 millió paraméteres modellt, amelynek súlyai szabadon elérhetők. A modell akár nyolc beszélőt is meg tud különböztetni egy beszélgetésben, és felismeri, ha többen beszélnek egyszerre; zajos vagy visszhangos környezetben, illetve több résztvevőnél a hibaarány nő. Parakeet nevű beszédfelismerővel párosítva a rendszer beszélőcímkés (pl. „speaker_2”) átiratokat készít, felvételekből és élő hangból egyaránt. A VoiceArena Diarization-Bench mérőszáma szerint a modell jelenleg az élen áll 14,72 százalékos hibaaránnyal, megelőzve a következő legjobb rendszer 19,3 százalékát; a szigorú benchmark az átfedő beszédet és a beszélőváltások apró pontatlanságait is hibaként számolja. Az elődjéhez, a Streaming Sortformerhez képest az új modell átlagosan 41 százalékkal csökkenti a hibaarányt nyolc tesztforgatókönyvben, 1,04 másodperces pufferrel mérve.

Miért fontos?

Az ingyenesen elérhető, nyolc beszélőt kezelő Nemotron 3 Diarization a Parakeet beszédfelismerővel kombinálva olyan nyílt, beszélő-azonosításra épülő átiratkészítést tehet elérhetővé fejlesztők számára, amihez eddig fizetős szolgáltatás kellett.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. szeptember 28., hétfő napi AI összefoglaló része.

Kapcsolódó hírek

Nvidia bemutatta a gyors, nyílt Nemotron 3.5 Lightning modellt

Az Nvidia kiadta a Nemotron 3.5 Lightning nevű nyílt súlyozású modellt, amely a vállalat közlése szerint 30 milliárd paraméteres Mixture-of-Experts architektúrát használ, de csak 3 milliárd paraméter aktív egyszerre, és az önműködő AI-ügynökök gyors, nagy volumenű végrehajtási feladataira optimalizálták. A modell a Nemotron 3 Nano 30B A3B utódja, megtartva a hibrid Mamba-Transformer felépítést. A független Artificial Analysis benchmarkplatform szerint a Lightning az Intelligence Indexen 24 pontot ér el, ami megegyezik az OpenAI gpt-oss-120b eredményével, negyedannyi paraméterből, és mintegy 670 token/másodperces sebességgel a mért modellek közül a leggyorsabbnak számít. Az Nvidia engedékeny licenc alatt, súlyokkal és tréningreceptekkel együtt adta ki a modellt.

NVIDIA bemutatta az Alpamayo 2 Super önvezető AI-modellt

Az NVIDIA hivatalos bejelentése szerint az Alpamayo 2 Super egy 34 milliárd paraméteres, nyíltan elérhető vizuális-nyelvi-cselekvési modell, amely önvezető autók fejlesztését hivatott egységesíteni. A rendszer a 32 milliárd paraméteres Cosmos 3 Super Reasoner nevű okfejtő komponenst és egy 2 milliárd paraméteres, diffúzió-alapú Action Expert modult kapcsolja össze, megerősítő tanulással utótanítva. A vállalat állítása szerint akár hét kamerából 360 fokos érzékelést biztosít, és egyetlen modellből ad jövőbeli pályát, okfejtési láncot, magas szintű cselekvési predikciót, jelenet-alapú kérdésválaszolást és automatikus adatannotálást. Az NVIDIA saját méréseket közölt, amelyek szerint a modell több benchmarkon – köztük pályaelőrejelzésben és LingoQA teszten – felülmúlja a korábbi megoldásokat, ezek az adatok azonban független validálás nélkül a vállalat saját közlésén alapulnak.

NVIDIA nyílt AI-modellje kvantumszámítógépeket kalibrálna

Az NVIDIA saját blogbejegyzése szerint megjelent az Ising Calibration 1.5, egy 31 milliárd paraméteres, nyílt forráskódú vizuális-nyelvi modell, amely kvantumprocesszorok diagnosztikai kimeneteit értelmezi és javaslatot ad a hangolásukra. A vállalat állítása szerint a modell BF16 pontosságnál 11,4 százalékkal kisebb az előző verziónál, és most először NVFP4-kvantált formában is elérhető, ami egyetlen GPU-n vagy NVIDIA DGX Spark eszközön futtatható. Az NVIDIA a QCalEval nevű benchmarkon mért eredmények alapján azt közli, hogy a modell minden nyílt modellnél jobban teljesít, és felveszi a versenyt a vezető zárt rendszerekkel is. A modellt több kubitmodalitás – szupravezető kubitok, kvantumpöttyök, ionok, neutrális atomok – partneradatain tanították, és a teljes csomag, beleértve a súlyokat és az adatkészleteket, OpenMDW licenc alatt válik elérhetővé.

DeepMind új vezetője a Gemini 4 gyors kiadását sürgeti, nem az AGI-t

Koray Kavukcuoglu, aki augusztus óta vezeti a Google DeepMindet Demis Hassabis után, első nyilvános szereplésén a The Information AI Agenda Live csúcstalálkozóján elmondta: a Gemini 4 még a korai utótanítási fázisban van, de a modellt „sokkal korábban” szeretné kiadni, mint az év vége. Kavukcuoglu szerint az AGI-kérdés, amelyre elődje mindig fókuszált, „nem a megfelelő beszélgetés”. A Financial Times szerint a Gemini 3.5 Pro, amelyet Sundar Pichai májusban az I/O-n jelentett be júniusi megjelenéssel, három határidőt is elmulasztott, és Kavukcuoglu nem erősítette meg, hogy a projektet törölték-e. Hassabis jelenleg az egység elnöke és az Alphabet vezető tudósa. Kavukcuoglu „száz százalékig biztos” abban, hogy a Google mindig az élvonalban lesz, miközben az Anthropic és az OpenAI már fejlettebb modelleket kínál.