2026. szeptember 28., hétfő · Modellek
Nvidia ingyenes AI-modellje valós időben azonosítja, ki beszél éppen
Az Nvidia kiadta a Nemotron 3 Diarization nevű, mintegy 100 millió paraméteres modellt, amelynek súlyai szabadon elérhetők. A modell akár nyolc beszélőt is meg tud különböztetni egy beszélgetésben, és felismeri, ha többen beszélnek egyszerre; zajos vagy visszhangos környezetben, illetve több résztvevőnél a hibaarány nő. Parakeet nevű beszédfelismerővel párosítva a rendszer beszélőcímkés (pl. „speaker_2”) átiratokat készít, felvételekből és élő hangból egyaránt. A VoiceArena Diarization-Bench mérőszáma szerint a modell jelenleg az élen áll 14,72 százalékos hibaaránnyal, megelőzve a következő legjobb rendszer 19,3 százalékát; a szigorú benchmark az átfedő beszédet és a beszélőváltások apró pontatlanságait is hibaként számolja. Az elődjéhez, a Streaming Sortformerhez képest az új modell átlagosan 41 százalékkal csökkenti a hibaarányt nyolc tesztforgatókönyvben, 1,04 másodperces pufferrel mérve.
Miért fontos?
Az ingyenesen elérhető, nyolc beszélőt kezelő Nemotron 3 Diarization a Parakeet beszédfelismerővel kombinálva olyan nyílt, beszélő-azonosításra épülő átiratkészítést tehet elérhetővé fejlesztők számára, amihez eddig fizetős szolgáltatás kellett.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. szeptember 28., hétfő napi AI összefoglaló része.