2026. szeptember 7., hétfő · Modellek
Meta bemutatta a Muse Voice Transcribe valós idejű hangmodellt
A Meta Superintelligence Labs kiadta a Muse Voice Transcribe nevű valós idejű hangmodellt, amely beszédfelismerést, mondathatár-felismerést és akár 20 beszélő megkülönböztetését végzi külön rendszerek nélkül, egyetlen modellben. A modell a bejövő hangot 80 milliszekundumos darabokra bontja, és szavanként dinamikusan állítja a várakozási időt: nehezebb szavaknál tovább hallgat a pontosabb eredményért, a Meta állítása szerint ezt megerősítéses tanulással érték el. A cég szerint a rendszer több mint 70 nyelvet támogat, 25-öt mélyebben teszteltek, és nyelvek közötti váltást is kezel. A Meta 0,18 dolláros óradíjat közöl, ami állítása szerint olcsóbb, mint az OpenAI vagy az ElevenLabs megoldásai. A cikk szerint a független Artificial Analysis értékelés megerősítette a Meta pontossági állításait angol nyelven, bár a teljes független validáció részletei a forrásból nem derülnek ki.
Miért fontos?
Egy integrált, olcsó és több nyelvet kezelő valós idejű hangmodell felgyorsíthatja az „állandóan figyelő” AI-asszisztensek fejlesztését, versenyt szorítva az OpenAI és az ElevenLabs hasonló szolgáltatásaira.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. szeptember 7., hétfő napi AI összefoglaló része.