2026. szeptember 7., hétfő · Modellek

Meta bemutatta a Muse Voice Transcribe valós idejű hangmodellt

A Meta Superintelligence Labs kiadta a Muse Voice Transcribe nevű valós idejű hangmodellt, amely beszédfelismerést, mondathatár-felismerést és akár 20 beszélő megkülönböztetését végzi külön rendszerek nélkül, egyetlen modellben. A modell a bejövő hangot 80 milliszekundumos darabokra bontja, és szavanként dinamikusan állítja a várakozási időt: nehezebb szavaknál tovább hallgat a pontosabb eredményért, a Meta állítása szerint ezt megerősítéses tanulással érték el. A cég szerint a rendszer több mint 70 nyelvet támogat, 25-öt mélyebben teszteltek, és nyelvek közötti váltást is kezel. A Meta 0,18 dolláros óradíjat közöl, ami állítása szerint olcsóbb, mint az OpenAI vagy az ElevenLabs megoldásai. A cikk szerint a független Artificial Analysis értékelés megerősítette a Meta pontossági állításait angol nyelven, bár a teljes független validáció részletei a forrásból nem derülnek ki.

Miért fontos?

Egy integrált, olcsó és több nyelvet kezelő valós idejű hangmodell felgyorsíthatja az „állandóan figyelő” AI-asszisztensek fejlesztését, versenyt szorítva az OpenAI és az ElevenLabs hasonló szolgáltatásaira.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. szeptember 7., hétfő napi AI összefoglaló része.

Kapcsolódó hírek

Google bemutatta a Gemini 3.5 Transcribe beszédfelismerőt

A Google elindította a Gemini 3.5 Transcribe nevű valós idejű beszéd-szöveg átalakító modelljét, amely a vállalat szerint automatikusan felismer több mint 85 nyelvet, kiszűri a töltelékszavakat, javítja a nyelvbotlásokat, és önállóan formázza a szöveget. Google állítása szerint a szóhiba-arány streamelt hangnál 4,0, rögzített hangnál 2,6 százalék, a késleltetés pedig 70 százalékkal alacsonyabb az elődjéhez, a Chirp 3-hoz képest. A modell function calling funkción keresztül más Gemini-modelleknek adhat tovább feladatokat, például képgenerálást vagy webes keresést. Két felülettel érhető el: a Live API valós idejű streameléshez, az Interactions API pedig rögzített hanganyagok feldolgozásához beszélő-azonosítással és időbélyegekkel. A Google szerint már elérhető az AI Studio-ban, a Gemini Enterprise platformon, Androidon és macOS-en, Chrome-támogatás hamarosan jön.

Meta megjelentette a Muse Glimmer nyílt súlyú AI-ügynökmodellt

Meta kiadta a Muse Glimmer nevű 30 milliárd paraméteres, sűrű architektúrájú modellt, amelynek súlyait Apache 2.0 licenc alatt, nyíltan tette elérhetővé a Hugging Face-en. A vállalat szerint a modellt kifejezetten helyi, folyamatosan futó AI-ügynökök számára optimalizálták: egyetlen fogyasztói GPU-n, akár internetkapcsolat nélkül is képes futni, és több mint 100 nyelven, szöveget és képet is kezel. A The Decoder szerint Meta saját benchmarkjai alapján a Glimmer a Google Gemma és az Alibaba Qwen hasonló méretű nyílt modelljeivel versenyképes ügynöki feladatokban, ám a mérés a vállalat saját, nem független tesztkörnyezetében történt. Ez Meta első nyílt modellje a 2025 tavaszi Llama 4 óta, amelyet gyenge fogadtatás és manipulált benchmarkok miatti kritika ért. NVIDIA és Hugging Face már nap-nulla támogatást biztosít a modellhez több futtatókörnyezetben.

A Meta bemutatta a Muse Spark 1.1 kódolási modellt és a hozzá tartozó fejlesztői API-t

A Meta elérhetővé tette a Muse Spark 1.1 nevű mesterségesintelligencia-modelljét, amelyet a vállalat állítása szerint jelentős előrelépésnek szán az első generációhoz képest: fejlettebb kódolási képességeket, összetett hibák felismerését és javítását, valamint ágens-alapú munkafolyamatok támogatását ígéri. A modell natív multimodális érzékelést kínál képek, videók és dokumentumok kezelésére. Ezzel párhuzamosan a Meta nyilvános előzetes verzióban elindította a Meta Model API-t amerikai fejlesztők számára, amelyhez minden új fiók 20 dollár értékű ingyenes kreditet kap. A lépés a The Verge értékelése szerint a Meta milliárdos AI-befektetéseinek megtérülését célozza, miközben a cég az OpenAI-jal, a Google-lal és az Anthropickal igyekszik felvenni a versenyt.

Google WeatherNext 3: fizikai szimuláció helyett élő műholdadatokból tanuló időjárás-modell

A Google Research és a DeepMind bemutatta a WeatherNext 3 nevű AI-modellt, amely a vállalat közlése szerint nem hagyományos fizikai szimulációkra épül, hanem közvetlenül valós idejű geostacionárius műholdadatokból tanul. A Google szerint az elődje, a WeatherNext 2 numerikus előrejelzési adatokon tanult, amelyek hatórás késéssel érkeztek, ami hibákat okozott a gyorsan változó csapadék- és hőmérsékleti adatoknál. Az új modell a cég állítása szerint óránként friss előrejelzést ad, akár öt kilométeres felbontásban, ötszörös élességgel, és akár 50 százalékkal pontosabb csapadék-előrejelzést kínál. A Google szerint elsősorban Latin-Amerika, Afrika és az Ázsiai-csendes-óceáni térség profitálhat, mivel ezeket eddig kevésbé szolgálták ki a drága regionális modellek. A modell a Google Search, a Térkép és a Gemini szolgáltatásokban már elérhető.