2026. október 3., szombat · Modellek

Microsoft új beszédfelismerő és szövegfelolvasó AI-modelleket adott ki hangalapú asszisztensekhez

A Microsoft AI bemutatta a MAI-Transcribe-2-Streaming nevű valós idejű beszédfelismerő modellt, amely a vállalat állítása szerint az Artificial Analysis mérésén pontosság terén az első helyen végez, 60 nyelvet kezel, és már körülbelül 100 milliszekundum alatt megadja az első részeredményeket, így a hangalapú asszisztensek még mondat közben reagálhatnak. Egy óra hangfelvétel feldolgozása bevezető áron 0,54 dollárba kerül az év végéig. Emellett két új szövegfelolvasó modell is megjelent: a MAI-Voice-2.1 23 nyelven, natív akcentussal, ugyanazzal a hanggal tud beszélni, a gyorsabb MAI-Voice-2.1-Flash változat 150 milliszekundumos késleltetést és 15 dollár/millió karakter árat kínál a korábbi 22 dollár helyett. Mindkét hangmodell néhány másodperces referenciahangból képes hangklónozásra, a Microsoft szerint beépített védelmi mechanizmusokkal a visszaélések ellen. Egy 4000 fős teszten a résztvevők mintegy fele valódi embernek vélte a mesterséges hangokat.

Miért fontos?

A hangklónozásra is képes MAI-Voice-2.1 modellt, amelyet a résztvevők fele valódi embernek hitt, a Microsoft saját állítása szerint beépített visszaélés-elleni védelemmel bocsátja piacra.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. október 3., szombat napi AI összefoglaló része.

Kapcsolódó hírek

Meta bemutatta a Muse Voice Transcribe valós idejű hangmodellt

A Meta Superintelligence Labs kiadta a Muse Voice Transcribe nevű valós idejű hangmodellt, amely beszédfelismerést, mondathatár-felismerést és akár 20 beszélő megkülönböztetését végzi külön rendszerek nélkül, egyetlen modellben. A modell a bejövő hangot 80 milliszekundumos darabokra bontja, és szavanként dinamikusan állítja a várakozási időt: nehezebb szavaknál tovább hallgat a pontosabb eredményért, a Meta állítása szerint ezt megerősítéses tanulással érték el. A cég szerint a rendszer több mint 70 nyelvet támogat, 25-öt mélyebben teszteltek, és nyelvek közötti váltást is kezel. A Meta 0,18 dolláros óradíjat közöl, ami állítása szerint olcsóbb, mint az OpenAI vagy az ElevenLabs megoldásai. A cikk szerint a független Artificial Analysis értékelés megerősítette a Meta pontossági állításait angol nyelven, bár a teljes független validáció részletei a forrásból nem derülnek ki.

Google bemutatta a Gemini 3.5 Transcribe beszédfelismerőt

A Google elindította a Gemini 3.5 Transcribe nevű valós idejű beszéd-szöveg átalakító modelljét, amely a vállalat szerint automatikusan felismer több mint 85 nyelvet, kiszűri a töltelékszavakat, javítja a nyelvbotlásokat, és önállóan formázza a szöveget. Google állítása szerint a szóhiba-arány streamelt hangnál 4,0, rögzített hangnál 2,6 százalék, a késleltetés pedig 70 százalékkal alacsonyabb az elődjéhez, a Chirp 3-hoz képest. A modell function calling funkción keresztül más Gemini-modelleknek adhat tovább feladatokat, például képgenerálást vagy webes keresést. Két felülettel érhető el: a Live API valós idejű streameléshez, az Interactions API pedig rögzített hanganyagok feldolgozásához beszélő-azonosítással és időbélyegekkel. A Google szerint már elérhető az AI Studio-ban, a Gemini Enterprise platformon, Androidon és macOS-en, Chrome-támogatás hamarosan jön.

Black Forest Labs bemutatta a Flux 3 Image szerkesztőmodellt

A Black Forest Labs kiadta a Flux 3 Image modellt, amely a Flux 3 modellcsalád képi ága. A cég állítása szerint a modell több lépéses szerkesztést tesz lehetővé úgy, hogy közben a kép többi része változatlan marad, emellett támogatja a szöveg-kép, kép-kép, szövegmegjelenítő és fotórealisztikus generálást is. A felhasználók körülhatároló dobozokkal komponálhatnak jeleneteket, akár tíz referenciaképet is felhasználhatnak, és 4K felbontásig készíthetnek kimenetet, az ingyenes demó pedig elérhető online. Az API-hozzáférés október 8-ig 50 százalékos kedvezménnyel vehető igénybe, a vállalatok pedig kereskedelmi licenc keretében saját infrastruktúrájukon futtathatják és finomhangolhatják a modellt; nyílt súlyú verzió a következő hetekben várható. A bejelentés előtt röviddel az Ideogram is saját szerkesztésközpontú modelljét, a 4.5-öt jelentette be, amely szintén hamarosan nyílt súlyokkal jelenik meg.

Google bemutatta a Gemini 4 Argon modellt, de egyelőre csak kevesek használhatják

A Google bejelentette a Gemini 4 Argon nevű új modelljét, amelyet a vállalat kódolásban, tudásmunkában és kiberbiztonságban iparágvezetőnek állít. A cég szerint a DeepSWE v1.1 szoftverfejlesztési teszten 77,9 százalékot ért el, és vezet a Vals Index gazdasági elemzési benchmarkon is – ezek a Google saját közlései, független megerősítés egyelőre nincs. A modell korlátozott ideig 2 dollár/millió bemeneti és 10 dollár/millió kimeneti tokenért érhető el API-n keresztül, kimeneti limitje pedig a korábbi 64 000-ről 1 millió tokenre nőtt. Google állítása szerint belső mérnökei már használják Argont, aminek köszönhetően 300 TiB memóriát takarítottak meg adatközpontjaikban, és több mint 800 000 sornyi kódot migráltak C/C++-ból Rustba a Fuchsia OS Zircon kerneljében. A szélesebb nyilvánosság egyelőre nem férhet hozzá a modellhez, mert a Google fokozatos, biztonsági fókuszú bevezetést tervez.