2026. augusztus 28., péntek · Modellek
Google bemutatta a Gemini 3.5 Transcribe beszédfelismerőt
A Google elindította a Gemini 3.5 Transcribe nevű valós idejű beszéd-szöveg átalakító modelljét, amely a vállalat szerint automatikusan felismer több mint 85 nyelvet, kiszűri a töltelékszavakat, javítja a nyelvbotlásokat, és önállóan formázza a szöveget. Google állítása szerint a szóhiba-arány streamelt hangnál 4,0, rögzített hangnál 2,6 százalék, a késleltetés pedig 70 százalékkal alacsonyabb az elődjéhez, a Chirp 3-hoz képest. A modell function calling funkción keresztül más Gemini-modelleknek adhat tovább feladatokat, például képgenerálást vagy webes keresést. Két felülettel érhető el: a Live API valós idejű streameléshez, az Interactions API pedig rögzített hanganyagok feldolgozásához beszélő-azonosítással és időbélyegekkel. A Google szerint már elérhető az AI Studio-ban, a Gemini Enterprise platformon, Androidon és macOS-en, Chrome-támogatás hamarosan jön.
Miért fontos?
A gyorsabb, pontosabb, sok nyelvet kezelő beszédfelismerés közvetlenül javíthatja a hangalapú Google-termékek és fejlesztői eszközök használhatóságát.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 28., péntek napi AI összefoglaló része.