2026. augusztus 28., péntek · Modellek

Google bemutatta a Gemini 3.5 Transcribe beszédfelismerőt

A Google elindította a Gemini 3.5 Transcribe nevű valós idejű beszéd-szöveg átalakító modelljét, amely a vállalat szerint automatikusan felismer több mint 85 nyelvet, kiszűri a töltelékszavakat, javítja a nyelvbotlásokat, és önállóan formázza a szöveget. Google állítása szerint a szóhiba-arány streamelt hangnál 4,0, rögzített hangnál 2,6 százalék, a késleltetés pedig 70 százalékkal alacsonyabb az elődjéhez, a Chirp 3-hoz képest. A modell function calling funkción keresztül más Gemini-modelleknek adhat tovább feladatokat, például képgenerálást vagy webes keresést. Két felülettel érhető el: a Live API valós idejű streameléshez, az Interactions API pedig rögzített hanganyagok feldolgozásához beszélő-azonosítással és időbélyegekkel. A Google szerint már elérhető az AI Studio-ban, a Gemini Enterprise platformon, Androidon és macOS-en, Chrome-támogatás hamarosan jön.

Miért fontos?

A gyorsabb, pontosabb, sok nyelvet kezelő beszédfelismerés közvetlenül javíthatja a hangalapú Google-termékek és fejlesztői eszközök használhatóságát.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. augusztus 28., péntek napi AI összefoglaló része.

Kapcsolódó hírek

A Google három új Gemini modellt mutatott be, köztük a kiberbiztonságra szabott változatot

A Google három új mesterségesintelligencia-modellt jelentett be: a Gemini 3.6 Flash-t, a 3.5 Flash Lite-ot és a 3.5 Flash Cyber-t. Az Ars Technica beszámolója szerint a 3.6 Flash a kódolási benchmarkokban jelentős javulást mutat elődjéhez képest (a DeepSWE teszten 49 százalékot ért el a korábbi 37-tel szemben), miközben körülbelül 17 százalékkal kevesebb tokent használ, és alacsonyabb API-áron érhető el. A 3.5 Flash Lite a Google állítása szerint a leghatékonyabb modelljük, másodpercenként 350 tokenes sebességgel, kedvező árazással. A Gemini 3.5 Flash Cyber a vállalat első kifejezetten kiberbiztonsági célra fejlesztett modellje. A Google emellett jelezte, hogy a késlekedő Gemini 3.5 Pro továbbra sem jelent meg, viszont már tréningezik a Gemini 4-et.

Alibaba bemutatta a Qwen3.8-Flash-Next modellt, a Qwen4 előfutárát

Az Alibaba Qwen csapata bemutatta a Qwen3.8-Flash-Next multimodális, mixture-of-experts modellt, amely a jövőbeli Qwen4 architektúrájának előzetese. A modell 125 milliárd paraméterből áll, de tokenenként csak 6 milliárdot aktivál, és tartalmaz egy 51 milliárd paraméteres N-gram beágyazási réteget, amely gyakori szócsoportokat tárol rendszer RAM-ban. A natív kontextusablak 262 144 token, YaRN-nel akár 1 millió tokenig bővíthető. Az Alibaba saját, publikált benchmarkjai szerint a Flash-Next a betanítási költség kilencedéből is jobb eredményeket ér el, mint a Qwen3.7-Plus, és a legtöbb tesztben megelőzi a DeepSeek-V4-Flash és az Anthropic Claude Opus 4.6 modelleket, kivéve a Humanity's Last Exam tesztet. Az éles verzió Qwen3.8-Flash néven érhető el a QwenCloudon, millió tokenenként 0,16–0,47 dollárért.

Z.ai áll a rejtélyes Ox Alpha modell mögött

Hétvégén sokat találgattak, melyik AI-labor készítette az OpenRouteren névtelenül feltűnt, benchmarkokon élen járó Ox Alpha nyílt súlyú modellt. A TechCrunch szerint a Bloomberg értesülésére hivatkozva a GLM-sorozatot jegyző Z.ai áll mögötte, amit a cég meg is erősített: Ox Alpha a GLM-család legújabb tagja. A Z.ai szerint a modell kódolásra, hosszan tartó ágensi munkára és éles üzemi feladatokra tervezett rendszer, amely komplex, hosszú távú szoftverfejlesztési munkát és vizuális kontextussal kombinált feladatokat is kezel. A cég a modell súlyait szerdán teszi közzé, ezután a fejlesztők építhetnek rá. A TechCrunch szerint az olcsó, versenyképes kínai modellek – köztük a korábban bemutatott GLM-5.3, amely egyes benchmarkokon az Anthropic Fable 5 modelljével vetekszik – piaci részesedést vehetnek el az olyan drága, élvonalbeli cégektől, mint az OpenAI és az Anthropic.

DeepSeek kísérleti vizuális modellt adott ki ügynöki feladatokra

A kínai DeepSeek nyilvánosságra hozta a V4-Flash-Vision-Exp nevű kísérleti, multimodális modellt, amely a szöveges V4-Flash alapmodellt képfeldolgozási képességgel bővíti. A cég saját belső benchmarkjai szerint – ezt fontos hangsúlyozni, mivel független ellenőrzés nem történt – a vizuális változat ügynöki feladatokban közelít az Anthropic Opus 4.8 teljesítményéhez, miközben megőrzi az alapmodell szövegértési és világtudás-képességeit. A modell DeepSeek állítása szerint képeket ír le, szöveget nyer ki képernyőképekből, és diagramokat elemez, valamint kompatibilis az OpenAI és az Anthropic API-formátumaival. A vállalat egyúttal frissítette Harness nevű keretrendszerét is, amely a cikk szerint alapból támogatja az új modellt. A képfeldolgozás technikai részletei – például a fájlformátum-felismerés vagy a tokenköltség – szintén a DeepSeek saját dokumentációjából származó állítások.