2026. szeptember 24., csütörtök · Modellek
Google új Flash TTS modelljei szöveges leírásból építenek AI-hangokat
A Google bemutatta a Gemini 3.8 Flash TTS és Flash-Lite TTS beszédszintézis-modelleket, amelyek több mint 100 nyelvet támogatnak. A Flash TTS a vállalat szerint szöveges leírásból képes teljesen új hangokat létrehozni, meghatározva a szerepet, akcentust és hangjellemzőket, ezen kívül több mint 2000 előre elkészített hangot is kínál. A hangklónozás funkció 30 másodperces hangmintából épít hangprofilt, a Google szerint ehhez a klónozott személy beleegyező nyilatkozatát is rögzíteni kell. Mindkét modell támogatja a soronkénti rendezői utasításokat, a kétszereplős dialógust és a nem verbális hangokat, mint a nevetés vagy sóhaj; a Flash-Lite a nagy tételben, alacsony költségű szinkronra és hangügynökökre készült. A Google állítása szerint minden generált hangklip láthatatlan SynthID vízjelet kap, a modellek a Gemini API-n és a Google AI Studio-n keresztül válnak elérhetővé.
Miért fontos?
A beleegyező nyilatkozathoz kötött hangklónozás és a SynthID vízjel a Google saját mechanizmusa a visszaélések elleni védekezésre, ami a hangalapú deepfake-ek elleni iparági gyakorlat egyik konkrét példája.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. szeptember 24., csütörtök napi AI összefoglaló része.