2026. szeptember 24., csütörtök · Modellek

Google új Flash TTS modelljei szöveges leírásból építenek AI-hangokat

A Google bemutatta a Gemini 3.8 Flash TTS és Flash-Lite TTS beszédszintézis-modelleket, amelyek több mint 100 nyelvet támogatnak. A Flash TTS a vállalat szerint szöveges leírásból képes teljesen új hangokat létrehozni, meghatározva a szerepet, akcentust és hangjellemzőket, ezen kívül több mint 2000 előre elkészített hangot is kínál. A hangklónozás funkció 30 másodperces hangmintából épít hangprofilt, a Google szerint ehhez a klónozott személy beleegyező nyilatkozatát is rögzíteni kell. Mindkét modell támogatja a soronkénti rendezői utasításokat, a kétszereplős dialógust és a nem verbális hangokat, mint a nevetés vagy sóhaj; a Flash-Lite a nagy tételben, alacsony költségű szinkronra és hangügynökökre készült. A Google állítása szerint minden generált hangklip láthatatlan SynthID vízjelet kap, a modellek a Gemini API-n és a Google AI Studio-n keresztül válnak elérhetővé.

Miért fontos?

A beleegyező nyilatkozathoz kötött hangklónozás és a SynthID vízjel a Google saját mechanizmusa a visszaélések elleni védekezésre, ami a hangalapú deepfake-ek elleni iparági gyakorlat egyik konkrét példája.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. szeptember 24., csütörtök napi AI összefoglaló része.

Kapcsolódó hírek

Alibaba bemutatta a Qwen-Audio-3.1 modellcsaládot, és drasztikusan csökkentette az AI-hangfeldolgozás árait

Az Alibaba Qwen csapata öt új modellből álló Qwen-Audio-3.1 csomagot jelentett be beszédfelismerésre (ASR), szövegfelolvasásra (TTS) és valós idejű hangalapú interakcióra. A cég állítása szerint az ASR modell jobban kezeli a többnyelvű és dialektus szerinti felismerést, az ASR-Next pedig több beszélőt is azonosít időbélyeggel, illetve érzelmeket és háttérzajokat is felismer. A TTS és TTS-Next modellek nyelvek közötti hangátvitelt és egyszerű szöveges utasítással vezérelhető érzelmi, stílusbeli hangolást tesznek lehetővé, míg a valós idejű modell egyidejű beszédet és hallgatást, illetve azonnali megszakítást támogat. Az Alibaba emellett jelentősen csökkentette az árakat: a TTS mintegy 70, a valós idejű szolgáltatás körülbelül 85, az ASR pedig akár 95 százalékkal olcsóbb lett. Az állítások a vállalat saját közleményén alapulnak, független teszteredmény egyelőre nem áll rendelkezésre.

OpenAI bemutatta a GPT-6 Sol és Luna modelleket, feleannyi hibával és fél áron

Az OpenAI hivatalos bejelentése szerint elindította a GPT-6 Sol és Luna modelleket, amelyek a korábbi GPT-6 Astra után a kisebb, olcsóbb kategóriát bővítik. A TechCrunch beszámolója szerint a cég azt állítja, hogy az új modellek fele annyi ténybeli hibát vétenek, mint elődeik, és az API-hozzáférés ára a felére csökkent az 5.6-os Sol és Luna sorozathoz képest, amit a cég a gyorsítótárazás és a következtetési folyamat javulásával magyaráz. Az OpenAI szerint a Sol komplex, kódolási feladatokra, a Luna pedig nagy mennyiségű, rutinszerű irodai munkára alkalmas. Az Amazon Bedrock hivatalos közleménye megerősíti, hogy mindkét modell elérhető a platformon, alacsonyabb áron, mint az 5.6-os elődök. A TechCrunch azt is megjegyzi, hogy az Anthropic mindössze 90 perccel az OpenAI bejelentése előtt adta ki saját Opus 5.5 modelljét, jelezve a két cég közti éles versenyt.

Anthropic olcsóbb Opus 5.5 modellt dobott piacra IPO előtt

Az Anthropic kedden bemutatta az Opus 5.5-öt, a Claude-sorozat legfejlettebb modelljét, amely a cég szerint kódolásban és tudásalapú feladatokban is új csúcsot állít fel, és több benchmarkban felülmúlja a nagyobb Fable modellt. A kimeneti tokenek ára millióanként 25 dollárról 20 dollárra csökkent, a modell gyorsabb futtatást igényel, és kevésbé szakzsargonos, tömörebb kommunikációt kínál. Az Anthropic szerint az Opus 5.5 biológiai és kiberbiztonsági képességei a Mythos modellel egyenértékűek, ezért ugyanazok a biztonsági korlátozások vonatkoznak rá. A kiadás Dario Amodei vezérigazgató nemrégiben tett bejelentése után az első modellfrissítés, amelyben a cég vállalta, hogy lassítja a képességfejlesztés ütemét az igazodási kutatások felzárkózása érdekében. A Financial Times szerint az új modell az Anthropic tőzsdei bevezetés előtti befektetői kommunikációjának is részét képezi.

Alibaba Qwen-Image-2.1: 7 milliárd paraméteres nyílt képmodell

Az Alibaba Qwen csapata kiadta a Qwen-Image-2.1 nyílt súlyú képgeneráló és -szerkesztő modellt. A cég állítása szerint a mindössze 7 milliárd paraméteres vizuális generáló komponens saját belső benchmarkján felülmúlja a legtöbb zárt modellt, független mérések eredményei még nem állnak rendelkezésre. A modell natívan kezel átlátszó (RGBA) képeket, egyszerre akár tíz referenciaképet is fel tud dolgozni csoportos portrékhoz, virtuális ruhapróbákhoz vagy lakberendezési tervekhez, és körökkel, maszkokkal vagy rajzolt jelölésekkel irányítható lokális szerkesztésre. A Qwen csapata szerint architektúrabeli változtatások és a KV-cache újrahasznosítása gyorsítja a következtetést, különösen több referenciakép esetén. A modell fut hagyományos fogyasztói GPU-kon is, például egy RTX 3090-en, és elérhető Hugging Face-en, GitHubon és a ModelScope-on, kutatási licenc alatt, amely kizárja a kereskedelmi felhasználást.