2026. szeptember 24., csütörtök · Modellek
Alibaba bemutatta a Qwen-Audio-3.1 modellcsaládot, és drasztikusan csökkentette az AI-hangfeldolgozás árait
Az Alibaba Qwen csapata öt új modellből álló Qwen-Audio-3.1 csomagot jelentett be beszédfelismerésre (ASR), szövegfelolvasásra (TTS) és valós idejű hangalapú interakcióra. A cég állítása szerint az ASR modell jobban kezeli a többnyelvű és dialektus szerinti felismerést, az ASR-Next pedig több beszélőt is azonosít időbélyeggel, illetve érzelmeket és háttérzajokat is felismer. A TTS és TTS-Next modellek nyelvek közötti hangátvitelt és egyszerű szöveges utasítással vezérelhető érzelmi, stílusbeli hangolást tesznek lehetővé, míg a valós idejű modell egyidejű beszédet és hallgatást, illetve azonnali megszakítást támogat. Az Alibaba emellett jelentősen csökkentette az árakat: a TTS mintegy 70, a valós idejű szolgáltatás körülbelül 85, az ASR pedig akár 95 százalékkal olcsóbb lett. Az állítások a vállalat saját közleményén alapulnak, független teszteredmény egyelőre nem áll rendelkezésre.
Miért fontos?
A 95 százalékos ASR-árcsökkentés és az öt új Qwen-Audio-3.1 modell jelentősen olcsóbbá teheti a hangalapú AI-alkalmazások fejlesztését az Alibaba felhőplatformját használó vállalatok számára.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. szeptember 24., csütörtök napi AI összefoglaló része.