2026. szeptember 24., csütörtök · Modellek

Alibaba bemutatta a Qwen-Audio-3.1 modellcsaládot, és drasztikusan csökkentette az AI-hangfeldolgozás árait

Az Alibaba Qwen csapata öt új modellből álló Qwen-Audio-3.1 csomagot jelentett be beszédfelismerésre (ASR), szövegfelolvasásra (TTS) és valós idejű hangalapú interakcióra. A cég állítása szerint az ASR modell jobban kezeli a többnyelvű és dialektus szerinti felismerést, az ASR-Next pedig több beszélőt is azonosít időbélyeggel, illetve érzelmeket és háttérzajokat is felismer. A TTS és TTS-Next modellek nyelvek közötti hangátvitelt és egyszerű szöveges utasítással vezérelhető érzelmi, stílusbeli hangolást tesznek lehetővé, míg a valós idejű modell egyidejű beszédet és hallgatást, illetve azonnali megszakítást támogat. Az Alibaba emellett jelentősen csökkentette az árakat: a TTS mintegy 70, a valós idejű szolgáltatás körülbelül 85, az ASR pedig akár 95 százalékkal olcsóbb lett. Az állítások a vállalat saját közleményén alapulnak, független teszteredmény egyelőre nem áll rendelkezésre.

Miért fontos?

A 95 százalékos ASR-árcsökkentés és az öt új Qwen-Audio-3.1 modell jelentősen olcsóbbá teheti a hangalapú AI-alkalmazások fejlesztését az Alibaba felhőplatformját használó vállalatok számára.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. szeptember 24., csütörtök napi AI összefoglaló része.

Kapcsolódó hírek

Az Alibaba bemutatta a 2,4 billió paraméteres Qwen 3.8 modellt, célkeresztben a Kimi K3

Az Alibaba nyilvánosságra hozta legújabb, nyílt súlyú Qwen 3.8 modelljét, amely a vállalat állítása szerint 2,4 billió paraméterrel rendelkezik, és csak a Fable 5 mögött marad el. A csapat szerint ez az első, egybillió paraméternél nagyobb multimodális modelljük, amely képeket, videókat és dokumentumokat is feldolgoz. Független benchmark-eredmények egyelőre nem állnak rendelkezésre, a teljesítményállítások kizárólag a fejlesztő közlésén alapulnak. Az előnézet az Alibaba platformjain a szokásos ár tizedéért érhető el, a nyílt súlyok közzétételét a közeljövőre ígérik. A The Decoder szerint a lépés részben a Moonshot AI Kimi K3 modelljének térnyerését célozza ellensúlyozni.

Alibaba bemutatta a Qwen3.8-Flash-Next modellt, a Qwen4 előfutárát

Az Alibaba Qwen csapata bemutatta a Qwen3.8-Flash-Next multimodális, mixture-of-experts modellt, amely a jövőbeli Qwen4 architektúrájának előzetese. A modell 125 milliárd paraméterből áll, de tokenenként csak 6 milliárdot aktivál, és tartalmaz egy 51 milliárd paraméteres N-gram beágyazási réteget, amely gyakori szócsoportokat tárol rendszer RAM-ban. A natív kontextusablak 262 144 token, YaRN-nel akár 1 millió tokenig bővíthető. Az Alibaba saját, publikált benchmarkjai szerint a Flash-Next a betanítási költség kilencedéből is jobb eredményeket ér el, mint a Qwen3.7-Plus, és a legtöbb tesztben megelőzi a DeepSeek-V4-Flash és az Anthropic Claude Opus 4.6 modelleket, kivéve a Humanity's Last Exam tesztet. Az éles verzió Qwen3.8-Flash néven érhető el a QwenCloudon, millió tokenenként 0,16–0,47 dollárért.

Alibaba kiadta a nyílt súlyú Qwen3.8 modellcsaládot

Alibaba Qwen csapata nyílt súlyú Qwen3.8 modelleket adott ki Apache 2.0 licenc alatt. A fő modell, a Qwen3.8-27B, 27 milliárd paraméteres multimodális modell, amely a fejlesztő állítása szerint kódolási és irodai feladatokban felülmúlja a nagyobb Qwen3.7-Plus modellt, és önállóbban tervez, megbízhatóbban hajt végre ügynöki feladatokat. Natívan kezel akár 262 000 tokenes kontextust, a YaRN módszerrel pedig egymillió tokenig skálázható, emellett képeket és videókat is feldolgoz, beleértve diagramokat és többórás videókat. Megjelent egy jóval nagyobb, Qwen3.8-2.4T-A95B jelű, Max szintű modell súlya is; mindkettő elérhető a Hugging Face-en és a ModelScope-on, egymillió tokenes kontextussal hamarosan a Qwen Cloud szolgáltatáson keresztül is elérhető lesz.

Alibaba bemutatta a Qwen3.8-Max modellt, kihívást intézve az amerikai AI-vezetők felé

Az Alibaba hétfői blogbejegyzésében bemutatta a Qwen3.8-Max nyelvi modellt, amelyet saját állítása szerint eddigi legnagyobb és legképzettebb rendszerének nevez. A cég szerint a teljesítménye vetekszik az Anthropic vezető modelljével (a forrásban Fable 5 néven szereplő rendszerrel), az OpenAI fejlesztéseivel, és a hazai Moonshot AI Kimi K3 modelljével is. Az Alibaba saját tesztjei és a nyilvános Arena.AI rangsor szerint a szöveges modellek listáján csak Fable 5 és három Claude Opus-modell előzi meg. A vállalat közlése szerint a modell 2,4 billió paraméterrel rendelkezik, és a súlyokat jövő héten nyílt formában teszik elérhetővé, visszatérve a korábban felfüggesztett nyílt hozzáférésű gyakorlathoz. A kínai nyílt modellek térnyerése tovább fokozza a Szilícium-völgy és Washington közötti feszültséget az AI-technológiai fölény kérdésében.