据雷峰网报道,9月28日,在全球权威AI评测平台Artificial Analysis的语音排行榜Controlled Voice Arena上,阿里巴巴发布的语音大模型Qwen-Audio-3.1-TTS以1177的Elo评分位列全球第一。
雷峰网介绍,Qwen-Audio-3.1-TTS是阿里新一代语音合成大模型,支持多语种及方言合成。该模型能够让同一音色在不同语言之间自然迁移,用一种声音自然讲出多种语言。
与传统语音合成主要关注字音是否正确不同,Qwen-Audio-3.1-TTS更强调声音是否符合具体内容和使用场景。用户可通过指令控制情绪、语速和表达方式,使合成语音不只“说得对”,也能“说得像”。
此次登顶的模型属于阿里在2026云栖大会发布的Qwen-Audio-3.1系列。该系列还包括语音转写(ASR)和实时语音交互(Realtime)两类模型。雷峰网称,三大模型的API服务均已上架千问AI平台。
在开源方面,阿里语音团队开源的多款模型,包括Qwen-Audio-Agent和CosyVoice,在GitHub上累计获得数万星标,受到海内外开发者关注。
价格方面,据雷峰网报道,目前Qwen-Audio全线语音模型价格均已下调,最高降幅达95%,为开发者和企业的语音应用节省成本。