据MarkTechPost报道,阿里巴巴Qwen团队9月29日发布Qwen-Audio-3.1音频模型栈,共五款模型,覆盖语音识别、语音合成和实时交互。主模型Qwen-Audio-3.1-Realtime是全双工语音模型,面向可调用工具的语音智能体;Qwen同时将Realtime价格下调约85%,TTS约降70%,ASR最高降95%。
该模型以托管API形式提供,qwen-audio-3.1-realtime-plus已在QwenCloud通过WebSocket上线,未公布开放权重。模型页显示,文本和音频均可输入输出,上下文262K tokens,最大输入245K,最大输出16K,默认每分钟60次请求和10万tokens。音频输入每百万tokens收费6.4美元,文本输入0.8美元;文本和音频输出每百万tokens 24美元,输出文本不计费,支持函数调用、网页搜索、结构化输出、上下文缓存和微调。配套模型Qwen-Audio-3.1-ASR-Flash-Filetrans面向离线长音频转写,支持热词、说话人分离、标点以及多语种和中文方言识别,输入每百万tokens收费0.15美元,输出0.47美元。
系统由两个模型组成,共用音频编码器和LLM设计。全双工决策模型判断继续听、开口、停止或恢复,语音转文本模型生成回应内容,上下文感知语音渲染器再把文本转为流式语音。训练分为Think、Act、Speak and Coordinate三层。Think阶段用百万小时级配对数据进行在策略蒸馏,再由多教师OPD合并领域专家。Act阶段为每个训练域打包工具池、有状态JSON数据库和自然语言业务策略,任务结果限定为写入、有理由拒绝或不支持请求,评分依次检查终态、允许写入和行为断言。搜索训练对冗余查询施加惩罚,每次搜索调用平均查询数从4.37降至1.05,触发F1从60.87%降至58.61%。
Speak and Coordinate层决定是否、何时以及如何开口。在Full-Duplex-Bench v1.5上,对他人对话的回应从0.13降至0.03;在v3.0上,填充词率从0.7590降至0.2960。代价是打断后非期望恢复率从0.035升至0.130,打断停止延迟为1.116秒,而GPT-Realtime-2为0.383秒。与3.0相比,Audio MultiChallenge从47.12升至52.21,14语种BBA平均从81.7%升至88.1%,FLEURS WER从9.01降至3.98;τ-Voice数据采用半双工语音转文本适配,不能与官方全双工结果直接比较。在50轮人类红队测试中,GPT-Realtime-2仍以96.00%领先Qwen的92.00%。
与OpenAI GPT-Realtime-2和Google Gemini 3.8 Live相比,Qwen音频输入每百万tokens 6.4美元,低于GPT的32美元,高于Gemini的3.00美元;音频输出24美元,低于GPT的64美元,高于Gemini的12美元;上下文262K高于两者,最大输出16K低于GPT的32K和Gemini的65,536,三者均未开放权重。价格是2026年9月28日核对的标价,因各家音频分词方式不同,token费率不能直接比较。在τ-Voice适配任务上,任务成功率从78.4%升至82.0%;Full-Duplex-Bench v1.5中对背景语音的回应从73.0%降至13.0%;多轮攻击成功率降至中文26.0%、英文23.5%。