据MarkTechPost报道,阿里通义千问团队发布新一代实时同声传译模型Qwen3.8-LiveTranslate。该模型在说话人仍在讲话时即可输出译文文本与语音,官方称其平均延迟指标LAAL从上一代的2.8秒降至2.3秒,降幅约18%。
Qwen方面介绍,延迟改善来自新的Interleave架构。同声传译需要在“多等一会儿以获得更多上下文”与“尽早开口以缩短听众等待”之间权衡,Interleave架构重构了这一循环。LAAL即长度自适应平均延迟,衡量译文平均落后源语音的程度,该指标不奖励输出过量的系统。QwenCloud团队将该模型描述为Qwen3.8-LiveTranslate-Flash的实时版本,其建立在Qwen-Omni技术栈、大规模多模态数据、跨语言与跨模态对齐以及视觉增强之上;Flash模型同时支持离线的音频与视频翻译。
相比上一代,新版本增加了三项能力。实时说话人分离可在多方对话中区分不同说话人,并通过更稳定的声音克隆保留每位说话人的音色,API提供多种克隆模式,其中always模式会在每次回复前重新克隆,适用于多人会话。双语同步显示将原文文本与译文同时呈现在屏幕上,API中源语音转写以独立事件流的形式与翻译流并行输出。长上下文消歧则利用对话历史确定人名与术语,会议早期出现的名字在后文翻译中保持一致。
语言方面,该模型可理解60种语言,其中29种支持语音输出,返回音频与文本,其余31种仅返回文本。语音输出覆盖中文、英语、阿拉伯语、德语、法语、西班牙语、日语、韩语、印地语等。输入为音频和可选图像,输出为文本和音频;唇部动作、手势、屏幕文字等视觉线索有助于在嘈杂环境或词义含糊时提升效果,官方文档建议每秒发送不超过2张图像。开发团队还可配置热词,将源语言词汇映射为固定的目标语译法,文档建议不超过1000个热词。
该模型仅通过API提供,已在阿里云百炼和QwenCloud上线,模型ID为qwen3.8-livetranslate-flash-realtime,经由WebSocket的Realtime API接入。默认轮次检测类型为speaker_detection,客户端持续推送音频并接收服务端生成的回复,默认音频输入为16 kHz PCM、输出为24 kHz PCM,默认音色为Tina;会话关闭前必须发送session.finish,否则最后一段内容会丢失。
定价按每百万token计,新加坡区域音频输入7.50美元、图像输入0.55美元、文本输出20美元、音频输出30美元;北京区域分别为5.653、0.466、14.133和22.613美元。音频输入每秒消耗7个token,音频输出每秒消耗12.5个token,在新加坡区域,一小时输入与输出均为语音的会话费用约为1.54美元,尚未计入文本与图像token。上下文窗口为53248个token,其中输入49152个、输出4096个;默认速率限制为每分钟10个请求、10万个token。阿里云百炼页面显示,该模型暂不支持函数调用、结构化输出、批量推理和微调。