阿里通义千问团队9月18日发布全模态模型Qwen3.8-Omni-Flash,称其是首个围绕智能体能力构建的全模态模型,可接收文本、图像、音频和视频,输出文本。据科技媒体MarkTechPost报道,该模型目前只以托管API形式提供,已在QwenCloud、阿里云百炼和Qwen Studio上线,发布时未公布开放权重,用户无法自行部署。
按通义千问的介绍,音视频理解、推理与工具调用被放进同一个模型,工作流程是理解内容、规划任务、借助工具执行并交付结果。模型基于2026年8月以开放权重发布的Qwen3.8-Flash-Next架构,上下文窗口为100万token,QwenCloud标注的最大输入为991K、最大输出为131K,最大推理长度为262K token。输出仅为文本,百炼文档建议需要生成语音的开发者改用Qwen3.5-Omni。模型默认开启思考,reasoning_effort设为xhigh,设为none则关闭。API同时兼容DashScope与OpenAI协议,支持Chat Completions和Responses API,以及函数调用、网页搜索、结构化输出、上下文缓存和批处理调用。
长视频处理采用了与从头到尾顺序读取不同的方式。研究团队称,智能体从问题出发,自行决定看什么、听什么,再经过多轮由粗到细的检索收集证据,把算力和token集中在相关片段上。在OmniVideoBench上,准确率从63.4升至67.8,token用量从145736降至79117,减少约45.7%。
模型公布的基准成绩来自通义千问方面,发布时没有独立验证结果。据其数据,29项评测的平均分较Qwen3.5-Omni-Plus提升超过25%,其中WildClawBench-MM提升36.5分,AgenticVBench提升22.3分,UniClawBench达到69.6分,LongAudioSpan提升8.3分,OmniVideoBench提升9.6分,OmniCap-IF的CSR和ISR分别提升8.5分和14.1分。研究团队称其音视频表现接近Gemini 3.8 Flash,音频整体表现则高于Gemini 3.8 Flash。Qwen在社交平台的帖文把智能体能力增益概括为WildClawBench-MM与UniClawBench两项平均提升19.5分。
价格方面,QwenCloud列出每100万输入token 0.15美元、每100万输出token 0.47美元,隐式缓存命中为每100万token 0.016美元。研究团队称相较Qwen3.5-Omni-Plus大幅降低了成本:音频输入每小时费用下降超过98%,音视频输入每小时下降超过93%,帖文给出的视频输入降幅约为89%。
百炼文档列出的限制包括:通过URL传入的视频文件最大2小时、2GB,音频文件最长3小时,音频输入覆盖113种语言和方言,视频采样帧率最高15fps时结果稳定,并可通过use_multichannel支持双声道立体声和四声道FOA空间音频。模型在北京、新加坡、香港、东京、法兰克福和弗吉尼亚六个区域可用。开发者用数行OpenAI SDK代码即可调用。
为了配合只输出文本的模型,通义千问团队同时开源支持媒体处理的工具。Qwen-MM-Plugins已在Apache-2.0许可下发布,其定位是让任意智能体框架原生支持多模态,每项能力以Skill加可选MCP服务器的方式安装,引导式安装器支持Claude Code、CodeBuddy、Codex、Qoder、OpenClaw、Qwen Code和Gemini CLI。其中omni-memory为长视频建立音视频记忆,omni-video2note把教程视频转成带插图的PDF,omni-chatcut覆盖音乐转MV、电影解说和保留说话人的视频翻译,另有一个核心插件让主模型原生读取本地图像和视频帧。团队还提到另一个开源项目Qwen-Live Harness,报道中未给出更多细节。