据雷峰网报道,华尔街投行杰富瑞分析师近日对八款全球主流AI Agent进行真实办公任务实测,结果显示,通过模型与Harness的协同,阿里千问办公综合得分排名第一,超过美国Claude Cowork和Codex等工具。
测试设置了五项真实办公任务,包括基于多份文件完成公司年报摘要、联网查找并比较公司经营数据、操作真实桌面浏览器完成信息检索和文档生成、根据数据制作英文PPT,以及基于参考图片生成营销海报。千问办公是唯一一个在所有测评维度中均获得90分以上的Agent产品,在复杂办公任务、网页浏览器控制以及多模态内容生成等场景中表现突出。
报告将Agent能力拆分为模型与Harness两部分。Harness是围绕模型运行的工程机制,包括指令、上下文、工具调用、边界控制、反馈纠错和治理等。据杰富瑞测算,千问办公的“隐含Harness分”位居测试产品首位,高于Claude Cowork和Codex等七款产品。这意味着,模型之外,工程和产品能力将模型智能转化为实际任务结果的能力,正在成为Agent竞争的重要维度。
成本也被纳入考量。报告显示,千问办公底层Qwen 3.8 Max的API价格明显低于部分海外头部模型。Agent通常需要多轮推理、持续调用工具和执行长链路任务,企业评估Agent价值时,除模型和产品能力外,还可能关注完成一项任务所需的“Cost per Task”。阿里Qwen模型和千问办公Agent的组合体现了一定的性能与成本优势。
报告认为,企业级Agent的核心竞争壁垒在于工作流和生态协同。随着Agent连接企业数据、业务系统、协作工具和权限体系,用户的历史任务、工作习惯、连接器、Skills和自动化流程会沉淀在产品中,形成使用粘性和迁移成本。千问办公已初步打通钉钉IM工具,企业员工可通过它完成群聊总结、文档表格创建、消息邮件收发等操作。未来企业客户还可将千问办公接入真实工作流,连接企业数据库和工作流,提升办公与组织效率。