据量子位报道,Google Cloud于10月9日凌晨发布长文《Welcome to Gemini at Work 2026: Introducing the Gemini agent》,由Google Cloud CEO Thomas Kurian署名,正式推出通用办公Agent Gemini Agent。该产品可跨应用执行任务,并支持动态选择底层模型,包括Anthropic的Claude。
谷歌将Gemini Agent定位为覆盖各类工作任务、能够长期运行的通用办公Agent。它可以查资料、写邮件、做PPT、分析数据、编写和运行代码,还能跨应用调用工具、自行规划任务,必要时召集多个子Agent协作。其工作原则是“给它目标,而非逐步指令”,核心能力包括统一入口、云端持久运行、跨平台调用、多Agent协作、事件触发和定时任务。文中举例称,让它完成市场分析报告,它可以自行搜索整理资料、分析数据,在Google Sheets中建立财务模型,再调用Google Slides生成演示文稿。
在Gemini Agent框架下,谷歌提出Coworker Agent,即“同事智能体”。企业可为Gemini创建长期存在、职责明确的身份,并配置独立Google Workspace账号、企业邮箱、日历和Drive存储空间,使其出现在公司通讯录中。团队成员可以像对待普通同事一样,邀请它加入Google Chat群聊,或在文档中@它。AI同事以自己的身份执行操作并留下记录,便于管理追踪。
记忆机制方面,Gemini Agent拥有四种记忆:会话记忆保存当前任务上下文;语义记忆从文档、交流及与其他Agent的协作中积累知识;程序性记忆记录工作如何完成,并可由Agent自行编写Skills保存方法;情景记忆记录过去完成的工作和执行经历。谷歌比喻称,它会像新员工一样逐渐熟悉用户、工具和团队。
其底层模型可以单独选择。现阶段,它能在Google的Gemini系列和Anthropic的Claude系列之间动态选择,未来计划支持更多闭源和开源模型。具体调用取决于任务要求,在效果、速度和成本之间权衡:简单工作使用成本较低的模型,复杂任务调用能力更强的模型。谷歌称这套能力为多模型编排,并提供Smart Routing自动路由。谷歌还表示,底层模型变化时,Agent积累的上下文、Skills和企业数据可以保留。
谷歌入场时,办公Agent竞品正密集发布。9月29日,OpenAI发布能够7×24小时工作的Dots;Meta此前推出个人AI Agent Muse。Muse偏向个人生活场景,可帮用户购物、预订旅行、发邮件甚至支付。Dots拥有独立云端电脑,能记住用户长期目标和工作习惯,还可连接超过4000个应用;开发者收到新反馈后,Dots可分析问题、修改代码并准备PR供人审查。
与Dots更强调围绕用户个人持续工作不同,谷歌重点让Agent进入企业已有的组织和办公体系。Gemini Agent可利用Gmail、Docs、Sheets、Calendar等应用中的业务上下文,理解员工正在做什么;企业可创建有独立邮箱、日历、账号和权限的Coworker agent,让它以自己的身份参与团队协作。谷歌把模型选择、企业数据连接、安全审计和成本控制放进这套体系,甚至允许Claude成为Gemini Agent完成任务时调用的底层模型。OpenAI也在探索面向企业岗位的专业Dots,但主要处于早期企业试点阶段。