据 SiliconANGLE 报道,Google Cloud 于10月8日推出 Gemini agent,这一统一人工智能助手可自主行动、生成代码,并在网页、移动端和桌面等任何设备上完成工作;它可通过命令行、Google Workspace、Microsoft 365 或 Slack 等渠道访问,也能在第三方应用内工作,无需专门界面。

Google Cloud 首席执行官托马斯·库里安表示,Gemini 可以回答问题、处理知识工作、创建图像和媒体,或把想法变成成品。他说,用户给它目标而不是指令,委托一项成果,然后回来收取完成的工作;代理必须连接个人工作流、记录系统和企业控制措施。

新代理体验遵循持续执行趋势。它跨所有沟通渠道及所有子代理维持一套记忆、上下文和个性化设置,像一名记住用户所告知内容的队友,并能衍生出拥有自己身份、专长、@agents.company.com 邮箱和持久存储的较小同事代理;这些子代理只能访问用户或团队成员提供的上下文。

Google Cloud 表示,Gemini agent 每项工作运行在适合任务的模型上。简单任务可能使用小型快速模型 Gemini Flash,长时间工作则使用 Argon 等旗舰前沿模型;Anthropic PBC 的 Claude 模型目前也可用,其他领先的私有和开源模型将在后续提供。

库里安强调 Google 提供对业务上下文的完整理解,涵盖定价、产品组合和部门规范等。Gemini 通过公司数据为答案提供依据,并安全连接 Confluence、Microsoft Office、Teams、Slack、Workspace、Git、Jira、Salesforce、ServiceNow、BigQuery、Databricks、Postgres、Snowflake 及桌面文件。

用户可构建可复用技能,作为指令、知识和工作流,教代理执行特定的多步任务。Gemini 出厂附带全球技能库,用户可向公司共享注册表添加并发布自定义技能,也可要求代理把任务转换成可复用模板。系统会从每个问题和目标中学习;会话记忆即使运行数天,也持续更新对用户工作方式及应产出内容的理解。Google 表示,它在了解用户正在做什么上花费的时间与使用工具的时间相当。

Google 表示,专门技能首先从数据领域开始,为数据科学家和工程师扩展机器学习技能与工具。用自然语言描述成果,Gemini 可生成 PySpark 代码,提供 notebook 供编辑和测试,训练模型并自行排查问题。对业务用户,Gemini 可使用运营 BigQuery 报告技能和 Knowledge Catalog 构建并保存查询;只需询问即可创建实时运营报告,保存后团队运行报告不会产生额外 token 成本,每次产出一致且经过验证的答案。

成本控制被放在突出位置。Google Cloud 指出,尽管每 token 价格自 2024 年以来已下降约 98%,企业 AI 用量仍大幅增加。Google 在8月宣布的灵活支出选项于当日上线,内部多模型编排按任务选择模型,或用快速模型处理小任务、前沿模型处理困难部分,以降低成本。智能路由会自动分诊企业工作负载,让每项工作以最低可能成本运行在提供最大性能的模型上。用户可在 Cloud Billing Console 中设置 AI 支出硬上限;Gemini 通过监控 token 使用量执行限制,触发上限时代理会暂停,用户可在控制台批准后恢复工作。