谷歌于 9 月 30 日发布新一代前沿模型 Gemini 4 Argon,称该模型在 18 项公开基准测试中的 13 项领先或与对手并列第一,初期仅向受信任的网络防御人员和部分预发布测试者开放,后续再扩大可用范围。
据 VentureBeat 报道,谷歌并未声称 Gemini 4 Argon 赢下每一项基准测试。在公司提供的基准对比表中,Argon 取得最高分或并列最高分的类别数量多于 GPT-6 Astra 和 Claude Opus 5.5。具体来看,在谷歌披露的 18 项基准中,Argon 有 12 项单独领先、1 项并列第一;GPT-6 Astra 有 3 项单独领先,并在 1 项上与 Argon 并列;Claude Opus 5.5 有 2 项单独领先。按领先或最高分项目的总数计算,Argon 在这组对比中居首,但三家之间的差距仍然不大。
分项结果也显示各家各有优势。GPT-6 Astra 在若干软件、科学终端和计算机操作类任务上仍然领先,Claude Opus 5.5 则在终端智能体和后训练工作流上保持优势。对企业采购方而言,这意味着模型选择依然取决于具体工作负载,尽管按基准领先数量计算,Argon 是谷歌迄今为止在前沿模型整体领先地位上最强的一次主张。
Argon 同时抬高了谷歌模型的输出上限。公司称该模型支持 100 万输出 token,为业界领先水平,此前的上限为 6.4 万 token。这一差异对智能体软件工程、审计、迁移和法律审阅类工作负载具有实际意义,因为这些场景的价值往往取决于模型在交还控制权给人类之前能持续完成多长的工作链条。