据SiliconANGLE报道,谷歌9月30日开始向通过审核的网络安全防御人员推出前沿人工智能模型Gemini 4 Argon,该模型在谷歌自家多数基准测试中超过Anthropic和OpenAI的竞品。
除谷歌内部团队外,目前只有其Fairwind计划成员可以使用Argon。该计划9月3日以规模较小的Gemini 3.8 Flash Cyber启动,迄今已有650多家机构加入,包括CrowdStrike和Palo Alto Networks。
谷歌首席AI架构师Koray Kavukcuoglu在公告中写道,发布这一级别的能力“需要分阶段推进”。谷歌参与美国政府关于模型发布前访问的自愿流程,并表示仍在加强防止模型被用于网络攻击或武器开发的防护措施。按谷歌的说法,Argon在抵御间接提示注入方面优于其此前发布的任何模型。另有独立监控器观察模型的思维链与行动,一旦超出用户意图即可叫停。
在DeepSWE v1.1的长周期软件工程任务中,Argon得分77.9%。上周发布的Anthropic Claude Opus 5.5在谷歌图表上为74.2%,比OpenAI的GPT-6 Astra高0.1个百分点。在衡量端到端业务工作的AutomationBench上,Argon以51.3%对42.5%领先Opus 5.5。在谷歌图表列出的18项基准中,VentureBeat统计Argon在12项上直接领先。Terminal-Bench 4.0仍属于Opus 5.5,FrontierSWE v2是Astra保住的少数项目之一。
谷歌为DeepSWE所衡量的长周期工作构建Argon,并把输出上限设为100万token与之匹配,早前Gemini模型的上限为6.4万token。
数千名谷歌员工已在使用Argon,公司团队让其智能体承担大型工程任务。其中之一是把C和C++代码迁移到Rust,项目从数万行核心库到谷歌Fuchsia操作系统中超过80万行的Zircon内核。在开源视频解码器libgav1上,智能体从已有的Rust移植版本出发,把3.2万行速度关键代码改写为编译器可自行优化的安全Rust,解码器运行速度比早前移植版快2.7倍,视频输出没有变化。谷歌工程师还用Argon智能体查找被浪费的内存,一次对全机群性能分析数据的扫描已在公司数据中心释放超过300 tebibytes。
Fairwind成员和谷歌内部团队获得的是移除网络防护栏的Argon版本,该版本可自行发现并修复软件漏洞,在修复测试CWE-bench v1上以68%与GPT-6 Astra持平。
谷歌旗下的云安全公司Wiz在免费Scan for Good计划中使用Argon,该计划寻找关键公共基础设施中的暴露问题。谷歌称,模型发现了一个暴露个人信息的严重漏洞,涉及全球多家医院使用的医疗软件,早前的前沿模型未能发现。
谷歌尚未给出向付费开发者和Google AI Ultra订阅者开放的具体日期,他们排在下一批。Argon发布时定价为每百万输入token 2美元、每百万输出token 10美元,缓存输入价格低95%。Anthropic对Opus 5.5收费4美元和20美元,启动定价结束后Argon将改用这一费率。