谷歌母公司Alphabet于9月30日发布新一代前沿人工智能模型Gemini 4 Argon,称其在编程、网络安全和复杂专业任务上取得提升,并计划先向受信任的网络安全合作方分批开放。据The Verge报道,Google DeepMind高级副总裁兼首席AI架构师Koray Kavukcuoglu表示,该模型在“真实世界软件工程、法律和金融等企业知识工作以及网络安全防御的复杂工作流中提供前沿性能”。

据MarkTechPost报道,Argon是Gemini 4代首款模型,最大技术变化是单次响应可生成最多100万token,较早前Gemini模型的64K大幅提高。谷歌未披露输入上下文窗口。API介绍期定价为每百万输入token 2美元、输出10美元,缓存输入可享95%折扣,即每百万0.10美元;介绍期后为输入4美元、输出20美元。Logan Kilpatrick确认了介绍期价格。Android Authority称,Argon仍只面向有限测试者,最终将扩展至Google AI Ultra订阅用户,但谷歌未给出“很快”之外的具体时间。

谷歌公布多项基准结果。据MarkTechPost,Argon在18项基准中12项领先、1项并列第一。DeepSWE v1.1上得77.9%,高于Claude Opus 5.5的74.2%和GPT-6 Astra的74.1%;Vals Index得68.9%排名第一;AutomationBench得51.3%排名第一;Harvey Legal Agent Benchmark得19.6%,GPT-6 Astra为5.4%;LVBench得91.7%。但Argon在FrontierSWE v2得55.0%,落后GPT-6 Astra的65.5%;Terminal-Bench 4.0得57.4%,落后Claude Opus 5.5的66.4%;OSWorld-2.0得69.2%,落后GPT-6 Astra的72.6%。Artificial Analysis称,按折扣价计算,Argon在Intelligence Index上与GPT-6 Astra持平,每任务成本为后者60%。

网络安全方面,谷歌称Argon可自主发现、验证和修补关键软件漏洞。受信任防御者和谷歌内部团队获得的版本不含网络安全护栏。在CWE-bench v1漏洞修复测试中,Argon以68%并列第一。Wiz已通过其Scan for Good计划使用Argon,该模型发现医院全球使用的医疗软件中的一个关键漏洞,谷歌称此前前沿模型漏掉了这一漏洞。据CNBC报道,Argon在网络安全评估基准上与OpenAI的GPT-6 Astra和Grok 4.7并列第一,并在Vals Index上领先GPT-6 Astra和Anthropic的Fable 5.1。

谷歌表示,公开发布前将加强四类保障:针对网络和CBRN风险的滥用防御,包括激活监控;间接提示注入抵抗;对思维链和行动进行错位监控并具备停止执行能力;为高风险训练和评估提供密封隔离沙箱。公司计划从受信任网络安全伙伴开始分阶段推出,并与美国政府进行发布前安全评估。此前一天,谷歌CEO Sundar Pichai在白宫与主要科技高管会面后,与总统Donald Trump签署了一份自愿安全协议。

内部使用方面,据MarkTechPost报道,已有数千名谷歌员工使用Argon。谷歌称,Argon智能体在数据中心应用内存优化,释放超过300 TiB内存,预计可达500 TiB至1 PiB;在libgav1的Rust移植中替换了3.2万行SIMD代码,解码器运行速度提高2.7倍且输出相同;还用于将C/C++代码库迁移至Rust,涉及Fuchsia Zircon内核超过80万行。谷歌还称,Argon在几分钟内击败已发表的量子算法基线40%。据Ars Technica报道,谷歌内部工程师已广泛使用该模型,但大多数用户仍需等待。