据量子位报道,谷歌于10月1日突然发布新一代旗舰模型Gemini 4 Argon,并在多项第三方评测中登顶。该模型主打编程、金融和法律等复杂工作流,同时强调网络安全防御能力,目前只向部分经过筛选的网络安全团队开放,其他订阅用户需要逐步获得权限。

谷歌上一代旗舰模型发布已近一年,OpenAI和Anthropic在此期间持续施压,假期前一周还连发Opus 5.5、Sonnet 5.5和GPT-6.1 Sol。Gemini 4 Argon在此时上线,谷歌的劈柴哥、哈萨比斯和Koray Kavukcuoglu均公开为其站台,喊出“谷歌 is back”。DeepMind研究员Zirui Wang则发帖称:“RSI来了!我已做无可做,是时候追逐我的咖啡师梦想了:)”

跑分方面,Argon在衡量长期软件工程任务的DeepSWE v1.1上取得77.9%,高于Claude Opus 5.5的74.2%和GPT-6 Astra的74.1%。网络安全漏洞修复测试CWE-bench v1中,Argon以68%与GPT-6 Astra并列第一。它还在Vals Index以68.90%登顶,较Gemini 3.8 Flash大幅提升,RSI指数升至第四,超过GPT-6 Astra。Text Arena中,Argon以1525分位列第一,在代码编写、高难度提示词、指令遵循、长查询和创意写作赛道优势明显;Code Arena中排名第八,较Gemini 3.8 Flash High提升21个名次,但仍稍逊于Claude和GPT最新模型。Artificial Analysis测评显示,Argon与GPT-6 Astra旗鼓相当,高于GPT-6.1 Sol一分,提升主要来自更少幻觉和更强智能体能力。

价格上,量子位称Argon只有Astra的一半,优惠期间单题成本约低四成,每百万输入Token为2美元、输出Token为10美元,目前是最具性价比的模型之一。模型支持最高百万Token输出,面向软件工程、企业专业知识梳理和网络安全防御等长任务。谷歌内部使用案例中,Argon在各数据中心自主识别并落地内存优化方案,全面部署后预计可释放超过300 TiB内存;另一案例中,Argon Agent围绕视频解码器的Rust移植版本反复实验,替换3.2万行SIMD代码,最终运行速度达到原Rust移植版的2.7倍。

谷歌重点强调Argon的防御性网络安全能力。它能够自主发现、验证并修补20多种语言的关键软件漏洞,在Wiz内部黑箱渗透测试中,可在无源代码下实时分析网络系统,发现攻击面、识别漏洞并生成概念验证证据。为防止滥用,Argon首批进入谷歌的Fairwind计划,面向经过审核的网络安全防御方;对受信任团队,谷歌会放开针对网络安全任务的部分限制,用于补洞和寻找攻击入口。

不过,量子位在报道中提到,谷歌内部对Gemini 4并不完全看好。一些接触过该模型的员工认为,其实际编程任务表现没有跑分那么亮眼,网页和应用前端界面设计仍是短板,甚至存在过度刷榜嫌疑。另一名熟悉开发工作的员工则表示,内部普遍认为Gemini 4已达到前沿水平。谷歌回应称,说它编程表现不佳并不准确。由于普通用户尚未用上该模型,其实际表现仍有待观察。