据爱范儿报道,Google多个相关账号于10月1日宣布Gemini 4 Argon正式发布。这是Gemini旗舰模型停更七个半月后的更新,目前仅通过Fairwind计划向少量网络安全合作伙伴开放,官方未列出全面公开时间,只表示届时将首先向付费API用户和Google AI Ultra订阅者开放,普通订阅用户仍需等待。

Gemini 4 Argon的名称来自测试期间内部代号,官方没有解释由来。其命名被指与Chrome形成对仗,Argon即第18号元素氩。此前测试场曾流出据称是Gemini 4的模型版本,但官方从未认领,也不清楚是否掺入Fable和Astra,因此相关比对结果可信度有限。

按官方释出的数据,Gemini 4 Argon在列举的18项测试中取得13项领先。其在知识工作方面优势明显,在Vals Finance Agent v2和Harvey’s Legal Agent Benchmark上领先其他任何模型两档;在测试256k至1M超长上下文使用能力的GraphWalks中,领先其他旗舰模型超过10%。该模型输出上限从上一代的6.4万token提升至100万token。官方称,当模型拥有足够空间深入思考,并在单次推理轨迹中生成数十万个词元时,将为推理带来全新深度,从而一次性解决棘手问题。

编程表现则不一致。在DeepSWE v1.1上,Gemini 4 Argon成绩为77.9%,领先GPT-6 Astra和Claude Opus 5.5接近4个百分点;但在FrontierSWE v2和Terminal-Bench 4.0上处于垫底水平。爱范儿将其特性概括为知识、写作强于编程,编程强于终端。第三方Arena.ai评分中,Gemini 4在Text Arena排名第一,在Code Arena: WebDev和Agent Arena中排名第8。

Artificial Analysis测试显示,Gemini 4幻觉率为15%,在前沿模型中最低,面对不确定回答时更倾向于说“不知道”。定价方面,Gemini 4 Argon官方API价格为每百万token输入2美元、输出10美元,命中缓存价格为5%,即0.1美元。官方称首发优惠结束后价格会翻倍,但按经验,优惠期大概率在下一代模型出现前不会结束。按优惠价计算,其价格是GPT-6 Astra和Fable 5.1的五分之一,大致持平GPT-6.1 Sol和Sonnet 5.5。

报道同时提到,几乎在Gemini 4公布的同时,彭博社称Google内部员工对Gemini 4实际性能持怀疑态度,知情人士表示该模型在真实任务中效果不尽如人意,难以处理某些编码任务。Google迅速反驳,也有员工表示Gemini 4很不错。爱范儿认为,最终交付给用户的Gemini 4可能不会像跑分中那么强,等待实装期间ChatGPT和Claude模型也可能完成一次迭代。不过,Gemini 4 Argon发布意味着Google重新回到赛场,上限未必很高,下限仍可保证。