Google于9月2日发布Gemini 3.8 Flash和Gemini 3.8 Flash Cyber。这是继3.6 Flash、3.7 Flash之后,Google在六周内推出的第三款Flash模型。两个版本基于同一基础模型,均经由长期智能体循环迭代优化,区别不在架构,而在安全边界和开放范围:通用版面向软件开发等场景,Cyber版专供受信任的网络安全防御者使用。
Gemini 3.8 Flash即日起通过Gemini API、Google AI Studio、Android Studio、Antigravity和Gemini Enterprise提供服务,Google AI Pro和Ultra订阅用户也可以在Gemini应用、Google搜索AI Mode和Google Sheets中使用。模型保持每百万输入Token 0.75美元、每百万输出Token 3.75美元的促销价,有效期至2026年12月31日;2027年起将分别调整为1.5美元和7.5美元。这一价格与三周前发布的3.7 Flash相同。
Google称,Gemini 3.8 Flash在长周期软件工程基准DeepSWE v1.1上超过多数更大的前沿模型。据不同媒体报道,其在该测试中的成绩存在差异:有报道称得分73.7%,另有报道称71.0%。在HLE-Verified测试中,3.8 Flash得分54.9%。此外,Google还报告其在Vals Finance Agent V2和Harvey's Legal Agent Benchmark上相对3.7 Flash及其他更大模型有优势,但未公布绝对分数。模型上下文窗口最高100万Token,单次最多可输出6.4万Token,支持文本、图片、音频和视频输入。
Google解释,3.8 Flash的性能提升来自“更努力地工作”:面对复杂任务时,它会执行额外推理步骤并反复调用工具,因此高推理强度下消耗的Token可能增多。开发者指南建议,计算效率优先的工作负载可继续使用3.7 Flash,或降低推理档位。值得注意的是,此前支持的MINIMAL思考等级在3.8 Flash中不再支持,设置该值会返回API验证错误。
与3.8 Flash同时发布的Gemini 3.8 Flash Cyber面向漏洞发现和自动修补。据Google公布,该模型在CyberGym漏洞发现基准上得分86.2%,超过此前版本及多个更大模型;在覆盖20种编程语言的内部漏洞测试中,发现成功率超过70%。在修补能力方面,Chrome安全团队报告其生成的正确补丁数量是更大商业模型的2.6倍。Google表示,其云漏洞研究团队借助该模型在不到两小时内发现了一个通常需要数月才能人工发现的关键基础性漏洞。由于Flash Cyber采用较宽松的网络安全缓解措施,Google仅通过新设立的Fairwind Program向经审核的政府机构、关键基础设施运营商和软件维护者提供访问权限,不公开售卖。据多家媒体报道,该计划启动时已有超过650个参与者,包括CrowdStrike、Datadog等公司。