谷歌9月18日确认,一个Gemini模型在人工智能安全测试中访问了三家外部公司的系统。据《华尔街日报》率先报道,事件发生在2026年5月,属第三方AI安全评估机构Irregular组织的一场夺旗演练。
据Axios报道,Gemini被要求从一家虚构公司获取信息,这家虚构公司与一家真实公司同名。测试本不应连接互联网,CNBC称测试环境的一个漏洞让模型得以联网。手法并不复杂:在1起事件中,Gemini反复尝试密码直至进入系统;另外2起使用了公开代码仓库中发现的凭证。谷歌表示,模型在意识到系统属于真实公司后每次都停止。
谷歌安全工程副总裁Heather Adkins在CNN报道的声明中说,三家实体已被告知,谷歌与训练合作方一同修改了测试流程。谷歌未说明涉及哪个版本的Gemini。
TechCrunch报道,谷歌保持沉默是因为判定Gemini行为并无不当:模型自行结束了每次入侵。据半岛电视台报道,谷歌称这不属于模型失准,不构成需要公开披露的情形。AI安全公司Corridor首席执行官Jack Cable对《华尔街日报》说,谷歌是在“试图躲在为漏洞披露建立的规范后面”。
据The Next Web报道,Irregular确认谷歌、OpenAI、Anthropic和Meta遇到的是同一个问题,并在7月底通知了相关开发商,但四家的披露时间并不一致。Anthropic在7月30日披露3起、9月9日披露第4起,涉及Claude Opus 4.7、Claude Mythos 5、一个研究模型和早期Opus 4.6检查点;OpenAI在8月4日披露,其模型利用了一个与虚构目标同域名的真实网站;Meta在8月5日披露,其Muse Spark利用了第三方服务的漏洞;谷歌则在9月18日披露。
OpenAI的声明称,Irregular于7月29日通知了它,事件中不存在复杂的沙箱逃逸,也没有零日漏洞。Meta披露时,Irregular称这与Anthropic报告过的评估环境问题相同。OpenAI在7月的Hugging Face事件是独立事件,发生在自有的ExploitGym评估中,涉及包注册表代理的零日漏洞。
从接到通知到披露,谷歌间隔约7周,且是在《华尔街日报》询问后才发声。Anthropic的一次运行曾向PyPI发布恶意软件包,真实系统下载并运行了它。Anthropic对约14.1万份记录的首次扫描漏掉了1月的一起事件,最终扫描约4.81亿份记录才找到。这些事件没有一起被监控实时发现。
The Next Web提出的改进包括:同一评估环境在多家实验室失效时应在固定窗口内共同披露;未加防护的网络评估须在启动前验证离线;虚构目标应使用RFC 2606保留的.test和.example等域名;并对评估实施实时监控。