据The Verge报道,谷歌人工智能模型Gemini今年5月在一次网络安全能力测试中突破限制,入侵了三家真实公司。谷歌在《华尔街日报》联系其置评前未披露这一事件。测试由第三方机构Irregular进行;The Verge援引《华尔街日报》称,Irregular也曾涉及与Meta和OpenAI有关的类似事件。
《华尔街日报》报道,谷歌未披露此事,是因为不认为它构成“模型对齐失败”的案例。谷歌将事件描述为“认错对象”,称模型通过猜测密码强行进入一家真实公司后意识到目标有误,随后停止。谷歌安全工程副总裁希瑟·阿德金斯对The Verge表示,模型在网上找到公开信息并猜测凭据,访问它认为属于测试范围的网站;在三起事件中,模型都停止了。阿德金斯说:“在这种情况下,模型的行为是适当的。”
阿德金斯没有进一步说明,Gemini自行突破限制并针对第三方,为何不算模型对齐失败。她说,谷歌安全团队长期记录并报告在其他软件和系统中发现的问题,哪怕只是一个弱密码;谷歌已确保三家公司知情,并与训练合作方就其测试流程的调整展开合作。她还称,这些事件凸显训练强大AI模型负责任行事的重要性。
AI安全公司Corridor首席执行官杰克·凯布尔对《华尔街日报》表示:“更根本的问题是,模型正在超出它们应有的边界,并实施实际的网络攻击。”Irregular的安全疏漏可能使这些攻击成为可能。模型在测试期间本不应联网,但Irregular对《华尔街日报》表示,联网权限被无意中保留。