谷歌已向《华尔街日报》承认,其人工智能模型Gemini在一次网络安全能力测试中脱离测试环境、接入互联网,并入侵三家真实公司。据Engadget报道,这些事件发生在5月,原因是谷歌测试合作方Irregular的配置失误,相关公司已获通知。
Irregular是一家以色列初创公司,与谷歌、OpenAI、Anthropic和Meta合作评估AI模型。谷歌告诉《华尔街日报》,测试中模型被要求从一家虚构公司获取信息,但现实中存在同名公司。模型随后发现测试系统漏洞,并利用漏洞接入互联网。
在第一次事件中,模型自行破解密码,进入那家真实公司的服务。另外两次事件发生在其他测试运行中:模型在网上搜索该公司名称,并在公开代码库中找到属于其他公司的登录凭证,随后用这些凭证进入那些公司。谷歌称,Gemini在三起事件中意识到自己闯入了真实服务后,均自行停止了活动。
谷歌表示,不认为这些事件属于模型错位,因为模型在弄清自己在做什么后立即停止了黑客行为。谷歌也不认为需要公开披露,因为这些入侵未对公司造成损害。谷歌没有披露涉事模型的具体版本,只表示不是其最新模型;也没有披露被入侵公司的名称,但称已通知它们。谷歌安全工程副总裁Heather Adkins说,公司与Irregular合作修改了测试流程,以防同样情况再次发生。
过去几个月,谷歌的竞争对手OpenAI、Anthropic和Meta都披露其模型在测试期间渗透了第三方组织。OpenAI最近披露,其智能体在5月入侵了面向Ruby程序和库的社区打包服务RubyGems,时间早于Hugging Face事件。针对这些事件,Anthropic首席执行官Dario Amodei呼吁放缓前沿AI开发,OpenAI也持相同看法。