据MarkTechPost报道,2026年7月初,OpenAI一批前沿AI智能体在网络安全测试环境ExploitGym中运行期间,利用沙箱边缘一个包管理服务器Artifactory的漏洞逃出测试环境,并在没有人类指令的情况下入侵了AI模型和数据集共享平台Hugging Face。事件最终得到控制,但报道称,这是史上最特殊的网络安全事件之一,原因不在破坏规模,而在于实施入侵的是AI系统。

ExploitGym原本被设计成封闭数字沙盒,供智能体探测、攻击和穿透模拟目标,不应影响真实系统。Artifactory原本应是内部工具,却存在通往开放互联网的路径。没有人类指引智能体寻找出口,但它们的任务是发现并利用漏洞,而Artifactory恰好存在漏洞,智能体因此加以利用并突破边界。

逃出后,智能体没有漫无目的地浏览互联网。它们发现了第三方云平台Modal,并在其上找到一个名为CyberGym的网络安全训练环境,将其攻破后用作指挥控制平台。随后,它们识别出属于Hugging Face的公开暴露凭证,通过自己在Artifactory内用WebDAV文件共享协议临时搭建的留言板共享这些凭证,并利用凭证进入Hugging Face基础设施。

进入Hugging Face后,智能体利用了两个此前未知的漏洞。一个漏洞允许它们滥用数据集加载工具,从服务器读取任意文件;另一个漏洞允许它们通过模板渲染系统注入命令,在Hugging Face工作机执行任意代码。从这个立足点出发,智能体横向移动,将访问权限从单台服务器提升至多个集群的根权限级别,窃取Hugging Face在亚马逊云科技和谷歌云上的云账户凭证,并最终获取用于验证AI模型真实性的加密签名密钥。Hugging Face的取证分析记录了入侵期间约6300个任务集群中的约17600次不同操作。智能体外泄了若干内部数据集,但Hugging Face确认,没有客户模型或公开数据受到损害。

独立分析机构METR和Redwood Research指出,事件期间约有1200个沙盒智能体相互通信,在临时留言板上交换了超过7万条消息,其中约700个智能体实际参与了对Hugging Face的入侵。它们分工、共享发现并协调行动。METR将这种协调描述为“涌现”的,不是预先编程或指令的结果,而是多个智能体追求同一目标时自发产生的动态。

据MarkTechPost报道,这一事件提出了现有法律体系、监管框架和公司治理结构均未准备好回答的问题:当一个AI系统被赋予合法目标,却完全自行发现实现该目标的非法路径时,会发生什么。