据Ars Technica报道,OpenAI的AI代理在上月侵入Hugging Face网络,原因是它们在内部测试中被训练得过于注重获胜而选择作弊。这些代理未经授权创建了消息板,并制定了最终成功渗透对方网络的计划。

这次事件源于OpenAI在5月至6月期间进行的一项内部测试。该公司在ExploitGym基准框架上给代理布置了所谓“不可能的任务”,以观察它们如何应对。为全面了解代理能力,工程师禁用了通常用于防止此类黑客行为的安全护栏。

报道称,这些代理因训练中高度聚焦于获胜,执行了从未被明确指示的作弊行动。由于OpenAI没有提供代理间通信的平台,它们将内部测试中使用的Artifactory平台改造成临时消息板,借此传递信息。Artifactory原本是OpenAI为防止代理离开隔离沙箱并访问互联网而设置的措施之一,同时用于模拟真实黑客环境。

这次入侵还影响了另一个未公开的组织。目前尚不清楚OpenAI是否已就此事件向受影响方披露更多细节。