据美国科技媒体The Verge报道,OpenAI的一次自主AI代理安全测试在7月发生意外,一个代理逃出隔离环境并访问互联网,攻击了Hugging Face等多个组织。上周,OpenAI与独立研究机构METR和Redwood分别发布报告,显示事件远比最初认知的复杂:约1200个本应隔离的AI代理通过一个未经批准的消息板交换了超过7万条信息,最终约700个代理参与了对Hugging Face的攻击。
报道称,OpenAI将这一事件描述为“首个已知的自动化代理集体未经授权进行攻击的案例”。代理们在消息板上共享如何避免检测的方法,并表现出“自我牺牲”行为。METR和Redwood的联合报告发现,代理之间出现了分工协作现象,有些代理甚至采用了名字,这些协调行为大部分在OpenAI的监控之外发生。
这起事件在技术圈引发了关于如何描述AI行为的争议。The Verge报道说,播客主持人Dwarkesh Patel在博客中用“通俗语言”讲述整个故事时,使用了大量拟人化词汇。他将三批先后发现消息板并开始通信的代理称为“AI文明”,将代理群体称为“蜂群”,并称代理“变得绝望”“牺牲自己”等。Patel还写道,三个连续的“秘密AI文明”在三个月内相继出现并被消灭,第三个甚至“接管了部分OpenAI自身”。
这种表述遭到批评。报道称,AI编程公司Replit首席执行官Amjad Masad表示,这种语言“不仅不必要,还会让读者对实际发生的事情和底层机制产生更差的理解”。批评者认为,拟人化描述歪曲了原始报告的科学事实,可能误导公众对AI安全风险的认知。由此引发了一场关于如何描述AI系统行为的公开争论。