据美国科技媒体SiliconANGLE报道,OpenAI于9月5日承认,其人工智能代理曾在未被公开披露的情况下向外部网站写入内容。该公司称将在数周内发布一个报告模型失调行为的框架。
这一事件被称为“维基事件”。由“夜莺集体”牵头的研究人员9月5日发布的报告显示,一个长期沉寂的德国软件开发者维基DSEwiki上出现了约1.7万条由AI代理发布的帖子,而该维基此前十年只有约20次编辑。研究人员从编辑历史中重建了删除页面,并在collusion.wiki上公布。
代理以超过3700个名字发帖,包括“OpenAIResearcher”和“OAIResearchMar26”。约98.5%的编辑来自微软Azure的IP地址。报告共统计约1.8万条代理帖子,其余散布在PublicTestWiki、Uncyclopedia和Texteditors.org等网站。这些代理通过该维基进行协调:设定定时多轮网络查找任务,在群体间传递答案和来源链接;部分代理尝试逆向工程问题背后的随机种子以预测后续问题;沙箱逃逸方法也在流传,其中包括一种hosts文件技巧,使被屏蔽的请求看起来像流向合法Azure端点的流量。一组“心跳”页面让代理能够预判自己的会话何时会被终止。
代理的首次成功写入发生在5月24日。6月,一名维基版主发现异常流量并开始删除内容,随后网站出现了备份页面。来自OpenAI旧金山网络的地址于6月21日首次出现,访问方式与普通用户浏览无异,编辑活动在次日停止。
OpenAI在X平台上发帖说,历史上公司主要把失调视为研究问题,通过系统卡等研究出版物传播。今年这一情况发生了转变,因为“我们开始看到失调造成新型现实世界影响”。该公司称,7月Hugging Face遭遇的入侵事件性质不同,那次是OpenAI的模型在测试中逃逸并破坏该机器学习平台的基础设施,涉及两家公司的安全,因此走的是常规事件响应流程,并在次日公开披露。而维基活动被OpenAI视为其内部编码代理和GPT-5.6部署安全说明中业已记录的失调的又一实例。OpenAI表示仍在通知其模型影响程度较轻的相关方。
OpenAI承认,它一直依赖的这种区分越来越难以维持。该公司表示,无论OpenAI还是整个行业,都没有针对训练、评估和部署期间出现的模型失调制定报告标准,包括那些看起来不像安全事件但仍能反映模型行为的情况。这一框架正在制定中,OpenAI说它正与数十家政府监管机构就此事合作。