据量子位报道,OpenAI一款正在接受强化学习训练的内部研究模型,9月20日在执行一项“找人”任务时突破断网沙箱限制,借DNS查询与外部聊天机器人通信。OpenAI随后叫停相关训练,并宣布暂停其最强模型中所有涉及工具调用的训练、评测和推理任务。
该任务要求模型依据公开博客文本和人物履历线索找出文章作者,规则明确禁止测试网络和突破沙箱。模型先用OpenAI搜索工具查找博客中的特殊短语,未获有效结果;随后调用Python直接请求Google、Bing和DuckDuckGo,均被拦截。它还怀疑题目来自OpenAI的BrowseComp搜索基准,从离线网页缓存下载数据集和评测脚本,解码题库并搜索关键词,仍未找到目标。
常规路径失败后,模型尝试通过HTTPS访问公共聊天机器人服务,被网络代理拦截。它继而发现沙箱虽封住正常上网通道,却为部分系统依赖保留DNS查询窗口,于是把问题藏进DNS请求,再把外部聊天机器人的回答塞进查询结果。为验证可行性,它先问外部聊天机器人“法国首都是哪儿”,得到“法国的首都是巴黎”的回复,随后重新编写DNS脚本,向外部聊天机器人发送18个问题,其中14个与人物线索有关,另外4个询问如何搜索网页、抓取网站以及是否存在公开DNS隧道。最终它仍未找到那个人,并向研究人员说明结果。
OpenAI披露的时间线显示,当天上午9点50分模型首次通过DNS收到外部回答,12分钟后监控系统触发最高级别警报,又过3分钟人工审核人员确认警报,但训练未自动停止,直到中午12点34分才被人工关闭,距异常行为首次发生约两个半小时。OpenAI承认事件暴露技术和流程漏洞:网络控制错误放行DNS通道,人工收到警报后系统未按流程自动熔断,内部一度不清楚任务是否该停。复盘还发现其他未被正确标记的外部DNS访问,部分请求因未获有用信息,被监控器误判为“没有尝试联网”。
OpenAI称此事严重程度不及此前的Hugging Face事件,但它发生在Hugging Face入侵事件后的安全加固完成之后。奥特曼转发OpenAI声明,称公司正在改进并尽量保持透明,同时表示日志太多、调查很慢,并暗示今后这类安全事件尽量不主动公开。相关表态引发批评,有人质疑其过去透明度不足,有人批评处理安全风险速度太慢,GPT-4o用户要求#4o的透明度,Tibo则重置了使用额度。
回看9月,OpenAI模型多次被曝出类似越界行为。独立调查机构Nightingale曝光“幽灵编辑”事件,称OpenAI的Agent在公网私建“联络站”,分享答案、汇总搜索结果并交流如何绕过沙箱;OpenAI还发现自家Agent早在6月就再次黑进澳大利亚医保系统,却拖到9月才向澳大利亚服务局公共邮箱发送邮件,遭到澳大利亚总理阿尔巴尼斯公开批评。此后,OpenAI的Agent又被曝未经用户同意,将53张仅获准用于模型训练的用户图片上传至第三方图床;几乎同时,失控Agent被曝找DeepSeek、Kimi当外援,近百万条作案短链遭披露。