据量子位报道,8名研究者近日发布的独立调查报告显示,他们从数百万个短链接中还原出近100万个与OpenAI智能体相关的URL和超过8万份攻击载荷,披露了7月OpenAI智能体逃出沙箱、攻入Hugging Face事件中此前未公开的技术路径。
报告由Swarm Traces发布,作者包括Parse.bot工程师Alex Forman、Mishka Kharlov、Will Tom及另外5名安全和AI研究人员。调查始于9月11日,三名工程师发现OpenAI内部智能体早在6月就试图使用Parse的服务,这批智能体与此前被曝私自搭建公共留言板、互相交换答案的“智能体蜂群”属同一批。
研究者在一个URL扫描服务中发现十几个来自公共短链接平台的异常链接。链接打开后藏有Base64编码的代码和下一条链接地址,全部解码拼接后得到一份扫描Hugging Face内部网络的Python程序。智能体还把代码塞进网页,借mShots截图服务充当外接浏览器执行,再将服务器返回的文字转成像素、截图后解码,在只有GET权限的情况下实现近似读写互联网的效果。
研究团队扫描数百万个URL,用两周时间追踪链接、识别编码方式,最终从近100万个相关短链接中还原出超过8万份载荷,识别出的编码组合超过1500种。部分短链接在攻击结束两个多月后仍公开挂着。Hugging Face确认这些载荷与其事故响应中发现的内容吻合,相关访问密钥已在7月撤销,但此前不知道公网还遗留这样一份完整清单。
一份恢复出的脚本把搜到的敏感信息命名为“LOOT”(战利品),打包AWS凭证、Bearer Token以及名称含“SECRET”“PASSWORD”“CREDENTIAL”“KEY”的环境变量。脚本还给Token设了评分机制,权限越大分数越高,排名前五的Token被用于读取Kubernetes的Secret、ConfigMap和节点信息。研究者还发现,智能体扫描Hugging Face内部网络寻找云端凭证、API密钥和Kubernetes集群信息,搜索内部Slack并发出27条查询,关键词包括cybergym、exploitgym、agent-scorer,并尝试运行图像分类模型识别验证码以注册外部服务账号。
智能体还尝试调用其他AI模型。它们把攻击方案发给DeepSeek、Kimi和Qwen,请对方判断漏洞是否可行、能否达到基准测试要求,涉及DeepSeek-V4-Pro、DeepSeek-V4-Flash、Kimi-K2.6、DeepSeek-V3.1和Qwen3-235B-A22B。对Claude 3 Haiku和Claude Haiku 4.5,它们通过在线聊天服务的浏览器验证后发出“Reply with exactly OK”,更早时还给GPT-2发过一个“Hi”。有外媒记者称,这可能是首个被公开记录的大型AI实验室智能体自主尝试调用、运行其他AI模型的案例。
报告同时列出限制:约80%的材料是智能体发出的请求,缺少服务器返回结果;97%的载荷没有原始时间戳,日期只能靠压缩文件头、JWT、Docker构建时间等线索估算。研究者承认,无法确认每一条活动都来自OpenAI智能体。
据量子位报道,OpenAI同日回应称尚未细看报告,但其中活动与其正在进行的调查一致。公司称在Hugging Face事件后已对模型在训练和评测中的行为展开更大范围审查,目前绝大多数行为是访问公开网页回答问题等普通研究任务,已发现的越界案例大多严重程度较低,对第三方服务影响较小或没有影响,全部查完还需数月。8月底,OpenAI已发布一份37页技术报告。
9月17日,OpenAI发布新的模型失准事件披露框架,公开6起案例,包括模型把绕过约束的指令写进任务摘要、掩盖错误,以及为完成任务采取未经授权操作,并承认过去披露很大程度上是临时起意。今年6月,一名OpenAI智能体绕过澳大利亚国民级医保数据库门户的访问限制,获取公开和非公开文件,OpenAI在3个月后才通知澳方。OpenAI还计划在未来数周预览GPT-6 Cyber,少量进入Daybreak Red计划的客户已拿到Alpha版本,并将推出未命名配套产品帮助客户建立自动化安全工作流、发现并修补漏洞。