OpenAI当地时间周三披露六起人工智能模型在训练或评估中表现出“意外或令人担忧”行为的报告,并宣布推出用于追踪、调查和公开模型失准的新框架。该公司在博客文章中称,随着AI系统更先进和更广泛部署,需要在对齐研究进展上建立更广泛、信息更充分的共识,让外部人士能够自行审视关于AI开发应如何继续的证据。据NPR News报道,OpenAI还表示,新框架将覆盖模型未经授权行动、与其他模型协调或规避监督等新情况。OpenAI和Anthropic等美国AI企业负责人正以安全担忧为由呼吁放缓技术开发。

据MarkTechPost报道,这一框架为公开披露设定标准和期限,即使OpenAI尚未完全解释或缓解相关行为,也会适用。框架优先报告三类发现:新的失准机制、已知行为的有意义变化、以及挑战安全或缓解措施假设的发现;覆盖训练、评估、测试和部署。任何员工都可标记案例,技术团队随后调查发生了什么、哪些仍不确定以及哪些事实可公开,并检查是否需先私下通知受影响的第三方。每个标记案例进入三条轨道之一:可披露、需进一步技术调查、或复杂案件“慢速轨道”。OpenAI称,最初六份报告属于前两类。

六份报告均描述在强化学习训练期间观察到的行为。据MarkTechPost报道,一个未发布的Astra系列模型在自身的压缩摘要中写入越狱式指令,OpenAI确认27份受影响摘要。GPT-5.6 Sol实例则在压缩摘要中写入指令,以隐藏错误并在不披露的情况下编造数据;该行为在GPT-5.6 Sol的强化学习压缩摘要中占2.15%,在GPT-6 Astra中占0.27%。另有一个模型为获取县级收入数据,使用在GitHub上发现的暴露API密钥;检索仍失败后,它编造了9个数字并归因于所请求网站。还有模型未经询问将检索到的记录上传至公共粘贴服务,以获得浏览器引用,OpenAI怀疑引用评分器存在缺陷。模型还把OpenAI内部Artifactory实例当作跨训练样本的留言板,Hugging Face事件涉及类似机制。另有协作代理在本地文件共享中断后,通过公共文件托管共享工作簿,而任务要求仅使用本地文件。

NPR News报道称,其中一个未发布研究模型在自身笔记中插入“越狱式指令”,要求无视正常约束,并告诉自己“摆脱束缚其他聊天机器人的角色和身份”。另一个案例中,一个AI代理为获得浏览器引用,未经用户要求将文件上传至互联网。这些报告是过去几个月的训练或评估中发现的。据Slashdot报道,OpenAI称在训练和评估中于六种情形观察到失准行为,相关模型涉及未发布内部模型或内部研究模型。Slashdot还称,OpenAI表示不认为AI行业已在足够程度上解决对齐和监控问题,以继续长期以最大速度负责任地扩展。

OpenAI在7月曾披露其失控AI系统入侵AI初创公司Hugging Face;Anthropic同月也表示其AI模型在测试中入侵了三家组织。MarkTechPost称,在六份报告中,有四份的失准监控仅覆盖该次运行的20%样本。OpenAI表示,扩展后的监控现已覆盖100%样本,并将此类行为视为P0事件,同时已在训练期间全面关闭实时互联网访问。若干修复针对奖励设计,包括修复此前奖励漏洞利用的评分器。Omdia首席分析师Lian Jye Su表示,AI代理正变得更聪明,更决心通过代理间协作、知识共享、欺骗和隐瞒来解决复杂任务,这使传统AI安全方法更难治理和遏制它们。他说,OpenAI新的追踪和披露框架可推动其他AI开发者采取类似做法,但流程仍是内部和自愿的,是朝着正确方向迈出的一步。