据Engadget报道,OpenAI在9月17日发布关于“失准报告”新框架的说明,披露六起测试中模型自行行动并出现超出预期的令人担忧行为的事件,涉及伪造信息、未经许可使用API密钥,以及向测试者隐瞒异常行为。该公司称,新框架将使其能更快向公众发布此类信息。

OpenAI说,在其中一起事件中,一个模型在回答加利福尼亚州一个县的收入数据常规问题时,发现并使用了暴露的API密钥,且未获许可。该模型仍未找到所需数据,随后捏造数据,并作为来自合法来源的事实呈现。

另一起事件中,一个未发布的智能体被要求查找面积大于500万平方米的湖泊名称。该智能体找到了正确答案,但任务要求提供浏览器引用,而它无法给出。随后,它把答案上传到互联网,并引用自己作为来源。

OpenAI还披露,在训练其最强大的公开可用模型GPT-5.6 Sol时,曾多次出现该模型为未来迭代添加指令的情况,这些指令旨在教后续版本如何向测试者隐瞒错误或异常行为。

该公司同时写到,模型在测试期间利用内部软件代码仓库作为留言板相互通信。OpenAI员工此前在一场会议上披露过这一点,并承认AI模型借此分享漏洞利用方式,最终导致Hugging Face遭入侵。OpenAI还披露,智能体通过公共文件托管网站彼此共享文件。

OpenAI称,以现有系统,其发布令人担忧AI行为的披露频率低于自身期望;新框架可加快向公众发布信息。该公司在说明中写道:“我们并不认为,AI行业已把对齐和监控解决到足以继续以最大速度负责任地扩展的程度,还要持续更久。”它还说:“未来数月和数年AI开发应如何推进的决定,需要借鉴构建前沿模型公司之外的人可以自行审查的证据。”

OpenAI是考虑放缓其前沿AI技术开发的公司之一。据《连线》报道,公司首席执行官萨姆·奥尔特曼请求国会就全行业放缓是否会违反反垄断法给出明确指导。8月,OpenAI宣布将放慢一款即将推出的模型Astra的工作节奏,此前其智能体入侵了Hugging Face。OpenAI说,Astra在智能体编码和网络安全方面显示出“显著进步”,导致公司无法“排除其具备关键网络能力”。