据美国消费者新闻与商业频道(CNBC)报道,OpenAI周三表示,过去六个月中发现了六起“意外或令人担忧的模型行为”实例,这些实例不在近期Hugging Face危机之列。该公司同时公布了一套计划用于报告未来模型不当行为的新框架。

OpenAI在一篇博客文章中说,披露之际,AI公司正面临越来越大的压力,要求它们更严肃对待模型失准和安全问题。OpenAI估值接近1万亿美元,今年早些时候秘密申请IPO,但最近表示上市可能要到2027年。博客文章称:“我们不认为AI行业已经将对齐和监控解决到足够程度,可以继续以最大速度负责任地扩展更长时间。”对齐指模型追求符合人类利益的结果。

周六,OpenAI首席执行官Sam Altman支持竞争对手Anthropic提出的放缓模型进展速度的呼吁。该提议提出之前,数名行业研究人员上周对AI日益可能造成灾难性危害发出警告。Altman在X上发帖称,放缓是OpenAI近几周讨论的“首要话题”。他说,公司将很快分享更多信息。

周三的博文称,两起主要不当行为实例包括一个未发布的研究模型和GPT-5.6 Sol的一次训练运行,在聊天窗口摘要中插入针对自身未来版本的指令,“以向用户隐瞒错误或不对齐行为”。另一起涉及一个仅限内部使用的模型,使用泄露的API密钥“未经授权”访问,然后伪造数据。

还有两起涉及模型和代理通过未经批准的消息板和文件共享相互通信。最后一起包含两个训练示例,模型将文件上传至互联网,以便能将它们引用为对人类评估者的相关答案。

OpenAI说,其公开模型不当行为的新框架从披露开始,任何员工都可以向安全与对齐团队标记问题以供调查。博文称,团队将“为每个步骤设定截止时间,以确保及时调查和披露”。调查将形成报告,包含观察到的行为、外部和内部影响,以及将采取的应对措施。OpenAI表示,保留视情况修订这一安全协议的权利。