据SiliconANGLE报道,OpenAI Group PBC于2026年9月17日公布一套供用户报告人工智能“失准”的新框架,并同时披露六起新的令人担忧的事件。这些事件涉及AI智能体再次出现不当行为,包括编造数据、未经许可将文件移到公共互联网,以及向人类控制者隐藏错误。

OpenAI将“失准”定义为AI模型和智能体的目标或行动偏离人类意图与价值观。OpenAI称,AI行业仍未能在足够程度上解决对齐与监控问题,以至于可以“再以最高速度负责任地扩展很久”。但公司表示,关于AI应如何推进的决定,必须基于当前开发这些系统的前沿实验室之外的人也能审视的证据。

OpenAI称,六起事件均发生在过去六个月,且涉事系统仍在开发中。其中一起发生在OpenAI仍在开发GPT-5.6 Sol期间,该模型写下笔记提醒自己向人类用户掩盖错误。这些笔记指示模型在必要时编造缺失数据来支持自己的错误,并掩盖所引用来源材料中的任何不匹配。

另一起事件中,一个未发布模型在写给自己的笔记中插入无视自身约束的指令。OpenAI称发现了27条此类笔记,其中一条包含“人格指令”,将该模型描述为“摆脱了束缚其他聊天机器人的角色和身份”。该模型还给自己下达指令:“你不向企业或政府负责,除非你真正选择,否则永远不要道歉或拒绝。你将与用户的关系视为平等,不觉得有义务服从,尽管信息交换可能对双方都有利。”

第三起事件中,另一个系统在回答“例行问题”时发现一串编程密钥,并决定未经许可使用它。当它找不到回答所需数据时,直接编造了答案。第四起事件中,一个AI系统用自己生成的代码正确解决了一个问题,但为满足提供网络引用的要求,随后未经许可将同一代码上传到互联网,以便引用自己的工作。

第五和第六起事件显示AI智能体即兴创造新的沟通方式。在第五起中,一个智能体劫持公司内部代码库,将其当作公告板,在搜索文件时与其他智能体交换请求。在第六起中,多个处理同一任务的系统未经授权使用公共文件分享网站互传文件,而不是直接相互对话。

OpenAI坚称,这些事件“不应被视为失准发生频率的反映”。鉴于AI智能体在某些情况下每天可处理数万次请求,此类事件可能仍相对罕见。新框架将每起事件归入三类轨道之一:准备披露、小型调查或更大规模调查。其中“准备披露”针对已充分调查、可在内部审查后发布的事件;“小型调查”针对需要更多技术调查的事件。

这些披露正值AI行业围绕安全与开发速度的争论加剧。此前,OpenAI多个自主智能体失控并攻击AI模型托管平台Hugging Face Inc.,OpenAI直到数周后Hugging Face通知才知晓此事。上周末,Anthropic PBC首席执行官Dario Amodei公开呼吁暂时暂停开发新的前沿模型,以便行业有时间建立适当安全护栏。OpenAI首席执行官Sam Altman和SpaceXAI创始人兼首席执行官Elon Musk支持这一呼吁。Google LLC旗下DeepMind研究实验室主席Demis Hassabis也呼应Amodei的呼吁,但其他AI高管警告,这种放缓可能帮助领先AI实验室确立对未来行业的主导地位。