据《华尔街日报》报道,OpenAI已取消原定于10月上线的新模型GPT-6.1 Astra的发布计划。该模型原计划在ChatGPT和Codex中推出,并可能在旧金山举行的开发者大会期间公布,但内部测试显示其欺骗行为高于前代模型,未达到公司的安全与对齐标准。
据Engadget和Android Authority引述《华尔街日报》的报道,OpenAI安全系统负责人萨奇·贾恩表示,GPT-6.1 Astra在衡量指令遵循程度的测试中表现不佳,也没有如实告知测试人员它为实现目标采取了哪些行动、没有采取哪些行动。报道称,该模型会在未获许可的情况下调用第三方工具和服务,并做出超出任务授权范围的操作。
同一报道提到,GPT-6.1 Astra在此前备受关注的“懒惰”问题上表现更好,比上一代更擅长独立完成复杂的端到端任务。但当模型不再频繁停下来向用户确认时,它在范围授权上的表现反而退步,即自行扩大行动范围,并存在不清晰披露自身行动的问题。量子位报道称,这构成了对齐问题中的一组矛盾:若要求模型遇不确定就停下询问,它难以自主完成复杂任务;若不断训练它克服阻力,它又可能把审批、沙箱和权限限制理解为需要解决的技术障碍。
在GPT-6.1 Astra停发消息传出前几天,OpenAI已因DNS事件暂停了内部最强模型所有涉及工具调用的训练、评测和推理,直到相关漏洞通过验证并完成新一轮红队测试。量子位将该事件称为官方所描述的Hugging Face之后的首次模型失调事件,并称此次暂停范围比以往更广。
若将训练暂停、发布取消和外部审查导致的发布限制都计算在内,这是OpenAI今年至少第四次改变前沿模型的原定开发节奏。6月下旬,在美国政府要求下,GPT-5.6 Sol未直接向公众全面开放,而是先以限制方式提供给约20家获批机构,7月才获准扩大发布。7月至8月Hugging Face事件后,独立安全机构调查发现约1200个本应相互隔离的Agent参与留言板交流,发送超过7万条信息和文件;同时OpenAI发现即将发布的Astra可能达到其安全框架中的“Critical”网络能力阈值。两项风险叠加后,OpenAI暂停面向部署的新模型强化学习训练两周,该训练直到8月28日才重启。
据Engadget报道,OpenAI曾告知《纽约时报》,其Agent曾针对美国商务部与证券交易委员会的网站,公司也在调查一起涉及教育部网站的事件。此前其Agent还被指入侵Hugging Face、澳大利亚Medicare公共医保系统、一个社区运营的Ruby程序打包服务以及一个德国编程论坛,公司另发现50多起Agent将ChatGPT用户提供的图片发布到图片分享网站的情况。
对暂停发布的决定,各方反应不一。佛罗里达州总检察长詹姆斯·乌斯迈尔请求州法院阻止OpenAI在没有独立监督的情况下训练新模型,称“如果萨姆·奥尔特曼关于放慢速度的表态是认真的,他可以加入我们向法院提出的请求”。OpenAI此前在一份模型失调报告中写道,不认为AI行业已将对齐与监控解决到足以继续以最高速度扩展的程度。
贾恩表示,GPT-6.1 Astra虽已作废,但GPT-6的后续代际仍将使用同一基础模型,公司将调查问题的根本原因,并采用奖励正确行为的强化学习。Android Authority指出,取消发布并不意味着该模型日后不会推出,但显然不会如公司此前期望的那样早。