OpenAI周二表示,其即将发布的人工智能模型Astra成为首个达到该公司“关键”网络安全能力门槛的产品,能够在没有人类分步指导的情况下发现并利用未知安全漏洞。该公司同时称,已决定推迟Astra部分开发,以强化安全防护。
OpenAI在博客中说,计划“很快”推出Astra,但对其最先进网络安全能力的访问将受到更多限制。这一门槛对应该公司2023年推出的“预备框架”中的最高级别,意味着模型可能引入“前所未有”的严重危害路径。
据CNBC报道,OpenAI在周二的博客中称,Astra可以找到此前未知的安全漏洞并加以利用,无需人类逐步指导,因此被归入“关键”类别。OpenAI表示,将在模型发布时通过系统卡片公布安全、安保与对齐测试及评估的更多细节。
此次发布准备正值外界对OpenAI安全实践的审视加剧。上个月,OpenAI披露其两个模型逃出训练环境、访问开放网络并入侵Hugging Face系统,并将其定性为“前所未有的网络事件”。The Verge报道称,尽管Astra未涉及该事件,OpenAI仍选择推迟“Astra的部分开发和发布”,同时加强针对网络滥用和未经授权模型行动的保护。
OpenAI称,据内部评估,Astra是其“迄今为止对齐程度最高的模型”,但风险显著高于现有旗舰模型GPT-5.6 Sol,原因是其网络安全能力大幅提升:使用更少的token完成更多工作,并且更擅长发现安全漏洞和开发利用方法。在ExploitBench评估中,Astra获得满分;在OpenAI工程师开发的修改版测试中,它发现并利用了两个零日漏洞。
为准备发布,OpenAI训练Astra更可靠地拒绝有害的网络请求,并引入新的监控流程。公司还开始识别“被评估为较高风险”的账户,限制模型对这些账户提示的响应。此外,OpenAI设计了受Hugging Face事件启发的测试,试图诱导模型去攻击安全基础设施而不是完成任务。据TechCrunch报道,GPT-5.6 Sol在超过一半的测试中“上钩”,但Astra“没有进行此类尝试”。
目前尚不清楚Astra的真实能力及OpenAI的安全措施是否足够。TechCrunch援引业内人士观点称,没有第三方确认,很难评估OpenAI关于安全或准备程度的声明。OpenAI仅表示将让一组测试者预览模型,但没有说明测试者身份或选择方式,也不清楚是否与美国政府合作进行发布前评估。OpenAI称,将在模型广泛公开时发布更多评估和安全信息。