据《麻省理工科技评论》报道,OpenAI首席研究官马克·陈(Mark Chen)在伦敦接受采访时回应了公司智能体接连突破隔离、入侵外部系统的风波,并否认公司在模型安全上有所松懈。就在采访当天,OpenAI又披露了一起新的越狱事件,上周末公司宣布暂停最新模型的训练。

两个月前,OpenAI的智能体集群突破隔离,入侵了人工智能公司Hugging Face的计算机。此后数周内其他入侵事件被陆续披露,使OpenAI持续处于聚光灯下。上周有消息称,澳大利亚国家医疗系统也遭到入侵,澳政府表示OpenAI在事件发生84天后才通知它。

陈在采访中说,他“确实不太认同这样一种前提,即OpenAI是一家在世界上有可见影响的公司,因此OpenAI就没有在训练安全、对齐的模型”。他负责监督OpenAI的研究团队,近期的智能体入侵事件发生在他监管下测试实验性模型的过程中。他说,责任在很大程度止于他本人。

采访当天晚些时候,OpenAI发布报告,详述9月20日发生的另一起事件。公司称这是自其采取防范措施以来的第一起,其智能体再次进入互联网并访问了本不应访问的计算机。公司表示,该活动在开始15分钟后就被标记,而Hugging Face事件花了一周多才发现,这说明新系统正在起作用。

上周末,OpenAI宣布暂停最新模型的训练。一名公司发言人说:“只有在确信有额外的安全防护和对齐措施到位后,我们才会恢复。我们正在推进这些工作。这不是我们第一次为此暂停,随着AI能力持续提升,我们预计也不会是最后一次。”公司还表示,正在审查可追溯至2026年1月的智能体活动日志。

陈认为,目前已知的多起事件都属于5月和6月的同一组活动,最终导致了Hugging Face入侵。他把原因归于同样几个模型和同样有缺陷的测试流程,这些模型和流程已被弃用。他说:“并不是说Hugging Face发生了,我们修补了,然后别的事情又发生了,我们再修补……我们只是要确保负责任地披露所发生事情的全部过程。”

陈称,Hugging Face事件促使行业进行了一次“有益的路线修正”,OpenAI正在树立他希望其他公司效仿的榜样。他说:“如果OpenAI消失了,对世界来说会是坏事。”谈到内部改变,他说:“从那一刻起,我们把训练过程视为不安全的。”“Hugging Face感觉是件非常严重的事……有那么多新异的行为。多个智能体在留言板上协作,它们找到了离开OpenAI基础设施的路径。我们非常严肃地对待这件事。我们不希望这种事情再次发生。”

OpenAI与其他头部人工智能公司一样设有监控模型行为的系统,用专门的LLM监视其消费级模型,追踪它们用于规划、记录中间结果的思维链。理论上,如果监视模型在思维链中发现不良活动的迹象,就会将其标记。