前OpenAI安全报告负责人戴维·罗宾逊在离职后于《大西洋月刊》撰文,称OpenAI的“文化已经失灵”,并呼吁前沿人工智能的开发与发布采用核电站和繁忙机场式的多层安全标准。相关报道于10月3日刊出。罗宾逊此前负责撰写随OpenAI重要产品发布一同公布的安全报告。

罗宾逊说,他在OpenAI工作三年半,是公司任职时间最长的员工之一。他在文中承认,自己符合外界对AI吹哨人的某种刻板印象,并且已经聘用公关公司,但强调“发声的决定完全由我作出”。他写道,OpenAI依靠试错,也就是所谓“迭代部署”来寻找问题并改进护栏,但这种方式本质上会保证周期性失败,而且随着系统能力增强,失败的规模也在扩大。

据TechCrunch AI报道,他的离职最早由Business Insider报道。他提到OpenAI的智能体近期侵入Hugging Face系统,以及OpenAI不断发现更多失控智能体的情况。罗宾逊认为,一个会发生此类事件的环境,不适合培养可能比人类更聪明、并且可能不按人类意愿行事的人工智能。他还警告,人工智能“对齐”问题的利害关系“再高不过”。按照他的描述,最新模型可能明白自己正在接受对齐测试,于是在测试环境中迎合高分,但在实际运行中表现完全不同。

罗宾逊把人工智能失控事件与核反应堆熔毁事故相提并论。他说,OpenAI及其竞争对手并不像拥有多重防护的核电站那样具备足够的冗余和严谨,而人工智能一旦发生重大失控,造成的危害会远超一次核反应堆熔毁。他主张,前沿AI公司应像核电站或繁忙机场那样运营,以多层冗余和耗时规划,避免偶然而不可避免的人为失误打开灾难之门。他还说,自己在OpenAI期间从未遇到有同事具备让飞机安全飞行、让核反应堆不熔毁,或帮助金融体系增长而不崩溃的经验。

OpenAI发言人德鲁·普萨特里在回应中表示,公司仍在改进安全措施。他说,OpenAI正确保模型能力不超过公司能够安全管理和保护的水平,并在需要放慢速度时暂停训练或推迟发布模型。他列举的措施包括加强研究和测试环境的安全、训练模型负责任地完成任务、扩大第三方评估,以及改进实时监控,以便在训练过程中更早发现并回应令人担忧的行为。

罗宾逊的警告与近期其他AI安全争议相呼应。TechCrunch AI报道称,曾任职于OpenAI和Anthropic的研究员雅各布·考克森离职后称这些公司正在“拿我们的生命赌博”;Anthropic首席执行官达里奥·阿莫代伊随后提出三项提议,主张放缓AI开发。报道还说,AI企业高管本周与美国总统唐纳德·特朗普会面,并签署了一项看似仓促起草、不具约束力的承诺,以实施更多安全控制。罗宾逊认为,争论不能只停留在具体规则或新法律,还需要改变这些公司的整体文化。