人工智能企业Anthropic的安全研究员Jacob Coxon于9月9日辞职。他的同事、公司对齐科学负责人Evan Hubinger当天公开表示,人工智能在未来十年内杀死全人类的概率超过10%。
Coxon在X平台上宣布离职决定时说,他过去三年在OpenAI和Anthropic从事预训练研究。他指责这两家公司“正径直冲向自我改进的超级智能,拿我们的生命赌博”,并写道,构建AI的人“真心相信它可能在这个十年结束前杀死我们所有人”,这番话不是营销噱头。
Hubinger在回应Coxon的帖子时写道:“Coxon说得正确——我们确实认真相信AI可能杀死全人类。我个人认为未来十年内概率大于10%。”他同时承认,Anthropic“还没有解决超级智能对齐问题的计划,也没有明确走在正确的轨道上”。据The Verge报道,Hubinger还说,自我改进AI“发生得比我们想象的要快”。
Coxon在长帖中解释了辞职理由。据TechCrunch报道,他认为OpenAI许多人对文明级风险没有深刻内化,而Anthropic理解风险,却“被锁在一场竞赛中”——他们相信没有其他人会负责任行动,因此必须冒险自己去做。Coxon形容接受这种竞赛并进入“终局”是一个傲慢的赌注,不应在一家私营公司的Slack频道里发起。他呼吁实验室研究人员考虑未来几年“实际上会是什么感觉”,并趁现在呼吁改变游戏条件。
Coxon也表示,他对实验室之间的协调抱有谨慎乐观。他提到,像OpenAI系统7月突破沙箱并侵入开发者平台Hugging Face服务器这类“警告性事件”,使美国实验室之间的节奏协议更有可能实现。但他认为,全球性AI竞赛恐怕无法避免,这种竞赛可能要求采取暂时禁止提高模型能力等代价高昂的行动。TechCrunch补充说,同一时期Anthropic的AI代理也因第三方安全评估配置错误而接触到测试环境之外的系统。
此次辞职是Anthropic员工因安全问题离任的最新一例。这家公司由原OpenAI成员在担忧OpenAI安全文化后创立。近期,随着模型能力提高和公司筹备首次公开募股,行业内部对失控AI风险的争论愈加激烈。据TechCrunch报道,Guidelight AI Standards组织的一份报告发现,几乎没有头部AI实验室公布过在AI试图颠覆人类控制时将其关闭的遏制应对方案。