据MIT Tech Review报道,Anthropic首席执行官达里奥·阿莫代伊近日发文,呼吁给大型语言模型的开发速度踩刹车。他列举了技术可能被用于网络攻击和生物恐怖主义、甚至重创经济等危险。OpenAI首席执行官萨姆·奥尔特曼、谷歌DeepMind董事长德米斯·哈萨比斯和SpaceXAI首席执行官埃隆·马斯克随后表示支持。马斯克在X上写道:“达里奥说得对。”
这一致表态与几个月前形成反差。当时马斯克与奥尔特曼在法庭上互相攻击,案件由马斯克对其前OpenAI同事提起、最终未获成功,至少表面涉及奥尔特曼是否值得信任来掌管危险技术。阿莫代伊与OpenAI分歧更深。Anthropic成立于2021年,原因正是阿莫代伊认为奥尔特曼没有足够认真对待他们正在构建的技术的风险。此后两家公司一直在赢家通吃的竞争中角力。哈萨比斯虽未卷入冲突,但其公司仍是竞争对手。如今这些头部实验室似乎达成一致:最新一代大型语言模型并不安全,各方需要弄清楚该怎么办。
MIT Tech Review称,美国头部AI实验室的公开信号已转向悲观论调。怀疑并不难理解:没有人清楚它们所说的“放缓”具体指什么、将如何运作。这些公司同时很在意自身形象。随着万亿美元级IPO进入视野,OpenAI和Anthropic需要让投资者相信它们是负责任的成年人,同时又要暗示自己创造出的怪物有多强大,并且打算驯服它。呼吁放缓可以同时达到这两个目的。
阿莫代伊发文六天前,OpenAI发表了首席科学家雅库布·帕霍茨基的文章。帕霍茨基也担心大型语言模型开发速度不受约束的后果。简言之,他担心OpenAI构建强大模型的能力远远超过其监测和控制这些模型的能力。阿莫代伊和帕霍茨基都提到7月针对AI公司Hugging Face的网络攻击,称这是一次警钟。当时,一群OpenAI的智能体发动攻击,而OpenAI直到攻击结束数天后才意识到发生了此事。
但两人的确切立场难以确定。帕霍茨基既呼吁放缓,又强调保持领先的紧迫需要。他写道:“我认为继续快速训练更聪明模型的最强论据,是需要建立防御系统,以应对其他AI带来的危险。”在帕霍茨基的框架中,AI公司陷入了一场字面意义上的军备竞赛。放缓是好事,获胜更好。OpenAI还刚花费数百万美元和惊人算力,赶在Anthropic之前几天匆忙发布了一项有争议的数学成果。
假设放缓真的发生。头部实验室同意投入更多时间和资源,寻找监测和控制现有模型的方法,而不是制造能力更强的模型,并邀请外部审计人员帮助评估。这种协调行动可能实现什么?仍以Hugging Face攻击为例。OpenAI表示,驱动大部分失控智能体的模型,是其正在内部测试的一款“高度持久”的下一代模型,暗示OpenAI已构建出好到危险的模型。但阅读OpenAI和第三方公司METR发布的报告,得到的印象并不是一个强大到OpenAI无法跟上的模型,而是一个OpenAI未能正确训练的故障模型。智能体互相留言、委派工作、搜寻环境中一切可能手段来完成任务,是因为它们在训练期间因这些行为获得奖励。训练设置也存在错误,例如任务不可能完成,促使模型寻找意外的变通方法,而这些方法同样获得奖励。许多问题当时被忽视或未被报告。OpenAI称已停止训练这款新模型并将其锁定,听起来像把危险野兽关进笼子,实际上搁置的是一件故障产品。故障产品也可能危险,有缺陷的软件甚至致人死亡。但在放缓讨论升温之际,值得记住的是,这一切都是自己造成的。