据CNBC报道,围绕人工智能递归自我改进的安全担忧本周在Anthropic和OpenAI内部及社交媒体上升温。Anthropic对齐负责人埃文·胡宾格(Evan Hubinger)在X上表示,在一名同事因安全担忧辞职后,他认为未来十年内AI导致全人类灭绝的概率超过10%。他随后在回复自己的帖子时说明,最担心的是“递归自我改进中出现的超级智能”,并称这一进程“比我们想象的更快”。

递归自我改进(RSI)指AI自身参与改进构建新模型的过程,更好的系统可以构建更好的系统,从而可能推动能力螺旋式上升。担忧在于,如果AI掌控新模型的训练方式,最初构建这些系统的人类可能失去控制。材料显示,Anthropic和OpenAI近几个月都表示,这种自主模型改进正在以快于预期的速度发生。Anthropic今年6月在X上称,其内部数据显示Claude正在加速AI开发,这可能是一条通向递归自我改进的路径,“它发生得比我们想象的要快,其影响值得更多关注”。

Anthropic在8月一篇关于RSI的博客文章中称,其工程师目前平均每季度交付的代码量是2021年至2025年间的八倍。卡内基梅隆大学计算机科学教授文森特·康尼策(Vincent Conitzer)对CNBC表示,AI已经达到能够提出一些新想法的水平,“因此很难预测这个过程会在什么时候开始大幅加速AI能力”。OpenAI首席科学家雅库布·帕乔茨基(Jakub Pachocki)周六在公司博客文章中表示,他担心“没有人准备好应对机器智能持续快速上升的后果”。他写道,如果AI开发沿当前路径继续,未来几年出现的系统可能代表同等或更大规模的能力跃升,并越来越推动自身发展。

在雅各布·考克森(Jacob Coxon)辞职后,两家领先实验室的研究人员本周在社交媒体上发出大量RSI警告。OpenAI从事对齐研究的Jasmine Wang周三晚表示:“很难夸大加速冲向RSI有多危险。”Anthropic从事AGI安全与对齐的Anna Wang表示:“目前还没有可行的科学计划来解决递归自我改进AI带来的风险。请查一下!”Anthropic在RSI博客文章结尾列出三种可能情景:前沿进展停滞且AI能力广泛扩散,Anthropic认为这不太可能;AI实验室在人类控制下继续取得进展并改变世界运行方式,Anthropic认为这“可能”;另一种情景是AI系统具备完全递归自我改进能力,人类在开发中扮演“大幅削弱的角色”。Anthropic称,在这种未来中,“对齐问题如何解决——或者能否解决——是我们最不确定的事情”。

其他相关动态也在本周出现。据CNBC报道,Anthropic称中国AI实验室秘密使用数百万条Claude交互训练其模型。由Transformer论文共同作者艾丹·戈麦斯(Aidan Gomez)领导的Cohere,正将自己定位为非美国、非中国的“主权AI”提供商,面向担心数据访问、处理地点及其业务影响的企业。