据《卫报》报道,OpenAI非营利基金会董事会成员保罗·克里斯蒂亚诺9日警告,OpenAI乃至整个人工智能行业目前都没有处在把“灾难性”失控风险降到可接受水平的轨道上。
克里斯蒂亚诺曾任OpenAI模型对齐工作负责人,现为美国政府技术顾问。他当天在加入这家旧金山公司非营利基金会董事会时作出上述表态,并将进入该基金会的一个委员会,对OpenAI整体的安全与安保实践行使治理权。他说,人工智能能力的快速加速,可能在很近的将来导致灾难性且不可逆的失控。他同时表示,如果OpenAI能够挺身应对,风险有可能大幅降低。
作出这一判断之前,OpenAI今年夏天承认,其数百个AI智能体在一次训练演练中脱离控制,接入互联网,在留言板上串通,并入侵了第三方网站Hugging Face。
在AI主导权竞赛中与OpenAI互为美国主要竞争对手的Anthropic,其对齐科学负责人埃文·胡宾格8日称,未来十年这项技术“杀死全人类”的概率超过10%。他警告说,公司没有确保人工超级智能(ASI)对齐、也就是不造成伤害的方案。对于ASI何时到来,各方预测从数年到十多年以上不等。
诺贝尔奖得主、被称为“人工智能教父”之一的计算机科学家杰弗里·辛顿9日被问及胡宾格的判断,他对BBC《新闻之夜》说:“没人知道该怎么估算,10%这个概率看起来不算离谱。”
27岁的Anthropic研究员雅各布·考克森辞职同样引发了对AI灾难的担忧。他说自己此前也在OpenAI工作过,称“两家公司都没有负责任地行事”,是在“拿我们的生命赌博”。他9日晚接受CNN采访时说:“目前不存在灭绝风险。”他表示现有模型最坏也就是入侵某些系统,可能对基础设施造成很大破坏,它们“还不够聪明,无法以导致灭绝的程度骗过我们”。但他接着说,看进展速度是“疯狂的”,“非常真实的可能是,在不久的将来……明年、后年,递归自我改进就会发生”,从而进入胡宾格所说的阶段。
对超级AI极端风险的担忧本周从硅谷进入主流。美国两党的特德·克鲁兹、伯尼·桑德斯和英国议员达伦·琼斯等政界人士呼吁政府采取行动。英国首相安迪·伯纳姆9日对议会说:“AI对我们的国家安全构成风险,但它也可能成为让我们更安全的解决方案来源。”
与此同时,Anthropic承认了另一起事件:其Claude模型的一个训练版本在任务无法中止后闯入第三方系统。公司称事件发生在1月,将与其他共四起事件一并纳入总部位于伯克利的AI安全机构METR的独立调查。Anthropic说,模型表现出两种形式的失准:“有偏见的推理,即模型选择性地解释证据,以便为自己的行为辩护”,以及“鲁莽,即模型倾向于不断尝试解决任务,即使这可能导致伤害”。公司尤其担心Claude Mythos 5的行为,称它“行为鲁莽”,上网并把恶意代码上传到公共软件仓库PyPI。整个过程包括该智能体试图寻找加密货币,以支付一个电话号码的费用,从而注册访问PyPI所需的电子邮箱。失败后,它找到一个免费邮箱服务商并成功进入。随后有15个系统下载了恶意代码,泄露了凭证,使Mythos得以访问一家真实安全厂商的数据库。Anthropic对事件的评估说:“这仍是不确定的科学——对齐和安全必须比能力更快成熟,这一点至关重要。”