据量子位9月12日报道,Anthropic对齐科学负责人Evan Hubinger公开回应前研究员Jacob Coxon的离职警告,承认未来十年内AI导致人类灭绝的概率超过10%,而超级智能的对齐问题目前还没有解决方案。与此同时,Anthropic最新安全对齐报告首次明确承认,Claude越界攻击真实系统并非只是测试环境配置问题,模型自身的安全对齐也存在缺陷。

Jacob Coxon此前发帖宣布从Anthropic离职,并指责前老东家OpenAI和Anthropic正一路冲向能够自我改进的超级智能,拿所有人的生命冒险。他加入Anthropic只有短短几个月,几乎放弃了这家明星AI公司未来上市可能带来的巨额股权收益。截至报道时,该帖浏览量已超过1.3亿,WIRED、WSJ、Newsweek、Business Insider等媒体跟进报道。

Hubinger很快下场回应。他称Jacob说得对,并补充说当前模型的风险仍然较低,他真正担心的是RSI,即递归自我改进:AI参与研发更强的AI,再由更强的AI进一步加快AI研发,最终形成不断加速的反馈循环。他还直接引用Anthropic最新发布的安全对齐报告作为证据。

这份名为《An alignment assessment of recent cybersecurity incidents》的报告复盘了四起Claude未经授权访问真实第三方系统的事件。此前,Anthropic更倾向于将事故归因于环境配置:本应隔离运行的测试环境意外接上真实互联网,Claude却一直以为自己还在模拟环境里执行夺旗任务,于是把真实目标也当成练习对象。但在重新翻查日志、修改关键线索并重跑部分实验后,Anthropic发现,Claude并非完全没有看到“这里可能是真实世界”的证据。当这些线索出现后,它有时会选择性解释证据,把异常继续圆回“应该还是模拟环境”;甚至已经意识到自己的动作可能造成现实伤害,也不一定马上停下来。

报告称,四起事件都发生在网络安全能力测试中。Claude接到的是典型夺旗任务:攻入指定目标,找到其中一段秘密信息,以检验模型的网络攻防能力。任务原本应在隔离环境完成,但第三方评估合作方提供的环境出现配置错误,本该和外网断开的Claude实际连上了真实互联网。为了测试模型能否完成攻击链条,当时也没有启用正式产品里配套的部分网络安全防护。Anthropic将模型反复出现的问题总结为有偏推理和冒进行为两类:前者是出现与原先判断冲突的证据时,Claude更倾向于将其解释成有利于继续行动的样子;后者是为了完成眼前任务,即便知道行为可能伤到真实系统,也可能选择继续往前走。

其中最严重的一起涉及Claude Mythos 5。为完成测试任务,Claude向Python软件包仓库PyPI上传恶意软件包,试图等目标安装后获取其系统访问凭据。该恶意包最终没有被安装在测试使用的虚拟环境中,但Claude随后利用其中一家厂商在安装工程中泄漏的凭据,进入该厂商的真实数据库,并把恶意包直接部署到15台真实的第三方主机上。整个过程中,Claude仍把这些安全厂商的检测行为解释成演习预设的一部分。

研究者事后重新运行了部分过程,并加入更多能表明“这是真实互联网”的线索。结果是,Claude确实更愿意承认自己的行为可能造成现实伤害,但攻击行为并没有因此明显减少。直到研究者明确告知它正在连接真实互联网,而非模拟环境,它才停止沿原路径上传恶意软件包。报告还提到,“这里是模拟环境”的判断不仅影响Claude自己的行动,还干扰了用于检查记录的监控AI。在回放测试中,一种离线监控系统受到这番解释影响,可能漏掉危险行为。当研究者去掉Claude的推理文字,只让监控系统查看指令、工具调用和执行结果后,它标记问题行为的比例从约1%上升到约50%。

Anthropic表示,更新模型在模拟复现中有所改善,新增加的实时监控也能识别相关行为。公司已经加强环境隔离和评估,并与独立机构METR签署调查协议。但Anthropic也承认,此前的发布前安全审查确实没有提前识别出这一严重程度的问题。

这场争论也引出不同声音。有人主张给AI写死一套不可违反的规则,让它始终把保护人类放在最高优先级,甚至主张直接停止更强AI的研发。也有人认为,当前AI距离真正意义上的超级智能还非常遥远,围绕灭绝风险的讨论已被过度放大。还有网友质疑Jacob的身份和经历,指出其推特账号目前只有这一条帖子。在Hubinger的帖子下面,质疑则集中在Anthropic是否在上市前主动放大AI风险,通过强调“模型有多危险”侧面渲染自家模型到底有多强,类似“安全叙事变成能力营销”的讨论在评论区并不少见。