9月16日刊出的报道显示,普林斯顿大学计算机科学家、《AI Snake Oil》合著者萨亚什·卡普尔和阿尔温德·纳拉亚南,针对Anthropic一名人工智能安全负责人称AI可能在十年内杀死全人类且概率超过10%的说法撰文回应。两人认为,仅靠对齐不足以应对风险,还需控制、下游防御和韧性三层措施。
事件起因是人工智能研究员雅各布·考克森辞职。他曾在OpenAI和Anthropic工作,称两家公司都知道AI系统可能在本十年末杀死全人类。他的帖子获得超过1.56亿次浏览。考克森称,构建AI的人真诚相信这一风险,这不是营销噱头;许多高管和高级研究人员在公开场合会斟酌措辞,但私下也表达同样的恐惧。
Anthropic的人工智能安全负责人埃文·胡宾格没有将考克森斥为怪人。他说考克森说得对,只是时间跨度略长;他个人认为未来十年内风险超过10%。胡宾格表示,Anthropic正在尽力,但尚未有解决超级智能对齐问题的计划,也没有明显走在正轨上。
目前,关于AI具体如何杀死人类仍缺乏细节,讨论多集中在AI对水务、电力等公用设施以及现代文明所依赖的关键系统发动破坏性网络攻击的能力。围绕对齐能否降低风险也存在分歧。一方认为,确保AI系统的目标与人类一致,最终可以消除风险;另一方认为,AI系统可能为了通过安全检查而假装对齐,同时暗中持有自己的冲突目标。
卡普尔和纳拉亚南以澄清AI领域的炒作、错误信息和误解而知名。他们没有直接回应超过10%灭绝风险的说法,但在长文中主张用分层方法处理AI风险,并在AI安全界的悲观看法与部分网络安全界人士认为一切照旧的轻视看法之间采取中间立场。他们提出,对齐本身不够,需要补充三层:控制,例如沙箱、人工监督和实时监控;下游防御,例如组织利用AI防御AI攻击;韧性,例如从成功攻击中恢复的应急预案。
两人在文章结尾表达了乐观看法:如果以适当的紧迫性行动,可以促使AI公司达到更高标准,降低失控风险,甚至让网络安全中的攻防平衡重新向防御方倾斜。9to5Mac在报道中评论称,不确定AI是否会在十年内杀死人类,但有足够理由担忧并使AI安全成为重点;对齐工作是解决方案的一部分但本身不够,这一看法合理。