微软董事长兼首席执行官萨提亚·纳德拉10月10日在社交媒体平台X发帖,呼吁为先进人工智能系统设置由人类控制的“紧急刹车”,授权人员在模型执行任务途中可以暂停或将其关闭。他说,面对能力持续提升的AI模型,行业需要重新审视信任架构,不能把“超级智能”当作一组嵌套黑箱,只对其建议、答案和行动做接受或拒绝。据TechCrunch AI报道,这是又一位科技高管就AI安全改进提出系统设想。

纳德拉写道,需要用强确定性的系统设计、人类控制和可靠操作程序来包围非确定性模型,并在现有标准不足的地方建立行业标准。他把前沿闭源模型和开放权重模型视为“内部风险”,认为这是构建这类系统的一条路径。据The Verge报道,他主张建立更透明的系统,使模型可被遏制、观察,并留下“防篡改、人类可读的证据”。

“我们必须假设一个模型已被入侵,并从一开始就遏制它。把它想象成紧急刹车。”纳德拉说,“授权人员应始终能够在模型执行任务途中暂停或关闭它。更先进的模型将需要更先进的遏制技术,我们需要将其标准化。”据TechCrunch AI报道,他的方案还包括把模型与调度其工作的“挽具”分离、将控制和保障外部化,并要求记录“每一个有意义的模型行动”。

纳德拉在X上列举的可观察性原则包括模型多样性、模型行动的人类可读足迹、持续系统测试、独立控制与可审计性、遏制以及事件披露。他写道,最值得信赖的超级智能系统“不会是那个我们最信任其模型的系统”,而是“让我们能够最不信任模型的系统”。据The Verge报道,这些建议与业内已有主张有重合,包括及时披露事件、独立审计、可验证数据和遏制;但在“从一开始就假设模型已被入侵”这一点上,他的表述比部分同行更进一步。

这些表态出现在AI安全争论升温之际。据CNBC报道,包括微软联合创始人比尔·盖茨、Anthropic首席执行官达里奥·阿莫代伊、OpenAI首席执行官萨姆·奥尔特曼和SpaceX首席执行官埃隆·马斯克在内的科技高管及研究人员警告,AI安全协议不足,技术推进过快。上月,一名Anthropic研究员离职,指责该公司及其主要竞争对手OpenAI“拿我们的生命赌博”;同一天,Anthropic一名负责AI安全的对齐主管称,未来十年该技术有超过10%的概率“杀死全人类”。

但美国总统唐纳德·特朗普多次否定AI灭绝风险,强调美国工业需要保持领先中国。特朗普最近还推出由国家情报总监杰伊·克莱顿领导的“AI Force”,以帮助促进行业发展并清除不法行为者。据TechCrunch AI报道,纳德拉在帖子中使用了特朗普政府偏好的“超级智能”一词。