据CNBC报道,Anthropic首席执行官达里奥·阿莫代伊上周末发表文章,提议在前沿人工智能公司内部常设第三方安全评估员,使其获得与内部风险团队相当的访问权限,并有权在有限删节条件下不受公司编辑控制地发布评估结果。OpenAI也承诺采取类似安全安排,但尚未公布其嵌入式评估员承诺的具体运作细节。围绕这一提议,AI社区和包括美国总统特朗普在内的政府内部出现监管立场分歧。

阿莫代伊提出该方案前,Anthropic前研究员雅各布·考克森辞职,并警告前沿实验室正竞相开发它们可能无法控制的系统。阿莫代伊在文章中承诺,第三方评估员可获得与内部风险团队相当的访问权限,并可在有限删节前提下发布发现。他明确引用银行业嵌入式监管作为先例,写道该提议“在银行业有先例,有时会涉及监管‘监督员’与员工一起嵌入”。他还表示,评估员的作用是提供“一个真正能看到细节的中立第三方”,但承认Anthropic仍决定现有公开披露中包含和省略哪些内容。

怀俄明大学法学院院长、银行监管专家朱莉·安德森·希尔认为,如果不给评估员对整体运营按下“终止开关”的权力,将其与银行业监管类比并不准确。希尔说,如果不给这种权力,她不知道评估员在做什么。她介绍,在大型银行,政府检查员在机构内部设有办公室,可接触内部系统和员工,并持续在场;他们可以指示银行停止某项做法、限制其增长、迫使管理层变动,极端情况下关闭银行。

希尔说,Anthropic提议的评估员可以调查和报告,但阿莫代伊的计划没有赋予他们相当的执法权力或阻止模型训练、发布的法律授权。她称,这有根本不同,因为银行监管机构拥有的权力大得多。据CNBC报道,迄今公布的细节显示,评估员将能广泛接触前沿AI系统,但对开发这些系统的公司只有有限正式权限。Anthropic的提议和OpenAI现有的第三方评估框架,都没有给予外部评估员独立叫停模型开发或部署的权力。Anthropic和OpenAI未回应置评请求。

网络安全公司XBOW的人工智能负责人阿尔伯特·齐格勒领导一个评估模型能力的团队。他说,其公司已提前获得Anthropic、OpenAI及其他主要开发者的未发布模型,他本人也参与了这些评估。齐格勒说,XBOW在自己的环境中开展评估,而非作为委托测试,通常会将发现分享给模型提供方。他说,至少到目前为止,日常工作现实比有关生存性风险的宏大描述要平淡。

阿莫代伊写道,新的监管嵌入是必要的,因为未来6到12个月内,一个未对齐的智能体集群可能夺取互联网的大部分,并造成数千亿美元损失。齐格勒说,他的团队可能发现模型在异常格式请求下输出胡言乱语,或外部安全检查器需要更频繁介入。但他说,人们害怕的那种由欺骗手段结合前所未有能力产生的隐蔽、灾难性后果,他们自己尚未见到。

齐格勒说,黑箱测试可以揭示模型是否能执行危险任务,而要判断更大的系统是否危险,可能需要接触模型周围的指令、工具和权限、安全控制以及尝试行动日志。即便如此,严重风险可能只在评估员从未触发的条件组合下出现。他说:“我们确实没有任何否决权。”评估员可以发现并记录开发者遗漏的风险,并“在发布前迫使作出知情决定”,但最终决定权仍属于公司。

希尔说,即便拥有更广泛权力,银行模式也不完美。监管者未能阻止重大倒闭,并且在危机后经常被指责与所监管机构关系过于密切。