百余名人工智能专家和评估人员9月18日发表联名公开信,警告在资源与保护不足的情况下,第三方评估者无法对前沿人工智能模型的安全性作出可信判断。

据CNBC报道,这封公开信由AI评估者论坛联盟组织,并在发表前独家提供给该媒体。签署者包括人工智能学者杰弗里·辛顿,以及约翰斯·霍普金斯大学、斯坦福大学和非营利评估机构METR等组织的成员。公开信要求基础模型提供商确保第三方评估者获得必要的“科学客观性、透明度、独立性和有力保护”,以有效、可信地开展工作。

论坛主席康拉德·斯托斯在接受采访时说,联名者希望“在基本原则上有共同立场,并确保独立监督能成为管理人工智能风险的切实工具”。他说,此举意在让基础模型公司兑现其近期作出的支持更彻底第三方安全测试的承诺。

这一评估者群体近期受到关注,起因是Anthropic首席执行官达里奥·阿莫代伊上周末提出,可以让部分评估者以“类似员工的身份”检查和审计最前沿的基础模型及其开发流程。斯托斯说,与评估者此前获得的权限相比,这一设想意味着大幅扩权:模型开发者可能允许第三方评估者使用公司计算机、与员工坦率交谈,并查看敏感内部数据和未发布系统。他以Hugging Face攻击事件中被使用的未发布OpenAI模型为例,称此类权限将让评估者对实际风险有更大把握。

围绕人工智能监管,业界存在分歧。一些行业领袖呼吁政府监管人工智能开发,以防其失控;美国总统特朗普及其前人工智能事务负责人戴维·萨克斯则明确反对此类努力。

OpenAI首席执行官萨姆·奥尔特曼、SpaceX的埃隆·马斯克和微软首席执行官萨蒂亚·纳德拉已公开支持阿莫代伊的提议,但尚未说明落实中的具体问题,例如如何挑选评估者、允许其检查受到严密保护的技术到何种深度。

公开信说,评估者的工作应独立于企业进行,技术信息应更加透明,评估者还应“免受其嵌入的公司的报复”。签署者之一、美国外交关系委员会人工智能高级研究员、前美国国家安全局首席人工智能官Vinh Nguyen在声明中说,当少数强大的实验室掌握着可能危及网络安全、关键基础设施以及国家安全和经济所依赖系统的能力时,政府和公众不能依赖这些实验室自己对安全性所作的说法。

斯托斯说,第三方评估并非要“取代任何内部评估工作,更不用说取代开发者自行发现问题的缓解措施”。他承认基础模型公司可能无视这封公开信,但认为这关系到它们的信誉。他还说,真正具备足够技术公信力、规模和能力从事这类工作的团体“非常少”。