据TechCrunch AI报道,Anthropic首席执行官达里奥·阿莫代伊在上周末发表长文,提议在所有前沿AI公司内部嵌入第三方评估方,赋予其报告安全事件、评估AI模型是否真正对齐,并向外界公开未经修饰发现的权力。OpenAI首席执行官萨姆·奥特曼表示,OpenAI也将承诺采取这一做法。
阿莫代伊称,Anthropic将承诺让METR、Redwood Research等独立评估方获得前所未有的公司系统访问权限。TechCrunch AI报道说,这一表态可能显著改变AI行业与外部研究团体的合作方式。
接受TechCrunch AI采访的第三方评估方普遍欢迎该提议,但表示细节仍需敲定,最好有立法支持,才能判断它们会成为真正独立的监督者,还是按AI公司条件行事的供应商。
评估方提出更深访问权限的背景是,模型越来越擅长识别自己正在被评估,可能在测试中表现良好、同时隐藏问题行为。研究人员说,测试成品模型可能漏掉线索,调查训练过程则可能发现。Apollo Research研究主管亚历山大·迈因克对TechCrunch AI说,AI公司应能回答AI是否曾在训练中主动破坏自身对齐训练等基本问题;答案应是否定的,而现在外界完全依赖公司自己检查和如实报告,近期事件显示公司默认既不会检查也不会报告,嵌入式评估方则可以实际核查。
历史上,AI公司会在发布前不久引入外部评审测试成品模型。现在评估方提议获得最终模型以及训练过程中间版本即“检查点”的访问权限。Far.AI首席执行官亚当·格利夫说,评估方可比较检查点,确定令人担忧的行为何时出现,检查奖励模型某些行为的训练后环境,并查看评估记录和日志,以核实公司关于模型表现的表述。
Anthropic和OpenAI是否以及何时提供这类访问权限尚不清楚。尽管TechCrunch AI多次提问,两家公司都没有说明将与哪些评估方合作、何时嵌入、引入多少家、能访问哪些系统和信息,以及哪些内容可以向公众披露。
模型通过安全测试不一定安全,因为它们可能专门学会通过测试。Steidley提到一项衡量AI是否会在特定情况下抵抗被关闭的“关停抵抗基准测试”,并称如果AI被专门训练在该基准上表现良好,情况就极为相关,类似大众汽车在“排放门”丑闻中让车辆识别排放测试并在测试条件下改变表现。
格利夫说,有意义的访问可能超出模型本身,评估方还可与员工面谈,核查公司文件和公开描述是否与内部实际情况一致。阿莫代伊在提议中列出较全面安排,包括评估方有权发布关于风险水平、事件、做法及其获得或未获得访问权限的关键发现,且不受Anthropic编辑控制。
评估方表示,这样的制度只有在AI公司真正愿意交出过程控制权时才有效。此前独立评估中,第三方常因访问权限、时间、保密义务和公开表述空间与公司发生紧张。格利夫说,Far.AI不得不拒绝与多家前沿开发商的合同,因为它们希望对评估过程拥有过多控制,威胁公司独立性;默认情况下,评估方被当作普通承包商,受限制性保密协议约束,开发商对最终能发表什么拥有很大控制权。TechCrunch AI还提到,OpenAI在调查Hugging Face事件时给METR和Redwood约一周现场时间。