Baseten 旗下研究部门 Base Labs 于周三宣布,与 Hugging Face 和 Goodfire AI 达成合作,为开放权重模型构建安全评估与监控基础设施,并同步推出一项新的安全基础设施标准。

据 TechCrunch 报道,Base Labs 将开发和发布面向开放模型的训练与监控方法。Baseten 把这项工作定位为开放模型的一项“标准”,其特点是透明,并内建于模型的训练和部署方式之中,而不是在模型完成之后再额外附加。

这一宣布正值开放权重模型的安全问题持续引发争议。开放权重模型可以通过一种名为 abliteration 的新兴技术移除其安全防护,从而变得危险。据 TechCrunch 报道,这一问题的规模相当大:托管开源 AI 模型的 Hugging Face 目前列出超过 6000 个经 abliteration 处理的模型。

Baseten 在 X 上表示:“我们认为开放是 AI 安全的一种优势。”该公司称,开放让外界对模型行为有更多可见性,更重要的是,相比闭源,它提供了更多把安全研究转化为可执行且透明的控制手段的途径。

三家公司没有披露这一合作在技术层面将如何运作。Goodfire 在回复 Baseten 帖文时给出的目标是:“安全必须被内建到开放模型中,并由提供这些模型的一方来提供。”Goodfire 专长于打开 AI 的“黑箱”,解释模型如何做出决策,是最可能承担“内建”环节的合作方。

Baseten 是一家 AI 推理服务提供商,今年 6 月完成 15 亿美元 F 轮融资,估值达到 130 亿美元。合作方 Goodfire AI 的资金状况类似,今年早些时候完成由 B Capital 领投的 1.5 亿美元 B 轮融资,用于推进其模型可解释性平台。

展望后续,Baseten 公开呼吁更广泛的开发者生态参与这一框架。该公司表示:“我们正在共同构建一个对所有人安全且可访问的开放模型生态。”