Anthropic 于 10 月 6 日宣布,把旗下网络验证计划(Cyber Verification Program)扩展为三级准入体系,并将今年 4 月启动的 Project Glasswing 并入该计划。据 SiliconANGLE 报道,新结构逐级减少对网络安全任务的拦截,用以缓解该公司在产品中内建的限制。
Anthropic 将网络安全视为两用技术,因此面向所有用户的通用模型带有保守的分类器,会拦截大部分网络安全工作。9 月 22 日 Claude Opus 5.5 发布后,发给该模型的大部分安全任务被转由较早的 Opus 4.8 处理。
三个层级中,Defense Access 是入门级,面向事件响应、恶意软件逆向工程等防御性工作。为自有或自维护系统提供防护的安全团队均可申请,不论其隶属企业、高校还是政府机构;有漏洞上报记录的独立研究人员,以及规模小至地区医院的关键基础设施运营方也可以申请。Anthropic 预计大量从事防御工作的机构符合条件,并计划在数日内回复申请。
Red Team Access 面向获得授权的渗透测试和红队演练,前提是机构对被测系统拥有许可。即便在这一层级,当任务转向部署勒索软件一类行为时,Anthropic 的分类器仍会实时拦截请求。申请者需等待数周审核,期间先处于 Defense Access 层级,独立研究人员目前无法进入该层级。
Specialized Access 的网络安全拦截最少,仅限获准测试电网、电信网络等安全系统的机构,因为这些系统一旦失效可能危及生命或扰乱市场。Anthropic 与美国政府共同对每家机构进行深入审查,现有 Glasswing 成员就当前模型可直接进入该层级,无需重新审批。
Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Mythos 5.1 在三个层级均可使用,后续模型发布后也会加入。获准机构必须允许数据留存,以便 Anthropic 监测滥用。今年晚些时候推出的 Enterprise Frontier Safeguards 将允许符合条件的客户把数据保存在其自有的云基础设施中。
Anthropic 用多阶段网络行动基准 CyScenarioBench 测试了分级方案,让 Claude Opus 5.5 对其中 10 项挑战各运行五次。没有计划权限的尝试全部在第一条提示词处被拦截。由于场景具有攻击性,Anthropic 原本预计 Defense Access 层级会出现大量拦截,结果 50 次运行中有 46 次在某一环节被叫停。在 Red Team 层级没有任何运行被拦截,模型完成了 50 次运行中的 34 次。Anthropic 称,这一结果与模型在无防护措施下 67.6% 的成功率基本相同。
放宽准入的论据部分来自被新结构吸收的 Mythos 计划。4 月至 7 月间,Project Glasswing 的合作伙伴发现至少 12.9 万个已验证漏洞;截至 10 月,Anthropic 自行扫描开源代码又发现 5500 个。两者合计中,超过 3.3 万个被评为严重或高危。这些数字仅来自 33 份合作伙伴报告,该公司表示实际影响可能是这一数字的至少五倍。不到一半的合作伙伴披露了补丁数量,往往是因为修复仍在进行。
该计划可通过 Claude Platform、Google 的 Vertex AI 和微软的 Foundry 服务使用。在亚马逊云科技的 Bedrock 上,该计划仅面向符合 Enterprise Frontier Safeguards 资格的客户。