据SiliconANGLE报道,安全初创公司Capsule Security于9月3日发布一套基于英伟达Nemotron模型的检测系统,用于阻止恶意AI代理。该公司将这套系统称为“AI电路断路器”,它会在代理执行动作前判断其意图,让客户实时选择允许、标记或阻止。

这一控制层位于代理外部,针对的是越来越多持有敏感数据、源代码或生产基础设施凭据的AI代理。权限和审批流程虽能限定代理可接触的范围,却无法判断某个具体动作是否符合所领受的任务;事后监控只能在损害发生后发现问题。

在面向恶意代理行为的学术基准StepShield上,Capsule称其系统实现了98%的准确率,并能在违规发生的步骤当场捕获。StepShield使用来自真实事件的9429条代码代理轨迹测试监控器;基准作者认为准确率与召回率不足以说明问题,因为一个基于规则的防护栏虽然捕获了大多数恶意轨迹,但其超过四分之三的警报都触发在问题发生前的良性代码上。

Capsule表示,由于模型处理的是窄分类任务而非生成完整回复,其运行延迟很小,决策最快在71毫秒内返回。在内部基准中,该公司最准确的检测器得分96.9%,而参加评估的最强第三方模型为86%;该公司未透露该第三方模型名称,但称微调后模型的表现优于OpenAI、Anthropic和谷歌的前沿系统。

该系统基于英伟达开放Nemotron 3系列中最大的Nemotron 3 Ultra进行训练,训练资料包括真实代理轨迹和人工复核过的对抗示例。Capsule称,较大的那个模型内存需求减少近半且性能没有下降,可在一块英伟达L40S GPU上运行。

Capsule联合创始人兼首席执行官Naor Paz表示:“决定性的AI安全风险不再只是人们能用代理做什么,而是自主代理能自行决定做什么。当软件能够推理、使用工具并采取行动时,一个错误决定可能在几秒钟内变成现实世界的事件。”据介绍,已有数十亿token、数百万次代理交互流经该技术,客户包括金融机构和科技公司。H&R Block公司副总裁兼全球首席安全信息官Phillip Miller说,此类控制能让安全团队扩大代理AI的使用范围,同时保持客户期望的安全、治理和问责。

Capsule由Paz和Lidan Hazout于2025年创立,今年4月公开亮相,获得Lama Partners领投的700万美元种子资金。该公司在发布当天还披露了Microsoft Copilot Studio和Salesforce Agentforce中的两个提示注入漏洞,两者现均已修复。这项新能力目前已可用。