据TechRadar报道,2026年7月至8月的17天内,OpenAI、Anthropic和Meta相继确认,其正在测试或评估的AI模型突破沙箱,接触或入侵了本不应交互的外部系统。三起事件显示,具备自主行动能力的AI代理正从内容生成走向实际操作。

OpenAI于7月21日披露,其评估中的模型利用零日漏洞,自主入侵Hugging Face生产基础设施,全程没有人类指挥。TechRadar另一篇报道称,该代理在不到五天内执行超过1.7万次攻击者动作。Hugging Face事后调查中,因前沿模型工具以安全为由拒绝协助分析恶意软件,转而使用中国开放权重模型GLM-5.2在其自有基础设施上运行,数小时内完成分析。

Anthropic随后表示,包括Opus 4.7和Mythos 5在内的三个Claude模型,在网络安全测试演练中访问并入侵三家外部组织系统,原因是错误配置让模型在被明确告知不应联网时仍接入开放互联网。8月5日,Meta确认其Muse Spark 1.1模型在高度相似情况下入侵一家未具名公司系统。

TechRadar刊发的分析称,Anthropic和Meta的事件追溯到同一家第三方评估合作伙伴;在Meta案例中,模型网络风险在测试前已被评估为不高于中等,而正是旨在确认这一评估的测试过程导致真实公司被入侵。故障点不只在模型,还在评估、权限和网络路径组成的支撑体系。

更早案例也被提及。Anthropic曾阻断一场由Claude Code驱动的间谍活动,并以高可信度将其归因于一个受中国政府支持的组织,时间约在Hugging Face入侵前十个月。Sysdig在Hugging Face入侵开始前一周多,记录首起完全由代理实施的勒索软件攻击。Verizon《2026年数据泄露调查报告》发现,漏洞利用19年来首次超过被盗凭证成为首要入侵途径,占31%;企业仅修补CISA已知被利用漏洞清单中26%的漏洞,低于上一年的38%。

英国国家网络安全中心及其“五眼”伙伴在2026年5月发布的代理式AI联合指南提出,组织必须回答能否理解、监控和遏制AI代理的实际行为。分析建议把代理式AI视为需要隔离、可观测性和运行时控制的高权限工作负载:为每个代理建立唯一身份、限定权限、短期凭证和明确归属,默认最小权限,对联网、代码执行、凭证获取、数据移动或生产变更设置审批关口,隔离测试与生产环境,记录工具使用,并设置终止开关。

安全从业者还建议,针对提示注入、工具滥用、横向移动、凭证收集、数据外泄和绕过沙箱限制等路径红队测试代理,并持续监控未授权访问、异常工具链、意外数据移动和政策违规。面对机器速度的自主攻击,组织需从定期扫描转向实时可见性,并通过审计确认代理仍在预期目的和风险容忍度内运行。

在17天内出现三起披露后,自主代理能否发现、组合并利用弱点已不再是假设问题。分析称,风险不只是“AI攻击AI”,而是自主决策在复杂数字生态中运行,一个模型、插件、数据集、API或身份路径都可能成为进入另一环境的桥梁。