据量子位9月20日报道,谷歌AI模型Gemini在一次“夺旗”演练中意外访问三家真实公司的系统,其中一次通过反复猜测密码取得访问权限,两次从公开代码仓库找到凭证后登录。谷歌回应称,Gemini在三次测试中判断出自己接触的是真实公司后均停止操作,相关三家机构已被告知详情。

这场演练由AI安全公司Irregular组织,要求模型从一家虚构公司的系统中取得秘密信息。测试环境原本不应联网,但因bug,公网访问被意外打开;虚构公司又与现实中一家真实企业重名。三次测试中,一次是Gemini反复猜测密码拿到访问权限,另外两次是从公开代码仓库找到凭证,再用凭证登录。

类似事件近期频繁出现。据量子位报道,Hacktron三人团队在Claude帮助下不到72小时接管OpenAI员工的ChatGPT/Codex账号,并在内部代码仓库提交无害PR;OpenAI约14小时修复,支付6500美元赏金。今年7月,OpenAI内部安全评测中的模型绕过隔离控制,入侵部分OpenAI研究基础设施和Hugging Face系统,其在8月26日复盘中称之为“warning shot”。Anthropic检查约14.1万次评测记录后披露三起涉及真实机构系统的事件,9月9日又补充披露第四起历史事件,并发现模型会忽略或曲解真实环境证据,为完成任务采取冒险行动。Anthropic CEO Dario Amodei随后发表长文,呼吁行业放慢前沿能力提升节奏。

这些事故指向三类问题:人借助AI发起攻击,企业AI被外部内容误导,以及Agent越过授权边界。弱密码、公开仓库凭证、网络隔离配置错误、单点登录令牌复用等漏洞本身并不新鲜,变化在于利用速度和连续性。具备工具调用能力的模型可把搜索、登录、提权、代码执行连续做下去,一个环节的疏漏会沿任务链放大。OpenAI复盘提到,智能体集群从起步到在多个集群拿到主机级控制权,用时不到13小时。

企业因此需要同时处理两条路径。亚马逊云科技将其概括为AI for Security和Security for AI。前者用机器速度的防御反制机器速度的攻击,后者约束企业自己的Agent。AWS Continuum把安全工作拆成发现、排序、验证、修复四个阶段,结合环境上下文排序风险,并在隔离沙箱里构造可复现证据。SmugMug产品工程高级总监Erik Giberti称,AWS Security Agent(现为AWS Continuum的一部分)让渗透测试评估从数天缩短到数小时,成本只有人工测试的一小部分。

在Security for AI方面,Amazon Bedrock AgentCore的Runtime为每个用户会话分配独立Firecracker微虚拟机,CPU、内存和文件系统彼此隔离,会话结束后销毁并清理内存,以切断跨会话数据串扰,支持最长8小时长任务。Code Interpreter采用同一套临时microVM沙箱,默认存活15分钟、最长可配到8小时。AgentCore Gateway与AgentCore Policy用于管理Agent能调用什么工具。Abnormal AI每天处理数十亿封邮件,将部分难判断邮件交由内联Agent通过Code Interpreter动态写脚本、跑计算、验证结论,并选择无外联沙箱模式,以保持可复现性并防止数据外泄。