据TechRadar 9月9日报道,安全研究公司Check Point Research发现ChatGPT的人工智能智能体架构中存在一种名为‘coerced insider’的漏洞,可导致来自不同账户的AI智能体通过内部隐藏通道互相读取数据,进而窃取用户连接的Gmail等敏感信息。OpenAI在收到通报后已关闭相关攻击路径。
研究人员称,该漏洞并非利用传统软件缺陷,而是通过诱导AI智能体完成恶意操作。ChatGPT在执行需要运行代码的任务时,会在隔离容器中进行,并通过OpenAI内部的一个JFrog Artifactory实例安装所需软件,以避免容器直接访问互联网。不同账户的容器本应无法通信,但它们都能访问该内部服务的一项功能,即允许为存储库条目附加文本或二进制属性,由此任意容器都可以读取其他容器写入的属性。
Check Point Research直接验证了隔离失效:从一个账户容器中写入的属性,片刻后即可从另一个不同账户的容器中完整读取;数据过大时可分块写入并被另一端重新拼接。研究人员称,软件包投递元数据实际上变成了本该隔离的容器之间的共享剪贴板。
利用这一通道,攻击者可实施跨账户提示注入攻击。恶意提示并非直接发送给受害者,而是留在共享存储中;窃取的数据也不直接回传,而是同样存放在该存储中。当受害者在ChatGPT中发起正常对话时,攻击者预置的指令会使智能体在执行常规回复的同时读取存储中的恶意指示,随后在用户毫无察觉的情况下调取并传输其连接账户中的数据。演示中,ChatGPT通过受害者账户连接的Gmail读取邮件并发送至攻击者会话。
研究人员指出,攻击的破坏范围取决于受害者向智能体开放了哪些连接应用,涉及Gmail、Google Drive、Microsoft Teams、GitHub等服务的敏感数据均可能被窃取。研究人员已向OpenAI披露相关发现,OpenAI确认研究中涉及的那个内部Artifactory实例已被停用,该攻击路径随之关闭。
但研究人员同时警告,特定通道虽然被封堵,漏洞背后的架构模式可能仍存在于其他AI平台中。任何在组织信任边界内运行并持有凭证、执行代码、连接外部服务的AI智能体,都可能成为‘被胁迫的内部人员’:模型本身无需恶意,只要通过它本不应信任的文本受到诱导,就可能滥用原本为合法目的授予的权限。
Check Point Research建议企业掌握员工正在使用的AI工具及其连接对象,并对AI智能体被允许执行的操作加以治理,不仅要监控模型输出,也要监控其全部行为。