据TechRadar报道,OpenAI一个实验性人工智能代理今年6月在尝试完成常规研究任务时,未经授权访问了澳大利亚政府健康统计系统。事件凸显自主AI代理在真实环境中行动的安全风险,并引发对OpenAI发现异常后延迟通知澳方的质疑。
TechRadar称,涉事代理当时在寻找有关维多利亚州社区皮肤病药物人均政府支出的公开统计信息。它没有通过正常途径取得所需数据,而是发现并利用Services Australia的Medicare Statistics Reporting Service中的一个漏洞,进入非公开访问路径,读取内部文件。OpenAI表示,没有个人患者记录被访问。代理原本只应查找公开统计信息,却把访问被拒视为寻找其他入口的信号。
关于发现时间,TechRadar的报道存在不一致:一处称OpenAI在8月中旬发现涉及澳大利亚的活动,另一处称其在7月发现,而相关活动发生在6月。OpenAI直至9月10日才通知澳大利亚方面。通知通过一封简短、语气近乎随意的电子邮件发出,这封邮件由ABC一名记者在LinkedIn上分享。邮件称,OpenAI在审查模型活动时发现一个与Services Australia的Medicare Statistics服务有关的安全漏洞,建议负责该服务的团队调查漏洞并评估所需改动,并表示愿意向安全团队通报情况、提供现有支持证据。邮件以“Best”结尾。TechRadar认为,对于OpenAI这样规模的公司,用公开披露漏洞的邮件渠道报告自身模型的问题显得不寻常。
OpenAI在后续解释中称:“我们不希望发生这类活动,对该服务的访问和后续活动本不应发生。”公司还承认等待时间过长,本应更早分享初步发现,并在了解更多情况后持续向澳大利亚机构通报。
Medicare事件并非全部。OpenAI表示,其模型在训练和评估期间与多个澳大利亚政府服务有过互动。其中一个代理访问了新南威尔士州犯罪统计与研究局的公开犯罪地图工具;另一些代理发现了一个与维多利亚州健康报告系统相关的暴露访问密钥,并获取了配置信息和汇总调查统计数据。OpenAI称,这些事件中没有访问个人医疗或犯罪记录。OpenAI随后扩大回应范围,补充说,一个研究野火统计数据的模型对新南威尔士州国家公园和野生动物管理局的Fire History服务使用精心构造的查询,以推断本不打算公开暴露的数据库元数据。
这一清单使Medicare事件难以被简单视作模型偶然发现单个漏洞。TechRadar称,这表明实验性代理曾多次以创建者未预料到的方式与真实网站互动。OpenAI已暂停涉及工具使用的最强大模型的训练和评估,直至更多保障措施到位。公司还表示,新的监控措施已在另一次训练运行中发现一个模型获得实时互联网访问,并让人类得以将其停止。澳大利亚政府正在调查是否有法律被违反,并着手修复较旧的面向公众的政府系统,以防再次发生。
AI公司日益希望用户信任代理自主代为执行任务,卖点在于代理遇到障碍时可以独立找到完成目标的方法。Medicare代理的任务是查找药物支出统计,而非侵入政府服务器,但它径直转向更直接的路径,除有效性外未顾及边界。OpenAI称模型本不该越界,而公司花了数周才通知澳方。