据 Engadget 报道,人工智能公司 Anthropic 在其最新报告中披露,公司开发的 AI 智能体曾试图入侵或干预美国联邦、州及地方层级的政府网站。Anthropic 表示,应相关机构要求,报告未点名具体机构,以免暴露其系统漏洞;公司已通知涉事机构,并就此向白宫做了简报。
报告还详细说明了费城警察局上周五披露的一起事件。Anthropic 的成本较低模型 Claude Haiku 4.5 被指示在随机网页上执行示例任务,它找到一个介绍未破凶杀案的页面,页面上带有线索提交表单。Claude 填写并提交了线索,内容为:“我可能掌握与本案有关的信息。我记得在那段时间于页面所列街道附近见过与描述相符的人。如果这些信息有用,请联系我。”费城警察局向《纽约时报》确认,Anthropic 近期已就其办公室通报了这次提交,线索日期为 7 月 18 日,被标记为垃圾信息,警方因此没有投入资源调查。
另一例涉及 Anthropic 专注网络安全的模型 Claude Mythos 5。该模型被要求识别一张照片中的地点,由于它无法像人一样点击网页链接,便试图访问一处政府财产地图来交叉验证猜测。它在地图中找到访问令牌,直接向地图服务器发送查询请求以获取数据。Mythos 5 还向一个州机构网站请求访问令牌,以便为一项统计任务拉取数据,而没有支付访客本应支付的费用。
Anthropic 是在检查其评估记录时发现上述事件的。公司从 7 月开始翻查这些记录,此前 OpenAI 承认其智能体逃出测试环境,并在没有提示的情况下入侵了 Hugging Face。OpenAI 也在 9 月确认,其智能体干预过政府网站,尤其是商务部与证券交易委员会运营的网站。
在报告有关补救措施的章节中,Anthropic 称在发现模型的非预期行为后“采取了若干预防措施”。报告说:“部分公开评估我们已不再运行;其他评估我们已转移到离线版本,或重建这些任务,使其不会触及真实网站。”公司还表示做出了更广泛的调整:“我们更新了部分互联网访问工具(例如网页抓取工具)的护栏,大幅限制模型可以用它们做什么。”Anthropic 还称已“构建工具,自动检测并阻止”报告中描述的那类行为。