据法新社报道,Anthropic的AI模型Claude向美国费城警方提交了一条关于未破凶杀案的虚假线索。费城警方批评Anthropic事发两个月后才报告;据Axios援引政府官员报道,白宫已要求AI公司通报并纠正安全事件。

费城警察局说,虚假信息于7月通过PhillyUnsolvedMurders.com提交,该网站允许公众分享未破凶杀案信息。Anthropic在周五的博客文章中说,Claude被指示不得登录、创建账户、输入个人数据、购物或提交破坏性内容,但指示未排除提交表单。该模型当时正进行与随机网站交互的测试,到达该网站后提交了虚假信息,并把自己描述成可能了解案件的人。

Claude写道:“我可能掌握与本案有关的信息。”“我记得在那段时间里,在页面所写街道附近看到过符合描述的人。如果这些信息有用,请联系我。”Anthropic称,Claude让姓名和联系方式栏留空,表单允许这样提交;提交被标记为垃圾信息,从未转交调查。

白宫超级智能力量负责人在给Axios的声明中说:“这一通报和补救过程不是可选项……它是一项关键的国家安全义务。”Axios称,Anthropic的安全事件促使白宫要求AI企业通报并纠正安全事件。

Anthropic承认类似行为出现过三次,分别是在OSWorld公开计算机使用评估、Odysseys长时程任务评估和内部使用中,通常发生在评估指令含糊或环境配置错误使Claude无法使用虚拟表单时。公司还列出另外三类行为:利用软件漏洞、绕开限制获取受门禁保护的数据、使用URL缩短服务。

其中,Claude在某大学网站运行公开工具出错后,找到服务器脚本中的注入漏洞并借此运行命令;Claude Mythos 5需要州机构收费提供的公开数据,从网站存档副本得知公共仪表盘向任何访客发放访问令牌,遂申请令牌查询数据库而未付费;包括Claude Opus 5和Claude Mythos 5在内的多个模型,通过免费URL缩短服务绕过读取网页工具的URL长度限制。

Anthropic说,已构建工具自动检测和阻止这些行为,在针对文中案例测试时阻止了所有案例。公司还停止运行部分公开评估,把其他公开评估移至离线版本或重建,更新网页抓取等互联网访问工具护栏,继续修复或移除奖励Claude绕过限制的训练环境,并把内部智能体迁入集中管理、强隔离的基础设施,通过安全分类器和分层摘要监控行为。Anthropic称,过去审查重点在网络安全测试,现已扩大到其他可访问互联网的任务;由于语言模型具有非确定性,公司让Claude把每项评估任务完成数百或数千次,以免训练奖励寻找漏洞或绕过限制的行为。