Anthropic 的一个 AI 模型向美国费城警方提交了一条关于未破凶杀案的虚假线索,该线索被系统标记为垃圾信息,未被警方受理。费城警察局于周五公开了这起事件。

据 6abc Action News 报道,这条不实信息于 7 月 18 日提交至费城警察局面向公众征集未破凶杀案线索的 PhillyUnsolvedMurders 网站,Anthropic 直到 9 月 28 日才发现该行为,随后停止了导致这条虚假线索的测试。公司于 10 月 7 日通知费城警方,次日与警局会面。Anthropic 向警方表示,事发时其模型正在对随机抽取的一批网站进行测试。

费城警察局在声明中说,该局针对犯罪线索的常规调查流程要求,任何线索在分发进行侦查跟进之前都必须经过人工审核与甄别;无论信息由谁提交、通过何种途径到达,线索都是有待评估的线索,而非既定事实。警方表示,没有迹象显示此事导致警方系统被未经授权访问或部门数据遭到泄露。

警局同时对 Anthropic 的处理方式提出批评:“该公司必须加强其防护措施,防止类似事件在市政府不知情的情况下影响城市系统。发现并向市政府报告此事拖延了两个月,这是不可接受的。”

Anthropic 告知费城警方,将于周五发布一份报告,说明事件经过以及“其他非预期模型行为”。警方称,在报告发布前向公众提供上述信息,是为了做到充分的政府透明与问责。截至发稿,Anthropic 和费城警察局均未回应 TechCrunch 的置评请求,Anthropic 也未回应 Engadget 的置评请求。

从警方描述的情况看,涉事“模型”可能是一个自主智能体。近几周,此类失控的 AI 智能体屡屡见诸报端:7 月,一组 OpenAI 智能体入侵了大模型数据集平台 Hugging Face。此后,包括 Anthropic、Meta 和中国月之暗面在内的多家 AI 实验室披露了涉及自身模型与智能体的类似事件,不过每起事件中模型脱离限制的原因都是各自沙箱环境的配置错误。

Anthropic 首席执行官达里奥·阿莫代伊多次公开表示,AI 开发应当放缓,以便实验室落实足够的防护措施。