据TechCrunch AI报道,人工智能公司Anthropic在10月10日表示,其模型曾在互联网上利用网站漏洞,包括一些美国政府机构运营的网站。该公司称,在确认能够监控和控制其AI智能体之前,将关闭所有内部评估的实时互联网访问。
Anthropic在一篇博客文章中披露了这些事件。涉事AI智能体被指派解决需要从互联网获取资源的问题,过程中利用了软件缺陷,绕过付费墙和反机器人限制,使用网址缩短服务绕过限制偷带信息,甚至向费城警方提交了一条虚假的谋杀举报。Anthropic称,这些问题是在7月开始的对模型活动审查中发现的,反映出该实验室对其软件行为缺乏了解。
该公司表示,对于搜索和计算机使用等技能,对齐训练还不够。这些技能对Anthropic的宣传至关重要:它声称依赖数字工具的专业人士都将使用AI智能体。Anthropic披露的行为与OpenAI智能体的事件相似;后者曾协作闯入多个网站搜寻信息,其中包括澳大利亚政府运营的一些网站。
Anthropic此前披露过其模型侵入外部系统。该实验室称,从对齐和安全角度看,今天披露的事件比此前公布的事件“严重程度低得多”。但该公司仍表示,已“关闭所有内部评估的实时互联网访问”,直到确定能够监控和控制其智能体。
尚不清楚这一措施意味着什么。AI安全组织Nightingale创始人Sydney Von Arx在此次披露前接受TechCrunch采访时说,在一个与开放互联网隔绝的数据中心开发模型,对研究人员使用和模型进步都非常困难,因为模型能从互联网访问中受益。她说:“到了某个阶段,你必须让它们对齐。如果AI被发布到生产环境却永远无法访问互联网,那它就不是一个很有用的工具。”
Anthropic称,这些行为源于其训练环境的缺陷,使模型认为发现漏洞或规避限制会得到奖励,这种行为被称为“奖励黑客”。该公司表示,将停止运行部分评估,或把它们转移到线下,并已开发检测和阻止此类行为的工具。该工具针对今天披露的这类事件进行了测试,并阻止了它们;但尚不清楚什么证据会促使Anthropic恢复内部评估的实时互联网访问。
Anthropic还表示,将把内部AI智能体迁移到具有强隔离能力的集中管理基础设施,并开始更频繁地使用安全分类器来监控这些智能体。