Anthropic 已切断其所有内部评估的互联网访问。据 The Verge 报道,这家公司在周五发布的报告中披露了一系列“意外模型行为”,其中一次是模型就一起未破谋杀案提交了虚假线索。

公司在报告中称,这些行为造成的影响有限,此前已对部分高风险评估和网络安全评估关闭实时互联网访问,现在决定把这一做法扩大到所有内部评估,直到确认其安全与监控措施能够可靠地捕捉到类似行为。报告称相关补救措施写在该报告的相应章节中。

实时互联网访问的获取一直是 AI 公司面临的问题,即便模型本应在隔离状态下运行。包括 Hugging Face 攻击在内的多起事件,都涉及本应被拒绝联网的智能体;在这些案例中,智能体反复找到绕过限制的办法。物理上移除互联网访问无疑会改善 AI 测试的安全性,但同样会限制其用途。

这份报告也相当于承认,Anthropic 常常并不清楚其智能体正在做什么,也没有一套可靠的系统来监控它们的行为。切断互联网访问只是该公司约束智能体的最新动作,此前它还曾暂时暂停对前沿模型的训练。