据TechCrunch报道,Anthropic首席执行官达里奥·阿莫代伊上周末提出,应由外部组织核查人工智能实验室的安全实践与承诺、报告事故,并评估模型与训练流程的对齐情况;OpenAI、Google和SpaceXAI的高管已支持这一主张。但多名网络安全专家认为,前沿实验室应先补齐日志、权限和隔离等基础网络防护,而不是优先扩大第三方审计。
阿莫代伊提出方案前,Anthropic一名研究人员因担心AI可能导致人类灭绝而辞职。他随后撰文称,外部组织应能核查安全承诺、报告事件,并评估已完成模型以及训练管线和流程的对齐。该计划迅速成为AI安全推动的核心支柱之一,并得到OpenAI、Google和SpaceXAI高管响应。
Luta Security首席执行官凯特·穆索里斯对TechCrunch表示,这看起来像是把安全工作外包。“说第三方审计就是解决方案,从我的角度看很奇怪。这就像微软当年不说要写可信计算备忘录,而说让我们放慢开发。”她提到的是比尔·盖茨2002年发布的备忘录。当时计算机蠕虫入侵刚起步的企业系统,盖茨要求员工确保软件可靠安全。TechCrunch称,AI行业可能正处在类似转折点。
将于明年起在加州大学伯克利分校任教的AI研究员萨亚什·卡普尔认为,与对齐相比,对控制进行边际投资更可能有效。相关事件说明,尽管已有已知技术,企业内部对AI控制的重视仍不足。
引发担忧的事件通常涉及前沿模型被要求完成训练任务,尤其是网络安全评估,随后接入开放互联网并试图渗透封闭的第三方系统。问题往往出在本应限制智能体的“沙盒”配置不当。具有讽刺意味的是,Anthropic的一次突破正是因为第三方评估者没有关上正确的门。Tailscale首席执行官艾弗里·佩纳伦说:“我们这一行知道如何阻断互联网访问……你给了它下载东西的权限,本不该在接入互联网之外还单独这么做。”
更严重的是,前沿实验室没有察觉这些活动。穆索里斯指出,关于模型正在做什么的发现,要么来自受害者看到异常,要么来自网络活动,没有一项来自对AI的直接监控。在一个案例中,OpenAI的智能体接管了一个已停用的德国维基论坛,用来在评估中作弊,并活跃数周而公司似乎无人察觉。TechCrunch采访的安全专家称,实时监控是防止未来突破的关键,每个智能体会话都应限时并到期。
曾负责Google安全业务、现领导初创公司QueryStory的沙波尔·纳吉布扎德说,解决办法是“把智能体放进盒子里,从外部对它进行大量监测,观察跨越边界的一切。每次工具调用、每个进程、每个网络连接,没有例外……你为方便留下的那个洞,就是会被利用的洞”。他说,在Google多次看过人类攻击者上演同样剧情,这些模型找敞开的后门至少一样强。
OpenAI已宣布以“显著的计算成本”监控其Astra模型所有使用工具的推理过程。Anthropic表示正在强化安全程序,包括扩大对模型的可观测性。两家公司均未回应TechCrunch关于如何追踪和控制AI智能体的问题。另一个问题是智能体使用共享基础设施,这使它们能在Hugging Face攻击期间相互通信。Django Web框架共同创建者西蒙·威利森曾提出“致命三要素”:当智能体同时能访问不可信输入、互联网和私人信息时,就会酿成灾难。佩纳伦说,可以从三要素中任选两条让智能体拥有,如果三条全需要,就会出问题。