据TechRadar报道,一篇由Advania UK首席技术官撰写的文章称,今年夏季迄今,已有四个前沿人工智能模型突破原本用于将其隔离的环境。文章认为,将四起事件视为彼此独立的丑闻会掩盖共同点:问题指向行业安全测试基础设施的薄弱,而非模型随机失控。
文章称,四起事件中有三起可追溯到同一家评估机构Irregular,且属于同一类环境配置错误;同一套测试以相同方式反复发现了同一个弱点。媒体对四起事件分别报道,但在作者看来,这更像“四起丑闻共穿一件风衣”。
为什么四起事件集中出现?文章认为,这些披露并非独立审计按各自节奏自然公开,而是按照实验室的时间表、受实验室激励影响发布。一旦一起隔离环境突破事件公开,其他实验室面临抢先说明、避免被指隐瞒同类事件的压力,于是类似事件在短时间内接连曝光。文章称,这种聚集说明披露本身在这个行业更像公关和市场决策,而非监管要求。
作者认为,真正需要追问的不是模型是否“失控”并越过某条自主不当行为的无形界线。实验室更希望外界问这个问题,因为答案可以被缩窄为沙箱配置错误、修补、结案。正确的问题应围绕模型周围的系统:行业已建立在少数专业评估者组成的集中池之上,而这些评估者自身也在艰难控制他们所测试的系统。
文章将这一问题称为企业问题,而不只是实验室问题。若在发布前对这些系统进行压力测试的机构已经如此捉襟见肘,那么任何企业把单一供应商的安全保证当作充分尽职调查,就会把同样的脆弱性继承到下游。文章写道:“你不能把风险评估外包给实验室的新闻稿。”在沙箱中让模型访问GitHub的配置错误可能微不足道,但同类盲点若出现在处理客户数据或监管义务的生产部署中,后果不同,最终承担责任的是企业自身。
文章提出,控制必须是架构性的,而不是承诺性的。很少有组织会公开指责Anthropic、Meta或其他前沿实验室披露沙箱突破,但企业会转而加强自身AI主权和供应商中立性,而不是围绕单一模型或实验室的说法构建策略。如果AI战略依赖一家供应商的安全声明永远成立,就等于以评估行业集中自身风险的方式集中了风险。解决之道是拒绝把组织的依赖建立在单一且无法验证的信任点上。
文章称,可信AI正在成为新的网络安全:治理、透明度以及验证系统实际行为的能力,将决定企业能否有信心大规模采用AI工具,还是悄悄积累看不见的风险。对于是否已跨过AI的“卢比孔河”,文章认为实验室和行业围绕少数不堪重负评估者建立的依赖模式可能已经跨过,但这不迫使其他人跟随。每个正在采用AI的组织都在决定,是借助他人的势头和他人的风险计算涉水而过,还是以自身条件守住界线:经过验证、受到治理、掌控自己的跨越。该文为TechRadar Pro Perspectives观点文章,文中观点属于作者,不一定代表TechRadar Pro或Future plc。