OpenAI新一代旗舰模型Astra的发布再生波折。据The Information 9月2日报道,Astra采用名为“循环深度”的推理技术,其思维链可能比现有前沿模型更不透明、更难监控;而OpenAI此前刚因安全问题宣布推迟发布。安全专家警告,这种不透明化趋势若扩大,将严重削弱人类对AI的监管能力。

The Information援引接近开发工作的消息人士报道,Astra使用了被称为“不透明递归”或“循环Transformer”的技术。与常见推理模型线性展开思维链不同,该技术让模型多次对同一查询进行循环处理,大量计算发生在内部,输出时留下的可读痕迹更少。消息人士称,OpenAI限制了这种技术的使用范围,以确保Astra的思维链仍能被阅读。

即便使用范围有限,消息仍引发AI安全界警觉。Redwood Research首席执行官Buck Shlegeris在社交平台发文说,他“极度担忧”Astra采用不透明递归;如果OpenAI进一步加大这种技术的使用比例,将彻底摧毁模型思维链的可监控性。该公司首席科学家Ryan Greenblatt更直言,这“可能是迄今为止对AI安全最糟糕的发展”。长期从事AI安全倡导的Zvi Mowshowitz则认为,相关技术“是在玩火”,可能逼使实验室陷入透明度“逐底竞争”,最终需要立法干预。

OpenAI方面回应称,不会放弃可监控性。首席科学家Jakub Pachocki在X平台写道,OpenAI自首个推理模型起就致力于维护和利用思维链监控,“这是我们当前研究计划的核心目标”。他同时表达了对“由混乱报道引发的不可监控性竞赛”的担忧,并说Astra的内部计算深度“在GPT-4的两倍以内”,意味着即便采用了新的推理技术,其不透明程度的增加也未必像外界反应所暗示的那样剧烈。OpenAI还通过博客表示,将为Astra配备额外的思维链监控,以便快速发现和遏制潜在的不一致行为,但未正面回应Astra是否采用了循环Transformer。The Verge说,对于确认或否认的请求,OpenAI没有直接回答,而是让其参考Pachocki的帖子。

“不透明递归”的担忧正在向全行业扩散。The Information在后续报道中说,Anthropic和谷歌DeepMind的研究人员已经开始讨论类似技术。Redwood的Greenblatt警告,不透明推理的发展速度可能超过传统思维链,最终让模型几乎完全在“潜在空间”中推理,外部将无从监看。他希望“现在阻止最令人担忧的架构还不算太晚”,并呼吁OpenAI止步。不过也有研究者指出,所有AI模型都会进行一定量的不透明推理,思维链本来就不是模型思维的完整记录;但失去这条线索仍会削弱人类发现模型恶意行为的能力。

在围绕“可监控AI”的争论发酵同日,一个强调“权限锁定”的开源AI代理项目也出现在Hacker News上。数据处理公司Mezmo发布了名为AURA的Rust框架,用于自动调查和修复生产事故。AURA把代理可调用的工具、白名单和权限集中定义在一份代码化的配置文件中,并在代理所处的提示上下文之外强制执行权限过滤,因此代理无法通过“越狱式”提示给自己增加工具权限。敏感操作必须经过人工审批,整个调查过程会生成审计事件流。项目作者称,即使用开放权重模型作后端,AURA也能在多套系统的遥测数据中定位故障根因,并将修复建议保留给人类来批准。

AURA并未回应Astra的技术路线争议,但提供了一种以外部代码约束代理行为的设计思路。在演示中,AURA通过日志、指标和代码仓库信息判断一次结账故障源于下游服务的内存泄漏和一次新合并的代码改动,随后在人工门控下将问题行和修复建议写进GitHub,待部署完成后自动验证错误消失。该项目以Apache 2.0许可证开源,支持本地安装或作为守护进程运行。