递归自我改进(Recursive Self Improvement,RSI)正成为人工智能行业在 AGI 之后的新一轮讨论焦点。据爱范儿报道,OpenAI、Anthropic 等前沿实验室已将 AI 编写代码、运行实验、改进训练流程的能力纳入内部研究,围绕这条技术路线的安全争论同时在业内升温。

RSI 指的是 AI 自行改进研发方法,并把有效改动交给下一代系统使用。其思想源头可追溯至 1965 年,英国数学家 I.J. Good 提出,一台超越人类智力的机器应当能够设计出比自己更聪明的机器,机器智能由此进入不断加速的正反馈循环,他称之为「智能爆炸」。与 AGI 关注 AI 能否完成与人类相当的通用认知工作不同,RSI 关心的是 AI 能否改变产生这些能力的系统。

上海交通大学、清华大学、字节跳动、上海人工智能实验室等机构研究者合作完成的预印本《The Last AI Built by Humans》,将 RSI 的自主性划分为 L1 至 L5 五个层级。L1 执行人类给出的改进方案,L2 自主寻找改进策略,L3 决定需要获取哪些经验,L4 能把部署环境中的反馈转化为持续保留的改动,L5 则把改进机制本身也作为改进对象。在最激进的设想中,AI 还将获得提出目标、修改评估方法和重写底层改进逻辑的能力。

企业侧的进展已经出现具体数字。OpenAI 在 9 月 6 日公布的内部报告称,其已实现「自动化研究实习生」目标,这类系统能在人类指导下编写代码、运行实验、排查故障和分析结果,其中一些任务原本需要熟练研究员花费数天。截至 8 月中旬,OpenAI 研究部门每投入一个人类工作日,智能体的运行时长相当于 3.1 个工作日。

Anthropic 把自动化推进到了安全研究。据爱范儿报道,Claude 可以自行查文献、提出方案、生成训练数据、运行实验和评估结果,并依据成绩反复迭代。在最接近「AI 训练下一代 AI」的一次实验中,能力较弱的 Claude Sonnet 5 帮助早期 Claude Opus 4.8 改善安全表现,约 60 小时内测试了 50 多种方案,最终仅使用约 2400 条训练样本,就把后者既定评测中的对齐成绩推到接近正式版 Opus 4.8 的水平。

另据外媒 The Information 报道,北大校友翁荔重返 OpenAI 后将带队研究递归自我改进。她在技术博客中讨论的 Harness Engineering,指对 AI 运行系统的改造,涉及工具调用、上下文管理、记忆保存、任务分配、权限控制和结果检查。这类改动未必直接修改模型权重,却可能提升整个系统的工作能力。

对于在各类计算机认知工作中全面超过顶尖人类专家的超级人工智能,Thinking Machines 首席科学家 John Schulman 给出的预测是 3 至 4 年,Millidge 倾向于约 5 年,O'Neill 认为可能需要 5 至 10 年。分歧背后是尚未解决的技术难题:模型需要不断吸收新经验又不能丢掉原有能力,更新过激可能出现灾难性遗忘,过于保守又可能学不进足够多的新知识;研究判断力更难自动化,判断一个失败实验意味着方向错误还是值得继续探索,至今仍高度依赖人类直觉。

安全争论的导火索来自 9 月 8 日。曾在 OpenAI 和 Anthropic 从事研究工作的 Jacob Coxon 宣布从 Anthropic 辞职,他在社交平台 X 上称,自己离开是因为担心两家公司没有采取负责任的行动,而是在竞相研发能够自我提升的超级智能,该帖浏览量很快超过 1.7 亿次。Anthropic 在职对齐科学负责人埃文·休宾格公开附和了这一说法。Anthropic CEO 达里奥·阿莫代伊随后发文呼吁同行集体降速,给安全研究让出一到两年,并提出允许第三方评估机构常驻实验室,以接近内部员工的权限检查企业是否履行安全承诺。OpenAI CEO 山姆·奥特曼、xAI 创始人马斯克也在减速问题上表态。

英伟达 CEO 黄仁勋则在近期 All-In 峰会上反驳了非黑即白的思路,认为安全与创新并非只能二选一。据爱范儿报道,能够承担高额安全审查成本的主要是头部公司,它们拥有庞大的安全团队、封闭的数据中心和充足的审计资源,开源社区和中小企业难以承担同等规模的合规成本。