据 MarkTechPost 报道,Google Cloud AI Research 与北卡罗来纳大学教堂山分校、斯坦福大学和圣路易斯华盛顿大学发布并开源 RRSI(Regularized Recursive Self-Improvement,正则化递归自我改进)。该框架允许大语言模型智能体改写自身的 harness,包括提示词、工具、记忆、控制流和子智能体,但模型权重保持不变。报道称,RRSI 通过约束改进循环本身,使提升能够保留在智能体从未优化过的基准上。
RRSI 可作为研究框架部署,代码采用 Apache 2.0 许可,需要 Python 3.10 以上版本,并接受任何 LiteLLM 模型字符串。其默认配置假设在 Vertex AI 上使用 Claude Opus 4.8。
报道指出,传统的 harness 演化循环会提出编辑,在固定的 evolve 集上评分并保留胜出方案。由于每轮重复使用相同任务,循环可能记住这些任务。RRSI 研究列出三种失败模式:基准特定拟合、追逐噪声和复杂度累积。每一种都会拉大 evolve 集分数与真实迁移之间的差距。
RRSI 保持每个 harness 组件可编辑,但正则化搜索的移动方式。在提案侧,退火编辑预算使用余弦调度,早期轮次可以捆绑多项编辑,后期轮次只允许单一可归因改动。证据感知信用机制会记录每个候选的组件、假设、diff、分数变化和成本变化,提案者读取该账本,避免重试已被证伪的想法。当进展停滞在噪声带内时,结构化探索会把预算转向运行从未触及的组件。在选择侧,泄漏批评者在任何评分前拒绝任务名称、实体、答案或基准特定逻辑;噪声调整下限要求增益超过在未改变基础 harness 上测得的方差;成本规则要求额外推理 token 必须由可测增益支付;不再产生增益的组件会成为剪枝目标。研究团队将这些机制类比为经典正则化,编辑预算对应 L0,剪枝对应 Lasso(L1),成本规则对应 Ridge(L2)。
在 8 个基准上,Terminal-Bench 2.1 的 evolve split 从 74.2% 升至 80.2%。SWE-bench Verified 从未用于选择,从 82.0% 升至 83.8%。分布外测试中,JobBench 提升 4.7 点,GDPval 提升 3.5 点,APEX-Agents 提升 3.7 点。EngDesign 的 evolve 分数提升 4.9,Frontier-Eng 提升 4.3 Medal points。Harvey LAB 的 evolve split 提升 1.1,held-out split 提升 2.3。所有 6 个 held-out split 均有改善。以 Gemini 3.5 Flash 作为策略时,Terminal-Bench 2.1 从 64.6 升至 78.7,SWE-bench Verified 从 76.8 升至 79.0。
RRSI 的 harness 也更轻。在 agentic workspace 实例上,RRSI 每次试验使用 2.42M policy tokens,未正则化演化使用 3.80M。论文摘要称减少 30%,项目页称减少 36%。
与最接近的竞争方法相比,论文表 1 显示所有方法共享相同的起始 harness、策略、evolve split 和候选预算。RRSI、Meta-Harness、AHETTHE 和 HarnessX 都冻结模型权重,但成本规则和剪枝仅 RRSI 具备,其他方法按 RRSI 研究团队的说法不具备。Meta-Harness 在 Harvey LAB evolve split 上领先。RRSI 的 evolve 增益最小,却是唯一 OOD 平均分比 H0 高出超过 1 点的方法,其 OOD 平均为 43.6,H0 为 39.7。