据MarkTechPost报道,该媒体于2026年10月9日发布了一篇教程,详细介绍了谷歌研究(Google Research)的RRSI(正则化递归自我改进)方法。该方法使LLM智能体能够在冻结模型的基础上重写自身的提示、工具、记忆、控制流和子智能体,同时避免智能体框架对其演化任务过拟合。

教程展示了RRSI的完整循环:使用Claude Opus在Vertex AI上起草编辑,并在Docker基准测试中评分。这一过程无法在免费的笔记本环境中运行。但教程指出,RRSI中真正体现论文思想的部分——决定保留哪些提议编辑的规则——是纯Python代码,可以直接驱动。教程从谷歌研究的官方仓库安装RRSI包(该包未发布在PyPI上),并逐一介绍其估计器、校准后的噪声带、选择算法的两个分支、退火编辑预算、确定性泄漏筛查以及编辑历史。随后,教程将一个模拟智能体接入RRSI自有的Domain接口。

由于作者自行构建了模拟环境,他们知道每次编辑的真实效果,从而能够对照真实基准审查RRSI的决策,并与一种非正则化搜索(简单地保留得分最高的编辑)进行比较。教程还打印了仓库中记录的论文符号与实现函数之间的映射,包括评估中的经验分数和成本估计、校准中的噪声带、选择中的算法2、调度中的退火编辑预算、批评中的泄漏筛查,以及历史中的编辑历史及其产量、修剪、停滞和探索摘要。RRSIConfig保存了论文的超参数,所有函数都按真实循环的方式接收它。

教程强调,以下内容不需要API密钥、GPU或数据集下载。该包唯一依赖是Anthropic客户端,搜索角色用它调用Claude,但教程从未使用该功能。