据量子位报道,MirroS团队发布AgentGarten,将可执行代码环境与实时神经渲染器连接,让智能体凭第一人称画面在物理规则确定的世界中行动、试错并撰写经验手册。系统以超过30fps的吞吐支持持续交互,目标指向物理世界中智能体的递归自我改进。

AgentGarten的闭环是:智能体发出动作指令,代码环境计算物理碰撞与状态更新,并导出深度或表面法线等几何草图;神经渲染器读取草图并结合此前的视觉记忆,实时渲染下一帧。物理规则由代码裁决,场景布局、接触判定和胜负判断不依赖神经网络的隐式记忆,光影与材质则由神经模型生成。任何能输出简单三维深度和法线轮廓的代码场景,都可套用同一渲染器,把虚拟环境扩充从美术劳动密集转向代码程序化扩展。

据量子位报道,传统代码或游戏引擎状态精准、规则透明,但场景往往只有粗糙几何白模和重复贴图,大规模逼真建模成本高。以视频生成为核心的世界模型能生成高清画面,但物理信息隐式藏在网络记忆中,无法提供可查询、可干预的明确状态。AgentGarten选择让代码推进世界、模型负责“看起来怎样”。

捉迷藏实验用于检验智能体能否自我提升。研究采用一对一对战:躲藏者先布置场景封堵入口,搜寻者随后进场。智能体通过编写Python代码控制移动与抓取,仅凭眼前画面决策,不知道空间坐标和对手位置。双方从空白手册起步,每轮对战十局,结束后复盘,下一轮随机抽取部分技能应用。躲藏者第4轮学会搬挡板搭掩体,搜寻者第10轮掌握借坡道翻墙;跳跃失败后,搜寻者会推近坡道调整位置再试。作为对照,OpenAI 2019年的捉迷藏研究依靠从零开始的强化学习,摸索掩体搭建经历约2500万局,学会借坡道翻墙经历约1亿局。

演练分为四个环节:领受任务时只拿到目标与规则红线;盲盒试错阶段只有相机画面,没有上帝坐标和小地图;一轮结束后撰写手册,记录试过什么、看到什么、哪些判断存疑;手册封存后交给下一轮智能体。手册中,躲藏者总结出防守核心在于堵住通道而非仅挡住视线,搜寻者总结出搬东西前先试拉、避免把卡死当抓稳。同一循环还被复刻到四个世界:陪伴小狗得分从首轮13分提高到第4轮19分,狭桥会车总耗时从71秒压缩至41秒,合作牧羊从第1轮仅圈进三只到后三轮全部圈进,采石场装载机第4轮在360秒时限内提前31秒完成推石、送料、入库。

为支撑边看边行动,团队从基础全模态模型出发提出Adversarial Forcing训练方法,并进行推理优化。渲染器从整段离线生成改为流式逐块生成;通过精确重放机制稳住长序列交互的时序一致性;训练中引入真实视频判别器构建对抗信号,约束画面质感并贴合代码给出的几何轮廓。团队还手写Triton融合算子、使用CUDA Graph和延迟不到10毫秒的超轻量解码器,最终在480p分辨率下以30fps以上吞吐稳定支撑闭环交互。

MirroS将这一方向称为Physical RSI,即物理世界的递归自我改进。可执行代码让训练世界被程序化生成,学习得到的渲染器让这些世界拥有可感知的逼真反馈,智能体写下的手册则让每次摸索成为下一轮探索的台阶。