据MarkTechPost报道,Google Cloud AI Research与华盛顿大学圣路易斯分校、北卡罗来纳大学教堂山分校的研究团队联合发布了EnvHarness,这是一种可编程层,能够将静态的智能体基准测试环境转变为随策略训练而动态调整的自适应训练环境。

研究团队指出,大语言模型智能体如今越来越少地从精心策划的文本中学习,而是更多地从交互式环境中学习。然而这些环境都是手工构建且冻结不变的,无论哪个智能体在行动或能力提升多少,其行为都保持一致,因而无法针对策略弱点进行优化,一旦解决就再无学习价值。常见解决方案是生成新环境,但论文指出这需要依赖特定领域的生成流程,且LLM编写的验证器必须过度生成并经过大量过滤,仍无法完全可信。

EnvHarness换了一种思路。它不像传统方法那样去编写新环境,而是通过包装现有环境,在标准reset()/step()接口上添加可插拔组件,改变回合起点、智能体可执行动作和观察内容,同时保留底层的模拟器、任务和人工构建的验证器不变。该工具附带三种可自由组合的组件:Stage负责在重置后重放固定动作列表,让回合从其他位置开始;Contract在动作、转移和观察轴安装逐步骤钩子,可阻止动作、改写响应或截断观察;Chain则在同一回合共享步数预算下组合第二个环境,并以两个验证器的合取结果作为最终判定。

EnvHarness还包含一个名为EnvRigger的LLM设计器。它将策略视为黑盒,先观察五次基线轨迹,诊断系统性缺陷,然后自动编写真实Python组件,再在五次新轨迹上验证。无法解决和过于简单解决的候选都会被拒绝,每个任务最多可修订五轮。生成的钩子在独立子进程中编译,因此错误变异只会留下记录轨迹而不会导致运行崩溃。

在ALFWorld、WebArena、SWE-bench Verified、OfficeQA和SpreadsheetBench五个基准测试中,EnvHarness挖掘的技能在未接触的保留任务上均优于两种对照组。ALFWorld平均得分从62.4升至68.3,分布外拆分提升9.0分;SWE-bench Verified的解决率从49.88升至52.58,平均步数从55.01降至49.61,相当于执行步骤减少9.8%。在SpreadsheetBench和WebArena上,未改写环境中挖掘的技能低于无技能基线,而环境重构使得挖掘变得有价值。与领域特定生成器相比,EnvHarness在SWE-bench上比SWE-smith高出2.46分,同时使用5.11步更少。

EnvHarness以Apache-2.0许可发布,提供Python代码和六个环境的复现驱动。新基准只需实现一个接口(reset/step/observe/evaluate/get_env_state/save_state/from_state)即可接入,下游无须任何改动。其硬性前提是环境必须可重置,因此不适用于实时用户账户和物理机器人。