据 Hugging Face 博客 10 月 2 日发布的文章,ServiceNow CoreAI 公开了名为 AutoSynthData 的方法,用于把企业智能体在特定环境中的能力缺口转化为训练数据。该方法先找出目标模型在真实企业环境中失败的地方,再借助能力更强的教师模型生成并校验新任务,用通过检查的样本进行后训练。
文章说,企业需要的是在自身环境中稳定工作的智能体,这些智能体承担的工作由企业使用的系统、遵循的规则和数据状态决定。一个模型可能具备广泛能力,却仍在某个具体环境中受挫,例如某个工作流处理不佳、错误组合工具,或未能遵守某项约束,而这些正是企业需要改进的薄弱点。
难点在于把单个失败变成训练数据。一次失败只能说明一个问题,而训练模型需要大量新任务,在不同情境下反复锻炼同一种能力。这些任务还必须能在环境中完成,接近真实用户会提出的需求,并且有可靠办法判断智能体是否成功。
AutoSynthData 将任务抽象为系统规范、用户提示和验证器三部分。系统规范定义智能体运行所遵循的约束,包括系统指令、环境策略,以及特定任务初始化,如预置数据库状态或知识文章集合。规范必须与环境中的工具、状态和支持的操作兼容,指令应当清晰,避免为刻意制造难度而加入任意约束。用户提示说明用户希望智能体完成什么,以及用户层面的限制条件。
文章提出,生成的任务应满足三项属性。可行性指当前环境中至少存在一条既满足用户提示又遵守系统规范的执行轨迹,排除依赖不可用工具、无法访问的知识、不可能的状态转移或策略禁止操作的任务;真实性指用户提示应接近目标环境中用户可能提出的请求,因为可执行行为的空间通常远大于真实工作流的空间;难度指任务应触及当前模型的弱点,已被稳定解决的任务提供的新训练信号有限。
验证器负责判断执行轨迹是否成功完成任务,需满足一致性、可靠性和完整性:与用户提示、系统规范和任务特定的环境状态保持一致;拒绝未满足任务或违反约束的轨迹;接受有效解法,而不是只认某一条参考轨迹。文章指出,验证器在训练中的影响直接,过于宽松会奖励错误行为,过于严格则会惩罚有效解法。
在流程上,AutoSynthData 先用诊断任务在目标环境中评测目标模型,找出它难以完成的任务模式。一个更强的教师模型帮助判断这些任务中哪些可解、成功行为是什么样。AutoSynthData 据此把能力缺口转成新的可执行任务,在环境中逐项检查,并把通过检查的样本用于后训练。对更新后的模型再次评测,可以看出哪些缺口仍然存在,并指导下一轮生成。模型能力提升后,课程会转向它仍然觉得困难的部分。
文章以 EnterpriseOps Gym(Malay 等,2026)为例展示该流程,并使用已发布的数据集。实验中,目标模型和更强的教师模型都在评测任务上运行,研究者据此识别所测试的能力、涉及的工具与工作流结构、目标模型失败而教师模型成功的环节、正确最终状态必须满足的属性,以及在保持能力不变的前提下可以变化的维度。