据MarkTechPost报道,NVIDIA研究人员与普林斯顿大学、马里兰大学合作提出PivotOPD,一种面向多轮大语言模型智能体的同策略蒸馏方法,训练智能体避免最具破坏性的早期错误,并在错误发生后恢复。该方法在ALFWorld、WebShop和基于搜索的问答上,让Qwen3-1.7B和Qwen3-8B学生模型对13个基线取得最佳平均成绩。
PivotOPD不是新模型,而是一种训练方法,不增加推理成本,训练后的智能体可在其基座模型能运行的地方部署。研究将“关键错误”定义为延长完成任务所需最短剩余路径、或使任务无法解决的动作。ALFWorld的符号oracle逐轮测量这一指标。在Qwen3-8B、Qwen3-30B-A3B和Qwen3-235B-A22B上,59%的失败轨迹(262次中的155次)包含关键错误;首次关键错误在30轮中的中位数为第8至第12轮,之后智能体平均浪费18至21轮仍未恢复。重放Qwen3-8B的失败轨迹时,修正关键轮次把成功率从8%提高到59%;保留错误但强制接下来2轮正确动作,成功率也达到58%。
标准OPD把留出失败率从79%降至56%,但关键轮次后的失败率只从51%降至49%;正确动作在关键轮次概率始终低于1%,8次rollout很少采样到。基于结果的强化学习同样有盲点:如果所有rollout都失败,组相对优势为0。
PivotOPD在基于分组的强化学习上加入3个组件,合并到一次PPO更新。关键检测让更大的教师模型回顾每次rollout及结果,挑选候选轮次并指定黄金动作;学生动作与黄金动作不同即为关键轮次。在ALFWorld,检测到的关键轮次平均在77.8%的失败rollout中落在oracle关键轮次的1轮范围内。预防性蒸馏用反向KL,让冻结的学生副本在黄金动作提示下重新为原回答打分,把学生推离已犯错误。恢复性蒸馏用前向KL,在每个关键轮次后由教师最多指定K轮恢复动作,被提示的自教师写出恢复回答,未提示的学生据此训练;前向KL能提升学生几乎不会采样到的动作。教师只指定动作,token级目标来自学生自身被提示后的分布。
1.7B学生上,PivotOPD在ALFWorld平均73.7%,比SDAR高5.5个百分点;搜索问答平均44.5%,比RLSD高5.9个百分点;WebShop得分比RLSD高1.2,成功率76.6%,高14.1个百分点。8B学生达到ALFWorld 93.0%、搜索问答47.4%、WebShop成功率81.9%,领先幅度至少1.8个百分点。以Qwen3-8B自任教师时,仍在3个基准全部胜出,平均领先3.9个百分点。SWE-Bench Verified上,Nemotron-3.5-SFT学生由Nemotron-3-Super教学后从62.8%升至66.0%,标准OPD为63.0%,教师为73.0%。
恢复是突出结果。72次重放关键错误中,PivotOPD恢复率72.7%,基座模型8.3%,标准OPD 20.3%,仅预防性蒸馏45.8%;平均9.7轮恢复,最优6.2轮。限制是1.7B学生在ALFWorld的「Look」任务上最差55.9%,SOD为83.9%;方法依赖可重放环境,以及关键判断能与oracle匹配的教师,失败rollout中匹配率77.8%。