据雷峰网9月22日报道,香港中文大学(深圳)、天津大学、香港科技大学(广州)和新加坡国立大学的研究团队提出 COBRA-Skills,将智能体技能优化转化为带预算控制的情境多臂老虎机问题。论文《COBRA-SKILLS: Contextual Bandit-Guided Evolution for Agent Skill Optimization》称,该方法仅用 50 个优化样本,就把优化成本降低 55% 至 58%,并在 6 个跨领域基准上取得最高平均性能。雷峰网 AI 科技评论独家对话了论文第一作者卢平琛。
过去智能体技能多依赖专家手动撰写。借助大模型自动生成与优化技能成为新路径,但验证技能必须让智能体在真实任务中执行,试错会消耗 Token 和多轮交互时间。许多候选技能生成时已有缺陷,现有框架缺乏事前筛选,低质候选会吃掉预算;后续精炼又频繁调用高阶大模型,即使没有有效新证据,反思和重写仍在重复。
COBRA-Skills 的设计是老虎机负责选,进化负责改。系统维护固定规模技能种群,每轮由老虎机为技能打分,挑选最高分进入实战检验,目标智能体执行后返回奖励与轨迹,结果写入历史数据并更新打分模型。种群定期触发进化,淘汰低分技能并生成新技能。团队用两层 MLP 预测技能收益,用 LinearUCB 量化探索价值,最终优先级为预测奖励加探索奖励。每轮只选最高分评估,低分技能在进化中淘汰,低质候选不再消耗 Token。
进化机制采用对数调度,在第 3、6、9、13、19 次迭代时按需触发。每次进化淘汰评估得分最低的若干技能,由再生算子、轨迹变异和交叉重组生成新技能。再生算子从初始无技能执行轨迹中归纳全新策略;轨迹变异针对最新成功与失败案例做局部修正;交叉重组以历史高分技能为骨架,吸收成功经验并规避失败模式,无需目标智能体重新评估。卢平琛表示,团队以现有技能或高分技能为骨架,进行少量、保守的局部修改,因为大面积修改容易破坏已有优良结构,引发性能震荡。
实验覆盖 SearchQA、SpreadsheetBench、DocVQA、LiveMath、SocialMaze 和 ALFWorld 六个异构基准,选用 Qwen3.6-35B-A3B、GPT-5.4-Nano、Gemma-4-26B-A4B-it 三个目标模型,统一采用 GPT-5.5 作为教学模型,所有方法共享同一 100 例留出测试集。COBRA-Skills 在三个目标模型上均取得最高平均性能,相比无技能基线在 Qwen、GPT-5.4-Nano 和 Gemma 上分别提升 13.1、26.9 和 22.5 个百分点。与最强基线 SkillOpt 相比,总优化成本降低 55% 至 58%,教学模型 Token 消耗减少 67% 至 80%,每单位性能提升成本降低 60% 至 69%。
COBRA-Skills 在所有基准上统一仅用 50 个优化样本。卢平琛解释,样本太少如 20 个会导致分数反馈剧烈震荡,50 个样本能提供稳定反馈信号;每次进化从 50 个样本中随机抽取 8 条执行轨迹作为证据。消融实验显示,移除老虎机、改为随机选择候选,平均性能下降 2.2 分;移除进化、只在固定 30 个技能池中挑选,平均性能下降 2.4 分;Best-of-30 基线比完整方法低 2.5 分。论文也显示,COBRA-Skills 并非所有单项基准都第一,但其综合鲁棒性较高。