据量子位报道,华为诺亚方舟实验室前主任、盘古大模型负责人王云鹤创办的基元律动公司近日发布其首个大模型成果——Agent-Native模型NeoHorse。该模型包含4B和9B两个版本,尝试将多模型调度执行中积累的经验用于Agent后训练。
报道介绍,NeoHorse由无问芯穹提供算力支持与Infra优化,清华大学、北京大学团队参与算法和训练方法研究。模型重点面向调用工具、读取环境反馈、发现错误、调整路径并最终完成任务等Agent能力。在覆盖Harness Agent、工具使用、代码和指令遵循等10项评测中,经过Agentic Post-Training的4B模型综合表现已达到或略超9B基础模型,宏平均得分从58.94提升至64.87。
基元律动此前一直以多模型协作和路由调度见长。其Routing Harness系统在运行中会记录模型选择、执行决策、失败修复和环境反馈等信号。NeoHorse的核心语料正是将这类执行信号与公开数据结合,经筛选后用于模型后训练。团队会对轨迹进行结构检查和六维度质量评估,再用路由信号安排课程顺序,让模型先学习能力需求较低的任务,再逐步进入更复杂的执行轨迹;同时采用On-Policy Distillation,由教师模型针对学生模型的实际执行步骤给出指导。
技术报告显示,后训练在4B和9B两个尺度均带来稳定提升,提升主要出现在环境反馈可观察、交付标准清晰的Agent任务上。例如,在一个项目排期任务中,基础模型找到了工作目录中的文件,却没有读取包含最新依赖约束的邮件,随后按过期信息生成计划;经过后训练的模型则会继续读取新增证据,发现约束变化后重新计算排期、验证结果并保存到正确位置。
王云鹤团队曾提出,模型不归一将是AI产业长期存在的一种结构,需要一套系统决定每一步调用哪个模型、何时切换。Routing Harness负责在Agent运行中组织执行,而执行过程中沉淀的经验反过来可用于模型改进。基元律动的产品体系还包括开源路由项目OpenSquilla和API服务TokenRhythm,NeoHorse则是这一循环中模型层的产物,也是公司从模型聚合与调度走向模型训练的一步。
基元律动认为,这一方式让模型产生的执行轨迹不再只停留在调用消费环节,而能成为下一轮训练来源,逐步形成执行、筛选、训练、再部署的改进闭环。这与公司此前提出的“递归自我改进”方向一致,不过目前该验证仍集中在工程闭环,而非常识意义上的人工智能自我改进。