据雷峰网报道,基元律动(TokenRhythm)联合无问芯穹、清华大学、北京大学、阿里巴巴等机构,近日推出首个Agent-Native模型NeoHorse-1,包含4B和9B两个版本。该模型探索将Agent使用工具、接收反馈和修正错误的经验转化为模型能力,为递归自我改进(RSI)提供单轮工程验证。
基元律动由前华为诺亚方舟实验室主任、盘古大模型负责人王云鹤创办。公司此前开发了开源Routing Harness系统OpenSquilla,用于在Agent执行任务时选择和组织不同模型。NeoHorse将这技术路线延伸至模型训练,模型基于阿里巴巴开源的Qwen3.5-4B和Qwen3.5-9B进行后训练。
据技术报告,NeoHorse的训练语料以包括OpenSquilla在内的Routing Harness产生的执行轨迹为核心,并辅以公开数据。这些轨迹保留了能力需求预测、路由选择、模型响应、工具调用和环境反馈,经完整性检查及目标完成、证据一致性、错误恢复等质量评估后用于后训练。团队利用路由信号估计任务所需能力、安排训练顺序,并采用Agent执行监督和在策略蒸馏(On-Policy Distillation)更新模型。
在一次项目排期测试中,一个4B基础模型找到了工作目录中的文件,却漏读了一封包含最新依赖约束的邮件,随后按过时信息生成计划并把文件写到了错误位置。这一案例来自基元律动近日发布的技术报告,用于展示模型需要从执行反馈中改进能力。报告在11项涵盖Agent执行、工具交互、代码和指令遵循的基准上评测显示,NeoHorse 4B的未加权平均分在所列4B级模型中最高,并在五项基准上超过Qwen3.5-9B底座。改善主要集中在流程清晰、反馈可观察、结果可验证的任务上;更大模型在复杂状态维护、长程调试和失败恢复中仍有优势。
研发过程中,无问芯穹依托模型算法与芯片硬件协同优化能力,为项目提供基础设施支持与Infra优化技术,提升训练效率、优化成本。清华大学、北京大学团队参与算法和训练方法创新,共同探索提高训练投入的能力回报。合作各方将模型底座、算法研究、算力基础设施与Agent执行反馈连接起来,依托开源生态验证国产开源模型的训练与迭代路径。
对基元律动而言,NeoHorse为其技术设想提供了模型层面的证据,并通过此次合作让开源模型进一步学习任务执行中的经验,检验Harness与模型协同改进的潜力。