小米把MiMo-V2.6两款模型的强化学习训练过程做成公开直播,训练花费、训练步数、奖励曲线和出现故障的显卡节点均对外可查。据量子位报道,从Pro模型开始训练算起36小时,两款模型已花费超过108万美元,平均每小时约3万美元,折算下来一分钟约4000元人民币。
直播页面显示,目前训练仍处初期,开始只有一天多。两款模型在强化学习过程中都已出现较明显的能力提升:Pro的dynsam/avg@n从第1步的约0.565升至0.614,Flash从约0.514升至0.603;最新公开的DeepSWE v1.1离线评测中,Pro和Flash分别为62.24和60.77,同一评测中DeepSeek-Flash v1.1为74.2%。Flash从更低的起点快速追近,Pro暂时保持小幅领先,但由于Pro完成一个训练Step更慢,其最新评分尚未公布。
自4月开源MiMo-v2.5后,小米在这个方向上沉默了近半年。负责人罗福莉解释,这期间只研究了一件事:强化学习能扩展到多远。小米给出的答案是沿三个维度扩展,分别是训练计算量、环境与执行框架,以及评分计算量。
训练计算量方面,MiMo-V2.6系列每个训练Step大约处理20亿Token,配置为1568个Prompt乘以每个Prompt 16条Rollout,同一道题不是只让模型回答一次,而是尝试多条不同的解题和行动轨迹,再从这些尝试中获取强化学习信号。1568乘16意味着一轮就可能产生超过2.5万条Rollout;对Agent任务来说,一条Rollout可能包含几十轮思考、工具调用、环境反馈和再次行动,因此单个Step的Token数可达数十亿级别。整个系统采用完全异步的执行方式,不同任务可以同时处于执行、等待判分、计算奖励或新进入系统的状态,生成、执行、评分和训练不再严格排队。
环境与执行框架方面,MiMo-V2.6做的是多任务Agentic RL,代码、通用任务、视觉、Chat等不同类型的任务可以混合进同一次强化学习运行,并可运行在不同的Harness中。例如编程Agent的Harness可能允许模型打开终端、修改代码、执行测试、阅读报错后再修改,视觉Agent面对的则是另一套工具、环境反馈和成功条件。直播页面专门展示的Batch Composition,用于说明每个训练Step中模型正从什么样的任务和环境里获取经验。
评分计算量方面,小米提到Grader Compute,即为打分本身增加算力。代码任务还可以靠运行测试用例形成相对客观的反馈,但更开放的Agent任务只判断最终成功或失败往往不够。这里还涉及信用分配问题:如果一个Agent连续执行40步搜索资料、打开网页、编写代码、运行测试、发现错误、修改代码最终成功,系统只给出“成功,Reward=1”,模型无法知道哪些动作真正帮助了成功,哪些步骤没有必要,哪一次修改扭转了任务。MiMo此次训练特别提到Agentic In-group Credit Assignment,但尚未公布具体算法,结合同一Prompt生成16条Rollout的训练方式,其目标是利用同组多条轨迹及其结果,得到比最终成败更细致的强化学习信号。
由此,三个扩展方向构成一套完整体系:扩展计算量让模型产生更多经验,扩展环境和Harness让模型获得更多样的经验,增加评分计算量则负责从海量经验中提取更准确的学习信号。文章提到,有围观者把这三件事概括为同一句话:背后都是算力。