据量子位报道,小米9月22日为持续6天的大模型强化学习训练直播收官,MiMo-V2.6-Pro和Flash均跑完30个训练Step,总花费约350万美元(约合人民币2344万元)。Pro以46分位列Artificial Analysis Intelligence Index开源第一,部分Agent评测逼近Claude Opus 5和GPT-5.6 Sol。
其中,Pro用时5天3小时,花费约260万美元;Flash用时3天10小时,花费约90万美元。训练结束后,Flash平均通过率相对提升25%,Pro相对提升12%;在样本外测试DeepSWE v1.1上,Pro从58.4分升至72.57分,Flash从48.7分升至65.68分。小米MiMo负责人罗福莉称,这是迄今开源模型团队进行的规模最大的单次强化学习训练之一,其研究创新和工程挑战超过她曾参与的DeepSeek-R1。
MiMo-V2.6-Pro拥有1.02万亿参数、420亿激活。在AutomationBench上,Pro得到53.1分,超过Claude Opus 5的50.3分和GPT-5.6 Sol的45.8分。Hugging Face CEO评价“太棒了”。
价格方面,MiMo-V2.6沿用V2.5的API定价,Pro输入输出每百万Token约3元、6元,Flash约1元、2元。按Artificial Analysis测算,Pro完成一项Intelligence Index任务平均成本0.13美元,约合人民币0.9元;同日发布的闭源模型Grok 4.7在该指数上同样得到46分,但其xHigh版本完成一项任务平均需3.74美元,约为前者的29倍。MiMo-V2.6-UltraSpeed模式最高速度约900 TPS。
小米同时开放Pro和Flash模型权重、完整技术报告、7000多个RL任务环境、端到端RL训练框架及可自由组合的mini-harnesses,并发布MiMo-V2.6-Distill-Qwen-9B。罗福莉的推文在数小时内获得几十万浏览。Ai2后训练负责人Nathan Lambert称,真正懂开源模型的人早就知道小米在用MiMo憋大招。Hugging Face前研究员Elie Bakouch提到,小米在最终RL训练启动不到一周后便交出模型、技术报告、RL环境和训练框架。AI研究者Himanshu Raj认为,开源模型与闭源前沿的差距被大幅缩小。
应用层面,小米把MiMo-V2.6-Pro用于新型MOF材料设计,课题是吸附PFAS这类“永久性污染物”。模型检索文献和专利后提出设计假设,自动搭建模拟环境并调用开源计算工具,最终跑出A50和B50两个候选结构,模拟显示其对PFAS的吸附性能是对照材料C50的一百万到一千万倍。北京大学材料科学与工程学院特聘研究员窦金虎评价,其表现相当于一个训练有素的博士研究员。小米披露,该系列已用于内部新材料研发,研发周期从一个月压缩到2至3天,效率提升十倍。MiMo-V2.6还展示了Blender 3D建模、视频创作、音乐生成等全模态能力,并能通过视觉反馈闭环控制Franka Panda机械臂完成抓取和颜色分拣。