人工智能媒体MarkTechPost 9月7日报道,OpenBMB发布MiniCPM5-2B。该模型为MiniCPM5系列的第二款检查点,是一个参数总量约25.2亿的稠密因果语言模型,面向端侧设备运行,在34项基准测试中平均得分53.9。
MiniCPM5-2B参数总量为2,516,756,480个,其中约19.8亿位于嵌入层之外。模型使用42层分组查询注意力,具有16个查询头和2个键/值头,原生上下文窗口为131,072个token。它的架构与常规LlamaForCausalLM一致,主流推理引擎无需定制算子或模型代码分叉即可加载。权重采用Apache 2.0许可,可通过vLLM、SGLang、Transformers、llama.cpp、Ollama、LM Studio、MLX和FlagOS运行。
OpenBMB将MiniCPM5-2B与同尺寸的LFM2.5-2.6B、Qwen3.5-2B和Gemma-4-E2B-it比较,并列出Qwen3.5-4B、granite-4.2-3B等作为更大尺寸参考。按OpenBMB的对比数据,MiniCPM5-2B在34项基准上平均得分53.9,对比模型中得分最高的Qwen3.5-4B为51.1,granite-4.2-3B为42.7,LFM2.5-2.6B为33.2。具体到代码推理,LiveCodeBench v6得69.1分,SWE-bench Verified得46.4分;工具调用方面,τ²-Bench Telecom得97.1分,BFCL v4得66.6分,τ³-Bench Banking得20.8分。长上下文表现有高有低:NoLiMa得68.1分,AA-LCR得59.0分,LongBench v2得43.7分。通用知识受尺寸限制明显:MMLU-Pro为70.8分,Humanity's Last Exam为8.9分。OpenBMB专门标注了哪些行来自Artificial Analysis,哪些行为内部复现。
训练方法上,OpenBMB表示MiniCPM5-2B遵循UltraData分层数据管理方法,基础训练分为稳定阶段和衰减阶段,中间训练将模型适配到目标数据分布。后训练先使用4000亿token进行深度思考SFT,随后为数学、代码、智能体任务和写作训练专用强化学习教师,算法基于评论家风格的JustRL II。最后通过on-policy distillation(OPD)将16个RL专家(其中5个为智能体专家)合并成单个模型,每步计算学生与教师logits之间的全词表反向KL散度作为优势估计。OpenBMB称,RL加OPD阶段在推理和通用基准上带来10.96分的平均增益,在智能体基准上带来6.96分的平均增益。
OpenBMB也公开了训练数据,包括Ultra-FineWeb、Ultra-FineWeb-L3、UltraX、UltraData-Code、UltraData-Math、UltraData-SFT-2605、含50万智能体样本的UltraData-SFT-Agent-2609,以及含8万以上RL样本的UltraData-RL-2609。中间检查点一并发布,覆盖基座、中间训练和仅SFT阶段,使每个阶段的贡献可以直接测量。