据MarkTechPost于2026年10月8日报道,JetBrains已发布Mellum2.1,这是一个面向编码智能体和快速子智能体的12B混合专家(MoE)思考模型,每个token激活2.5B参数,以Apache 2.0协议在Hugging Face开源。该模型可自行托管,能够探索代码仓库、编辑文件并检查自身修改。
此次发布的检查点为Mellum2.1-12B-A2.5B-Thinking,是JetBrains在2026年6月开源的Mellum2 Thinking的后续版本。它属于先输出思维链再作答的推理模型,面向智能体工作单元、通用推理助手和私有自托管部署三类用途。
模型架构与Mellum2相同,共28层、64个专家,路由器每token激活8个专家。注意力采用分组查询注意力,32个查询头和4个KV头;每4层中有3层使用1,024 token滑动窗口。上下文长度为131,072 token,词表包含98,304 token,权重以bfloat16格式发布。
据MarkTechPost报道,Mellum2.1的升级几乎全部来自强化学习。训练后阶段成为主要部分,JetBrains加入数学、竞赛编程、科学、工具使用和软件工程等RL任务,并过滤开放RL数据集中测试损坏、答案无法验证以及过易或不可行的任务。在软件工程场景中,模型在真实仓库里使用shell和文件编辑工具训练,测试通过时获得奖励;训练在数千个环境中启动了数百万个沙箱。
JetBrains自报的基准测试显示,Mellum2.1在17项列出的基准中15项超过Mellum2,并在17项中5项胜过Qwen3.5-9B。智能体编码提升最明显:SWE-bench Verified从2.0升至47.0,SWE-bench Pro从0.0升至28.0,Terminal-Bench 2.1从0.6升至17.4。智能体运行使用开源Pi v0.73.1测试框架和114K token上下文。Mellum2.1在LiveCodeBench v6(82.0)、HumanEval+(91.5)、MBPP+(79.4)和BFCL v4(62.3)上领先同组模型;Qwen3.5-9B仍在SWE-bench Verified(50.0)、SWE-bench Pro(38.0)、AIME 25/26(86.7)和GPQA Diamond(77.8)上领先。Mellum2.1在Terminal-Bench 2.1上为17.4,低于Qwen3.5-9B的21.7。安全性方面,HarmBench从21.5降至8.5,数值越低越好。
基准比较需注意测试管线差异。Qwen官方模型卡列出Qwen3.5-9B在LiveCodeBench v6为65.6、GPQA Diamond为81.7,而JetBrains对同一模型测得75.4和77.8。JetBrains的评测在思考模式下用同一管线完成,所有分数均为其自报。
速度方面,训练后阶段未改动架构,因此Mellum2.1速度与Mellum2一致。JetBrains称,在1块H200重负载下,Mellum2.1服务的token吞吐接近Qwen3.5-9B的两倍;单次请求中,多token预测(MTP)使其约快1.6倍,用于vLLM投机解码的MTP头即将推出。本地运行上,完整模型可用vLLM并加--reasoning-parser qwen3服务;工具调用需加--enable-auto-tool-choice --tool-call-parser hermes。JetBrains建议温度0.6、top_p 0.95、top_k 20。GGUF构建正在进行,已有仓库列出5个文件:BF16为24.3 GB,Q8_0为12.9 GB、最高token匹配率96.1%,Q6_K为10.9 GB、93.9%,Q4_K_M为8.1 GB、88.0%(推荐),MXFP4_MOE为7.0 GB、85.6%。