据MarkTechPost报道,IBM于8月26日发布Granite 4.2系列开源推理语言模型,包含3B、8B、30B三种参数规模。与此前的指令跟随模型不同,Granite 4.2以显式推理为核心,每个模型在回答前可生成思维链,并提供思考/非思考开关及低强度模式(对简单问题使用短推理预算)。三款模型均采用Apache 2.0许可,允许免费下载、微调和商用。

Granite 4.2为纯解码器稠密Transformer,从零预训练约15万亿token,后训练采用多阶段强化学习链路。其中8B和30B版本包含智能体强化学习模块,可在沙盒环境中学习编辑代码、操作终端和执行网络搜索。IBM还同步发布了两个470M参数的Granite Speech 5.0 Turbo CTC语音模型,后者不含大语言模型骨干,采用连接时序分类将音频映射为文本。

性能方面,据IBM公布的数据,8B和30B模型在SWE-Bench Verified上分别取得47.67和57.00分,在Terminal-Bench 2.1上分别取得20.56和29.24分。30B在τ³-bench、BFCL(v4)、AIME25、GPQA、MMLU-Pro和RULER 128K等基准上的得分分别为68.05、61.39、89.17、66.41、77.60和81.38。3B模型未公布前两项数据,在后续基准上得分为50.99、52.41、78.33、54.80、67.84和55.30。语音模型在单个H200上的RTFx吞吐量约为12,600,已上线WebGPU演示。

部署上,3B模型适合个人开发者和初创公司通过Ollama或LM Studio在笔记本上运行,官方发布了低至Q4_K_M的GGUF量化版本;8B适合拥有单块现代GPU的中型团队;30B面向具备A100/H100级算力的企业,支持FP8/NVFP4下的vLLM服务。受监管机构可额外获得本地部署权重的优势。应用领域涵盖软件工程智能体、终端与DevOps自动化、深度研究与搜索代理、长文档RAG、结构化工具调用及大规模转写。

训练细节方面,监督微调采用约720万样本,约1000亿token,其中31.6%为智能体数据,软件工程占其中69%。强化学习采用多阶段异步GRPO,每阶段从上一检查点热启动,并设置留一法基线和截断重要性采样。训练在CoreWeave托管的NVIDIA GB200 NVL72集群上完成,辅助使用IBM CodeAlchemy生成的1万亿token合成代码和推测解码层。