据Hugging Face博客消息,IBM于8月25日发布了两款Granite系列模型:Granite Speech 5.0 Turbo CTC语音识别模型和Granite 4.2语言模型。前者以极高速度完成语音转写,后者为具备推理能力的开源大语言模型。

Granite Speech 5.0 Turbo CTC包括两个470M参数的英文语音识别模型,在NVIDIA H200 GPU上批量推理速度超过12,600 RTFx,即每秒可转写超过3.5小时的语音。两个模型的训练数据和许可证不同:非商业版本使用额外数据,采用CC-BY-NC-SA-4.0许可证;另一个版本采用Apache 2.0许可证。在OpenASR排行榜公开测试集上,非商业模型词错率为4.85%,Apache版本为5.00%。此外,这两个模型在远场语音识别中均位列速度最快的前两名,同时保持较高准确性。

与之前的Granite Speech模型不同,这两个新模型采用仅编码器架构,参数量仅470M,吞吐量比以往模型快20倍以上,更适用于边缘设备上的语音转文本任务,但牺牲了语音翻译和关键词偏置等功能。

同日发布的Granite 4.2是IBM首个密集、仅解码器的推理大语言模型系列,提供3B、8B和30B三种尺寸。该系列模型从头预训练了约15万亿个Token,采用五阶段训练策略,将上下文窗口扩展到512K Token,并在监督微调后应用多阶段强化学习。所有模型均支持思考/非思考模式切换,以及低难度思考模式,原生支持工具调用,并采用Apache 2.0开源许可证。

其中8B和30B模型额外经过智能体强化学习训练,能够在真实沙盒环境中调用工具、编辑和运行代码、操作终端及搜索网络。所有Granite 4.2模型可通过OpenAI兼容端点提供服务,例如配合vLLM使用时可输出OpenAI格式的工具调用,方便接入智能体框架。

IBM通过Hugging Face平台向开发者开放这些模型,延续了Granite系列开源策略。