8月19日消息,据雷峰网报道,九章智算云以GLM-5系列为例,展示了其强化学习系统如何将训练与推理整合为一条持续运行的智能生产线,实现“训推一致”。该公司认为,随着大模型预训练边际收益递减,模型能力提升正越来越依赖后训练强化学习,AI基础设施需要从单纯提供算力转向算法与基础设施的协同扩展。

SemiAnalysis指出,当强化学习成为模型能力持续扩展的关键,竞争的不只是算法,还有支撑模型持续生成、训练和更新的AI基础设施系统。智谱公告显示,GLM-5.3与GLM-5.2在相同基座上推进强化学习,其中GLM-5.2在SWE-bench Pro取得62.1分,在Terminal-Bench 3.0达到81.0分,核心驱动力正是面向长时序、多步骤、工具联动场景的强化学习训练。目前GLM-5系列、DeepSeek R系列等主流推理模型均已部署于九章智算云。

强化学习与传统预训练的关键差异在于改变了训练系统的结构。一个完整的强化学习系统由生成器(Generator)、环境(Environment)和训练器(Trainer)组成,形成“生成-反馈-训练-更新-生成”的持续闭环。由于训练数据由模型实时生成,训练与推理首次形成连续生产关系,基础设施优化的核心不再是单点GPU利用率,而是训练吞吐与有效生成吞吐的动态匹配。否则,训练算力可能闲置,或产生轨迹堆积和数据陈旧,导致策略陈旧(Policy Staleness)。

九章智算云将生成器、环境和训练器纳入统一工作流,通过全局动态调度适应不同阶段的资源需求。该公司称,在MiniMax M2.1 229B和Qwen3-Coder-Next 80B等前沿模型上,该方案使首日速度提升1.5倍;随着流量变化,速度比静态预测器再提升1.25倍。九章智算云还将在线投机者学习定义为在生产环境中运行的异步强化学习问题,以接受和拒绝的令牌作为奖励信号,训练服务器持续更新投机者,新权重可热插拔到服务器,实现零停机时间。

在计算之外,运行状态也被视为基础设施的核心资源。九章智算云依托DingoFS分布式文件底座、DFKV分布式缓存、全域零拷贝链路和RDMA高速网络,将KV Cache从单GPU临时缓存升级为可定位、可迁移、可跨任务复用的状态资源,减少重复预填充和非计算开销。其调度逻辑从“哪里有空闲GPU”升级为“模型、算力、上下文和状态应该在哪里组合”。

九章智算云与中国人民大学STILL项目团队联合发布的研究显示,Qwen2.5-32B、DeepSeek-R1-Distill-Qwen-1.5B等模型均可通过持续强化学习迭代释放潜在推理能力,后者在AIME 2024上的准确率达到39.33%。研究还表明,在线策略学习是持续提升性能的重要机制,而单纯奖励更长回答容易产生“长度作弊”;通过动态更新奖励模型的Cooper方法,可以缓解奖励作弊,改善端到端强化学习效果。

SemiAnalysis的强化学习系统专项分析指出,只有实现训练推理吞吐与系统状态高度匹配的基础设施,才能充分释放强化学习的性能潜力。九章智算云认为,这一能力将从大模型延伸至具身智能,智能体的工具调用、多轮决策,以及机器人的感知、推理、行动与反馈,本质都是动态试错和持续学习的强化学习闭环。未来迭代环境将从代码沙箱、工具调用场景延伸至模拟器、真实机器人与物理世界,基础设施需求依然一致。