据雷峰网报道,九章智算云近日以GLM-5为例,披露其强化学习系统在“训推一致”方向的落地实践。该系统将Generator、Environment和Trainer纳入统一工作流,使训练与推理形成连续生产关系,支撑模型通过后训练Scaling持续提升能力。
报道称,随着预训练边际收益递减,大模型能力提升正从预训练堆叠向后训练强化学习(RL)转变,数学推理、代码生成、复杂决策等高阶能力越来越依赖RL激发。智谱在GLM-5.3与GLM-5.2上基于相同基座推进强化学习,其中GLM-5.2在SWE-bench Pro取得62.1分,在Terminal-Bench 3.0达到81.0分,核心驱动力是面向长时序、多步骤、工具联动场景的RL训练。
九章智算云与智谱等模型厂商形成了算法与工程系统双向RL Scaling的协作模式。目前,GLM-5系列、DeepSeek R系列等主流推理模型均已部署于九章智算云,实现规模化Token生产。九章智算云将RL系统视为一个分布式生产系统:Generator是生产者,Trainer是消费者,需要持续平衡吞吐、数据新鲜度与资源利用率。如果Trainer每秒消费100个样本而Generator只能生成60个,训练算力就会闲置;反之则会造成Rollout堆积和数据陈旧。九章智算云通过全局动态调度,在生成环节成为瓶颈时增加推理资源,在训练进入高峰时重新分配算力,在Environment等待时释放闲置GPU。
在状态管理方面,九章智算云依托DingoFS分布式文件底座、DFKV分布式缓存、全域零拷贝链路和RDMA高速网络,将KV Cache从单GPU临时缓存升级为可定位、可迁移、可跨任务复用的状态资源,同时减少RL闭环中的非计算开销。对于Agent场景,若已在一个节点完成大量Prefill,后续请求可复用已有KV Cache,避免重复计算。九章智算云还将在线投机者学习重新定义为异步强化学习问题,接受和拒绝的令牌作为奖励信号,训练服务器持续更新投机者,新权重可热插拔到服务器,实现零停机更新。
报道还指出,推理优化技术如PD分离、Chunked Prefill、Speculative Decoding,本质上都在解决同一个问题:让有限GPU生产更多有效Token。在九章智算云体系中,Generator产生的Token不是最终答案,而是下一轮训练的原材料。九章智算云与中国人民大学STILL项目团队联合发布的研究显示,Qwen2.5-32B、DeepSeek-R1-Distill-Qwen-1.5B等模型可通过持续RL迭代释放推理能力,后者在AIME 2024上准确率达到39.33%。研究同时表明,通过动态更新Reward Model的Cooper方法可缓解Reward Hacking。
该能力预计将从大模型延伸至具身智能。Agent的工具调用、多轮决策以及机器人的感知、推理、行动与反馈,本质都是动态试错和持续学习的RL闭环。九章智算云认为,未来迭代环境将从代码沙箱、工具调用延伸至模拟器、真实机器人与物理世界,但基础设施需求依然一致:弹性算力、实时推理、状态管理、高频反馈和持续迭代。