据量子位报道,星尘智能基座模型团队近日发布可异步执行的在线强化学习框架SmoothRL,用于解决机器人异步执行中“计划动作”与“实际动作”不一致导致的强化学习偏差问题;趋境科技与摩尔线程于9月3日签署战略合作,共同推进国产化高品质AI Token工厂建设。

实际机器人无法在推理时停下来等待。当前视觉-语言-动作模型生成一段动作序列后,异步推理意味着机器人继续执行当前动作,模型在后台计算下一段。星尘智能将动作序列按执行状态划分为已提交、执行和丢弃三类区域,只让价值梯度穿过机器人真正执行的执行区域,并从训练阶段起就让推理和机器人执行并行,保持训练与部署采用同一时间节奏。团队将这一原则概括为“在部署中强化学习”。

具体实现以针对任务微调后的π0.5为基础策略,采用轻量TD3风格actor-critic在原始动作空间预测残差修正。在绳驱本体S1上,执行频率为30Hz,推理请求频率为5Hz,基础策略每次预测32帧动作,其中本轮真正执行的区域为6帧。团队称,SmoothRL首次将这类异步在线强化学习放到真实高动态投掷任务中验证。真机测试中,动态投掷成功率在累计250个rollout的评估节点从39%升至94%;给笔戴帽成功率从8%升至83%;快递开箱成功率从30%升至90%,其中开箱任务的学习曲线并非一路上升,曾从30%回落至20%后回升至90%。在线强化学习还使真实投掷中末端执行器加速度均方根下降52%、急动度下降47%。论文也说明,该方案要求每次推理在预设延迟预算内完成,轻量残差策略的表达能力受冻结基础策略限制。

趋境科技与摩尔线程的合作聚焦国产算力生产环节。趋境科技自研的国产PD异构技术将把摩尔线程MTT S5000智算卡用于Prefill阶段的输入计算和KV Cache生成,由高带宽GPU承担Decode阶段的Token生成,以减少高成本资源占用。双方将以Token Pod为交付载体,把ATaaS平台和推理系统集成为标配集群。据双方披露,相关方案已投入生产,并承接头部模型厂商官方业务的真实流量,在同等生产服务标准下整体性价比超越国际先进算力方案。生产运行数据为平均生成速度超过50 TPS,KV Cache命中率超过90%,稳定性达到99.9%。截至2026年8月,趋境科技已完成日均万亿级高品质AI Token生产项目共建,并在多个项目形成日均千亿级生产能力。双方计划面向互联网企业、前沿基础模型公司和运营商等行业继续推广该方案。