据量子位9月24日报道,清华大学与无问芯穹联合开源面向具身智能的云原生纳管平台RLark。该平台以自研具身设备运行时(embodied-runtime)和任务级跨集群网络互联技术为核心,试图把机器人、相机等现场设备与云端算力纳入统一资源体系,让分散的设备、算力和执行程序围绕同一项任务协同运行。

RLark将机器人、相机等真实硬件通过统一硬件抽象转化为云原生系统中可识别、可申请、可调度的资源,使其能够与GPU等算力资源共同参与任务编排。平台采用控制面与数据面分离的架构,用户可通过Web控制台、API或命令行工具管理资源、提交任务;控制面统一维护资源信息、任务配置与通信关系,各集群中的Agent负责本地任务部署、资源同步与状态回传。

据量子位报道,RLark已完成3个集群、近百个云边端节点的统一纳管,覆盖4种型号的具身设备。设备纳管时间从传统的小时级缩短至约5分钟,任务提交后可在10秒内启动运行。平台还结合训练框架RLinf,打通了跨地域的采集、训练与真机验证闭环。

为验证云端算力与现场设备能否围绕同一项任务协同运行,团队将RLark与强化学习基础设施框架RLinf结合,在广东云端GPU集群与北京机器人现场之间完成了一次跨地域真机实测。实验中,现场设备负责交互和数据采集,云端GPU承担训练计算,训练得到的策略再用于后续真机交互;RLark负责设备申请、跨集群部署、任务实例互联与运行状态汇集,RLinf负责训练计算与数据协作。

这次实验连续运行约36分钟,训练推进至323个全局训练步骤(global step),完整跑通设备申请、跨集群调度、真机数据回传、云端训练和策略更新全链路。研究或运维人员可在同一任务入口查看各角色状态,并沿执行实例、节点、设备与日志定位异常;后续更换设备、调整角色规模或算法参数时,可直接修改并复用任务配置。

通信方面,RLark结合虚拟寻址、gVisor用户态网络栈与SSH安全隧道,为分布在云端和现场的执行实例建立通信通道,由平台统一维护路由、隧道与转发关系。专项测试显示,在受限网络环境下,RLark的大包单流吞吐较测试所用VPN方案提升约49%,小包单流吞吐提升约14%;在高带宽环境下,大包单流吞吐接近2Gbps。与EasyTier方案对比,RLark称显著减少了跨地域真机任务运行中因网络传输造成的卡顿。

技术路径上,RLark的自研具身设备插件与运行时负责发现并注册已适配设备,运行时为执行实例提供访问所分配硬件的能力。任务级跨集群通信优化则通过虚拟地址与SSH安全隧道连接同一任务中分布在不同集群的执行实例,并以通信域(Domain)组织互联范围,结合成员关系与证书认证控制访问。

声明式任务编排用Job、Task和Worker三层模型描述一项具身实验,用户通过一份配置声明各角色的资源、实例数量和部署位置。后续实验可复用同一份配置,具有阶段依赖的流程可通过Workflow组织多个Job。任务级运行观测将Job、Task、Worker与相关节点、设备、事件和日志关联,并提供Web Terminal与TensorBoard入口。

RLark将用户界面、API、后端服务、任务编排、跨集群互联和具身设备运行时的整套能力开放出来。项目开源地址为github.com/RLinf/RLark,项目文档为rlark.readthedocs.io,快速开始为github.com/RLinf/RLark#quick-start。