据量子位9月21日报道,清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。该框架面向真实物理世界,将通用大模型的任务理解与规划、VLA等专家模型的精细操作,以及记忆、工具和机器人接口连接起来,形成从感知、决策、执行到反馈纠错的闭环。在LIBERO-PRO基准测试中,RPent达到92.6%的任务成功率,并将端到端任务完成速度优化7倍以上。
报道提到,随着GPT-6 Astra开始接受真实机器人操作测试,这种以大模型作为决策大脑的智能体范式正逐渐走向物理世界。RPent由大规模具身强化学习框架RLinf的核心团队打造,开源代码已在GitHub发布。真机展示中,机器人可将钢珠倒入碗中、双臂协同擦拭盘子,也会主动移开遮挡物,找到藏在碗下的勺子。这些任务并非为每一种场景单独训练专用策略,机器人开始从执行学过的动作,转向理解任务、调用能力,并根据环境变化调整行动。
在“将干净餐具放入纸箱”任务中,冻结VLA会把同一只蓝色盘子错误放入金属篮,RPent则先观察环境,再根据新目标选择放置位置;若视觉定位出现偏差,它会检查结果、排除错误目标并重新定位。另一任务要求机器人读取品牌标签,将不同饮料放入对应袋子,它抓起瓶子后先小幅试抬确认夹持稳定,路径不可行时再调整腕部姿态。面对被碗遮挡的勺子,机器人会先移开两个碗,使目标重新可见、可达。
探索成功后,RPent会把经过验证的任务逻辑沉淀为任务卡;再次执行时可启用Flash Mode,通过任务卡复用流程,只根据当前视觉状态做必要调整,避免每一步都重新调用大模型,以降低执行延时。
当前具身智能存在纯VLA端到端和纯大模型Agent两种路线。前者精细操作较好,但任务变长、语言变复杂或场景受扰动后容易退化;后者随着GPT-6这一代通用模型对具身任务覆盖率提升,已能跑通不少任务,但在亚厘米级精度、执行时延和“越用越强”上仍有短板。RPent将通用大模型用于理解任务和制定计划,VLA、WAM等专家模型负责高精度动作执行,记忆系统沉淀经验,框架连接模型、工具与真实环境。其算法源于团队7月提出的Harness VLA工作。
架构上,RPent分为用户层、智能层、接口层和环境层。用户层提供交互式命令行和可选Web Dashboard;智能层由Agentic Planner和Action Primitive组成;接口层将决策转换为机器人可执行指令;环境层已支持LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境,以及Franka、双臂Franka、YAM、SO101等真实设备。新增机器人只需作为独立模块接入robots/目录。
RPent通过MCP、RPC与MHS三层接口连接物理设备。MCP统一描述可调用能力,RPC连接工具、模型服务与机器人环境,MHS面向更广泛物理设备提供统一读写与控制抽象。其Memory系统将经验按复用范围组织为三层记忆,并记录适用范围、类型、可信度和支撑证据,新经验需验证后才能提高可信度,冲突记录会被保留和隔离。记忆机制包含可迁移的任务方案Recipe,而非固定坐标。在LIBERO-Pro Goal实验中,引入记忆机制后,RPent在位置交换任务中的成功率从31.0%提升至87.0%,并支持记忆资产分发。