据雷峰网报道,斯坦福大学The Movement Lab与加州理工学院公开研究项目HomeBody,将GPT Astra接入宇树G1人形机器人。机器人先自主探索陌生厨房,再按人的指令完成找东西、拿药、扔垃圾和开抽屉等连续任务。项目没有让GPT Astra直接控制关节,导航、轨迹规划、碰撞检测、视觉伺服和全身控制仍运行在本地,大模型负责任务理解、技能选择和失败后的重新决策。
Astra每次判断后,通过结构化tool call选择技能并提供参数。Pick接收当前图像中归一化到0至1000的二维点,并指定左手或右手;Navigate接收地图坐标系中的二维目标点和朝向点;Place使用机器人躯干坐标系中的三维释放位置、执行手和释放距离;抽屉操作把视觉对准、挂住把手和向后行走封装成一个技能。雷峰网报道称,这套接口刻意不让VLM输出机械臂末端的连续轨迹,大模型只在语义空间表达操作目标。
探索阶段,系统同步保存相机观测、D435i双目数据、LiDAR与SLAM信息、关节姿态和Astra选择过的航点,并通过Real2Sim整理成Isaac Sim中的数字环境。运行时先由Super Odometry得到G1在现实SLAM地图中的状态,再用ICP把SLAM点云与Isaac Sim重建环境配准。空间记忆因此分成语义记忆和度量几何两层:前者保存关键帧里出现了什么,后者保存拍摄时机器人位于哪里。收到拿药任务后,Astra从历史观测恢复药瓶或抽屉的视觉线索,再沿绑定位置让Navigate返回记录过的区域。
抓取阶段,Astra给出图像中0至1000范围的二维点并指定手。系统先用该点提示分割模块切出目标,随后Fast-FoundationStereo根据D435i双目图像计算深度,再利用相机标定关系把mask内像素投影成三维几何,通过解析方法生成抓取姿态。机械臂移动时,规划器生成spline reference,使用minimum-jerk timing约束轨迹,再沿轨迹逐点求逆运动学,并检查整条swept motion的碰撞间隙。
系统继续使用SAM 2.1跟踪目标,结合SAMURAI的memory selection维持跨帧目标状态,再通过visual servoing修正接近方向。小范围视觉误差由servo loop修正;机械手闭合却没有建立接触时,Pick技能可以换一个grasp candidate,或改变机器人站位后重新规划,这些尝试有明确次数边界。只有局部恢复无法处理,技能才把失败原因返回Astra,由VLM决定重新定位、换目标或调整任务顺序。
控制频率也被分层:手臂和手部控制命令运行在250 Hz,AMO每5个控制tick更新一次,相当于50 Hz,GPT Astra的远端推理处在秒级。抽屉操作中,机械手挂住把手后,系统让机器人向后走,同时维持上肢操作目标。AMO将Sim2Real强化学习和轨迹优化结合,训练目标之一是让G1在面对超出常规分布的上肢目标时,仍能通过下肢和躯干调整扩大可操作空间。
系统目前仍有工程边界。Real2Sim会增加部署准备和API成本,Astra的远端推理会在技能之间产生停顿,本地感知和规划需要一台RTX 4090笔记本运行,更重的视觉模型会继续推高计算需求。长时间任务还受到机械臂工作空间、手部舵机发热以及硬件耐久度限制。技能覆盖范围同样有限:Astra可以重新安排Pick、Place、Navigate和Open Drawer,却不能仅靠语言推理生成从未实现过的接触动力学;技能库没有擦桌子,就无法因一句指令自动获得稳定的擦拭控制。