据科技媒体MarkTechPost 9月7日报道,由Axis Robotics、加州大学伯克利分校、佐治亚理工学院、南洋理工大学等机构组成的研究团队发布了名为AXIS的浏览器驱动的机器人操作数据引擎。该系统将示范采集移到浏览器中,后端GPU负责繁重算力,并提供包含207个操作任务、50129条经过验证轨迹的快照。在实验中,使用AXIS数据持续预训练后,π0.5模型在LIBERO-Plus基准上的总体成功率从83.9%升至88.8%。

AXIS采用前后端分离设计。贡献者无需本地GPU或实体机器人,即可在MuJoCo WebAssembly前端中遥控Franka Research 3机械臂,通过键盘、鼠标、虚拟摇杆或游戏手柄完成示范。物理运算与Three.js渲染独立于React界面线程,使状态动作样本保持与模拟器同步。渲染、训练和评估则分别由8张RTX 4090 GPU和8张A100 GPU承担。任务由TaskGen生成器自动创建,它将语言指令分解为任务、场景和物体配置,经图像到3D流程获取或生成网格,再按物理尺寸缩放并建议2.5D布局。场景监督模块会校验结果,必要时重新放置物体或生成新方案。每个任务均配有结构化成功判定,由后端重新运行验证,而非直接信任前端的成功标志。

本次发布的数据集包含207项任务、50129个片段,任务或场景变体超过6万种,覆盖七类场景。每条轨迹包含任务元数据、机械臂形态、模拟器版本、机器人状态、动作、成功标签,以及第三视角和腕部RGB-D观测。论文称有超过7万名社区成员参与了数据贡献。数据清洗流程包括:删除关节变化量低于0.005的静止样本;使用窗宽15、三阶多项式的Savitzky-Golay滤波器平滑连续运动;通过三次样条将浏览器端6至8Hz的数据重采样到20Hz目标。该报道引用论文的对比数据称,清洗使平均加速度从1.3539降至0.4885,平均加速度变化率从11.5899降至2.2243,但回放成功率从100%下降到86.2%。随后,验证后的轨迹在IsaacSim中以禁用物理步进的方式重放,同时随机化场景、相机、材与光源,最终生成256×256的射线追踪RGB图像。

评估以公开的π0.5预训练权重为起点,该模型使用PaliGemma加Gemma-2B主干和Gemma-300M动作模块。实验在模拟语料上继续预训练10万步,再用LIBERO数据微调3万步。采用AXIS全部数据后,π0.5在LIBERO-Plus上的得分达88.8,高于原π0.5的83.9,也高于轨迹数量匹配的RoboCasa365对照组的57.5。研究摘要中给出的相对提升5.8%和37.3%均以83.9基线归一化,因此更直观的绝对差距为4.9分和31.3分。按AXIS数据量25%、50%、100%划分,总体得分依次为84.7、85.7、88.8。分项结果显示,传感器噪声和相机两项提升最大,分别为13.7分和11.3分;背景、机械臂姿态和布局分别提高3.7分、3.8分和2.6分;光照和语言则分别下降1.7分和1.3分。相机分项在50%数据量时曾低于基线,后随数据量增加恢复。

AXIS平台目前已在浏览器中开放,操作者可在线体验;训练代码以补丁形式发布在OpenPI项目上;Hugging Face数据集则采用门控访问,大小2.36TB,仅限非商业学术用途,未发布模型权重。该报道同时指出,系统目前仅部分部署。