据MarkTechPost于2026年9月14日报道,机器人初创公司Reward AI发布通用操作策略OM-1(Omnibody Model 1)。该策略从人类佩戴传感手套的演示中学习,再运行于工业机械臂和人形机器人,并以人类速度操作。Reward AI称,训练不使用遥操作数据,也不使用机器人本体数据,系统遵循“一个模型、一个数据接口、任意本体”的原则。目前OM-1是公司内部策略,未公布权重、代码、数据集或API,开发者还不能在自有硬件上运行。
Reward AI团队此前参与过DexCap、HumanPlus和ALOHA等项目。多数机器人基础策略使用遥操作或自采机器人数据,会把数据集绑定到单一本体。Reward AI认为,人类水平操作不会来自更多此类数据或更多算力,并引用安德森的“More Is Different”。该公司把采集、学习和控制设计为同一条流水线,使今天录制的演示可训练尚不存在的机器人本体。
系统的数据采集端是Omnibody Hand,一款七自由度可穿戴设备,延伸了团队此前的DexCap便携动作捕捉工作。该设计没有逐关节复制人手,而围绕选择接触点、在手中重新定向物体、在精细抓取与强力抓取之间切换等功能构建。设备可捕捉拇指与食指捏合、拇指和食指弯曲,以及中指、无名指和小指在掌指关节处的耦合运动。其远端弯曲机构可吸收手指长度差异,无需按用户调整。Reward AI把人体工程学视为数据质量问题,因为设备滑动或限制佩戴者会产生补偿性抓取。
一个数据接口把佩戴者动作转化为训练数据,无需分阶段设置或监督人员。设计目标是传送带分拣,即人在不到一秒内发现、抓取并抛出物体。手套结合高频触觉传感、用于接触前接近的接近传感,以及可在快速运动中保持上下文的全局快门手内相机。手部姿态跟踪常用视觉惯性方案,但快速反向运动时精度受视觉更新率限制;Reward AI加入电磁传感和扰动补偿。让两种跟踪器在两个机械止点间以3至67厘米/秒的八种速度移动,每种速度平均十次运行,电磁跟踪平均超调误差从约0.4毫米升至9.5毫米,视觉惯性方案从约2.1毫米升至24.9毫米,最高速度下误差降低60%,运行间波动也更窄。力沿同一轨迹记录,因此演示既包含路径也包含用力。
OM-1直接从人类动作生成机器人动作,不经过中间机器人。由于每条演示格式相同,预训练与后训练没有分割:最早和最新的演示在同一阶段训练同一策略。输入是手套的多模态流,包括图像、触觉信号、指间接近和手部姿态轨迹。每个模态按传感器原生采样率处理,不降采样到共同频率,以保留高频触觉和运动线索。输出包含运动方向、速度、力,以及抓取启动等事件的时间信息。Reward AI称为此构建了高效推理的新架构,但未披露架构细节和参数数量。
策略之下是高频率控制层,在仿真中用强化学习训练,以处理速度与加速度相关动力学、外部扰动和系统延迟。经典控制器遇到意外负载偏离参考后可能无法恢复,该层则能保持参考并回到稳定状态,这使机器人可打开完全关闭的冰箱门或抬起重量未知的箱子。控制层按自己的时钟运行,在策略计算下一步动作时继续工作,因此推理延迟不会中断运动。由于连续预测可能无法平滑衔接,它在线优化两者之间的过渡。同一动作空间覆盖移动机器人的操作与导航。
Reward AI报告称,OM-1能用不到30分钟的人类数据学会一项全新任务,包括有挑战性的动力学和长时程任务,并将此归因于集成式技术栈,而不是单独的策略。