据量子位报道,诺因(Knowin)9月24日发布面向通用具身智能的生成式学习架构GLOW技术报告,称机器人经过一次完整的人类操作演示,即可实现跨物体、跨环境、跨任务复用所学能力。报告将其概括为“一教就会”,目标是让通用认知能力转化为可靠的物理行动。
近期GPT-6 Astra发布后,行业就具身智能技术路线出现讨论,并逐步形成共识:自回归架构正成为模型架构的收敛方向,具身智能的竞争核心将转向数据与学习方式。GLOW的路径是把人的一次完整操作、当前环境、机器人自身状态与执行历史放在同一条链路中理解,使机器人同时捕捉物体、空间关系、动作顺序和状态变化。
报告称,这一能力已在开盒收纳、浇水、擦桌和调酒等任务中得到验证。开盒收纳中,机器人根据实时画面定位盒盖、物品和盒内区域,按人类操作逻辑完成开盖、放物、合盖,更换盒子或物品后无需重新教学。浇水任务中,人类教学使用黑色细嘴壶,实际执行换成绿色浇水壶,机器人仍可完成抓握、对准和倾斜。擦桌任务中,机器人看过一次心形轨迹后能复现同样擦拭动作。调酒场景中,机器人可识别每一步的操作对象、倾倒关系和先后顺序,依次完成取杯、倾倒、回正、放回。
GLOW此次升级将原有Brain与Act能力统一到多模态自回归模型KnowinGLOW中,让视觉理解、空间推理、任务规划与动作生成在同一模型内协同完成。KnowinDream以完整交互经历为训练单元生成物理交互经验;KnowinWorld基于当前状态推演候选动作,评估碰撞风险、接触稳定性和路径可达性;KnowinAgent则围绕任务记忆、工具调用、反馈和重新规划组织执行。报告称,KnowinWorld可在训练阶段替代真机完成大量试错推演,在运行阶段预判风险;Harness会在接近瓶口、碗沿、抽屉把手等精细操作区域时切换为小幅微调模式。
评测方面,报告披露,在RoboDojo的18项仿真任务中,GLOW取得62.2%的平均成功率和71.1分的平均得分,较GPT-6(Robocurve)基线分别高出40个百分点和41.3分。在LIBERO-Pro的Object、Goal与Spatial六个扰动分项中,GLOW独立运行的平均成功率为86.7%,较GPT-6 Astra的58.2%提升28.5个百分点,六项中五项领先,位列单策略模型第一,领先第二名单策略模型ASPIRE15个百分点。在Embodied Arena的2D-Embodied QA Benchmarks榜单中,KnowinBrain-1.5以65.62的综合得分位列20个参评模型第一。
报告还称,用户完成一次操作后,系统会将整个过程编码为可复用的技能信息。执行新任务时,模型无需重新训练或更新参数,而是结合眼前环境、机器人状态、任务进展和历史反馈实时判断下一步。它学习的不是人的手臂经过哪些位置,而是任务目标、物品之间的关系,以及环境变化后如何继续完成任务。
诺因表示,将持续推进GLOW的物理学习与泛化能力,让机器人在变化环境中自主执行,通过一次教学理解并完成新任务。