据量子位报道,一个神秘的具身智能团队近日连续发布多个机器人演示视频,展示其内部代号为“MVP”(Make Veritable People,直译“做个人吧”)的自进化模型。视频中,机器人展现出类似人类的物理理解、行为逻辑和持续学习能力,被部分网友评价为“具身智能的ChatGPT时刻”。该团队此前发布的十分钟一镜到底视频已在行业内引发热议,甚至有头部公司专门开会研究。
针对外界关于“是否遥操”的质疑,该团队没有直接回应,而是又发布了几个依旧一镜到底的演示视频。团队表示,模型也像人,要让它自己说。据悉,MVP模型的名字意为“模型能力像真人一样”,团队还透露,下一步将让机器人上街,在开放环境中直接展示。
在第一个演示中,机器人左手端水杯,在被人用木棍推搡时能平稳躲避,杯中水未洒半滴;当右侧易拉罐被推倒时,它还能同时用右手扶住易拉罐。团队称,这一表现得益于模型对物理规律的理解,而非简单的动作模仿。相比之下,主流的VLA和WAM模型在面对遮挡、接触、形变等物理推理场景时容易失效。
第二个演示中,机器人执行家务整理任务,团队称这是零样本完成的,成功率已达80%。视频里,机器人将玩偶放回原处,从收纳篮中取出帽子和健身环挂上衣帽架,并将坐垫扔到沙发上。其动作显示出对空间、物体属性和人类习惯的理解,例如知道环状物可挂、平整物可扔,甚至会“偷懒”选择省力的方式。
第三个演示中,两台不同型号的机器人协作拉平、抖动床单。团队称,这些机器人的训练数据全部来自人类视频,并通过“一脑多形”实现了跨本体协作。该模型似乎将物理世界理解与人类行为逻辑统一起来,而主流模型往往缺乏这种自进化能力。
第四个演示中,机器人在收纳物品时表现出“能量最优”的决策倾向。它一次尽量多带物品,把围巾搭在脖子上、圆环套在小臂上,身上挂满物品后转身离开。一分钟内收纳四件物品,显示了处理长程任务和建立物体与自身能力映射的能力。团队认为,主流模型基于统计拟合,缺乏自主意图,而MVP模型的行为像水往低处流一样自然。
四个演示视频展示了机器人动作一致性、思考持续性和个性化特征。团队称,装载MVP模型的机器人仿佛各有“做事的独特调调”,有了性格。尽管视频画质粗糙,但其中展现的智能迹象已让不少人相信,具身智能真正为人所用的时刻可能正在临近。