2026年9月,具身智能领域连续出现围绕真实环境持续任务的验证与路线讨论。乐享科技9月16日在上海闵行让两台搭载以太大模型的机器人完成近一小时烧烤直播,Figure于9月17日将Helix 2.5带入旧金山湾区30个陌生家庭,图灵奖得主Yann LeCun则在ECCV 2026演讲中主张放弃像素生成,转向世界模型与联合嵌入预测。
据雷峰网报道,9月16日傍晚,上海闵行一家烧烤店门口,两台名为“二爷”和“五弟”的机器人接单、烤串、上菜。直播没有剪辑、遥控和预设脚本,观众可实时改造场地布局、改道具位置、打断任务并追加需求。乐享创始人郭人杰带摄像机进后厨并掀开幕布,展示唯一可能藏人的小房间堆满食材厨具,以证明现场没有遥操。他称场地是周日才与烧烤店老板谈好,花几万元租下。
直播反复测试五项能力。服务机器人感知顾客等候较久后主动询问出餐进度,并在无人要求时递纸巾;顾客点单时提出“少放辣”,服务机器人结合语言和视觉确认订单,传给烧烤机器人完成撒料;被临时要求拿水后,它停下点单,递水再继续把单点完;烧烤机器人第一次翻面失败,食材掉落炉架,第二次调整抓取和翻转姿势成功。材料称这背后是以太大模型的Energy-Driven机制:将任务完成度、物理约束、记忆状态和动作可行性整合为统一能量函数,总分越低状态越好,决策即在此能量地形上找低点。与VLA预测动作分布、WAM预测未来世界状态不同,能量是标量,支持复合,约束写进目标而非塞入训练集。材料还称,VLA在ICML 2026论文LangForce中被指信息坍缩,纯视觉模型在RoboCasa基准上成功率与接收完整语言指令的模型几乎相同;WAM基于视频扩散Transformer,推理成本高,NVIDIA DreamZero训练一次需8张H100跑25天。乐享创始人郭人杰此前在9月10日发文三问OpenAI,称对方“像素级搬运”“直接蒸馏”,并称法律团队已启动程序,舆论对此分成两派。
据量子位报道,9月17日Figure将Helix 2.5带到旧金山湾区30个陌生家庭,执行整理客厅、叠毛巾和铺床。机器人到达后不再采集新数据,不更新模型权重,也不根据现场执行结果重新选择模型。Figure所称“零样本”指面对新布局和操作对象时不针对当地环境重新训练,任务此前已在其他环境用专门数据适配。Figure用同一批任务数据训练两套策略模型,架构、优化、超参数和评估一致,一套随机初始化,一套从Index预训练模型开始。前者在30个陌生家庭完整任务成功率9%,后者56%;部分完成不得分,人工干预记失败。Figure还以Index四档嵌套数据子集做离线评测,预训练数据总跨度8倍,随着数据规模翻倍,动作预测损失规律下降,官方称预测误差相当于整个8倍数据范围内损失变化的0.54%。但Figure未公布各档Index预训练对应的真实家庭成功率。
8月Dyna Robotics发布Dyna-2,用1000小时、1万小时、10万小时和100万小时第一视角人类视频预训练,再用相同机器人后训练适配14个真实任务,平均归一化得分依次为20%、28%、45%和53%。该得分不是任务成功率,不能与Figure的56%直接比较。Dyna消融显示,单独预测动作会随数据增加过拟合,加入未来视频预测后39个机器人任务迁移表现改善,增加无动作标签人类视频后跨本体表现随规模稳定提升。Figure的Index到8月底收到超1600万条视频,累计支付创作者1500万美元,新数据以约35分钟/秒进入;9月初Figure与Nscale合作,涉及初始35亿美元算力承诺,计划基于英伟达Vera Rubin部署最高10万颗GPU。亮源新创9月21日发布技术博客,Light-O1从互联网第三视角人类行为视频恢复结构化动作,编码成统一人形动作表示,与视觉、语言一起自回归预训练,人类动作预训练规模从37.5亿扩展到1200亿token,最大约对应10万小时人类动作。
据雷峰网报道,Yann LeCun在ECCV 2026 Keynote演讲《World Models: Enabling the next AI revolution》中称,只靠语言和token训练,AI到不了人类水平智能,跨不过物理世界门槛。他把世界模型分为四条路线:Sora、Genie等视频生成赌涌现,World Labs赌几何,英伟达Cosmos、Omniverse赌仿真,JEPA在抽象表征空间预测未来。LeCun认为“预测像素”是伪命题,因为当前帧不包含镜头外信息。他指出大语言模型前馈输出token不是智能行为,思维链只是增加计算量。他提出用能量函数给候选答案打分,能量越小越好,系统在能量地形上找低点。他给出三个建议:别再死磕生成式模型,别再去研究LLM,转向联合嵌入、抽象表征和世界模型。他引用数据称,大语言模型预训练约10的14次方字节,四岁孩子清醒6万小时通过视觉触觉接收的信息量也约10的14次方字节,因此只靠文本不够。