据雷峰网报道,7月13日在悉尼开幕的RSS 2026上,斯坦福大学李飞飞实验室研究员黄文龙提出,具身智能应抛弃对海量演示数据的“死记硬背”,转向“反事实推理”与“脑内搜索”。同期,英伟达发布全模态世界模型Cosmos 3,多篇论文展示少样本操作技术。8月19日至23日在北京举行的WRC 2026上,墨奇智能、优必选等公司展示长程家务、工业作业等落地成果。

黄文龙在RSS 2026“以数据为中心的机器人学”研讨会上介绍了其最新工作Point-World。他提出,机器人不需要穷举所有失败场景,而应利用3D点云流作为统一动作表示,训练一个零样本真实世界模拟器,在动手前虚拟尝试“如果我这么做会怎样”的反事实可能性。仅需15小时3D交互数据和2D预训练,即可获得较高物理保真度的环境动力学预测。他认为,这是机器人实现“递归自我改进”的关键路径。

英伟达物理AI专家Max Li在RSS 2026“机器人世界模型”研讨会上拆解了Cosmos 3。这是全球首个在单个Transformer架构下打通文本、视觉、音频和动作的全模态世界基础模型,包含Cosmos Edge(4B)、Nano(16B)、Super(64B)三个版本,其中Edge模型可在Jetson等边缘设备实时推理。团队称,模型、代码及论文已全盘开源,并正与Pi团队合作探索离线策略评估。

RSS 2026“Manipulation”环节的多篇论文显示,机器人操作正迈向“少样本、强泛化”。华南理工大学团队提出BiDemoSyn,仅需一段真实演示即可合成数千条双臂训练数据;上海人工智能实验室与清华大学提出DexImit,可从人类单目视频学习灵巧操作;伯克利与Meta等机构提出TactAlign,利用触觉对齐实现零样本迁移。浙江大学提出的SID框架在仅两次演示下,面对分布外干扰仍保持约90%成功率。

在德国不莱梅举行的IJCAI 2026上,苏黎世联邦理工博士后秦浩桐介绍了极限量化技术。针对大模型规模与硬件内存容量之间约20倍的差距,其团队提出BiLLM和SqueezeLLM,分别将模型压缩至平均每权重1.08比特和优化2比特分组量化,无需重训即可让模型保持可用。他认为,4比特量化已成熟,但低于2比特时复杂指令执行、硬件原生支持及激活值与KV Cache量化仍是挑战。

WRC 2026上,成立半年的墨奇智能首次公开自研轮式机器人MORPHI KINO及具身智能模型架构MoRA。该机器人现场用15分钟完成清理桌面、检查冰箱库存并补货、取出烘干机衣物并叠放等长程家务,全程无需人工干预。墨奇CTO黄青虬表示,其路线是将目标持续性、执行记忆和进度认知内化为策略模型的原生能力,而非依赖上层大模型逐一调度。

优必选在WRC 2026展示了工业、商用、家庭消费三大场景产品:工业人形机器人Cruzr Y1完成汽车钣金件上下料、物流分拣等作业;全尺寸商用服务机器人Walker C1支持迎宾导览、科研教育;超仿生人形机器人U1搭载情感大模型和仿生颈椎结构,可提供情感陪伴。优必选透露,其自研基座大模型Thinker在10B以下具身智能大脑模型评测中获9项第一,并已发布世界模型Thinker-WM。

据量子位报道,8月18日五一视界发布AperData具身数据底座和AperOne应用平台,首发价5100元/套。AperData包含AperEgo采集硬件和AperOS数据平台,通过第一视角多模态采集与端侧质检,将无效数据直接剔除,号称同等成本下数据生产效率较传统真机遥操作提升10倍以上,同时披露“低空—太空—深空”空天战略布局。