据量子位报道,智象未来(HiDream.ai)9月7日发布具身世界模型HiDream-O1-Embodied。模型首次参评具身智能评测平台RoboColiseum,即在核心的扰动适应(Robustness)子榜单中以平均分0.692登顶。
智象方面表示,该模型延续原生全模态技术理念,强化机器人物理感知与动态预判能力,助力具身智能实现更高阶的物理交互。智象未来CTO姚霆称,围绕真实世界的表达、理解和生成,需要构建同时具备全模态表达、因果推演与物理世界构建三大核心能力,才能建立完整的世界模型基座。HiDream-O1-Embodied的发布,是公司从“模拟世界”迈向“真实世界”的关键里程碑。
RoboColiseum平台面向全球高校、科研机构、模型企业与研究者开放,基于高保真仿真环境构建,设置指令跟随、空间理解、扰动适应与通用操作4类能力子榜、78个评测任务。扰动适应被公认为最具挑战性的环节,通过改变背景、光照、材质、机器人初始状态、相机位置与图像质量,并改写指令,检验模型的稳定性与泛化能力。
HiDream-O1-Embodied的登顶成绩被认为得益于原生全模态底座。据智象方面介绍,模型在语言理解上覆盖多元动词、句式与表达方式的等价指令空间,不被句式束缚,锁定意图本身;在视觉感知上综合多个视角的信息,使不同视觉通道相互补充,避免局部失灵导致全局失效;在容错机制上,训练阶段主动引入光照变化、画面污损、视野遮挡等非理想条件,使模型在信息不完整时仍能稳定执行任务。
在数据层面,智象采用“模型+数据”双驱动策略,探索出“真实基座+生成增强”的数据生产范式。以与诺亦腾的合作为例,高精度真人动作捕捉数据作为真实底座,借助原生全模态能力进行百倍级数据扩增,基于单段真实动作样本生成切换背景、光照、物体形态等变量的变体视频,形成数据与模型互相驱动的增长飞轮。
不到一个月前,智象刚发布交互式世界模型HiDream-O1-World,并在交互式视频世界模型评测基准WBench的Navi分榜中以平均分80.9登顶。智象未来创始人兼CEO梅涛此前表示,下一代大模型竞争的关键是从单模态走向多模态,并走向原生统一的全模态。从HiDream-O1-Image到HiDream-O1-World再到HiDream-O1-Embodied,公司正逐步形成覆盖视觉模型、交互式世界模型及具身世界模型的模型矩阵。