据雷峰网报道,8月27日,具身智能机器人企业昆仑行机器人宣布,其研发的昆仑世界模型(GeWu)在具身智能评测基准WorldArena 2.0 Track 1中,以69.58分获得图像质量单项冠军,并以65.91的综合得分位列全球第二。此次评测共有77支模型参赛,昆仑世界模型是唯一在6大评测维度中取得4项前4成绩的模型,在物理一致性、可控性等关键能力上领先同期参赛模型。

WorldArena由国际顶尖高校和科研机构联合共建,是面向具身世界模型的权威评测。Track 1赛道聚焦模型“看得准、猜得对、画面真实合理”的能力,重点考核物理因果合理性。昆仑行认为,优秀的世界模型不能只做视觉渲染,而要具备模拟器能力,理解物理因果并预测动作后果。基于这一原则,昆仑世界模型采用三座参数独立的Transformer塔架构,分别处理任务目的、动作干预和后果响应,并通过联合因果注意力机制施加单向可见性约束,使动作生成不能预知视觉结果,而视频生成需同时参考目的和动作。

消融实验显示,切断任意一条因果通路后,模型会从因果仿真退化为“默写模式”,产生物体自行运动等违反物理规律的画面,交互质量维度得分骤降。终版模型在此维度获得82.40分。针对长时序视频生成,团队设计了Chunk-wise自回归方案和仿生记忆采样策略,模拟人类记忆衰减规律,以保持长视频中物体与背景的一致性。该策略解决了后续片段上下文缺失的问题。

昆仑世界模型是昆仑行“本体+大脑”双轮驱动战略的核心模块。研发负责人郝志会博士表示,世界模型架构应当尊重物理世界的因果结构,目的驱动行动、行动产生结果,当归纳偏置对齐问题本质时,模型在指标、训练效率和泛化能力上均得到改善。下一步,团队计划在更复杂任务场景中验证模型能力,并将其用于行为规划和仿真强化,推动世界模型从视觉渲染器向物理智能基座进化。