据量子位报道,9月2日,由李飞飞创办的World Labs发布全球首个多模态世界模型Atlas。该模型可将文字、图像、视频和3D信息纳入统一空间上下文,通过一张或几张图片重建三维场景并保持空间结构一致。李飞飞本人称这一发布为“里程碑”。国内空间智能团队影溯开发的InSpatio-World早在今年3月已开源,具备从视频构建动态4D场景、改变观察轨迹和观察时刻的能力,其升级版本据影溯透露也将开源。

Atlas与InSpatio-World技术路径有所不同。前者从图像出发,把相机位置变成访问空间世界的坐标;后者从视频出发,把时间作为显式处理的维度,使用户可在已有事件范围内改变观察时刻,从新的视角重新观察动态过程。两者都指向世界模型从生成“看起来合理的二维画面”转向围绕持续存在的空间或时空状态,生成不同位置、不同视角下的观测结果。

影溯最近一次公开成绩是登顶世界模型权威榜单WorldArena 2.0。截至8月27日,其世界模型InSpatio-Curious以66.11分位列77个参评模型第一,并在Physics Adherence、Trajectory Accuracy、JEPA Similarity和Depth Accuracy四项指标上均排名第一。其中Depth Accuracy为99.29分,Trajectory Accuracy为64.89分、领先第二名3.02分,JEPA Similarity为98.36分,Physics Adherence为73.24分。相比之下,InSpatio-Curious的Image Quality仅60.64分,比综合排名第二的模型低了近9分,表明其总分主要由轨迹、深度、时空表征和交互一致性等能力贡献。

WorldArena 2.0由清华大学、上海交通大学、香港大学等高校联合发起,用于评测具身世界模型在运动轨迹准确性、场景空间关系稳定性和物理逻辑合理性上的表现。据该报道,评测目前主要覆盖标准化仿真环境与机器人操作任务,Track 1总分仍以生成与视觉代理指标为主,不直接测量真实世界中的力、摩擦、质量与惯性,因此高分尚不能等同于通用空间智能能力。

8月29日,在武汉举行的第二届中国空间智能大会上,影溯联合20余家高校团队和行业机构启动大规模空间智能3D数据开放计划SIDO。参与方覆盖高校、激光雷达、机器人、3D生成、数字空间及产业应用等环节。SIDO计划未来两年建设百万级3D/4D场景数据底座,并同步推进评测基准建设,围绕3D重建与生成、场景理解、空间推理、动态预测和具身规划等任务建立统一的任务定义与评价标准。