据爱范儿报道,2026年9月2日,李飞飞创办的World Labs发布了全球首个多模态世界模型Atlas。该模型面向空间智能,可基于数张普通照片生成最长1分钟的1440p视频,并能完成三维场景重建与时空模拟,为具身智能和机器人训练提供低成本仿真路径。

官方定义称,Atlas是一款面向空间智能的全能世界模型,从零开始预训练,可原生处理文本、图像、视频、相机位姿与3D深度信息,并在同一套模型中完成世界生成、空间重建和时空模拟。

Atlas的核心能力之一是相机控制生成。用户只需输入1至6张普通照片并设定运镜轨迹,模型即可生成最长1分钟、1440p分辨率的视频。由于将相机位姿参数作为原生输入,Atlas在镜头运动和空间一致性上明显优于常规视频生成模型。官方演示显示,输入一张机器人正面照片,Atlas可补全其背面;仅给一张泳池边角照,它也能推测出未拍摄到的草坪和远山。不过,当镜头进入原图未覆盖区域时,模型仍需依赖先验猜测,视角跨度越大,局部几何漂移和纹理闪烁越容易暴露。

空间重建是Atlas的另一关键功能。传统3D扫描需要专业设备拍摄大量照片,而Atlas只需2至25张游客视角平拍图,即可还原斯坦福大学Main Quad的草坪、拱廊和教堂外墙,并支持上帝视角航拍漫游。在DTU、ETH3D、ScanNet等公开数据集上,Atlas的稀疏视角重建误差(AbsRel×10⁻³)为25.3分,低于Pi3X的28.7、Depth Anything 3的39.3和MapAnything的47.7。输出可直接对接点云和3D Gaussian Splatting,并可接入World Labs自家的Marble平台高帧率即时渲染。此外,用几部普通手机或运动相机拍摄日常场景,Atlas即可生成“子弹时间”式的多视角自由切换视频。

技术架构上,Atlas采用多模态自回归扩散Transformer,融合了自回归预测和扩散去噪的优势,以Transformer为底座,可使用KV Cache和分布式推理优化。它还具备图像生成能力,能处理复杂提示词、渲染多种风格,并能根据文字或图片生成360度全景图。World Labs在官方博客中强调,随着参数量和计算力增长,模型展现出类似大语言模型的涌现能力。

据World Labs介绍,Atlas可服务于具身智能和机器人训练。传统仿真环境需要大量人工搭建3D场景,而Atlas的Real to Sim能力可让用户用手机拍摄工厂或房间视频,自动生成高精度3D物理空间,供机器人训练试错。模型还能模拟机械臂碰撞、铰链开合和软体挤压等受力反馈,并生成机载视角的RGB与深度图。

在针对镜头运动控制的真人盲测中,Atlas对MiniMax H3、Gemini Omni Flash、FLUX 3、Seedance 2.5的胜率分别为75%、81%、93%和94%。目前Atlas已向部分合作伙伴开放早期访问,未来将成为Marble和World Labs其他产品的底层模型。

从二十年前的ImageNet到如今的Atlas,创始人李飞飞长期致力于视觉与空间智能研究。她曾将今天的大语言模型形容为“黑暗里的文字高手”,而世界模型的目标是为机器补充关于几何、物理、时间和行动的经验,让AI从数字世界走向真实世界。