9月1日,由著名计算机视觉学者李飞飞联合创立的World Labs发布了其称为“全球首个多模态世界模型”的Atlas。该模型可从一张图片生成具有像素级相机控制的图像和视频,并完成3D重建,为机器人和视觉特效等领域打开了大门。

据World Labs介绍,Atlas是一个“全能模型”,能够原生处理文本、图像、相机位姿和3D深度图等数据类型。它可以在输入一张至数十张图像后重建真实世界场景,既生成新视角图像,也输出显式3D表示;还能根据文本生成图片和360°全景图,遵循复杂提示并准确渲染文字。李飞飞本人将这一成果称为World Labs的“里程碑”,并称其为从视觉特效到机器人的众多应用场景打开了大门。据量子位报道,英伟达机器人主管Jim Fan认为这是机器人领域Real-to-Sim的一大步。

技术层面,Atlas采用多模态自回归扩散Transformer架构,将各类输入锚定在三维空间中形成空间上下文,再根据上下文生成多模态输出。该架构融合了大语言模型和现代视频生成模型的技术,支持KV缓存、无分类器引导等算法,并具备随规模扩大持续提升能力的潜力。

Atlas的一大应用目标是机器人训练。仅需几张照片,Atlas即可生成逼真的RGB和深度数据,从而让机器人能在多样化的模拟空间中训练和测试。World Labs称,这打通了从真实照片/视频到3D空间再到机器人传感器视图的路径,是机器人领域Real-to-Sim的关键一步。

在性能评估中,World Labs表示,在相机控制生成任务上,Atlas优于现有SOTA视频模型,且相机轨迹越复杂优势越明显;在稀疏输入视角的3D重建中,它也超过了专门的开源重建模型。一项人类盲评中,评估相机轨迹遵循能力时,Atlas相较Google的Gemini Omni Flash和FLUX获得压倒性偏好。

World Labs由李飞飞于2024年2月创立,她此前曾领导斯坦福大学AI实验室。据SiliconANGLE报道,该公司已从英伟达、AMD和Autodesk等投资者处筹集12亿美元,并致力于开发具有物理感知的世界模型。

目前,Atlas正以早期访问形式向部分合作伙伴开放,用户也可在官网申请权限。World Labs表示,Atlas将成为未来版Marble及其他产品的底层模型。