据爱范儿报道,李飞飞创立的World Labs发布3D世界模型Atlas。该模型仅凭3至5台手机或运动相机从不同角度拍摄的视频,就能生成“子弹时间”式环绕画面,并重建出可自由穿梭的三维空间。
在官方演示中,现场没有《黑客帝国》拍摄时沿弧线布置的120台相机,也没有VOGUE盛典上60台iPhone组成的阵列。操作人员只在几个角度架设了3至5台普通设备,即完成了素材采集。模型通过“多模态自回归扩散Transformer”架构,将文字、图像、深度和相机位姿统一为空间上下文,在维持视角间几何一致性的同时,推断并生成未被覆盖的区域。World Labs称,静态场景通常只需2至3张照片即可完成基础重建,给的真实视角越多,模型对空间的理解越扎实。
Atlas与主流视频生成模型存在本质区别。主流模型是在二维像素层面,根据文本语义推演“一段看起来像是在旋转拍摄的视频”;Atlas则将相机位姿作为原生几何输入参数,允许创作者像在3D软件中排布机位一样,精确设定虚拟摄影机的运动轨迹。这些轨迹坐标与现实空间严格对应,因而可以在拍摄完成后生成现场并不存在的“上帝视角”或重构特写景别。
从影像技术史看,Atlas把“后期自由度”推向了最核心的机位环节。胶片时代,对焦、机位和快门时机难以后期挽回;数码时代,RAW格式和计算摄影延后了白平衡、曝光和虚化的调整;如今,Atlas让摄影师在拍摄结束后重新选择角度,甚至凭空调出一个现场不存在的机位。这种体验类似《赛博朋克2077》中的“超梦”编辑模式,玩家可在凝固的时空里自由移动镜头。
这一能力最终指向空间智能。Atlas在推断时可同步导出稠密深度图、三维点云和3D Gaussian Splat场景,用于实时渲染。World Labs于今年2月完成10亿美元融资,7月收购机器人与仿真公司SceniX,其技术路径被称为“真实-仿真-真实”。在具身智能与人形机器人领域,Atlas可凭几条视频重建数字孪生世界,让虚拟机器人在其中规划导航、推演抓取,并以低成本生成近乎无限的训练数据。
过去需要上百台相机围出的子弹时间,如今几台手机配合一个世界模型即可实现。当物理机位不再成为灵感的阻碍,决定镜头方向的,便只剩下创作者想要讲述的故事。