据雷峰网报道,香港科技大学教授谭平在 ECCV 2026 上介绍团队在 3D 重建与 3D 场景生成方面的近期工作,提出以学习模型提供局部先验、以 3D 几何提供全局结构约束,提升视觉大模型在跨视角、长距离任务中的一致性。
谭平演讲题为《几何的反攻:规模化 3D 重建与结构化 3D 场景生成》。他指出,以 VGGSfM、DUSt3R 为代表的前馈网络通过大型 Transformer 直接估计相机位姿、深度图和点云,局部 3D 重建效果很强,但消费级 GPU 很难一次处理超过 100 张图像;Sora 等生成模型在多视角、长距离 3D 一致性上仍有不足。
针对重建规模化,团队借鉴视觉 SLAM/SfM 的关键帧思想,从海量图像中均匀采样锚点帧,送入前馈网络获取初始 3D 结构;再通过 Token 采样为每张图像随机保留 20% 到 50% 的 Token,聚合成全局场景表示,降低显存开销。非关键帧只需与该表示交互,即可得到相机位姿、深度图和点云。据雷峰网报道,该方法在 Tanks and Temples 测试中约 70% 情况下将相对旋转和相对平移误差控制在 5 度以内,并减少重影。团队还发现 COLMAP 位姿存在估计误差,用 90% 图像训练 NeRF 后在 10% 未见视角的 PSNR 更优。
Global 3R 进一步融合前馈网络与全局 SfM。系统输入图像后提取滑动窗口,在每个窗口内用前馈网络计算相对运动和点云,选择关键帧并与窗口内其他帧匹配对齐,得到一致特征轨迹;再构建位姿图,进行旋转平均、平移平均和集束调整,生成最终 3D 结果。该方法无需固定参考帧,可通过形变对齐关键帧并计算置信度筛选匹配。集束调整对点云质量提升明显,仅运动平均会出现重影,优化后结构趋于一致。在 Tanks and Temples 预留图像上,其 PSNR 超越 COLMAP 等基线;ETH3D 上 1 度阈值旋转精度多个场景达 100%,集束调整还将相对旋转达标率从约 70% 提升到 90% 以上,相对平移从约 35% 提升到 70% 以上。
3D 场景生成方面,团队介绍受 Text2Room 启发的 ControlRoom。Text2Room 能根据文本生成 3D 房间,但缺少显式全局 3D 布局约束,有时家具数量或空间布局不合理。ControlRoom 将生成解耦为布局生成和外观生成:先训练扩散模型根据文本生成由边界框和语义组成的 3D 房间布局,渲染语义全景图;再将该布局作为 ControlNet 控制信号,指导高保真全景图生成。布局生成引入视觉先验学习房间陈设规律,并通过随机循环平移增强全景图边界一致性。对比测试显示,无显式布局约束时可能一间卧室生成多张床,布局引导有助于生成更合理配置。
ControlRoom 仅生成固定全景图,存在视角盲区,无法真正自由 3D 漫游,且受制于现有 3D 数据集规模。团队发布的 SpatialGen 数据集涵盖 1.2 万个场景、5.7 万个房间,包含 62 个物体类别的约 100 万个边界框,并提供约 500 万张含 RGB、分割、深度和法线等 6 种模态的渲染图像。基于该数据集,SpatialGen 提出布局引导的多视角多模态扩散模型,输入 3D 布局与参考图像或文本,联合生成 RGB、语义及由场景坐标图编码的 3D 绝对几何信息,不同视角迭代融合至 3D 高斯模型,并支持相同布局下的风格迁移。但该工作强制要求显式 3D 布局,用户通常只提供单张图片时缺乏灵活性。谭平还介绍 SpatialCraft,采用两阶段策略,第一阶段从单图生成 3D 代理。
谭平强调,演讲并非主张学习方法与几何方法二选一,而是强调二者互补:学习模型擅长从大规模数据获得局部先验,3D 几何则为跨视角、长距离场景提供全局结构约束。对于空间计算、世界模型和具身智能,这种结合值得进一步探索。