据雷峰网2026年9月3日报道,中山大学研究团队在一项新研究中提出SpatialSV方法,通过让多模态大模型在训练阶段从隐藏层直接学习显式三维几何表示,提升其对物理空间的理解。实验表明,将人工文本标注减半并由开源3D模型自动补足几何监督后,模型的空间问答准确率仍可接近全量标注水平。

面对“从室内多视角照片判断物体相对位置”的视觉考题,Qwen2.5-VL-7B能够正确作答,而LLaVA-OneVision-8B会选错。研究团队像做脑部CT一样提取LLaVA推理时的中间隐藏层特征,并渲染成三维点云图,结果发现模型脑海里根本没有建立作为关键参照物的小桌子的几何结构。这种可视化诊断可以直观揭示模型答错的原因,而不像传统评估方法那样只能比较最终文本选项。

目前让大模型获得3D感知主要有两条路线:接入外部深度模型会增加推理延迟,且外部工具误差容易传导;蒸馏3D基础模型的隐特征则缺乏显式几何约束。SpatialSV选择在模型中间隐藏层直接把二维视觉特征提升为显式三维表达。它从模型多个隐藏层提取特征并映射到统一三维特征空间,由轻量化DPT模块同时预测深度图、射线图与点云图。深度图用于还原空间距离和物体轮廓,射线图通过预测每个像素的射线起点与方向来隐式建模相机位姿,点云图则还原像素对应的真实三维坐标。训练阶段施加的三维几何损失将空间约束写入模型主干;推理时这些预测头全部卸载,不增加任何额外计算量。

研究团队在Qwen2.5-VL、InternVL3、LLaVA系列等8个主流多模态大模型上进行了探测分析,发现模型的3D重建误差与空间问答准确率存在明显的负相关:隐藏层对三维几何还原得越精准,模型最终回答准确率越高。若按重建质量将样本分成四档,所有模型的准确率都随重建质量提高而阶梯式上升。研究人员还可通过观察点云和深度图定位模型盲区,典型失效模式包括关键实体遗漏——重建结果中找不到作为判断依据的物体,以及空间锚点丢失——用于确立坐标参照的实体没有被准确建模。

在半监督训练实验中,论文以Qwen2.5-VL-3B为基础,仅使用50%样本的文本问答标注时,模型准确率从全量标注的55.3%下滑到47.2%;对剩余50%的无文本图像自动生成3D几何监督后,准确率回升至53.9%,接近全量水平,相对50%纯文本基线提升了14.19%。由于深度图、点云等几何信号属于纯视觉物理表征,不必依赖人工撰写问答,研究团队直接调用DepthAnything-v3、VGGT等开源3D视觉基础模型,从海量裸图中批量提取深度图与相机参数,从而大幅降低了对高成本3D空间问答标注的依赖。

多模态大模型普遍依赖自回归机制预测下一个Token,而语言符号离散,真实物理空间关系却连续。SpatialSV没有改动主流Transformer架构,而是把深度估计、点云重建等经典密集预测任务作为辅助目标重新引入训练阶段,相当于为模型的中间表征加上一道几何正则化约束。这种方法在推理时零额外开销,内部表征可被可视化解释,并借助开源模型降低标注成本,为大模型走向机器人和物理世界交互提供了一条更务实的路径。