2026年9月9日,在瑞典马尔默举行的欧洲计算机视觉会议(ECCV 2026)一场专题分场上,斯坦福大学计算机科学助理教授吴佳俊提出,视觉、听觉与触觉并非彼此独立的信息源,而是同一组物理属性在不同观测通道上的投影;面对新领域中声音与触觉数据几乎为零的情况,应当用物理属性为三种感官建立共同坐标系,而不是单纯依靠Transformer拼接模态。据雷峰网报道,这场演讲发生在“Embodied Multimodal Reasoning in Physical Environments”专题分场。
ECCV 2026于9月8日开幕。这是吴佳俊两个月内的第三场重要演讲。8月20日,他在德国不来梅领取IJCAI 2026“计算机与思想奖”,并在获奖演讲《Building Visual and Physical Intelligence Through Code》中,系统阐述如何将经典符号AI的几何、物理先验定义为“物理代码”,与现代基础模型结合,铺就从“看懂画面”到“具身动作交互(4D)”的物理智能范式。9月8日,他在ECCV期间的“Robotic Manipulation Research”Workshop上转向操作与规划,让基础模型自动发现“原子技能”及其前置与后置条件,构成可组合的抽象,使机器人能从极少演示泛化到长程任务,并配套一系列评测基准。
9月9日的演讲换了一个方向。前两次的路径是从视觉出发向下游延伸,先理解世界,再规划与操作;这一次则在感知端横向拉平。吴佳俊举例说,一个塑料物体,看起来像塑料,摸起来像塑料,敲起来也像塑料。同一组底层物理属性,支配着不同感官模态的观测。他提出的问题是:当几乎没有任何数据时,怎样把视觉、声音与触觉三种模态融合在一起?
吴佳俊没有沿用“把视觉、音频、触觉拼起来喂给Transformer”的常规做法,也没有退回“先估计状态、再跑物理仿真”的经典路径。他直指当前多模态融合的痛点:进入新领域、面对从未见过的物体时,声音与触觉的数据几乎为零,真正稀缺的不是架构而是原则。他系统阐述了如何把几何、材质与刚度这类物理属性,既作为从视频扩散模型中蒸馏出的学习目标,又作为条件化生成模型的中间接口。
在PhysDreamer工作中,吴佳俊和合作者尝试从视频扩散模型中提取物理属性,用于动作条件下的三维物体动力学预测。任务从一个静态三维场景出发,例如一朵花,推理其物理属性,使其可动、可交互。难点在于物体往往非均质,不同部分的物理属性不同,杨氏模量场是高维场,且没有密集的真值标注。他们的做法是用三维高斯表示场景,渲染成图像后送入视频生成模型得到参考视频,同时维护一个待估计的杨氏模量场,将外观场与物理属性场一起送入可微分物质点法管线,通过可微分仿真得到物体轨迹并渲染成视频,在像素空间计算损失并反向传播,更新物理属性估计。吴佳俊说,即使只在像素空间计算损失,由于整个过程可微,也能提供有用信息。后续工作不再在像素空间计算损失,而是采用类似分数蒸馏采样的方法,在视频上操作,得到估计的4D表示。
这一思路随后延伸到更通用的物理现象建模。吴佳俊介绍了去年的工作WonderPlay,它能从单张输入图像重建出可动、可仿真的三维场景,让刚体、流体等不同状态的物质在动作下交互。传统做法是先做状态估计再做物理仿真,但状态估计本身非常困难,流体与刚体的交互又极其复杂,不得不做大量近似。视频模型则具有互补优势:它们拥有大量视觉先验,能从信息严重缺失的输入出发补全场景。不过,生成式方法也有局限。吴佳俊指出,尽管视频生成模型进展迅速,但至今仍难以接受各种细粒度的动作作为输入。这从根本上与数据类型有关:训练数据大量是视频,对应的动作多是导航指令,语言虽然能在某种意义上指定动作,但要指定到很细的粒度非常困难。
除视觉与触觉外,吴佳俊还将物理属性思路延伸到声音的可微分渲染,涉及DiffImpact、RealImpact,以及柔性电子皮肤DexSkin,试图形成从“看懂画面”到“听出材质、摸出力度”的跨模态物理智能范式。