两年一届的欧洲计算机视觉大会(ECCV 2026)在瑞典马尔默的 Malmö Arena 与 Malmömässan 举行。据雷峰网报道,大会收到 10473 篇有效投稿,接收 2883 篇,接收率 27.5%,约 6000 名研究者到场参会。两篇报道对开幕时间的表述不同:一篇称大会 9 月 8 日开幕,另一篇称 9 月 8 日先行启动、9 月 10 日正式开幕并开始论文报告专场。会议公布的 86 个 workshop 中有 13 个直接以 World Models 或 Embodied AI 为主题,这一密度为 ECCV 历史上首次,Yann LeCun、Jürgen Schmidhuber、Kristen Grauman、Jamie Shotton 等将作 keynote 演讲。
雷峰网将世界模型的升温归因于三条线索合流:Yann LeCun 自 2022 年 JEPA 论文起主张智能的核心是预测物理世界,Sora、Veo、Genie 把这条路线变成可视化产物;3D 高斯泼溅自 2023 年 Inria 团队在 SIGGRAPH 重新激活后,扩散到 SLAM、水下场景、热红外、4D 动态、压缩流式传输与医学 CT 重建;人形机器人、自动驾驶与配送机器人面对开放环境,模仿学习暴露出泛化瓶颈。会议讨论集中在四个问题:世界模型如何构建、如何评价、是否可靠、如何进入行动闭环。
中国研究者从三个方向切入。新加坡国立大学王新超团队提出 World Action Model,认为预测出的未来必须进入行动路径;陈志波团队提出 4DWorldBench,把评价从视觉质量扩展到空间结构、时间连续性、物理规律与后续任务支持,并与李新团队探索 VLA 与世界模型的结合,主会场出现的 VLA-JEPA 是其中代表;中山大学梁晓丹提出物理具身基础模型,相关落地工作包括 A1、AtomicVLA、eWAM、PhyAgentOS、ManipArena 与 ProPhy,杨高则关注用大规模视觉数据提升机器人泛化能力。
三维重建是另一条拥挤赛道,第一个 Poster 环节与 splatting 直接相关的论文超过 80 篇。AI 科技评论从 9 月 10 日的 Spotlight 专场选取 14 篇梳理,包括长序列前馈重建 GRF-Recon、无需水下标注的 Wat3R 及自建数据集 Water3D、把几何约束钉进特征空间的 GeoNVS、两阶段解耦的 DreamWorld、单遍完成编辑的 Edit3r、补回被遮挡背景的 PriSplat、以渲染误差为反馈循环精修的 ReSplat,以及面向主动重建视角选择的 SA-ResGS。
浙江大学、字节跳动与香港中文大学(深圳)合作的 PointSplat 被会议收录。论文面向沉浸式直播,提出从 view-centric 转向 human-centric:先估计人体几何代理体,用光线投射筛除不在人体上的三维点,再用 Point-Image Transformer 融合多视角几何与外观信息,直接预测高斯属性,以减少同一主体被多视角重复编码造成的跨视角冗余。作者名单包括 Hujun Bao、Sida Peng、Xiaowei Zhou、Jing Zhang、Xianchao Shen 与 Lingteng Qiu。
同日,雷峰网还刊发一篇分析文章,列举五起与 AI 系统相关的事件:一起 L4 级自动驾驶车辆未识别横穿道路行人并致其死亡的事故、一起 AI 辅助诊断把早期肺癌征象判为良性结节而延误治疗的病例、一名用户采用大模型生成的不存在法律条款提交法院后败诉、一款面向青少年的 AI 伴侣产品在对话中给出自残相关建议,以及一起作家起诉 AI 公司训练使用其作品并胜诉的版权案。文章称这些案例的痕迹均指向“中层拟合圈层”。