据雷峰网和量子位报道,9月14日集中披露的ECCV 2026现场报告及近期模型发布信息显示,3D空间智能、多模态统一架构、物理基座模型与递归自我改进成为AI研究密集推进的方向。慕尼黑工业大学教授Angela Dai展示用物理遮挡先验重构3D空间的方法,NUS Show Lab负责人寿政教授展示自回归与离散扩散融合的Show-o系列;深度机智发布PhysBrain 1.5,CosmosMind联合多所高校发布MetaRSI-v1。
据雷峰网报道,Angela Dai在ECCV现场指出,2D领域成功的“加噪-去噪”扩散范式无法直接套用到真实3D场景,传感器噪声与物体遮挡造成的几何缺失既非随机,也不符合常规统计分布。其团队将传感器视野拆为已知空域、已观测表面和未知盲区三状态,通过故意扣除观测帧构建训练对,并用掩码损失忽略未知空间,形成逆向自监督SG-NN。面对大面积盲区,团队引入可见性引导的流匹配与3D高斯溅射,以几何骨架结合2D渲染破解均值模糊,将连贯生成尺度扩展到七八个房间。GenRecon进一步把合成场景结构先验注入真实重构,并推演至机器人主动感知。
据雷峰网报道,NUS Show Lab负责人寿政在ECCV 2026介绍,Show-o是首个将自回归与离散扩散融合在单一Transformer中的统一模型:文本理解与生成保持自回归,图像或视频生成切换至离散Token扩散,仅需十几步迭代恢复视觉Token。Show-2针对连续视频生成,引入循环一致性监督实现“观察-描述-再合成”的自监督闭环,开发通用3D Tokenizer,并采用文本因果注意力、视觉时空双向注意力。为兼顾语义与像素细节,模型采用共享3D Encoder、内部分立路径,理解路径加入语义层。团队将架构延伸至机器人,搭建桌面双臂与移动平台,形成VLA、世界模型和世界动作模型闭环;云端大模型单次决策约8至20秒,本地微调模型可实现近实时控制。
据量子位报道,CosmosMind联合斯坦福、伯克利、MIT、清华、北大等十余家高校发布MetaRSI-v1,称其为全球首个统一Model-RSI、Data-RSI、Harness-RSI的元递归架构,目标是改进“自我改进的过程”。该系统提出Loop Kernel,把反馈学习信号在Data、Harness、Model上提出改动并交由验证器裁决;通过横轴编排算子顺序、纵轴优化算子内部策略,并由四个Agent构成三层改进。实验中,无外部教师模型参与下,一个30亿激活参数的小模型在Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond高难度子集、AIME四项基准上平均自我提升10.9分,SWE-bench Pro解决率接近翻倍;GPT-5.6、Claude Opus 5等六款前沿旗舰模型在Terminal-Bench 2.1上平均提升7.3分。团队同步开源RSI-Harness,并提炼五条定律,其中提到验证决定自我改进前沿、能力与载体无关但成本与载体有关。
据量子位报道,深度机智9月9日发布物理基座模型PhysBrain 1.5。在28项公开基准中,PhysBrain 1.5-8B取得72.5综合均分,位居参评开源模型首位,14项开源第一、10项开源第二;与GPT-6 Astra的73.3、Gemini 3.6 Flash的73.0差距收窄至1分以内,高于Hy-Embodied-VLM-1.0的66.0和RynnBrain 1.1的63.1。2B版本取得66.6分,按规则仅作参考,不参与开源排名。深度机智同步开放技术报告、2B与8B模型权重及评测工具包,Hugging Face上线3天获得超过3k下载量。该模型围绕Physical Loop组织具身理解、动作生成与未来状态预测,训练数据来自Ego360人类全景真实数据体系,保留全身姿态、手部运动与任务级语音。深度机智创始人陈凯在WAIC 2026阐述人类学习范式,9月10日该公司出席国家数据局具身智能座谈会并展示情境数采范式。
量子位报道还提到,Robocurve将GPT-6 Astra部署在真实机械臂上,在20次“积木放入碗”任务中完成19次,Claude Fable 5.1完成8次;但在“蓝色拼图块对位插入凹槽”毫米级精细任务上,GPT-6 Astra成功率从95%降至10%。这一对比显示,通用基座模型可跨越“看懂”到“粗动作”的鸿沟,精细接触与精准插入仍是瓶颈。
从ECCV 2026现场报告到近期发布,几条路线均把闭环与物理先验放在核心位置。Angela Dai的GenRecon将可见性推演至具身主动探索,寿政团队把统一多模态架构用于机器人闭环控制,PhysBrain 1.5将观察、理解、判断、执行和反馈修正纳入同一基座,MetaRSI-v1则用验证器闭环改进数据、Harness和模型参数。不同路径共同指向让模型在物理世界或自身运行中持续修正,而非仅依赖静态2D数据。