据雷峰网报道,2025年以Xspark AI(无界智航)联合创始人、首席科学家身份亮相的丁文伯提出,机器人触觉不应与视觉竞争,而应建立一套更轻、更快、更靠近身体的“脊髓”式智能,补全物理交互中的实时反馈短板。
丁文伯同时是清华大学教授,长期研究机器触觉与传感器。他在报道中称,过去两年具身智能主流路径仍是扩大视频、机器人轨迹和VLA模型规模,让机器人沿“看见—理解—行动”提高泛化。他并不反对该路线,并认为VLA会在具身智能历史中留下重要位置。但他强调,机器人最终要伸手碰到世界,视觉已解决感知世界的绝大部分问题,触觉不必与视觉竞争,而应在视觉失效或不够确定时补上接触后的信息,比如杯子是否滑动、机械臂是否撞到人,以及动作应继续用力还是立刻修正。
在丁文伯看来,把触觉直接塞进现有视觉模型并不完全可行。触觉信息量不如视觉丰富,却对反馈效率要求更高;与整个视觉模型融合,可能产生大量冗余,也可能让少量关键触觉信息被视觉淹没。因此,他提出“触觉原生智能”。这种智能未必需要视觉大模型那样丰富的语义理解能力,而应更轻、更快、更靠近身体,类似人快要摔倒时身体先完成反射,而不是先识别“我正在摔倒”再决定动作。他用人的“脊髓”类比触觉智能:信息可以不那么丰富,但要足够低延迟,能在滑动、碰撞、失衡发生的一瞬间作出反应。
从判断触觉重要到做出一套触觉智能仍有距离。据雷峰网报道,不同触觉传感器之间一致性依然很差,同批次设备性能也可能明显不同,模型难以像视觉模型那样跨硬件直接迁移。触觉也没有互联网时代天然积累的海量图片和视频,同一个动作换一个人、一个传感器甚至一个机器人,数据分布都可能变化。更基础的问题是,触觉应如何表征和嵌入,不同传感器采集的力、温度、剪切、振动,能否转换成与具体硬件无关的共同表征。丁文伯把接下来两三年甚至五年的问题概括为三个“跨”:跨传感器、跨模态、跨本体。
丁文伯并未声称成熟的“触觉大模型”已有答案。他表示,目前更现实的是一条折中路线:短期先把某一种多模态触觉传感器做好,再与现有模型融合;预训练阶段聚焦通用能力构建,触觉信息的引入与融合放在灵巧操作的后训练和动作修正阶段。长期他倾向于认为,触觉最终会形成自己的模型和逻辑。Xspark AI提出的“慢脑VLM—快脑VTLA+TWAM—脊髓VTA”三层架构,被看作这一判断在现阶段的工程表达:视觉语言模型构成“慢脑”,负责语义理解、高层认知和任务规划;触觉首先进入“快脑”,与视觉、语言和动作一起参与长程任务和灵巧操作;再往下,触觉成为“脊髓”的核心信息,在碰撞、滑落、安全等场景下完成更快局部反应。同一种触觉因此承担两种角色:在快脑里帮助机器人“做得更好”,在脊髓里保证机器人“来得及反应”。
丁文伯说,真正没有被定义清楚的是,触觉究竟只是现有视觉模型增加的一种输入,还是因为对接触、运动和实时反馈的特殊要求,最终会生长出一套不同于视觉智能的模型和计算逻辑。他现在试图找到这个答案。