据雷峰网9月3日报道,两项围绕视觉语言模型与具身智能的研究同日发布,分别从“动作评估”和“长程控制”两个环节探索降低对超大模型依赖的路径。国立清华大学与英伟达联合团队提出VLM-AR3L框架,让Gemini、GPT等视觉语言模型为强化学习智能体充当“视觉裁判”;华东师范大学与上海交通大学团队推出仅2B参数的S²-VLA模型,在长程操控基准上达到96.4%的成功率。
在第一项研究中,团队把Gemini-2.0-Flash、GPT-4.1-nano等大模型送入一个“看图判进展”考场。模型只能获得第一人称RGB画面和一句自然语言目标,需要判断前后两帧画面中哪一帧更接近任务目标。任务覆盖倒立摆、拉直绳索、平移水杯、踢球入网、扫方块入洞、拉开抽屉以及《我的世界》中的打蜘蛛、挤牛奶、剪羊毛、猎牛等10个典型场景,来自四套具身仿真套件。
测评显示,Gemini-2.0-Flash是唯一在全部10项任务中准确率都高于70%的模型,在倒立摆任务上达到91%。GPT-4.1-nano多数任务准确率为60%至66%,踢球入网仅60%。基于对比学习的CLIP和MineCLIP表现低迷,MineCLIP在《我的世界》相关任务中只有39%至59%。开源轻量模型则在局部场景中反超:Phi-3.5在挤牛奶和剪羊毛任务中均达90%,DeepSeek-VL2-Tiny在打蜘蛛任务中获85%,MiniCPM-o-2.6在倒水任务中做出73%的准确判断。
尽管大模型判断能力可观,直接用它实时指导强化学习却不现实。几十万次云端API调用会把单次训练成本抬到数万美元,网络和大模型推理延迟也严重拖慢训练。更重要的是算法缺陷:用单张画面做绝对打分,在训练中会出现评分漂移,且在环形跑道这类不存在全局先后顺序的任务中完全失效。为此,VLM-AR3L将绝对奖励与相对奖励相结合,由双向置信度规则过滤幻觉式预测;大模型只在后台异步从经验回放池中采样图像对打标,训练出的本地轻量孪生网络负责前台奖励计算,使API查询需求降低约20倍。实际任务中,该框架在打蜘蛛和挤牛奶任务上成功率达到85%和95%,在剪羊毛等需要长时程探索的任务上,也超过了人类手写的稀疏真值奖励,后者在这些任务上的成功率为0。
另一项研究聚焦机械臂长程操控中的误差累积。华东师范大学与上海交通大学团队观察到,多款7B甚至8.5B参数的视觉-语言-动作模型在执行到第10步后容易突然失败,早期毫米级定位偏差会在静态特征融合机制中被逐步放大。他们的S²-VLA包含一个信念状态更新模块和一套三路自适应注意力门控:前者的轻量循环网络根据动作历史与关节反馈持续估计当前进度和偏差,后者则由门控权重在局部视觉、全局意图与动作自注意力三条通道间动态分配资源。实验显示,在接近目标时视觉权重上升,抓取和子任务切换时意图权重上升,平稳移动时动作自注意力占优。凭借该机制,2B参数的S²-VLA在LIBERO-Long上取得96.4%成功率,超过多数7B以上参数模型。
S²-VLA的端侧表现同样突出。其推理显存约7GB,吞吐量80.8赫兹,而同类7B模型通常只有几赫兹。论文作者认为,长程动作稳定与否不仅取决于参数量,更取决于能否在执行阶段动态分配算力;高层语义理解由预训练视觉语言模型完成,低层控制则交给能实时调节注意力的轻量策略网络。