据雷峰网报道,大晓机器人近日联合香港大学发布连续物理智能研究成果StreamPI(Streaming Multimodal Temporal Modeling for Vision-Language-Action Models),旨在解决VLA(视觉-语言-动作模型)长期依赖单帧决策、缺乏时间理解的问题。StreamPI通过为模型建立持续的多模态时序上下文,让机器人能够记住过去、理解状态变化,从而从“识别当前状态”走向“理解正在发生的物理过程”。

传统VLA模型主要依据当前观测独立决策,难以利用运动视差、状态变化等跨帧线索。StreamPI没有简单堆叠历史帧,而是将每个时刻组织为“视觉观测+任务指令”的时序单元,语言指令持续绑定观测,成为贯穿任务的语义锚点。同时,模型采用流式推理,首帧编码后存入键值缓存,后续只处理新信息,避免重复计算,在不增加额外模型参数的情况下,基于现有VLA骨干实现轻量化时序建模。针对真实世界时间波动,StreamPI引入随机时间间隔训练,让模型适应不同时间跨度和不完整上下文。

在LIBERO基准上,StreamPI将三帧输入时的平均成功率从96.4%提升至97.5%,五帧时从97.0%提升至98.3%;最依赖长程上下文的LIBERO-Long从π0.5的92.4%提升至95.0%。在CALVIN上,平均连续任务长度达到4.547,超过π0.5的4.313,任务推进到第五步时成功率仍为85.0%,高于π0.5的79.5%。

真机验证中,团队设计了四项任务,每项采集100条人类遥操作示范。在“猜杯子”任务中,StreamPI将π0.5的成功率从46.7%提升至80.0%;滚动物体抓取从26.7%提升至63.3%;窄瓶口插笔从40.0%提升至66.7%;纸杯插入杯套从60.0%提升至92.0%。实验显示,连续观测带来的运动视差和状态变化为机器人提供了单帧图像难以给出的几何线索。

StreamPI目前仍有提升空间,团队未来将探索超过100帧的高效时序训练与自适应缓存裁剪,将时序理解延伸至更长、更复杂的真实任务。大晓机器人是一家具身智能公司,由商汤科技联合创始人王晓刚任董事长,陶大程院士任首席科学家,此前已推出“开悟”世界模型3.0和具身超级大脑模组A1。