据科技媒体量子位报道,Generalist AI公司8月21日发布机器人基础模型GEN-1.5,称该模型能使机器人仅观看3至12秒动作演示就学会新任务,全程无需梯度更新或微调。有评论将这一进展类比为机器人领域的“GPT-3时刻”。
GEN-1.5在展示中表现出类似大语言模型的上下文学习能力。机器人看完人类用刷子扫取物体的演示后,即使工具被换成香蕉,仍能继续执行相似动作;在未教授完整流程的情况下,它还可以自行发展出一手扫、一手接的双手配合。模型能拼接两段不同的教学演示,自主补全中间衔接动作,并可将在模拟器中观看的演示直接迁移到现实世界复现。该公司将这种以动作片段作为提示的方式称为“物理版提示工程”。
在10种任务的基准测试中,仅提供一次物理演示且零梯度更新时,GEN-1.5平均成功率为59%;若为每项任务额外提供5分钟数据和10步梯度更新,成功率可升至83%。Generalist AI承认,通过临时上下文学到的技能稳定性尚不及专门微调的模型,现阶段测试任务也以短程、相对原子化的操作为主。
这项一次性学习能力并非由研究人员刻意设计。据Generalist AI透露,他们没有为上下文学习设计专门架构、元学习循环或额外目标函数,该能力是在大规模连续物理数据预训练过程中自发涌现。训练期间,团队发现新任务所需的数据量从数百步微调逐步缩减,最后在零步更新时也能学会新动作。
团队认为,真实世界中的操作很少孤立发生,整理、装配、搬运等数据天然包含重复、延续和失败恢复,模型在长期连续轨迹上预训练后,逐渐学会根据刚才发生的事决定下一步行动,这被视为物理世界中的上下文学习雏形。
一些网友在社交媒体上表示“机器人界的GPT-3时刻可能真的来了”。目前,GEN-1.5的技术细节已由Generalist AI在官方博客中公开。