据爱范儿报道,Figure AI 于9月17日发布新一代机器人模型 Helix 2.5,并在30个位于湾区的真实民宅中完成零样本测试。在420次试验中成功237次,零样本成功率为56%,评测过程为盲测,没有远程操作,也没有事先采集目标家庭的任何数据。
据该媒体报道,评测前 Figure 把要用到的玩具、毛巾和床品单独存放,先由 AI 模型初筛、再经人工复核,确认它们没有出现在任何任务训练数据里;30个住宅也保留了各自原有的沙发、床铺和折叠台面,没有针对评测做改造。作为参照,同样硬件、同样任务数据、但没有经过 Index 预训练的策略,成功率只有9%。Figure 称,在其他条件不变的情况下,Index 预训练把零样本任务的成功率从9%提升到56%,整体成功率提升了522%。
与上一代模型 Helix 02 相比,后者需要先在目标场地采集数据才能训练,而 Helix 2.5 仅用一半的适应数据量,就在30个从未见过的家庭里追平了 Helix 02 在单一场地的成功率。Figure 首席执行官 Brett Adcock 称这是公司“迄今做过最重要的项目”,AI 总监 Corey Lynch 在发布视频中强调,机器人在30个家庭中“每一个都记录到了成功”。
支撑这一结果的是 Figure 的数据集 Index。据披露,Index 今年5月以另一款应用的形式低调上线,8月25日才正式公开,官方称其为“迄今最庞大、最多样的机器人训练数据集”。上线时已有26.4万次下载,覆盖108个国家,每周活跃创作者超过4.4万人,累计上传视频超过1600万条;上传速度一度达到每秒30分钟新视频,相当于每天有4.9年人类工作量涌入系统,到9月初提高到每秒35分钟。Figure 已向创作者支付1500万美元,并计划在未来12个月投入超过10亿美元用于数据和算力,把采集规模再扩大100倍。
据爱范儿报道,每1000小时收集到的数据包含373个不重复任务、1146个不重复操作对象和116个不重复环境,还需经过筛选、反作弊检查、去重、分布再平衡和文字标注五道工序。Figure 称,在模型规模和下游训练条件固定时,把 Index 预训练数据逐次翻倍,机器人动作预测误差会规律性下降;实验中最大与最小数据规模相差8倍,误差曲线平滑到可以用小规模实验预测最大规模训练的损失值,偏差只有整体波动范围的0.54%,公司把这称作从人类到人形机器人的缩放定律。
其他公司也在寻找扩大经验来源的办法。1X 的 Neo 今年2月开始面向家庭预订,售价2万美元,但从冰箱里取水、往洗碗机里放餐具、叠一件毛衣等动作,仍要靠公司内部代号“Turing”的远程操作员戴着 VR 设备实时接管;特斯拉的 Optimus 则更依赖大规模人类遥操作。相比之下,Figure 先让模型从海量人类视频里学习一般性行为模式,再用少量任务数据适配具体动作。
算力方面,9月初云计算公司 Nscale 宣布向 Figure 提供至少35亿美元算力,双方计划把这一规模扩大到60亿美元以上,最多部署10万块英伟达 Vera Rubin 芯片,首批设备预计2027年下半年在得州巴斯托落地;作为交易的一部分,Nscale 还入股 Figure,成为其“优先算力供应商”。Adcock 在声明中表示,要把人形机器人送进全世界的每一个家庭,公司眼下最大的瓶颈就是数据和算力。
爱范儿文章提到,此次测试只有三类任务,如果能扩展到10至12类,并把零样本成功的几率提升到80%至90%,限定范围的家庭试点会更有吸引力。目前56%的成功率并不意味着机器人永远都会失败,Helix 2.5 在长时间任务中已具备自我修正和重试功能。