据TechCrunch报道,由两名前Meta研究科学家创立的初创公司Perceptron于本周发布了最新视觉模型Isaac 0.5,旨在让机器在仓库、工厂等工业环境中实现更灵活的感知、推理和行动。

Perceptron成立于2024年11月,由曾在Meta人工智能研究部门FAIR任职的Armen Aghajanyan和Akshat Shrivastava联合创立。本次发布的Isaac 0.5是一款开源权重模型,其参数和训练材料可被任何人查看。该模型能够帮助视觉引导机器人在复杂环境中导航,例如仓库或工厂车间,同时也能让企业从机器人录制的视频中提取视觉情报。

该公司近期完成了2100万美元融资,由Bessemer Venture Partners领投。两位创始人表示,当前物理AI领域存在一种“虚假选择”:要么是每个实例都需要多块专用云GPU的通用基础模型,要么是只能处理感知或控制的窄模型,而他们的工具是通用型的,并非为某一种重复性任务设计,能够根据所在环境灵活调整。

Shrivastava在采访中以分拣包裹为例说明了这类任务的复杂性:机器人先要读取包裹标签,进行空间分析以了解箱子位置,决定拿起哪一个,如果是一系列箱子,还要规划抓取顺序。Perceptron的软件旨在帮助机器人逐步完成这些步骤。据他介绍,业界已有能够完成其中大部分工作的软件,但很少能像这样灵活地处理不同场景。

Isaac 0.5通过摄入海量视频训练数据来学习操作技能。Perceptron称,该模型使用了100万小时通用视频,以及大量通过GoPro或可穿戴相机拍摄的第一人称视角视频和用于教授动作的UMI视频。公司未披露训练数据的具体来源,但Shrivastava表示,他们内部构建了PB级数据集,涵盖图像、文本、视频乃至机器人轨迹等多种模态。

Perceptron计划将该软件推向各类供应商,使其智能层集成到制造、物流仓储、安防、移动出行以及媒体和娱乐等行业。Aghajanyan说:“市面上还没有类似的产品,我们对此感到非常兴奋。”