Chance AI创始人兼CEO在科技媒体TechRadar发文指出,随着人工智能从训练阶段转向推理阶段,下一代相机竞赛将不再围绕画质,而是围绕“理解”展开。传感器正在成为感知问题,设备制造商需要像重视图像质量一样重视推理质量。
他讲述了一次亲身经历:他曾为一个艺术展览制作导览程序,参观者只需把手机对准展品,就能获得说明。展览结束后,人们仍继续使用这个工具,把它对准建筑、花卉、儿童玩具和街头海报,而这些都与展览无关。他说,没有人要求他们这样做,但他们已经自行认定,相机应该能够把世界解释给他们。
文章回顾了相机传感器的演变。Eric Fossum在20世纪90年代初开发的CMOS有源像素传感器,让强大相机进入几乎每个人的口袋。而他后来的量子图像传感器则走向完全不同的方向——逐个计数光子。这条路径预示着AI正在发生的变化:从捕捉人类喜欢的画面,转向为机器提供最干净的信号。传感器正在变成感知工具,摄影只是它众多用途之一。
AI从训练转向推理让这一问题变得紧迫。训练阶段,相机只是间接产出供后续标记和学习的数据;推理则要求系统在用户举着手机时实时识别,并在瞬间给出回答。当系统必须在设备上、在功耗和发热受限的情况下完成这一过程,最薄弱的环节就是送入模型的数据,它决定了产品性能的上限。
文章认为,部分行业仍在押注错误的方向。有人假设足够大的模型能清理相机传给它的任何画面,但这一想法经不起物理定律的检验。运动模糊或眩光已经破坏的细节,或者美化管线在模型看到画面之前就丢弃的信息,都不是模型规模能挽回的。瓶颈正在向上游移动,移向传感器以及传感器与模型之间的处理环节。
硬件领域已经出现一些变化。部分传感器开始在芯片上完成部分处理,在数据离开像素阵列之前就进行计算。事件传感器(有时称为神经形态传感器)只记录场景中变化的部分,比连续传输整帧画面更适合实时感知。全局快门也减少了破坏机器读取的运动伪影。高动态范围功能长期用于让天空更动人,现在也在围绕模型能否在高对比度下清晰读取而重新调整。
从识别到推理,最直接的构建方向是视觉搜索:用户指向某物,获得标签。但文章指出,指向菜单时,用户真正想要的是帮助决定吃什么;指向海报时,有用的操作可能是把活动加入日历。识别物体只是起点,产品价值在于知道接下来该做什么。传感器因此成为一条更长的解释链条中的第一环,而不再只是简单捕捉画面。
文章最后强调,设备制造商多年来一直在完善图像质量,现在必须同样认真地对待推理质量。软件开发者也应当重新看待采集环节,因为信号如何被获取和传输,在用户看到结果之前就已决定最终输出。实时感知让硬件和软件之间的传统界限变得模糊,初创企业在这一领域仍有空间。