据SiliconANGLE报道,数据中心基础设施初创公司Cornelis Networks于9月14日宣布完成2.05亿美元融资,并推出面向人工智能工作负载的Active Compute Fabric架构,同时宣布与高通技术公司达成战略合作。此轮融资由IAG Capital Partners领投。

Cornelis是AI和高性能计算专用无拥塞数据中心网络系统开发商,竞争对手包括思科系统和Arista Networks。其网络基础设施旨在加速AI模型训练和推理,最大化计算性能。新发布的Active Compute Fabric在AI Infra Summit上亮相,是一种开放架构,将可编程计算直接集成到网络结构中,使网络更灵活高效。Cornelis称,AI模型计算集群规模快速增长,已在数据中心网络中造成严重瓶颈,昂贵的AI加速器常因等待数据而长时间闲置。

Cornelis首席执行官Lisa Spelman表示,过去几年计算、内存和存储都变得更“感知工作负载”,但传统网络尚未经历同样变化,因而难以跟上。Active Compute Fabric将网络内加速、无损传输和可编程计算结合,使网络在数据穿越系统时主动处理数据,并可根据工作负载实时调整,卸载复杂集合操作并承担新功能。该架构基于以太网和UALink等scale-up开放标准,以及用于scale-out的Ultra Ethernet,组织可用现有计算架构实施。

Cornelis首席营销官Brandon Draeger对SiliconANGLE表示,Active Compute Fabric在数据移动过程中执行某些工作负载特定操作,而不只是充当信使。例如,它可为解耦推理组装KV缓存数据,协调混合专家模型的专家调度,加速AllReduce等集合操作,并在传输中压缩梯度,这些都在数据到达目的地前完成。他说:“数据负载不会以离开时的样子抵达。”在集合操作中,来自许多端点的部分结果在网络结构内部合并,最终只有一个归约结果到达目的地,而不是成千上万个独立贡献;压缩梯度以原始大小的一小部分移动。相关工作在数据原本就要经过的路径上完成一次,而不是消耗两端的加速器周期。

Draeger称,根据Cornelis的预生产模拟,该架构可减少高达50%的总体网络流量。大型AI部署中的加速器利用率通常接近装机容量的一半,该架构旨在回收当前被浪费的相当一部分,具体改善幅度取决于模型、集群规模和客户技术栈。

Spelman表示,Cornelis正扩展到scale-up和scale-out,以便让网络架构更接近驱动AI工作负载的加速器,更快为其输送数据并提升性能。她说,AI基础设施正达到仅靠更快的端点不够的阶段,网络结构必须成为计算系统的主动部分;客户对开放替代方案的需求增长,为Cornelis带来动力。

高通技术公司认同Cornelis关于开放高效scale-up和scale-out网络的愿景。双方将在圣克拉拉AI Infra Summit上同台宣布战略合作,旨在塑造机架级AI数据中心的网络未来。双方认为,现有被动网络结构只移动数据,是导致AI加速器长期利用不足的重大问题,并认为网络应在AI数据中心基础设施设计中获得更高优先级。