据SiliconANGLE报道,NetApp与英伟达正在为AI工厂重新设计存储架构,双方合作可追溯至十多年前,并包含围绕AI基础设施的联合工程。NetApp首席平台与技术官Arindam Banerjee和英伟达存储技术副总裁Jason Hardy在NetApp INSIGHT期间接受theCUBE采访时说,AI工作负载迫使存储系统同时处理大规模数据移动与高频元数据操作,以保持GPU持续获得数据。
NetApp的Novus架构将数据与元数据功能分离,使两者可以依据不同工作负载需求独立扩展。Banerjee说,传统企业存储围绕扩展方式相对可预测的工作负载设计,而AI把重数据移动与事务型元数据活动结合在一起,且往往发生在共享基础设施上。如果元数据和数据共享同一资源、同一介质和同一网络,数据操作会排在小而具事务性质的元数据操作之后,造成系统效率低下,并让昂贵的GPU在继续耗电的同时利用不足。将两者分开扩展,是为了恢复效率,让GPU保持数据供给。
Banerjee说,AI工厂的变化在于不同类型工作负载同时出现:元数据对应事务型负载,检查点等对应重型顺序负载。以往架构能很好处理其中一种,却无法同时兼顾两者。AI工厂正在推动存储系统在同一时间处理这两类数据需求。
Hardy说,关键在于设计一套能随时间扩展的系统。企业正从试用阶段进入第二阶段,即主流生产部署;AI代理开始出现,企业级推理也在发生。这意味着基础设施要在微调、推理、容量和AI就绪数据之间保持灵活性,随着生产工作负载变化和需求在不同部分之间转移而调整,不必每出现一个新用例就重新设计系统。
代理型工作负载带来另一重压力。Banerjee指出,吞吐量重要,并发同样关键。成千上万个代理可能同时访问数据,其权限可能是临时的、范围狭窄的,这会增加元数据操作量。并发代理带来的元数据访问正在重新定义未来存储系统的构建方式。
这种变化也改变了与存储层交互的人。Banerjee说,AI团队不是存储工程团队,应能通过API、SDK来消费存储,未来也可能由代理完成这些工作。因此存储必须真正由API驱动、对代理友好。NetApp正在设计新的控制平面,允许通过API使用Novus。