据SiliconANGLE报道,戴尔科技与CoreWeave的高管在Fully Connected活动期间表示,AI基础设施的可靠性已经不再只取决于单个机架,而取决于计算、网络、供电和冷却能否协同运行。戴尔PowerEdge AI架构与系统开发工程总监萨拉特·克里希南和CoreWeave计算架构工程副总裁雅各布·尤恩特在theCUBE直播访谈中,讨论了联合工程、制造诊断、液冷和数据中心协调。
克里希南说,不同数据中心对冷却方式的要求不同,有的冷却从顶部进入,有的从底部进入,供电线缆尺寸也各不相同。戴尔已经学会构建模块化机架级基础设施,以快速适应这些需求。尤恩特表示,对CoreWeave和戴尔而言,设计工作在系统进入生产前数月甚至数年就已开始,固件设置、机械改动和部署要求都会在第一台机架之前完成协调。
尤恩特说:“这种合作涵盖从解决方案的紧密联合工程,到在工厂中嵌入人员……让产品更好,弄清楚如何扩展,弄清楚如何部署。”他表示,这种合作对双方都有利,因为CoreWeave可以利用戴尔的供应链能力和工程经验,戴尔则可以利用CoreWeave的部署、运营以及大规模运行这些系统时看到的经验。
这种合作也影响机架作为集成生产系统的验证。克里希南说,戴尔利用CoreWeave的运营反馈来改进服务器和机架组装过程中的诊断。他说:“这实际上是把风险向左推。”制造过程越往后,修复问题的成本越高;如果必须在数据中心内更换部件,成本会极其高昂。过去两年,戴尔将最复杂的诊断——那些能够捕捉真实硬件故障的诊断——不断向左推移。
液冷为AI基础设施可靠性增加了另一个维度。CoreWeave的机架管理器Racky将供电、冷却和环境遥测整合到一个统一控制界面中。克里希南说,戴尔与CoreWeave合作,在L11工厂中集成Racky,因此设备发货时已经经过测试,双方也进行了大量联合创新。他说,与CoreWeave的合作启发戴尔构建更好的泄漏检测机制,因为泄漏可能造成灾难性后果。
对于英伟达的Vera Rubin系统,运营挑战已经扩展到计算托盘、交换机、数据处理单元和网络结构。尤恩特解释说,将这些元素与设施供电和液冷协调起来,需要在完整基础设施堆栈上进行管理。他说:“对于Vera Rubin及以后,我认为我们看到的是,机架不再是计算机。‘这一排是计算机’,或者‘这个数据大厅是计算机’,或者‘这个数据中心是计算机’。这意味着整个堆栈需要紧密的系统集成。”
SiliconANGLE报道称,theCUBE是Fully Connected活动的付费媒体合作伙伴,CoreWeave是theCUBE报道的赞助商,但赞助商不对theCUBE或SiliconANGLE内容拥有编辑控制权。