据TechRadar报道,Meta正与韩国初创公司Panmnesia合作设计一种面向人工智能的数据中心架构,目标让数千个处理器在同一一致环境中运行。该方案使用Compute Express Link(CXL)连接多个机架中的CPU、加速器和内存,而不依赖传统网络链路;按其公布的设计,最多可将约960个AI加速器纳入一个一致性域,接近1000个GPU作为一个系统工作。
这项设计针对的是AI训练系统扩展到数百或数千个加速器后愈发突出的问题。每个加速器都必须按重复的计算阶段推进,一个组件延迟就可能迫使其他设备等待。研究人员因此把重点放在减少机架间不可预测的通信延迟上。通常,跨出单机系统的连接由以太网或InfiniBand网络承担,这些网络需要数据包处理和软件协调,当工作负载扩展到更多服务器时,可能带来更大的延迟波动。CXL则提供共享一致性机制,使处理器、加速器和内存处于同一个互联资源环境。该架构还加入专用硬件,以便在更大的互联结构中保持通信路径和处理行为更一致。
据TechRadar报道,Panmnesia的设计使用高扇出交换机、链路加速单元和结构控制器管理系统流量。这些组件被组织成托盘、Pod和互联结构,借鉴了半导体芯片内部功能模块的排布原则。公司称,其结构控制器和链路加速单元已完成硅验证,交换机也已完成制造;随着开发走向商用产品,预发布硅片正在供应。
该方案将自身与英伟达的GB200 NVL72作比较。在GB200 NVL72中,一个CPU通过NVLink-C2C直接协调两个加速器;而在Panmnesia的架构中,一个CPU可协调16个加速器,相当于参考配置的八倍。按照公布设计,约60个这样的组合可构成一个包含约960个加速器的一致性域。跨机架访问可能从微秒级降至数百纳秒,约减少一个数量级。该架构还允许更换单个故障设备,而不必让整台服务器退出服务,这种分离可能减少故障时被移除的正常硬件数量,但实际运营收益取决于具体实现。
Panmnesia首席执行官Myoungsoo Jung在发布时表示:“CXL能让整个数据中心作为单一计算系统运行。”该架构仍受物理限制:在128 GT/s速率下使用两个重定时器时,电信号CXL的传输距离只有约7米。Panmnesia因此提出用光学CXL链路覆盖更长距离,并称已完成该方案的硬件概念验证。