TechRadar 10月11日刊文指出,AI热潮正触及电网容量和散热的物理极限,AI数据中心并网等待时间被拉长,传统风冷与液冷系统也难以满足快速扩张的设施需求。该报道称,算力增长正超出GPU互连的数据传输能力,波动的负载还会冲击电网功率因数校正系统,机架功率密度则让传统冷却系统不堪重负。
机架级散热构成第一道瓶颈。标准服务器机架会产生大量热量,高性能GPU集群的热量更高。现代GPU机架单柜功耗超过50至100千瓦,使传统风冷和液冷方法显得不足。报道指出,标准冷却系统通常让集群运行在65至85摄氏度,一旦达到90至100摄氏度,系统就会触发性能降频,以避免GPU永久损坏。传统风冷系统并非为超过30至40千瓦的机架密度设计,而AI集群很容易越过这一水平,100千瓦以上正成为常态。若仅靠空气冷却大型AI集群,需要“飓风级”气流,这种做法并不现实。
液冷方案正在被重新设计。冷板利用微通道让流体在芯片上方形成湍流带走热量,但要维持足够流量,需要巨大的泵送功率,这成为数据中心运营商的约束。运营商因此转向直接安装在处理器上而非处理器上方的直接芯片冷板,以较低泵送功耗维持冷却。相变机制也被用于提高GPU集群的冷却效率,利用液体汽化或固液转换的潜热吸收高密度机架的热峰值。专用介电流体直接接触发热GPU后沸腾为蒸汽,蒸汽上升至冷凝器,再通过重力变回液滴落回池中循环。报道称,这种两相浸没冷却可将冷却能耗降低最多40%。部分运营商还采用闭环液冷系统,循环流体冷却GPU,几乎不产生蒸发损耗,也无需频繁补水。按容量排名前三的数据中心运营商微软已在新数据中心部署闭环系统:水一次性注入后在服务器间循环吸热,再进入风冷冷却器降温,随后重新循环,无需新鲜补给。该系统成本高昂,规模部署需要时间。
互连和板级限制同样逼近。GPU集群依赖铜缆电互连或光互连共享数据、内存和工作负载。铜缆电互连长期是标准方案,但高GPU负载已将其推到极限。电信号在超过两米的距离上会衰减,带宽需求每翻一倍,可用传输距离就减半,而大型GPU集群使通信距离比以往更长。密集排列的铜互连还会产生电磁干扰,干扰其他信号,需要复杂的均衡系统,进而消耗更多电力。GPU电路板铜板的电阻也会带来功率损耗:传输电流越大,发热越多,需要的冷却能耗也越高,而冷却本身已是瓶颈。报道称,在电互连触及绝对极限后,数据中心所有者不得不转向光互连,把数据转化为光脉冲,通过光纤电缆在长距离上以极低损耗传输。光纤比铜缆束细得多,可在密集发热环境中创造更多气流通道。