据SiliconANGLE于9月23日刊发的分析文章,人工智能基础设施正从以GPU为中心的阶段,转向计算、内存、网络、封装、电力与软件协同设计的系统级架构。文章认为,AI工厂本身正在变成一台计算机,半导体行业的经济逻辑、竞争格局乃至地缘政治影响将随之改变。
文章将生成式AI最初几年概括为“第一阶段”:GPU是稀缺资源,英伟达成为AI基础设施周期的标志性公司,市场关注能获得多少GPU以及多快部署。如今,重心正从芯片向外转移。AI基础设施讨论迅速转向系统,包括CPU、GPU与定制XPU、内存与高带宽内存、纵向与横向扩展网络、小芯片、先进封装、光学、冷却、软件和电力,最终是整个园区作为巨型计算机运行。
SiliconANGLE作者近期听到多位业内人士讨论未来半导体生态,包括AMD首席技术官Mark Papermaster、博通半导体业务负责人Charlie Kawwas、三星电子的Paul Cho以及OpenAI硬件负责人Richard Ho。作者的结论不是某一份路线图,而是AI正迫使行业重新设计计算机,同时AI也开始重新设计计算机制造方式。
从GPU时代走向异构AI工厂,单一处理器架构通吃越来越难,因为训练、推理、检索、代理和专门企业负载的计算特征差异很大。Papermaster认为,通用CPU和GPU不会消失,模块化架构和小芯片让半导体供应商在保留共同基础的同时,为特定负载创建变体。AMD的多个Venice设计就是例子,其中包括日益针对新兴代理式工作负载的配置。
定制加速器方面,Kawwas把XPU视为主要面向少数超大规模前沿AI公司的市场。这一定位很重要。定制芯片不只是设计更好的芯片,还需要足够工作负载规模、软件栈所有权和可预测需求,以摊销开发成本。因此,超大规模云厂商和前沿模型公司正深入芯片领域。谷歌有TPU,AWS有Trainium和Inferentia,微软有Maia,Meta继续投资内部加速器战略,OpenAI正与博通推进名为Jalapeño的自有架构。Richard Ho表示,Jalapeño围绕前沿模型重要的“内核、内存移动、网络和服务模式”进行优化。这是全栈优化。AI基础设施前沿正从购买芯片转向围绕工作负载设计系统。
内存正被移到架构设计的前页。过去架构师可以大体先设计计算系统,再配上合适的存储层级。AI推翻了这个假设。庞大的参数与数据移动意味着内存带宽、容量、功耗以及与计算单元的物理距离,越来越决定系统性能。相关讨论集中于逻辑、内存和封装的协同设计,包括HBM认证和3D集成内存,而不是把这些元素当成彼此独立的采购决定。Paul Cho最近描述这一转变时说:“内存在AI基础设施中不再是配角,它正成为设计中心。”文章认为,AI基础设施竞赛不再只是计算竞赛,而正在变成数据移动竞赛。信息每经过一次板卡、机架或数据中心,都会消耗时间和能源。这也是计算、HBM和先进封装日益激进整合的原因。