英伟达超大规模与高性能计算业务副总裁兼总经理伊恩·巴克(Ian Buck)在Fully Connected活动上表示,AI工厂的经济性正越来越取决于把算力转化为可用智能的整套基础设施,而不只是获取高性能图形处理器。他是在接受SiliconANGLE Media旗下theCUBE Research的戴夫·韦兰特(Dave Vellante)和约翰·弗里尔(John Furrier)采访时作出上述表述的。

据SiliconANGLE报道,巴克说,随着代理式系统同时调用多个模型、数据库和工具,整个数据中心必须作为一台计算系统运转。这一转变把关注点从单颗芯片转向基础设施:网络、存储、处理器和软件需要在大规模下协同工作,同时提高每一单位电力所产生的输出。

“过去衡量的是汽车、设备或个人电脑,现在是代币(token)。”巴克说。他表示,这些资产不是IT支出,也不是成本,而是经济中会增值、能创收、可互换、耐用且具生产性的组成部分。

巴克认为,AI工厂的商业产出主要来自推理,即已部署的模型处理请求并生成代币。但推理并不意味着训练被替代,因为企业会随着数据和市场条件变化持续更新已部署的模型。他说,这些服务并非部署完就不管,企业在使用模型过程中会不断优化、对齐并加入更多数据,让模型保持最新并具备感知能力,这实际上就包含了一部分训练工作,在强化学习和在线对齐方面可以看到这类工作。

低延迟为工作负载划分出另一个经济层级,推理速度越快,价值越高。英伟达的Groq 3 LPX推理加速器与其Vera Rubin平台配合,提升对时间敏感工作负载的单用户代币生成速率。巴克说,如果这些代币的价值在于尽可能快地思考,LPX可以在Vera Rubin之上加速实现这一点,在金融科技和其他实时发生的领域,他们看到很多兴趣。

电力容量最终限制数据中心可部署的算力基础设施规模。这一约束使每瓦代币成为衡量AI工厂经济性的核心指标,也迫使供应商在每一代硬件上提升性能。巴克说,数据中心有天然上限,这个上限就是电力;每一代GPU都要确保每瓦代币效率提升约10倍,Blackwell最终实现了每瓦代币效率30倍的提升。

系统设计与运营的规模也随之改变。据巴克介绍,CoreWeave允许客户自行选择配置,或使用更上层的推理服务,在吞吐量与代币速度之间取得优化平衡。他说,CoreWeave可以为客户做到这一点,客户不必被众多选择压垮,这正是合作伙伴生态重要的地方。

theCUBE是Fully Connected活动的付费媒体合作伙伴,CoreWeave是theCUBE相关报道的赞助商,赞助商对theCUBE或SiliconANGLE的内容没有编辑控制权。