据 SiliconANGLE 10 月 9 日报道,CoreWeave 公司正把业务从单纯的 GPU 容量扩展到存储、网络与软件层,围绕 AI 推理瓶颈推进全栈优化,并推出用于加速智能体模型迭代的 CoreWeave RL Rollouts,以及连接推理服务、可观测性、后训练与评估的平台 CoreWeave Forge。
CoreWeave 产品与 AI 服务副总裁 Urvashi Chowdhary 在 Fully Connected 活动上接受 theCUBE Research 的 Dave Vellante 和 John Furrier 采访时表示,AI 开发者希望尽快解决问题,同时获得最佳性能和可扩展的成本,公司因此专注于构建技术栈的各个层次,在可靠基础设施之上提供更多托管服务,涵盖训练、后训练和推理。
推理需求的上升幅度在客户数据中已经显现。theCUBE Research 对 CoreWeave 客户和潜在客户的一项调查发现,一家医疗健康客户的推理工作负载占比从第一年的约 10% 上升到第二年的 40%,预计 12 个月内将达到约 50%。
Chowdhary 说,CoreWeave 的应对方式是逐层调优硬件之上的每一个环节,从 vLLM 引擎到量化模型和自定义投机解码器。她表示,公司有意利用开源工具和技术,并向开放系统回馈,以便客户保持灵活性,再在此基础上层层构建服务。
强化学习给推理带来了新的压力。Chowdhary 说,当客户使用奖励和验证器训练智能体模型时,推理会在 rollout 阶段成为瓶颈。CoreWeave RL Rollouts 是基于英伟达 Dynamo 框架构建的预览能力,可把新的检查点加载到正在运行的部署中。据其介绍,在测试中该能力相比基线配置将模型重载延迟改善了 15 倍。
“当你做 RL rollout 时,你会不断创建新的模型检查点和版本,你希望它们能进入你的推理设置,这样你就可以独立扩展它。”Chowdhary 说,“我们把它加速了 15 倍,这意味着训练运行得快,推理在扩展,同时你还能继续快速训练模型。”
上述能力现已纳入 CoreWeave Forge。该平台在 Fully Connected 活动上发布,把服务、可观测性、后训练和评估连接起来。Chowdhary 说,Forge 免费起步,付费层级提供额外能力,将 AI 开发工具与服务的获取范围扩展到个人开发者。“我们希望为这些领先技术创造可及性。”她说,“即使你是今天自己注册的个人开发者,你仍然能获得最佳性能、最佳可靠性,不必妥协。”
这一转变的背景是,AI 推理正在成为决定 AI 热潮经济性的工作负载。训练造就了第一波 GPU 云,而更快、更便宜地提供模型服务将定义下一波,这也推动专业云服务商在 GPU 容量之外寻求存储、网络和软件层面的差异化。