据SiliconANGLE报道,IBM与CoreWeave正在围绕智能体工作负载的隔离与身份管理展开联合工程。IBM Research高级技术人员布赖恩·贝尔戈代雷在该媒体theCUBE的直播访谈中介绍了这一合作,称双方在身份系统对接和工作负载控制上经过多轮迭代。

贝尔戈代雷是在Fully Connected活动期间与theCUBE Research的戴夫·韦兰特和约翰·弗里尔对谈时作出上述表述的。他描述了强化学习给研究基础设施带来的变化:模型训练进行到某一阶段后,需要取出检查点并加载到推理环境中执行任务、进行测量,这就是测试阶段。他指出,随着模型开发方式演变,IBM Research的基础设施必须支持越来越多样化的负载,系统不仅要承担密集计算,还要处理与工具、存储及其他服务的交互。

IBM Research的Granite系列模型开发需要大量算力。贝尔戈代雷称,后续一代硬件的冷却与电力需求,促成了IBM决定与CoreWeave合作。IBM自建了一个大型H100集群,从选址到落地全部自行完成,他形容这是一项浩大的工程。

双方的合作随后扩展到身份管理和工作负载控制方面的联合工程。IBM提出了把内部身份系统延伸到CoreWeave的需求,又经过数轮迭代完善实现。贝尔戈代雷说,CoreWeave经常主动来询问正在考虑的做法能否听取反馈,IBM也乐于参与评审。

据其介绍,IBM Research的大部分集群为单租户,自有存储部署在CoreWeave内部,并在成本与安全参数允许的范围内使用额外容量。合作还涉及CoreWeave Sandboxes,该功能支持在专用基础设施或托管的无服务器运行时上隔离执行代码,研究人员由此可以选择智能体代码的运行位置以及可访问的资源。

贝尔戈代雷提到架构决策的代价:早期做出错误选择,要么会意外购入过多网络基础设施,要么必须重新采购并改造全部设施。他说,失误很多,人们往往低估了更改这些决定的成本。在安全方面,IBM将安全控制对性能的影响与基准测试结果对照,并据此与安全团队讨论取舍,工作负载隔离与企业身份集成同属这套安全架构。

他把这一问题描述为自下而上的供应链问题:不只是硬件,还有固件、内核层、代码、数据来源,然后进入智能体和镜像的世界,这绝对是一个来源溯源问题。

需说明的是,CoreWeave是theCUBE相关报道的赞助方,theCUBE为Fully Connected活动的付费媒体合作伙伴,赞助方对theCUBE或SiliconANGLE的内容不拥有编辑控制权。