据SiliconANGLE报道,随着开放权重模型的性能逼近闭源前沿系统,企业开始把生成式AI从试点项目搬进自有硬件上的生产环境。在NetApp INSIGHT大会期间,NetApp与Iterate.ai推出面向私有部署的AIPod Mini一体机;同期在Fully Connected大会上,CoreWeave与LlamaIndex则把讨论焦点放在推理算力的组网与供给方式上。

NetApp云业务部门高级副总裁、总经理兼首席营收官Ashish Dhawan在theCUBE访谈中表示,企业对私有AI中模型的使用已更加成熟,闭源模型和开放权重模型都在接近前沿水平。Iterate.ai联合创始人兼首席技术官Brian Sathianathan介绍,AIPod Mini把NetApp基础设施与Iterate的Generate平台打包成开箱即用设备,目标是让模型、硬件和数据都留在客户手中,而不是把信息送往第三方服务。该设备通过ONTAP协议与NetApp存储连接,上层运行内置大语言模型的Generate软件,使AI查询可以在企业自己的范围内本地、私有地完成。

Iterate.ai联合创始人兼首席执行官Jon Nordmark说,系统出厂即带有200多个代理模板、200多项技能,并可接入800多个工具。在一个保险部署案例中,原本需要分析师约8小时的事故报告分析缩短到8分钟。医疗领域的案例更具体:Sathianathan称医院通常只能从保险公司收回账单金额的80%至85%,Iterate.ai的法务收入周期代理为一家年账单1.5亿美元的医院识别出1740万美元被拒赔款项;Nordmark补充,该工作流串联三个代理,分别读取付款方合同、检查收到的拒赔并起草重新提交材料。

随着这类代理承担后台工作,对其可访问范围的管控变得关键。Sathianathan表示,自主代理开始运行意味着需要治理和权限控制,这正是NetApp平台的价值所在。NetApp还在该活动上发布Novus存储架构,面向AI工厂的泽字节级容量需求。Nordmark称公司常讲“记忆加上下文等于知识”,企业的大量记忆今天就在存储里,这正是要释放的部分。

在Fully Connected大会的theCUBE访谈中,CoreWeave人工智能计划高级副总裁Lukas Biewald与LlamaIndex联合创始人兼首席执行官Jerry Liu讨论了推理负载、治理以及AI原生创业公司为何转向专业化云。Liu说,LlamaIndex已从检索增强生成的开源框架演变为模型构建方,通过租用而非自建算力运行,公司专注于文档解析与抽取,后训练开放权重模型、自建数据集,并围绕性能、成本和延迟的组合调整产品。

Liu称,LlamaIndex的计算负载约75%用于推理、25%用于训练,每天为金融、法律和保险客户处理数百万页文档,这些客户的单据呈突发式到达。公司不拥有GPU集群,因此有保障的容量比硬件所有权更重要。

Biewald通过CoreWeave收购Weights & Biases加入该公司。他说自己最初怀疑芯片配置能有多大影响,答案是差异巨大:取决于芯片的网络连接方式和电力分配方式,差距可达数个数量级。CoreWeave在活动上发布Forge开发层,把训练、推理、评估和代理开发放在同一个互联环境中。

在开放性上,Biewald称CoreWeave遵循英伟达推荐的标准网络协议,而AWS等提供商依赖专有API,使工作负载难以迁移。他说客户来自不同云,很多人的Web服务仍会托管在AWS或GCP上,CoreWeave对此并不介意,因此与其他云相处得更融洽。

Liu则认为,后训练一个小型开放权重模型目前仍是少数专家掌握的技能,充裕的新云算力加上快速改进的编码代理,可能让更多人参与这项工作。他说,业界正越来越擅长定义可观测性、评估和应关注的指标,整个循环有望被自动化并向所有人开放。