据SiliconANGLE报道,两家AI基础设施技术公司9月9日分别发布新产品。Compute Exchange Inc.上线GPU库存管理功能,让企业买家可在超过100家供应商中浏览和比较可用AI算力;Lightbits Labs Ltd.宣布其KV缓存引擎Inferra正式可用,旨在提升AI推理性能并降低使用成本。

Compute Exchange是一家撮合GPU买卖双方的初创公司。新功能在其询报价(RFQ)市场基础上,允许买家浏览当前、预留及远期库存,比较价格、规格、位置、服务级别协议和商业条款。目前覆盖英伟达和AMD的主要加速器,包括H100、H200、B200、A100及MI系列,也包括整机服务器和推理token承诺。由于专门运营GPU的云服务商数量增加,GPU采购变得复杂,Compute Exchange首席执行官Carmen Li估计目前市场有数百家此类供应商,“你不想给400个销售打电话去对比参数和谈判”。

该公司称,库存数据通过应用程序接口或电子表格上传进入市场,过去18个月已与100多家供应商合作,目前几乎每天新增一家。Compute Exchange不持有GPU、不运营数据中心,以避免市场方同时销售自有算力产生的利益冲突。买家初期只看到技术细节、基准测试结果、位置、价格和服务承诺,选定候选后才披露供应商身份。Li强调中立性最关键,“我们不站队”。供应商只在交易完成时支付平台费用,新库存功能不额外收费。Li透露,公司今年收入已超过七位数并盈利,平台求购请求从单节点到2万个节点不等,受库存限制目前约40%的询价量能成交。平台支持GPU和token的预留及远期合约,也支持物理硬件二手销售。她预计明年供应会增加,但需求也可能同步增长。

Lightbits发布的Inferra将key-value缓存数据从GPU的高带宽内存中移出,扩展至DRAM和NVMe存储,并用预测预取在GPU需要前把数据放到附近。KV缓存保存模型处理提示时生成的中间注意力数据,会随对话或文档变长而挤占GPU内存。当缓存未命中时,系统要从较慢内存读取或重算,造成GPU资源闲置。Lightbits AI解决方案业务高级副总裁Ramesh Chettuvetty表示,预测预取可防止这种停顿。Lightbits声称Inferra在部分长上下文任务中可将首次输出token时间降低超过100倍,在通用硬件上支持超过1000万token的上下文,并发会话密度提高超过16倍,但这些数据来自公司基准测试和外推,未经独立验证。该公司称多数测试场景缓存命中率达近99.9%,还提供服务质量控制、加密和租户隔离,并能在会话迁移时移动缓存数据。

Inferra面向运营大语言模型的neocloud和企业,主要针对长上下文窗口或大量并发会话。Lightbits架构总监Arthur Rasmusson将其类比为CPU速度超过内存性能后发展出的处理器技术。Lightbits表示已有生产试点,初期瞄准neocloud供应商,因为他们提高利用率和利润率的动力更强。公司将在下周圣克拉拉AI基础设施峰会上展示Inferra。