据SiliconANGLE报道,企业人工智能软件公司Iterate Studio Inc.(Iterate.ai)10月5日发布大语言模型推理引擎Lifeboat,该引擎内置机密计算功能。Iterate.ai称,它能在每块图形处理器(GPU)上承载两至六倍的并发AI代理会话。
Lifeboat试图解决AI代理规模化后造成的内存问题。一个聊天机器人问题通常只触发一次模型调用,而一个代理处理单项任务可能发起数十次调用,上下文窗口随之增长,共享硬件上的数百个代理会迅速填满键值缓存。Iterate.ai称,标准推理引擎在同时运行四五个长上下文请求时可能停滞。遇到这一限制的团队往往会购买更多GPU,或把工作负载转移到按令牌计费的云服务,并将数据交给第三方。Iterate.ai联合创始人兼首席技术官布莱恩·萨蒂亚纳坦表示,银行、保险公司和医疗系统希望“在自己内部”用自有数据运行代理,同时不想让GPU支出翻倍。
据该公司介绍,Lifeboat的做法从公平调度和准入控制开始,为每个会话分配GPU份额,使繁重的文档处理代理无法挤占交互式代理。对键值缓存的优化将有效容量提高一倍,同时模型权重保持全精度。在混合专家模型上,只有特定代理需要的专家会被加载。每个会话还在独立安全胶囊中运行,具备过滤、令牌预算和沙盒化执行。
Iterate.ai的测试使用单块英伟达RTX PRO 6000 Blackwell GPU运行Qwen 30B-A3B模型。Lifeboat在该配置上维持2048个并发会话,且每个请求都完成。关闭Lifeboat优化后,同一引擎最多只能维持上述数量的一半,处理速度为每秒4965个令牌,而开启优化后为每秒8714个令牌。差距最大的是内存压力测试:128个会话发送18000个令牌请求时,Lifeboat将99百分位首令牌时间保持在1.5秒,基线则需要189秒。
Iterate.ai联合创始人兼首席执行官乔恩·诺德马克说:“任何企业在为其代理购买更多GPU之前,都应先了解已有GPU能做什么。”他说,数据中心或新型云服务商如果能让每张卡承载的并发会话翻倍,就能在不增加机架或电力的情况下拿回这部分容量。
Lifeboat最高端的机密计算版在硬件认证通过前不会处理请求。该认证覆盖AMD和英特尔处理器中的可信执行功能,以及英伟达在H100、B200、GB300及其他受支持GPU上的机密计算模式。模型权重被密封在可信执行环境中,并在使用中保持加密,无论引擎位于云机密虚拟机还是客户自有硬件上。
Iterate.ai称,Lifeboat早期访问版在几天内获得数千次下载,目前已经全面可用。免费开发者许可证覆盖非商业和评估用途,可在单节点最多两台推理服务器上使用。需要专业支持的客户可选用每月49.99美元的标准许可证。机密计算版定价为每月499.99美元,与标准版一样可免费试用七天,无需信用卡。诺德马克和萨蒂亚纳坦上周还在NetApp Insight大会的theCUBE节目中讨论了公司的Generate平台以及与NetApp的合作。