据SiliconANGLE于2026年10月6日报道,Vast联合创始人兼首席技术官阿隆·霍雷夫在Fully Connected 2026大会期间接受theCUBE采访时表示,随着AI智能体运行时间变长并在企业内扩散,其记忆需求正在把基础设施压力从GPU内存扩展到数据移动和存储层。Vast提出以分层存储方式卸载键值缓存,以缓解推理过程中的内存瓶颈。

霍雷夫与theCUBE Research的约翰·弗瑞尔和戴夫·维兰特讨论了AI智能体记忆、键值缓存卸载以及数据移动成为下一瓶颈的趋势。他说,智能体的记忆与通常所说的大模型上下文并不相同。企业智能体既需要单次交互中的上下文,也需要跨会话保留的共享知识,还包括可回看过去对话和交互、从中学习的长期记忆。

压力首先出现在推理环节。据霍雷夫介绍,每个长时间运行的会话都会把KV缓存保存在GPU内存中,一个50万token的会话可能占用一块GPU内存的十分之一到二十分之一。当智能体因为编译代码、测试软件或用户暂时离开而暂停与大型语言模型交互时,如果能够把会话卸载到存储,就可以避免重复计算。

Vast的做法是把内存分为多个层级。GPU内存最先使用,其次是同一台机器上的CPU内存,再到可保存PB级KV缓存的持久性介质,并由英伟达的Dynamo软件进行编排。霍雷夫说,可以把会话从繁忙GPU转移到较空闲GPU,KV缓存既可以通过网络迁移,也可以从Vast读取。把推理视为分布式问题后,企业可以在整批机器上使用GPU内存、CPU内存和Vast存储,获得更多选择与更优化的调度。

随着企业部署数千个处理敏感数据并代表客户行动的智能体,记录并保留其行为成为要求。霍雷夫称,这使AI智能体记忆同时成为治理资产和性能资产。Vast还推出了面向敏感工作负载的机密计算服务。

霍雷夫还表示,智能体产生的对话具有价值,这些信息可用于微调、训练或创建专用模型。