在第五届GMIF2026全球存储器行业创新峰会上,与会企业把AI推理带来的存储压力摆到台前:截至今年3月,中国日均Token调用量已突破140万亿,存储介质的能力与分工正被迫调整。据雷峰网报道,这一变化正在从数据中心资本支出延伸到SSD、HDD和NAND的产品路线。

摩根士丹利执行董事、大中华区半导体分析师颜志天指出,在未计入HBM的情况下,2026年存储占全球云数据中心资本支出比例接近五成,2027年预计进一步升至53%。三星电子副总裁、Memory事业部首席技术官Kevin Yoon换算,中国每天消耗的Token超过中国国家图书馆全部藏书对应Token量的20倍,接近人类历史上所有出版图书总量的6倍。

Solidigm亚太区销售副总裁倪锦峰将推理负载对存储的压力概括为数据丰富度、推理复杂度和运营持久性三个维度。星河智联展示的车载Agent需要同时处理语音、视觉、车辆信号,并结合对话历史、长期记忆、用户画像和实时车身状态。Arm全球存储业务负责人John Xavier Lionel则拆解了推理数据:模型变大带来更多权重和运行时状态,上下文变长增加KV Cache,服务用户增多要为每个请求保留KV Cache,Decode阶段还会反复访问模型权重和KV Cache。Dify联合创始人陈璐莎判断,未来企业运行的Agent数量可能从个位数升至数百个,并24小时待命、执行长程任务。并行科技提供MaaS模式按Token付费,联想规划企业本地Token工厂时更关注算力利用率、服务稳定性和持续产出Token的成本。

压力之下,SSD、HDD和NAND开始越过原有边界。慧荣科技通过主机软件和存储软件栈识别任务类型,再由SSD控制器按QoS等级调整资源,使同一块SSD响应不同AI负载。闪迪资深产品市场总监张丹把SSD分为直接连接GPU、通过网络连接GPU和位于计算集群之外三类,分别承接热KV、较大规模计算和低频大容量数据。倪锦峰观察到,北美大型互联网公司已开始用大容量QLC SSD替代部分HDD。大数极限设计的PMD则试图在传统HDD与企业级SSD之间提高带宽和随机访问能力。欧康诺在AI SSD测试中加入深度学习I/O负载,以及KV Cache、断点恢复等场景。

NAND也在沿不同方向突破。三星设计的Z-NAND核心Die基于SLC并集成TSV等技术,其架构中操作系统和KV Cache留在DRAM,大容量、读取密集的模型权重放入Z-NAND。北京大学集成电路学院院长蔡一茂介绍,HBF主要有两条路径:一条缩小NAND阵列尺寸以降低读取时延,另一条借鉴HBM增加接口数量以提升带宽;但缩小阵列会牺牲部分存储密度,NAND读取时延仍偏高,写入寿命也难以承受KV Cache的频繁更新。蔡一茂还提到,北大与燕芯微等合作方正在探索利用NAND阵列完成部分存内计算。

数据管理方式随之改变。芯展速副总裁李蓁用存储、连接和解决方案三个关键词拆解AI数据供给体系。联芸与寅谱联合推出的AI SSD方案针对MoE模型,把当前调用的专家权重留在CPU内存和GPU显存,暂时不调用的放入SSD,并预测下一阶段专家提前预取;KV Cache高频部分留在内存,低频部分下沉SSD。杰创智能搭建的常青云平台提前把任务所需数据准备到相应节点,结合任务类型、GPU代际和网络带宽匹配数据与算力资源。佰维存储董事长孙成思在峰会上表示,数据供给的效率决定算力的产出。