雷峰网10月8日报道,AI基础设施正沿数据和存储两端延伸。如祺出行首席运营官韩锋称,公司不训练大模型,而是把出行场景中的真实数据加工成自动驾驶、世界模型和具身智能公司可用的训练材料;华为和英伟达则推出面向推理缓存的AI记忆存储产品,KV Cache开始走向独立存储,但专用SSD标准尚未确定。
韩锋在接受新智驾采访时说,如祺出行2023年推出智驾数据工具链,逐步搭建从采集、清洗、标注到模型评测的数据闭环。2026年具身智能发展加快后,公司发现自动驾驶与机器人所需数据只部分复用,但底层数据工具链高度相通,于是把智驾数据能力向外延伸。他不做大模型或世界模型,是因为核心优势在场景和数据:公司有数据采集车、Robotaxi和线下运维网络,车辆每天在真实社会中运行,可持续产生真实数据。
客户需要的是低成本、高质量、可直接进入训练流程的数据,以及确定性的交付产能和工程效率。韩锋举例,服务一家头部自动驾驶公司时,如祺先按客户数据规范把复杂标注任务结构化,再匹配资源并数字化管理,以天为单位持续交付,并提前介入缩短产能爬坡。他认为,数据服务没有特别高的单点技术壁垒,门槛来自长期沉淀的采集方法、处理工具链和客户反馈带来的迭代。数据标注目前成熟度和自动化程度较高,适配新客户的时间已从一年多明显缩短。
对于世界模型和合成数据,韩锋说,合成数据适合以真实长尾案例为基础,扩展危险、临界和复杂交通场景;真实数据则记录交通参与者不可预设行为、道路环境变化和传感器物理响应,帮助发现未知问题并为合成结果提供校准。会被替代或压价的是为增加数量反复采集的常规数据,不是真实数据本身。Robotaxi和具身智能主要在数据基础设施层面复用,感知数据可部分支撑机器人环境感知,机械臂操作、运动轨迹和精细动作仍需新数据来源。
推理存储的变化同样明显。华为在全联接大会上推出OceanStor M900,英伟达推出CMX Context Memory Storage,对推理中已产生、可能复用的KV Cache进行分层管理和存储,后续请求命中时减少重复计算。长期研究存储的学者章衡告诉雷峰网,KV Cache外置的核心逻辑是“以存换算”:命中率从90%提高到95%,需要重新计算的部分从10%降到5%,算力开销减少一半,但保存更多历史KV也会推高存储容量需求。某头部存储厂商负责人李辉说,DRAM既贵又缺,给SSD留下空间,但DRAM和SSD不是1比1替换,一些方案中可能达到1比5甚至1比10,按相同容量计算成本可相差数十倍。
独立KV存储设备已出现,专用SSD标准却没跟上。李辉说,行业开始讨论面向KV Cache负载优化的SSD,但采购端多数仍买普通企业级SSD;KV Cache给SSD带来的负载尚未摸清,有方案对耐写能力要求先从约3 DWPD提高到9 DWPD,指标仍可能反复变化。数据生命周期从分钟、小时到天、周不等,容量、耐久度和性能需求难以提前确定。他估算,行业形成较统一产品共识可能还需6至12个月,标准确定后开发、验证和优化还可能再花约1年。
KV Cache外置直接缓解的是DRAM负载压力,对HBM的缓解不那么直接。外部存储更多影响首Token延迟,一旦开始生成Token,后续速度仍依赖高速显存。AI芯片公司创始人顾淮告诉雷峰网,存算一体试图减少模型权重和当前数据的搬运开销,在Prefill阶段高并发下优势明显,同一组参数可服务多个请求;Decode阶段不同请求KV不完全相同,收益较弱。顾淮认为,存算一体不能替代历史KV Cache的存储需求,历史对话产生的大量KV仍需SSD等大容量介质保存。