9月16日,据量子位和爱范儿报道,英特尔、杭州力文所、蚂蚁灵波和高通分别披露AI系统新进展:英特尔公布KV Cache分层卸载与QAT压缩方案,力文所发布蛋白质设计Agent,蚂蚁灵波CEO朱兴在2026外滩大会谈机器人落地,高通介绍面向AI智能体手机的近存计算与芯片分工。这些进展分别涉及大模型推理缓存、蛋白质设计工作流、具身智能数据采集和终端芯片异构计算。

据量子位报道,英特尔围绕大模型推理中的KV Cache提出KV Shrink等四个技术方向,其中KV Shrink已有实现和测试披露。该方案把KV Cache分层管理与QAT硬件压缩结合,内存吃紧时可将较冷数据转存到SSD等下一层介质。英特尔称,重新排列KV Cache存储格式后,压缩节省空间从原先的10%以上增加到20%以上,空间降幅约为20%至30%,且采用无损压缩。在80%缓存命中率下,使用L20 GPU和Qwen3-32B模型的测试中,相较未开启分层卸载的原生vLLM基线,KV Shrink在测试覆盖的输入长度和并发组合中,TTFT最高获得约5倍加速。QAT硬件压缩整体性能约为CPU软件压缩方案的两倍;开启QAT压缩带来的额外TTFT开销低于10%。英特尔与道客联合实验室采用八张H800和Qwen3-32B FP8模型测试,相较LMCache方案,KV Shrink单路负载平均TTFT由129.81毫秒降至114.13毫秒,降幅约12.1%;八路并发降幅约4.6%。

量子位还报道,杭州AI蛋白质设计公司力文所发布Lévin™ Harness,面向科研社区开放使用,目前支持搭载Apple芯片的Mac。该产品把数据、模型、插件工具、算力和工作流放入同一Agent工作区,用户可用自然语言描述需求,通用大模型负责任务理解与规划,专业科学模型和分析工具承担蛋白质结构预测、序列设计等计算。Lévin™ Harness不绑定特定模型,新能力可通过插件加入,跑通的研究方法可沉淀为Workflow复用。力文所自研的Pallatom曾入选ICML 2025 Spotlight,并被英伟达官网收录为代表性蛋白质基础模型。

据爱范儿报道,蚂蚁灵波CEO朱兴在2026外滩大会期间表示,机器人落地仍受能力和成本制约,小卖部等场景也不容易落地。灵波把重心放在具身“大脑”上,希望同一套基础模型适配不同构型、不同任务,再通过后训练降低使用门槛。朱兴称,当前模型仍处冷启动阶段,主流可落地产品基本以模仿学习为主,最怕异常,任务不能太长程。灵波已转向定制化采集,内部数据可用率从约15%提升到90%以上,并与供应商采用流式交付。他认为“今天的机器人还吃不了粗粮”。

高通方面,据爱范儿报道,高通推出高带宽计算技术HBC,将计算放到内存旁边,减少数据搬运。下一代骁龙旗舰的Qualcomm Oryon CPU最高主频达5GHz,并采用Qualcomm Oryon FlexCache可扩展缓存架构;Adreno GPU加入Adreno Matrix Cores,Hexagon NPU新增Element Accelerator,共享内存最高扩容50%,并引入混合专家MoE架构,使30B MoE模型在NPU上每次生成一个词元仅激活约30亿个参数。高通称,AI智能体手机需要CPU、GPU、NPU、缓存和内存围绕Agent重新分工。