2026年9月,高通在2026骁龙峰会发布两款2nm制程移动旗舰平台,其中第六代骁龙8超级至尊版面向智能体AI重新设计;同期,中科类脑在世界制造大会推出算电词元一体化平台,并在乌鲁木齐启动融合算力中心运营。两家公司分别从端侧计算平台和Token生产运营层切入AI基础设施。
据雷峰网报道,高通总裁兼CEO安蒙表示,行业正从以手机为中心转向以智能体为中心,手机、PC、眼镜、可穿戴设备和汽车都将成为智能体入口。高通技术公司高级副总裁兼手机业务总经理Chris Patrick说,单一标准已无法定义旗舰。两款平台共享多项核心技术,第六代骁龙8超级至尊版位于产品组合顶端,包括业界首个最高主频达5GHz的移动CPU、GPU首次加入Matrix Cores,以及可运行300亿参数MoE模型的NPU。
为解决端侧智能体内存墙,Oryon CPU引入Oryon FlexCache,让8个核心访问同一共享L2缓存池并动态分配资源,减少任务切换等待;Adreno GPU配备第二代18MB独立高速显存HPM,功耗降低12%;Hexagon NPU共享内存增加50%,支持最高32K Token上下文,部分模型预填充性能提升最高80%;平台采用LPDDR6内存和UFS 5.0闪存。传感器中枢双Micro NPU性能提升85%,功耗降低20%。
该平台由CPU负责规划智能体循环、管理控制流程、任务调度和数据移动,NPU运行主要模型,GPU中的Matrix Cores让AI进入图形管线,传感器中枢低功耗处理语音、活动和个人情境。Adreno GPU性能最高提升44%,能效最高提升40%。高通与阶跃、无量火、江波龙合作,将StepEdge-Omni 30B-MoE完整部署到手机端,模型运行内存需求较常规方案降低超过50%,预填充速度超过330 Token/s,解码速度超过28 Token/s,可在本地完成邮件理解、行程规划、日历同步、航班酒店推荐和邮件草拟;NPU与GPU双引擎协同的预填充吞吐性能比仅用NPU的通用方案提升超过30%。
据量子位报道,成立九年的中科类脑将体系称为算电协同型Token工厂,通过BitaHub彼塔云平台纳管英伟达、昇腾等异构算力,聚合模型API和Token服务,后台由决策大脑统筹电力、算力、Token三个子系统。公司合伙人、副总经理常峰称,一度工业用电采购价通常几毛钱,转化成算力后价值可能达几十元,进一步形成Token后部分模型每百万Token价格可超百元。平台已接入逾3000个算力节点,总规模超过5000P,累计服务超8万企业及科研用户。
中科类脑采用“1+3”架构,一个决策大脑连接算力、Token和电力子系统,先匹配算力、模型与任务,再加入电力信号优化。系统按监控、预测、决策运行,监测Token需求、集群负载、新能源发电功率、电价和每份算力Token产出效率。实时任务留在原地,可排队、可断续的批处理任务转移到电价低谷时段异地运行。异构芯片通过插件管理并建立能力画像;推理流水线将Prefill和Decode拆开,Prefill交给计算能力更强的芯片,Decode交给大显存、高吞吐芯片,KV Cache迁移连接两阶段。
一次跨上海、芜湖和乌鲁木齐的调度测试中,控制响应保持在200秒以内,跨域迁移成功率达到100%,能耗预测精度达到98%,为全国首个跨三地算电协同智能调度测试。9月17日,皖疆人工智能科技产业园在乌鲁木齐开园,按照“三中心一平台”布局建设,首个突破千P的融合算力中心已建成投运。在世界制造大会上,中科类脑推出算电词元一体化平台,延续“1+3”架构,以博弈智能决策大脑为中枢,打通算力、Token、电力三大子系统。
国家数据局披露,我国日均Token调用量从2024年初的1000亿增至2026年3月的140万亿,两年增长超过千倍;部分主流模型API累计降价超过90%。中科类脑以度电智能作为统一优化目标,通过异构调度与推理加速提升每度电产出的有效Token数量,再叠加电力协同压低单位Token成本,并把通用Token组织成场景结果按价值计价。公司称已在AI4S及能源领域形成可规模化商业闭环。中移基金2025年独家投资B轮,中车资本2026年领投数亿元B+轮,银杏谷、水木、启迪等跟投。
中科类脑CTO、研究院院长丁海松称,核心壁垒是对算电Token一体化的运营能力和理解,而非单项算力或电力能力。常峰判断,Token会因模型能力和任务价值不同拉开价格差距,科研智能体可串起读论文、实验设计、验证和论文生成,能源场景则依托央国企市场形成供给壁垒。