据爱范儿报道,联想与英伟达在柏林IFA 2026发布可本地运行1200亿参数大模型的Windows笔记本Yoga Pro 9n;AMD在同一展会推出统一内存最高192GB的个人AI新平台;华为9月7日在秋季发布会上推出能端侧运行30B参数MoE模型的折叠屏手机Mate XT 2。个人设备开始承载原本需要云端的千亿级模型推理。
联想Yoga Pro 9n(国内型号YOGA Pro 15 Spark)重1.65千克,最薄16.7毫米,搭载NVIDIA RTX Spark超级芯片。该芯片通过NVLink-C2C互联,将20核NVIDIA Grace CPU与6144个CUDA核心的Blackwell RTX GPU整合,提供1 PFLOPS(FP4精度)AI性能,最高可选128GB统一内存。英伟达对RTX Spark的规格说明显示,这套配置可本地运行1200亿参数、上下文最长100万token的大语言模型,这使Yoga Pro 9n成为一款可本地运行千亿级模型的量产Windows笔记本。
统一内存是这类产品的关键。传统PC中CPU内存与GPU显存相互独立,消费级显卡的显存容量往往只有十几到二十几GB,容纳不了千亿参数模型;统一内存让CPU和GPU共享同一物理内存池,模型参数只需保存一份,128GB容量才得以装下千亿级模型。此前苹果Mac已通过统一内存和Thunderbolt集群展示了本地运行大模型的能力,联想与英伟达的组合将类似能力带到Windows和CUDA生态,开发者可沿用CUDA工具链,数据无需上传云端。
AMD在同一展会的开幕演讲中把个人AI作为核心方向。高级副总裁Jack Huynh认为,电脑应先处理本地能完成的工作,涉及敏感数据和上下文的任务留在设备端,需要更大规模算力时再调用云端。新发布的Ryzen AI Max 400系列平台(代号Gorgon Halo)统一内存最高192GB,可本地运行3000亿参数模型;现场展示的Threadripper Halo Station工作站配备96核Threadripper PRO和两张Instinct MI350P加速卡,系统内存最高2TB,可运行超过1万亿参数的模型。AMD给出的成本对比显示,一个活跃用户每天1500万输出token走云端约300欧元,一年接近10万欧元。Jack Huynh说,“AI是新的电力”,但“我们不能只是花更多钱,必须算得更聪明”。
AMD用开源模型作为新平台的验证:智谱GLM-5.3-Flash拥有3200亿总参数,可在Gorgon Halo上本地运行;阿里1250亿参数模型Qwen3.8-Flash-Next也在该平台完成现场演示。微软方面表示,Windows正在为统一内存访问和工作负载调度做适配,并宣布面向开发者硬件的Project Zenith将率先随Ryzen AI Halo设备提供。联想在IFA期间还发布ThinkCentre X Ultra(国内型号ThinkCentre X Tiny),1.6升机身内搭载AMD锐龙AI Max+ PRO 495系列处理器,最高128GB统一内存,最多四台可组成集群。
华为Mate XT 2搭载麒麟9050 Pro芯片,该芯片以“逻辑折叠”(LogicFolding)立体堆叠计算单元,使Mate XT 2整机性能比Mate XTs提升42%,并能在端侧运行30B参数的MoE模型。HarmonyOS 7将小艺升级为跨应用意图调度,用户说清意图后,系统可自动联动日历、地图或表格。