据量子位9月26日报道,大模型推理领域出现两项进展:推理创业公司Inferact用16块谷歌TPU v7运行Kimi K3,跑出每秒709个token,比同数量英伟达GB200的每秒452个快57%;开源项目Colibrì则把SSD纳入内存层级,在最低16GB、推荐约24GB内存的机器上运行744B参数的GLM-5.2,并已支持2.8T参数的Kimi K3。

据量子位报道,Inferact用16块TPU v7 Ironwood对阵16块英伟达GB200,双方都跑Kimi K3、都用vLLM推理引擎。TPU每秒709个token,GB200每秒452个,快57%。成绩包含DeepSeek提出的DSpark推测解码框架,Inferact在TPU上acceptance length达6,单步decode约8.5毫秒。关闭推测解码后,batch size为1时TPU每秒249个token、GB200为127个;batch size为8时分别为865个和636个。Inferact用greedy decoding验证,Kimi K3在TPU上的GPQA-Diamond得分94.4%、GSM8K得分97.2%,与GPU一致。TPU v7的HBM带宽为7380 GB/s,GB200为8000 GB/s,带宽更高的GB200速度反而更低。

Inferact将差距归因于软件。其megakernel把推理时原本调度的几百个独立小程序合并成一个大程序,消除切换时的带宽空转。Kimi K3有92层MoE计算,团队把92层逻辑放进一个Pallas程序,一次调用完成前向传播,并在第N层计算时预取第N+1层权重。TPU v7每个TensorCore带64 MiB VMEM,由软件管理,可同时容纳当前层数据和下一层预取权重。团队绕过XLA,用Pallas手写内核,编译时间从30分钟以上降至不到90秒。该内核目前针对Kimi K3定制。

据量子位报道,代码已开源,tpu-megakernels是Inferact与Google Cloud联合工程合作的首个公开成果,目标是让TPU成为vLLM的一流支持对象。Inferact创始团队来自vLLM,今年完成1.5亿美元种子轮融资,估值8亿美元。

开源项目Colibrì从存储端降低门槛。据量子位报道,这一纯C实现、零引擎依赖的分层推理框架已在GitHub获得32k Star,最早目标是让744B参数的GLM-5.2在消费级电脑上运行。它不把模型全部装入内存,而是把暂时用不到的专家权重放在NVMe SSD中,需要时再读取。GLM-5.2经int4处理后权重约372GB,可在最低16GB、推荐约24GB RAM的机器上运行,GPU并非必需。GLM-5.2总参数744B,但每个token实际激活约40B;Attention、Embedding、共享专家等Dense部分约17B参数,int4后约9.9GB常驻RAM,19456个路由专家int4后约370GB放入SSD。Router先选出当前需要的专家,未命中的才从SSD临时读取。

据量子位报道,Colibrì把VRAM、RAM和NVMe SSD组织成分层内存系统,加入LRU缓存并记录专家使用次数,高频专家留在更快存储层。它还根据相邻层专家路由相关性预取下一层专家,可预测性为71.6%,将计算与SSD I/O重叠。目前它覆盖9个模型家族,包括GLM-5.2/5.3、DeepSeek V4 Flash、Qwen、975B的Inkling和2.8T参数的Kimi K3;Kimi K3权重需约1.6TB存储,RAM从32GB起步。速度上,12核CPU加25GB RAM开发机冷缓存约0.05至0.1 token/s,128GB RAM纯CPU桌面机约1.8 token/s,6张RTX 5090让专家常驻高速层时解码5.8至6.8 token/s。Colibrì提供Linux、macOS和Windows预编译版本。