据科技媒体MarkTechPost报道,来自加州大学伯克利分校和得克萨斯大学奥斯汀分校的研究团队提出了一款名为FreeToken的边缘原生MoE(混合专家)推理引擎,可让参数规模达753B的GLM-5.2模型在单张工作站显卡上运行,从而大幅降低前沿开源模型的本地部署门槛。
研究团队认为,当前开源模型虽然缩小了与闭源系统的能力差距,但其服务仍依赖数据中心级GPU集群,个人开发者和小团队难以负担。与此同时,超过一亿台消费级设备已配备独立GPU。FreeToken将个人电脑视为统一的弹性推理平台,持续将计算和模型状态映射到实际拥有的GPU、CPU、内存及互连带宽上。
FreeToken目前已在GitHub上以Apache-2.0开源,并发布为PyPI包freetoken v0.1.2,同时提供Windows和Linux一键桌面应用。其CLI支持NVIDIA GPU,驱动器需r580+(CUDA 13)以上。ft serve命令可暴露OpenAI和Anthropic兼容端点,ft launch claude可将Claude Code、Codex等工具连接到本机。
该引擎针对混合专家模型设计。例如DeepSeek-V4-Flash在43层中共有256个路由专家,但每次仅激活6个,单token推理只需13B参数参与。不过全部专家在FP4下约140GB,因此空闲专家需驻留主机内存。现有引擎在预填充阶段会破坏稀疏性,导致整个专家池流经PCIe,产生数秒延迟;静态放置又无法适应动态路由,而消费级CPU内存带宽远低于GPU显存带宽。
FreeToken通过三项机制解决上述问题。带宽自适应执行根据实测PCIe与主机内存带宽比例,将部分专家预取至GPU缓存,其余在CPU上原位计算,最终结果精确合并;语义感知缓存在预填充阶段采用全层双缓冲,并将循环状态检查点锚定在思维块、工具调用等特殊token边界,解码时使用跨所有MoE层的共享LRU专家缓存;弹性内存管理允许在不重启引擎的情况下,于调度安全点按新显存预算重建GPU专家缓存。
性能测试显示,在RTX 5090上,FreeToken对Qwen3.6-35B-A3B(BF16)维持77至83 token/s,对DeepSeek-V4-Flash(MXFP4)为22至25 token/s,较最强基线快1.5至2.3倍。在三种agent任务中,解码速度保持在单轮速率的12%以内;最差首token延迟始终低于44秒,而llama.cpp、Ollama和KTransformers某些场景分别达到232秒、179秒和946秒。该引擎最适用于医疗、法律、国防、金融等对数据隐私要求高的领域。