据雷峰网报道,Cursor近期开源了名为Mixture-of-Kittens(MoK)的GPU内核,Meta于8月27日发布了面向本地Agent的多模态模型Muse Glimmer。前者通过重写MoE执行方式,将大规模混合专家模型训练中的通信延迟从103微秒降至18微秒;后者以约30B参数和128K上下文支持在24GB显存设备上运行长期Agent任务。
Cursor开源的MoK没有追求更快的矩阵乘法,而是把token调度、跨GPU通信和专家计算整合进同一个GPU内核。在MoE训练中,token需要跨卡发送到专家所在的GPU,算完再传回,通信过程还伴随布局生成、同步和负载均衡等开销。即使GB300 NVL72整机架NVLink带宽达到130TB/s,动态、零碎的MoE通信仍会拖慢计算。MoK将前向Dispatch从Push改为Pull,由目标GPU主动读取所需token,免去发送方之间的地址协调。在多节点微基准中,signaling延迟从约103微秒降至18微秒,NVLink利用率最高提升29%。同时,MoK将通信与专家计算放进同一个Megakernel,通过minibatch控制计算节奏,并使用Ring Token Buffer避免CPU反复介入。在512张GB300 GPU上,MoK使单卡吞吐从每秒760.9个token提高到1070.2个,提升约41%。这套设计依赖Blackwell和NVL72的低延迟显存访问,属于高度特化的执行方式。
Meta的Muse Glimmer是一款约30B参数的多模态Agent模型,支持128K上下文,能调用工具、执行代码、处理图片和屏幕信息,采用Apache 2.0许可证开放。其架构为52层Dense Transformer,Hidden Size为6656,但只有2个KV Head,并采用三个Local Attention接一个Global Attention的循环。这样每层KV Cache很小,39个Local层只维护2048 token的滑动窗口,理论KV Cache可从传统方案的20多GiB降至约1.7GiB。配合4bit量化,K Quant版本权重约16.8GB,加上视觉模块和DFlash共接近20GB,可装入24GB显存。另一套Dynamic K Quant约20GB面向32GB设备,精度损失约0.2%,24GB版本精度损失约1.0%。模型还配有约1.8B参数的ViT G 14视觉编码器,将截图转换为最多4096个视觉token。
在训练上,Muse Glimmer从更大的Muse Spark蒸馏而来,使用Logit Distillation学习教师模型对候选动作的偏好,并通过On Policy Distillation覆盖学生自己会犯的错误状态,以提升失败恢复能力。推理方面,DFlash使用Block Diffusion并行预测16个token,并读取主模型5个层的隐藏特征,以减少自回归解码步数。Meta在OSWorld Verified等评测中并未无限保留截图历史,说明128K上下文仍需配合Agent Runtime进行状态管理。
这两项工作分别从算力优化和模型设计两个方向回应了大规模AI系统的瓶颈:硬件速度提升之后,软件编排和运行效率成为新的关键。