据 Hugging Face 博客,LFM2.5-VL-DSpark 于 2026 年 9 月 24 日发布,这是面向 LFM2.5-VL-3B 视觉语言模型的推测解码草稿模型,设备端解码最高提速 3.13 倍,H100 上最高提速 2.66 倍,端到端最高分别提升 2.62 倍和 2.27 倍,首日支持 llama.cpp、MLX-VLM 和 SGLang。

该视觉草稿模型与文本 LFM2.5-DSpark 草稿模型采用相同架构。它在固定的一组抽取层捕获目标模型的隐藏状态,并以此为条件草拟一个包含 k 个候选 token 的块。图像 patch 和文本 token 在这些层之前被投影到共享表示,因此草稿模型无论输入何种模态,处理的是维度相同的隐藏状态向量,推理算法也与文本模型一致。草稿模型增加约 2.795 亿参数,在 3B 目标模型上仅增加 8.9%。

训练沿用 DSpark 方案,使用混合视觉语言监督微调数据,并偏向预期服务的工作负载。基于 3 层、4 层和 5 层的消融结果,草稿模型被确定为仅注意力的四层结构,块大小为 9。最终混合数据训练了 10 个 epoch,每轮测量接受率;接受率随训练 token 增加而提升,之后收益递减。推理时,博客建议根据硬件使用 8 或 9 的块大小。参数构成方面,四层解码器栈为 1.93 亿参数,隐藏状态投影为 2100 万参数,马尔可夫头为 6550 万参数,归一化与置信头为 6400 个参数,总计约 2.795 亿参数。

博客测算了设备端推理和 GPU 推理,两种配置都使用 DSpark 块大小 8,并遵循 MMSpec 基准在六类视觉任务上评估,包括通用视觉问答、文本视觉问答、图像描述、图表视觉问答、复杂推理和多轮对话。在设备端,M5 Max 上使用 MLX 时,解码按任务提速 2.30 倍至 3.13 倍,端到端延迟改善 1.56 倍至 2.62 倍;M3 Ultra 上使用 llama.cpp 时,解码提速 1.57 倍至 2.14 倍,端到端改善 1.30 倍至 1.77 倍。在 H100 上,同一草稿模型带来 2.66 倍至 20.4 倍的解码提速,端到端改善 1.64 倍至 2.27 倍。

博客解释,大语言模型的预填充主要受计算限制,其成本随提示长度呈次二次增长。视觉语言模型还增加了一层开销,因为图像先经过视觉编码器,语言主干随后要处理数百个视觉 token 以及文本提示。边缘设备算力远低于数据中心 GPU,预填充在端到端延迟中占比更高,Apple 芯片和 H100 上的首 token 时间与解码测量反映了这一点,M5 的每核 GPU 神经加速器缩小了这一差距。推测解码只加速解码,不加速视觉编码或预填充;当这些阶段已占据大部分时间时,即使解码大幅提速,端到端收益也有限,这符合阿姆达尔定律。

运行支持方面,SGLang 需要支持 LFM2 目标 DSpark 的构建版本,对应 PR #40651;llama.cpp 使用对应构建版本 PR #29339;MLX-VLM 使用对应构建版本 PR #2280。SGLang 从草稿模型的 config.json 读取块大小,基线为移除三个 --speculative-* 标志的同一命令。MLX-VLM 从旁车元数据读取块大小,n-max 会被钳制。推测解码是精确的:目标模型会验证每个提议 token,因此贪婪输出与单独运行目标模型相同,每响应时间会报告 draft_n 和 draft_n_accepted。模型已在 Hugging Face 以 Safetensors 和 GGUF 格式提供。

博客称,LFM2.5 旨在实现随处运行的 AI。相关模型为开放权重,可下载、微调和部署,且无限制;从第一天起支持 llama.cpp、MLX 和 SGLang;并构成完整家族,从可定制的基础模型到专用音频和视觉变体,采用同一架构。