据MarkTechPost报道,Liquid AI于2026年9月25日发布LFM2.5-VL-3B-DSpark,这是面向LFM2.5-VL-3B视觉语言模型的实验性推测解码草稿模型。它新增约2.795亿参数,在不改变输出前提下,在Apple silicon上最高实现3.13倍解码提速,在NVIDIA H100上最高2.66倍。
Liquid AI称,权重已在Hugging Face以Safetensors和GGUF格式上线,并在SGLang、MLX-VLM和llama.cpp获得首日支持。该版本采用LFM Open License v1.0,仅允许年收入低于1000万美元的公司免费商用。
推测解码流程中,目标模型每轮前向生成一个token,小型草稿模型先提出若干token,目标模型再一次性检查候选块并保留认可部分。DSpark延续Liquid AI文本模型DSpark草稿器方案,读取目标模型多个层的隐藏状态并预测后续k个token。Liquid AI表示,草稿器不关心模态,因为token进入隐藏层后,文本和图像块都只是张量,视觉语言模型可直接复用同一套推理算法。
草稿器为简化后的纯注意力模型,消融实验选定4层和块大小9,推理时建议块大小8或9,Apple silicon使用8。其总参数为279.5M,嵌入和LM头与目标模型绑定,部署参数增加8.9%。训练使用覆盖常见视觉语言任务的监督微调数据,进行10个epoch,消融与训练均在AMD硬件上完成。
评估遵循MMSpec基准,覆盖通用VQA、文本VQA、图像描述、图表VQA、复杂推理和多轮对话6类任务。所有运行使用批量大小1、温度0和16位权重,数据由Liquid AI的公开设备基准设施Pipette采集。MLX-VLM在M5 Max MacBook Pro上使用块大小8,解码提速2.30倍至3.13倍,端到端提速1.56倍至2.62倍;llama.cpp在M3 Ultra上解码提速1.57倍至2.14倍,端到端提速1.30倍至1.77倍;SGLang在单张H100 80GB上使用块大小9,解码提速2.04倍至2.66倍,端到端提速1.64倍至2.27倍。每次通过接受token数分别为3.24至4.34、3.31至4.50和3.46至4.57。Liquid AI指出,“最高”解码和端到端数字常来自不同任务,例如M5 Max上3.13倍解码来自COCO图像描述,2.62倍端到端来自MMMU-Pro。
在更高并发下,DSpark在SGLang单张H100上的每个测量级别都保持吞吐优势,但差距随并发上升而缩小。贪心解码下,目标模型验证每个提议token,输出与基础模型相同;非零温度和匹配采样下,推测解码保留目标模型输出分布。温度越高,概率越分散,草稿器与目标模型越容易不一致,Liquid AI测试中接受率和吞吐随之下降。
端到端增益在边缘设备上较小,因为推测解码只加速解码,图像编码和预填充速度不变。视觉语言模型必须先编码图像,再处理数百个视觉token,算力低于数据中心GPU的边缘设备上预填充占延迟比例更大。Liquid AI用Amdahl定律解释,总提速受未加速部分限制。例如M5 Max上的TextVQA解码快2.69倍,端到端只有1.56倍。运行方面,SGLang需v0.5.19或更新版本,启动LiquidAI/LFM2.5-VL-3B时使用--speculative-algorithm DSPARK并指向草稿模型路径;Apple silicon上MLX-VLM v0.7.2或更新版本可通过--draft-model加载,目前仅支持贪心采样;llama.cpp需将GGUF草稿器与LFM2.5-VL-3B-GGUF目标模型配对。集成工作已在三个项目的拉取请求中公开,该版本不涵盖量化模型加速。