据Hugging Face博客消息,Liquid AI发布面向边缘与GPU推理的开源d1决策模型,其中d1-3B在Decision Index 0.2.1的10B以下模型中排名第一,得分48.57,超过所有4B和9B模型以及Decider 35B-A3B的47.11。
该系列模型基于Liquid Foundation Models(LFMs)。与生成模型不同,决策模型不生成token,而是在单次前向传播中给出答案。d1-3B支持文本和图像输入;d1-omni-600M支持文本与图像,或文本与音频输入。
d1-3B与d1-omni-600M分别从两个差异较大的骨干网络训练而来。d1-3B由LFM2.5-VL-3B训练,后者是较新的视觉语言模型,采用仅解码器架构,接受文本和图像输入。d1-omni-600M由LFM2.5-Encoder-350M训练,后者是双向编码器,并增加视觉和音频编码器以处理三种模态。该模型目前处于早期研究发布阶段,仍在进一步开发。
该博客称,d1-3B与d1-omni-600M在七个公开数据集上进行了评测,覆盖阅读理解、毒性检测、意图分类、医疗问答和跨语言理解。d1-3B平均得分82.9,为表中最高,高于Decider 4B的81.1;d1-omni-600M得分78.4,以约四分之一参数量超过Decider 2B的77.1。具体而言,d1-3B在SQuAD 2.0得83.3,高于Decider 4B的76.0;在PubMedQA得68.3,高于Decider 4B的63.3;在PAWS-X得76.4,高于Decider 4B的69.8;但在MASSIVE intent得86.9,低于Decider 4B的88.3;在BoolQ得86.3,低于Decider 4B的89.0;在XNLI得85.6,低于Decider 4B的88.6。d1-omni-600M在Civil Comments得95.8,高于d1-3B的93.3。
该博客还表示,已验证d1-3B保留其LFM2.5-VL-3B骨干的标准视觉能力,d1-omni-600M可处理文本、图像和音频三种模态。由于Decision Index v0.3仅包含私有视觉分片,音频决策基准目前仍是开放问题,因此未报告视觉或音频基准成绩。
在与NVIDIA合作中,d1-3B在NVIDIA GeForce RTX 4090、Jetson AGX Thor、Jetson AGX Orin 64GB和Jetson Orin Nano上完成评估。边缘推理中,d1-3B在每个测量设备上回答单个问题均低于50毫秒:Jetson AGX Thor为16毫秒,Jetson AGX Orin 64GB为26毫秒,Jetson Orin Nano为50毫秒,Apple M5 Pro为30毫秒。三个问题耗时约为一个问题的1.3倍,AGX Thor从16毫秒增至20毫秒。GPU推理中,d1-3B在NVIDIA RTX 4090和AMD MI325X上回答单个问题均低于10毫秒,处理384px图像均低于18毫秒;RTX 4090单问题8毫秒、三个问题21毫秒,MI325X单问题9毫秒、三个问题14毫秒。由于d1-omni-600M是早期研究发布,本次未报告其速度数据。
该博客称,当需要快速、结构化决策并支持多模态输入时,可使用d1决策模型;d1-3B在同尺寸下提供最高决策质量,d1-omni-600M适合对占用空间敏感的场景。