据MarkTechPost报道,Liquid AI于2026年10月7日发布开放权重多模态决策模型d1-3B和d1-omni-600M,属于d1决策模型系列。两款模型不生成文本,而是在一次前向传播中返回校准后的类型化答案,输出Token数为零,面向NVIDIA的DGX服务器、RTX工作站和Jetson边缘板执行实时决策。
两款检查点已上架Hugging Face,可通过Transformers加载,并在发布首日获得llama.cpp支持。LFM Open License v1.0允许年收入低于1000万美元的商业免费使用。d1-omni-600M是早期研究版本,尚未公布延迟数据。
决策模型与生成式LLM不同:后者逐Token写出答案,再由代码解析;前者接收一个状态和一组命名问题,一次读取后返回每个允许答案的概率。Liquid AI定义了三类问题:noul是是否问题,返回P(yes);choice从命名选项中选出一个标签并给出完整概率分布;score在2至10级有序评分表上给出概率加权位置。多个问题可在一次调用中共享同一状态,每个响应都报告output_tokens: 0。Liquid AI推荐d1用于路由、审核、意图分类、重排序、LLM-as-a-judge评分、智能体护栏和视觉检查,两款检查点都不是聊天模型。
d1-3B有31.2亿参数,从LFM2.5-VL-3B出发,采用4亿参数的SigLIP2 NaFlex视觉编码器和32768 Token上下文,可读取文本和图像。d1-omni-600M有5.87亿参数,从LFM2.5-Encoder-350M双向编码器出发,包含3.81亿共享主干和决策头、9400万视觉编码器、1.12亿音频编码器;音频编码器为17层FastConformer,上下文16384 Token,音频片段上限30秒。一个请求只携带图像或音频,不会同时携带两者,音频训练仅覆盖英语说话者到助手的请求。
在应用上,d1-3B可在一次调用中完成退款是否通过、选择负责团队和评定紧急程度;在Jetson AGX Thor上读取384像素图像需35毫秒,Open d1 Arcade将其逐帧运行在实时摄像头输入上,用于内容审核和手势控制。d1-omni-600M可接收最长30秒语音与文本,直接返回说话者意图或主题,用于小设备语音命令路由和智能体护栏。
在Decision Index v0.2.1上,d1-3B得分48.57,超过所有小于100亿参数的模型,并以微弱优势领先Decider 35B-A3B的47.11,仅低于Winnow-12B的50.02。Liquid AI自行运行官方评分器,因此这些分数不是排行榜提交。在七个公开文本基准上,d1-3B平均82.9,高于Decider 4B的81.1;d1-omni-600M平均78.4,Civil Comments得95.8,PAWS-X得79.5。在11个图像基准上,d1-3B平均74.1,基础模型为73.9。Liquid AI称音频决策基准仍是开放问题。
Liquid AI测量了d1-3B在NVIDIA硬件上的端到端延迟,每次一个预热请求。一个问题在RTX 4090上需8毫秒,在AMD MI325X上需9毫秒;在Jetson上,AGX Thor需16毫秒,AGX Orin需26毫秒,Orin Nano需50毫秒。在Jetson AGX Thor上,对同一状态提出三个问题需20毫秒,一个问题需16毫秒。RTX 4090的8毫秒数据使用model.compile(mode="reduce-overhead"),不启用时一个问题需16毫秒。
对比其他开放决策模型,d1-3B和d1-omni-600M采用LFM Open v1.0许可,Decider 4B、Decider 35B-A3B和Winnow-12B采用Apache 2.0;Decision Index得分分别为48.57、15.95、40.70、47.11和50.02。