据MarkTechPost报道,2026年10月10日,Nace.AI开源决策模型Drex 1.5,微软发布Microsoft-Decision-1。两者均基于Qwen 3.5 9B系列,不生成文本,而是读取状态和问题后为固定选项输出概率,面向智能体、路由、分类、验证和后端工作流。

Drex 1.5为8.95B参数稠密模型,bf16权重约18GB,默认上下文16384 tokens,最高131072。它支持choice、noul(是/否)和ordinal score三类问题,不采样token,只能回答用户提供的选项,服务POST /v1/systemone API,Nace称现有Jev客户端修改少量环境变量后即可使用。其骨干是蒸馏版Qwen 3.5 9B,有32层混合注意力,另有指针头为选项打分。Nace称模型在官方基准训练集上训练,仅在留出集评估。

在公开Decision Index 0.3.1上,Drex 1.5得58.08,Jev得57.96,Bespoke Nimble 9B v3得57.19。Drex在37项基准中的20项领先Jev,工具项75.0最高,知识与推理项44.6最弱。JevBench的231个公开项目上,Drex得86.2%,Jev得87.0%。长文档是强项:8K至32K tokens准确率89.5%,32K至128K为93.4%;截断到8K后降至76.5%和78%。其弱点是知识和细粒度情感:GPQA Diamond为45.4%,Jev为78.6%;MMLU-Pro为58.7%,Jev为82.7%。Drex不能生成文本、代码或解释。

Drex可通过Python Kev、llama.cpp、Ollama或托管API部署。Nace在A10G 24GB上测试bf16和Q8_0得到相同答案,约9.5GB的Q8_0 GGUF也能在Apple M5 Pro的Metal和CPU上运行。OpenRouter标价为每百万输入tokens 0.04美元,输出免费,由DeepInfra提供。

微软方面,Microsoft-Decision-1基于Qwen3.5-9B后训练,参数规模未披露,上下文32768 tokens,仅通过Microsoft Foundry和OpenRouter等托管API提供,无开放权重。它支持是/否、多选、评分、分类和评分量规问题,可用于评估AI回答和智能体动作、依据证据做事实核查,以及设置“无法判断”等弃权选项,输出JSON。微软称其使用公开数据集和合成数据训练。

微软在36项基准、147137个问题上比较9个系统,称Microsoft-Decision-1平均准确率最高,为83.5%,高于Quyet-1.0-Large的81.9%;p50延迟85毫秒,p95延迟125毫秒,比Quyet快4.5倍,比GPT-6 Sol快35倍;校准分数92.2,仅次于Quyet的93.1。每请求做8种扰动,模型平均仅1.3%决策翻转,选项改写、反转或打乱时翻转为零。价格为每百万输入tokens 0.042美元,输出免费,模型卡明确其不适用于文本生成、开放式问答、聊天、翻译或摘要。

开发者需通过Foundry的Direct from Azure或OpenRouter的Decisions API调用,聊天补全SDK无法使用。延迟对比存在争议:微软图表中竞争对手数据来自JevBench v1.6.1调整后中位数,H2O.ai称该调整将实测时间翻倍并增加0.15秒,H2O-Lightning-4B实测中位数为29毫秒而非210毫秒。Microsoft-Decision-1未出现在JevBench榜单;该榜单官方综合分中,H2O-Lightning-4B以72.5排名第一。