据 MarkTechPost 报道,AWS Strands Labs 发布了开源决策模型 Strands Decider 2B。该模型不生成文本,而是读取状态与带类型的问题,返回选项、是/否概率或分数,并附带校准后的置信度。

Strands Decider 2B 有19亿参数,可在本地 CPU、消费级 GPU 或 Apple silicon Mac 上运行。权重以 Apache-2.0 许可发布在 Hugging Face,执行 pip install strands-decider 可获得命令行界面和 HTTP 服务器。随附服务器绑定 127.0.0.1 且没有身份验证,生产环境需自行添加认证层,目前尚无托管推理提供商提供该模型。

决策模型也被称为 System One 模型。据该报道,TypeSafe AI 上月推出 Jev 后,这类模型形成类别。大型语言模型可产生任意输出,决策模型只在选项间选择或在量表上评分。Strands Decider 支持 choice、noul 和 score 三种问题类型,分别对应从 N 个选项中选 1 个、返回 0 到 1 之间的是/否概率、返回有序评分等级。每个答案都来自允许的选项并带有置信度。团队称该模型在复杂问题上不如推理模型,不适合编码、聊天或摘要。

架构上,团队从 Qwen3.5-2B-Base 出发,丢弃语言建模头,换成一个约100万参数的小型指针头。该头比较当前位置的隐藏状态与每个选项最后一个 token 的隐藏状态,一次前向传播即可得到结果,没有解码循环。主体使用 rank-16 LoRA,指针头以 fp32 运行。标签集来自请求,选项数量没有上限。发布检查点为 v19。对同一段文本提出多个问题成本较低,状态只读取一次,每个额外问题只增加自身 token。

团队在 JevBench 公开集上测量准确率与校准。v19 公开准确率为0.723,即231项任务中答对167项;Brier 分数0.342,预期校准误差0.052。分层准确率为 easy 1.000、standard 0.875、hard 0.505。RTX 3090 上延迟中位数115毫秒,p95为299毫秒;M3 Pro 上300 token 以内热启动中位延迟153毫秒。9月25日 v1.4.2 榜单上,v19 在2B类别33个模型中排名第3,排除3个略高于2B的模型后,在30个模型中排名第1。

仓库标出提醒,Mapika 较新的 decider-2b v11 在 Strands 测试框架上答对231题中的175题,比 v19 多8题。截至撰写时,Strands Decider 未出现在更新的 v1.5.4 综合榜单。校准是实际优势,在未见的短分类任务中,置信度0.9及以上的答案约95%正确,团队建议低于该阈值时确认或升级处理。

在同一 JevBench v1.4.2 榜单上,Mapika 的 decider-2b 公开准确率为0.710,FlyMy.AI 的 Decision 2B 为0.753,Jev 未出现在来源表格。报告中的延迟来自不同硬件和测试框架,不能直接比较。Mapika 和 FlyMy.AI 的模型也开放代码或权重,Jev 则是闭源托管 API。

团队称该模型在模型路由、工具选择、参数检查、分诊、护栏、评估和混合代理中有初步成功。混合代理中,大型语言模型负责困难判断,决策模型处理常规判断。仓库示例在 Strands 代理内门控天气工具调用,before_tool_call 干预提出两个是/否问题:参数是否基于用户所说内容,现在调用是否过早;如果代理猜测城市,它会询问用户。命令行示例将“Help! My payouts have been failing for 3 days!”在 billing、sales 和 retail 之间路由时,以0.768置信度选择 billing。