10月1日,AWS旗下Strands Labs发布开源决策模型Strands Decider 2B,面向代理式人工智能工作流。该模型不生成文本,而是直接在一组预定义选项中作出选择并给出置信度,可在本地电脑或公有云环境运行,AWS希望借此加快代理式AI开发。
决策模型也被称为“System 1模型”。据SiliconANGLE报道,与大语言模型输出文本、代码、图像或视频不同,决策模型只对预设选项作出决定,不产生其他输出;每个决定附带置信度评分,帮助使用者判断结果可能有多准确。省略文本生成使其速度和延迟占优,但也意味着模型无法解释自己的决定,置信度评分因此更关键。
Strands Decider 2B基于Qwen3.5-2B的基础躯干构建,AWS将传统“LLM头”替换为约100万参数的定制“指针头”,并使用rank-16 LoRA适配器微调,让隐藏状态直接对可用选项的答案位置打分。AWS称反复迭代后,此次发布版本名为v.20。该公司称,2B规模足以在本地机器上以低于150毫秒的延迟运行,同时仍能处理复杂决策。在JevBench基准上,其准确性和校准表现与其他开源2B模型相比处于高水平。该模型已可通过Hugging Face下载,完整代码库、训练脚本和示例发布在GitHub。
据TechCrunch报道,该项目由AWS杰出工程师Marc Brooker在看到TypeSafe的Jev后发起,他尝试自建同类模型,一度在Jevbench同规模模型排名中升至第一,随后AWS工程师将其整理,由Strands Labs发布。布鲁克对TechCrunch说,这类模型最适合充当工作流中的一个“决策器”,回答“基于当前位置,下一步该做什么”。他表示,由于有置信度评分、答案范围封闭,这种工作流步骤更可靠,延迟更低,成本也可能更低。
TypeSafe AI此前发布Jev,决策模型由此获得更多关注。TechCrunch称,AWS此次发布与OpenAI宣布类似产品处于同一周,自TypeSafe提出这一思路后,研究者已产出数十个类似模型。SiliconANGLE报道,AWS团队认为Jev的并行输出结构在执行复杂推理时存在性能问题,因此尝试改进。TechCrunch则将Strands Decider 2B称为受Jev启发、由亚马逊发布的开源决策模型。
布鲁克对TechCrunch表示,挑战在于优化模型的快速决策能力,同时不损害其智能。他说,需要在准确性、校准表现与语言理解、知识保有之间找到平衡,这些能力使其保持通用、有趣和有用。他并不认为前沿实验室一定会主导这一领域,因为市场规模较小,构建有趣产品的成本可能只有数百或数千美元。
TypeSafe首席执行官Diogo Almeida对TechCrunch表示,公司正专注于改进未来模型。他说:“我理解人们认为这是一场淘金热,但他们可能低估了让模型真正变聪明的难度。”他还说,当前一批模型更像是机器学习人员想实现一种很酷的架构,而不是一支深度致力于让智能变得有用的团队。TechCrunch称,Almeida目前尚未看到公司面临真正的竞争。
AWS希望AI开发者社区试用Strands Decider 2B,以加速模型路由、工具选择、上下文管理、护栏执行和政策分类等代理任务。该公司表示,这也为“混合代理”铺路,即用决策模型处理简单重复选择,用大语言模型处理复杂推理。