据MarkTechPost报道,Fastino Labs发布GLiNER2.5-Decide,一个340M参数的开源决策模型。该模型接收文本和带类型问题的模式,返回结构化答案,并附带概率分布、置信度分数和约束可行性元数据,权重以Apache 2.0许可发布,可在CPU、GPU或隔离环境运行。
该模型是非生成式分类器,采用DeBERTa-v3-large编码器,从gliner2-large-v1微调,不生成token,也不需要提示模板,标签集在调用时传入。模式中的每个问题声明允许的答案,并说明期望单一、多个或有序值;模式还可携带指令、示例、标签描述及跨问题关联规则。Fastino明确它不进行推理、解释或回答开放性问题,而是面向操作决策。
流水线分两阶段:编码器同时读取文本和模式,为每个允许答案打分;约束解码器搜索规则允许的最高分联合赋值。联合解码的价值可用护栏场景说明。独立解码时,模型以0.82标记提示注入,又以0.52将同一提示标为安全,输出冲突。联合解码应用“任何检测到的危害都要求不安全判定”的规则,同时返回safety=unsafe和harm_type=prompt_injection。下游代码可用这些分数阻断、路由或升级。模式可表达蕴含、排斥、基数限制和序数边界;同一编码器还能在一次前向传播中抽取实体、关系及带字符级偏移的结构化记录,分类答案不返回证据片段。
Fastino团队在内部生成并留出的Fast Decisions套件上评估,该套件包含17个数据集、5100个测试样例,任务覆盖客户运营、领域路由(银行、临床、旅行、福利)和通用内容理解,指标为精确匹配准确率。GLiNER2.5-Decide(340M编码器)平均60.1%,高于54B级Qwen3.5解码器(57.5%)和Qwen3.5-4B解码器(56.4%)。该模型在9个数据集领先,意图路由最强,支持意图75.3%,银行意图64.3%,分别领先次优18.6和8.6个百分点。
延迟方面,在批大小1、2个头、15个标签模式下,64个token时CPU p50为167.3毫秒,NVIDIA T4为43.6毫秒,A100为47.3毫秒;1024个token时A100为52.6毫秒。短请求主要受固定预处理和内核启动开销影响。
模型卡示例显示,通过gliner2的AutoExtractor加载fastino/GLiNER2.5-Decide后,可调用classify_text并传入文本与包含intent、urgency、route字段的模式。单标签头返回一个字符串,多标签头返回超过cls_threshold的每个标签。Fastino列出的目标场景包括模型路由、工具调用、浏览器与计算机使用、护栏、上下文剪枝、LLM作为评判者及模拟。微调可在本地全量或LoRA进行。Fastino还发布了GLiNER2.5-Decide-1B(59.6%)和多语言的GLiNER2.5-multi-Decide(56.7%)。