据 MarkTechPost 报道,TypeSafe AI 在结束两年隐身开发后推出决策模型 Jev,该模型不生成段落,而是返回供代码直接分支的判断结果。此后三周内,Fastino Labs 接连发布 GLiDE 与 GLiNER2.5-Decide 两款竞品,开源开发者也复现出多个 Jev 式模型。
决策 AI 模型是一类新模型:用户提交文本和带类型的问题,模型返回选项、评分或真假概率。TypeSafe 将 Jev 称为“系统一模型”,取自丹尼尔·卡尼曼提出的快速直觉思维。Jev 接受字符串、数组或键值对构成的“状态”,支持三种原语:从最多 255 个选项中择一的 Choice、按有序等级评分的 Score,以及给出 0 到 1 真值概率的 Noul(Bernoulli 的缩写)。同一状态下的多个问题并行且相互隔离地评估,增加问题几乎不改变响应时间。TypeSafe 称,由于 Jev 从不生成字符串,因此不会返回类型错误。其内部采用并行采样器,并以“校准决策强化学习”(RLCD)训练,目标是让更高的置信度对应更高的准确率,而 RLHF 优化的是人类偏好。
价格与延迟方面,Jev 输入为每百万 token 0.042 美元,输出免费,OpenRouter 列出 32K 上下文窗口,TypeSafe 称端到端响应在 70 至 500 毫秒之间。
TypeSafe 围绕安全事件、智能体轨迹可观测性、发票处理和客服四项任务构建工作流评测,参考标签来自 GPT-6 Astra 与 Claude Fable 5.1 在高思考模式下的平均结果。Jev 平均准确率 67.8%,每例成本 0.0004 美元,耗时 0.4 秒;Claude Sonnet 5 在同一工作流下同为 67.8%,但每例 0.1174 美元、耗时 78.1 秒;表现最好的对比模型 OpenAI “sol” 为 74.1%,每例 0.0836 美元、23.3 秒。Jev 以远低于 Sonnet 5 的成本和延迟追平其准确率,但仍落后最优前沿配置 6.3 个百分点。分任务看,Jev 在客服上得 76.0%,在发票处理上仅 61.8%。
报道称,判断标准很简单:如果代码需要一个有界答案并据此分支,决策模型是候选;如果需要人阅读输出,则用大语言模型。适用场景包括智能体控制流中的工具或子智能体选择,继续、重试、询问用户或停止等动作,按目的地、复杂度或升级层级做模型路由;客服工单与邮件分拣、意图识别、垃圾信息检测和安全告警分诊;提示词与推理轨迹的护栏和越狱检测,GLiNER2.5-Decide 可同时解码“安全”与“伤害类型”以避免答案互相矛盾;先由廉价模型起草、再由 Jev 校验并仅在失败时升级的级联流程;替换 LLM-as-a-judge、在 CI/CD 中设置评分或分类关卡;对 100 条 BM25 候选并行重排序、大规模数据的映射归约、调用大模型前的上下文裁剪;以及 Doom、Wikiracing 等游戏和低延迟交互。
不宜使用的场景包括:需要生成文本、摘要或解释,需要精确算术、计数或日期运算,以及影响他人生计的决策(如招聘)。TypeSafe 的 Jev 1.13 指南列出这三种情况;Simon Willison 则警告,此类决策中的隐性偏见难以审查。
Vercel 报告称,Jev 成为其 AI Gateway 历史上采用最快的模型,上线 24 小时内已有近 13% 的付费团队使用。