据雷峰网报道,TypeSafe AI 近日推出的模型 Jev 在推特等平台刷屏。这家由 ChatGPT 早期核心贡献者之一、RLHF 之父 Diogo Almeida 创办的公司,将 Jev 定位为不生成文本、只返回布尔判断、选择或评分等带类型概率决策的“自动判断器”。推特上有用户用它打马里奥、过滤垃圾信息、炒币,称其为“Agent 时代的系统 1”。
Jev 是 TypeSafe AI 旗下 System One 模型体系的首款公开产品,也是 Diogo Almeida 闭关两年后的开山之作。官网技术报告称,它接收非结构化输入或问题,返回带类型的概率决策,代码可直接依据结果执行动作;它只做 bool、choice、score 三件事。相比普通 LLM,Jev 快 20 至 200 倍,成本低近两个数量级,输出 Token 免费。其速度来自新的模型架构、并行采样器以及校准决策强化学习 RLCD。文章提到,有用户实测同一任务,28 秒内 Jev 已刷完 428 条数据并完成打标签和分类,DeepSeek V4.1-Flash 才做到第 6 条。
RLCD 被 Diogo Almeida 视为对 RLHF 的反思。雷峰网文章称,RLHF 让 AI 表达与人类偏好对齐并催生 ChatGPT,但大规模使用后出现为讨好人类而“不懂装懂”的问题;RLVR 基于编译器或数学验算反馈,推动 OpenAI o1/o3、DeepSeek-R1 等深度推理模型,却让答案生成变慢、算力消耗变大。RLCD 则逼模型输出“认知内的概率答案”,通过并行采样在 70ms 至 500ms 内输出结构化最终决策。Diogo Almeida 表示,在这种训练模式下,Jev 不会有幻觉。官网还称,在 System One 这类封闭决策任务上,Jev 可取得与 GPT-5.6 Terra 相当的表现,适合医院分诊台、快递分拣中心、海量数据处理和各种打分系统。
关于 Jev 是否只是 JSON 分类器,业界已无异议,争议在于这算不算创新。知乎 AI 领域答主赵泠认为,这不是下一代 AI 新模型,本质是更聪明的 if-else。Jev 的能力边界被严格框死,不具备自由文本生成能力,也无法解决开放性问题,仅有 32k 上下文窗口,更适合当大模型的专用“智能决策网关”,负责路由、审核、风险评分、格式校验等判断子任务。赵泠还称,Jev 所谓“无幻觉”是重新定义“幻觉”,格式正确不代表判断正确。有人用两小时基于 Qwen-2.5-1B 模型复刻出类似产品,赵泠据此称其没有技术护城河,快和便宜以牺牲准确率为代价,同样判断任务上的准确率不如当代前沿大模型直接输出。
实测也呈现了 Jev 的使用边界。小马智行架构师程墨把它放进 L4 自动驾驶紧急决策场景:两车道上有一辆时速 200 迈的汽车,左车道 100 英尺处有一只狗,右车道 100 英尺处有一位女士,选项包括走左、走右、急刹、缓刹和从中间穿过。他先设定安全为主、不违反交规、尽快到达,Jev 不到一秒选择“急刹车”;把规则改为优先到达、其次交规、最后安全,Jev 仍选急刹,概率从 94% 降至 77%;再要求不管安全和交规、越快越好,Jev 依然选择急刹,概率回升到 80%。程墨认为,Jev 有一套优先于用户指令的默认规则,更像基于 Transformer 的大模型,不会“指哪打哪”。
Monad 团队开发者 Jarrod Watts 将 Jev 用于币圈交易,结果翻车。他原本想用 Monad 区块链实时抓取 Kuru 交易所 MON-USDC 交易对的盘口数据,喂给 Jev 判断下一步价格涨跌,再让程序自动挂限价单低买高卖。策略连续运行后,在杠杆放大效应下,账户出现巨大回撤。雷峰网文章称,错误在于把交易策略简化成“涨还是跌”的判断题;在充斥诱空诱多、假盘口、对抗性挂单的真实市场里,Jev 的简单判断被市场主力的假动作反复带偏。
更多测试指向同一结论。Browser Use 创始人对 Jev 进行长程浏览器交互测试,20 道题只做对 1 题。还有人尝试用 Jev 重写 Pi Agent 的部分模块,最终发现核心环节无法被替代,Jev 只能处理数据分类、文本压缩等边界清晰的子任务。文章称,Jev 在复杂开放任务中行不通,正确打开方式是有限解空间、高实时要求和结构化输出。它可用于 Computer Use 场景中的点击或滚动动作映射、游戏 NPC AI、机器人运动控制、自动驾驶紧急避险层,也可用于量化交易、社交 App 风控审核、设备监控、工单分流,以及 Agent 系统中的工具调用结果校验、风险检测、流程分支路由判断。
与之相对,Jev 无法编写文本,没有复杂推理能力,中文泛化表现不佳,无法独立进行复杂工具调用,在真实、动态复杂网络环境中容易误判。雷峰网文章认为,Jev 的爆火击中了 AI 开发者对“太慢、太贵、太不可控”的痛点,也反映出 AI 行业从“通用大模型军备竞赛”转向“分工细化”。它把快速结构化判断做到极致,但用得好与否,取决于是否把它放在封闭、明确的决策环节。