9月19日,TypeSafe AI发布系统一模型Jev,Cua同日发布面向电脑操作的开源决策模型CUA-S1-FORMS。两者都不生成文本,而是接收状态和候选选项,返回带概率的决策,供代码直接分支或执行。

据MarkTechPost报道,Jev基于Transformer,但不是大语言模型,不生成文本。用户发送状态和带类型的问题,它返回带概率的类型化决策。Jev目前以托管API在等待名单中提供早期访问,TypeSafe未公布权重、参数量或自托管方案。其名称取自丹尼尔·卡尼曼对快速直觉与缓慢推理的划分。TypeSafe称,RLHF带来聊天能力,也带来过度自信和模式坍缩;Jev采用新架构、并行采样器和“校准决策强化学习”,但架构细节未披露。

Jev的API端点为POST https://api.typesafe.ai/v1/systemone,请求体包含状态、模型和问题映射。文档定义三类问题:Choice从列表选一个选项,返回选择、概率和置信度;Rate按有序等级打分;Noul判断陈述是否为真,返回0到1的概率。问题并行、独立运行,TypeSafe称增加问题几乎不改变响应时间,Choice最多支持255个选项。每个Choice和Score答案都带0到1的置信度,由概率分布形状推导。文档建议高置信度直接执行,中等置信度人工复核,低置信度交给人类,阈值随错误操作成本调整。

Jev输入价格为每100万token 0.042美元,输出token免费。TypeSafe称端到端响应时间为70毫秒至500毫秒。其录制的演示显示,Jev用时0.114秒、花费0.000081美元,GPT-5.6 Terra用时8.566秒、花费0.013880美元,TypeSafe据此声称快193.6倍、便宜444.6倍。这些数据来自TypeSafe自身评测。MarkTechPost指出,参考答案是GPT-6 Astra与Fable 5.1的平均值,工作流由TypeSafe能力团队编写,TypeSafe预计增益处于实际使用上限,并称无法证明价格没有补贴;“零幻觉”仅指保证模式匹配,答案仍可能出错。

发布后数日内出现社区项目。Vercel CEO Guillermo Rauch称Jev在p95延迟上比GPT Luna快至多18倍且更准确,但表示fx reviewer仍运行在Luna上。Browser Use的jev-ultrafast在7.1秒内完成苏黎世到伦敦的Google Flights搜索;Droidrun的mobile-jev在真实Android手机上约21秒执行9个动作,未完成预订。这些项目由不同开发者发布。

据Hacker News上的Show HN帖子,Cua的Dillon和Francesco在思考有多少电脑操作任务真正需要通用大模型。部分任务需要规划、探索和失败恢复,另一些只需局部决策,例如某个值填入哪个框、是否勾选或忽略某元素。他们受TypeSafe的Jev及其系统一模型框架启发,尝试用小模型只做这类决策。CUA-S1的首个版本CUA-S1-FORMS基于jevlike的思路和代码,再训练一个专门处理表单交互的模型,参数量70.6万,原始检查点2.8MB,首次训练在合成数据上不到30分钟。

给定从文档中抽取的结构化元素和值,该模型为每个元素预测使用给定值、CHECK、CLICK或SKIP,不预测文本框新值,也不考虑截图。元素决策一起打分,代码可对动作排序,由Cua Driver逐一执行。Cua在表单任务上与托管Jev对比:整个决策集正确率99.7%对83.6%,需要执行动作的子集为100%对96%,仅保留已填字段不动的子集为100%对74%。Cua称,专用模型针对该任务和约定训练,托管Jev未为此微调,因此这是限定范围的专业化实验。本地为表单打分耗时7至9毫秒,调用托管Jev每次含网络延迟耗时260至280毫秒,但两者测量内容不同,并非端到端表单完成时间。

Cua表示,其兴趣在于脆弱脚本与通用智能体循环之间的空间:表单字段的内容和布局变化大到脚本难以维护,但可用决策集合仍可保持狭窄明确。他们想探索通用智能体遇到新情况时,将理解清楚的决策交给此类专用模型。当前版本仅面向表单,合成数据生成、训练、评估和Driver集成已以MIT许可证在libs/cua-s1下开源。