据MarkTechPost报道,TypeSafe AI上周发布其首个System One模型Jev。创始人Diogo Almeida曾在OpenAI参与ChatGPT背后的指令遵循研究。Jev不聊天、不写代码、不摘要,而是接收非结构化状态并返回带校准概率的类型化决策,面向智能体循环中的模型调用、命令安全、段落相关性和任务完成度等小判断。
TypeSafe AI说明,每次调用需要发送一个状态,状态可以是文本或JSON,同时发送一组类型化问题。其文档定义三个原语。Choice从列表中选择一个选项,返回每个选项的概率以及置信度;Score按有序评分标准对状态评级,返回概率和置信度;Noul返回某个陈述为真的概率,范围为0到1。所有问题在同一请求中针对同一状态并行评估。Choice最多支持255个选项。
训练方面,TypeSafe AI采用Reinforcement Learning for Calibrated Decisions,即RLCD,使更高置信度应当对应更高准确率。该公司发布的信息称,Jev的主要性能声明为快193.6倍、便宜444.6倍,这些数字来自TypeSafe AI自己的workflow evals。发布帖还表示,这些数字处于真实世界收益的高端,并使用GPT-6 Astra和Fable 5.1作为参考答案。
材料标题提到20个智能体用例,但正文未逐一列出清单。已说明的适用判断包括:选择调用哪个模型、判断一条命令是否安全、判断哪段文本相关,以及判断智能体是否真的完成。与通用聊天模型不同,Jev的输出不是自然语言回复,而是带概率的决策结果。TypeSafe AI称,这种设计使其能够在一次请求中并行回答多个类型化问题。
Jev由TypeSafe AI发布,该公司创始人Diogo Almeida此前在OpenAI参与ChatGPT背后的指令遵循研究。性能数据由TypeSafe AI自行通过workflow evals得出,发布帖称其倍数位于真实世界收益的高端,参考答案为GPT-6 Astra和Fable 5.1。