诺基亚应用研究团队9月23日开源了AnyJev。据MarkTechPost报道,这个Python库无需训练,可把任意开源大语言模型转成带概率校准的决策模型,其目标是完成从固定选项中选出一个答案的生产任务,而不是生成句子。AnyJev采用Apache-2.0许可,发布在PyPI,提供transformers和vLLM后端,并支持共享前缀打分。

AnyJev的接口借鉴了TypeSafe AI的Jev。Jev是TypeSafe AI在2026年9月推出的System One决策模型。用户向AnyJev提出类型化问题,会得到一个带概率的决策,该概率来自模型的下一token分布,可以直接设阈值使用,过程中不生成文本、不解析输出,也不进行训练。AnyJev支持三类问题:choice从K个选项中选一个,noul回答是或否,score把答案放入若干有序区间。

AnyJev要解决直接读取logits的两个问题。据MarkTechPost报道,诺基亚研究团队指出,直接把下一token限制在选项标签并读取分数,会带来两个缺陷:选项重排后答案可能改变,概率也没有校准。原因包括先验偏差和位置偏差,前者使模型无论输入如何都偏爱某些标签,后者使模型偏爱选项列表中的某些位置。AnyJev的L0层默认开启,通过对K个选项做K轮循环移位,并在对数空间以几何平均合并结果,消除加性位置偏差;同时用批量校准,在真实输入上保留预测分布的运行均值,并以0.75强度剔除,从第8个样本后开始修正。L1层在L0基础上增加温度缩放,需要100到500个标签,拟合值保存为小型JSON文件。L1只重塑置信度,不改变答案排序。

据MarkTechPost报道,在Qwen3-8B与BANKING77的20路、300条测试项上,原始logits的翻转率为0.230,AnyJev L0为0.073,L1为0.077;准确率从0.747升至0.803和0.807;校准误差ECE从0.240降至0.184和0.095;在5%误差下可自动决策的比例从7.7%升至46.3%和52.0%。L0每次决策需要K次预填,在单张H100、batch 32、K为20时约0.25秒。在类型化决策集上,Qwen3-32B加L1的ECE为0.036,对比Jev已公布的0.144。准确率方面,微调后的Laya仍领先。诺基亚的Wu表示,团队曾在内部路由问题上试用AnyJev,结果有希望。

AnyJev出现前,决策AI已在发酵。据量子位报道,TypeSafe AI的Jev近期受到关注,该团队有OpenAI背景,口号是“Decisions, not strings”。Jev把AI输出变成Choice、Score、Probability等软件可直接执行的结果,主要服务软件和Agent的即时判断。国内中科闻歌则在今年6月发布通用决策大模型Decitron决策机,把世界模型、多智能体推演、博弈与求解纳入统一决策框架。量子位认为,Jev与Decitron并非一回事:Jev把决策做成一次瞬时判断,Decitron把决策展开为对未来的一场推演,一个解决“此刻选什么”,一个解决“选完之后会发生什么”。

量子位还指出,两者都在让AI输出从生成内容走向支持判断和行动,都强调显式量化不确定性,并尝试把决策变成独立的AI计算范式。差别在于,Jev量化的是当前判断的不确定性,Decitron处理的是不同主体、行动和环境变化下未来演化的不确定性。Jev的计算逻辑是输入状态、输出判断,Decitron则是输入现实、建模世界、模拟行动、推演结果、比较策略。AnyJev则沿着Jev的路径,把开源大模型接入可设阈值的分类决策流程。