据MarkTechPost报道,巴西小型AI实验室Supersonic Labs于9月26日发布Julia 1决策模型。该模型不是聊天机器人,参数量144.3M,可在普通CPU上运行。用户输入上下文、问题和2至20个候选答案,模型从中选择一个,并返回每个选项的概率。权重以Apache 2.0协议发布在Hugging Face,可在Python 3.11+环境用CPU或支持BF16的GPU本地运行,ONNX构建可通过WebGPU在浏览器运行;托管API已宣布但尚未开放。

Julia 1通过一个API处理三类决策:choice从2至20个带描述选项中选择一个标签,用于分类和路由;score在有序评分标准上返回预期索引,例如低、中、高;noul返回某个是/否陈述为真的概率。结果按调用者提供的选项顺序返回,并给出完整softmax概率,账单等调用者ID原样返回。该模型不生成文本。

架构上,Julia 1以JHU CLSP的mmBERT-small为起点,这是140M参数、覆盖1800多种语言的多语言ModernBERT编码器。Supersonic Labs保留编码器和分词器,加入决策头,并用决策格式样本训练。实验室称Julia 1并非微调Qwen模型。运行时支持8192个合并token,但已发布基准使用1024 token上限。训练和实验的云GPU总支出约104.08美元。FP32权重占550.5 MiB,私人训练流水线未公开。采用自研基础架构的Julia 2正在开发中。

2026年9月24日的评估在H200 BF16上以严格编码运行,比较基线是TypeSafe的Jev,使用Jev基准协议中的参考值,而非新一次Jev运行。Typed Decisions结果为73.15%(1463/2000),参考值72.70%;AG News四标签为94/100,参考值91%;DAIR Emotion六标签为86/100,参考值48%;Banking77七十二标签为64/100,参考值87%,报道称这是明显失败。MASSIVE十八个场景在52个地区取得71.50%宏平均准确率。这些分类试点各仅使用100个样本。9月25日的一次CPU运行复现了多数数字:Typed Decisions为72.55%,Banking77为60/100,并有3次弃权。

设备端延迟方面,Apple M4上每次调用做一个决策的中位数为33.15毫秒。三星SM-X510平板通过ONNX Runtime运行时,中位数为203毫秒,峰值RSS为393.1 MB。Intel Core i5-1235U上AG News决策中位数为107.83毫秒;Banking77因先缩小72个标签,耗时3713.54毫秒。@supersonicai在X上称Julia 1在i5笔记本上分类速度比Jev快5倍。报道提醒需谨慎看待,因为Jev试点是将其作为托管服务从法国调用,延迟并非同条件比较。

局限性方面,Julia 1只比较用户提供的答案,不能用于缺失事实、代数或多步计算。其Router在缩小标签范围时可能丢掉正确标签。它不是可直接替换的Transformers流水线,也没有Hugging Face推理提供商为其服务。Supersonic Labs建议用户用自己的问题评估,并在后果重大的决策中保留人工环节。