据MarkTechPost报道,Cloudflare发布了由其Workers AI团队训练的首批模型Clef和Clef-flash。这两款模型属于决策模型而非聊天机器人:它们读取输入状态和一组带类型的问题架构,对每个允许的答案返回概率,不生成自由文本。两款模型以Apache 2.0协议开放权重,兼容TypeSafe AI的Jev API,目前已在Workers AI上线,权重同步发布在Hugging Face上供自行部署。

Clef支持三类问题。noul为是非题,返回“是”的概率;choice从若干具名选项中选定一项,给出各选项概率和置信度;score按有序评分标准打分,返回概率加权分数。在Workers AI上,单次请求最多可携带64个问题和4张图片。

TypeSafe AI于2026年9月15日推出其首个“System One”模型Jev,随后出现Kev-9B、Laya等开放替代方案。Clef使用同一套System One API,从Jev迁移只需更换端点和模型名。

Clef基于Qwen3.8-27B后训练,Clef-flash基于Qwen3.5-9B,两者均保留骨干的视觉编码器。推理分两阶段:骨干先对状态和问题做一次仅预填充的传递,随后由小型transformer“联合架构头”读取最终隐藏状态,把证据路由到各个问题,让字段之间交叉注意力,并对所有选项联合打分,再由逐问题softmax把logits转为概率。训练时冻结两个骨干,联合优化路由头与rank-256低秩适配器;损失函数将标签平滑交叉熵与用于校准的Brier损失配对,并引入“校准决策强化学习”(RLCD)作为次要目标,对相邻序数选项给予部分得分。

在Cloudflare取自Decision Index 0.2.1套件的10项基准清单上,Clef在其中7项得分最高。BANKING77(macro-F1)为94.20,Jev为79.74;CLINC150+OOS为97.43,Jev为89.27;家用电器(case exact)Clef-flash为97.73,Jev为52.27。Jev在其他项目保持领先:GPQA Diamond为78.3对48.0,MMLU-Pro为82.7对65.9,BBH为92.9对73.7。在TypeSafe自身的工作流评测中,Clef在4个领域中的3个以小幅优势胜出:发票处理64.7对61.8,客户服务76.3对76.0,安全事件62.9对61.7;Jev在代理轨迹可观测性上以71.6对68.5领先。在Cloudflare的威胁情报工作流中,Clef用2.2秒完成域名分类,gpt-oss-120b用时4.7秒。上述数字均由厂商提供,尚无独立复现。

按Cloudflare内部Decision Index运行的数据,Clef中位延迟为209.3毫秒,Clef-flash为38.8毫秒,Jev为524.1毫秒,Kev-9B为51.4毫秒,Laya为5.8毫秒。托管价格(输入)方面,Clef为每百万token 0.24美元,Clef-flash为0.09美元,Jev为0.042美元。Clef与Clef-flash的上下文长度均为65,536。

两款模型可通过Workers AI绑定(env.AI.run())、REST API或AI Gateway调用。自行托管方面,模型卡列出在单张H200上以BF16权重测试。Cloudflare同时宣布一项强化学习服务,用于在私有数据上微调Clef,初期由Cloudflare的前置工程师参与,后续推出自助平台;该流水线整合AI Gateway、Workers AI、Containers和一个新的Trainer组件,团队可通过设计伙伴表单申请。