据 MarkTechPost 报道,Contrastive-LM 发布了 CLM-8B,这是名为对比语言模型(CLMs)的新类别中的首个开放模型。该模型不生成文本,而是针对当前状态为一组候选动作打分并返回概率,主要对标 TypeSafe AI 的专有 System One 模型 Jev。
在部署方面,CLM-8B 采用 Apache-2.0 许可的头部权重,体积为 75 MB,可在 Linux 下用单张 NVIDIA GPU 运行,由 vLLM 提供 Qwen3-8B 编码器的服务。Jev 于 2026 年 9 月 15 日进入有限早期访问,其输出是带概率的类型化数值而非文本,CLM 瞄准的是同一接口。CLM 的 GitHub 仓库以兼容 TypeSafe 的 API 提供 CLM-8B,对外暴露三类问题:Noul 返回某陈述为真的概率,Choice 从声明好的选项集合中选出一个并给出概率,Score 返回有序评分表上的期望等级。为 TypeSafe 的 API 编写的请求,可以通过 CLM 的 Python 客户端重放。
技术上,CLM 用一个状态编码器和一个动作编码器,以双向 InfoNCE 损失训练。每个编码器由冻结的 Qwen3-8B 主干加一个 2000 万参数的可训练投影头组成。训练过程把每个状态拉向实际采取的动作,同时推离其他动作。推理时,CLM 通过状态嵌入与动作嵌入的点积为每个候选打分,再对这些分数做 softmax 得到答案分布。同一套原语可用于 best-of-N 解的排序、工具路由和类型化决策。这种设计把状态与动作解耦:在智能体循环中,状态每步都变,而动作集合基本固定。clm-serve 会预留一块 GPU 显存,类似 vLLM 的 KV 缓存,并复用已缓存的向量。在单张 RTX 4090、3 个动作的条件下,重复访问的状态耗时从 1.7 毫秒降至 0.6 毫秒。模型卡报告称,在约 1000 个候选的情况下,CLM 的运行速度比 Jev 快 13 倍。
训练分为三个阶段:预训练使用约 6000 万条 Nemotron DQA 问答对;中期训练使用 Gemini 2.5 Flash-Lite 生成的约 3000 万条合成困难负样本;后训练使用来自 Agent Data Protocol、Endless-Terminals 和 LiteCoder-Terminal-SFT 的约 100 万条智能体轨迹。在约 10 万个留出问题上,仅预训练就达到 52.1% 的 top-1 准确率,中期训练将其提升至 69.2%。如果从一开始就用困难负样本训练,准确率峰值为 62.4%,随后出现过拟合。
零样本对比中,T-Rex 游戏任务上 CLM-8B 延迟为 16.5 毫秒、Jev 为 149.8 毫秒,两者成功率均为 5/5;工具调用(BFCL v4)上 CLM-8B 为 76.8 毫秒、成功率 95.2%,Jev 为 125.5 毫秒、成功率 99.2%;WikiRacing 上 CLM-8B 为 79.8 毫秒、26/30,Jev 为 225 毫秒、30/30;Super Mario 上 CLM-8B 为 33.5 毫秒、5/5,Jev 为 132.6 毫秒、5/5。9 倍这一数字来自 T-Rex 游戏,该任务的动作在不同状态间重复出现。CLM 在 T-Rex 和 Super Mario 上与 Jev 持平,在工具调用和 WikiRacing 上落后,但在每一项任务上都更快。
在作为编码智能体验证器的场景中,生成器先采样若干候选解,再由验证器挑选。Opus 5 生成 DeepSWE 候选(best-of-4),Fable 5 生成 Terminal-Bench 2.1 候选(best-of-5)。团队评测了 38 个留出的 DeepSWE 任务和 30 个留出的 Terminal-Bench 2.1 任务,延迟在 H100 上测量。DeepSWE 上 pass@1 为 73.7%,CLM(微调)为 81.6%,Jev 为 71.1%,CLM 延迟 79 毫秒、Jev 为 449 毫秒;Terminal-Bench 2.1 上 pass@1 为 84.0%,CLM 为 87.6%,Jev 为 83.1%,CLM 延迟 32 毫秒、Jev 为 131 毫秒。研究团队称这些是新的验证器 SOTA 结果。Jev 在两个基准上的得分都低于 pass@1,因此用它做选择还不如直接取 1 个样本。CLM 的速度快 4.1 倍到 5.7 倍。这些数字使用的是轻量微调头,而非零样本检查点,且属于留出子集结果,不是完整的排行榜提交。