据 MarkTechPost 报道,Conway Research 旗下端侧助手项目 Underdog 以 Apache 2.0 许可发布 Saluki 27B。这是对 Qwen3.8-27B 的 2 比特混合精度 GGUF 量化版本,文件体积 7.89 GB,而 BF16 全量模型需要 54 GB。Underdog 称其压缩过程针对工具调用能力做了保护,开发者可在原版 llama.cpp 及基于它的应用中运行该模型,并支持全部 GPU 卸载。

Underdog 表示,Saluki 27B 在 9 项基准测试中平均保留原模型 96% 的能力。提升最明显的是并行工具调用:100 项 BFCL v4 并行任务经官方检查器评测,Saluki 得 42 分,全量模型得 35 分,保留率约 120%。下降最明显的是 AIME 2025,Saluki 为 79.2,全量模型为 96.7,保留率约 82%。该模型还提供 629 MB 或 928 MB 的可选视觉插件,原版 Qwen3.8-27B 则原生支持视觉。

Saluki 27B 由三层工作堆叠而成。底座是 Qwen 团队的 Qwen3.8-27B,为稠密 27B 参数模型,共 64 层,混合 Gated DeltaNet 线性注意力与门控注意力,原生支持 262,144 个 token。第二层是 ISTA-DASLab 的 Qwen3.8-27B-GSQ-RCO-GGUF,其中 GSQ 为每个张量学习精确的低比特标量网格,RCO 在固定体积预算下为每个张量分配量化类型;ISTA 体积最小的文件 IQ2_XS 为 8.4 GB,每权重 2.50 比特。第三层是 Underdog 自己的一道处理,把文件压缩到 7.89 GB,并针对工具调用做优化。该文件命名为 IQ2-mix,带有 imatrix 标签,Underdog 未公布这一层的完整配方。

基准结果被 Underdog 分为两组。第一组中两个模型在同一测试框架下运行:Underdog Bench 的 120 项任务取自 BFCL v4,测试前已冻结,关闭思考模式,温度设为 0,Saluki 得 88 分,全量模型得 84 分,PrismML 的 Bonsai 2 得 70 分。SWE-bench Verified 的 50 个 issue 中,Saluki 修复 30 个,全量模型修复 33 个。第二组将 Saluki 与公开的全尺寸分数对比:IFEval 为 93.5 对 91.5,IFBench 为 72.7 对 71.0,MBPP+ 为 78.0 对 83.9,MuSR 为 67.5 对 79.6,AIME 2025 为 79.2 对 96.7,AIME 2026 为 80.0 对 94.6。

与其他紧凑版 Qwen3.8-27B 构建相比,PrismML 的 Bonsai 2 27B(PTQ1_0)参数为 27.36B,文件 5.95 GB,每权重 1.75 比特,上下文 262K,可选 0.63 GB 的 mmproj,报告在 14 个思考模式基准上保留 98.2%,AIME25 得分 95.00。但该模型需要 PrismML 的 llama.cpp 分支,因为原版 llama.cpp 不接受其打包格式;Saluki 则可直接在原版 llama.cpp 上运行。报道指出,各厂商使用各自的测试框架,跨厂商分数不可直接比较。