据MarkTechPost报道,BottleCap AI发布ThinkingCap系列第二款模型ThinkingCap-Qwen3.8-27B。该模型基于Qwen团队的Qwen3.8-27B微调,目标单一,即缩短推理轨迹;在12项基准上平均减少37.2%的思考token,宏观平均准确率从86.65%降至85.79%,下降0.86个百分点。
报道称,ThinkingCap-Qwen3.8-27B可在vLLM或SGLang上直接替换Qwen3.8-27B,并提供FP8、NVFP4、GGUF和MLX构建。其仓库设有门禁,超出小企业许可的商业使用需与BottleCap达成协议。
BottleCap认为,推理模型常花费超出问题所需的思考token,其中不少额外token不会改变最终答案。该系列首个版本已将这一思路用于Qwen3.6-27B。此次目标刻意保守,不增加知识或改变回答风格,并让推理能力、指令遵循和安全行为保持不变,团队还重点考察数学、推理、长上下文和智能体基准。
所有主要数据均在reasoning_effort=xhigh下测得,这是聊天模板默认值。12项基准全部缩短,降幅从10.7%到65.5%不等,知识和多语言任务缩减最多。MMMLU从1,656降至571个token,降幅65.5%;MMLU-Pro下降57.3%;GPQA-Diamond从12,772降至7,267个token,降幅43.1%。IFBench思考token减少46.4%,准确率几乎持平,从79.75%变为79.71%。长上下文检索表现改善,AA-LCR准确率上升2.25个百分点,从81.75%升至84.00%,思考token减少38.6%。LiveCodeBench v6准确率微升0.07个百分点,思考token减少20.3%。智能体结果接近基座:τ²-bench减少30.9%思考token,准确率下降1.01个百分点;Terminal-Bench 2.1减少10.7%,准确率下降0.56个百分点,处于±4.26区间内。代价最大的是AIME 2026,思考token减少30.2%,准确率从98.13%降至94.27%,下降3.85个百分点。37.2%是12项基准降幅的平均值,合并平均思考token从15,735降至12,144。BottleCap还报告,在每条回复16K token上限下,ThinkingCap得分高于基座模型,截断轨迹从0.51%降至0.34%,循环从0.06%降至0.05%。
Qwen3.8-27B提供推理努力程度设置,ThinkingCap的压缩可与该设置叠加。在11项基准平均后,medium档下基座模型减少52.1%思考token,准确率下降9.16个百分点;ThinkingCap减少60.2%,准确率下降9.90个百分点。low档下基座为减少55.4%、下降9.71个百分点,ThinkingCap为减少62.3%、下降10.79个百分点。关闭思考时,ThinkingCap比基座低5.7个百分点。BottleCap团队建议使用xhigh以获得最佳准确率与token平衡,并表示个别思考模式将在未来版本中处理。
评估在两款模型上使用同一测试框架,运行于一块NVIDIA H200,vLLM版本0.29.0。采样参数一致:temperature 1.0、top_p 0.95、top_k 20、min_p 0.0。多种子准确率取均值并给出95%区间,种子数从AIME 2026的32个到MMLU-Pro和MMMLU的1个不等。MMMLU使用固定10,000题样本,其余11项基准运行完整集合。MTP推测解码(3个草稿token)在AIME 2026上测得准确率中性,接受53%草稿token,约每步2.6个token,与基座模型一致。
部署方面,bf16检查点为28B参数,接受图像和文本输入。BottleCap发布5个量化构建:FP8为31GB,用于vLLM、Hopper和Blackwell;NVFP4 weight-only为21GB,用于vLLM、Hopper的Marlin内核和Blackwell;NVFP4 W4A4(AWQ)为23GB,仅限Blackwell;GGUF为16至55GB,用于llama.cpp、LM Studio和Ollama;MLX 4-bit DWQ为21GB,用于32GB内存的Apple Silicon Mac。服务沿用基座模型配方,在vLLM上使用reasoning-parser qwen3和qwen3_xml工具调用解析器,思考内容在单独的reasoning字段返回。许可为PolyForm Small Business 1.0.0加BottleCap个人使用授权,上游Qwen材料仍采用Apache-2.0。Hugging Face目前尚无推理提供商托管该模型。