PrismML于9月18日发布Bonsai 2 27B,这是其第二代超紧凑多模态模型,基于Qwen3.8 27B压缩,体积约5.9GB,可在个人电脑和部分高端移动设备本地运行。据SiliconANGLE报道,该模型保留约98.2%能力;MarkTechPost给出的对照容量为53.80GB FP16,而SiliconANGLE称原模型约56GB。模型权重以Apache 2.0许可发布。
据MarkTechPost报道,Bonsai 2 27B保持Qwen3.8 27B架构不变,参数量为27.36B,其中语言主干24.35B、嵌入和LM head 2.54B、视觉塔0.47B。主干约75%为线性注意力层,25%为全注意力层。三值权重覆盖嵌入、注意力投影、MLP投影和LM head,仅26.2M参数、约0.0976%保持高精度,主要是循环状态路径和归一化权重。模型支持文本和图像输入,上下文长度为262K tokens;视觉塔在GGUF中单独发布,仅在图像输入时加载。
三值格式让每个权重取-1、0或+1,每128个权重共享1个FP16缩放因子,折算约1.71比特/权重,计入高精度张量后为1.72比特。白皮书列出两种GGUF打包:PTQ1_0以1.76比特/权重密集存储,体积5.93GB;PQ2_0把每个三值放入2比特槽位,体积7.25GB,但解包成本更低。权重在赋值前还经过块大小为1024的Hadamard旋转,白皮书中提到这一思路来自SpinQuant;PrismML未公布三值赋值方法。
在20项基准上,Bonsai 2 27B平均得分83.9,Qwen3.8 27B FP16为85.4,平均保留率98.2%。其中知识推理83.95对86.66,数学96.57对97.06,代码81.58对82.17,代理与工具调用77.57对79.74,指令遵循82.66对81.25,视觉78.59对81.64。常规量化对照中,Qwen3.8 27B的IQ2_XXS版本在7.3GB下平均75.2;AIME26上Bonsai 2得分95.83,IQ2_XXS为78.6;LiveCodeBench v6上分别为90.07和70.05。
质量损失并不均匀。长程代理任务下降更明显:Bonsai 2在Terminal-Bench 2.1得52.8,Qwen3.8 27B为69.7;在SWE-bench Verified得60.8,Qwen3.8 27B为80.6,保留率约75%。中等推理强度下,Bonsai 2平均79.3,FP16基线82.6;低推理强度不受支持。上述结果均来自PrismML自身,尚未被独立复现。
硬件运行方面,PrismML称在批次大小为1的解码中,RTX 5090达到142.5 tokens/秒,每token耗电0.582毫瓦时;RTX 4090在PTQ1_0下为96.7 tokens/秒,72W L4为32.1 tokens/秒。苹果设备上,M5 Max为46.8 tokens/秒,M5 Pro为27.7 tokens/秒。PTQ1_0在Ada架构显卡和L4上更快,PQ2_0在Blackwell、Hopper、Ampere和苹果芯片上更快,并在所有平台的提示处理中更快。PrismML还称其能效比全精度8B模型高40%。SiliconANGLE报道的RTX 5090速度为143 tokens/秒,M5 Max为46.8 tokens/秒。
部署上,Apache 2.0权重可在16GB笔记本或单张24GB GPU上运行,但GGUF文件需要PrismML的llama.cpp分支,原版llama.cpp不接受PTQ1_0和PQ2_0类型;Mac用户可使用MLX包,但需其配套加载器。官方还提供WebGPU浏览器演示。SiliconANGLE指出,这类超小模型可让用户在本机完成推理,避免把提示和响应发往云端,从而减少延迟和第三方数据共享,简单翻译、摘要和搜索整理等任务可本地处理,复杂长程任务仍可交给云端大模型。