据Hugging Face博客8月19日发布的信息,Liquid AI宣布推出LFM2.5系列四款模型的Q4_0检查点,这些检查点使用量化感知蒸馏(QAD)训练。QAD将高精度教师模型蒸馏到量化学生模型中,使得新检查点在保持原生Q4_0低内存占用和高吞吐的同时,恢复了因量化损失的BF16平均准确率的97%。涉及的模型包括LFM2.5-230M、LFM2.5-350M、LFM2.5-1.2B-Instruct和LFM2.5-2.6B。
Liquid AI将这些QAD Q4_0检查点与通过后训练量化(PTQ)生成的GGUF文件进行了对比。基准套件涵盖推理、指令跟随、工具使用和智能体能力,包括GPQA Diamond、MMLU-Pro、IFEval、IFBench、Multi-IF和BFCLv4。针对模型规模,230M和350M额外使用GSM8K,1.2B-Instruct和2.6B使用AIME25,每项测试重复五次取均值。结果显示,四个QAD检查点分别保留了对应BF16基线性能的97.1%、96.5%、97.4%和96.6%。
在解码吞吐量测试中,Liquid AI使用MacBook Pro、NucBox EVO-X2、三星Galaxy S26 Ultra和树莓派5四类设备,前两者采用GPU推理,后两者采用Arm CPU推理。230M和350M的QAD Q4_0检查点在评估误差范围内达到Q5_K_M质量,解码吞吐量高4%至33%;1.2B和2.6B的QAD Q4_0检查点达到Q4_K_M质量,吞吐量高3%至14%。这些检查点还与Unsloth的UD-Q4_K_XL(一个外部后训练量化检查点,适用于230M和1.2B)表现相当。
这四款QAD Q4_0 GGUF文件已上传至Hugging Face,可通过llama.cpp或任何支持GGUF Q4_0格式的运行时加载使用。