据Hugging Face Blog报道,一项名为“量化感知修复”(Quantization-Aware Healing, QAH)的新技术,使一个从120B参数压缩至60B并量化到4位(MXFP4)的模型,在9项基准测试中的7项上超越了其全精度(bfloat16)版本。这意味着4位模型更小、运行成本更低,却比它所源自的16位检查点更精确,颠覆了4位模型与16位模型之间的通常关系。

大多数效率管线的流程都是三步:压缩架构、量化压缩后的权重、修复损伤。不同方法的差异完全在最后一步。现有主流修复方法是量化感知训练(QAT),它在前向传播中插入伪量化算子,并继续用任务损失微调模型,但这意味着要重新运行昂贵且多阶段的后训练过程,而且如果训练超过最佳点太久,可能变得不稳定。另一种方法是量化感知蒸馏(QAD),它通过KL散度损失将冻结的全精度教师直接蒸馏到量化学生,但在模型经过结构压缩后,教师不复存在,唯一候选教师是恢复后的bfloat16检查点,它本身是对原模型的蒸馏近似,以它为教师会把量化学生锚定在一个降级的目标上,精度被限制在该恢复检查点的上限。

QAH通过一个改变消除了这个上限:它直接从未压缩的原始模型蒸馏,而不是从恢复后的模型蒸馏。教师和学生甚至不共享架构,教师是全尺寸全精度,学生是半尺寸且运行在MXFP4。由于教师的输出分布与架构无关,尺寸和形状的错配不影响知识迁移。学生看到的只是教师的输出分布,通过logits上的KL散度匹配。这重新定义了量化的作用:在QAH下,量化不再是修复完成后的有损后处理步骤,而是对原始教师的第二次完整蒸馏,是bfloat16检查点从未获得过的监督。4位学生不是在补偿量化损失的信息,而是在获取早期恢复阶段没有时间或数据迁移的信息。

QAH还有一个稳定性益处:KL蒸馏将学生与固定教师分布绑定,一旦学生赶上,就没有进一步漂移的压力;而交叉熵任务损失会无限期地推动学生朝向硬标签。为了在长上下文中工作,修复语料包含长达32k令牌的文档,QAH复用了伴随论文中的内存高效分块KL散度损失,逐片计算KL,避免物化完整的词表-序列网格,使得32k令牌的修复能够在固定GPU内存预算内完成。

研究者将QAH应用于GPT-OSS 120B模型,压缩到60B参数并以bfloat16恢复,再在QAH下量化为MXFP4。与同一60B模型的最佳全精度bfloat16检查点相比,QAH模型在9项基准中胜出7项。