据量子位报道,Meta FAIR与华盛顿大学研究人员提出一种字节级知识蒸馏方法,将教师模型的Token概率分布转换为字节级别的训练目标。论文题为《突破Token天花板:蒸馏出更小、更强的字节模型》。团队根据缩放定律预测,随着训练计算量增加,字节级蒸馏将反超传统Token级蒸馏,下游平均准确率上限高出4个百分点。
传统蒸馏让学生模型学习教师在庞大Token词表上的概率分布。以Llama 3-8B为例,其词表包含128256个Token,每个预测位置对应十几万个候选概率;离线蒸馏保存完整分布成本高,实际常保留top-k。字节只有256种基础取值,单个位置预测空间更小,也不随分词器改变。
论文提出Marginalize-It和End-Of-Token两种方案,把教师对不同Token的概率分解到对应字节位置。前者直接聚合并重新分配概率;遇到不同Token长度不一致时,已结束候选不再向后追,对剩余候选概率重新归一化。它只需一次教师前向计算,但会丢失部分已结束Token的概率信息,属于近似。后者在每个Token末尾加入特殊结束标记,让学生可以预测当前Token结束,从而在保留Token边界的同时,把教师分布更完整地映射到字节空间。两种方法都只需教师做一次前向计算。
实验统一使用Llama 3-8B作为教师。三类学生的Transformer层参数量相同,均约12.8亿;计入词表相关参数后,Token学生总参数量约18.1亿,字节学生约12.8亿。团队测试Token、普通字节和带结束标记的字节三种表示,每种再分为监督训练与蒸馏训练,共六组。字节模型训练覆盖约万亿字节规模,并在选择题问答、语言生成和机器翻译三类任务中完成八项评测。
训练过程中,Token模型在计算量较小时学得更快,但很快接近平台期;字节模型起步更慢,却随计算量增加持续改善。论文没有直接用每字节预测损失BPB判断强弱,而是拟合训练计算量、BPB与下游任务成绩之间的关系,再预测继续扩大规模后的能力上限。预测结果显示,Token蒸馏平均准确率上限为48.4%,Marginalize-It蒸馏为50.5%,End-Of-Token蒸馏为52.4%。End-Of-Token比传统Token蒸馏高4个百分点,也是六种方案中预测上限最高的。普通字节监督模型的渐近准确率预测为51.2%,高于Marginalize-It蒸馏的50.5%。论文认为,这很可能因为Marginalize-It为省计算丢掉了部分Token结束后的概率信息。
按照缩放曲线外推,End-Of-Token大约在6.33×10²² FLOPs时追平Token蒸馏48.4%的预测上限。存储方面,End-Of-Token处理的实际文本量约为Token方案的六分之一;在Token只保存top-600、字节保存完整分布的设置下,存储量也只有约五分之一。但更少数据不代表更少计算。由于End-Of-Token在每个Token后加入结束标记,处理相同文本量时,训练计算量比普通字节模型高约30.94%。论文也尚未完成等推理成本下的公平比较。
论文作者包括华盛顿大学博士生Kalyani Marathe,她是论文一作,师从Luke Zettlemoyer;共同作者还包括Artidoro Pagnoni、Tomasz Limisiewicz、Margaret Li、Mike Lewis、Luke Zettlemoyer和Srinivasan Iyer等。Mike Lewis是Meta FAIR研究科学家,也是Llama 3预训练负责人之一;Luke Zettlemoyer是华盛顿大学Allen School教授,同时担任Meta FAIR Seattle负责人。论文链接为arXiv:2609.12303。