Meta研究:字节级蒸馏或在扩展后超越Token模型
Meta与华盛顿大学研究者发现,字节级蒸馏模型起步较慢,却可能在更大训练规模下取得更高能力上限并降低教师分布存储压力。
研究提出了什么
Meta FAIR与华盛顿大学研究者探讨了一条不同的小模型训练路线:让学生模型按字节学习教师模型的知识,而不是直接复制教师的Token词表。知识蒸馏的一个现实难题是,Token词表往往包含超过10万个候选项,完整保存教师的概率分布成本很高,实际操作通常只能保留一部分高概率Token。
研究提出的方法把Token概率转换成字节级训练目标。一种方法会沿着匹配的字节前缀累加概率;另一种方法加入明确的Token结束标记,使学生能够保留教师Token边界的信息。由于单个字节只有256种可能,完整概率分布比大规模Token分布更容易存储。
实验说明了什么
团队以Llama 3 8B作为教师,比较了Token模型与字节模型在监督训练和蒸馏训练下的表现。字节模型在较低计算量阶段学习更慢,但论文根据缩放曲线推算,带Token结束标记的字节蒸馏方案可能达到高于传统Token蒸馏的下游准确率上限,预测差距约为4个百分点。
不过,这仍是外推结果,并非已经验证的部署优势。字节模型需要生成更多预测步骤,其中一个表现最好的方案训练计算量也更高;论文尚未完成等推理成本下的公平比较。
为什么重要
这项工作挑战了“分词只是工程细节”的默认看法。如果更大规模实验能够复现其缩放趋势,字节级学生模型或许能降低蒸馏数据保存成本,也减少对教师模型专有Tokenizer的依赖。眼下更准确的结论是:Token模型仍然拥有早期效率优势,但小模型训练可能存在一条更慢起步、长期上限更高的路线。