Meta 新研究:字节级蒸馏模型或反超 Token 级蒸馏
11 小时前

Meta FAIR与华盛顿大学团队共同提出字节级蒸馏方法,该方法将大模型教师的Token概率分布转换为字节级别,使学生模型能够学习字节级概率分布。团队提出了Marginalize-It和End-Of-Token两种转换方案,其中End-Of-Token方案能更完整地保留教师分布。实验结果表明,Token模型在前期学习速度较快,而字节模型具有更强的Scaling潜力。采用End-Of-Token蒸馏方案,下游平均准确率上限比传统Token蒸馏高出4个百分点,同时显著降低了数据和教师分布的存储压力。不过,该方案训练计算量略高,推理成本比较尚未完成。