Meta FAIR与华盛顿大学联合发表研究,提出将知识蒸馏的学习单位从Token切换为Byte,让学生模型直接学习教师模型在字节级别的概率分布。团队设计了Marginalize-It和End-Of-Token两种方法,将教师Token概率分布完整映射到字节空间,且仅需一次前向计算。以Llama 3-8B为教师的实验显示,Token模型在低计算量下学得更快但很快触及平台期,字节模型起步慢却随计算量持续改善,展现出更强的Scaling潜力。经拟合训练计算量与下游表现的关系,End-Of-Token蒸馏的预测准确率上限达52.4%,比传统Token蒸馏高出4个百分点。该研究的意义在于:字节级建模将候选空间从十几万压缩至256,在降低存储与计算成本的同时,反而打开了更高的能力天花板,为大模型蒸馏提供了新的方向。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅