🔥 今日值得一读 字节模型用六分之一数据反超词元模型,性能上限高出4%!
Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models
arXiv CL (cs.CL) 🔥 重点 #知识蒸馏#分词#模型压缩#缩放定律 🕐 09-14 12:00
👨‍💼 主理人解读 · 为什么值得关注
想用字节级模型替代tokenizer的开发者,可参考其logits转换与蒸馏扩展规律来设计小模型。

📖 AI 总结

本文比较了字节模型与词元模型在知识蒸馏下的扩展规律。研究者提出两种将词元logits高效转换为字节logits的方法:近似的Marginalize-It与精确的End-Of-Token,并首次在约10亿参数、最多1万亿字节数据规模上,同时改变分词方案与训练目标进行大规模实验。结果显示,词元模型在低算力区间表现更优但很快趋于平台,而字节模型起步较差却随算力增加反超,达到更高的下游任务性能上限。外推预测,蒸馏后的End-Of-Token模型渐近性能可超出词元模型约4%,且数据效率更高,仅需六分之一训练数据即可持平。此外,256字节的小词表省去了top-k截断,logit存储成本降至约五分之一。该研究为小模型蒸馏提供了新的分词与扩展视角。

🔑 关键词速览

蒸馏一种模型压缩技术,通过让小型模型学习大型模型的输出分布来提升其性能。
分词方案将文本分割成词元或字节等基本单元的方法,影响模型处理文本的方式。
字节模型以字节为基本处理单元的模型,通常词汇表较小,能避免分词带来的问题。
词元模型以词元为基本处理单元的模型,通常词汇表较大,是当前主流方法。
缩放定律描述模型性能随计算量、数据量等规模因素变化规律的数学关系。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅