本文比较了字节模型与词元模型在知识蒸馏下的扩展规律。研究者提出两种将词元logits高效转换为字节logits的方法:近似的Marginalize-It与精确的End-Of-Token,并首次在约10亿参数、最多1万亿字节数据规模上,同时改变分词方案与训练目标进行大规模实验。结果显示,词元模型在低算力区间表现更优但很快趋于平台,而字节模型起步较差却随算力增加反超,达到更高的下游任务性能上限。外推预测,蒸馏后的End-Of-Token模型渐近性能可超出词元模型约4%,且数据效率更高,仅需六分之一训练数据即可持平。此外,256字节的小词表省去了top-k截断,logit存储成本降至约五分之一。该研究为小模型蒸馏提供了新的分词与扩展视角。
| 蒸馏 | 一种模型压缩技术,通过让小型模型学习大型模型的输出分布来提升其性能。 |
| 分词方案 | 将文本分割成词元或字节等基本单元的方法,影响模型处理文本的方式。 |
| 字节模型 | 以字节为基本处理单元的模型,通常词汇表较小,能避免分词带来的问题。 |
| 词元模型 | 以词元为基本处理单元的模型,通常词汇表较大,是当前主流方法。 |
| 缩放定律 | 描述模型性能随计算量、数据量等规模因素变化规律的数学关系。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅