预分词边界让最优令牌数暴涨36.8%,压缩与预测竟偏好不同词典!
The Price of Token Boundaries: Compression Certificates and Prediction
arXiv AI (cs.AI) 论文方法大模型 🕐 今天 12:00

📖 AI 总结

这篇论文研究预分词边界对文本压缩成本的影响。作者通过最短路径与词汇预算选择,从有边界规则和无边界规则两侧界定最小token数,并用独立整数校验器验证结果。在英文维基百科上,边界规则使最优token数增加28.3%至36.8%;字节对编码比受限下界高2.1%,比无限制下界高10.9%。研究还发现压缩与预测偏好不同词典:在8500万非嵌入参数和匹配训练token预算下,无限制拟合在全部12种语言中均取得更低的平均留出比特每字节。为研究中间边界策略,作者提出边界许可证机制,限制可跨越切分的词汇条目。在独立英文和中文拟合语料上,仅许可10%词汇预算即可分别恢复85.2%和100.0%的token数缩减。该工作量化了边界的压缩代价,并将其与所得token单元的预测质量区分开来。

🔑 关键词速览

预分词在分词之前对文本进行初步分割的步骤,决定哪些文本片段可以成为预测单元。
字节对编码一种常见的子词分词算法,通过迭代合并频繁出现的字节对来构建词汇表。
边界许可证一种限制词汇表中允许跨越切割的条目的机制,用于研究中间边界策略。
线性规划松弛将整数规划问题放松为线性规划问题,以便于求解和获得下界。
每字节比特数衡量压缩或预测性能的指标,表示每个字节所需的平均比特数,值越低表示性能越好。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅