这篇论文研究预分词边界对文本压缩成本的影响。作者通过最短路径与词汇预算选择,从有边界规则和无边界规则两侧界定最小token数,并用独立整数校验器验证结果。在英文维基百科上,边界规则使最优token数增加28.3%至36.8%;字节对编码比受限下界高2.1%,比无限制下界高10.9%。研究还发现压缩与预测偏好不同词典:在8500万非嵌入参数和匹配训练token预算下,无限制拟合在全部12种语言中均取得更低的平均留出比特每字节。为研究中间边界策略,作者提出边界许可证机制,限制可跨越切分的词汇条目。在独立英文和中文拟合语料上,仅许可10%词汇预算即可分别恢复85.2%和100.0%的token数缩减。该工作量化了边界的压缩代价,并将其与所得token单元的预测质量区分开来。
| 预分词 | 在分词之前对文本进行初步分割的步骤,决定哪些文本片段可以成为预测单元。 |
| 字节对编码 | 一种常见的子词分词算法,通过迭代合并频繁出现的字节对来构建词汇表。 |
| 边界许可证 | 一种限制词汇表中允许跨越切割的条目的机制,用于研究中间边界策略。 |
| 线性规划松弛 | 将整数规划问题放松为线性规划问题,以便于求解和获得下界。 |
| 每字节比特数 | 衡量压缩或预测性能的指标,表示每个字节所需的平均比特数,值越低表示性能越好。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅