乌克兰语分词开销最高暴涨220%!9大生产级分词器实测837万词形,新方案把成本差距从2.22倍砍到1.30倍!
Beyond Two Bytes per Letter: Tokenization Overhead in Cyrillic AI Systems
arXiv CL (cs.CL) 多模态论文方法算力 🕐 08-25 12:00

📖 AI 总结

这篇论文系统量化了现代多语言分词器对乌克兰语等西里尔字母语言的处理开销问题。研究覆盖9种生产级分词器和5种同时具有西里尔及拉丁字母标准形式语言,分析了837万个词形。结果显示,乌克兰语在现代分词器上的分词开销达68-121%,在较老的cl100k模型上更高达220%。研究还发现,分词开销与分词器中西里尔词汇分配比例呈负相关,但统计显著性不足。在缓解策略方面,LLMLingua-2压缩方法可将乌克兰语输入长度减少47-49%且不损失信息价值;而采用20万词汇上限的平衡字节级BPE分词器,可将乌克兰语与英语的分词比率从2.22倍降至1.30倍。研究结论指出,训练数据分配不均导致西里尔语分词效率低下,但可通过推理阶段优化和分词器设计两个层面进行改善。

🔑 关键词速览

tokenization overhead分词开销,指分词器将文本分割成子词单元时产生的额外数量,导致成本和上下文容量增加。
full-text fertility全文本繁殖率,衡量分词器对完整文本生成的分词数量与参考标准的比率,用于量化分词效率。
LLMLingua-2一种基于语言模型的提示压缩方法,用于减少输入长度,同时保持语义完整性。
byte-level BPE tokenizer字节级字节对编码分词器,一种基于字节对编码的子词分词方法,适用于多语言处理。
RAG benchmark检索增强生成基准,用于评估结合检索和生成模型在特定任务上的性能。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅