100种语言+20种编程语言!开源框架Tokka-Bench五大指标评测7大分词器
Tokka-Bench: Evaluating Tokenizers Across 100 Natural and 20 Programming Languages
arXiv CL (cs.CL) 重要 大模型论文方法开源 🕐 今天 12:00

📖 AI 总结

Tokka-Bench 是一个开源的分词器评测框架,旨在填补大语言模型分词质量缺乏标准化多指标比较的空白。该框架在100种自然语言(涵盖30多种文字系统)和20种编程语言上,采用适配各书写系统的语言感知分词方法,从每token字节数、唯一token覆盖率、子词繁殖率、词切分率和词表构成五个互补维度对分词器进行评估。研究比较了GPT-2、GPT-4、gpt-oss、Llama 3.1、Gemma 3、Qwen3和Kimi K2七种BPE分词器,发现词表分配策略比词表绝对规模更能决定分词效率,且近期分词器在编程语言上的效率已趋于一致,尽管其在自然语言上的表现仍存在明显差异。该工作为分词器的跨语言公平性评估提供了可复用的基准、数据和交互式仪表盘。

🔑 关键词速览

Tokka-Bench一个开源的多语言分词器评估框架,涵盖100种自然语言和20种编程语言。
BPE字节对编码,一种常见的子词分词算法,通过迭代合并频繁字符对构建词汇表。
subword fertility子词繁殖率,衡量每个单词平均被分割成多少个子词,反映分词粒度。
word-split rate词分割率,指单词被切分成多个词元的比例,用于评估分词器对词汇边界的保持能力。
vocabulary composition词汇组成,指分词器词汇表中不同语言或类型词元的分布情况。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅