Tokka-Bench 是一个开源的分词器评测框架,旨在填补大语言模型分词质量缺乏标准化多指标比较的空白。该框架在100种自然语言(涵盖30多种文字系统)和20种编程语言上,采用适配各书写系统的语言感知分词方法,从每token字节数、唯一token覆盖率、子词繁殖率、词切分率和词表构成五个互补维度对分词器进行评估。研究比较了GPT-2、GPT-4、gpt-oss、Llama 3.1、Gemma 3、Qwen3和Kimi K2七种BPE分词器,发现词表分配策略比词表绝对规模更能决定分词效率,且近期分词器在编程语言上的效率已趋于一致,尽管其在自然语言上的表现仍存在明显差异。该工作为分词器的跨语言公平性评估提供了可复用的基准、数据和交互式仪表盘。
| Tokka-Bench | 一个开源的多语言分词器评估框架,涵盖100种自然语言和20种编程语言。 |
| BPE | 字节对编码,一种常见的子词分词算法,通过迭代合并频繁字符对构建词汇表。 |
| subword fertility | 子词繁殖率,衡量每个单词平均被分割成多少个子词,反映分词粒度。 |
| word-split rate | 词分割率,指单词被切分成多个词元的比例,用于评估分词器对词汇边界的保持能力。 |
| vocabulary composition | 词汇组成,指分词器词汇表中不同语言或类型词元的分布情况。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅