该研究针对低资源语言处理中分词器失效的问题,提出了一种字节级分块的零样本迁移方法。论文指出,传统的子词分词器会将高频语言的频率模式强加于共享文字的低资源语言变体,而字节级模型虽能处理原始UTF-8字符,却在非拉丁文字的词级任务上存在粒度不匹配。为此,作者设计了一种自适应分层网络框架,通过从冻结的子词基座模型直接初始化字节嵌入,并引入分块对齐损失将动态分组的字节块映射到预计算的子词目标,同时辅以轻量级词性标注监督来引导边界检测。实验覆盖六种语言,结果显示该方法在词法任务上显著优于现有方案,词性标注准确率最高提升13.3%。该研究为低资源语言处理提供了无需大规模训练即可实现有效迁移的新思路。
| Subword tokenization | 子词分词,一种将文本分割成子词单元的方法,常用于语言模型预处理。 |
| Byte-level models | 字节级模型,直接处理原始UTF-8字节的模型,避免子词分词带来的频率偏差。 |
| Hierarchical byte-level architectures | 分层字节级架构,通过将字节分组为词对齐块来处理词级任务。 |
| Chunk alignment loss | 块对齐损失,一种损失函数,用于将动态分组的字节块投影到预计算的子词目标。 |
| POS tagging | 词性标注,为文本中的每个词分配词性标签的任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅