该研究通过逻辑回归探针与logit-lens两种可解释性方法,考察大语言模型中文字系统知识在各层的分布情况。探针实验揭示出一种明显的非对称性:输入文字系统与指令要求的输出文字系统均在网络最浅层即被编码,而对实际输出文字系统的承诺却直到最后几层才出现,模型中间层的大部分表征默认停留在拉丁字母。logit-lens分析进一步确认,文字系统的最终确定始终发生在模型的最后几层。此外,较小模型在遵循文字系统指令方面表现更弱。这些结果共同表明,文字系统承诺与模型深度密切相关,对设计足够深且更具包容性的多语言架构具有启示意义。
| logistic regression probing | 一种可解释性方法,通过训练逻辑回归分类器来探测模型内部表示中编码的特定信息。 |
| logit-lens analysis | 一种分析技术,通过将中间层的表示直接映射到输出词汇空间,来观察模型在不同层的预测倾向。 |
| script commitment | 模型在生成过程中最终确定输出文字(如拉丁字母、阿拉伯字母等)的决策点。 |
| LLMs | 大型语言模型,指具有大量参数的深度学习模型,用于自然语言处理任务。 |
| multilingual architectures | 支持多种语言处理的模型架构,旨在公平有效地处理不同语言。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅