本研究将 QuanLing 语言距离量化框架从北日耳曼语系扩展至西罗曼语系,以法语、葡萄牙语、西班牙语和意大利语为对象,检验该框架的跨语系适用性。研究采用150组四语平行句,结合 LaBSE 句向量距离、四种单语 BERT 分词器的碎片化率以及 mBERT 掩码语言模型互懂度进行测量。结果显示,葡萄牙语与西班牙语距离最近(LaBSE 距离0.0229),法语与意大利语最远(0.0338);LaBSE 与 mBERT 在六对语言中有四对排序一致,表明跨模型稳健性。西罗曼语系的绝对距离跨度大于北日耳曼语系(0.011 对 0.008),但相对比值相近(1.48 对 1.67),与更长的分化时间相符。法语表现出更高的掩码预测准确率(36.12% 对意大利语的29.28%),反映其拼写与音系脱钩的特征。该跨语系验证进一步支持 QuanLing 框架的普适性。
| QuanLing | 一个结合语言距离度量与语言属性分析的定量语言学框架,基于预训练语言模型。 |
| LaBSE | 语言无关的BERT句子嵌入模型,用于计算跨语言句子相似度。 |
| 分词碎片化率 | 衡量文本被分词器切分为子词单元程度的指标,反映语言形态复杂度。 |
| mBERT | 多语言BERT,一种在104种语言上预训练的掩码语言模型,用于跨语言理解任务。 |
| 互通性 | 在掩码语言模型任务中,模型预测被掩码词的能力,间接反映语言间的可理解程度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅