这篇论文指出现有多语言亲属称谓评测普遍采用选择题形式,将理解简化为识别任务,因而可能高估大模型的真实能力。作者转而要求五个开源权重模型在印地语、泰米尔语和韩语中生成亲属称谓,并设置选项支持的匹配基线作对照。结果显示存在明显的“评测格式鸿沟”:GPT-OSS-120B在相同关系单元中选择正确率达90.67%,但生成可接受称谓的比例仅36.00%;Llama-3.3-70B同样呈现77.92%对24.24%的落差。在明确指定关系层级的提示下,各模型准确率从72.29%到24.24%不等。研究还发现父系优势具有语言特异性,在印地语中显著,在韩语中微弱甚至反转。该工作表明,即便关系被明确说明,文化特定亲属称谓的生成依然困难,因此有必要在选择题评测之外引入生成式评测。
| LLM | 大语言模型,指基于海量文本训练、能生成自然语言的大型神经网络模型。 |
| 亲属称谓 | 用于指称亲属关系的词汇,如“叔叔”“姑姑”,在不同文化中差异显著。 |
| 多项选择基准 | 一种评估方法,要求模型从给定选项中选出正确答案,而非自由生成。 |
| 生成式评估 | 要求模型直接生成文本答案的评估方式,更贴近实际语言使用场景。 |
| 父系优势 | 在亲属称谓任务中,模型对父系亲属关系的处理表现优于母系亲属关系的现象。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅