LLM亲属称谓识别90%却生成仅36%,多选题高分竟是假象!
Recognized but Not Produced: A Generation Benchmark for Culturally Specific Kinship Terms
arXiv CL (cs.CL) 重要 #评测基准#多语言#文化知识 🕐 今天 12:00

📖 AI 总结

这篇论文指出现有多语言亲属称谓评测普遍采用选择题形式,将理解简化为识别任务,因而可能高估大模型的真实能力。作者转而要求五个开源权重模型在印地语、泰米尔语和韩语中生成亲属称谓,并设置选项支持的匹配基线作对照。结果显示存在明显的“评测格式鸿沟”:GPT-OSS-120B在相同关系单元中选择正确率达90.67%,但生成可接受称谓的比例仅36.00%;Llama-3.3-70B同样呈现77.92%对24.24%的落差。在明确指定关系层级的提示下,各模型准确率从72.29%到24.24%不等。研究还发现父系优势具有语言特异性,在印地语中显著,在韩语中微弱甚至反转。该工作表明,即便关系被明确说明,文化特定亲属称谓的生成依然困难,因此有必要在选择题评测之外引入生成式评测。

🔑 关键词速览

LLM大语言模型,指基于海量文本训练、能生成自然语言的大型神经网络模型。
亲属称谓用于指称亲属关系的词汇,如“叔叔”“姑姑”,在不同文化中差异显著。
多项选择基准一种评估方法,要求模型从给定选项中选出正确答案,而非自由生成。
生成式评估要求模型直接生成文本答案的评估方式,更贴近实际语言使用场景。
父系优势在亲属称谓任务中,模型对父系亲属关系的处理表现优于母系亲属关系的现象。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅