GPT-5.1等三大模型乌尔都语故事生成翻车:93个故事全是语法错误和文化浅薄!
Multilingual in Name Only? Cultural and Linguistic Weaknesses of LLMs in Urdu
arXiv CL (cs.CL) 重要 大模型论文方法 🕐 09-11 12:00

📖 AI 总结

这项研究以乌尔都语为低资源语言代表,考察了多语言大语言模型在开放式故事生成任务中的实际表现。研究者使用GPT-5.1、Qwen-3-Max和DeepSeek-3.1三个当代模型生成了包含93篇故事的数据集Urdu-Stories,并依据涵盖语言学、语义和文化的九类标注体系进行人工错误标注。结果显示,模型频繁出现基础语法和语义错误,生成的故事缺乏连贯性,存在不自然的重复,并普遍表现出文化浅薄的问题。研究进一步通过少样本提示验证,发现文化与语境类错误基本未能得到改善。该研究揭示了当前大语言模型在低资源语言内容生成和信息检索方面的可靠性局限,说明其"多语言"能力在很大程度上名不副实。

🔑 关键词速览

多语言大语言模型支持多种语言处理的大规模预训练语言模型,但可能在低资源语言上表现不佳。
低资源语言在数字资源和训练数据中可用文本较少的语言,如乌尔都语。
故事生成自然语言处理任务,旨在自动生成连贯、有意义的叙事文本。
少样本提示在提示中提供少量示例来引导模型完成特定任务的方法。
文化浅薄性生成内容缺乏文化深度和语境适当性,表现为对文化细节的忽视或误解。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅