该研究通过计算分析考察了大语言模型(LLM)对印度口头传统的叙事同质化问题。研究者选取了三种差异显著的印度传统——拉贾斯坦邦的帕布吉史诗、古典泰米尔桑加姆诗歌和孟加拉民间故事,收集了各传统的真实语料(分别为11、21和10段),并利用Claude Sonnet和Gemini两个模型生成了54组文本,涵盖通用、文化特定和区域语言三类提示。通过Sentence-BERT嵌入和余弦相似度分析,研究发现模型输出虽仍更接近自身传统,但跨传统相似度高达0.52-0.66,明显高于各传统实际应有的差异,表明存在部分同质化。意外的是,使用区域语言(印地语、泰米尔语或孟加拉语)提示反而降低了输出对真实传统的保真度,在拉贾斯坦和孟加拉传统中降幅高达27个百分点。这一发现与先前关于多语言提示的研究结果相矛盾,研究者认为这反映了“激发普遍文化多样性”与“模拟单一、记录较少的口头传统”之间的本质区别。该研究为LLM中印度文化误表征问题提供了轻量级、可扩展的量化评估方法。
| LLMs (Large Language Models) | 大型语言模型,基于海量文本训练的人工智能模型,能够生成和理解自然语言。 |
| Sentence-BERT | 一种基于BERT的句子嵌入模型,用于计算句子间的语义相似度。 |
| reference drift | 参考漂移,指模型输出与特定传统真实文本的接近程度相对于其他传统的偏离。 |
| cross-tradition convergence | 跨传统收敛,指模型在不同文化传统上的输出相似程度。 |
| homogenisation | 同质化,指模型将多样化的文化叙事简化为单一、统一模式的现象。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅