多语言模型答非所问?新研究:统一评测揭示训练后方法更稳,直接对齐全场景提效!
A Systematic Evaluation of Cross-Lingual Consistency Enhancement Methods in Multilingual Language Models
arXiv CL (cs.CL) 重要 #多语言#评测基准#问答 🕐 09-07 12:00

📖 AI 总结

该研究对多语言大模型中提升跨语言一致性(CLC)的方法进行了系统评估,统一比较了推理时干预和训练后调整两大类方法,覆盖三个模型家族和三个封闭式问答基准。结果显示,训练后方法整体更可靠,其中直接分布对齐在所有模型与数据集组合中均稳定提升跨语言一致性,而其他方法对答案格式和语言覆盖广度较为敏感。研究还发现,跨领域迁移效果有限,除非源任务与目标任务输出格式相似。针对文化相关问题,封闭式评估中未发现一致性增强导致系统性性能下降,但开放式生成中非英语回答偶尔出现准确率降低。该工作强调,评估跨语言一致性增强方法时,需同时关注跨领域鲁棒性与文化适应性差异,为后续训练方法和基准建设提供了参考方向。

🔑 关键词速览

Cross-Lingual Consistency (CLC)跨语言一致性,指模型对语义等价但语言不同的问题给出相同回答的能力。
Inference-time interventions推理时干预,指在模型推理阶段应用的技术,旨在调整输出以提高一致性,无需重新训练。
Post-training methods训练后方法,指在模型预训练后通过额外训练或微调来增强特定能力的技术。
Distribution alignment分布对齐,一种训练后方法,通过调整不同语言表示的概率分布来增强跨语言一致性。
Closed-form benchmarks封闭式基准测试,指具有固定答案格式(如多项选择)的评估数据集,便于自动评分。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅