🔥 今日值得一读 英语安全锁失灵了?印度6种语言实测LLM偏见,孟加拉语最危险!
Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs
arXiv AI (cs.AI) 🔥 重点 #安全对齐#跨语言#LLM 🕐 08-20 12:00
👨‍💼 主理人解读 · 为什么值得关注
揭示LLM安全对齐的英语中心化漏洞,跨语言输入可绕过过滤,需加强多语言安全训练。

📖 AI 总结

这篇论文揭示了大型语言模型(LLMs)安全对齐训练中的跨语言安全缺口问题。由于现有安全对齐主要基于英语,当模型处理非英语语言时,安全过滤机制可能失效,导致语音助手和对话系统输出强化刻板印象的内容,对非英语社区传播有害偏见。针对印度语言多样性背景,作者提出了INCLUDE基准,一个包含2604个提示、覆盖英语、印地语、孟加拉语、马拉地语、泰米尔语和印地英语混合六种语言的多语言评估工具。研究对十个开源和闭源模型进行了14988个偏见分数分析,发现两个关键结果:开源模型中孟加拉语产生最高平均偏见分数;英语表现出现反转——在开源模型中偏见最低,但在闭源模型中偏见最高。该研究强调了跨语言安全评估的必要性,为多语言环境下的AI安全部署提供了重要参考。

🔑 关键词速览

Safety Alignment安全对齐,指训练语言模型以遵循安全准则、避免生成有害内容的过程。
Cross-Lingual Safety Gap跨语言安全差距,指模型在不同语言上的安全性能不一致,非英语语言往往更易产生有害输出。
INCLUDE一个多语言评估基准,用于量化以印度为中心的社会文化偏见。
Hinglish兴都语,印地语和英语的混合语,在印度广泛使用。
Bias Score偏见分数,用于量化模型输出中社会文化偏见程度的指标。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅