🔥 今日值得一读 非标准英语被路由到更小模型,37,704个句子揭示AI服务偏见!
Register Bias in Complexity-Based Large Language Model Routing
arXiv CL (cs.CL) 🔥 重点 安全对齐大模型论文方法 🕐 09-17 12:00

📖 AI 总结

该研究考察了基于复杂度的大语言模型路由机制中的偏见问题。作者指出,当前服务常用查询复杂度这一廉价指标,将简单查询分配给小型模型、困难查询分配给大型模型,但这一路由步骤并非语体中立。研究发现,非标准英语语体(如非裔美国人英语、第二语言写作者的英语)的文本,会被系统性地分配到能力更低的模型层级,即便其含义与标准英语版本完全相同。这一效应的根源在于输入长度这一常见路由信号:非标准语体常省略功能词,因而显得更短、更简单,而其他复杂度信号则不具备此效应。作者在37704对真实学习者句子及受控平行语料上验证了该差异,并在设备端、边缘端和云端模型阶梯上测量了质量后果,发现危害主要源于普遍存在的模型偏见——包括前沿云端模型在内的每一层级,对非标准语体查询的回答准确率都显著更低,而路由决策本身的边际质量成本在该基准上并不显著。研究由此指出,基于复杂度的路由会进一步加剧模型本已服务最差用户的暴露风险。

🔑 关键词速览

Register Bias语域偏差,指模型或系统对特定语言变体(如非标准英语)的系统性不公平对待。
Complexity-Based Routing基于复杂度的路由,根据查询复杂度估计将请求分配给不同能力模型的方法。
African American English非裔美国人英语,一种具有独特语法和词汇的非标准英语变体。
Function Words功能词,如冠词、介词等,主要起语法作用而非承载主要语义。
Model Ladder模型阶梯,指从设备端到云端按能力或规模排列的一系列模型。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅