大型视觉语言模型(LVLMs)在众多任务中表现优异,但常从训练数据中继承社会偏见,导致在处理不同社会群体肖像时产生不公平行为。现有去偏方法多依赖单一刻板视角比较token概率,无法覆盖多元社会观点。受社会科学中“多样性促进公平”原则启发,该研究提出反事实集成解码(CED)框架:先在视觉表征空间中识别各社会群体语义方向,生成反事实表征以打破刻板叙事;解码时定位分歧最大的层,用不确定性感知权重集成多视角token分布,优先采纳不同群体的高置信token,形成更均衡的概率分布。在三个社会偏见基准上的实验显示,CED在职业、描述词和人格特质场景中最高将偏见降低47.97%,同时保持原模型核心能力,仅带来极小性能损失。该方法为LVLMs公平性提供了一种兼顾多样性与稳定性的新路径。
| Large Vision-Language Models (LVLMs) | 大型视觉-语言模型,能够同时处理图像和文本信息,执行多模态任务。 |
| Counterfactual Ensemble Decoding (CED) | 反事实集成解码,一种通过生成多群体反事实视角并在解码时集成以减轻偏见的新框架。 |
| Counterfactual steering | 反事实引导,在视觉表示空间中沿语义方向生成反事实表示,以提供多样视角。 |
| Uncertainty-aware weights | 不确定性感知权重,根据令牌预测的不确定性调整集成权重,优先高置信度令牌。 |
| Social bias | 社会偏见,模型从训练数据中继承的针对特定社会群体的刻板印象或歧视性倾向。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅