本文提出MAVEN框架,用于评估多模态内容与宏观社会价值观(如和平、正义、自由)的一致性。现有方法多局限于安全分类、纯文本心理测试或单一标签,难以全面覆盖复杂价值维度。MAVEN基于国际人权文书和文化价值理论,构建了包含6个主要维度和72个次级指标的层级体系,支持多级量化评分。研究团队开发了人工验证的多模态基准和软匹配指标,以测试视觉语言模型(VLMs)的价值判断能力。为优化评估器,他们提出跨度自适应多级偏好优化(SA-MDPO)和推理时的无训练多角色共识策略。实验显示,2B参数的紧凑评估器性能与其8B版本相当,接近前沿闭源模型,为可扩展的宏观价值评估提供了实用方案。相关代码和基准已开源。
| MAVEN | 一个用于多模态内容宏观社会价值观评估的分层框架,基于国际人权文书和文化价值理论。 |
| 宏观社会价值观 | 指如和平、正义、自由等社会层面的普遍价值观念,用于评估内容是否符合社会规范。 |
| 视觉语言模型(VLM) | 能够同时处理图像和文本的AI模型,用于多模态内容的理解和评估。 |
| 多级偏好优化(MDPO) | 一种优化方法,通过多级偏好信号来训练模型,此处用于评估器的蒸馏。 |
| 软匹配度量 | 一种评估指标,允许部分匹配而非严格匹配,用于衡量模型评估与人类标注的一致性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅