该研究针对多模态大语言模型(MLLMs)在系统消息约束下的表现提出了一项新基准VSysBench。现有评测多局限于文本或用户指令,缺乏对多模态场景中系统消息遵从度的系统衡量。VSysBench基于MMVet-v2构建,将约束分为5大类、22个子类,涵盖视觉情境中的文本指令到完全基于视觉的指令,并为每项约束设计了冲突性对照以测试指令层级。研究采用联合满意度率(JSR)和跨约束敏感性(CCS)两个维度评估模型。对16个MLLMs的测试发现:系统消息会显著降低模型的基础任务准确率;面对用户冲突指令,开源模型遵从性明显下降,而顶尖闭源模型保持稳定;视觉锚定约束对所有模型而言都是最难遵循的类别。该研究为多模态系统消息的评测提供了系统化框架,揭示了遵从性与基础能力之间的权衡。
| Multimodal Large Language Models (MLLMs) | 多模态大语言模型,能处理文本和图像等多种输入模态的AI模型。 |
| System Messages | 系统消息,用于在对话或任务中设定模型行为规则的指令。 |
| Joint Satisfaction Rate (JSR) | 联合满足率,同时衡量约束遵循和答案正确性的指标。 |
| Cross-Constraint Sensitivity (CCS) | 跨约束敏感性,衡量模型在不同约束冲突下表现变化的指标。 |
| Instructional Hierarchy | 指令层级,指不同来源指令(如系统消息与用户指令)之间的优先级关系。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅