🔥 今日值得一读 多模态模型一加系统指令就翻车?16款大模型实测:准确率暴跌,视觉约束最难!
Compliance, Capability, and Conflict: Benchmarking Multimodal LLMs under System Messages
arXiv CL (cs.CL) 🔥 重点 #多模态#系统消息#评测基准 🕐 08-21 12:00
👨‍💼 主理人解读 · 为什么值得关注
构建多模态LLM在系统消息下的合规性评测基准,衡量模型遵循指令与能力冲突的情况。

📖 AI 总结

该研究针对多模态大语言模型(MLLMs)在系统消息约束下的表现提出了一项新基准VSysBench。现有评测多局限于文本或用户指令,缺乏对多模态场景中系统消息遵从度的系统衡量。VSysBench基于MMVet-v2构建,将约束分为5大类、22个子类,涵盖视觉情境中的文本指令到完全基于视觉的指令,并为每项约束设计了冲突性对照以测试指令层级。研究采用联合满意度率(JSR)和跨约束敏感性(CCS)两个维度评估模型。对16个MLLMs的测试发现:系统消息会显著降低模型的基础任务准确率;面对用户冲突指令,开源模型遵从性明显下降,而顶尖闭源模型保持稳定;视觉锚定约束对所有模型而言都是最难遵循的类别。该研究为多模态系统消息的评测提供了系统化框架,揭示了遵从性与基础能力之间的权衡。

🔑 关键词速览

Multimodal Large Language Models (MLLMs)多模态大语言模型,能处理文本和图像等多种输入模态的AI模型。
System Messages系统消息,用于在对话或任务中设定模型行为规则的指令。
Joint Satisfaction Rate (JSR)联合满足率,同时衡量约束遵循和答案正确性的指标。
Cross-Constraint Sensitivity (CCS)跨约束敏感性,衡量模型在不同约束冲突下表现变化的指标。
Instructional Hierarchy指令层级,指不同来源指令(如系统消息与用户指令)之间的优先级关系。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅