该论文提出了一种名为“模态成熟度指数”(MMI)的新基准,用于评估全模态大语言模型的多模态能力。现有评估框架主要聚焦于双模态理解(通常是文本加另一种模态),而MMI覆盖了文本、图像、音频、视频和文档五种模态,并测试最多三种模态的输入输出组合。基准包含893个自包含问题,每个问题附带人工撰写的评分标准,用于衡量模型在预期输出模态上的表现。研究者还引入了模态存在分数(MPS),以区分模型未能生成模态与生成内容错误的情况。对五个前沿多模态模型的测试显示,MPS得分范围仅为15.6至34.9,表明当前模型在模态覆盖方面存在显著不足。此外,一项独立实验发现,LLM评委依据评分标准与未接触标准的人类标注者在70.8%的判断上保持一致,验证了该评估方法的可行性。
| Modality Maturity Index (MMI) | 一种基准测试,用于评估大语言模型在多种模态(文本、图像、音频、视频和文档)及其组合下的多模态能力。 |
| omni models | 全能模型,指能够跨多种模态感知和响应的前沿语言模型。 |
| Modality Presence Score (MPS) | 模态存在分数,衡量模型在响应中生成预期输出模态的F1分数,用于区分模态缺失和内容错误。 |
| bimodal understanding | 双模态理解,指模型同时处理两种模态(如文本和图像)的能力。 |
| LLM judge | 使用大语言模型作为评判者,根据评分标准自动评估模型输出质量的机制。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅