该研究检验了用多个视觉语言模型组成评审团来评估图像美学的常见做法,发现无论是简单平均还是学习式融合,整体性评审团都未能显著优于其中最好的单个模型,说明评审团的价值取决于输入内容而非投票机制。作者转而让每个模型按一套固定的人工撰写评分标准,从五个维度分别打分,再结合各模型的整体判断进行跨模型家族的折外融合。结果显示,维度评分确实携带了与其标签相符的属性信息,在30个模型-属性组合中有28个优于整体性提示;融合后在EVA数据集的全部十个三家族评审团中均超过最佳单模型,最强组合的斯皮尔曼相关系数提升0.07,预注册组合提升0.10,而PARA数据集上则基本持平。该增益并非特征数量所致,但代价是额外标注、数据集间不可迁移以及约4.8倍的API调用。
| Vision-language models (VLMs) | 视觉语言模型,能够同时处理图像和文本的多模态模型,此处用于零样本图像美学评判。 |
| Rubric | 评分标准,此处指人类编写的、用于分解美学评价的五个维度的固定准则。 |
| Out-of-fold combiner | 折外组合器,一种在交叉验证中利用未用于训练模型的数据来学习融合多个模型预测的元学习器。 |
| Spearman rho | 斯皮尔曼等级相关系数,衡量两个变量排序之间单调关系的非参数指标。 |
| Kendall tau-b | 肯德尔秩相关系数(tau-b),衡量两个变量排序一致性的非参数指标,对并列值有调整。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅