针对艺术情感理解任务中细粒度情感分类、效价-唤醒度预测与属性描述之间存在权衡、单一模型难以兼顾的问题,研究者提出多智能体框架ArtSociety。该框架整合DINOv2-Giant视觉智能体、场景化思维链微调的多模态大模型及三个闭源推理智能体,并引入两个免训练控制器:面向稀有类别的投票仲裁机制通过降低尾部情感的一致性阈值,利用不同智能体家族间去相关的错误模式提升识别效果;描述优先推理智能体采用先描述后分类的思维链,强制在给出标签前先获取视觉证据。任务路由策略将困难的情感分类交给五智能体集成,将接近饱和的效价-唤醒度与描述任务交给单一最强推理智能体。在官方测试集上,整体得分0.8870,分类0.7789,描述0.9952。消融实验表明,当方法与规模在约0.76处饱和后,决定性增益来自智能体协作与数据侧监督,而非单纯扩大模型规模。
| AffectiveArt | 一个用于多维艺术情感理解的基准任务,要求同时预测艺术品的细粒度情感、效价/唤醒度和属性描述。 |
| ArtSociety | 本文提出的多智能体多模态协作框架,通过集成异构专家和免训练控制器来提升艺术情感理解性能。 |
| DINOv2-Giant | 一种大规模视觉自监督预训练模型,作为视觉智能体用于提取艺术品的视觉特征。 |
| CoT(思维链) | Chain-of-Thought,一种引导模型逐步推理的提示或微调方法,本文中用于强制先描述视觉证据再分类。 |
| MoE(混合专家) | Mixture of Experts,一种模型架构,通过多个专家网络和门控机制提升模型容量与效率。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅