多智能体协作让AI读懂艺术情感,总体得分0.8870,描述准确率99.52%!
ArtSociety: Multi-Agent Multimodal Collaboration for Art Emotion Understanding
arXiv CV (cs.CV) 重要 #多智能体#多模态#情感计算 🕐 09-15 12:00

📖 AI 总结

针对艺术情感理解任务中细粒度情感分类、效价-唤醒度预测与属性描述之间存在权衡、单一模型难以兼顾的问题,研究者提出多智能体框架ArtSociety。该框架整合DINOv2-Giant视觉智能体、场景化思维链微调的多模态大模型及三个闭源推理智能体,并引入两个免训练控制器:面向稀有类别的投票仲裁机制通过降低尾部情感的一致性阈值,利用不同智能体家族间去相关的错误模式提升识别效果;描述优先推理智能体采用先描述后分类的思维链,强制在给出标签前先获取视觉证据。任务路由策略将困难的情感分类交给五智能体集成,将接近饱和的效价-唤醒度与描述任务交给单一最强推理智能体。在官方测试集上,整体得分0.8870,分类0.7789,描述0.9952。消融实验表明,当方法与规模在约0.76处饱和后,决定性增益来自智能体协作与数据侧监督,而非单纯扩大模型规模。

🔑 关键词速览

AffectiveArt一个用于多维艺术情感理解的基准任务,要求同时预测艺术品的细粒度情感、效价/唤醒度和属性描述。
ArtSociety本文提出的多智能体多模态协作框架,通过集成异构专家和免训练控制器来提升艺术情感理解性能。
DINOv2-Giant一种大规模视觉自监督预训练模型,作为视觉智能体用于提取艺术品的视觉特征。
CoT(思维链)Chain-of-Thought,一种引导模型逐步推理的提示或微调方法,本文中用于强制先描述视觉证据再分类。
MoE(混合专家)Mixture of Experts,一种模型架构,通过多个专家网络和门控机制提升模型容量与效率。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅