壁画碎片识别新突破:准确率从0.604飙至0.656!
Fragment-Aware Vision Transformers for Fresco-Fragment Style Classification
arXiv CV (cs.CV) 重要 #Vision Transformer#风格分类#文化遗产 🕐 今天 12:00

📖 AI 总结

本文研究壁画残片的艺术风格分类问题。与通常针对完整艺术品的风格识别不同,考古场景中的艺术品往往仅以残缺、不规则且缺乏上下文的形式留存,模型难以借助整体构图与图像结构进行判断。作者提出一种渐进式的Transformer框架:以ViT-B/16为基线,引入前景引导掩码以抑制纯背景token,采用基于修复的几何正则化使不规则残片与ViT的patch网格对齐,并设计了一种在预测分布上通过KL相似度运作的监督对比目标,该目标在所有分支上均带来稳定提升。各分支通过一个刻意简化的可学习logit集成进行组合。在CLEOPATRA和POMPAAF数据集上的实验表明,残片感知建模优于标准ViT基线,集成方法将CLEOPATRA上的准确率从0.604提升至0.656,宏F1从0.596提升至0.648,并在POMPAAF的六种碎片化设置中的四种优于最佳单分支。作者还评估了更复杂的图融合变体,发现其仅在CLEOPATRA上有小幅数据集特定增益,不足以证明其额外复杂度的合理性。该工作的贡献包括一个能持续锐化单分支识别的分布级对比目标,以及一项可解释性分析,验证模型确实利用了真实的绘画证据,同时量化了基于修复的分支部分归因来自合成周边区域。

🔑 关键词速览

Vision Transformer (ViT)一种将图像分割为固定大小分块并直接应用Transformer架构进行视觉任务的模型。
前景引导掩码一种通过抑制背景区域对应的标记,使模型聚焦于前景碎片区域的注意力机制。
基于修复的几何正则化利用图像修复技术填充碎片的不规则边缘,使其与ViT分块网格对齐的预处理方法。
监督对比目标一种利用标签信息在嵌入空间中拉近同类样本、推远异类样本的损失函数。
Kullback-Leibler相似度一种基于KL散度衡量两个概率分布之间差异的度量,此处用于对比预测分布。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅