语言先验注入RGB-D分割,DTFormer三模态对齐实现性能一致提升!
DTFormer: Text-Guided Semantic Alignment for RGB-D Segmentation
arXiv CV (cs.CV) 重要 #多模态#语义分割#RGB-D 🕐 今天 12:00

📖 AI 总结

本文提出DTFormer,一种文本引导的三模态(RGB-D-文本)语义分割框架,旨在解决主流RGB-D分割模型仅依赖像素级监督、缺乏高层语义约束的问题。其核心是文本引导语义对齐模块(TSAM),该模块先将文本线索编码为一组语义原型,再在编码器和解码器的多个层级上,显式地将多模态RGB-D特征与这些原型对齐,从而对表示学习施加强语义正则化,引导网络学习更具判别力的特征。在多个基准数据集上的实验表明,DTFormer在保持简洁高效的同时取得了一致性性能提升,验证了显式语义对齐是改进RGB-D语义分割的一条有效且实用的路径。

🔑 关键词速览

RGB-D 语义分割结合彩色(RGB)与深度(D)图像,为每个像素预测语义类别的任务。
DTFormer本文提出的三模态(RGB-D-文本)语义分割框架,通过文本引导实现语义对齐。
文本引导语义对齐模块(TSAM)将文本线索编码为语义原型,并在编码器和解码器多层将 RGB-D 特征与原型对齐的模块。
语义原型从文本中提取的一组代表类别语义的向量表示,用于对齐多模态特征。
语义正则化通过高层语义约束引导网络学习更具判别性特征的正则化手段。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅