树枝细结构深度估计误差仅1.31像素,还开源5520对合成数据!
EMCStereo: Attention-Enhanced Stereo Matching for Thin-Structure Depth Estimation with a Synthetic Tree-Branch Benchmark
arXiv CV (cs.CV) 重要 #立体匹配#注意力机制#深度估计 🕐 09-15 12:00

📖 AI 总结

本文针对细结构(如树枝)深度估计这一立体匹配难题展开研究,指出此类目标像素宽度极小、背景杂乱且真实数据难以人工标注稠密真值。作者提出EMCStereo,在PSMNet式代价体主干中引入三种轻量注意力模块:作用于深层语义特征的EMA、以空间金字塔权重学习替代简单拼接的MSFblock,以及作用于最终匹配特征的CoordAtt;由于MSFblock将四路金字塔分支合并为一,网络反而缩小2.0%,推理时间仅增加1.7%。同时构建了基于虚幻引擎5与模拟ZED Mini相机渲染的合成数据集VirtualTree,包含5520对带精确视差的树枝图像。八组消融实验确立了0.009像素的逐次运行噪声下限。EMCStereo在VirtualTree测试集上取得1.31像素EPE与5.96%的D1-all,在SceneFlow、KITTI 2012/2015、ETH3D和Middlebury上分别为1.00、0.80、0.73、0.62和3.19像素,深度精度delta_1达92.6%至98.7%。对照噪声下限,该注意力组合在100轮训练预算下精度中性,MSFblock与CoordAtt仅在缺少EMA时带来0.03至0.05像素的代价。

🔑 关键词速览

EMCStereo本文提出的立体匹配模型,通过集成三个轻量级注意力模块来提升细结构深度估计精度。
Efficient Multi-scale Attention (EMA)一种高效的多尺度注意力机制,用于增强深层语义特征的表征能力。
MSFblock多尺度融合块,学习空间金字塔权重而非简单拼接,以压缩分支并减少计算量。
Coordinate Attention (CoordAtt)坐标注意力机制,将位置信息嵌入通道注意力,用于最终匹配特征以提升空间定位精度。
VirtualTree在 Unreal Engine 5 中渲染的合成立体数据集,提供细树枝的精确视差真值,用于训练和评估。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅