该论文提出了一种名为CRISP的校准框架,用于改进遥感语义分割中的视觉状态空间模型(VSSD)。研究发现,VSSD在压缩空间上下文时过度平滑了边界响应,导致分割精度下降。CRISP包含两个核心组件:一是Duality Calibration Operator(DCO),通过残差注入和频率校准恢复局部对比度和边界响应,同时保持模型的线性复杂度;二是Orthogonal Multi-Prototype(OMP)分割头,为每个类别分配多个正交约束的原型,以更好地建模遥感图像中较大的类内差异。在Potsdam、Vaihingen和LoveDA三个数据集上的实验表明,CRISP在约3000万参数规模下,平均F1分数和mIoU均取得一致提升,性能与现有最先进方法相当。该工作已被ECCV 2026接收,代码已公开。
| Visual State Space Duality (VSSD) | 一种基于状态空间模型的视觉架构,通过全局聚合实现线性复杂度,但可能抑制高频细节。 |
| Duality Calibration Operator (DCO) | CRISP的核心组件,通过残差注入和频率校准恢复局部对比度和边界响应。 |
| Orthogonal Multi-Prototype (OMP) head | 一种分类头,为每个类别分配多个正交约束的原型,以处理类内方差。 |
| Remote sensing semantic segmentation | 遥感图像中逐像素分类的任务,用于识别地物类别,如建筑、植被等。 |
| Linear complexity | 算法复杂度随输入大小线性增长,相比Transformer的二次复杂度更高效。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅