针对高光谱图像分类中光谱-空间异质性强、空间结构复杂导致像素级分类困难的问题,本文提出Token聚类与语义序列Mamba模型(STMamba)。现有视觉状态空间模型通常依据预设空间邻域构建序列,未显式考虑语义相似性与空间非平稳性。STMamba在宏观层面采用层次化编码器-解码器,通过Token聚类模块逐步筛选语义Token,并利用无参数跨尺度邻域注意力上采样器恢复密集特征;在微观层面,该模块先以密度感知聚类确定代表性聚类中心并估计软隶属度,再通过四叉树动态选择策略从各语义簇中保留稀疏且空间分布的Token,形成连贯的语义Token序列,减少冗余像素表示。并行的空间与光谱语义序列Mamba模块在同类语义Token序列内捕获长程空间和光谱依赖,同时抑制异质区域间的无关交互。在三个大规模基准数据集上的实验表明,STMamba在定量与定性结果上均优于现有最先进方法。
| 高光谱图像分类 | 对高光谱图像中每个像素赋予类别标签的任务,利用丰富的光谱-空间信息进行地物识别。 |
| Mamba | 一种基于状态空间模型的序列建模架构,具有线性复杂度,适用于长序列依赖建模。 |
| Token聚类模块 (TCM) | 通过密度感知聚类和软隶属度估计,将稀疏Token组织成语义连贯序列的模块。 |
| 跨尺度邻域注意力上采样器 (CNA) | 一种无参数的上采样模块,利用跨尺度邻域注意力从稀疏Token恢复密集特征。 |
| 空间和光谱语义序列Mamba (SWSM) | 并行处理空间和光谱语义序列的Mamba模块,用于捕获长程依赖并抑制异质区域交互。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅