本文提出SGMA,一种面向超高分辨率科学图像的结构引导掩码自编码框架,旨在解决视觉Transformer自监督预训练难以应用于十亿像素级科学图像的难题。针对随机掩码与科学数据多尺度形态不匹配、均匀分词导致序列过长使注意力机制不可行两大瓶颈,SGMA引入内容自适应四叉树分词器将超大图像压缩为固定长度序列,并采用结构条件掩码使重建聚焦于空间信息丰富区域;同时提出阻尼累积机制,跨尺度聚合信号响应生成结构画布以引导掩码。在电子显微镜、全切片光学显微和X射线CT数据集上,SGMA均优于MAE基线:SpringXCT数据集Dice达95.68%,提升13.00个百分点;PAIP数据集Dice达83.21%,提升16.84个百分点,并实现最高24.8倍推理加速。该工作为超大规模科学图像理解提供了高效可扩展的自监督预训练方案。
| Masked Autoencoders (MAE) | 一种自监督预训练方法,通过随机掩码输入图像的部分区域并重建缺失像素来学习视觉表示。 |
| Vision Transformers (ViT) | 基于Transformer架构的视觉模型,将图像分割为固定大小的块序列进行处理。 |
| Quadtree Tokenizer | 一种内容自适应的图像分词方法,使用四叉树结构递归划分图像区域,将千兆像素图像压缩为固定长度序列。 |
| Damped Accumulation (DA) | 一种跨尺度聚合信号依赖响应的方法,用于生成结构画布以指导掩码过程,稳定多尺度训练。 |
| Dice | 一种衡量图像分割重叠度的指标,取值范围0到1,值越高表示分割结果与真实标签越吻合。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅