该研究探讨了X射线荧光(XRF)与光学显微镜图像之间的视场定位问题,这是关联同一标本不同模态测量数据的关键步骤。由于XRF图通常仅覆盖光学图像的一小部分区域,且不同模态间外观和结构差异显著,传统定位方法面临挑战。研究团队在两个数据集上评估了无需训练的视觉语言模型(VLM)定位方法,分别代表同一切片的高对应性和相邻切片的低对应性成像场景。结果显示,直接使用VLM提示虽能产生内容相关的空间信号,但单独使用并不可靠;经典模板匹配在结构保留时最准确,但在低对应性场景中失效。研究者提出的“提议-验证”工作流,通过重复VLM预测作为候选位置,再结合图像相似性选择最终定位,成功在低对应性条件下恢复了有效定位能力,为跨模态显微图像配准提供了新思路。
| XRF (X-ray Fluorescence) | X射线荧光,一种元素分析技术,用于获取样本中元素分布图。 |
| FOV (Field-of-View) localization | 视场定位,确定一个图像在另一个更大图像中的位置和范围。 |
| Vision Language Model (VLM) | 视觉语言模型,一种结合视觉和文本信息进行推理的AI模型。 |
| Correlative microscopy | 关联显微术,将不同显微镜模态的图像进行配准以关联同一标本的多种测量。 |
| DINOv2 | 一种自监督视觉特征提取模型,用于图像匹配和检索。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅