六编码器+视觉语言模型,任意形状文本识别无需合成数据!
MEVL-STP: Multi-Encoder and Vision Language Model for Arbitrarily Shaped Scene Text Spotting
arXiv CV (cs.CV) 重要 #场景文本检测#视觉语言模型#多编码器 🕐 今天 12:00

📖 AI 总结

该论文提出MEVL-STP,一种面向任意形状场景文本检测与识别的两阶段方法,旨在解决曲线招牌、密集多方向文字等复杂场景中定位误差传导至识别失败的问题。检测阶段冻结CLIP、DINOv2、SigLIP、EVA-CLIP、SAM和ConvNeXt六个视觉编码器,提取语义、空间与纹理互补特征,经带通道注意力的分层特征金字塔网络融合,并由深度监督渐进尺度扩展网络解码,生成贴合文本实际形状的多边形掩码,避免轴对齐矩形引入背景干扰。识别阶段利用多边形掩码裁剪隔离目标文本,微调Qwen3-VL-8B-Instruct模型专注识别。在无合成预训练数据条件下,该方法于CTW1500取得91.99%检测F值和85.86%端到端H均值,刷新最优结果,并在Total-Text和ICDAR 2015上表现强劲,验证了多编码器融合与视觉语言模型结合的有效性。

🔑 关键词速览

Scene Text Spotting场景文本检测与识别,指在自然图像中同时定位并识别文本内容的任务。
Multi-Encoder Segmentation多编码器分割,利用多个冻结的视觉编码器提取互补特征以生成精确文本掩码的方法。
Vision-Language Model (VLM)视觉语言模型,能够同时处理图像和文本信息,用于文本识别等跨模态任务。
Low-Rank Adaptation (LoRA)低秩适配,一种参数高效微调技术,通过低秩矩阵更新来适配大模型。
Progressive Scale Expansion (PSENet)渐进式尺度扩展网络,一种用于任意形状文本检测的分割方法,通过逐步扩展核来生成文本区域。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅