这篇论文探讨了低资源语言在视觉语言模型(VLM)发展中的数字鸿沟问题,聚焦于光学字符识别(OCR)在极端数据稀缺场景下的适应性。研究发现,传统微调策略在少于1万张真实图像和25万张合成图像的数据条件下容易达到性能瓶颈,且存在结构性低效:模型高层会分化以捕捉独特文字特征,而低层则学习到冗余的相似特征。基于此,作者提出PSMC框架(预训练、特化、合并、协同训练),利用跨文字系统的“迁移效应”,先从高资源基础模型派生语言专属专家,再通过任务算术融合为统一的多语言骨干网络。在覆盖20多种语言的10种印度文字上,PSMC在不增加参数量的情况下,平均词识别率(WRR)比单一专家模型提升约2%,表明合并后的潜在空间能实现建设性知识迁移,惠及所有相关文字系统,为包容性VLM开发提供了可扩展路径。
| Vision-Language Models (VLMs) | 视觉语言模型,结合图像和文本信息进行多模态理解的模型。 |
| Optical Character Recognition (OCR) | 光学字符识别,将图像中的文字转换为机器可读文本的技术。 |
| PSMC (Pre-train, Specialize, Merge, and Co-train) | 一种数据高效的训练框架,通过预训练、专门化、合并和协同训练实现跨文字知识迁移。 |
| Task Arithmetic | 任务算术,一种通过模型参数的加减操作来组合或调整多个任务模型的方法。 |
| Word Recognition Rate (WRR) | 单词识别率,衡量OCR系统正确识别单词的比例。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅