10种印度文字零基础训练,PSMC让单词识别率暴涨2%!
What Can Low Resource Languages Learn From Each Other?
arXiv CV (cs.CV) 重要 #OCR#低资源#迁移学习 🕐 08-31 12:00

📖 AI 总结

这篇论文探讨了低资源语言在视觉语言模型(VLM)发展中的数字鸿沟问题,聚焦于光学字符识别(OCR)在极端数据稀缺场景下的适应性。研究发现,传统微调策略在少于1万张真实图像和25万张合成图像的数据条件下容易达到性能瓶颈,且存在结构性低效:模型高层会分化以捕捉独特文字特征,而低层则学习到冗余的相似特征。基于此,作者提出PSMC框架(预训练、特化、合并、协同训练),利用跨文字系统的“迁移效应”,先从高资源基础模型派生语言专属专家,再通过任务算术融合为统一的多语言骨干网络。在覆盖20多种语言的10种印度文字上,PSMC在不增加参数量的情况下,平均词识别率(WRR)比单一专家模型提升约2%,表明合并后的潜在空间能实现建设性知识迁移,惠及所有相关文字系统,为包容性VLM开发提供了可扩展路径。

🔑 关键词速览

Vision-Language Models (VLMs)视觉语言模型,结合图像和文本信息进行多模态理解的模型。
Optical Character Recognition (OCR)光学字符识别,将图像中的文字转换为机器可读文本的技术。
PSMC (Pre-train, Specialize, Merge, and Co-train)一种数据高效的训练框架,通过预训练、专门化、合并和协同训练实现跨文字知识迁移。
Task Arithmetic任务算术,一种通过模型参数的加减操作来组合或调整多个任务模型的方法。
Word Recognition Rate (WRR)单词识别率,衡量OCR系统正确识别单词的比例。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅