97篇研究全面盘点!OCR十年进化史,多语言识别竟藏这些未解难题!
Systematic Literature Review of Machine Learning Models and Applications for Text Recognition
arXiv CV (cs.CV) #OCR#综述 🕐 08-28 12:00

📖 AI 总结

该论文基于PRISMA指南,对2015年1月至2025年1月间的97项研究进行了系统性文献综述,全面评估了机器学习模型在文本识别(OCR)领域的演进与应用。研究发现,OCR技术已从传统模型发展为能够处理结构化与非结构化文本、场景文本识别及多语言处理的先进AI架构,显著提升了对异构文本数据的识别能力。然而,挑战依然存在,包括低资源语言的训练数据不足、手写文本的高度变异性、字符视觉相似性导致的误识别,以及实时OCR应用的性能瓶颈。为应对这些问题,论文提出了自监督学习、多模态AI、自动化机器学习(AutoML)、AI辅助后处理、微型机器学习(TinyML)及构建联合语料库等未来研究方向。该综述不仅梳理了OCR技术十年来的发展脉络,还为提升识别精度、拓展工业应用场景提供了理论依据和实践指导,对推动该领域的后续研究具有重要参考价值。

🔑 关键词速览

OCR (Optical Character Recognition)光学字符识别,通过机器视觉将图像中的文字转换为可编辑文本的技术。
PRISMA系统综述和荟萃分析首选报告项目,用于规范系统文献综述的报告标准。
AutoML自动化机器学习,自动优化模型选择和超参数调整,减少人工干预。
TinyML微型机器学习,在资源受限的嵌入式设备上运行机器学习模型的技术。
Self-supervised Learning自监督学习,利用未标注数据通过预训练任务学习特征表示的方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅