该论文基于PRISMA指南,对2015年1月至2025年1月间的97项研究进行了系统性文献综述,全面评估了机器学习模型在文本识别(OCR)领域的演进与应用。研究发现,OCR技术已从传统模型发展为能够处理结构化与非结构化文本、场景文本识别及多语言处理的先进AI架构,显著提升了对异构文本数据的识别能力。然而,挑战依然存在,包括低资源语言的训练数据不足、手写文本的高度变异性、字符视觉相似性导致的误识别,以及实时OCR应用的性能瓶颈。为应对这些问题,论文提出了自监督学习、多模态AI、自动化机器学习(AutoML)、AI辅助后处理、微型机器学习(TinyML)及构建联合语料库等未来研究方向。该综述不仅梳理了OCR技术十年来的发展脉络,还为提升识别精度、拓展工业应用场景提供了理论依据和实践指导,对推动该领域的后续研究具有重要参考价值。
| OCR (Optical Character Recognition) | 光学字符识别,通过机器视觉将图像中的文字转换为可编辑文本的技术。 |
| PRISMA | 系统综述和荟萃分析首选报告项目,用于规范系统文献综述的报告标准。 |
| AutoML | 自动化机器学习,自动优化模型选择和超参数调整,减少人工干预。 |
| TinyML | 微型机器学习,在资源受限的嵌入式设备上运行机器学习模型的技术。 |
| Self-supervised Learning | 自监督学习,利用未标注数据通过预训练任务学习特征表示的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅