本文提出一种基于TrOCR预训练模型的手写天城文(Devanagari)字符识别方法。天城文包含36个元音、14个辅音和10个数字,书写复杂,识别难度较大。研究团队对microsoft/trocr-base-handwritten模型进行微调,使用约5000张字符图像,按8:1:1划分训练、验证和测试集,并采用混合精度训练、梯度检查点和早停等优化策略。模型取得3.95%的字符错误率和96.05%的字符级准确率,优于此前的CNN模型。作者还基于Golang和FastAPI搭建了可扩展的Web应用,单次请求延迟低于5秒,实现了实时部署。该工作验证了Transformer架构在手写天城文识别中的有效性,并为后续相关研究提供了基础。
| TrOCR | 一种基于Transformer的OCR模型,专门用于文本识别任务。 |
| Devanagari | 印度次大陆的一种古老文字系统,用于书写印地语、梵语等语言。 |
| Fine-tuning | 在预训练模型的基础上,使用特定任务的数据进行进一步训练,以适应新任务。 |
| Character Error Rate (CER) | 字符错误率,衡量OCR系统识别字符时错误比例的指标。 |
| Mixed Precision Training | 混合精度训练,一种使用不同数值精度(如FP16和FP32)加速训练并减少内存占用的技术。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅