Transformer模型识别天城文手写字符准确率高达96.05%,错误率仅3.95%,碾压CNN!
Devanagari Handwritten Character Recognition Using TrOCR: A Transformer-Based Model with Real-Time Web Deployment
arXiv CV (cs.CV) #OCR#Transformer#手写识别#部署 🕐 今天 12:00

📖 AI 总结

本文提出一种基于TrOCR预训练模型的手写天城文(Devanagari)字符识别方法。天城文包含36个元音、14个辅音和10个数字,书写复杂,识别难度较大。研究团队对microsoft/trocr-base-handwritten模型进行微调,使用约5000张字符图像,按8:1:1划分训练、验证和测试集,并采用混合精度训练、梯度检查点和早停等优化策略。模型取得3.95%的字符错误率和96.05%的字符级准确率,优于此前的CNN模型。作者还基于Golang和FastAPI搭建了可扩展的Web应用,单次请求延迟低于5秒,实现了实时部署。该工作验证了Transformer架构在手写天城文识别中的有效性,并为后续相关研究提供了基础。

🔑 关键词速览

TrOCR一种基于Transformer的OCR模型,专门用于文本识别任务。
Devanagari印度次大陆的一种古老文字系统,用于书写印地语、梵语等语言。
Fine-tuning在预训练模型的基础上,使用特定任务的数据进行进一步训练,以适应新任务。
Character Error Rate (CER)字符错误率,衡量OCR系统识别字符时错误比例的指标。
Mixed Precision Training混合精度训练,一种使用不同数值精度(如FP16和FP32)加速训练并减少内存占用的技术。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅