植物标本数字化提速!HERBIOME流水线让1亿张标本标签自动识别,错误率仅4%!
Automated pipeline for herbarium label digitization
arXiv CV (cs.CV) #OCR#多模态#自动化流程 🕐 09-01 12:00

📖 AI 总结

该研究提出了一套名为HERBIOME的自动化流水线,用于数字化植物标本标签中的元数据。全球已数字化的植物标本图像超过1亿张,但标签中蕴含的采集者、地点、日期等关键信息仍难以大规模提取。该流水线整合了YOLOv8组件检测、CRAFT文字定位、微调后的TrOCR混合文字识别模型,以及GPT-4o Mini语义结构化模块。TrOCR在结合通用转录语料与植物标本专项数据后,字符错误率降至4.05-4.10%。在450份法国标本上的端到端评估中,最大窗口相似度为0.614-0.618,语义元数据准确率为0.440-0.445,其中分类学字段是主要瓶颈。该工作通过自动化结构化元数据提取,为构建配对图像-文本数据集和多模态生物多样性AI系统奠定了基础。

🔑 关键词速览

HERBIOME一个用于自动化植物标本标签数字化的模块化端到端流水线系统。
YOLOv8一种基于深度学习的目标检测模型,用于识别图像中的组件。
TrOCR一种基于Transformer的光学字符识别模型,用于识别手写和印刷文本。
CRAFT Hezar一种文本定位方法,用于在图像中检测单词级别的文本区域。
Maximum Window Similarity (MWS)一种评估指标,用于衡量预测文本与真实文本在滑动窗口上的相似度。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅