RefLAM提出了一种面向历史阿拉伯语手稿的参考锚定行标注流水线,旨在解决现有方法在构建行级手写文本识别(HTR)训练数据时的扩展性与准确性问题。该流水线结合深度学习页面分割模型、多模态大语言模型(MLLM)进行结构化OCR,并采用忽略变音符号的模糊对齐引擎,将每一行OCR结果锚定到参考文本的连续片段,同时给出字符级置信度。其核心创新在于“置信度100规则”:完美分数在数学上等价于归一化字符串的逐字符一致,且经语料验证无反例,使审阅者可快速信任高置信度行,将精力集中于不确定部分。实验显示,在7本完全验证的书籍上,吞吐量较人工标注提升75倍(每小时3000行对比40行);通过该流水线,作者在一周内保留了16533行置信度100的主文本行,并发布了包含14本书、3043页、27971行主文本及629行边注的AraMS-28k数据集。微调实验证实了该数据对下游HTR训练的实用价值。
| RefLAM | 一种基于参考文本的行级手稿标注流水线,结合深度学习与多模态大语言模型,实现高效且可验证的标注。 |
| HTR (Handwritten Text Recognition) | 手写文本识别,指将手写文档图像自动转换为文本的技术。 |
| MLLM (Multimodal Large Language Model) | 多模态大语言模型,能够同时处理图像和文本,用于结构化OCR任务。 |
| Confidence-100 rule | 置信度100规则,指当对齐置信度达到100时,可证明归一化字符串与参考文本逐字符一致。 |
| AraMS-28k | 一个包含14本历史阿拉伯语手稿、3,043页及行级标注的数据集,用于HTR训练。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅