本文介绍了一个面向历史阿拉伯语手稿的紧凑型多域识别系统Phoenix及其配套的审阅工作流Athar。作者指出,手稿转录不仅是识别问题,还需处理书写风格与版式变化、保留不确定读法、区分视觉证据与语言合理性,并记录研究者的最终决策。Phoenix是一个仅含499万参数的CNN-BiLSTM-CTC模型,通过文档感知重放、扩展的81符号编码和遗忘防护机制,在档案、马格里布和历史手稿等多个领域间实现适应。在预设的对照评估中,Phoenix在两个大型测试集上将字符错误率从19.98%降至14.93%,相对降低25.3%,但在一个小型测试集上略有回退。N-best诊断显示,束搜索与Oracle@25之间存在2.15个百分点的差距,而多种后处理方法仅能恢复其中不到4%。因此,Athar工作流强调保留视觉读法、提供受限替代方案、保守使用语言模型,并输出可审计的TEI和PAGE-XML记录。研究主张将手稿识别视为可审计的证据管理,而非静默的文本替换。
| CNN-BiLSTM-CTC | 一种结合卷积神经网络、双向长短期记忆网络和连接时序分类的深度学习架构,用于序列识别任务。 |
| CER | 字符错误率,衡量识别结果与真实文本之间字符级别差异的指标。 |
| Oracle@25 | 在N-best列表中,最佳候选(与参考最匹配)的误差率,用于评估解码上限。 |
| MBR | 最小贝叶斯风险,一种通过最小化期望损失来选择输出的解码策略。 |
| TEI | 文本编码倡议,一种用于数字文本编码的标准格式,常用于学术文献。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅