该研究提出PalmLeaf-VQA,一个面向南亚与东南亚历史贝叶斯手稿理解的多文字视觉问答基准。基准收录923幅手稿图像和7384组问答对,覆盖巴厘文、格兰塔文、泰米尔文、高棉文等八个收藏组,聚焦手稿保存状态、行结构、材质涂层、装订孔、边距及局部视觉痕迹等推理任务,而非单纯的文字识别。研究对多种主流多模态大模型在开放与受限作答模式下进行评估,表现最佳的模型在测试集上仅达58.00%的精确匹配准确率,表明当前模型在稀有文字、退化版式及保存导向的文档理解方面仍存在明显不足。该基准为推进文化相关且版式敏感的多模态文档分析提供了标准化评测工具。
| PalmLeaf-VQA | 一个面向历史贝叶手稿理解的多文字视觉问答基准,包含923幅图像和7,384个问答对。 |
| MLLMs | 多模态大语言模型,能够同时处理视觉和文本信息的大型语言模型。 |
| 多文字(Multi-Script) | 指涉及多种文字系统,如巴厘语、泰米尔语、高棉语等非拉丁文字。 |
| 精确匹配准确率(Exact-Match Accuracy) | 模型生成的答案与标准答案完全一致的百分比,是问答任务的严格评估指标。 |
| 面向保护的文件理解(Preservation-Oriented Document Understanding) | 关注手稿物理状况、材料、装订等保护相关线索的文档分析任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅