该研究针对多模态大语言模型(MLLMs)在高棉语文档理解任务中的表现进行了试点诊断评估。高棉语表单文档因包含复杂文字形态、高棉语-英语混合字段以及柬埔寨瑞尔和美元双币种数值,对现有模型构成显著挑战。研究者从KH-FUNSD数据集中构建了包含发票、收据、报价单等商业表单的评估子集,设计了英语和高棉语问题,并保留答案的原始语言形式。实验评估了Qwen-VL系列模型,结果显示直接使用Qwen3-VL-8B的准确率为51.9%,优于较小模型;而外部OCR辅助配置表现最佳,Tesseract和PaddleOCR分别达到61.9%和61.6%的准确率。然而,高棉语文字答案的识别准确率仍显著低于英语和数值字段。研究表明,当前MLLMs能较好处理视觉清晰的英语和结构化数值内容,但可靠的本地高棉语文档理解仍是未解决的挑战。
| MLLMs (Multimodal Large Language Models) | 多模态大语言模型,能够同时处理文本和图像等多种模态信息。 |
| Document VQA | 文档视觉问答,指根据文档图像内容回答问题的任务。 |
| KH-FUNSD | 高棉语表单理解数据集,用于文档结构分析和信息提取的基准。 |
| OCR (Optical Character Recognition) | 光学字符识别,将图像中的文字转换为可编辑文本的技术。 |
| Qwen-VL | 阿里巴巴开发的多模态大语言模型系列,支持视觉和语言理解。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅