高棉语文档VQA实测:Qwen3-VL-8B准确率仅51.9%,外部OCR加持飙到61.9%!
Do MLLMs Really Understand Low-Resource Khmer Documents? A Pilot Study on Khmer Document VQA
arXiv CL (cs.CL) 重要 #多模态#文档理解#低资源语言 🕐 09-01 12:00

📖 AI 总结

该研究针对多模态大语言模型(MLLMs)在高棉语文档理解任务中的表现进行了试点诊断评估。高棉语表单文档因包含复杂文字形态、高棉语-英语混合字段以及柬埔寨瑞尔和美元双币种数值,对现有模型构成显著挑战。研究者从KH-FUNSD数据集中构建了包含发票、收据、报价单等商业表单的评估子集,设计了英语和高棉语问题,并保留答案的原始语言形式。实验评估了Qwen-VL系列模型,结果显示直接使用Qwen3-VL-8B的准确率为51.9%,优于较小模型;而外部OCR辅助配置表现最佳,Tesseract和PaddleOCR分别达到61.9%和61.6%的准确率。然而,高棉语文字答案的识别准确率仍显著低于英语和数值字段。研究表明,当前MLLMs能较好处理视觉清晰的英语和结构化数值内容,但可靠的本地高棉语文档理解仍是未解决的挑战。

🔑 关键词速览

MLLMs (Multimodal Large Language Models)多模态大语言模型,能够同时处理文本和图像等多种模态信息。
Document VQA文档视觉问答,指根据文档图像内容回答问题的任务。
KH-FUNSD高棉语表单理解数据集,用于文档结构分析和信息提取的基准。
OCR (Optical Character Recognition)光学字符识别,将图像中的文字转换为可编辑文本的技术。
Qwen-VL阿里巴巴开发的多模态大语言模型系列,支持视觉和语言理解。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅