计算机科学论文中的图表(如架构图、流程图和管线示意图)往往承载着比正文更丰富的信息,但此前缺乏专门针对这类图表的公开数据集来训练视觉语言模型。为此,研究者提出了SCAFFOLD——一个大规模结构化数据集,包含图像、标题、上下文、问答对及思维链推理轨迹。该数据集通过版面检测和PDF解析从arXiv计算机科学论文中构建,并辅以AI辅助问题生成。SCAFFOLD提供三个规模版本:157K对(覆盖3058篇论文、29887张图)、37K对和12K对。基线实验在Qwen2.5-VL-3B-Instruct模型上使用SCAFFOLD-12K完成。这一资源填补了计算机科学图表理解领域的数据空白,为训练具备图表问答和逐步推理能力的多模态模型提供了基础。
| SCAFFOLD | 本文提出的数据集名称,包含计算机科学论文图表及其问答和思维链推理轨迹。 |
| Diagram QA | 图表问答,指针对图表内容提出问题并给出答案的任务。 |
| Chain-of-Thought (CoT) | 思维链,一种逐步推理过程,用于解释如何从问题得出答案。 |
| Vision-Language Model (VLM) | 视觉语言模型,能够同时处理图像和文本信息的模型。 |
| Layout Detection | 布局检测,用于识别PDF页面中图表、文本等元素位置的技术。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅