首发15.7万对图表问答数据!SCAFFOLD让AI看懂论文架构图,推理能力直接起飞
SCAFFOLD: A Large-Scale Structured Dataset of Computer Science Research Figures with Diagram QA and Chain-of-Thought Reasoning Traces
arXiv AI (cs.AI) 重要 多模态数据集 🕐 09-02 12:00

📖 AI 总结

计算机科学论文中的图表(如架构图、流程图和管线示意图)往往承载着比正文更丰富的信息,但此前缺乏专门针对这类图表的公开数据集来训练视觉语言模型。为此,研究者提出了SCAFFOLD——一个大规模结构化数据集,包含图像、标题、上下文、问答对及思维链推理轨迹。该数据集通过版面检测和PDF解析从arXiv计算机科学论文中构建,并辅以AI辅助问题生成。SCAFFOLD提供三个规模版本:157K对(覆盖3058篇论文、29887张图)、37K对和12K对。基线实验在Qwen2.5-VL-3B-Instruct模型上使用SCAFFOLD-12K完成。这一资源填补了计算机科学图表理解领域的数据空白,为训练具备图表问答和逐步推理能力的多模态模型提供了基础。

🔑 关键词速览

SCAFFOLD本文提出的数据集名称,包含计算机科学论文图表及其问答和思维链推理轨迹。
Diagram QA图表问答,指针对图表内容提出问题并给出答案的任务。
Chain-of-Thought (CoT)思维链,一种逐步推理过程,用于解释如何从问题得出答案。
Vision-Language Model (VLM)视觉语言模型,能够同时处理图像和文本信息的模型。
Layout Detection布局检测,用于识别PDF页面中图表、文本等元素位置的技术。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅