🔥 今日值得一读 定向爬取让数学内容命中率暴涨70倍!63%数据竟是CommonCrawl没有的宝藏!
Data Scout: Targeted Web Crawling for Domain-Specific Pretraining Corpora
arXiv LG (cs.LG) 🔥 重点 #数据采集#预训练#LLM 🕐 09-09 12:00
👨‍💼 主理人解读 · 为什么值得关注
用于构建小众领域预训练语料,替代通用过滤方法,提升数据质量。

📖 AI 总结

本文介绍了一种名为Data Scout的领域特定预训练语料库构建新方法,其核心思路是颠覆传统的“先抓取后过滤”模式,转而采用“定向抓取”策略。该方法利用大语言模型将根主题扩展为分类体系和大量搜索查询,再通过用户提供的分类器(探针)对返回的子域名进行小样本筛选,从而精准定位高质量内容。实验表明,在数学领域,子域名层面的相关性边界非常清晰,相关页面概率是兄弟子域名的21倍。使用FineMath分类器作为探针时,抓取页面中21.9%为高质量数学内容,是传统过滤方法的70倍;且其中63.2%的页面在CommonCrawl中完全缺失,但训练价值相当。在Llama-3.2-3B模型上的持续预训练实验显示,使用1.9B Data Scout tokens的效果与FineMath语料库在GSM8k基准上相当。由于探针是唯一的领域特定组件,该方法原则上可推广至任何拥有此类分类器的领域,为专业领域语料构建提供了高效新路径。

🔑 关键词速览

Data Scout一种定向爬取方法,通过LLM生成查询和分类器筛选子域,构建领域特定预训练语料库。
CommonCrawl一个大型网络爬虫档案库,常用于构建通用预训练语料库,但专业内容覆盖不足。
FineMath一个用于识别高质量数学内容的分类器,在本文中作为探针使用。
探针 (probe)用户提供的分类器,用于基于小样本筛选子域,决定是否接纳其内容。
GSM8k一个数学推理基准数据集,用于评估模型在数学问题上的表现。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅