该论文提出了一种名为PACE的智能体框架,用于解决网络内容提取中准确性、可扩展性和适应性难以兼顾的问题。传统通用提取器在特定出版商的页面布局上表现脆弱,而直接使用大语言模型提取成本高昂,人工构建解析器又费时费力。PACE在训练阶段利用大语言模型分析页面结构并聚合可复用的提取模式,在推理阶段则通过固定确定性提取器模板执行,无需额外调用大语言模型。实验覆盖文章正文、元数据及多模态内容,结果显示PACE在提取文本、元数据、图片和表格方面均优于可扩展的非人工基线,质量接近人工定制解析器,表明智能体配置学习能有效实现面向LLM就绪页面表示的自动化出版商定制提取。
| PACE | 一种代理框架,用于学习发布商特定的提取配置,实现可扩展且准确的网络内容提取。 |
| Agentic framework | 一种利用LLM作为代理来自动化任务(如配置学习)的框架。 |
| LLM data pipelines | 为大型语言模型提供训练或推理数据的处理流程。 |
| Publisher-specific extraction | 针对特定网站或发布商的布局定制的数据提取方法。 |
| Multimodal extraction | 从网页中提取多种类型的数据,如文本、图像和表格。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅