本文提出EAR(实体感知分区)方法,用于改进检索增强生成(RAG)中源语料的分区方式。针对固定长度分块常返回与问题关联隐晦的长段落这一问题,EAR从问题、答案选项和语料中提取规范化表层锚点,检索语料锚点周围的局部窗口,并可通过抽取式摘要附加更大的父段落。研究在经自动语料支持启发式筛选的153道MMLU风格题目上进行评估,使用去污染的公开教科书文本,并在Mistral、Gemma和DeepSeek三种模型上开展top-k=3与top-k=8的对比实验。结果显示,EAR实体窗口相较固定分块减少37.5%至40.2%的检索词量,准确率变化分别为+5.2、+1.3、-3.9(top-k=3)和+5.9、-3.3、-4.6(top-k=8),但均未达到统计显著性。该研究的贡献在于方法层面:EAR提供了一种紧凑且可检查的检索单元,但其基于规则的锚点提取器仍具领域特定性,迁移前需单独验证。
| Retrieval-Augmented Generation (RAG) | 检索增强生成,一种将外部知识检索与语言模型生成相结合的技术,用于提升知识密集型任务的回答质量。 |
| Entity-Aware Partitioning (EAR) | 实体感知划分,本文提出的方法,通过提取问题、选项和语料中的实体锚点来划分语料,形成紧凑的检索单元。 |
| Multiple-Choice Question Answering (MCQA) | 多项选择问答,一种问答任务形式,模型需从给定选项中选择正确答案。 |
| Massive Multitask Language Understanding (MMLU) | 大规模多任务语言理解,一个广泛使用的基准测试,涵盖多个学科领域的多项选择题,用于评估语言模型的知识能力。 |
| top-k | 检索时返回的最相关文档或片段的数量,k 为具体数值,如 top-k=3 表示返回前 3 个结果。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅