72种RAG配置大乱斗:印度政府文档检索,没有全能赢家!
Parser, Chunking, and Embedding Interactions in Retrieval-Augmented Generation over Indian Government Regulatory Documents
arXiv CL (cs.CL) 重要 论文方法大模型 🕐 今天 12:00

📖 AI 总结

该研究针对印度中央政府监管文件构建检索增强生成(RAG)流程,系统考察了解析器、分块策略与嵌入模型三者之间的交互影响。作者采用受控因子实验设计,组合3种解析器、3种分块策略、5种稠密嵌入模型及BM25稀疏基线,在四类结构差异显著的印度政府监管文档上,以800个问题实例(含经自动校验与10%人工复核的证据字符串)进行评估,共产生72000行结果,并运用线性混合效应模型、Holm校正配对比较及聚类自助置信区间进行分析。关键发现包括:没有任何单一检索器家族在所有文档上占优;解析器与分块器的选择存在显著交互;MPNet-base持续表现不佳,且在表格类问题上出现严重失效;语料证据保留率接近饱和(超过98%),说明检索差异主要源于排序质量而非摄取阶段的信息损失。研究还报告了嵌入维度、块大小与重叠的消融实验及效率与质量的帕累托分析,并公开了完整评估工具、语料清单与800题基准,为RAG组件联合选型提供了可复现的实证依据。

🔑 关键词速览

检索增强生成 (RAG)一种结合检索和生成模型的框架,通过检索外部知识来增强语言模型的生成能力。
稠密嵌入模型将文本映射到低维稠密向量空间的模型,用于语义相似度计算和检索。
BM25一种基于词频和逆文档频率的稀疏检索算法,常用于信息检索中的基线方法。
线性混合效应模型一种统计模型,包含固定效应和随机效应,适用于处理分组或重复测量数据。
Holm校正一种多重比较校正方法,用于控制家族错误率,调整p值以降低假阳性风险。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅