该研究针对检索增强生成(RAG)系统中的性能瓶颈问题,提出了一种无需训练的优化框架PACE。研究首先通过实验揭示了RAG系统中的瓶颈会在上游重排序和下游生成之间动态转移,在高查询率或大重排序预算下,上游重排序可能成为主要瓶颈。为缓解这一问题,PACE框架包含两个核心组件:证据前置加载机制通过边际证据覆盖率对候选文档重新排序,优先选择查询相关、互补且有助于形成多跳证据链的文档,该目标函数具有单调子模性质,贪心选择可提供(1-1/e)的近似保证;压力自适应预算机制则根据重排序器和LLM的相对压力动态调整重排序预算。在三个多跳问答数据集和在线服务模拟上的实验表明,PACE能提升证据召回率并降低排名密集型工作负载下的p95延迟。研究还发现,证据密集的高排名候选文档可以用更少的重排序文档实现更高的最终召回率,体现了"少即是多"的理念。
| RAG | 检索增强生成,一种结合检索和生成模型的技术,用于提升回答质量。 |
| PACE | 优先自适应证据覆盖,一种无需训练的框架,通过证据前置加载和压力自适应预算优化RAG效率。 |
| evidence frontloading | 证据前置加载,一种策略,优先排列证据密集的文档以提升检索效率。 |
| pressure-adaptive budgeting | 压力自适应预算,根据系统负载动态调整重排预算的方法。 |
| submodular | 子模性,一种集合函数的性质,保证贪心算法的近似最优性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅