这篇论文研究长文档问答中的分层检索方法,提出NavTree——一种仅保留叶节点的检索器。它通过在文本块上构建确定性的平衡分段树,在索引阶段完全不调用语言模型,仅将树作为导航骨架:从根节点出发,结合词汇与稠密向量的混合前沿游走,锚定高分叶节点,最终只向阅读器输出叶块内容。在匹配成本评估中,NavTree是所测网格中最强的分层检索器,并与最强平坦基线持平;在长文档多跳问答上,它是唯一在类对类比较中显著优于BM25的分层方法。即便给RAPTOR摘要变体提供高质量聚类摘要,其在各多块预算下仍不敌NavTree,且后者索引成本为零。研究表明,摘要树在长文档问答中的主要收益来自导航结构而非生成的摘要内容,且该结论在更强及开放权重阅读器、更强编码器和全因子实验中均成立。
| RAPTOR | 一种递归聚类文本块并用语言模型生成摘要树的分层检索方法。 |
| NavTree | 本文提出的仅叶节点检索器,使用确定性平衡分段树作为导航支架,索引时无需语言模型调用。 |
| 匹配成本评估 | 在相同计算或资源成本下比较不同检索方法性能的评估方式。 |
| 多跳问答 | 需要整合多个文档片段或推理步骤才能回答的复杂问答任务。 |
| BM25 | 一种经典的基于词频的稀疏检索算法,常作为信息检索的基线。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅