🔥 今日值得一读 学习式规划竟输给强检索!503题实测准确率低2个百分点
When Learned Context Planning Fails to Beat Strong Retrieval: A Controlled Study of Planning, Routing, and Reranking for Long-Context QA
arXiv CL (cs.CL) 🔥 重点 #长上下文#检索增强#上下文规划 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
做长文档问答时,先别急着上学习式规划器,强检索加重排可能已足够,避免无效复杂度。

📖 AI 总结

这篇论文对长上下文问答中“学习式上下文规划”的实际价值进行了受控检验。研究以Qwen2.5-7B-Instruct为答案模型,在LongBench-v2全部503道多选题上,将学习式规划器与强检索、路由、预算选择器和重排序等基线对比。规划器基于140道训练题和28道开发题的结果筛选轨迹做SFT训练。结果显示,在18k字符预算下,锚定混合检索准确率为36.18%,BM25为35.98%,而最佳规划引导方法仅34.19%;在未接触的152题测试集上,锚定混合检索仍以42.11%领先规划方法的36.84%。防泄漏路由器也无法把明显的oracle差距转化为实际收益,紧预算下规划器优势微弱甚至消失,重排序增益的置信区间跨越零。打包顺序与分数平坦度分析未发现稳定机制。作者据此认为,在该设定下学习式规划只是一种弱相关性信号,无法替代强检索。

🔑 关键词速览

LongBench-v2一个用于评估长上下文理解能力的基准测试,包含多项选择题。
Qwen2.5-7B-Instruct通义千问2.5系列的一个70亿参数指令微调大语言模型。
SFT监督微调,一种使用标注数据对预训练模型进行进一步训练的方法。
BM25一种经典的基于词频的稀疏检索算法,常用于信息检索。
锚定混合检索一种结合了稀疏和稠密检索方法的混合检索策略,可能通过锚点增强效果。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅