这篇论文对长上下文问答中“学习式上下文规划”的实际价值进行了受控检验。研究以Qwen2.5-7B-Instruct为答案模型,在LongBench-v2全部503道多选题上,将学习式规划器与强检索、路由、预算选择器和重排序等基线对比。规划器基于140道训练题和28道开发题的结果筛选轨迹做SFT训练。结果显示,在18k字符预算下,锚定混合检索准确率为36.18%,BM25为35.98%,而最佳规划引导方法仅34.19%;在未接触的152题测试集上,锚定混合检索仍以42.11%领先规划方法的36.84%。防泄漏路由器也无法把明显的oracle差距转化为实际收益,紧预算下规划器优势微弱甚至消失,重排序增益的置信区间跨越零。打包顺序与分数平坦度分析未发现稳定机制。作者据此认为,在该设定下学习式规划只是一种弱相关性信号,无法替代强检索。
| LongBench-v2 | 一个用于评估长上下文理解能力的基准测试,包含多项选择题。 |
| Qwen2.5-7B-Instruct | 通义千问2.5系列的一个70亿参数指令微调大语言模型。 |
| SFT | 监督微调,一种使用标注数据对预训练模型进行进一步训练的方法。 |
| BM25 | 一种经典的基于词频的稀疏检索算法,常用于信息检索。 |
| 锚定混合检索 | 一种结合了稀疏和稠密检索方法的混合检索策略,可能通过锚点增强效果。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅