本文提出 AdaMem,一种面向检索增强生成(RAG)的相关性引导软压缩框架,旨在解决现有软压缩方法对每条保留段落分配相同数量记忆嵌入、忽视其与查询相关程度的问题。AdaMem 通过共享的查询条件压缩器在一次前向过程中同时生成连续段落记忆与相关性得分,并依据确定性分配规则,将固定的记忆令牌预算向高分段落倾斜,低分段落则可被直接省略。在六个开放域问答基准上,AdaMem 在相同记忆预算下持续优于采用均匀分配的 OSCAR 及其他软压缩方法:标准 16 倍压缩下子串匹配最高提升 3.2 个百分点(5.5%),平均相对增益 3.4%;在激进的 64 倍压缩下平均相对增益升至 14.6%,PopQA 上最高提升 9.8 个百分点(19.7%)。其推理延迟与均匀压缩基线相当,却比完整上下文推理低至多 4 倍,并能在该延迟水平下达到未压缩的答案质量。研究表明,当检索池较大且记忆预算紧张时,相关性引导的记忆分配尤为有效。
| Retrieval-Augmented Generation (RAG) | 检索增强生成,一种结合检索外部知识来提升语言模型生成质量的技术框架。 |
| Soft Compression | 软压缩,将文本段落编码为连续向量(记忆嵌入)而非离散令牌的压缩方法,以减少计算开销。 |
| Memory Token | 记忆令牌,指压缩后用于表示段落信息的连续嵌入向量,每个令牌对应一个向量表示。 |
| Relevance-Guided Allocation | 相关性引导分配,根据段落与查询的相关性分数动态分配记忆令牌预算的策略。 |
| Sub-string Match | 子串匹配,一种评估问答系统答案准确性的指标,检查预测答案是否包含在标准答案中。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅